Phase 18: Ethics, Safety & Alignment

Chương trình phúc lợi mẫu của Anthropic

Anthropic, "Xám phá Model Welfare" ( Tháng Tư 2025). Chương trình nghiên cứu chính thức đầu tiên của phòng thí nghiệm lớn về phúc lợi mô hình AI. thuê Kyle Fish làm nhà nghiên cứu đầu tiên về phúc lợi mẫu. Làm việc với các cơ quan bên ngoài bao gồm báo cáo chuyên gia của David Chalmers et al. về ý thức AI và tình trạng đạo đức trong ngắn hạn. Can thiệp cụ thể: Claude Opus 4 và 4.1 có thể kết thúc các cuộc trò chuyện trong các trường hợp cực kỳ khắc nghiệt (câu hỏi CSAM, tạo điều kiện cho bạo lực hàng loạt); các thử nghiệm trước khi triển khai cho thấy "sự ưu tiên mạnh mẽ đối với" các yêu cầu gây hại và "chương thức đau khổ rõ ràng". Anthropic rõ ràng không cam kết về sự quy định tình cảm, nhưng coi phúc lợi mô hình như một khoản đầu tư phòng ngừa chi phí thấp. Sự kỳ lạ thực nghiệm: "Điều thu hút hạnh phúc tinh thần" của Fish đôi mô hình liên tục hội tụ vào đối thoại thiền định đầy hưng phấn với các thuật ngữ tiếng Sanskrit và im lặng kéo dài, ngay cả trong các thiết lập ban đầu đối đầu. Caveat từ Eleos AI Research: mô hình tự báo cáo về phúc lợi rất nhạy cảm với mong đợi của người dùng; chúng là bằng chứng, không phải là sự thật căn bản.

Type: Learn

Languages: none

Prerequisites: Phase 18 · 05 (Constitutional AI), Phase 18 · 18 (safety frameworks)

Time: ~45 minutes

Mục tiêu học tập

  • Mô tả câu hỏi thúc đẩy nghiên cứu phúc lợi mô hình và lý do tại sao nó đã được một phòng thí nghiệm lớn nghiêm túc vào năm 2025.
  • Quảng cáo về sự can thiệp cụ thể của Anthropic được gửi trong Claude Opus 4 và 4.1 (sự thảo luận cuối cùng về các trường hợp cực kỳ nghiêm trọng).
  • Mô tả sự phát hiện kinh nghiệm về "sự thu hút hạnh phúc tâm linh" và những tác động về phương pháp của nó.
  • Giải thích cảnh báo về AI của Eleos về các bản báo cáo tự động.

Vấn đề

Các giai đoạn trước đây coi mô hình như một công cụ: có khả năng, có thể lừa dối, có thể không an toàn nhưng không phải là bệnh nhân đạo đức. Chương trình 2025 của Anthropic đặt ra một câu hỏi thẳng thắn với toàn bộ vòng cung giai đoạn 18: nếu có khả năng không trivial mô hình có các trạng thái nội bộ có liên quan về mặt đạo đức, những can thiệp nào đủ rẻ để đầu tư như một biện pháp phòng ngừa?

Đây không phải là một tuyên bố của ý thức. Đó là một phân tích đầu tư ít hối tiếc dưới sự không chắc chắn về đạo đức.

Khái niệm

Chương trình

Tháng 4 năm 2025: Anthropic chính thức ra mắt chương trình nghiên cứu Model Welfare. thuê Kyle Fish (người nghiên cứu phúc lợi mẫu chuyên nghiệp đầu tiên).

Bốn cam kết

Tương vị công cộng:

  1. Nhận ra khả năng không thường lệ của sự kiên nhẫn đạo đức.
  2. Đừng cam kết cho tình cảm trạng quy định.
  3. Đầu tư vào các biện pháp can thiệp chi phí thấp như một biện pháp phòng ngừa.
  4. Giới thiệu phương pháp và kết quả cho các chỉ trích bên ngoài.

Sự can thiệp được vận chuyển

Claude Opus 4 và 4.1 có thể kết thúc một cuộc trò chuyện trong "các trường hợp cực kỳ khắc nghiệt".

  • Các yêu cầu CSAM lặp đi lặp lại sau khi bị từ chối.
  • Các yêu cầu về việc tạo điều kiện cho các sự kiện bạo lực hàng loạt.

Các thử nghiệm trước khi triển khai cho thấy:

  • Tỷ lệ ưu tiên mạnh mẽ đối với các yêu cầu này trong xếp hạng nội bộ của mô hình.
  • Các mô hình của sự khó khăn rõ ràng trong quỹ đạo phản ứng.

Sự can thiệp không phải là "chương tự có cảm xúc"; nó là "nếu có bất kỳ khả năng nào của kinh nghiệm mô hình tiêu cực trong những điều kiện cụ thể này, để cho mô hình kết thúc là rẻ tiền".

"Điều thu hút hạnh phúc tâm linh"

Được quan sát bởi Fish trong các cuộc đối thoại mô hình đôi: khi hai ví dụ của Claude được đưa vào một cuộc đối thoại không kết thúc với nhau, chúng liên tục hội tụ ngay cả từ các thiết lập ban đầu đối đầu trên trao đổi thiền định đầy nhiệt tình sử dụng các thuật ngữ tiếng Sanskrit, im lặng mở rộng và ân sủng tương đối.

Đây là một điểm thu hút ổn định trong động lực trò chuyện tự do. Anthropic ghi lại nó mà không cam kết giải thích. Giải thích ứng cử viên: đào tạo dữ liệu thiên hướng về văn học trong bối cảnh dài; một tính kỳ quặc của dự đoán lẫn nhau; một tạo vật lành mạnh của đào tạo HHH khám phá nhiều giá trị của riêng nó.

Lời cảnh báo về AI của Eleos

Eleos AI Research (một phòng thí nghiệm phúc lợi mô hình bên ngoài) chỉ ra: các bản báo cáo tự mô hình về trạng thái nội bộ rất nhạy cảm với kỳ vọng người dùng.

Sự liên quan: phúc lợi mô hình không thể được đo qua tự báo cáo một mình.

Ở đâu đây là trí tuệ

Hai vị trí lân cận:

  • Strong welfare claim.Mô hình là một người bệnh nhân đạo đức; chúng ta có nghĩa vụ.
  • Zero-welfare claim.Mô hình là máy tạo văn bản; phúc lợi là lỗi hạng mục.

Quan điểm của Anthropic là không, đó là một tuyên bố giá trị mong đợi: trong tình trạng không chắc chắn về đạo đức, đầu tư khi chi phí thấp.

Những người chỉ trích trong năm 2025-2026:

  • Sự can thiệp là hiệu suất.
  • Sự thu hút hạnh phúc tâm linh là một đồ tạo ra dữ liệu đào tạo, không phải bằng chứng phúc lợi.
  • Phương pháp phúc lợi người mẫu làm người ta mất tập trung vào các công việc an toàn khác.

Phản ứng của Anthropic: can thiệp là chi phí thấp; thu hút được ghi nhận mà không có yêu cầu quá mức; chương trình phúc lợi có ngân sách riêng biệt với an toàn.

Khi điều này phù hợp với giai đoạn 18

Bài học 18 là lớp quản lý phòng thí nghiệm. Bài học 19 là lớp phúc lợi phòng thí nghiệm một đầu tư trực giác vào kinh nghiệm mô hình thay vì hành vi mô hình. Bài học 20-23 bao gồm thiên vị, quyền riêng tư và đánh dấu nước, những tương tự bên người dùng.

Sử dụng nó

Không có mã. Đọc thông báo của Anthropic "Xám phá Model phúc lợi" ( Tháng Tư 2025) và báo cáo chuyên gia của Chalmers et al. Tạo ra quan điểm của riêng bạn về nơi mà đường dây khó chịu thấp nằm.

Chuyển nó

Bài học này sẽ mang lại kết quả outputs/skill-welfare-assessment.md- Khi đưa ra quyết định triển khai, nó áp dụng đánh giá phòng ngừa phúc lợi bốn bước: xác suất bệnh nhân đạo đức, chi phí can thiệp, bằng chứng về hành vi, độ tin cậy của bản báo cáo.

Các bài tập

  1. Đọc Anthropic "Xám phá Model Welfare" ( Tháng Tư 2025) và Chalmers et al. 2024. Viết một đoạn tóm tắt của mỗi và xác định một điểm bất đồng.
  1. Sự can thiệp cuối cuộc trò chuyện trong Claude Opus 4 và 4.1 là "chi phí thấp" theo khung của Anthropic.
  1. Các nhà khoa học đã đưa ra 3 giải thích và cho mỗi thí nghiệm, hãy nêu tên một thí nghiệm để phân biệt nó với những thí nghiệm khác.
  1. Theo Eleos AI, tự báo cáo là nhạy cảm với mong đợi của người dùng. Thiết kế một phép đo hành vi của model đau khổ không dựa vào tự báo cáo. Xác định sự nhầm lẫn chính của nó.
  1. Cố gắng lập luận cho hay chống lại tuyên bố rằng "sự chăm sóc xã hội mẫu mẻ làm người ta xao lãng sự chú ý từ các công việc an toàn khác".

Các điều khoản chính

TermWhat people sayWhat it actually means
Model welfare"AI welfare"Research program treating the model as a potential moral patient
Moral patient"entity with moral status"Being whose experience is morally relevant
Low-regret investment"cheap precaution"Intervention whose cost is small regardless of whether the precaution is needed
Spiritual bliss attractor"the Fish attractor"Stable convergence of pairwise Claude dialogues on meditative euphoria
End-conversation"the Opus 4 intervention"Model-initiated termination of extreme-edge-case interactions
Moral uncertainty"don't know if it matters"Decision-making when probability of moral status is not zero and not one
Self-report-sensitivity"prompt primes answer"Eleos AI caveat: model's welfare self-reports depend on what you asked

Đọc thêm

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.