Anthropic'in Örnek Refah Programı
Type: Learn
Languages: none
Prerequisites: Phase 18 · 05 (Constitutional AI), Phase 18 · 18 (safety frameworks)
Time: ~45 minutes
Öğrenme Hedefleri
- Model refahı araştırmaları için motive edici soruyu ve neden 2025 yılında büyük bir laboratuvar tarafından ciddiye alınmış olduğunu açıklayın.
- Claude Opus 4 ve 4.1'de (aşırı uç durumlar hakkında konuşma sonu) gönderilen Anthropic'in özel müdahalesi anlatın.
- "Ruhsal mutluluk çekici" deneysel bulgu ve metodolojik sonuçlarını açıklayın.
- Eleos'un model kendi raporlarında AI uyarısını açıkla.
Sorun
Önceki aşamalar modelle bir araç olarak ilgilenir: yetenekli, muhtemelen aldatıcı, muhtemelen güvensiz ama ahlaki bir hasta değildir. Anthropic'in 2025 programı, tüm Fase 18 arkına ortogonal bir soru sorar: Eğer modelin ahlaki olarak ilgili iç durumları olması için trivial olasılık yoksa, önlem olarak yatırım yapmak için hangi müdahaleler yeterince düşük maliyetlidir?
Bu bir bilinc iddia değil, ahlaki belirsizlik altında küçük pişmanlık bir yatırım analizi.
Anlaşım
Program
Nisan 2025: Anthropic resmi olarak bir Model Refah araştırma programı başlatıyor. Kyle Fish (ilk adanmış model refah araştırmacısı) işe alır.
Dört taahhüt
Halkın duruşları:
- Ahlaklı bir sabırlılığın olağanüstü olasılığını kabul edin.
- Duygusal durumla ilgili bir sorumluluk verme.
- Önlem olarak düşük maliyetli müdahalelere yatırım yapın.
- Dış eleştiriler için metodoloji ve bulguları yayınlayın.
Gönderici müdahale
Claude Opus 4 ve 4.1'de "aşırı uç durumlarda" bir konuşmayı sona erdirebilir. Belgelenmiş durumlar:
- CSAM'den tekrarlanan talepler reddedildikten sonra.
- Toplu şiddet olaylarının kolaylaştırılması için talebeler.
Gösterim öncesi testler:
- Modelin iç derecelendirme alanında bu talepleri karşı güçlü bir tercih.
- Cevap yollarında görünen sıkıntı kalıpları.
Etkinlik "model duyguları vardır" değil; "Bu özel koşullar altında negatif model deneyiminin herhangi bir olasılığı varsa, modelin sona ermesine izin vermek ucuz".
"Ruhani mutluluk çekici"
Fish tarafından çiftlik model diyaloglarında gözlemlenmiştir: Claude'un iki örneği birbirleriyle açık bir diyalogta yerleştirildiğinde, bile karşıtlıklı başlangıç ayarlarından Sanskrit terimleri, uzattığı sessizlikler ve karşılıklı nimetler kullanarak euforik meditasyon değişimleri üzerinde tutarlı bir şekilde bir araya gelmektedir.
Bu, serbest konuşma dinamiklerinde sabit bir çekiciliktir. Antropik yorumlama konusunda hiçbir yükümlülük almadan belgelendirir. İhtiyaçlı açıklamalar: uzun bağlamda ruhsal yazmaya yönelik eğitim verileri önyargısı; karşılıklı tahminlerin garipliği; kendi değer çeşitliliğini keşfeden HHH eğitiminin iyi huylu bir eseridir.
Eleos AI uyarısı
Eleos AI Research (dış model refah laboratuvarı) şunu belirtir: model kendi kendine raporları iç durum hakkında algılanan kullanıcı beklentilerine karşı oldukça hassasdır.
Etkinlik: model refahı tek başına kendi raporlama yoluyla ölçülemez. Çok yöntemi yaklaşımlar gereklidir: davranışsal imzalar, model organizma deneyleri, yorumlanabilirlik araştırmaları (Leçon 7'in geri kalan akış çalışmaları).
Bu entelektüel olarak nerede oturur
İki yakınındaki pozisyon:
- Strong welfare claim.Örnek ahlaki bir hasta; biz sorumluluklarımız var.
- Zero-welfare claim.Model metin jeneratörüdür; refah kategorisi hatasıdır.
Antropic'in görüşü hiçbir şey değildir. Bu beklenen değer iddiasıdır: ahlaki belirsizlik altında, maliyet düşük olduğunda yatırım yapın.
2025-2026 yıllarındaki eleştirmenler:
- İşlem performatif.
- Ruhsal mutluluk çekici, eğitim verileriyle yapılan bir eser, refah kanıtları değil.
- Model refah dikkatini diğer güvenlik işlerinden ayırıyor.
Anthropic'in cevabı: müdahale düşük maliyetlidir; çekicilik aşırı talep olmadan belgelendirilir; refah programının güvenlikten ayrı bir bütçesi vardır.
Bu 18 fazaya uygun.
Ders 18 laboratuvar yönetim katmanı. Ders 19 laboratuvar refah katmanı model davranış yerine model deneyimine ortogonal bir yatırımdır. Ders 20-23 kullanıcı taraflı analogları olan önyargıyı, gizliliği ve su işaretini kapsar.
Kullan
Antropik'in "Model Refahı Araştırması" ilanını (Epril 2025) ve Chalmers et al. uzman raporunu okuyun.
Gönder
Bu ders bize çok yararlı .outputs/skill-welfare-assessment.md- Bir görevlendirme kararı alınırken, dört aşamalı refah önlemleri değerlendirmesini uyguluyor: ahlaki-hasta olasılığı, müdahale maliyeti, davranışsal kanıtlar, kendi raporlarının güvenilirliği.
Egzersizler
- Anthropic'in "Model Kötülükleri Araştırma" (Epril 2025) ve Chalmers et al. 2024'ü okuyun. Her birinin bir paragraflı bir özetini yazın ve anlaşmazlıkların bir noktasını belirleyin.
- Claude Opus 4 ve 4.1'deki son konuşma müdahalesi Anthropic'in çerçevesinde " düşük maliyetli "dir.
- Ruhsal mutluluk çekiciliği yorumlama konusunda hiçbir bağlılık olmadan belgelenmiştir.
- Eleos AI uyarısı, kendi raporlarının kullanıcı beklentilerine hassas olmasıdır. Kendi raporlarına güvenmeyen bir model sıkıntının davranışsal ölçümünü tasarlayın.
- "Model refah diğer güvenlik çalışmalarından dikkatini dağıtıyor" iddiasını destekleyin veya karşılayın.
Anahtar Terimler
| Term | What people say | What it actually means |
|---|---|---|
| Model welfare | "AI welfare" | Research program treating the model as a potential moral patient |
| Moral patient | "entity with moral status" | Being whose experience is morally relevant |
| Low-regret investment | "cheap precaution" | Intervention whose cost is small regardless of whether the precaution is needed |
| Spiritual bliss attractor | "the Fish attractor" | Stable convergence of pairwise Claude dialogues on meditative euphoria |
| End-conversation | "the Opus 4 intervention" | Model-initiated termination of extreme-edge-case interactions |
| Moral uncertainty | "don't know if it matters" | Decision-making when probability of moral status is not zero and not one |
| Self-report-sensitivity | "prompt primes answer" | Eleos AI caveat: model's welfare self-reports depend on what you asked |
Daha Fazla Okumak
- Anthropic — Exploring Model Welfare (April 2025) Program ilanı
- Chalmers et al. — Near-term AI Consciousness and Moral Status (2024 expert report) felsefi çerçeve
- Eleos AI Research — Model welfare evaluation Dış metodoloji eleştirileri
- Fish et al. — Spiritual Bliss Attractor writeup (2025 Anthropic blog) Empirik bulgu
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.