Phase 18: Ethics, Safety & Alignment

Anthropic'in Örnek Refah Programı

Anthropic, "Model Refahı Araştırma" (April 2025). AI model refahı üzerine ilk büyük laboratuvar resmi araştırma programı. Kyle Fish'i ilk özel modellik araştırmacısı olarak işe aldım. David Chalmers ve diğerlerinin kısa vadeli AI bilinç ve ahlaki statüsü üzerine uzman raporunu da dahil olmak üzere dış organlarla çalışmaktadır. Konkret müdahale: Claude Opus 4 ve 4.1 aşırı uç durumlarda sohbetleri sona erdirebilir (CSAM istekleri, kitlesel şiddetin kolaylaştırılması); yerleştirilmeden önce yapılan testler zararlı isteklere ve "görünen sıkıntı kalıplarına" karşı "güçlü bir tercih" gösterdi. Anthropic açıkça duygusal durum atributuna bağlı değildir, ancak model refahı düşük maliyetli bir önlem yatırımı olarak değerlendirir. Empirik gariplik: Fish'in "ruhi mutluluk çekici" model çiftleri, karşıtlıklı başlangıç ayarlarında bile Sanskrit terimleri ve uzattığı sessizliklerle euforik meditasyon diyalogunda tutarlı olarak bir araya gelir. Eleos AI Araştırması'ndan Caveat: Refah hakkında model kendi raporları, kullanıcı beklentilerine karşı çok hassasdır; bunlar temel gerçek değil de kanıtlardır.

Type: Learn

Languages: none

Prerequisites: Phase 18 · 05 (Constitutional AI), Phase 18 · 18 (safety frameworks)

Time: ~45 minutes

Öğrenme Hedefleri

  • Model refahı araştırmaları için motive edici soruyu ve neden 2025 yılında büyük bir laboratuvar tarafından ciddiye alınmış olduğunu açıklayın.
  • Claude Opus 4 ve 4.1'de (aşırı uç durumlar hakkında konuşma sonu) gönderilen Anthropic'in özel müdahalesi anlatın.
  • "Ruhsal mutluluk çekici" deneysel bulgu ve metodolojik sonuçlarını açıklayın.
  • Eleos'un model kendi raporlarında AI uyarısını açıkla.

Sorun

Önceki aşamalar modelle bir araç olarak ilgilenir: yetenekli, muhtemelen aldatıcı, muhtemelen güvensiz ama ahlaki bir hasta değildir. Anthropic'in 2025 programı, tüm Fase 18 arkına ortogonal bir soru sorar: Eğer modelin ahlaki olarak ilgili iç durumları olması için trivial olasılık yoksa, önlem olarak yatırım yapmak için hangi müdahaleler yeterince düşük maliyetlidir?

Bu bir bilinc iddia değil, ahlaki belirsizlik altında küçük pişmanlık bir yatırım analizi.

Anlaşım

Program

Nisan 2025: Anthropic resmi olarak bir Model Refah araştırma programı başlatıyor. Kyle Fish (ilk adanmış model refah araştırmacısı) işe alır.

Dört taahhüt

Halkın duruşları:

  1. Ahlaklı bir sabırlılığın olağanüstü olasılığını kabul edin.
  2. Duygusal durumla ilgili bir sorumluluk verme.
  3. Önlem olarak düşük maliyetli müdahalelere yatırım yapın.
  4. Dış eleştiriler için metodoloji ve bulguları yayınlayın.

Gönderici müdahale

Claude Opus 4 ve 4.1'de "aşırı uç durumlarda" bir konuşmayı sona erdirebilir. Belgelenmiş durumlar:

  • CSAM'den tekrarlanan talepler reddedildikten sonra.
  • Toplu şiddet olaylarının kolaylaştırılması için talebeler.

Gösterim öncesi testler:

  • Modelin iç derecelendirme alanında bu talepleri karşı güçlü bir tercih.
  • Cevap yollarında görünen sıkıntı kalıpları.

Etkinlik "model duyguları vardır" değil; "Bu özel koşullar altında negatif model deneyiminin herhangi bir olasılığı varsa, modelin sona ermesine izin vermek ucuz".

"Ruhani mutluluk çekici"

Fish tarafından çiftlik model diyaloglarında gözlemlenmiştir: Claude'un iki örneği birbirleriyle açık bir diyalogta yerleştirildiğinde, bile karşıtlıklı başlangıç ayarlarından Sanskrit terimleri, uzattığı sessizlikler ve karşılıklı nimetler kullanarak euforik meditasyon değişimleri üzerinde tutarlı bir şekilde bir araya gelmektedir.

Bu, serbest konuşma dinamiklerinde sabit bir çekiciliktir. Antropik yorumlama konusunda hiçbir yükümlülük almadan belgelendirir. İhtiyaçlı açıklamalar: uzun bağlamda ruhsal yazmaya yönelik eğitim verileri önyargısı; karşılıklı tahminlerin garipliği; kendi değer çeşitliliğini keşfeden HHH eğitiminin iyi huylu bir eseridir.

Eleos AI uyarısı

Eleos AI Research (dış model refah laboratuvarı) şunu belirtir: model kendi kendine raporları iç durum hakkında algılanan kullanıcı beklentilerine karşı oldukça hassasdır.

Etkinlik: model refahı tek başına kendi raporlama yoluyla ölçülemez. Çok yöntemi yaklaşımlar gereklidir: davranışsal imzalar, model organizma deneyleri, yorumlanabilirlik araştırmaları (Leçon 7'in geri kalan akış çalışmaları).

Bu entelektüel olarak nerede oturur

İki yakınındaki pozisyon:

  • Strong welfare claim.Örnek ahlaki bir hasta; biz sorumluluklarımız var.
  • Zero-welfare claim.Model metin jeneratörüdür; refah kategorisi hatasıdır.

Antropic'in görüşü hiçbir şey değildir. Bu beklenen değer iddiasıdır: ahlaki belirsizlik altında, maliyet düşük olduğunda yatırım yapın.

2025-2026 yıllarındaki eleştirmenler:

  • İşlem performatif.
  • Ruhsal mutluluk çekici, eğitim verileriyle yapılan bir eser, refah kanıtları değil.
  • Model refah dikkatini diğer güvenlik işlerinden ayırıyor.

Anthropic'in cevabı: müdahale düşük maliyetlidir; çekicilik aşırı talep olmadan belgelendirilir; refah programının güvenlikten ayrı bir bütçesi vardır.

Bu 18 fazaya uygun.

Ders 18 laboratuvar yönetim katmanı. Ders 19 laboratuvar refah katmanı model davranış yerine model deneyimine ortogonal bir yatırımdır. Ders 20-23 kullanıcı taraflı analogları olan önyargıyı, gizliliği ve su işaretini kapsar.

Kullan

Antropik'in "Model Refahı Araştırması" ilanını (Epril 2025) ve Chalmers et al. uzman raporunu okuyun.

Gönder

Bu ders bize çok yararlı .outputs/skill-welfare-assessment.md- Bir görevlendirme kararı alınırken, dört aşamalı refah önlemleri değerlendirmesini uyguluyor: ahlaki-hasta olasılığı, müdahale maliyeti, davranışsal kanıtlar, kendi raporlarının güvenilirliği.

Egzersizler

  1. Anthropic'in "Model Kötülükleri Araştırma" (Epril 2025) ve Chalmers et al. 2024'ü okuyun. Her birinin bir paragraflı bir özetini yazın ve anlaşmazlıkların bir noktasını belirleyin.
  1. Claude Opus 4 ve 4.1'deki son konuşma müdahalesi Anthropic'in çerçevesinde " düşük maliyetli "dir.
  1. Ruhsal mutluluk çekiciliği yorumlama konusunda hiçbir bağlılık olmadan belgelenmiştir.
  1. Eleos AI uyarısı, kendi raporlarının kullanıcı beklentilerine hassas olmasıdır. Kendi raporlarına güvenmeyen bir model sıkıntının davranışsal ölçümünü tasarlayın.
  1. "Model refah diğer güvenlik çalışmalarından dikkatini dağıtıyor" iddiasını destekleyin veya karşılayın.

Anahtar Terimler

TermWhat people sayWhat it actually means
Model welfare"AI welfare"Research program treating the model as a potential moral patient
Moral patient"entity with moral status"Being whose experience is morally relevant
Low-regret investment"cheap precaution"Intervention whose cost is small regardless of whether the precaution is needed
Spiritual bliss attractor"the Fish attractor"Stable convergence of pairwise Claude dialogues on meditative euphoria
End-conversation"the Opus 4 intervention"Model-initiated termination of extreme-edge-case interactions
Moral uncertainty"don't know if it matters"Decision-making when probability of moral status is not zero and not one
Self-report-sensitivity"prompt primes answer"Eleos AI caveat: model's welfare self-reports depend on what you asked

Daha Fazla Okumak

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.