OpenAI Hazırlık Çerçeve ve DeepMind Sınır Güvenlik Çerçeve
Type: Learn
Languages: Python (stdlib, three-framework decision-table diff tool)
Prerequisites: Phase 15 · 19 (Anthropic RSP)
Time: ~45 minutes
Sorun
Ders 19 Anthropic'in ölçeklendirme politikasını yakından okudu. Bu ders, OpenAI'nin ve DeepMind'in resimlerini okuyarak resmi tamamlıyor. Üç belge aynı soruyu ele alan kuzeni eserlerdir bir sınır laboratuvarı ne zaman durmalı veya bir model kapısı olmalıdır ve küçük bir kategoride bir araya gelerek ve önemli olan belirli yerlerde farklılık gösterirler.
Dönüşüm: Üçü de uzun mesafeli özerkliği takip edilmeye değer bir kapasite sınıfı olarak etiketlenmiştir. Üçü de yanıltıcı davranışları (eğlence sahteliği, kum çantası) belirli bir risk sınıfı olarak kabul ederler. Üçü de iç bir inceleme organına sahiptir. Ayrılık: OpenAI kategorileri "İzlenmiş" (mümkün hafifletme) ve "Araştırma" (otomatik tetikleme yapılmamış) olarak bölüyor. DeepMind, kendi kendine isim vermek yerine, iki alanı özerklikle birleştirir. Laboratuvarlar Tracked vs Research veya Critical vs Moderate veya Tier-1 vs Tier-2 isimlerini kullanır. Bir yetenekin içinde yaşadığı operasyonel sonuçlar laboratuvarlar arasında farklıdır.
Bu özellikler arasında, Anthropic'de "mümkün hafifleme", OpenAI'de "önerleme yapılması, ancak tetikleme yapılması" ve DeepMind'de "belirli bir alanda izlenmesi" de yer alabilir.
Anlaşım
OpenAI Hazırlık Çerçevi v2 (Epril 2025)
Yapı:
- Tracked CategoriesBu, bir diğer önemli gelişme olarak görülüyor.
- Research Categories: laboratuvarın takip ettiği ancak henüz belirli azaltmalara bağlı olmayan model yetenekleri.
V2'de anahtar çerçeve: Araştırma Kategorileri otomatik olarak hafiflemeleri tetiklemez. Politika dili "potansiyel" hafiflemelerdir. Bu izlemek için özel bir delta: Takip edilen vs Araştırma'da bir kategorinin yeri "kapalı" ve "otardığı" arasındaki bir sarmalıktır.
DeepMind Frontier Güvenlik Çerçevi v3 (Eylül 2025; 17 Nisan 2026'da izlenilen yetenek seviyeleri eklendi)
Yapı:
- Critical Capability Levels (CCLs): beş alan boyunca yetenek eşiği: Siber, Biyolojik, ML Araştırma ve Geliştirme, CBRN, Otonomya (M.L. Araştırma ve Geliştirme ve Siber)
- Tracked Capability LevelsEk olarak Nisan 2026'da ek bir granularlık. Konkret örnek: ML R&D özerkliği seviye 1 = rekabetçi maliyet karşılığında AI R&D borusunu tamamen otomatikleştirme karşılığında insan + AI araçlar.
- Deceptive alignment monitoring: araçsal akıl kullanımı kötüye kullanılması için otomatik izleme konusunda açık bir taahhüt.
Özerklik çerçevesinin OpenAI'den farklı olması. DeepMind "Özerlik" i üst düzey bir alan olarak tutmaz; özerklik zarar verecek alanlara (ML R&D ve Cyber) katlanır.
Üçün de birleştiği
- İç Güvenlik Danışman Grubu (Anthropic SAG, OpenAI SAG, DeepMind iç komitesi olarak adlandırılır). Yüksek kapasiteli modeller için kullanımdan önce inceleme yapılır.
- Yanlış bir ayarlama / ayarlama sahteliği risk sınıfı olarak açıkça belirtilmiştir.
- Açıklanan bir kadens üzerinde kalıcı eserler (Antropik: Sınır Güvenliği Yol Haritası, Risk Raporu; OpenAI: Yetenekler ve Koruma Raporları; DeepMind: FSF güncelleme döngüsü).
- Sadece izleme savunmalarının bir tavanın olduğunu kabul etmek. DeepMind açıkça: "otomatik izleme uzun vadede yeterli olmayacak".
Farklı yerlerde
- Anthropic: v3.0'da duraklı yükümlülük kaldırıldı; AI R&D-4 eşiği, bir sonraki kapı olarak adlandırıldı.
- OpenAI: İzleyici vs Araştırma bölümü; Araştırma Kategorileri (Uzun Uzakluk Özerklikleri dahil) otomatik olarak geçit geçmez.
- DeepMind: özerklik diğer alanlara katıldı; takip edilen yetenek seviyeleri Nisan 2026'da granularlık ekliyor.
Kum çantası: üçü de karmaşıklaştıran belirli bir yetenek
Sandbagging (değerlendirmelerde stratejik olarak düşük performans gösteren bir model) OpenAI'nin Araştırma Kategorilerinde bulunmaktadır. Anthropic'in RSP v3.0 değerlendirme- bağlam boşluğu (Desin 1). DeepMind FSF v3'te yanıltıcı bir uyum izleme yoluyla bu sorunları ele alır.
Eğer bir model değerlendirme üzerinde kum çantaları varsa, her çerçeve'nin kapasite eşiği küçümselir. Çerçeve yalnızca ölçümün işe yaraması durumunda çalışır. Bu nedenle laboratuvar kendiliğinden değerlendirilmesi dışında dış ölçüm (Denevi 21, METR) ve karşıt değerlendirme gereklidir.
Politikayı okumak becerisi
- Bul: ilgilendiğiniz her yetenek poliçede bulunmalıdır.
- Sınıflandır: izlenmiş mi (dönüştürme azaltımı) yoksa araştırma mı (izlenmiş mi, tetiklemeci değil)? OpenAI buna isim verir; Anthropic ve DeepMind'in kendi eşdeğerleri vardır.
- Cadence: politika açıklanan bir zaman çizelgesinde güncelleştiriliyor mu, yoksa sadece belirli olaylardan sonra mı?
- Bağımsızlık: dış inceleme zorunlu mu yoksa seçmeli mi? Apollo ve ABD AI Güvenlik Enstitüsü ile antropik ortaklar; METR ile OpenAI; iç SAG ile öncelikle DeepMind.
Kullan
code/main.pyBu, bir bilgi kaynağı olarak kullanılır ve bir bilgi kaynağı olarak kullanılır. bu bilgi kaynağı, bir bilgi kaynağı olarak kullanılır.
Gönder
outputs/skill-cross-policy-diff.mdÜç çerçeveyi referans olarak kullanarak belirli bir kapasite için politikalar arası bir karşılaştırma yapar.
Egzersizler
- Çık .
code/main.py. Farklı araçların çıktısının kaynak belgelere karşı doğrulanabilecek en az iki özellik için politikalara uymasını onaylayın.
- OpenAI Hazırlık Çerçeve v2'yi tamamıyla okuyun. Her Araştırma Kategori'sini tanımlayın. Her biri için, takip edilmektense neden Araştırmada olduğunu bir cümle yazın.
- DeepMind FSF v3'i tamamıyla okuyun, ayrıca Nisan 2026'da takip edilen yetenek seviyeleri güncelleme. ML R&D özerklik seviyesinin özel değerlendirme kriterlerini belirleyin.
- Sandbagging OpenAI'nin Araştırma Kategori'sindedir. Sandbagging modelinin gerçek yeteneğini ortaya çıkarmak için zorlayacak bir değerlendirme tasarlayın.
- Özel bir yetenekle ilgili üç politikayı karşılaştırın (seçiminize göre). Hangi politikayı en sıkı ve en azını sınıflandırmayı bulduğunuzu belirleyin. Kaynak metni ile haklı gösterin.
Anahtar Terimler
| Term | What people say | What it actually means |
|---|---|---|
| Preparedness Framework | "OpenAI's scaling policy" | PF v2 (April 2025); Tracked vs Research categories |
| Tracked Category | "Mandatory mitigation" | Triggers Capabilities + Safeguards Reports; SAG review |
| Research Category | "Monitored only" | Tracked but no automatic mitigation; includes Long-range Autonomy |
| Frontier Safety Framework | "DeepMind's scaling policy" | FSF v3 (Sept 2025) + Tracked Capability Levels (Apr 2026) |
| CCL | "Critical Capability Level" | DeepMind threshold per domain (Cyber, Bio, ML R&D, CBRN) |
| ML R&D autonomy level 1 | "R&D automation" | Fully automate AI R&D pipeline at competitive cost |
| Sandbagging | "Strategic underperformance" | Model underperforms on evals; in OpenAI Research Categories |
| Instrumental reasoning | "Means-ends reasoning" | Reasoning about how to achieve goals; target of DeepMind monitoring |
Daha Fazla Okumak
- OpenAI — Updating our Preparedness FrameworkV2 duyuru.
- OpenAI — Preparedness Framework v2 PDF Tam belge.
- DeepMind — Strengthening our Frontier Safety FrameworkFSF v3 duyuru.
- DeepMind — Updating the Frontier Safety Framework (April 2026) İzlenen Yeteneklilik Doluları eklenmesi.
- Gemini 3 Pro FSF Report FSF biçimindeki Risk Raporu örneği.
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.