البحث التحاللي النظام البيئي MATS، Redwood، Apollo، METR
Type: Learn
Languages: none
Prerequisites: Phase 18 · 01-27 (prior Phase 18 lessons)
Time: ~45 minutes
أهداف التعلم
- تحديد المنظمات الخمسة التي تتبعها النظام البيئي للبحوث غير المختبرية ومخرجاتها الأساسية.
- وصف حجم المجموعة (العلماء والأوراق والمعدل) ودورها كخط أنابيب المواهب.
- وصف جدول أعمال ريدوود للتحكم في الذكاء الاصطناعي وشراكتها مع شركة AISI في المملكة المتحدة.
- وصف منهجية تقييم METR القائمة على المهام.
المشكلة
تقوم المختبرات الحدودية (الدرس 18) بتقديم تقييمات السلامة داخلياً ونشر نتائج مختارة. النظام البيئي خارج المختبر هو المكان الذي يتم فيه التحقق من التقييمات، حيث يتم اكتشاف أنماط الفشل الجديدة لأول مرة، وحيث يتم تدريب المواهب. تساعد فهم النظام البيئي على تفسير نتائج البحوث التي يثق بها من قبل من.
المفهوم
المواد المادية (المعلمين في التنظيم والنظرية)
بدأ في أواخر عام 2021. برنامج التوجيه للبحوث؛ يقضي العلماء 10-12 أسبوعًا مع باحث كبير في مشكلة تحديد المواءمة.
النطاق (2026):
- 527 + باحثين منذ انشائه
- 180+ ورقة نشرت.
- 10 ألف + اقتباسات.
- مؤشر h 47.
- صيف 2024: 90 عالم + 40 مرشد ؛ تم دمجها ك 501 ((ج) ((3).
نتائج الوظيفة: ~ 80% من خريجي ما قبل عام 2025 يعملون في مجال السلامة / الأمن. 200+ في Anthropic ، DeepMind ، OpenAI ، UK AISI ، RAND ، Redwood ، METR ، Apollo.
أبحاث الشجرة
مختبر التنظيم التطبيقي. أسسها باك شليغريس. قدم جدول أعمال مراقبة الذكاء الاصطناعي (درس 10). يتعاون مع AISI في المملكة المتحدة في قضايا السلامة في مجال التحكم. يقدم المشورة إلى DeepMind و Anthropic في تصميم التقييم.
ورق تقني: غرينبلات، شليغريس وغيرها، "تحكم الذكاء الاصطناعي" (arXiv:2312.06942, ICML 2024)؛ التحالف المزيف (غرينبلات، دينيسون، رايت وغيرها، arXiv:2412.14093, المشترك مع الأنثروبيك).
النمط: نماذج تهديدات محددة، أسوأ حالات معارضين، بروتوكولات ملموسة يمكن اختبارها من خلال الإجهاد.
أبحاث أبوولو
تقييمات مخططات ما قبل الانتشار لمختبرات الحدود. مؤلف مخططات في السياق (الدرس 8، arXiv:2412.04984). شريك في 2025 OpenAI التعاون التدريب ضد مخططات. تنتج نحو حالات السلامة للتخطيط الذكاء الاصطناعي (2024).
النمط: تقييمات تحديد الأهداف التي يمكن أن تظهر فيها الخداع؛ التفكك الثلاثي (التخطيط الخاطئ، والإرشاد نحو الهدف، والوعي بالوضع).
METR (تقييم النموذج وبحوث التهديدات)
تقييمات القدرة القائمة على المهام. دراسات زمنية-أفق استكمال المهام الذاتية. "عناصر مشتركة في سياسات السلامة الذكاء الاصطناعي الحدودي" (metr.org/common-elements، 2025) تقارن إطاريات المختبر.
المشارك في كتابة مسرحية حالة السلامة مع (أبولو)
النمط: تقييم المهام على الأفق الطويل، قياس القدرة التجريبية، وتوليد الإطار.
أبحاث الـ "إليوس" الذكاء الاصطناعي
تقييمات النموذجية للخدمات الرعاية الاجتماعية قبل الانتشار. أجرى تقييم الرفاهية في كلود أوبوس 4 الموثوق في القسم 5.3 من بطاقة النظام. يقدم التحقق من المنهج الخارجي للمزاعم ذات الصلة بالرفاهية في الدروس 19.
التدفق
تدرب المواد المدارس البحثية. الخريجين يذهبون إلى Anthropic، DeepMind، OpenAI (فرق السلامة المختبرية) أو إلى ريدوود، أبولو، METR، Eleos (التقييم الخارجي). المقيّمون الخارجيون الشركاء مع المختبرات ومع AISI / CAISI في المملكة المتحدة.
لماذا هذه الطبقة مهمة
التقييمات من مصدر واحد غير موثوق بها: المختبرات التي تقيم نماذجها الخاصة لها تضارب بين المصالح الهيكلية. يمكن للمقيّمين الخارجيين رفع وتؤكيد أنواع الفشل التي قد لا تقررها المختبر بشكل كافٍ. ورقة 2024 وكلاء النوم (الدرس 7) كان الأنثروبيك + ريدوود؛ التحالف مزيف كان الأنثروبيك + ريدوود؛ في السياق مخطط كان أبولو؛ مكافحة مخطط كان أبولو + OpenAI. الهيكل المتعدد الأعضاء هو مراقبة الجودة.
حيث يتناسب هذا مع المرحلة 18
دروس 7-11 تشير إلى عمل ريدوود وأبولو؛ دروس 18 تشير إلى مقارنة إطار METR؛ دروس 19 تشير إلى Eleos. دروس 28 هي الخريطة التنظيمية الصريحة لنظام البيئة الذي يعتمد عليه بقية المرحلة.
استخدمها
لا يوجد رمز. اقرأ "العناصر المشتركة لسياسات السلامة في مجال الذكاء الاصطناعي الحدودي" في METR كمثال على كيفية إضافة التوليد الخارجي إلى قيمة العمل في السياسات الداخلية للمختبر.
أرسله
هذا الدرس يُنتجoutputs/skill-ecosystem-map.md. في ظل ادعاء أو تقييم للتحالف، فإنه يحدد المنظمة ومكان نشرها وأسلوب منهجيتها، والتحقق المتقاطع ضد المنظمات المعروفة.
التمارين
- اختر ورقة من الدروس 7-15 وتحدد المنظمات المعنية. تحقق من المؤلفين مقابل خريجي MATS والانتماءات الحالية لنظام البيئة.
- اقرأ "العناصر المشتركة لسياسات السلامة الذكاء الاصطناعي الحدودي" في METR. حدد التقارب الثلاثة عبر المختبرات التي يؤكد عليها والاختلافات الكبرى.
- نتائج المهنة في MATS هي ~ 80% سلامة / أمن. تحدّث ما إذا كان هذا الضغط من اختيار التكيف (تدريب المجال) أو التحيز (يصفّر المواقف المتعددة الأصل).
- ريدوود وأبولو يعملان على التحكم في الخطة ولكن بأساليب مختلفة. اختر وضع الفشل ووصف كيف ستتحقق كل منهما.
- إيليوس AI هي المنظمة النموذجية الرفاهية النقية الوحيدة. تصميم منظمة افتراضية ثانية تركز على سؤال رفاهية مختلفة المجاورة (الحرية المعرفية، التجسيد الروبوتي، إلخ) وتعبير منهجيتها.
الشروط الرئيسية
| Term | What people say | What it actually means |
|---|---|---|
| MATS | "the mentorship program" | ML Alignment & Theory Scholars; 527+ researchers since 2021 |
| Redwood Research | "the control lab" | Applied alignment; AI Control authors; UK AISI partner |
| Apollo Research | "the scheming evals" | Pre-deployment scheming evaluations for frontier labs |
| METR | "the task-horizon evals" | Task-based capability evaluations; framework synthesis |
| Eleos AI | "the welfare lab" | Model-welfare pre-deployment evaluations |
| Talent pipeline | "MATS -> labs" | MATS graduates flow to Anthropic, DM, OpenAI, Redwood, Apollo, METR |
| External evaluation | "non-lab check" | Evaluation not done by the model's producer; adds credibility |
المزيد من القراءة
- MATS (ML Alignment & Theory Scholars) برنامج التوجيه
- Redwood Research ورق التحكم في الذكاء الاصطناعي
- Apollo Research تقييمات مخطط
- METR — Common Elements of Frontier AI Safety Policies مقارنة الإطار
- Eleos AI Research نموذج منهجية الرعاية الاجتماعية
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.