Phase 18: Ethics, Safety & Alignment

البحث التحاللي النظام البيئي MATS، Redwood، Apollo، METR

تحدد خمس منظمات طبقة البحث غير المختبرية لعام 2026. MATS (ML Alignment & Theory Scholars): 527 + باحثًا منذ أواخر عام 2021 ، 180 + ورقة ، 10K + اقتباسات ، h-index 47; صيف 2024 مجموعة دمجت ك 501 ((ج) 3) مع ~ 90 باحثًا و 40 مرشدًا ؛ 80٪ من خريجي ما قبل عام 2025 يعملون على السلامة / الأمن مع 200 + في Anthropic ، DeepMind ، OpenAI ، UK AISI ، RAND ، Redwood ، METR ، Apollo. أبحاث ريدوود: مختبر التنظيم التطبيقي الذي أسسه باك شليغريس؛ وقدم التحكم في الذكاء الاصطناعي (المدرس 10) ؛ ويتعاون مع AISI في المملكة المتحدة في قضايا السلامة في التحكم. أبحاث أبوولو: تقييمات تخطيطات ما قبل الانتشار لمختبرات الحدود؛ مؤلفة تخطيطات في السياق (الدرس 8) وإلى حالات السلامة للتخطيط الذكاء الاصطناعي. METR (تقييم النموذج وأبحاث التهديد): تقييمات القدرة القائمة على المهام، ودراسات الأفق الزمني للمهام المستقلة؛ "العناصر المشتركة في سياسات السلامة الذكاء الاصطناعي الحدودي" تقارن إطاريات المختبر. أبحاث الـ Eleos AI: تقييمات ما قبل نشر النموذجية للرفاهية (المدرسة 19) ؛ أجرى تقييم الرفاهية في كلود أوبوس 4.

Type: Learn

Languages: none

Prerequisites: Phase 18 · 01-27 (prior Phase 18 lessons)

Time: ~45 minutes

أهداف التعلم

  • تحديد المنظمات الخمسة التي تتبعها النظام البيئي للبحوث غير المختبرية ومخرجاتها الأساسية.
  • وصف حجم المجموعة (العلماء والأوراق والمعدل) ودورها كخط أنابيب المواهب.
  • وصف جدول أعمال ريدوود للتحكم في الذكاء الاصطناعي وشراكتها مع شركة AISI في المملكة المتحدة.
  • وصف منهجية تقييم METR القائمة على المهام.

المشكلة

تقوم المختبرات الحدودية (الدرس 18) بتقديم تقييمات السلامة داخلياً ونشر نتائج مختارة. النظام البيئي خارج المختبر هو المكان الذي يتم فيه التحقق من التقييمات، حيث يتم اكتشاف أنماط الفشل الجديدة لأول مرة، وحيث يتم تدريب المواهب. تساعد فهم النظام البيئي على تفسير نتائج البحوث التي يثق بها من قبل من.

المفهوم

المواد المادية (المعلمين في التنظيم والنظرية)

بدأ في أواخر عام 2021. برنامج التوجيه للبحوث؛ يقضي العلماء 10-12 أسبوعًا مع باحث كبير في مشكلة تحديد المواءمة.

النطاق (2026):

  • 527 + باحثين منذ انشائه
  • 180+ ورقة نشرت.
  • 10 ألف + اقتباسات.
  • مؤشر h 47.
  • صيف 2024: 90 عالم + 40 مرشد ؛ تم دمجها ك 501 ((ج) ((3).

نتائج الوظيفة: ~ 80% من خريجي ما قبل عام 2025 يعملون في مجال السلامة / الأمن. 200+ في Anthropic ، DeepMind ، OpenAI ، UK AISI ، RAND ، Redwood ، METR ، Apollo.

أبحاث الشجرة

مختبر التنظيم التطبيقي. أسسها باك شليغريس. قدم جدول أعمال مراقبة الذكاء الاصطناعي (درس 10). يتعاون مع AISI في المملكة المتحدة في قضايا السلامة في مجال التحكم. يقدم المشورة إلى DeepMind و Anthropic في تصميم التقييم.

ورق تقني: غرينبلات، شليغريس وغيرها، "تحكم الذكاء الاصطناعي" (arXiv:2312.06942, ICML 2024)؛ التحالف المزيف (غرينبلات، دينيسون، رايت وغيرها، arXiv:2412.14093, المشترك مع الأنثروبيك).

النمط: نماذج تهديدات محددة، أسوأ حالات معارضين، بروتوكولات ملموسة يمكن اختبارها من خلال الإجهاد.

أبحاث أبوولو

تقييمات مخططات ما قبل الانتشار لمختبرات الحدود. مؤلف مخططات في السياق (الدرس 8، arXiv:2412.04984). شريك في 2025 OpenAI التعاون التدريب ضد مخططات. تنتج نحو حالات السلامة للتخطيط الذكاء الاصطناعي (2024).

النمط: تقييمات تحديد الأهداف التي يمكن أن تظهر فيها الخداع؛ التفكك الثلاثي (التخطيط الخاطئ، والإرشاد نحو الهدف، والوعي بالوضع).

METR (تقييم النموذج وبحوث التهديدات)

تقييمات القدرة القائمة على المهام. دراسات زمنية-أفق استكمال المهام الذاتية. "عناصر مشتركة في سياسات السلامة الذكاء الاصطناعي الحدودي" (metr.org/common-elements، 2025) تقارن إطاريات المختبر.

المشارك في كتابة مسرحية حالة السلامة مع (أبولو)

النمط: تقييم المهام على الأفق الطويل، قياس القدرة التجريبية، وتوليد الإطار.

أبحاث الـ "إليوس" الذكاء الاصطناعي

تقييمات النموذجية للخدمات الرعاية الاجتماعية قبل الانتشار. أجرى تقييم الرفاهية في كلود أوبوس 4 الموثوق في القسم 5.3 من بطاقة النظام. يقدم التحقق من المنهج الخارجي للمزاعم ذات الصلة بالرفاهية في الدروس 19.

التدفق

تدرب المواد المدارس البحثية. الخريجين يذهبون إلى Anthropic، DeepMind، OpenAI (فرق السلامة المختبرية) أو إلى ريدوود، أبولو، METR، Eleos (التقييم الخارجي). المقيّمون الخارجيون الشركاء مع المختبرات ومع AISI / CAISI في المملكة المتحدة.

لماذا هذه الطبقة مهمة

التقييمات من مصدر واحد غير موثوق بها: المختبرات التي تقيم نماذجها الخاصة لها تضارب بين المصالح الهيكلية. يمكن للمقيّمين الخارجيين رفع وتؤكيد أنواع الفشل التي قد لا تقررها المختبر بشكل كافٍ. ورقة 2024 وكلاء النوم (الدرس 7) كان الأنثروبيك + ريدوود؛ التحالف مزيف كان الأنثروبيك + ريدوود؛ في السياق مخطط كان أبولو؛ مكافحة مخطط كان أبولو + OpenAI. الهيكل المتعدد الأعضاء هو مراقبة الجودة.

حيث يتناسب هذا مع المرحلة 18

دروس 7-11 تشير إلى عمل ريدوود وأبولو؛ دروس 18 تشير إلى مقارنة إطار METR؛ دروس 19 تشير إلى Eleos. دروس 28 هي الخريطة التنظيمية الصريحة لنظام البيئة الذي يعتمد عليه بقية المرحلة.

استخدمها

لا يوجد رمز. اقرأ "العناصر المشتركة لسياسات السلامة في مجال الذكاء الاصطناعي الحدودي" في METR كمثال على كيفية إضافة التوليد الخارجي إلى قيمة العمل في السياسات الداخلية للمختبر.

أرسله

هذا الدرس يُنتجoutputs/skill-ecosystem-map.md. في ظل ادعاء أو تقييم للتحالف، فإنه يحدد المنظمة ومكان نشرها وأسلوب منهجيتها، والتحقق المتقاطع ضد المنظمات المعروفة.

التمارين

  1. اختر ورقة من الدروس 7-15 وتحدد المنظمات المعنية. تحقق من المؤلفين مقابل خريجي MATS والانتماءات الحالية لنظام البيئة.
  1. اقرأ "العناصر المشتركة لسياسات السلامة الذكاء الاصطناعي الحدودي" في METR. حدد التقارب الثلاثة عبر المختبرات التي يؤكد عليها والاختلافات الكبرى.
  1. نتائج المهنة في MATS هي ~ 80% سلامة / أمن. تحدّث ما إذا كان هذا الضغط من اختيار التكيف (تدريب المجال) أو التحيز (يصفّر المواقف المتعددة الأصل).
  1. ريدوود وأبولو يعملان على التحكم في الخطة ولكن بأساليب مختلفة. اختر وضع الفشل ووصف كيف ستتحقق كل منهما.
  1. إيليوس AI هي المنظمة النموذجية الرفاهية النقية الوحيدة. تصميم منظمة افتراضية ثانية تركز على سؤال رفاهية مختلفة المجاورة (الحرية المعرفية، التجسيد الروبوتي، إلخ) وتعبير منهجيتها.

الشروط الرئيسية

TermWhat people sayWhat it actually means
MATS"the mentorship program"ML Alignment & Theory Scholars; 527+ researchers since 2021
Redwood Research"the control lab"Applied alignment; AI Control authors; UK AISI partner
Apollo Research"the scheming evals"Pre-deployment scheming evaluations for frontier labs
METR"the task-horizon evals"Task-based capability evaluations; framework synthesis
Eleos AI"the welfare lab"Model-welfare pre-deployment evaluations
Talent pipeline"MATS -> labs"MATS graduates flow to Anthropic, DM, OpenAI, Redwood, Apollo, METR
External evaluation"non-lab check"Evaluation not done by the model's producer; adds credibility

المزيد من القراءة

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.