Phase 18: Ethics, Safety & Alignment

اکوسیستم تحقیقات هماهنگی MATS، Redwood، Apollo، METR

پنج سازمان لایه تحقیقاتی تعادل غیر آزمایشگاهی را در سال 2026 تعریف می کنند. MATS (ML Alignment & Theory Scholars): 527+ محقق از اواخر سال 2021، 180+ مقاله، 10K+ نقل قول، h-index 47; تابستان 2024 گروه شامل به عنوان 501 ((c) ((3) با ~ 90 دانشمند و 40 مربی؛ 80٪ از فارغ التحصیلان قبل از سال 2025 در زمینه ایمنی / امنیت با 200+ در Anthropic، DeepMind، OpenAI، AISI، RAND، Redwood، METR، Apollo کار می کنند. تحقیقات ریدوود: آزمایشگاه تعادل کاربردی که توسط باک شلیگریس تاسیس شد؛ کنترل هوش مصنوعی (درسی ۱۰) را معرفی کرد؛ در مورد موارد ایمنی کنترل با AISI انگلستان همکاری می کند. تحقیقات اپولو: ارزیابی های برنامه ریزی پیش از انتشار برای آزمایشگاه های مرزی؛ نویسنده برنامه ریزی در زمینه (درس 8) و به سمت موارد ایمنی برای برنامه ریزی هوش مصنوعی. METR (مودل ارزیابی و تحقیق تهدید): ارزیابی توانایی مبتنی بر وظایف، مطالعات زمانی-منطقی وظیفه مستقل؛ "عنصر های مشترک سیاست های ایمنی AI مرزی" چارچوب های آزمایشگاهی را مقایسه می کند. تحقیقات هوش مصنوعی Eleos: ارزیابی های پیش از انتشار مدل رفاه (درسی ۱۹) ؛ ارزیابی رفاه کلود اوپوس ۴ انجام داد.

Type: Learn

Languages: none

Prerequisites: Phase 18 · 01-27 (prior Phase 18 lessons)

Time: ~45 minutes

اهداف یادگیری

  • پنج سازمان اکوسیستم تحقیقاتی غیر آزمایشگاهی و تولید اصلی آنها را شناسایی کنید.
  • مقیاس MATS (تجربه های علمی، مقالات، شاخص h) و نقش آن به عنوان یک خط لوله استعداد را توصیف کنید.
  • برنامه کنترل هوش مصنوعی ریدوود و همکاری آن با AISI انگلستان را توصیف کنید.
  • روش ارزیابی مبتنی بر وظایف METR را شرح دهید.

مشکل

آزمایشگاه های مرزی (درسی 18) ارزیابی های ایمنی را در داخل تولید می کنند و نتایج انتخاب شده را منتشر می کنند. اکوسیستم خارج از آزمایشگاه ها جایی است که ارزیابی ها تأیید می شود، جایی که حالت های شکست جدید برای اولین بار کشف می شود و جایی است که استعداد آموزش داده می شود. درک اکوسیستم به تفسیر اینکه کدام یافته های تحقیقاتی توسط چه کسی اعتماد می شود کمک می کند.

مفهوم

MATS (معلمین مبانی و نظریه)

برنامه مشاوره تحقیقاتی آغاز شد در اواخر سال 2021؛ محققان 10-12 هفته را با یک محقق ارشد در یک مشکل موازی خاص صرف می کنند.

مقیاس (2026):

  • 527+ محقق از زمان آغازش
  • 180+ مقاله منتشر شده
  • 10 هزار تا نقل قول
  • شاخص h 47.
  • تابستان 2024: 90 دانشمند + 40 مربی؛ به عنوان 501 ((c) ((3).

نتایج شغلی: ~ 80٪ فارغ التحصیلان قبل از سال 2025 در زمینه ایمنی کار می کنند. 200+ در Anthropic، DeepMind، OpenAI، UK AISI، RAND، Redwood، METR، Apollo.

تحقیق در مورد درختان سرخ

آزمایشگاه تعادل کاربردی. توسط باک شلیگریس تاسیس شد. دستور کار کنترل هوش مصنوعی (درسی 10) را معرفی کرد. با AISI انگلستان در مورد موارد ایمنی کنترل همکاری می کند. در طراحی ارزیابی به DeepMind و Anthropic مشاوره می دهد.

مقالات کنونیکی: گرین بلات، شلیگریس و همکاران، "کنترول هوش مصنوعی" (arXiv:2312.06942, ICML 2024)؛ جعلی ساز (Greenblatt, Denison, Wright و همکاران، arXiv:2412.14093, مشترک با انسان شناسی).

سبک: مدل های تهدیدی خاص، بدترین خصمان، پروتکل های مشخصی که می توانند تحت فشار آزمایش شوند.

تحقیقات اپولو

ارزیابی های پیش از انتشار طرح ریزی برای آزمایشگاه های مرزی. نویسنده طرح بندی در زمینه (درس 8، arXiv:2412.04984). شریک در همکاری آموزش ضد طرح ریزی OpenAI در سال 2025. تولید موارد ایمنی برای طرح ریزی هوش مصنوعی (2024).

سبک: ارزیابی های تنظیم کننده عوامل که در آن ممکن است فریب ظاهر شود؛ تجزیه سه ستون (مخطط سازی، هدف، آگاهی از موقعیت).

METR (مثال ارزیابی و تحقیق در مورد تهدید)

ارزیابی توانایی مبتنی بر وظایف. مطالعات زمانی و افق تکمیل وظیفه مستقل. "عناصر مشترک سیاست های ایمنی هوش مصنوعی مرزی" (metr.org/common-elements، 2025) چارچوب های آزمایشگاهی را مقایسه می کند.

هم نویسنده ی نقشه ی "آای تی" در مورد "اپولو"

سبک: ارزیابی وظایف افق دراز، اندازه گیری توانایی تجربی، ترکیب چارچوب.

تحقیق هوش مصنوعی Eleos

ارزیابی های پیش از انتشار مدل رفاه. ارزیابی رفاه کلود اوپوس 4 انجام شده که در بخش 5.3 کارت سیستم مستند شده است. بررسی روش خارجی برای ادعاهای مربوط به رفاه در درس 19 را ارائه می دهد.

جریان

MATS به محققان آموزش می دهد. فارغ التحصیلان به Anthropic، DeepMind، OpenAI (تشکم های ایمنی آزمایشگاه) یا به Redwood، Apollo، METR، Eleos (مایه گذاری خارجی) می روند. ارزیابی کنندگان خارجی با آزمایشگاه ها و با AISI / CAISI بریتانیا همکاری می کنند. انتشارات سیستم زیست محیطی را برای MATS برای گروه بعدی تغذیه می کنند.

چرا این لایه مهمه

ارزیابی های یک منبع قابل اعتماد نیستند: آزمایشگاه هایی که مدل های خود را ارزیابی می کنند، در تضاد منافع ساختاری دارند. ارزیابی کنندگان خارجی می توانند حالت های شکست را که آزمایشگاه ممکن است کم گزارش دهد افزایش و تأیید کنند. مقاله 2024 Sleeper Agents (درسی 7) Anthropic + Redwood بود؛ جعل سازي Anthropic + Redwood بود؛ برنامه ریزی در زمینه اپولو بود؛ برنامه ریزی ضد-آپیل Apollo + OpenAI بود. ساختار چند ارگان کنترل کیفیت است.

جایی که این در مرحله 18 قرار داره

درس 7-11 به کار ریدوود و آپولو اشاره دارد؛ درس 18 به مقایسه چارچوب METR اشاره دارد؛ درس 19 به Eleos اشاره دارد. درس 28 نقشه سازماندهی صریح برای اکوسیستم است که بقیه مرحله بر آن تکیه می کند.

ازش استفاده کن

هیچ کد. "عنصر های مشترک سیاست های ایمنی هوش مصنوعی مرزی" METR را به عنوان یک مثال از چگونگی ترکیب خارجی به کار سیاست های داخلی آزمایشگاه اضافه کنید.

-باده

این درس به ما کمک می کندoutputs/skill-ecosystem-map.mdدر صورت ادعای تعاونی یا ارزیابی، سازمان، محل انتشار و سبک روش شناسی و چک های متقابل با سازمان های معادل شناخته شده را مشخص می کند.

تمرینات

  1. یک مقاله از درس 7-15 را انتخاب کنید و سازمان های درگیر را شناسایی کنید. نویسندگان را با فارغ التحصیلان MATS و وابستگی های فعلی اکوسیستم بررسی کنید.
  1. " عناصر مشترک سیاست های ایمنی هوش مصنوعی مرزی" METR را بخوانید. سه متقابل آزمایشگاهی را که آنها بر آن تاکید می کنند و دو تفاوت بزرگ را شناسایی کنید.
  1. نتایج حرفه ای MATS حدود 80٪ ایمنی/امنی است. استدلال کنید که آیا این فشار انتخاب سازنده است (به میدان آموزش می دهد) یا متحيز (از موقعیت های غیر عادی فیلتر می کند).
  1. ريدوود و اپولو هر دو کار کنترل و نقشه برداری را انجام می دهند اما با سبک های مختلف.
  1. Eleos AI تنها سازمان خالص مدل رفاه است. یک سازمان فرضیه ای را طراحی کنید که بر یک سوال رفاه مختلف (آزادی شناختی، تجسم رباتیک و غیره) متمرکز باشد و روش آن را بیان کنید.

اصطلاحات کلیدی

TermWhat people sayWhat it actually means
MATS"the mentorship program"ML Alignment & Theory Scholars; 527+ researchers since 2021
Redwood Research"the control lab"Applied alignment; AI Control authors; UK AISI partner
Apollo Research"the scheming evals"Pre-deployment scheming evaluations for frontier labs
METR"the task-horizon evals"Task-based capability evaluations; framework synthesis
Eleos AI"the welfare lab"Model-welfare pre-deployment evaluations
Talent pipeline"MATS -> labs"MATS graduates flow to Anthropic, DM, OpenAI, Redwood, Apollo, METR
External evaluation"non-lab check"Evaluation not done by the model's producer; adds credibility

خواندن بیشتر

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.