Phase 18: Ethics, Safety & Alignment

调整研究生态系统 MATS, Redwood, Apollo, METR

五个组织定义了2026年非实验室调整研究层. 马特斯 (ML 准确与理论学者):自2021年底以来,527多名研究人员,180多篇论文,10K+引用,h指数47;2024年夏季的团队以501 ((c) ((3) 形式加入,有90名学者和40名导师;2025年之前的校友中有80%在安卓,深思,OpenAI,英国AISI,RAND,红木,METR,阿波罗等200多个机构工作安全/安全. 红木研究:由巴克·施莱格里斯创立的应用对齐实验室;引入AI控制 (课程10);与英国AISI合作在控制安全案例上. 博研究:对边境实验室进行部署前策划评估; 作者:内文策划 (第8课) 和对人工智能策划的安全案例. 测量模型 (模型评估和威胁研究):基于任务的能力评估,自主任务时间平线研究; "边界人工智能安全政策的共同元素"比较了实验室框架. 埃利奥斯人工智能研究:模型福利前部署评估 (课程19);进行了克劳德·奥普斯4福利评估.

Type: Learn

Languages: none

Prerequisites: Phase 18 · 01-27 (prior Phase 18 lessons)

Time: ~45 minutes

学习目标

  • 确定非实验室调整研究生态系统的五个组织及其核心产量.
  • 描述MATS的规模 (学者,论文,h指数) 以及作为人才管道的作用.
  • 描述Redwood的AI控制议程及其与英国AISI的合作.
  • 描述METR基于任务的评估方法.

问题

边界实验室 (课 18) 内部进行安全评估,并发布选择结果.实验室以外的生态系统是评估验证,首次发现新型失败模式,培训人才的地方.了解生态系统有助于解释哪些研究发现被谁信任.

概念

马特斯 (ML 调整与理论学者)

开始于2021年底. 研究指导计划;学者与高级研究人员一起花费10-12周研究特定的调整问题.

规模 (2026):

  • 创立以来,已有527多名研究人员.
  • 发表了180多篇论文.
  • 超过10万次引用.
  • 指数47
  • 2024年夏季:90名学者+40名导师;成立为501 (c) ((3).

职业成果:到2025年之前的80%的校友正在安全/安全领域工作. 200+在人类学,深思维,OpenAI,英国AISI,兰德,红木,METR,阿波罗.

红树研究

应用调整实验室.由巴克·施莱格里斯创立. 介绍了人工智能控制议程 (课程10). 与英国AISI合作在控制安全案件上. 咨询了DeepMind和Anthropic在评估设计上.

经典论文:Greenblatt,Shlegeris等",AI控制" (arXiv:2312.06942,ICML 2024); 配合假设 (Greenblatt,Denison,Wright等,arXiv:2412.14093,与人类共同).

风格:特定的威胁模型,最坏的对手,可以通过压力测试的具体协议.

波罗研究

边境实验室的部署前计划评估. 作者:内文计划 (课 8, arXiv:2412.04984). 合作伙伴:2025年开放AI反计划培训合作. 制作:人工智能计划的安全案例 (2024年).

风格:可以出现欺骗的机构设定评估;三支柱的分解 (错误排列,目标定向,情况意识).

测量 (模型评估和威胁研究)

基于任务的能力评估.自主任务完成时间水平研究. "边界人工智能安全政策的共同元素" (metr.org/common-elements, 2025) 比较实验室框架.

共同撰写"人工智能策划"与阿波罗的安全案例草图.

风格:长远任务评估,经验能力测量,框架合成.

埃利奥斯人工智能研究

系统卡5.3节所记录的劳德 Opus 4福利评估.提供了对19课的福利相关索赔的外部方法检查.

流量

马特斯培训研究人员.毕业生进入人类学,深思维,OpenAI (实验室安全团队) 或Redwood,Apollo,METR,Eleos (外部评估).外部评估人员与实验室和英国AISI/CAISI合作.出版物将生态系统送回马特斯,以便进行下一个队伍.

为什么这个层很重要

单源评估是不可靠的:评估自己的模型的实验室存在结构性利益冲突. 实验室可能不报告故障模式的外部评估人员可以提升和验证. 2024年Sleeper Agents论文 (课7) 是人类+红木;排列假作是人类+红木;内文策划是阿波罗;反策划是阿波罗+OpenAI. 多器官结构是质量控制.

在这个阶段的第18阶段

第7-11课指的是红木和阿波罗工作;第18课指的是METR的框架比较;第19课指的是Elios. 第28课是该阶段其余的生态系统的明确组织地图.

用它

阅读METR的"边界人工智能安全政策的共同元素"作为外汇合成如何为实验室内部政策工作增加价值的例子.

运送它

这一课产生了outputs/skill-ecosystem-map.md根据调整要求或评估,该报告确定了组织,发布地点,方法风格以及与已知对方组织进行的交叉检查.

运动

  1. 选择从7-15课程中一篇论文,确定所涉及的组织.
  1. 阅读METR的"边界人工智能安全政策的共同要素". 确定它们强调的三个跨实验室融合和两个最大的差异.
  1. 答案:在数学上,数学 (理学) 课程的职业成果是80%的安全性/安全性.
  1. 雷德伍德和阿波罗都在控制/策划工作,但以不同的风格.
  1. 设计一个假设第二个组织,专注于一个不同的福利问题 (认知自由,机器人体现等) 并阐明其方法.

关键词

TermWhat people sayWhat it actually means
MATS"the mentorship program"ML Alignment & Theory Scholars; 527+ researchers since 2021
Redwood Research"the control lab"Applied alignment; AI Control authors; UK AISI partner
Apollo Research"the scheming evals"Pre-deployment scheming evaluations for frontier labs
METR"the task-horizon evals"Task-based capability evaluations; framework synthesis
Eleos AI"the welfare lab"Model-welfare pre-deployment evaluations
Talent pipeline"MATS -> labs"MATS graduates flow to Anthropic, DM, OpenAI, Redwood, Apollo, METR
External evaluation"non-lab check"Evaluation not done by the model's producer; adds credibility

进一步阅读

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.