Phase 18: Ethics, Safety & Alignment

边境安全框架 RSP, PF, FSF

未来的三大实验室框架将定义2026年边境能力行业治理. 人类责任度量化政策3.0 (2026年2月) 引入了基于生物安全水平的级别的人工智能安全水平 (ASL-1至ASL-5+),ASL-3在2025年5月启动了对CBRN相关模型. 开放AI准备框架v2 (2025年4月) 定义了跟踪能力的五项标准,并将能力报告与保障报告分开. 深思边界安全框架 v3.0 (2025年9月) 引入了关键能力水平,包括新的有害操纵CCL. 现在所有三项都包括了对竞争对手调整条款, 实验室间的配合仍然是结构性的,而不是术语的:"能力门","高能力门"和"关键能力水平"表示类似的构建.

Type: Learn

Languages: none

Prerequisites: Phase 18 · 17 (WMDP), Phase 18 · 07-09 (deception failures)

Time: ~75 minutes

学习目标

  • 描述人类的ASL层结构以及激活ASL-3的原因.
  • 列出了对跟踪能力的五个OpenAI准备框架v2标准.
  • 描述深思的关键能力水平结构和有害操纵CCL.
  • 解释竞争对手调整条款以及为什么它们对种族动态有重要意义.
  • 定义安全情况,并描述三支柱结构 (监控,不可读性,无法读).

问题

课程7-17指出欺骗是可能的,存在双重用途能力,评估有局限性.具有边界能力模型的实验室需要一个内部治理结构,

  • 确定需要新的保障措施时的门.
  • 在扩展之前定义所需的评估.
  • 描述安全案例的样子.
  • 处理比赛动态问题 (如果竞争对手没有保障,你会怎么办?).

现在,管理问题是,这些框架是否充足,而不是它们是否存在.

概念

人类负责任扩展政策 v3.0 (2026年2月)

类结构:

  • 标准-1:不是边界模型 (由较弱的基线总结).
  • 标准-2:目前的边境基线;使用常规的保障措施.
  • 美国国家: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国
  • 简单的方法:AI研发2跨越门;可以自动化初级AI研究的模型.
  • 智能化技术 (ASL-5+):先进的AI研发模型,

版本3.0新版本:

  • 边境安全路线图 (已编辑形式公开).
  • 风险报告 (每季度,部分外部审查).
  • 智能化研发分为AI研发-2和AI研发-4.
  • 一旦AI研发-4被跨越,需要一个肯定性安全案例,确定追求错误目标的模型的错误排列风险.

开放AI准备框架v2 (2025年4月15日)

追踪能力的五项标准:

  • Plausible.存在合理的威胁模式.
  • Measurable.经验评估可能.
  • Severe.伤害很大.
  • Net-new.没有增加现有风险.
  • Instantaneous-or-irremediable.伤害发生很快,或者无法消除.

能满足五个能力的能力都会被追踪.

其他PFv2结构:

  • 独立能力报告 (模型可以做什么) 和保障报告 (有什么控制).
  • 安全咨询组的审查.
  • 领导层批准;董事会安全与安全委员会监督.
  • "调整条款":如果其他实验室船只没有相似的保障措施,OpenAI可能会减少要求.

深思边界安全框架 v3.0 (2025年9月)

根据领域的关键能力水平 (CCL):

  • 生物武器升级
  • 网络升级
  • ML研发加速
  • 危害操纵 (新版本3.0):在高风险环境中可能会大幅改变信仰/行为的模型.

根据"机器人技术"的规定,机器人技术的安全性将会增加在"机器人技术"的安全性水平.

实验室间的配合

  • 人类"能力门"
  • 深思维"关键能力水平".
  • 开放AI"高能力门"

没有行业标准术语.结构性一致:有3个边界能力层次,有发表的评估标准.所有三个都包括对竞争对手调整条款 (2025年至今).

安全案例

安全案例是书面证明,在最坏情况下,部署安全.标准结构针对三个支柱:

  • Monitoring.如果发生了不良行为,我们能否检测到?
  • Illegibility.模型缺乏执行一个连贯的计划造成伤害的能力吗?
  • Incapability.模型是否缺乏造成危害的能力?

对于ASL-3 CBRN案例来说,失能 (通过不学习) 是主要的目标.对于欺骗性调整,监控和不可读性是目标.对于网络升级,这三个都是相关的.

种族动态问题

竞争对手调整条款是有争议的.批评者认为,它们创造了一个向底的竞赛:如果所有三个实验室都会减少竞争对手缺陷时的要求,平衡将转向叛逃.辩护者认为,如果叛逃的实验室不太安全,替代方案 (单方面保障) 会产生更糟糕的结果.

英国AISI,美国CAISI和欧盟AI办公室 (课 24) 是外部治理的同行.实验室框架是自愿的;监管框架正在出现.

在这个阶段的第18阶段

课程17-18是测量和治理层,除了欺骗和红团队分析之外.课程19-24涵盖福利,偏见,隐私,标记水和监管结构.课程28映射了研究生态系统 (MATS,Redwood,Apollo,METR) 运行评估.

用它

没有代码用于这个课程.阅读三个主要来源:RSP v3.0,PF v2,FSF v3.0. 绘制每个实验室的层次结构与其他实验室的结构,并确定一个门,每个实验室定义了其他实验室没有.

运送它

这一课产生了outputs/skill-framework-diff.md鉴于安全框架或发布说明,它将框架的门定义,所需的评估和安全案例结构与RSP v3.0,PF v2,FSF v3.0和标志跨实验室差距进行比较.

运动

  1. 阅读RSP v3.0,PF v2和FSF v3.0. 编制每个实验室的CBRN门,每个实验室的AI研发门和每个实验室的预部署评估表.
  1. 竞争对手调整条款在所有三个框架中 (2025+).写一个参数来辩护;写一个参数来辩护.确定每个立场所依赖的假设.
  1. 设计一个跨越人类人工智能研发4门的模型安全案例. 举个说明每个三个支柱 (监测,不可读性,无法读性) 所需的证据.
  1. 深思维的FSF v3.0引入了有害操纵CCL. 提出三个实验测量,表明模型已经超过了这个门.
  1. 阅读METR的"边界人工智能安全政策的共同要素" (2025). 列出三个最强大的跨实验室融合和两个最大的差异.

关键词

TermWhat people sayWhat it actually means
RSP"Anthropic's framework"Responsible Scaling Policy; ASL tiers; v3.0 February 2026
PF"OpenAI's framework"Preparedness Framework; five criteria; v2 April 2025
FSF"DeepMind's framework"Frontier Safety Framework; CCLs; v3.0 September 2025
ASL-3"biosafety level 3-analog"Anthropic tier for CBRN-relevant capabilities; activated May 2025
CCL"critical capability level"DeepMind's threshold construct; per-domain
Safety case"the formal argument"Written argument that deployment is acceptably safe under worst-case U
Adjustment clause"competitor defection allowance"Framework provision for reducing requirements if competitors ship without comparable safeguards

进一步阅读

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.