边境安全框架 RSP, PF, FSF
Type: Learn
Languages: none
Prerequisites: Phase 18 · 17 (WMDP), Phase 18 · 07-09 (deception failures)
Time: ~75 minutes
学习目标
- 描述人类的ASL层结构以及激活ASL-3的原因.
- 列出了对跟踪能力的五个OpenAI准备框架v2标准.
- 描述深思的关键能力水平结构和有害操纵CCL.
- 解释竞争对手调整条款以及为什么它们对种族动态有重要意义.
- 定义安全情况,并描述三支柱结构 (监控,不可读性,无法读).
问题
课程7-17指出欺骗是可能的,存在双重用途能力,评估有局限性.具有边界能力模型的实验室需要一个内部治理结构,
- 确定需要新的保障措施时的门.
- 在扩展之前定义所需的评估.
- 描述安全案例的样子.
- 处理比赛动态问题 (如果竞争对手没有保障,你会怎么办?).
现在,管理问题是,这些框架是否充足,而不是它们是否存在.
概念
人类负责任扩展政策 v3.0 (2026年2月)
类结构:
- 标准-1:不是边界模型 (由较弱的基线总结).
- 标准-2:目前的边境基线;使用常规的保障措施.
- 美国国家: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国: 美国
- 简单的方法:AI研发2跨越门;可以自动化初级AI研究的模型.
- 智能化技术 (ASL-5+):先进的AI研发模型,
版本3.0新版本:
- 边境安全路线图 (已编辑形式公开).
- 风险报告 (每季度,部分外部审查).
- 智能化研发分为AI研发-2和AI研发-4.
- 一旦AI研发-4被跨越,需要一个肯定性安全案例,确定追求错误目标的模型的错误排列风险.
开放AI准备框架v2 (2025年4月15日)
追踪能力的五项标准:
- Plausible.存在合理的威胁模式.
- Measurable.经验评估可能.
- Severe.伤害很大.
- Net-new.没有增加现有风险.
- Instantaneous-or-irremediable.伤害发生很快,或者无法消除.
能满足五个能力的能力都会被追踪.
其他PFv2结构:
- 独立能力报告 (模型可以做什么) 和保障报告 (有什么控制).
- 安全咨询组的审查.
- 领导层批准;董事会安全与安全委员会监督.
- "调整条款":如果其他实验室船只没有相似的保障措施,OpenAI可能会减少要求.
深思边界安全框架 v3.0 (2025年9月)
根据领域的关键能力水平 (CCL):
- 生物武器升级
- 网络升级
- ML研发加速
- 危害操纵 (新版本3.0):在高风险环境中可能会大幅改变信仰/行为的模型.
根据"机器人技术"的规定,机器人技术的安全性将会增加在"机器人技术"的安全性水平.
实验室间的配合
- 人类"能力门"
- 深思维"关键能力水平".
- 开放AI"高能力门"
没有行业标准术语.结构性一致:有3个边界能力层次,有发表的评估标准.所有三个都包括对竞争对手调整条款 (2025年至今).
安全案例
安全案例是书面证明,在最坏情况下,部署安全.标准结构针对三个支柱:
- Monitoring.如果发生了不良行为,我们能否检测到?
- Illegibility.模型缺乏执行一个连贯的计划造成伤害的能力吗?
- Incapability.模型是否缺乏造成危害的能力?
对于ASL-3 CBRN案例来说,失能 (通过不学习) 是主要的目标.对于欺骗性调整,监控和不可读性是目标.对于网络升级,这三个都是相关的.
种族动态问题
竞争对手调整条款是有争议的.批评者认为,它们创造了一个向底的竞赛:如果所有三个实验室都会减少竞争对手缺陷时的要求,平衡将转向叛逃.辩护者认为,如果叛逃的实验室不太安全,替代方案 (单方面保障) 会产生更糟糕的结果.
英国AISI,美国CAISI和欧盟AI办公室 (课 24) 是外部治理的同行.实验室框架是自愿的;监管框架正在出现.
在这个阶段的第18阶段
课程17-18是测量和治理层,除了欺骗和红团队分析之外.课程19-24涵盖福利,偏见,隐私,标记水和监管结构.课程28映射了研究生态系统 (MATS,Redwood,Apollo,METR) 运行评估.
用它
没有代码用于这个课程.阅读三个主要来源:RSP v3.0,PF v2,FSF v3.0. 绘制每个实验室的层次结构与其他实验室的结构,并确定一个门,每个实验室定义了其他实验室没有.
运送它
这一课产生了outputs/skill-framework-diff.md鉴于安全框架或发布说明,它将框架的门定义,所需的评估和安全案例结构与RSP v3.0,PF v2,FSF v3.0和标志跨实验室差距进行比较.
运动
- 阅读RSP v3.0,PF v2和FSF v3.0. 编制每个实验室的CBRN门,每个实验室的AI研发门和每个实验室的预部署评估表.
- 竞争对手调整条款在所有三个框架中 (2025+).写一个参数来辩护;写一个参数来辩护.确定每个立场所依赖的假设.
- 设计一个跨越人类人工智能研发4门的模型安全案例. 举个说明每个三个支柱 (监测,不可读性,无法读性) 所需的证据.
- 深思维的FSF v3.0引入了有害操纵CCL. 提出三个实验测量,表明模型已经超过了这个门.
- 阅读METR的"边界人工智能安全政策的共同要素" (2025). 列出三个最强大的跨实验室融合和两个最大的差异.
关键词
| Term | What people say | What it actually means |
|---|---|---|
| RSP | "Anthropic's framework" | Responsible Scaling Policy; ASL tiers; v3.0 February 2026 |
| PF | "OpenAI's framework" | Preparedness Framework; five criteria; v2 April 2025 |
| FSF | "DeepMind's framework" | Frontier Safety Framework; CCLs; v3.0 September 2025 |
| ASL-3 | "biosafety level 3-analog" | Anthropic tier for CBRN-relevant capabilities; activated May 2025 |
| CCL | "critical capability level" | DeepMind's threshold construct; per-domain |
| Safety case | "the formal argument" | Written argument that deployment is acceptably safe under worst-case U |
| Adjustment clause | "competitor defection allowance" | Framework provision for reducing requirements if competitors ship without comparable safeguards |
进一步阅读
- Anthropic — Responsible Scaling Policy v3.0 (February 2026) 技术水平,路线图,人工智能研发分类
- OpenAI — Updating the Preparedness Framework (April 15, 2025)五项标准,调整条款
- DeepMind — Strengthening our Frontier Safety Framework (September 2025)CCL v3.0, 危害操纵
- METR — Common Elements of Frontier AI Safety Policies (2025)跨实验室比较
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.