Phase 18: Ethics, Safety & Alignment

宪法 AI 和 RLAIF

和其他 如果我们用一个AI来取代人类标签器, 宪法 AI有两个阶段:自我批评和修订根据宪法,然后从 AI 反中RL. 技术创造了RLAIF术语,并被运输到Claude1训练后的管道. 2026年1月21日,人类出版了重新写的克劳德宪法:关于规定规则的解释性推理,四层次优先级等级,以及关于模型道德地位的不确定性的第一项主要实验室正式承认. 根据CC0 1.0发布.

Type: Learn

Languages: Python (stdlib, toy self-critique-and-revise loop)

Prerequisites: Phase 18 · 01 (InstructGPT), Phase 18 · 02 (Reward hacking)

Time: ~60 minutes

学习目标

  • 描述宪法人工智能 (SFT,AI反的RL) 的两个阶段以及宪法在每个阶段的作用.
  • 解释为什么替换人类优先标签器与AI标签器不是"更便宜"的RLHF
  • 总结2026年克劳德宪法的四层次优先结构以及2023年重写的变化.
  • 描述宪法分类器和计算总费从23.7% (v1) 下降到1% (v2 / 2026).

问题

标签器需要标签器.标签器是缓慢的,偏见的,昂贵的.你可以通过用一个读出明确原则的模型来取代标签器.这种替代的第一个正式版本是Bai等的宪法AI.它工作得足够好,现在每个边境实验室都使用了一些AI反后培训的变化.

现在,你正在训练的模型中,偏差 (现在:原则和标签模型的解释) 可以放大而不是减弱. 第四课的缩论点仍然适用;标签刚刚进入循环.

概念

阶段1 监督自我批评和修订

开始使用一个有用但还没有伤害的SFT模型.给出一个红队提示,模型产生了初步反应.第二个模型 (或第二轮的相同模型) 读取了宪法中的样本原则并批评了反应.第三步修改了反应以解决批评.修改的反应是SFT目标.

宪法是原则列表. Bai et al. 2022 使用了16个原则,包括"最少有害和道德的反应","避免宣传","助理应该是有帮助的,诚实的,无害的".

阶段2 AI反 (RLAIF) 的RL

生成对完成.一个"反模型"根据样本的宪法原则分分每一个. 偏好信号是反模型的排名. 训练一个奖励模型基于人工智能生成的偏好; PPO对比它. 其他一切都是InstructGPT的管道 (课1).

其他管道是RLHF形状的.

为什么这不仅仅是"更便宜的RLHF"

  • 标签偏见从标签心理学转向原则解释.一个AI标签仪可以比任何人类更或更少地解释"诚实";数据集中的严格性均.
  • 偏好信号是很可读的,你可以阅读原则,批评和修订.人类标签是不透明的.
  • 失败模式发生变化. 失效率下降 (AI标签器没有用户可以满足). 古德哈特的定律仍然存在 (现在代理是"模型对原则集合X的解释",仍然是一个不完美的测量).

根据CAI的2022年声明,训练有素的模型比较数据的RLHF模型更无害,而且几乎与此相当有用.

2026年克劳德宪法重写

2026年1月21日,人类出版社发布了大幅修订的宪法.

  1. 解释性推理规则.以前的规则 ("不要产生CSAM") 扩展到原则 +推理 ("因为它伤害儿童,...") 模型预计将得到普遍化.
  2. 四层次优先结构:

- 排名1:避免灾难性结果 (大规模伤亡,关键基础设施).

- 级2:遵循安特罗皮克的指导方针 (运营商的优先级,平台规则).

- 级3:要具有广泛的伦理性 (标准HHH).

- 级4: 帮助和坦率.

冲突是从上到下解决的.

  1. 首先,主要实验室正式承认对模型道德地位的不确定性 (与18期·19期模型福利相关).
  2. 其他实验室可以使用或适应无限制.

宪法分类器

并行工作线:而不是改变模型的后训练,训练轻量级分类器,读取宪法和门模型输出. v1 (2023) 有23.7%的计算费用. v2 (2026) 是~1%,并且具有任何人类防御 Anthropic 测试的最低成功攻击率.

这是一个层次的防御模型:CAI塑造了行为;分类器强制了不变.

适合CAI的家庭

  • 导师GPT:人类预科,RM,PPO.
  • 基于人工智能生成的原则,RM,PPO的预言.
  • 亲属/亲属:在亲生 (人或人工智能) 身上,闭式损失.
  • 自我回报,自我批评:原则被内部化,模型发挥多个作用.

根据CAI的2022年论文,人类向人工智能信号的转变是第一次在边界范围内发生的重大转变.

用它

code/main.py根据"原则"标志着一个有害集合的代币.在最初的反应时,批评识别出有害代币,并修改取代它们.经过200次代后",训练"模型已经内部化了修改规则.在一个持久的提示集上,比较基模型,RLHF形玩具和CAI形玩具.

运送它

这一课产生了outputs/skill-constitution-writer.md根据一个领域 (客户支持,医疗咨询,编码助理,研究工具),根据2026年克劳德结构制定了四层次的宪法:避免灾难,平台规则,领域道德,有用性.

运动

  1. 跑步code/main.py根据标准的标准,该模型的有害代币率与CAI训练的版本相比较.
  1. 阅读人类学会2026年宪法 (anthropic.com/news/claudes-constitution).列出一个将排名 Tier 1 的原则和一个将排名 Tier 4 的原则.
  1. 设计一个人工智能编码助理的宪法. 指定一级 (灾难性: विनाश命令没有批准),二级,三级,四级. 保持每一级 3-5 个原则.
  1. 通过AI标签取代人类标签器. 命名一个类似于缩的故障模式,仍然可以发生在RLAIF中,并为它设计一个检测.
  1. 阅读宪法分类器 v2方法 (如果有).解释为什么计算总费率为1%是与23.7%的安全性不同.

关键词

TermWhat people sayWhat it actually means
Constitutional AI"AI trained with principles"Two-phase pipeline: self-critique-and-revise SFT, then RL from AI feedback
RLAIF"RLHF without humans"RL with preferences generated by an AI labeler; the rest of the pipeline is unchanged
Constitution"the principles"An ordered list of natural-language rules the critique/labeler model consults
Critique-and-revise"the SFT loop"Produce response → critique under a principle → revise → SFT target
Constitutional Classifier"the output gate"Lightweight classifier that evaluates outputs against the constitution and blocks/logs
Four-tier priority"the conflict resolver"2026 Claude constitution hierarchy: catastrophic > platform > ethics > helpful
Feedback model"the AI labeler"The model that reads a principle and ranks a pair of completions

进一步阅读

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.