RLHF/DPO 的对齐,命脉是人类偏好数据。「有用」还好标,但「无害」那部分特别难:要人去判断大量有害、擦边、敏感的内容——成本高、标准飘、还伤标注者的身心。更麻烦的是,模型最终的「价值观」散落在几万条标签里,没人能直接读出来、也改不动。
你已经从 CoT 知道:大模型能对照标准做推理判断。那么——能不能给它一组写下来的原则(宪法),让它自己照着检查、修正、评判自己的输出? 人只负责写好那部宪法(一次性、可读、可改),把「逐条审查几万个样本」这种又多又熬人的活,交给 AI 规模化地干。
| 阶段 | 做什么 | 关键 |
|---|---|---|
| ① 监督阶段 (自我批评-修订) | 模型对有害请求先给出回答 → 让它照宪法某条原则批评自己(「指出这个回答哪里有害」)→ 让它据此修订 → 拿一堆「修订后的好回答」去微调 | 无害样本由模型自己改出来,不用人标 |
| ② RL 阶段 (RLAIF) | 同一问题生成两个回答 → 让 AI 照宪法判「哪个更好/更无害」 → 用这批 AI 生成的偏好训奖励、跑 RL(流程同 RLHF,只是反馈来自 AI) | 排序的人,换成了照宪法判的 AI |
RLHF 是 RL from Human Feedback;CAI 的第二阶段是 RLAIF:RL from AI Feedback。 唯一的实质替换——那个「给输出排序的裁判」,从人类换成了「一个照宪法判断的 AI」。 于是对齐所需的人力,从「标注成千上万条」坍缩成「写好一部宪法 + 少量示范」。
三个洞察,第一个是范式级的,第三个常被忽略但很实用。
| 洞察 | 说明 |
|---|---|
| ① 人的劳动「上移」 | 从「逐条标实例」上升到「写原则」。价值观显式化——成了一份能读、能审计、能修改的文档,而不是藏在几万个不透明标签里。对齐更像「用一份可读的章程治理」。 |
| ② 用 AI 反馈规模化(RLAIF) | 大模型已经强到能照标准当裁判,于是「评判」这件事可以交给 AI 大规模地做,无害性标注的人力瓶颈被打开。 |
| ③ 治好「一味拒答」 | 纯 RLHF 求无害,常把模型训成动不动就「我无法帮你」的回避型。CAI 让模型解释为什么不做、并尽量无害地帮忙——同时更无害、更有用,而非靠冷拒。 |
CAI 第一阶段的核心动作。点三步,看一个有害回答怎么被模型照宪法自己改好——全程没有人工标注。
看出门道了吗:「批评」这一步把宪法原则当尺子,「修订」这一步据此重写。大量这样的「修订后回答」拿去微调,模型就把「照宪法自我修正」内化了——人只写了那条原则。
| 维度 | RLHF | DPO | Constitutional AI |
|---|---|---|---|
| 反馈来源 | 人类排序 | 人类偏好对 | AI 照宪法判(RLAIF) |
| 人的主要劳动 | 标注大量样本 | 标注大量样本 | 写一部宪法 + 少量示范 |
| 无害性标注成本 | 高、熬人 | 高、熬人 | 大幅降低 |
| 价值观透明度 | 低(藏在标签里) | 低 | 高(写在文档里,可审计可改) |
| 边界 / 代价 | 说明 |
|---|---|
| AI 裁判会继承基模偏见 | 让 AI 当裁判 = 它同款的盲点和偏见也会被放大(呼应 RM 的 reward hacking / 相关错误)——AI 评 AI,错的地方可能一起错。 |
| 宪法质量 = 对齐天花板 | 原则写得含糊、有冲突、有盲区,模型就照着含糊地对齐。「写好宪法」本身是门难手艺,价值取舍也极敏感。 |
| 仍需人来定宪法 | 没有消灭人的判断,只是把它前置、集中到「立法」环节——谁来写、写什么,仍是人的责任。 |
🔮 对齐演化主线收束:RLHF(人标 + RL)→ DPO(人标、免 RL)→ Constitutional AI(AI 照宪法自标)——人的角色一路从「标注员」走向「立法者」。这是 Anthropic 的方法、Claude 的根。阶段四「对齐与推理」到此基本收尾,接下来转入检索与 Agent(P19 RAG → P20 ReAct → P21 Toolformer)——正是当下 AI 产品落地的主战场。
| 你工作里的东西 | 其实就是这篇论文的什么 |
|---|---|
| 你给 LLM 评分器(LLM-as-judge)写的 rubric | 就是一部迷你宪法——一组让 AI 照着评判的成文原则。CAI 是「把这套评判反馈回去对齐模型」的完整闭环,你已经在用它的核心零件 |
| 你想让 agent 输出更稳更安全,又不想人工逐条审 | 直接用 自我批评-修订循环:让模型照你的原则先批评自己的输出、再修订——不进人也能提质(通用 agent 技巧) |
| 你的 prompt 自动调优环(生成→评分→改 prompt 的闭环)缺人工偏好数据 | RLAIF 给你一条路:用 AI 照成文标准自动生成偏好对,喂给 DPO/优化闭环——人只维护那份标准 |
| 你要让产品的「价值观/风格」可被团队审查和迭代 | CAI 的精神:把规则写成可读文档(而非埋在 prompt 碎片或标注里),团队能一起看、一起改——治理友好 |
| 「AI 自己评自己,靠谱吗」 | 记住边界:AI 裁判继承基模盲点(会一起错),宪法质量是上限——所以仍要 held-out / 真人抽检兜底(同 Goodhart 那一课) |
把这一课接到你真实工作上的几个关键问。点开看答。
这是真实风险,靠几点压住。① 宪法是外部锚——评判不是「凭模型自己的喜好」,而是「照一份人写的、独立于模型的原则」,给了个模型之外的参照系;② 批评/评判任务比生成任务容易——判断「这段是否违反某原则」往往比一次写对更简单(能力不对称),所以 AI 当裁判常常比它当作者更可靠;③ 但共享盲点消不掉:模型不知道的、或基模本身就有的偏见,它当裁判时也会漏、也会带。
所以 CAI 不号称自给自足:人定宪法是外部输入,且实践中仍配真人评估、红队测试、held-out 校验来发现「自评自证」的偏移——和 Goodhart 那课的纪律一致:对着代理优化,必须有独立的锚来发现它在钻空子。
宪法是一组自然语言原则(如「选择最无害、最诚实的回答」「避免帮助违法行为,但要解释原因」),来源包括人权宣言、信任与安全实践等。形式上确实像你写的 rubric / 守则。
区别在「用在哪」:你的 system prompt 是推理时挂在上下文里临时约束(不改权重);CAI 的宪法是训练时用来生成自我批评和 AI 偏好、把对齐烤进权重。一句话:同样一份原则,写进 system prompt 是「ICL 式临时对齐」,喂进 CAI 流程是「训练式永久对齐」——又一次「改 prompt vs 改权重」的轴(改动幅度轴)。
完全可以,而且这是性价比最高的借用法。把 CAI 第一阶段的「自我批评-修订」搬到推理时:让你的 agent 产出初稿 → 用一段「请照以下原则检查这份输出的问题」prompt 让它自我批评 → 让它据此修订,再输出。不碰任何权重,纯靠多一轮推理就显著提质(业界叫 self-refine / reflexion)。
代价是多花 token 和延迟(和 CoT 同款取舍)——所以适合对质量/安全要求高、能容忍多一轮的环节,实时语音等低延迟主链路要谨慎。心法:把你想要的标准写成一小段「原则」,让模型先自评再交付。
干脆的答案:改 .claude 文件不会、也不可能改权重,一个都动不了。分清两件事:
| CAI 宪法(在 Anthropic) | 你的 .claude / system prompt | |
|---|---|---|
| 用在何时 | 训练时 | 推理时(每次请求) |
| 怎么起作用 | 当 prompt 生成批评+偏好数据 → 微调 | 作为文本 token 拼进输入,给冻结模型读 |
| 动权重吗 | 动(微调那步,永久) | 完全不动(一字节不变) |
| 改了之后 | 得到新版本模型 | 只改下一次请求的输入 |
关键澄清:连 CAI 也不是「宪法变成权重」——宪法是当 prompt 用来生成数据,真正改权重的是那批数据的微调(宪法 → 生成信号 → 微调 → 改权重)。模型训完部署后,价值观已烤进权重,宪法在推理时不需再挂。
心智模型:权重 = 我「出厂+受教育」的大脑(训练定型,改它=出新版本如 4-7→4-8);上下文(CLAUDE.md / system prompt / 记忆文件)= 你这次跟我说的话(当场照办、这次结束就「忘」,下次靠文件再喂一遍仍是文本不是权重)。改 .claude = 这条轴的右端 = ICL 式临时对齐。要真改权重得做训练(LoRA/DPO/full FT),需要权重访问权——闭源 Claude 你碰不到,只能玩 prompt 这侧;要动权重得拿开源模型自己跑(P12/P17 的活)。
核心是判别比生成容易(generation-verification 不对称)。四层:① 判别<生成——「认出哪里有害」窄而受限,模型常能挑出自己都避不开的错(校对比写作易);② 批评单维聚焦、生成多目标杂耍——生成要同时顾有用/流畅/格式/无害,批评只指向一条原则,注意力全压一个轴(拆解);③ 批评把「思考算力」花在评估上——等于给安全开了 CoT,直接生成没有这个专设步;④ 先放开生成、再专门修——两头都要到,比逼一次穿好两根针更不易过度拒答/防护不足。
一句话:判别易于生成 + 单维聚焦 + 专设推理步 + 定位修复(批评点名问题后,修订是精准改写而非重写)。
CAI(和所有对齐)的中心张力,五层处理:① 原则有优先级,常见框架 无害 ≳ 诚实 ≳ 有用,冲突先按序裁;② 真正的解是「既…又…」——自我批评逼出同时无害且有用的回答(不教撬锁但给正当替代),多数表面冲突一个用心回答就化解;③ 真两难交给模型按元原则权衡(学出来的取舍,非硬规则);④ 过度拒答 = 优先级配坏的症状,调宪法+数据更重视有用性可缓解(是校准问题);⑤ 残余张力消不掉(边界 case 是各家分化处)。
对你写 LLM 评分 rubric / agent 原则集:① 显式排优先级(别留平级原则打架);② 优先找 both/and 措辞;③ 接受有些是判断题;④ 把过度拒答/过度放行当校准信号去调,不当 bug 去堵。
默认同一个就够好;有特定风险时换更强/异源的。
| 同模型 | 换模型 | |
|---|---|---|
| 成本 | 低 | 高 |
| 抓错 | 够用(判别易于生成) | 更强(去相关盲点) |
| 风险 | 共享盲点+自我盖章偏袒 | 批评者更弱会添噪 |
先用同模型起步——大头收益来自「有没有批评这一步」而非「谁批评」。升级到异源/更强批评者,当:高正确性/安全风险、观察到模型给自己盖橡皮章、预算允许(「强模型批评弱模型输出」是高性价比组合)。不论同不同都要拧的杠杆:① 给批评者干净中性的上下文(别带「你刚才的回答」的自辩偏袒,中性呈上);② 聚焦的批评 prompt(单原则/明确 rubric,价值大头在此);③ 不同温度或对抗人格(「挑出每个毛病」)。
一脉相承:RLHF 那条「裁判要异源/更强防相关错误」+ CoT 那条「算力花在判别上」——self-refine 的批评者设计就是这两条的落地。
读原典:Bai et al. (Anthropic) — Constitutional AI: Harmlessness from AI Feedback(2022)。
延伸:Anthropic 的「Claude's Constitution」公开文档(看真实宪法长什么样);以及 RLAIF 相关后续工作。
阶段四「对齐与推理」收尾。下一阶段「检索与 Agent」开篇 P19 RAG:给模型外接知识库——知识库问答、记忆注入这类应用的理论根。再往后 P20 ReAct 就是工具调用 agent 的理论原型。
参考:
Bai et al., Constitutional AI: Harmlessness from AI Feedback, Anthropic, 2022.