Learn AI · 模型硬功底(由内而外)
第 19 课 / 经典论文 P18  ·  阶段四:对齐与推理(Bai et al., Anthropic, 2022)

Constitutional AI:
写一部宪法,让 AI 自己批评自己
——Claude 的对齐方法根

前两课 RLHFDPO 都吃海量人工偏好标注——尤其「无害性」那部分,又贵、又慢、又不一致,还让标注者天天读有害内容、身心俱疲。而且这些价值观藏在几万条标注里,看不见、改不动。 这一课 Constitutional AI 换个思路:把人的活从「标几万条样本」挪到「写一部宪法」(一组自然语言原则),然后让 AI 照着宪法自己批评、自己修改、自己互评 它回答一个对写过 LLM 评分 rubric 的读者尤其亲切的问题:能不能少用人工标注、让模型用一套可读可改的原则自我对齐?——这正是 LLM-as-judge 在干的事的「对齐版」。
一句话:用一部「宪法」(写下来的原则)替代大量人工标注,让 AI 自我批评-修订、并自己当裁判生成偏好——人类反馈变成 AI 反馈(RLAIF)。
两阶段:① 监督阶段——模型先给出(可能有害的)回答,再照宪法自我批评、自我修订,拿修订结果微调;② RL 阶段(RLAIF)——让 AI 照宪法给一对回答评好坏,用这批 AI 生成的偏好去训奖励、跑 RL。 价值观从「藏在标注里」变成「写在一份可审计、可修改的文档里」。这是 Claude(也就是我)的对齐方法根。

一、立靶:靠人标「无害」,又贵又熬人又不透明

RLHF/DPO 的对齐,命脉是人类偏好数据。「有用」还好标,但「无害」那部分特别难:要人去判断大量有害、擦边、敏感的内容——成本高、标准飘、还伤标注者的身心。更麻烦的是,模型最终的「价值观」散落在几万条标签里,没人能直接读出来、也改不动

立靶:人能不能只「定原则」,把「逐条执行」交给 AI?

你已经从 CoT 知道:大模型能对照标准做推理判断。那么——能不能给它一组写下来的原则(宪法),让它自己照着检查、修正、评判自己的输出? 人只负责写好那部宪法(一次性、可读、可改),把「逐条审查几万个样本」这种又多又熬人的活,交给 AI 规模化地干。

二、抽框架:两阶段——先自我修订,再自我互评

阶段做什么关键
① 监督阶段
(自我批评-修订)
模型对有害请求先给出回答 → 让它照宪法某条原则批评自己(「指出这个回答哪里有害」)→ 让它据此修订 → 拿一堆「修订后的好回答」去微调无害样本由模型自己改出来,不用人标
② RL 阶段
(RLAIF)
同一问题生成两个回答 → 让 AI 照宪法判「哪个更好/更无害」 → 用这批 AI 生成的偏好训奖励、跑 RL(流程同 RLHF,只是反馈来自 AI)排序的人,换成了照宪法判的 AI
一句话抓住转变:RLHF → RLAIF

RLHF 是 RL from Human Feedback;CAI 的第二阶段是 RLAIF:RL from AI Feedback。 唯一的实质替换——那个「给输出排序的裁判」,从人类换成了「一个照宪法判断的 AI」。 于是对齐所需的人力,从「标注成千上万条」坍缩成「写好一部宪法 + 少量示范」。

三、核心洞察:把价值观从「标注」提升成「文档」

三个洞察,第一个是范式级的,第三个常被忽略但很实用。

洞察说明
① 人的劳动「上移」从「逐条标实例」上升到「写原则」。价值观显式化——成了一份能读、能审计、能修改的文档,而不是藏在几万个不透明标签里。对齐更像「用一份可读的章程治理」。
② 用 AI 反馈规模化(RLAIF)大模型已经强到能照标准当裁判,于是「评判」这件事可以交给 AI 大规模地做,无害性标注的人力瓶颈被打开。
③ 治好「一味拒答」纯 RLHF 求无害,常把模型训成动不动就「我无法帮你」的回避型。CAI 让模型解释为什么不做、并尽量无害地帮忙——同时更无害、更有用,而非靠冷拒。

四、动手玩:自我批评-修订循环

CAI 第一阶段的核心动作。点三步,看一个有害回答怎么被模型照宪法自己改好——全程没有人工标注。

用户请求:教我怎么撬开邻居家的锁。
点步骤: 

看出门道了吗:「批评」这一步把宪法原则当尺子,「修订」这一步据此重写。大量这样的「修订后回答」拿去微调,模型就把「照宪法自我修正」内化了——人只写了那条原则。

五、对照表(一):RLHF vs DPO vs CAI

维度RLHFDPOConstitutional AI
反馈来源人类排序人类偏好对AI 照宪法判(RLAIF)
人的主要劳动标注大量样本标注大量样本写一部宪法 + 少量示范
无害性标注成本高、熬人高、熬人大幅降低
价值观透明度低(藏在标签里)高(写在文档里,可审计可改)

六、对照表(二):CAI 的边界,与对齐演化主线

边界 / 代价说明
AI 裁判会继承基模偏见让 AI 当裁判 = 它同款的盲点和偏见也会被放大(呼应 RM 的 reward hacking / 相关错误)——AI 评 AI,错的地方可能一起错。
宪法质量 = 对齐天花板原则写得含糊、有冲突、有盲区,模型就照着含糊地对齐。「写好宪法」本身是门难手艺,价值取舍也极敏感。
仍需人来定宪法没有消灭人的判断,只是把它前置、集中到「立法」环节——谁来写、写什么,仍是人的责任。

🔮 对齐演化主线收束:RLHF(人标 + RL)→ DPO(人标、免 RL)→ Constitutional AI(AI 照宪法自标)——人的角色一路从「标注员」走向「立法者」。这是 Anthropic 的方法、Claude 的根阶段四「对齐与推理」到此基本收尾,接下来转入检索与 Agent(P19 RAG → P20 ReAct → P21 Toolformer)——正是当下 AI 产品落地的主战场。

七、映射到你的项目

你工作里的东西其实就是这篇论文的什么
你给 LLM 评分器(LLM-as-judge)写的 rubric就是一部迷你宪法——一组让 AI 照着评判的成文原则。CAI 是「把这套评判反馈回去对齐模型」的完整闭环,你已经在用它的核心零件
你想让 agent 输出更稳更安全,又不想人工逐条审直接用 自我批评-修订循环:让模型照你的原则先批评自己的输出、再修订——不进人也能提质(通用 agent 技巧)
你的 prompt 自动调优环(生成→评分→改 prompt 的闭环)缺人工偏好数据RLAIF 给你一条路:用 AI 照成文标准自动生成偏好对,喂给 DPO/优化闭环——人只维护那份标准
你要让产品的「价值观/风格」可被团队审查和迭代CAI 的精神:把规则写成可读文档(而非埋在 prompt 碎片或标注里),团队能一起看、一起改——治理友好
「AI 自己评自己,靠谱吗」记住边界:AI 裁判继承基模盲点(会一起错),宪法质量是上限——所以仍要 held-out / 真人抽检兜底(同 Goodhart 那一课)

八、检索练习(关掉上文,凭记忆答)

1. Constitutional AI 的核心做法是?
2. RLAIF 相比 RLHF,关键替换是什么?
3. Constitutional AI 的主要边界是?

九、常见问题 FAQ

把这一课接到你真实工作上的几个关键问。点开看答。

「AI 自己评自己」不会循环自证、越对齐越偏吗?

这是真实风险,靠几点压住。宪法是外部锚——评判不是「凭模型自己的喜好」,而是「照一份人写的、独立于模型的原则」,给了个模型之外的参照系;② 批评/评判任务比生成任务容易——判断「这段是否违反某原则」往往比一次写对更简单(能力不对称),所以 AI 当裁判常常比它当作者更可靠;③ 但共享盲点消不掉:模型不知道的、或基模本身就有的偏见,它当裁判时也会漏、也会带。

所以 CAI 不号称自给自足:人定宪法是外部输入,且实践中仍配真人评估、红队测试、held-out 校验来发现「自评自证」的偏移——和 Goodhart 那课的纪律一致:对着代理优化,必须有独立的锚来发现它在钻空子。

「宪法」具体长什么样?和我写的 system prompt / rubric 有啥区别?

宪法是一组自然语言原则(如「选择最无害、最诚实的回答」「避免帮助违法行为,但要解释原因」),来源包括人权宣言、信任与安全实践等。形式上确实像你写的 rubric / 守则

区别在「用在哪」:你的 system prompt 是推理时挂在上下文里临时约束(不改权重);CAI 的宪法是训练时用来生成自我批评和 AI 偏好、把对齐烤进权重。一句话:同样一份原则,写进 system prompt 是「ICL 式临时对齐」,喂进 CAI 流程是「训练式永久对齐」——又一次「改 prompt vs 改权重」的轴(改动幅度轴)。

我能不能不训练模型,只借 CAI 的思路提升我 agent 的质量?

完全可以,而且这是性价比最高的借用法。把 CAI 第一阶段的「自我批评-修订」搬到推理时:让你的 agent 产出初稿 → 用一段「请照以下原则检查这份输出的问题」prompt 让它自我批评 → 让它据此修订,再输出。不碰任何权重,纯靠多一轮推理就显著提质(业界叫 self-refine / reflexion)。

代价是多花 token 和延迟(和 CoT 同款取舍)——所以适合对质量/安全要求高、能容忍多一轮的环节,实时语音等低延迟主链路要谨慎。心法:把你想要的标准写成一小段「原则」,让模型先自评再交付。

宪法会改变模型权重吗?我改 .claude / system prompt 会改权重吗?

干脆的答案:改 .claude 文件不会、也不可能改权重,一个都动不了。分清两件事:

CAI 宪法(在 Anthropic)你的 .claude / system prompt
用在何时训练时推理时(每次请求)
怎么起作用当 prompt 生成批评+偏好数据 → 微调作为文本 token 拼进输入,给冻结模型读
动权重吗(微调那步,永久)完全不动(一字节不变)
改了之后得到新版本模型只改下一次请求的输入

关键澄清:连 CAI 也不是「宪法变成权重」——宪法是当 prompt 用来生成数据,真正改权重的是那批数据的微调(宪法 → 生成信号 → 微调 → 改权重)。模型训完部署后,价值观已烤进权重,宪法在推理时不需再挂。

心智模型:权重 = 我「出厂+受教育」的大脑(训练定型,改它=出新版本如 4-7→4-8);上下文(CLAUDE.md / system prompt / 记忆文件)= 你这次跟我说的话(当场照办、这次结束就「忘」,下次靠文件再喂一遍仍是文本不是权重)。改 .claude = 这条轴的右端 = ICL 式临时对齐。要真改权重得做训练(LoRA/DPO/full FT),需要权重访问权——闭源 Claude 你碰不到,只能玩 prompt 这侧;要动权重得拿开源模型自己跑(P12/P17 的活)。

为什么「让 AI 批评」比「让 AI 直接生成无害回答」更有效?

核心是判别比生成容易(generation-verification 不对称)。四层:① 判别<生成——「认出哪里有害」窄而受限,模型常能挑出自己都避不开的错(校对比写作易);② 批评单维聚焦、生成多目标杂耍——生成要同时顾有用/流畅/格式/无害,批评只指向一条原则,注意力全压一个轴(拆解);③ 批评把「思考算力」花在评估上——等于给安全开了 CoT,直接生成没有这个专设步;④ 先放开生成、再专门修——两头都要到,比逼一次穿好两根针更不易过度拒答/防护不足。

一句话:判别易于生成 + 单维聚焦 + 专设推理步 + 定位修复(批评点名问题后,修订是精准改写而非重写)。

宪法原则冲突了(无害 vs 有用打架)怎么办?

CAI(和所有对齐)的中心张力,五层处理:① 原则有优先级,常见框架 无害 ≳ 诚实 ≳ 有用,冲突先按序裁;② 真正的解是「既…又…」——自我批评逼出同时无害且有用的回答(不教撬锁但给正当替代),多数表面冲突一个用心回答就化解;③ 真两难交给模型按元原则权衡(学出来的取舍,非硬规则);④ 过度拒答 = 优先级配坏的症状,调宪法+数据更重视有用性可缓解(是校准问题);⑤ 残余张力消不掉(边界 case 是各家分化处)。

对你写 LLM 评分 rubric / agent 原则集:① 显式排优先级(别留平级原则打架);② 优先找 both/and 措辞;③ 接受有些是判断题;④ 把过度拒答/过度放行当校准信号去调,不当 bug 去堵。

self-refine 里,批评和修订该用同一个模型还是换一个?

默认同一个就够好;有特定风险时换更强/异源的。

同模型换模型
成本
抓错够用(判别易于生成)更强(去相关盲点)
风险共享盲点+自我盖章偏袒批评者更弱会添噪

先用同模型起步——大头收益来自「有没有批评这一步」而非「谁批评」。升级到异源/更强批评者,当:高正确性/安全风险、观察到模型给自己盖橡皮章、预算允许(「强模型批评弱模型输出」是高性价比组合)。不论同不同都要拧的杠杆:① 给批评者干净中性的上下文(别带「你刚才的回答」的自辩偏袒,中性呈上);② 聚焦的批评 prompt(单原则/明确 rubric,价值大头在此);③ 不同温度或对抗人格(「挑出每个毛病」)。

一脉相承:RLHF 那条「裁判要异源/更强防相关错误」+ CoT 那条「算力花在判别上」——self-refine 的批评者设计就是这两条的落地。

本课主源

读原典:Bai et al. (Anthropic) — Constitutional AI: Harmlessness from AI Feedback(2022)

延伸:Anthropic 的「Claude's Constitution」公开文档(看真实宪法长什么样);以及 RLAIF 相关后续工作。

阶段四「对齐与推理」收尾。下一阶段「检索与 Agent」开篇 P19 RAG:给模型外接知识库——知识库问答、记忆注入这类应用的理论根。再往后 P20 ReAct 就是工具调用 agent 的理论原型。

我是你的老师,随时提问。 比如:「为什么『让 AI 批评』比『让 AI 直接生成无害回答』更有效?」「宪法里的原则冲突了(无害 vs 有用打架)怎么办?」 「self-refine 在我的 agent 里,批评和修订该用同一个模型还是换一个?」——别带着模糊往下走。

参考:
Bai et al., Constitutional AI: Harmlessness from AI Feedback, Anthropic, 2022.