- 阶段一 · 地基:P01《Attention Is All You Need》 · P02 Bahdanau Attention · P03 seq2seq · P04 word2vec
- 阶段二 · 预训练范式:P05 BERT · P06 GPT-1 · P07 GPT-2 · P08 GPT-3 · P09 T5
- 阶段三 · 规模与效率:P10 Scaling Laws · P11 Chinchilla · 本篇 · P12 LoRA · P13 FlashAttention · P14 MoE
- 阶段四 · 对齐与推理:P15 InstructGPT(RLHF)· P16 思维链 CoT · P17 DPO · P18 Constitutional AI
- 阶段五 · 检索与 Agent:P19 RAG · P20 ReAct · P21 Toolformer
太长不读2022 年初,大模型的军备竞赛只卷一个数:参数量。GPT-3 1750 亿、Jurassic 1780 亿、Gopher 2800 亿、MT-NLG 5300 亿——而它们的训练数据出奇一致,全在 3000 亿 token 上下。这个行规的源头,正是上一篇讲的 Kaplan 定律:算力翻 10 倍,模型放大 5.5 倍,数据只加 1.8 倍。DeepMind 重做了这套实验——400 多个模型、三种彼此独立的算法——三条路指向同一个答案:Kaplan 把数据项算少了,参数和数据应该一比一等比放大,换算下来大约每个参数配 20 个 token。照新账本,GPT-3 该喂 4.2 万亿 token 而不是 3000 亿;市面上所有大模型都「过大而欠训」。为了证明这不是纸上谈兵,他们用训练 Gopher 的同一笔算力,训了一个 700 亿参数、吃 1.4 万亿 token 的模型,起名 Chinchilla(栗鼠,一种比 Gopher——囊地鼠——还小的动物,命名本身就是宣言):语言建模全线胜出,MMLU 考出 67.6%,不但比 Gopher 高 7.6 个百分点,还超过了当时专家预测 2023 年 6 月才能达到的水平。而且它小 4 倍,推理和微调也便宜 4 倍。从此,「大力出奇迹」的说明书被改写成:大力,但要喂饱。
上篇回顾 · 先答一题上一篇 Scaling Laws 讲完,「变大」成了可计算的科学。先别往下翻,试着答:Kaplan 配方说,突然给你 10 倍算力,模型和数据各放大多少?……答案:模型放大约 5.5 倍,数据只加约 1.8 倍——钱几乎全砸给参数,「大模型、早停」。GPT-3 每个参数摊不到 2 个 token,就是这份配方的实盘。但上一篇结尾我们埋了一句:这份配方的数据项算少了。今天就讲清楚——它错在哪、怎么被发现、以及改对之后发生了什么。这可能是整个系列里「科学自我修正」最教科书式的一集:不是推翻定律,而是把定律里的一个系数拧准。
012022 年初的行规:参数越卷越大,数据却人人停在 3000 亿
先看问题出在哪。GPT-3 成功之后的两年,是参数排行榜最热闹的两年:OpenAI 的 GPT-3 站上 1750 亿,以色列 AI21 的 Jurassic 微调到 1780 亿,DeepMind 的 Gopher 冲到 2800 亿,微软和英伟达合作的 MT-NLG 干脆做到 5300 亿。头条一个比一个大,但如果你把这些模型的训练数据量列在一起,会看到一幅奇怪的画面:3000 亿、3000 亿、3000 亿、2700 亿——参数翻了三倍,数据纹丝不动。
这不是巧合,是集体抄作业。作业的原件就是上一篇讲的 Kaplan 定律:算力预算翻 10 倍时,模型该放大 5.5 倍,训练数据只需加 1.8 倍——增长的钱应该几乎全部花在「变大」上。GPT-3 照此下注、一把成功之后,「1750 亿参数、3000 亿 token」就成了业内的参考答案:后来者把参数往上加,数据照抄。论文开篇把这个现象钉在了一张表里(Table 1):五个当时最大的稠密模型,训练 token 量清一色 3000 亿上下。
DeepMind 这篇论文要回答的问题,和 Kaplan 一模一样:给定一笔固定的算力预算,模型多大、数据多少,才最划算? 不同的是,他们怀疑两年来全行业遵奉的那个答案是错的。这个怀疑值多少钱?训练一次 Gopher 量级的模型,算力开销以千万美元计。如果配方错了,那不是某一家的失误——是所有前沿实验室在用同一本错账花钱。
02疑点:Kaplan 的账本,有两道裂缝
科学上推翻一个结论,先要说清楚它当初为什么会算错。论文在相关工作一节给出了诊断,两道裂缝都不玄,说穿了甚至有点朴素。
裂缝一:学习率的日程表没配对。训练神经网络时有个关键旋钮叫学习率(learning rate,每一步参数修正的步幅),通行做法是让它按「余弦日程」从大到小慢慢衰减——好比长跑配速,起跑快、冲线前收。日程表的总长度,应该正好等于这次训练的总长度。而 Kaplan 的实验为了省事,给所有模型配了同一张固定长度的日程表(对应约 1300 亿 token),不管这一趟实际要训多久。后果是:凡是训练长度和日程表不匹配的场次,中途读出来的 loss 都偏高——用长跑的话说,按全马配速跑十公里,成绩当然难看。论文实测:这一项误差会系统性低估「多喂数据」的收益。Kaplan 定律里数据那一项的系数算小了,根子就在这张日程表上。
裂缝二:用小学生的成绩单,外推了大学生。Kaplan 的 400 多个模型里,绝大多数不到 1 亿参数(论文原话:majority less than 100M)。用一批小模型拟合出幂律,再把直线延长一千倍去指导 1750 亿参数的训练——上一篇我们夸过这种外推的胆量,但胆量不等于保票。DeepMind 观察到:幂律在大算力端其实有轻微的弯曲,小模型区间看不出来,一外推就放大成系统性偏差,方向恰恰是——把最优模型算得太大。
两道裂缝指向同一个结论:数据被低估了。到底低估多少,得重新做实验才知道。DeepMind 的做法延续了这个系列反复出现的路数——不争论,加钱重测。
03重审:400 多个模型,三条互相独立的路
这次重测的规模:400 多个模型,参数从 7000 万铺到 160 亿,训练数据从 50 亿铺到 4000 多亿 token——注意和 Kaplan 的差别,这批模型的主力就在「亿级到百亿级」这个真实作战区间,不再靠小模型远距离外推。每个模型的学习率日程也逐一配对训练长度,把裂缝一堵死。
更讲究的是方法论:同一批数据,他们用三种彼此独立的算法各算了一遍最优配比。第一条路「固定模型、扫训练长度」:给每档大小的模型训四种不同时长,把所有训练曲线叠在一起,描出「每一档算力下最低的 loss」这条包络线。第二条路「固定算力、扫模型大小」(论文叫 IsoFLOP,iso 是「等」的意思,等算力曲线):把算力预算钉死,从小到大换不同尺寸的模型跑,画出一条 U 形谷——模型太小浪费容量,太大吃不饱数据,谷底就是这笔预算的最优大小(就是上图那族碗状曲线)。第三条路最抽象:直接给 loss 拟合一个关于「参数 N + 数据 D」的解析式,再在预算约束下求最小值。
三条路,三套拟合,三个独立的答案。这个设计的用意,做过实验的人都懂:一条路得出的结论可能是方法的偶然,三条独立的路撞出同一个数,才叫证据。撞出来的数是什么?往下看。
04判决:参数和数据五五开,每个参数配 20 个 token
用幂律的语言说:设最优参数量随算力的 a 次方增长、最优数据量随算力的 b 次方增长。Kaplan 的答案是 a=0.73、b=0.27——七三开,钱优先给参数。DeepMind 三条路各自算出的 a 是 0.50、0.49、0.46,b 是 0.50、0.51、0.54——五五开,误差不过零点零几。翻译成人话:算力翻 10 倍,模型和数据各放大约 3.2 倍(√10);算力翻 100 倍,各放大 10 倍。参数和数据,从此平起平坐。
五五开还有一个更好记的推论。照新配方换算,各档算力下的最优搭配全都落在同一个比例附近:每个参数配大约 20 个 token(论文 Table 3 的预测:10 亿参数配 202 亿 token、670 亿参数配 1.5 万亿 token——除一下,都是 20 上下)。这个「20 比 1」后来成了业内人人会背的经验值。拿它当尺子一量,2022 年的排行榜全线尴尬:GPT-3 每个参数只摊到约 1.7 个 token,Gopher 只有约 1.1 个——论文直接点名:照新账本,1750 亿参数的 GPT-3 该喂 4.2 万亿 token(实际 3000 亿),2800 亿的 Gopher 该喂 6.8 万亿(实际也是 3000 亿)。一句话:市面上所有大模型都严重欠训练——它们不是太笨,是没吃饱。
上面那张图(Figure 1)把这场判决画得很直观:三条实线是 DeepMind 三种方法的预测,几乎重合;那条明显更陡的虚线是 Kaplan 的旧配方;而 GPT-3、Gopher、MT-NLG 这些明星模型的星标,齐刷刷落在虚线一侧——整个行业都站在错的那条线上。论文还顺手给未来算了账:除非你手里的算力超过训练 Gopher 的 250 倍(10²⁶ FLOPs),否则万亿参数模型就不该是你的选项——这盆冷水,泼向的正是当时人人都在画的「万亿大饼」。
05对赌与放榜:同一笔算力,70B 把 280B 打得没有还手之力
算出新账本只是纸面推演,这篇论文真正的杀手锏是拿真金白银验了一次货。实验设计干净得像教科书:拿出和训练 Gopher 完全相同的算力预算(5.76×10²³ FLOPs),按新账本重新分配——模型从 2800 亿缩到 700 亿(新配方预测这笔预算的最优大小在 400 亿到 700 亿之间,他们取了上端),省下的算力全部换成数据:1.4 万亿 token,正好是 Gopher 的 4 倍多,也正好落在「每参数 20 token」上。数据集、训练框架都沿用 Gopher(细节上换了 AdamW 优化器、微调了分词器和数据配比),层数保持 80 层不变,把宽度从 16384 砍到 8192、注意力头从 128 减到 64。唯一的实质变量,就是大小与数据的配比。模型起名 Chinchilla——南美栗鼠,一种比 Gopher(囊地鼠)小得多的动物。名字即论点:小的那个会赢。
放榜结果是单方面的。语言建模:在 The Pile 测试集的每一个子领域上,Chinchilla 都压过 Gopher,无一例外;Wikitext103 困惑度 7.16 对 Gopher 的 7.75(论文同时诚实提醒:Chinchilla 数据多 4 倍,测试集内容撞进训练集的风险也更高,这类分数要留个心眼)。真正的重头戏是 MMLU——57 门学科的综合大考(上图那张成绩单):Chinchilla 考出 67.6%,比 Gopher 高出 7.6 个百分点;要知道,就在论文发表前,领域专家们对「2023 年 6 月最先进模型」的预测中位数也只有 63.4%——Chinchilla 提前一年多越过了专家们的预言线,还在其中 4 门学科(美国政府与政治、国际法、社会学、美国外交政策)上考过了 90%。阅读理解 RACE-m 从 Gopher 的 75.1 跳到 86.8;常识与推理合集 BIG-bench 平均 65.1% 对 54.4%;连「不说车轱辘假话」的 TruthfulQA 也全面上涨。57 门 MMLU 里 Chinchilla 只在 4 门上输给 Gopher,62 项 BIG-bench 里也只输 4 项。
而这场胜利最狠的部分在赛后:Chinchilla 小 4 倍,意味着推理(每次回答问题的开销)和下游微调也便宜约 4 倍。同样的训练预算,换来一个更强、还更便宜的模型——赢两次。压倒性的证据面前,行业几乎立刻改口:此后你再没见过「参数翻倍、数据照抄」的发布,人人开始报自己的 token 数。
06后日谈:这本新账,后来又被翻过两次
按这个系列的惯例,讲讲定律后来的命运。Chinchilla 的账本统治了行业叙事,但它自己也没能免于被重算——而且是两次,两个方向。
第一次翻账:Llama 公然「过度喂食」。Chinchilla 优化的目标是训练算力:给定训练预算,怎么配最省。但模型训完是要上线服务的——每天回答几亿次问题,推理开销日积月累,很快超过训练那一次性投入。对部署者来说,更划算的是把小模型往死里喂:训练时多花的钱,用推理时省下的钱慢慢赚回来。2023 年起 Meta 的 Llama 系列把这条路走到极致——Llama 1 就喂到约每参数 142 个 token,到 Llama 3 的 80 亿参数版干脆喂了约 15 万亿 token,折合每参数近 1900 个,是 Chinchilla 配方的近百倍。社区管这个叫走出「Chinchilla 陷阱」:20 比 1 只是「训练最省」的答案,不是「用起来最省」的答案。注意,这不是说 Chinchilla 算错了——是优化目标换了,账就得重算。
第二次翻账:连修正者也被修正。2024 年,研究机构 Epoch AI 试图复现这篇论文,发现第三条路(参数化拟合)的数值有 bug——按论文报告的参数,那条路隐含的结论其实接近「每参数 70 token」,和自家另外两条路都对不上;修正拟合后,答案回落到 20 上下,和前两条路重新对齐。有惊无险,但这个插曲本身很有教育意义:Chinchilla 修正了 Kaplan,Epoch 又修正了 Chinchilla——科学不是谁一锤定音,是允许每一本账都被后人重新翻开。
还有一笔账,是 Chinchilla 留给整个行业的焦虑。看上图 Table 3 的最后几行:万亿参数模型,最优搭配要 21.2 万亿 token;10 万亿参数,要 216 万亿。论文在讨论一节把话挑明:照等比放大走下去,瓶颈很快不是算力,而是高质量数据本身——互联网上够格的文本是有限的,「更大、更高质量的数据集,将在语言模型的下一轮 scaling 里扮演关键角色」(论文原话大意)。今天 AI 圈天天讨论的「数据墙」「合成数据」,源头就在这几行预测里。上一篇 Kaplan 算出了定律的失效点,这一篇 Chinchilla 算出了数据的账单——阶段三的两篇连着读,你会发现规模时代的每一步,都是先算账、后花钱。
✎读完自测:先别往下翻,试着答
主动回忆一遍才记得住。三问,想好再看答案:
- 1. Kaplan 配方和 Chinchilla 配方,10 倍算力各怎么花?错账的根源是什么?
- 2. Chinchilla 的对赌实验里,唯一的实质变量是什么?赌赢的证据挑一个最硬的说。
- 3. 「每参数 20 token」后来被 Llama 系列大幅突破了——这说明 Chinchilla 错了吗?
答案1. Kaplan:模型 5.5 倍、数据 1.8 倍(七三开);Chinchilla:各约 3.2 倍(五五开、等比放大)。错账根源主要是固定长度的学习率日程系统性低估了多喂数据的收益,加上用不到 1 亿参数的小模型外推了千倍规模。2. 唯一实质变量是「大小与数据的配比」:同一笔算力(5.76×10²³ FLOPs)、同源数据集,700 亿参数×1.4 万亿 token 对 2800 亿×3000 亿;最硬的证据是 MMLU 67.6%——不但比 Gopher 高 7.6 个百分点,还提前一年多越过了专家对 2023 年 6 月的预测中位数 63.4%。3. 不是。Chinchilla 优化的是训练算力,Llama 优化的是「训练 + 海量推理」的总账——优化目标变了,最优解自然变;20 比 1 在它自己的问题定义下,至今站得住。
→一句话带走,和下一步
只记一句:DeepMind 用 400 多个模型、三条互相独立的算法证明 Kaplan 配方把数据算少了——参数和数据该等比放大、约每参数 20 个 token;然后用与 Gopher 完全相同的算力训出 4 倍数据、1/4 大小的 Chinchilla,全面击败自家 280B 大哥,顺手把「大模型欠训练」「数据将成瓶颈」两个判断钉进了行业——从此大力出奇迹的说明书上多了一行:大力,但要喂饱。
启后:训练的账算明白了,但另一笔账还没人管:模型训好之后,普通团队想让它学会自己的任务,按老办法要把几百亿参数全部重训一遍——微调一次的开销,小玩家根本掏不起。2021 年微软的一篇论文给出了四两拨千斤的答案:冻住全部参数,只训万分之一的「补丁」,效果几乎不掉。下一篇 P12《LoRA》,讲大模型如何走进寻常百姓家。
想再深入一点荐读一个最优源:Epoch AI 的《Chinchilla scaling: a replication attempt》(epochai.org,免费公开)——既是对本篇论文最严格的一次复核,也把「20 token 经验值」的适用边界讲得最清楚。原论文:arXiv 2203.15556;关键前作:Kaplan et al. 2020(arXiv 2001.08361,上一篇的主角);实践参照:Llama 3 技术报告(arXiv 2407.21783,「过度喂食」路线的实盘)。/ 互动钩子:Chinchilla 说训练要省着算,Llama 说部署要多喂——如果明天你有一笔固定预算训自己的模型,你会站哪边?欢迎评论区聊聊。