← 橙研所 chengyansuo.com
Learn AI

模型硬功底 · 由内而外搞懂大模型

一个 AI 产品经理边学边公开的「模型由内而外」工程笔记——从下一个 token 的概率分布,到注意力、采样、对齐。每课自带可玩的交互与即时测验。

课程目录

第 0 课一张地图:LLM 从「一个文件」到「一台操作系统」 第 1 课模型只在做一件事:算下一个 token 的概率分布 第 2 课Attention Is All You Need:为什么注意力能取代循环 第 3 课Bahdanau Attention:attention 是从哪长出来的 第 4 课Seq2Seq:把一个序列翻成另一个序列 第 5 课word2vec:词 = 向量,语义 = 几何 第 6 课BERT:把「双向」夺回来,预训练-微调成为范式 第 7 课GPT-1:只学「接下一个词」,却顺手学会了一切 第 8 课GPT-2:规模一上,「猜下一个词」自己长出了多任务能力 第 9 课GPT-3:在 prompt 里给几个例子,模型就当场学会了——你 prompt 工程的理论根 第 10 课T5:把每个任务都改写成「一段文字进、一段文字出」——你对 chat 模型用 prompt 干所有活的源头 第 11 课Scaling Laws:大力出奇迹不是玄学,是能画成直线、能外推的幂律——你判断「该不该花这笔算力」的尺 第 12 课Chinchilla:当年的大模型几乎全「虚胖」——同样算力,小一半但喂饱数据,反而更强还更便宜 第 13 课LoRA:冻住整个大模型,只训旁边两片「瘦」矩阵——「人人都能微调」「一底座挂无数技能插件」的根 第 14 课FlashAttention:attention 慢不是因为算得多,是因为大矩阵在慢显存里反复搬——长上下文与低延迟能落地的工程底 第 15 课MoE / Switch Transformers:每个 token 只走一两个「专家」——前沿模型能又大又便宜的根 第 16 课InstructGPT / RLHF:博学 ≠ 听话——为什么 ChatGPT 会照你说的做,也是你「prompt 控不住行为」的根 第 17 课Chain-of-Thought:让它「一步步想」再答——给模型开草稿纸,也是推理模型(o1/R1)的根 第 18 课DPO:RLHF 但不用 RL——把三步对齐压成一步,也是开源对齐遍地开花的根 第 19 课Constitutional AI:写一部宪法,让 AI 自己批评自己——Claude 的对齐方法根 第 20 课RAG:给冻结的模型外接一个可检索的知识库——你「改不了权重就改上下文」的正路 第 21 课ReAct:想一步、做一步、看一步——AI agent 的循环骨架 第 22 课Toolformer:模型自己学会「该在哪调工具」——function calling 的由来(全课收官)

本课线随学随更 · 配合公众号「橙研所」 Build in Public