← 橙研所 chengyansuo.com
Learn AI
模型硬功底 · 由内而外搞懂大模型
一个 AI 产品经理边学边公开的「模型由内而外」工程笔记——从下一个 token 的概率分布,到注意力、采样、对齐。每课自带可玩的交互与即时测验。
课程目录
第 0 课
一张地图:LLM 从「一个文件」到「一台操作系统」
第 1 课
模型只在做一件事:算下一个 token 的概率分布
第 2 课
Attention Is All You Need:为什么注意力能取代循环
第 3 课
Bahdanau Attention:attention 是从哪长出来的
第 4 课
Seq2Seq:把一个序列翻成另一个序列
第 5 课
word2vec:词 = 向量,语义 = 几何
第 6 课
BERT:把「双向」夺回来,预训练-微调成为范式
第 7 课
GPT-1:只学「接下一个词」,却顺手学会了一切
第 8 课
GPT-2:规模一上,「猜下一个词」自己长出了多任务能力
第 9 课
GPT-3:在 prompt 里给几个例子,模型就当场学会了——你 prompt 工程的理论根
第 10 课
T5:把每个任务都改写成「一段文字进、一段文字出」——你对 chat 模型用 prompt 干所有活的源头
第 11 课
Scaling Laws:大力出奇迹不是玄学,是能画成直线、能外推的幂律——你判断「该不该花这笔算力」的尺
第 12 课
Chinchilla:当年的大模型几乎全「虚胖」——同样算力,小一半但喂饱数据,反而更强还更便宜
第 13 课
LoRA:冻住整个大模型,只训旁边两片「瘦」矩阵——「人人都能微调」「一底座挂无数技能插件」的根
第 14 课
FlashAttention:attention 慢不是因为算得多,是因为大矩阵在慢显存里反复搬——长上下文与低延迟能落地的工程底
第 15 课
MoE / Switch Transformers:每个 token 只走一两个「专家」——前沿模型能又大又便宜的根
第 16 课
InstructGPT / RLHF:博学 ≠ 听话——为什么 ChatGPT 会照你说的做,也是你「prompt 控不住行为」的根
第 17 课
Chain-of-Thought:让它「一步步想」再答——给模型开草稿纸,也是推理模型(o1/R1)的根
第 18 课
DPO:RLHF 但不用 RL——把三步对齐压成一步,也是开源对齐遍地开花的根
第 19 课
Constitutional AI:写一部宪法,让 AI 自己批评自己——Claude 的对齐方法根
第 20 课
RAG:给冻结的模型外接一个可检索的知识库——你「改不了权重就改上下文」的正路
第 21 课
ReAct:想一步、做一步、看一步——AI agent 的循环骨架
第 22 课
Toolformer:模型自己学会「该在哪调工具」——function calling 的由来(全课收官)
本课线随学随更 · 配合公众号「橙研所」 Build in Public