本文作者:meng shao(@shao__meng)。版权归作者所有,未经授权禁止转载。


Build a Reasoning Model (From Scratch) with Sebastian Raschka https://www.youtube.com/watch?v=XBU-5modiqI

主持人​:Sophia Yang @@sophiamyang(AI Book Club,曾在 Mistral 工作,读书会停办两年后复办)

嘉宾​:Sebastian Raschka @rasbt(《Build a Large Language Model (From Scratch)》,新书《Build a Reasoning Model (From Scratch)》作者)

时长​:约 69 分钟,2026 年 9 月 9 日上传,形式为读书会直播访谈 + 社区实时提问

访谈核心内容

1. 什么是“推理模型”?(新书主线)

Sebastian 开宗明义地祛魅:​"reasoning"(推理)本质上只是行业术语​,并不代表模型像人脑一样思考——LLM 的工作机制和人类大脑完全不同。所谓推理模型,就是会生成中间步骤(chain of thought,思维链)的模型​:同一个问题,普通模型可能输出 100 个 token,推理模型会输出 2000 个 token 来解释得出答案的过程。

新书《Build a Reasoning Model (From Scratch)》是他的前作《Build a Large Language Model (From Scratch》的续篇(也可独立阅读):前作讲架构、预训练和监督微调,这本基于一个预训练模型(书中用 Qwen3 0.6B​,因为笔记本就能跑),讲解两大类方法:

  • 推理时扩展(inference scaling)​:不改模型权重,靠提示词(“请一步步解释”)、自我精炼(self-refinement)、多数投票等技巧提升效果;
  • RLVR(Reinforcement Learning with Verifiable Rewards,可验证奖励的强化学习)​:用数学计算器 API 或代码编译器等客观验证器判断答案对错(对给 1、错给 0),让模型自己学会生成有用的中间推理过程。

他用了一个很贴切的类比:大学生考数学不会全在脑子里算,会在草稿纸上写中间步骤——草稿纸又乱又可能有错、不会交上去,但它帮你到达正确答案。思维链就是模型的草稿纸。

2. 循环 Transformer 与 OpenAI Astra “隐藏思维链”传闻

访谈前一天 The Information 报道称 OpenAI 新模型 Astra 基于循环深度(recurrent-depth / looped)Transformer​,并担忧这会让思维链变得“人类无法阅读”。Sebastian 当天刚好做了视频专门反驳这个说法。

循环 Transformer 的原理:同一个 22 层的 Transformer 层堆叠权重共享地过两遍​,效果近似一个 44 层的模型,但参数量仍是 30 亿而非翻倍——本质上是用更多计算换取更高质量的 token​,可以追溯到 Universal Transformer 和近期的 mixture-of-recursions(让每个 token 动态决定经过多少层)等工作。

他的反驳逻辑很清晰:这就像 OpenAI 自家的三个不同大小的模型(Luna、Terra、Sol)——没人抱怨大模型 Sol 比 Luna 更难理解​。大模型解决同一任务需要的 token 更少,循环 Transformer 同理:答案从 4000 token 变成 3000 token,不是“隐藏了推理”,是不需要犯那么多错、走那么多回头路​。就像数学专家考试只用半页草稿,而没准备的学生用两页还到处涂改——专家不是在隐藏思考,只是不需要绕路。

他同时泼了冷水:这是一个有趣的架构改进,但不是根本性突破​。

3. 蒸馏的伦理边界与“挖掘隐藏思维链”

有人问到近期从闭源模型中“提取被隐藏的推理轨迹”的研究。他的立场划分得很细:

  • 公开输出的内容​:模型给你看了答案,你用它学习、甚至训练自己的模型——他认为完全正当(尽管违反部分厂商的服务条款,属于灰色地带,但“你没有入侵系统获取未公开的信息”);
  • 刻意隐藏的内容​:通过技巧绕过隐藏机制去挖出推理轨迹,“更进了一步”,他不愿深究;
  • 更实际的建议​:Kimi、新版 DeepSeek、GLM 5.3 这些开源/开放权重模型本来就公开全部推理轨迹,直接用它们蒸馏即可,不必碰灰色地带。

4. 硬蒸馏 vs 软蒸馏:他做了独家分析

这是访谈中信息密度最高的部分,他展示了尚未公开发布的幻灯片。蒸馏可按两个维度分为四类:

| | 含义 |
|---|---|
| **硬蒸馏** | 只用模型输出的文本作为训练数据 |
| **软蒸馏** | 连同 logits(完整的概率分布)一起训练 |
| **离线(off-policy)** | 数据事先批量获取 |
| **在线(on-policy)** | 训练过程中实时采集模型自身输出 |

他的几个结论:

  • 查阅各家技术报告后,没有发现向软蒸馏迁移的趋势——业界主流仍是“离线 + 硬蒸馏”;
  • 软蒸馏信息量更大、理论上更好,但硬蒸馏并没有那么差​;而且软蒸馏有个工程硬约束:师生模型需要相同或兼容的 tokenizer 和词表(logits 的每个维度要能对上)。DeepSeek 和 Llama 词表不同,做软蒸馏要么没法做、要么极其麻烦。所以软蒸馏基本只在同族模型之间有意义——DeepSeek-R1 从自家大模型蒸馏出小模型正是典型场景;
  • 关于合成数据为何有效,他给了一个直觉性解释(也坦言没有机理层面的定论):合成数据更干净​。就像学数学先读教科书(结构化、正确、按主题组织)比泡论坛效率高。但纯合成数据也不行——如同只读一本教科书,会绕圈子、缺乏多样性,必须与人类生成的原始数据混合;
  • 做蒸馏的两个动机要区分:让模型变强 vs 造出能跑在笔记本上的小模型​。

5. 如何选模型:他的实用方法

面对每天层出不穷的模型版本,他的“速查手册”:

  • 看版本号的小数位更新​:架构不变,部署环境不用动,性能通常提升(他展示了 DeepSeek V4 Pro 两个版本在 Artificial Analysis 上从 33 涨到 43,约 20% 提升);
  • 主力工具是 Artificial Analysis(artificialanalysis.ai):独立评测,性能、速度、成本三维度统一 harness、横向可比。他也指出局限——各家官方 benchmark 连 harness 都不同,数字容易虚高;而 Artificial Analysis 用的 harness 未必匹配你的实际用法(比如用 Qwen 却配 Codex CLI 或 Claude Code 的 harness 也能跑,但不同 harness 消耗的 token 差异很大:Claude Code 约为 Codex 的两倍);
  • 实践建议:先定成本/速度阈值,再在约束内找性能最优的“性价比之王”。

6. 训练实操:KL 散度、验证器与“防跑偏”

社区成员 Kyle 分享了自己后训练音频模型 Inkling(能识别情绪、口音,甚至注意到他在用力敲键盘)的经历。Sebastian 的回应透露了不少实战细节:

  • 数学任务的 RLVR 现在普遍不用 KL 散度了——这个约束本来是为了让训练后的模型别偏离基座太远(保持正常语言能力),但纯数学任务去掉它照样工作,Qwen3(他口中的“almost three”)等热门模型都明说不加或设为近零;
  • 但换了领域(如音频)就可能出问题,需要大量试错调参;
  • 他的实际做法:另用一个 LLM 按评分量规(rubric)给输出打分(1-10 分),不是当训练信号,是当“熔断器”——发现输出质量崩坏就停训回滚到之前的 checkpoint;
  • 关于“任务是否太小家子气”的疑虑,他直言:RLVR 除了数学和代码之外,从来没有“显而易见”的应用场景,放手试就是了。

顺带一个有趣轶事:他用 OBS 录视频发现音画不同步,把视频整个丢给 GPT 5.6 Sol(extra high 推理档),模型算出了 0.15 秒的延迟——一个从未针对此任务后训练的模型开箱即用解决了问题。

7. RLVR 奖励设计:中间步骤有用吗?

经典 RLVR 只有两种奖励:准确性奖励(答案对=1,错=0,用 SymPy 或计算器验证)和格式奖励(思维链标签格式是否规范)。模型生成的中间推理过程本身被完全忽略​。

那用中间步骤做奖励(过程奖励,process reward modeling)值不值?他的答案是“是也不是”:

  • DeepSeek-R1 论文试过用模型给中间步骤打分,当时效果不佳;
  • 但 DeepSeekMath V2 展示了新进展:用多个模型互相配合——一个模型解题、一个“裁判”模型给中间步骤反馈、还有一个模型评估裁判的反馈本身靠不靠谱——在自我精炼迭代中确实带来了显著提升;
  • 总体判断:中间步骤的奖励信号是主观的、实验性的​,容易滑向 reward hacking(模型学会讨好评分器而非真正做对);最终答案的正确性才是最客观的 ground truth​,目前主流模型大多还没采用过程奖励,因为它“不简单”。

8. 推理时扩展:两条路线的权衡

  • 自我精炼(self-refinement)​:生成答案 → 给反馈 → 据反馈改进,多轮迭代。串行​,必须等上一轮结束,效果好但慢;
  • 多数投票(majority voting / best-of-N)​:同一问题用一定温度采样并行生成 32 个答案,取众数​。可完全并行,在数学类任务上几乎能让准确率翻倍(因为难题答案有方差、简单题答案一致)。数学最适合,因为答案是单一数值;自由文本答案则很难“取众数”;
  • 用另一个模型给答案打分再选最高分也可行,但不如多数投票稳健——有研究发现打分很脆弱,模型(即使被告知不要)更偏爱“听起来自然”的答案而非数值正确的答案,这与偏好训练有关。

9. 主观任务为什么仍需要人类

对“如何为设计网页前端这类主观任务设计奖励”的问题,他直言这是“十亿美元问题”,也是人类尚未过时的原因​:不同人偏好不同(简洁技术流 vs 小白友好型),不存在 one-size-fits-all。出路是通过上下文引导(AGENTS.md、告诉模型你的背景和约束,比如“必须客户端运行、要向后兼容”)以及——测试​。

他讲了个亲身经历当注脚:周日他在车企新官网上预约了换机油,还夸网站改版漂亮,周二到店时店员一脸茫然:“您预约了?哦,一定是新的 AI 系统吧。”——网站功能炫酷,但预约根本没进系统。“这就是为什么仍然需要人来测试这些东西。”

10. Token 质量与推理档位

他展示了一张自绘图:GPT 5.6 的 Luna/Terra/Sol 三个模型在不同推理档位(effort settings)下的“总分 vs 总成本”。核心洞察:大模型生成的是“更好的 token”——用更少的 token 得到更好的答案,但每个 token 更贵(层数多、服务慢)。Luna 开 Max 档的总成本可以低于 Sol 开 Medium 档且效果相当。循环 Transformer 是同样的账:内部计算更多、token 更少更好、单价更高。

11. LLM 能否发现真正的新东西?

他认为无法给出确定答案,但给出了一个有说服力的框架:

  • 组合式发现已经发生:模型在网络安全任务中发现并利用了前所未知的漏洞(“如果早有人知道,早修了”)——但你无法排除训练数据里存在过类似模式;
  • 他认为模型没有理由只能复用训练数据:就像遗传算法/进化,把已有元素大量组合、保留有效的​。人类很多发现也是先有直觉、试出来、再倒推数学解释——Hinton 就常这么干;
  • 他举了 2006 年 NASA 进化天线的例子:演化算法设计出的天线性能远超传统设计,形状却诡异到没人能解释为什么——不需要理解,也能发现​。LLM 理论上也能这样,尤其在能调用工具和子代理并行试错的情况下;
  • 他的总结:LLM 的“聪明”来自以极高效率检索、筛选和组合海量信息——相当于一千个人类的想法总和,还不知疲倦。看起来像超级智能,本质是极致的信息整合效率。

12. 他的日常工作栈

坦诚且接地气的回答(披露:他申请到了 OpenAI 的开源订阅,免费用 ChatGPT):

  • 日常主力​:Codex + GPT 5.6 Sol——他承认这比 Qwen3.8 27B 更强;
  • 本地实验​:一台 DGX Spark​,常跑 Qwen3 系列(常用 35B A3B 的 MoE 版本,约 50 token/s,速度和质量的平衡点)。训练很慢,但机器从不闲置——目前上面正跑着他那篇 AI 检测器文章的 RLVR 实验(“reward hacking 多到够写一章”)。因为一直在训练,本地模型反而更多用于开发调试而非“正经工作”;
  • 通过 OpenRouter 试用新出的开放权重模型;
  • 他还回忆了 2018 年在大学当教员时那台四路 GTX 1080 Ti 工作站:热到必须搬离办公室,否则学生听不见他讲 office hour——这是他至今只有一台安静的 Spark 而不是家用 GPU 集群的原因。

———

几点观察

整场访谈的价值不在于新闻点,而在于 Sebastian 把一个正在快速变化、噪音很大的领域拨回了工程直觉​:推理模型没有魔法(就是带可验证奖励的 RL 加思维链)、循环 Transformer 不是革命(是用计算换 token 质量)、软蒸馏没有取代硬蒸馏(tokenizer 兼容性是硬约束)、多数投票优于打分选优(评分器可被讨好)、主观任务仍无解所以人类测试仍不可少。他反复强调的方法论是:把可验证性当杠杆,把不可验证的部分交给试错和人工熔断​。

一个需要注意的地方:字幕是自动生成的,个别专有名词可能有转写误差(如模型版本号 "Qwen3.8"、"GLM 5.3"、"DeepSeek V4" 等以实际为准)。如果你需要,我可以把这份解读整理成 Markdown 文档保存到你的工作目录,或者针对某个章节(比如蒸馏四象限或 RLVR 奖励设计)做更深入的展开。