本文作者:meng shao(@shao__meng)。版权归作者所有,未经授权禁止转载。
CS329A · Part 8:智能体评测与长时程任务
斯坦福课程 CS329A Self-Improving AI Agents | Part 8 | Agentic Evaluations and Long Horizon Tasks
https://www.youtube.com/watch?v=8JAqLnTaZu4&list=PLangBM27OtEA&index=8
讲师 @achowdhery(斯坦福教授,PaLM 540B 与 Gemini MoE 预训练负责人)
这节课的展开方式本身就是一堂“评测方法论课”:讲师带着三个递进的研究问题走完全程,每讲一个问题,就以一篇前沿论文为研究目标,边拆解方法、边看数据、边组织课堂讨论。
开场:从“跑分”到“跑评测”
老师先做现场调研:“多少人给自己的项目做过评测?”学生的回答——多跳 QA、企业私域知识库问答——恰好暴露了现状:传统单轮基准正在快速饱和,而智能体评测要回答的是两个性质不同的问题:
- 模型能完成多长、多复杂的任务?
- 模型能完成有多大经济价值的任务?
这两问分别对应本讲的论文一(METR)与论文二(GDPval),论文三(DeepScholar-Bench)则补上第三问:当任务需要检索与综合知识时,产出质量可信吗?
第一幕:任务能做多长?——研究目标:METR《Measuring AI Ability to Complete Long Tasks》
讲师的切入点
从聊天机器人的上下文讲起:几年前的模型多轮对话两三轮就“丢了”,如今对话可以很长——那么任务的时长(以熟练人类耗时计)和可靠性(成功率)能否构成一个统一度量?
论文方法拆解
- 170 项任务、三个套件:SWAA(66 项 1–30 秒的原子操作)、HCAST(97 项 1 分钟–30 小时的软件/研究工程任务)、RE-Bench(7 项 8 小时 ML 研究任务)。
- 每项任务由约 5 年经验的专家实际计时完成(累计 2,529 小时),任务难度取成功者耗时的几何平均。讲师提醒一个偏差:熟练者往往低估难度。
- 对每个模型,在“耗时对数 → 成功率”空间拟合逻辑斯蒂曲线,**曲线穿过 50% 成功率的时长即“50% 时间视界”**。
关键数据
- 视界每约 7 个月翻一倍:GPT-2(2019)≈ 2 秒 → GPT-4(2023)≈ 8 分钟 → Claude 3.7 Sonnet(2025)≈ 59 分钟;后续 o3 约 1.5 小时,高于趋势线。按此外推,约 2029 年模型可完成“人类一个月”的软件任务。
- 80% 可靠性曲线是另一回事:同样模型的视界缩短 4–6 倍(Claude 3.7 从 59 分钟跌至约 15 分钟)。讲师强调:“如果你想部署,可靠性挑战从几分钟的任务就开始了。”
- 改善来自可靠性、错误恢复、推理与工具使用——正是本课程前几讲的主题(ReAct、规划、记忆)。
课堂讨论(本讲最精彩处)
讲师问:为什么 Claude Code / Codex 这一年变强了?学生给出四个答案,她逐一确认:
- 上下文工程——包括上下文压缩;
- 真实用户日志的反馈回路(类比 Cursor 的在线 RL);
- 显式规划与中途重规划——复杂任务先规划,执行中根据收集到的数据触发 replanning;
- 对代码库的记忆,维持跨步骤的环境理解。
失败模式 taxonomy
对比 GPT-4 与 o1:规划差、工具选错、推理错误、过早放弃、重复动作循环。讲师把它与课程作业打通:“你们做 self-critique refinement 时,正是在做失败模式分析。”
论文的自我批评(讲师特意保留)
- 任务“脏”(无单一正解)时表现更差;
- SWE-bench 有污染,翻倍速度被高估;
- 最有启发性的发现:在 METR 内部代码库上,外部承包商比维护者慢 5–18 倍,而模型表现贴近承包商——**模型是“零上下文的人类”**。这个结论将在第三幕回响。
第二幕:任务值多少钱?——研究目标:OpenAI《GDPval》
讲师的切入点
换一个问题:不问“AI 能不能做这个任务”,而问“把任务从人类专家手里拿给模型,交付物够不够好”——胜率直接对标行业专家。
论文方法拆解
- 覆盖对 GDP 贡献超 5% 的 9 个行业、44 个高薪数字化职业(合计年收入约 3 万亿美元),共 1,320 项真实任务,由平均 14 年经验的从业者基于自己的实际工作设计,每项任务平均 5 轮人工审核。
- 任务都是真实交付物:护士写会诊报告、工程师做 3D 模型、剪辑师做片头、审计查价格矛盾。金标子集平均耗时 9.5 小时、价值约 400 美元。
- 评分用盲测成对比较:评审专家在不知哪份来自人类的情况下排序,每任务 3 样本 × 3 评审。
关键数据与课堂张力
- 胜率(含平局):GPT-4o 12.4% → o3 35% → GPT-5 39% → **Claude Opus 4.1 47.6%**。
- 讲师点破本讲核心张力:“这与 METR 非常不同——METR 是指数趋势,这里更像线性。” 学生追问两者是否矛盾,她答:不矛盾,但人常犯的外推错误是“能做一小时,接下来就能做一天、一周”——GDPval 按职业拆开告诉你,真实工作里模型只在一部分职业接近专家。
- 模型分化:Claude 强在排版美学与 PDF/表格/幻灯片,GPT-5 强在指令遵循与计算——“你必须按任务类型选模型。”
- 失败主因是指令遵循:模型声称查看了参考文件,实际用幻觉覆盖。GPT-5 的产出约半数“可用但平庸”,仅约 20% 真正优于人类,20–29% 糟糕或灾难性。
- 经济性:GPT-5 以“多次采样 + 自我修复”循环,成功任务成本不到专家薪资 10%——部分职业已具备部署价值。
关键消融:上下文
把 prompt 里的上下文削掉,模型明显变差。讲师的结论:“当人类把脑子里的上下文都写清楚、任务只剩推理与执行工具调用时,模型能做;但‘该做什么’本身,是人类在架构的。”——第一幕的“承包商 vs 维护者”在此回响:真实工作是上下文重的(70% 任务需要参考文件)。
第三幕:综合得可信吗?——研究目标:斯坦福《DeepScholar-Bench》
讲师的引入很有趣:学期初有同学提出“想让 AI 帮我写论文的文献综述”,于是有了这个基准。
论文方法拆解
- 活基准:给定一篇 arXiv 新论文(2025 年 4–6 月,晚于主流模型训练截止),检索文献并写出它的 Related Work 章节,与专家范本对比;每月换新论文重跑,从机制上杜绝污染。
- 自动化评测三维度(LLM 评审与人类博士评审一致率 70–82%):知识综合(组织、要点覆盖)、检索质量(相关性、参考覆盖、文献重要性)、可验证性(引文是否支持主张、主张是否有引文支撑)。
关键数据
- 没有一个系统总分超过 31%(人类范本 0.78)——讲师开玩笑说:“大多数基准都在饱和,这个还有大把空间,适合你们做期末项目。”
- 系统各有残缺:OpenAI Deep Research 文风与组织最好(0.86),但引用精度差——*“英文很漂亮,但引文撑不住主张”*;作者的 DeepScholar 流水线引用精度可达 0.94,成本仅为 Deep Research 的四分之一。
- 消融直指要害:喂给“完美检索”(oracle 论文列表),总分从 0.29 跳到 0.81——检索是第一瓶颈;但要点覆盖仍只到约 50%——综合本身是第二瓶颈。
- 根因:模型找不到奠基性论文、判断不了文献重要性——人类专家靠多年积累“知道该引谁”,这正是上下文问题的知识工作形态。 ## 结尾总结:三个基准的合读
讲师的总结展示把三篇论文放进一个坐标系,也是本讲真正的论点:
| | METR | GDPval | DeepScholar-Bench |
|---|---|---|---|
| 量纲 | 任务时长 | 经济价值(胜率) | 综合质量与可验证性 |
| 趋势 | 指数(7 个月翻倍) | 近似线性 | 远未饱和(≤31%) |
| 各自盲区 | 80% 视界短 5 倍 | 任务过度规范化、一次性 | 规模小、限 CS 领域 |三条结论:
- 能力 ≠ 价值 ≠ 质量。METR 预言 2028–2031 年一个月视界,但 GDPval 的线性趋势和 DeepScholar 的低分都在提醒:单一指标的外推都会误导。评测体系需要时长、经济价值、综合质量三类指标并用,且都要有人类校验。
- 上下文是三个基准共同撞上的墙——零上下文承包商、prompt 里的隐性知识、找不到奠基文献,是同一件事的三张面孔。
- **进步集中在“我们自己最懂的领域”**:“软件工程和 ML 研究进步最大——也许正因为我们是计算机科学家,我们正在自动化自己的工作。” 而对抗性环境、95% 可靠性、跨出知识工作的泛化,仍是低置信区。
Q&A
- AGI 的定义(讲师的个人版本):“当 AI 能自己构建下一代模型时,我们甚至不必在场。现在还没到——目前它们是极好的 co-scientist。”
- 长尾难题:“前 80% 容易,最后 20% 花了十年。” 分布式系统被点名为难啃领域。
- 给学生的职业建议:“AI 需要有人给它上下文才能解决任何问题——所以从基本原理出发的推理能力,是你要保有的东西。”