本文作者:Dongxi 东锡 NLP(@dongxi_nlp)。版权归作者所有,未经授权禁止转载。


TRACES 评估 AI 系统能否通过证据充分、可审计、可修复的调查得到正确结果。

一个 AI 系统接到任务,要复现一张临床试验安全性统计表。它算对了数字,却没有预先声明自己选择了哪组患者作为分析人群。证据记录列出了每个分子对应的患者,却遗漏了分母中的患者。其他研究者可以看到最终百分比,却无法独立复算。

一个看不到隐藏答案和结果得分的过程批评器定位了这两个缺口。修复后的求解器先声明分析人群,再记录分子与分母对应的患者 ID,最后提交了数值相同的表格。数字保持不变,可复现性得到改善,结果得分从 0.83 上升到 0.95。

Article image

公开的临床试验环境说明了这类缺陷的重要性。一套关键性的三期临床试验材料可能包含 200–500 张表格、列表和图形。行业通常安排两组人员独立编程,再逐个单元格核对。在这种规模下,一条未声明的分析人群规则或一处缺失的数据血缘,都会让报告失去审计条件。

这个案例呈现了 Apodex Discovery 论文的核心区别:

正确答案本身不足以证明调查过程可信。多数基准衡量最终答案,TRACES 还会评估答案的生成过程。

传统基准预先定义了什么

常规基准启动时,大量设计工作已经完成。设计者已经选定问题、完成任务表述、准备输入、限定工具、设置预算并定义成功标准。通常,参考答案也已经存在。

开放式发现开始得更早。“设计一种更好的基因治疗载体”还需要确定可用的生物数据、衣壳活性标准、目标组织、新颖性、可制造性、实验反馈与资源上限。

Apodex Discovery 把这些问题表述工作纳入研究任务。它的评估对象是 heavy-duty solver(重型求解器):基础模型,加上运行框架(harness)、记忆、工具和控制策略。评估单位由答案扩展为完整调查:

ambition → formulation → action → observation → verification → repair
Article image

从提示词到可执行环境

TRACES 是 Apodex Discovery 框架中的现实基准。它把重要的开放目标转化为问题清单(problem manifest)和有状态的可执行环境。

问题清单是一份静态契约,规定目标、任务分解、可用数据和工具、资源预算、成功标准及隐藏验证路径。环境负责承载求解器的行动,并返回新的观察,包括工具输出、执行错误、检索证据、模拟结果、实验测量和验证器反馈。提示词提供固定上下文;环境会随着行动改变状态。

公共网站目前展示四个环境:

  • AAV 衣壳设计覆盖活性预测、组织靶向、三维结构重建,以及在有限实验反馈下设计候选序列。
  • 药物再利用要求求解器综合临床试验、分子与遗传证据、安全信号、扰动数据和相互冲突的文献。看似合理的机制仍可能受到毒性、暴露水平、患者异质性或试验设计限制。
  • 临床试验要求系统把统计分析计划转成可执行代码与可审计的表格、列表和图形。计划存在缺口时,求解器必须声明有依据的选择,并保存单元格级数据血缘。
  • 大模型工程使用真实模型、语料、GPU、资源预算和隐藏检查。训练可能持续数小时保持稳定,随后因熵耗尽和梯度失稳而失败。

这些环境可以暴露静态提示词难以复现的领域故障。

项目团队报告称,10 位 STEM 博士用两个月调查了 16 个行业部门中的 561 个产业,收集 423 个高价值问题,并选择其中 20 个继续开发。候选问题需要具备可检查的交付物、实质性的中间任务、可度量的评分规则、可运行实例、外部证据来源,以及未来确认或证伪结果的明确路径。

Article image
开放问题的验证原则: 今天可以没有答案,但必须预先说明哪些证据能够确立答案。

新药可能需要多年验证,新材料可能尚未制造,某个假说也可能依赖未来实验。TRACES 仍可检查当前调查有没有保存后续验证需要的证据、不确定性和适用边界。

结果验证与过程验证

TRACES 把评估分成两个通道。

结果验证器(outcome verifier)使用隐藏真值、留出数据、模拟结果、实验测量或可量化代理指标,评价最终交付物和承载结论的中间产物。它还可以设置硬性关卡,拦截数据污染、答案泄漏和无效提交。

过程验证器(process verifier)评价求解器如何得到结果。它读取外部可见的完整轨迹,包括行动、观察、产物、主张和修订,同时看不到最终验证结果与求解器身份。模型私有的思维链会被移除。

Article image

HDS6 评价六种过程能力:

  • Tools,工具:选择、调用并正确解释合适的工具;
  • Repair,修复:定位真实故障、修正原因并确认修复有效;
  • Alternatives,备选解释:保留相互竞争的假设,并随着证据变化更新判断;
  • Coherence,连贯性:在长时间运行中维持状态、约束与逻辑一致;
  • Evidence,证据:让重要结论可以追溯到观察、数据、实验、工具输出或来源;
  • Scope,适用边界:说明结论成立的条件与可能失效的范围。

六个英文首字母组成 TRACES。结果得分与过程得分分开后,一个总分容易掩盖的四种情况会变得清楚:

  • 结果强 · 过程强:结果成功,调查过程也可以检查。
  • 结果强 · 过程弱:系统可能依赖运气、数据污染或无法泛化的理由得到正确结果。
  • 结果弱 · 过程强:调查过程可能严谨,但受到噪声、统计功效不足或高难度环境影响。
  • 结果弱 · 过程弱:结果与过程都需要修复。

临床统计表案例说明了双重验证的价值。只检查最终单元格时,两次运行等价;检查完整轨迹后,可复现报告与证据不完整的正确数字会得到不同评价。

过程反馈与修复

TRACES 可以把过程诊断转成简短的修复说明。说明会定位错误步骤、描述更高评分所需的行为,并要求求解器重新尝试,同时隐藏答案与结果得分。

论文中的一个案例要求求解器估计多个来源包含多少份独特且高质量的文档。第一次运行提到了“捕获—再捕获”方法,却没有使用已经收集的文档指纹。系统直接假设每个来源约有 100 份文档,并提交估计值 108。算术成立,关键输入却缺少证据。

过程批评器定位了这个问题。修复后的求解器根据文档指纹的重复频率估计未观察到的文档,提交 2,471,更接近隐藏真值 1,505。估计得分从 0.05 提升到 0.30。

Article image

修复结果仍然明显高于真值。反馈提高了证据基础,也暴露出尚未解决的校准问题;它无法保证成功。

在 434 条被判定为存在缺陷的轨迹上,加入修复说明后的重新运行使环境结果得分平均提高 0.155。10 个测试环境中有 9 个的平均变化为正:204 次改善,144 次不变,86 次下降。

这个结果值得关注,但证据尚未形成定论。实验缺少匹配对照组,没有让相同轨迹在缺少修复说明的条件下重新运行,因此普通的运行间波动可能解释部分提升。这个限制保留了一项重要的替代解释。

TRACES 与其他基准的区别

TRACES 建立在推理、交互式智能体、研究工程与科学评估等既有工作之上。论文的相关工作显示,各类基准采用不同的评估单位:

  • 静态推理(MMLU、GPQA、Humanity's Last Exam):固定提示与答案;检查最终答案的正确性。
  • 交互式智能体(WebArena、OSWorld、GAIA):数字环境中的有界运行;检查任务完成情况。
  • 研究与科学智能体(SWE-bench、RE-Bench、PaperBench、DiscoveryBench):补丁、实验或科学产物;使用可执行测试或结构化评分标准。
  • TRACES:求解器与环境组成的完整运行实例;检查隐藏结果、承载结论的中间产物与盲评 HDS6 轨迹。

这组对照比较评估单位,无意排列难度,各类基准之间也存在交叠。TRACES 的关键设计是同时评价最终提交与外部可见的轨迹。固定的 episode 接口还能保持问题、环境、工具、预算和验证方式稳定,从而受控比较模型、运行框架、智能体循环、初始指导与反馈处理方式。

Article image

TRACES 真正提出了什么

论文的核心论点关乎评估单位。承担重要任务的 AI 系统需要在长程调查中保持状态,区分观察与假设,保留仍然成立的备选解释,用证据支撑关键主张,说明结论边界,并修复已经确认的故障。

TRACES 提供了一套具体评估设计,用于检验完整 AI 系统能否开展可靠、证据充分且可以自我修正的调查,并让结果与轨迹接受审计、质疑、复现和扩展。

主要来源

  • Apodex Discovery 技术报告,arXiv:2608.11341v1
  • TRACES:工作原理
  • TRACES 问题注册表
  • TRACES 公共环境
  • Hugging Face 论文页面