本文作者:Dongxi 东锡 NLP(@dongxi_nlp)。版权归作者所有,未经授权禁止转载。


这项研究从一个问题开始:

MATS 论文如何使用和评价中国模型,尤其是中国开放权重模型?

听起来,搜索模型名、统计出现次数就够了。

第一步就会错。

一个模型可能只出现在参考文献里,也可能承担训练、评测、监控或红队任务。“中国模型”说的是来源,“开放权重”说的是访问方式。把这些概念混在一起,很容易把使用便利误读成国别偏好。

MATS(ML Alignment & Theory Scholars)是一个聚焦 AI alignment、transparency 与 security 的研究项目。我们整理了 221 个项目,希望沿着论文证据回答:哪些中国模型真正进入了安全研究?它们做了什么?研究者又如何评价它们?

我把这项工作交给了 Apodex 1.1,面向复杂科研任务的主模型 + 在线工作台产品。

可检查、可复核的,端到端执行

输入包括 221 个项目的主表、4,821 条论文证据摘录、3,918 条原始模型提及,以及 871 条“项目—模型家族”记录。

四份表互有关联,也各有口径。直接加总没有意义。

Apodex 先把问题拆开:

  1. 回到 CSV、PDF 和网页,定位原文与页码;
  2. 区分 raw mention 和 substantive use;
  3. 标注模型来源、访问方式、研究角色、安全领域与评价立场;
  4. 重新计算关键数字,并让独立 reviewer 检查证据链。

最容易被忽略的是第二步。

论文引用 Llama,并不代表实验使用了 Llama。论文讨论 DeepSeek 的新闻,也不代表 DeepSeek 进入了研究流程。只有找到模型在方法、实验或评测中的具体作用,采用率才有清楚的含义。

Article image

Figure 1. Model roles across the complete MATS corpus.

研究中途,问题变了,但可以 Chime-in

最初的范围只有 52 篇安全与红队相关论文。

运行开始后,我通过 Chime-in 调整了任务,steer 了模型:扩展到全部 221 个 MATS 项目,加入 paper_model_mentions.csv,并把重点收紧到“安全研究与中国开放权重模型的关系”。目标也从内容素材改成一项可以复查的正式研究。

任务板随之更新。已经完成的数据读取和证据抽取继续保留,受影响的采用率、角色、立场和稳健性分析重新规划。

这类长任务的难点,常常出现在运行中:问题会变,数据会暴露新缺口,局部脚本会失败。系统需要记住已经确认的部分,同时重做真正受到影响的部分。

异步 Agent Team(Deep Discover):十条线同时推进

Deep Discover 没有沿用一棵预先写死的任务树。主 Agent 先判断工作能否拆分,再决定拆成什么、交给几个 Subagent,以及何时汇总或调整。

这次研究最终形成 17 个任务,首轮启动 10 个 Subagent。文献证据核查、Data Analysis、Method Validation 和 Path Exploration 分别在独立 context 中推进,主 Agent 维护目标、依赖关系和 Shared Task State。

Article image

第一个数据审计结果回流后,主 Agent 已经开始核对 871、628 和 186 三个核心数字;角色、立场与匹配分析仍在后台继续。后续任务可以直接读取阶段性产物,整条主线无需等待最慢的分支。

异步也给 Chime-in 留出了空间。用户可以在运行中修改范围,系统再判断哪些结果仍然成立、哪些分析需要重做。

并行只是开始。真正困难的是让十条工作线使用同一套定义。因此,两名数据审计 Agent 分别复算核心分母和采用记录。robustness 脚本出错时,系统只修复并重跑相关步骤;报告整理触及运行预算后,校验和发布收尾进入下一轮,已完成的分析没有丢失。

再开一条线,专门检查结论

并行提高了速度,结论质量仍需单独处理。

负责写作的 Agent 已经看过全部分析,也已经形成解释。让它独自审查自己的结论,容易沿用原来的判断。

Apodex 的 Statement Review 另外启动 claim_refuter,逐项检查 10 组核心论断;final_verifier 再核对交付是否完整。它们检查分母、置信区间、纳入规则、论文原句、评价归因和图表口径。

审查确实找到了问题。

Article image

报告原先写“63 条人工修正”,数据中实际能数到 65 条;另有“125 条保留复核”无法从现有字段完整重建。最终版本保留了这两个差异,也说明它们是否影响主要结论。

这一步决定了一份结果能否被信任。漂亮的图表只能呈现结论,独立审查才能暴露结论依赖了哪些定义、哪些数据仍有缺口。

数据最后说了什么

核心数字经过两条审计路径复算:871 个“项目—模型家族”对、628 个实质性采用对,以及 186 个实际使用具名模型的项目都可以复现。

几个结果最值得注意:

  • 中国模型的实质性采用率从 2023 年的 4.35% 升至 2025 年的 50.55%。2026 年截至 8 月为 65.52%。
  • 80.9% 的中国模型实质性使用发生在可获得权重的条件下。
  • 170 条中国模型评价记录中,63.5% 属于中性、工具性使用。现有证据没有显示论文将负面安全结论明确归因于模型的中国来源。

放在完整语料中看,采用变化十分清楚。

Article image

Figure 2. Model adoption across the complete MATS corpus.

评价记录呈现出另一层信息。

Article image

Figure 3. Evaluative stance toward Chinese model families.

回到最初的问题,现有 MATS 语料呈现一种清楚的信号是:中国开放权重模型正在成为安全研究的实验基础设施。

值得一提的是,Apodex 1.1 的最终结果,生成的图片,全部在本地有真实验证的的artifacts,可以随时复用和检查。

Article image

我对 Apodex 1.1 的理解

能持续、可验证地把一件事做完。

这次 MATS 研究把这个“能力单位”拆得很具体:

  1. 理解目标:把一句关于“中国模型态度”的问题,转成定义、分母、分类规则和可检验假设;
  2. 真实环境中动手操作:进入 CSV、PDF、网页和代码环境,读取证据、运行统计并生成图表;
  3. 维护长链条任务状态:持续管理 17 个任务、10 个 Subagent、依赖关系和共享产物;
  4. 处理执行中的新反馈:通过 Chime-in 把范围从 52 篇扩展到 221 个项目,并加入新的数据文件;
  5. 失败后修复而非推倒重来:局部脚本报错就修复相关步骤,运行跨轮也能沿用已有结果;
  6. 交付结果可被核查:保留原文、页码、数据表、evidence matrix、统计口径、图表和 Statement Review 记录。

搜索和写作只覆盖了开头与结尾。真正拉开差距的是中间这条执行链:任务如何拆分,Agent 如何协作,用户在哪里改变方向,错误怎样被修复,数字和论断又怎样被独立挑战。

让推理走出报告,走进真实任务的执行过程。

这句话在这次实测里有了具体含义。最终留下的包括可复用数据表、evidence matrix、统计结果、六张图、审查记录和完整报告;每一项都能沿着过程回查。

如果你也有一份材料复杂、口径容易变化的研究任务:

  • 在 Apodex 在线工作台 上传论文、CSV、表格、图像或代码。新注册用户可获 credits;API Platform 上线期免费两周。
  • 在 Hugging Face 查看或下载可本地部署的 Apodex 1.1 mini(35B),也可以搭配 FrontierAgent 使用。
  • 在 GitHub 查看单机 harness FrontierAgent。无需预装 Docker,一条命令即可运行。