Dongxi 东锡 NLP

Apodex 1.1 帮我研究了 221 个 MATS 项目:从模型提及到可复核结论

本文作者:Dongxi 东锡 NLP(@dongxi_nlp)。版权归作者所有,未经授权禁止转载。 这项研究从一个问题开始: MATS 论文如何使用和评价中国模型,尤其是中国开放权重模型? 听起来,搜索模型名、统计出现次数就够了。 第一步就会错。 一个模型可能只出现在参考文献里,也可能承担训练、评测、监控或红队任务。“中国模型”说的是来源,“开放权重”说的是访问方式。把这些概念混在一起,

面向发现式智能的基准:TRACES

本文作者:Dongxi 东锡 NLP(@dongxi_nlp)。版权归作者所有,未经授权禁止转载。 TRACES 评估 AI 系统能否通过证据充分、可审计、可修复的调查得到正确结果。 一个 AI 系统接到任务,要复现一张临床试验安全性统计表。它算对了数字,却没有预先声明自己选择了哪组患者作为分析人群。证据记录列出了每个分子对应的患者,却遗漏了分母中的患者。其他研究者可以看到最终百分比,却无法独立复算。 一个看不到隐藏答案和结果得分的过程批评器定位了这两个缺口。

DeepSeek Harness:把边界写成契约

本文作者:Dongxi 东锡 NLP(@dongxi_nlp)。版权归作者所有,未经授权禁止转载。 DeepSeek Harness 开源了,如果说简单总结 DeepSeek Harness 的设计哲学,那就是 “事实有据,权限有度”。 第一次面对它,你可能会期待一个 model wrapper、一组 tools,或者一个围绕
AI一起学
00:00:00 00:00:00