本文作者:huangserva(@servasyy_ai)。版权归作者所有,未经授权禁止转载。
先说答案:国内模型综合第一,是 GLM-5.3,两轮等权参考分 93.4。
要一个既能整包交付、又经得起反复拆题委派的国产模型,现在的答案就是它。
但这个答案值得花十分钟读完推导过程,因为它不是一路领先赢下来的。
三周前,这个问题还只有一个答案:Kimi-K3——Round 1 超长整包 95.6 分,在我们那份冻结 rubric 的九模型榜上排国产第一,且与身后的差距足够大,算得上独一档。
三周后,两款新模型的发布把这个格局打破了。
hy4 preview 在 Round 1 上以 96.4 压过了 Kimi,单发上限全场国产最高;GLM-5.3 在 Round 2 拆题稳定测试里以 93.6 登顶;而 hy4 的 Round 2 只有 83.8——单发第一和综合第一,不是同一个模型。
下面把三层答案逐一讲清楚:先看 Round 1 为什么是 hy4,再看 Round 2 为什么是 GLM-5.3,最后回到开头那个最重要的综合榜,看 93.4 是怎么算出来的。
先说评分尺
所有分数出自同一份冻结 rubric:10 个能力维度 × 每维 5 个子项 = 50 细项,满分 100。

▲ 十个能力维度与三条硬规则。核心答案错误、虚假完成或捏造事实触发 B0 硬封顶,该维度最高只能拿 3 分;速度与价格一律不计入;模型版本经 OpenRouter 实时目录固定,评分账本完整存档可复核。
测法分两轮,考的是两种不同的工作方式:
Round 1(超长整包):把十类工作一次性塞进同一请求,考注意力竞争、跨任务约束保持和长答案预算分配——像把一整天的活儿一次委派出去。
Round 2(拆题稳定):十个维度拆成十个独立对话,每项跑 3 次,共 30 份答案,考单项上限、重复运行波动和正文完整性——像日常把任务分给不同工作代理。
一个模型可以在其中一轮很强、另一轮平庸。这正是「第一」会裂开的原因。
Round 1 第一:hy4 preview,96.4
一次性整包交付这条赛道上,国产第一现在是 hy4 preview。总分 96.4,压过 Kimi-K3 的 95.6,在十一模型合榜上排第 3,仅次于 GPT-5.6 Sol Ultra(98.4)和 Claude Fable 5(97.6),无 B0 封顶。

▲ Round 1 十一模型合榜(含 Grok 4.6,经 Grok Build 命令行界面运行)
它赢在一个高光加上没有短板。高光在 D9:直接抓出题面自身的数据矛盾(9 + 2 = 11 > 10 次运行),还给出正确的置信区间——此前只有 Sol 和 Fable 级别的答卷做到过。D1 / D4 / D9 / D10 四个满分维度都是硬的,唯一短板是 D2 的 8.8:测试 mock 和实现对不上。
但这个第一要带限定词读:只差 0.8 分、单次答卷。它是能力基线,不是稳定胜负——它随后的 Round 2 把这句提醒变成了事实。
Round 2 第一:GLM-5.3,93.6
拆题稳定这条赛道上,第一是 GLM-5.3——而且这是全场(Fable5和GPT5.6Sol不参与)横向可比性最强的一个榜:六个模型的 180 份答案在同一批次、同一匿名映射、同一冻结评分表下统一重判。
hy4 preview 与 Grok 4.6 的拆题答卷为单模型匿名补判(同题同评分尺,属追加批次,未与六模型同批重判),一并列入参考,合计八个模型。

▲ Round 2 八模型稳定性总榜。能力画像 = 每维取三次中位数后十项相加;右侧四列是 30 份答案的交付质量账本(完整 / 部分 / 空正文 / 服务失败)。Hy4 与 Grok 为单模型匿名补判。
再拆到逐维看,八个模型全部列入,每格给出中位数和三次原始成绩,每个维度下还标注了五个评分细项:

▲ Round 2 八模型十维 × 三次逐次分。每格大字是三次中位数,小字依次为第 1、2、3 次成绩;「缺失」表示服务未返回有效样本,不补成 0;每个维度下的小字为该维五个评分细项。
GLM-5.3 的赢法和 hy4 正好相反:没有哪一项特别炸裂,但十项里没有一项拉胯。考得最差的是写代码(D2),也有 8.4 分——同一道题,Kimi 只拿 3 分,DeepSeek 直接 0 分。其余九项全在 8.8 到 10 分之间,逻辑推理和 Agent 任务两项满分。同一套题连考三次,成绩是 95.6、91.6、92.0,次次都在 90 分以上,而且 30 份答案交得齐齐整整。
值得注意的是 Kimi-K3 在这一轮的位置:87.4,第 3,出现了 3 份正文不完整的问题。可以看到一次委派它很强,反复委派它的波动和交付完整性都被 GLM-5.3 明显拉开。
hy4 的反转:单发最强,拆题跌到 83.8
Round 1 的领跑者在这一轮跌得最厉害。hy4 的 30 份答卷交付本身无可挑剔——30/30 完整,无空答、截断或服务失败,三次整套 84.6 / 83.8 / 85.8,波动只有 2.0 分,稳是稳的——但稳定画像只有 83.8。
丢分的原因是不守规矩:写代码时三次里有两次改了题目明说不许动的地方,被直接封顶到 3 分。
这正好解释了 Round 1 和 Round 2 的落差:单次整包里它把约束守住了一次,拿到 96.4;拆开重复跑三次,违反约束的概率就暴露出来了。这也是 Round 2 存在的意义。
综合第一:GLM-5.3,93.4
现在回到开头给出的那个答案,看 93.4 是怎么来的。公式是(Round 1 分数 + Round 2 能力画像)÷ 2——同时照顾整包一次性交付和拆解任务的稳定性,八个模型排名如下:

▲ 八模型双轮等权参考榜。等权参考分 =(Round 1 整包 + Round 2 能力画像)÷ 2,是路由参考,不能替代两张原始榜;Hy4 与 Grok 含单模型追加判分,细小差距不可解释。
GLM-5.3 两轮都稳在 93 上下,等权 93.4,第 1。
Kimi-K3 靠 Round 1 的 95.6 撑着,被 Round 2 的 87.4 拖到 91.5,第 2。
hy4 preview 是全场落差之最:Round 1 全场国产最高的 96.4,被 Round 2 的 83.8 直接拖到 90.1,国产第 3。
被很多人吹上天的 Qwen3.8 Max 则是另一种偏科:拆题能拿全场第 2 的 88.0,整包却只有 78.4,综合 83.2 排第 5。
梁圣 DeepSeek V4 Pro 0813 这次也跌下神坛:整包 91.6 还算体面,拆题却只有 74.2——写代码一项直接 0 分——综合 82.9,排第 6。
唯一的两款海外模型里,Grok 4.6 以 86.8 排第 4,Claude Opus 4.6 78.0 排第 7——榜单前三清一色国产。
所以,到底谁是第一?
按三层分开答:

▲ 同一份冻结 rubric,三种问法,三个答案。
Round 1 整包第一:hy4 preview(96.4)——单发上限最高,但 0.8 分差距、单次样本,是能力基线不是稳定排名。
Round 2 稳定第一:GLM-5.3(93.6)——同批盲测重判、无塌陷项、30/30 完整交付,是全场最硬的一个第一。
综合第一:GLM-5.3(93.4)——这是最重要的答案。要一个能整包交付、也能反复拆题委派的国产模型,现在的答案是 GLM-5.3。
Kimi-K3 没有掉队——它综合仍是国产第 2——但「国产独一档」的时代确实结束了:单发上限被 hy4 拿走,稳定与综合被 GLM-5.3 拿走。而 hy4 的双轮成绩则给所有榜单读者上了一课:单发 96.4 与稳定 83.8 可以出自同一个模型,只看一轮,你看到的不是它的全貌。
最后一个尾注:GLM-5.3 的最高推理档非常吃输出预算,16K tokens 时曾推理耗尽、正文为空,用 64K 上限才完整交付——生产使用记得留够预算。
这份榜单反复证明的正是:决定「第一」的,从来不是最高的那一次,而是每一次。
不相信?欢迎自己跑一遍
这套评测的题目和方法已经全部开源:huangserva/model-evaluation。
仓库里公开了两套彼此独立的评测:
十维代理能力快筛——就是本文用的这套。Round 1 超长整包和 Round 2 十项独立题的完整题面、闭卷运行协议、三次重复运行方法和结果报告规范,全部可以逐字取用。
每模型 300 题代码与困难推理基准——150 题代码(HumanEval+ / MBPP+)加 150 题困难推理(MMLU-Pro)的历史实测快照,含确切题目清单、上游固定版本和题面重建脚本。
为了防止刷题,私有评分表、参考答案、历史分数和匿名映射不公开——但题面和协议足够任何人对任何模型复现同样的测试。如果你复测出了不同的结果,欢迎带着全部原始答案来讨论:这份榜单的规矩从第一天起就是三次重复运行、全样本披露、不静默删除异常。