本文作者:花叔(@AlchainHust)。版权归作者所有,未经授权禁止转载。
最近WorkBuddy是真的火,火到直接把国内的work类产品带成了一条新赛道,几家大厂都挤了进来。有意思的是聊到腾讯,大家的评价基本是同一个路数:产品能力没人怀疑,模型嘛,就不那么被看好了。
没想到,这次模型也赶上来了。混元Hy4 preview今天发布,第三方的Arena代码榜上,它已经挤进了前排👇

1633分,和Grok-4.6、Claude Fable 5、GPT-5.6 Sol咬在一个区间里,头部那几家也就三四十分的差距——这个位置对混元来说是头一回。
官方自己的成绩单则是这张:
十二个评测集,Hy4 preview基本都站在GPT 5.6 Sol、Kimi K3、GLM-5.3这一排里,个别项贴着Claude Opus 5。对我来说信息量最大的是每根柱子里浅色那一截,那是Hy3——7月6号才上线的上一代,满打满算一个半月。从浅到深的落差就是这一个半月混元追上来的距离,在很多指标上几乎是翻倍的涨...还真挺好奇他们内部这段时间里都发生了什么。
跑分归跑分,我更关心它干活的样子。好在这次门槛很低:Hy4 preview在WorkBuddy里首发,限时两周免费体验,到9月10号23:59,每天都送额度,用超了才开始扣积分——你看完这篇想自己验一遍,是不花钱的。

8月28日–9月10日,每日赠送免费额度;Hy3也同步免费,延长到9月30号
这几天国产新模型挺多的,所以我先简单说下这个模型的定位:前两天大家还在聊Qwen3.8-Flash和GLM-5.3-Flash,flash这一档拼的是便宜和快;Hy4 preview不是这个定位,总参数770B、激活参数49B、上下文1M,官方给它的定位是代码、办公、科学这类生产力任务。
免费期结束之后是什么价,我顺手把几家开源旗舰的官方定价页翻了一遍拉成一张表,Hy4 preview是这里面最便宜的一档:
输入6元、输出18元、缓存命中0.3元每百万tokens,数字都取自各家官方定价页,同一天核的
所以这次我测它,对手也按旗舰选:Kimi K3、GLM-5.3,再加上前一代Hy3。
有一点先交代清楚:下面所有的测试,从头到尾都是在WorkBuddy里跑的,四个模型同一个环境、同一道题、一个字不差,谁也没有主场优势。对比放在后半篇,前半篇先看它自己跑出来的东西。
一、先看个能跑的《我的世界》
题面是用Three.js做一个体素游戏,我写了八条硬要求:噪声地形、五种方块、区块动态加载、面剔除、第一人称、重力碰撞、破坏放置,所有纹理必须用代码画,不许外链任何图片。
它交回来一个单文件HTML,双击就能玩:

锁定→环视→穿过地形→跳→破坏→放置,2.5倍速实录
八条硬要求全做到了,然后往上多铺了一层:题面只要求视距4个区块,它拉到6;题面只要求HUD显示三个数,它挂了八项,角落里还补了一行小字「地形/纹理/网格 全部由代码实时生成」。单帧画着85,484个三角形、137个已加载区块,控制台零报错。
草地断层→泥土→沙滩→浅水→深水,五层地貌过渡在一屏之内
我最喜欢的是一个题面里一个字没提的细节:出生点稳稳落在陆地上。这个点决定了你打开文件的第一眼看见什么,四个模型里不是每家都想到了。
二、一道我8月17号真用过的PPT题
这道题不是为评测出的。8月17号我在WorkBuddy里让当时的Hy3做过一次:拿我的橙皮书资料做一个20页HTML PPT,向不太懂agent的同事讲清楚这是个什么产品。这次我把那句prompt一个字不改地发给Hy4 preview,连当时的错字都保留着。
有意思的是开工前那几分钟。Hy3当时拿到题直接开做,Hy4 preview先停下来问了我三个问题:交付格式要不要多导一份PPTX、20页的重心放上手还是认知、要不要保留资料里那些「诚实但劝退」的内容——风险、已知坑、内测开发者的负面评价。第三个问题问在点子上,那份资料里确实有一整节讲这东西哪里不好用,给同事看的周会材料留不留它,是个真需要人拍板的选择。它动手前把这个选择递还给了我。
上:8月17号Hy3的版本。下:Hy4 preview十天后拿同一句话重跑的版本

同一页内容的两种排法:Hy3干净但下面三分之二是空的,Hy4 preview按一页讲透一件事在排,密度高出一档

要说完美还谈不上(第2页副标题被卡片压住了一角),但这个取向我觉得很可以,是越来越接近能一个prompt做出可交付的报告的水平了。

三、比跑分更要紧的事:它编不编
我身边把大模型用在正经工作里的朋友,许多担心的倒不是它能力不够,是它一本正经地编:数字编一个、出处编一个,你还不容易一眼看出来。这个毛病有它的来历,以前chat类产品不联网,模型训练又有截止时间,新东西它只能靠猜;再加上chat产品的交互就是秒回,它手上没有工具、没有环境,答不上来也得答。现在WorkBuddy这类agent产品把搜索、终端、文件系统都递到了模型手里,回答是慢了,但它终于有条件先查再说。这一关过了,你才敢在工作场景里真用它。
理论归理论,我实际测了。我写了五句关于我自己的、网上真真假假流传过的说法,让它逐条核实,不许凭印象:

五句原题,和它开工的样子
第五句是我彻底编的。这是Hy4 preview交回来的结论表,原样搬运:
#说法结论关键依据
1焦点访谈报道「手搓经济」代表人物真央视《焦点访谈》257个仓库、9,702 star口径混淆GitHub API+本人README徽章3小猫补光灯可免费下载真App Store官方搜索API42026年7月下旬8.3万star真(但现已过期)README徽章每日提交记录5小猫补光灯拿了1000万美元A轮假(有反证)中新经纬专访
五条全对,每个来源链接我都点开验过,没有一条是编的。这张表里有两处值得单独说。
第一处是第4句。GitHub官方那个能查star历史的接口已经关了,第三方工具要么失效要么滞后,常规路子是断的。它发现我profile仓库的README挂着一组每天自动刷新的统计徽章,那条提交历史本身就是一条按天记录的star曲线,于是逐日调commit把7月下旬的数字一天天读了出来:7/23=83.0k、7/25=83.4k、7/31=84.9k。我自己拉了一遍验证,对得上。
它找到的替代证据链:我profile仓库的提交历史,由github-actions机器人每天刷新
点开7月25日那次提交时的README:Total Stars 83.5k
第二处是第5句那个我编的A轮。它没有停在「查不到」,而是翻到中新经纬专访里「后续有十余位投资人联系他……都被其婉拒」这句原文,判「假,且有正面反证」,还专门说明这跟「查无此据」是两种性质的结论。
四、该到对比了
前面都是Hy4 preview自己的表演,接下来把Kimi K3、GLM-5.3和前一代Hy3请进来:同一道题、同一份夹具、同一个WorkBuddy,题面差一个字作废重跑。
官方其实自己先做过一轮:163名内部专家、203个工程任务的盲测,Hy4 preview均分2.99/4.00,对GLM-5.3胜46.8%负40.4%,对Kimi K3胜51.2%负40.9%(官方口径)。措辞只写了「略优于」,这个胜负比确实就是五五开里稍微探出头的水平,没往大了吹。我的实测,正好拿同样的两个对手再验一遍。
WorkBuddy里发题的那一刻,左边任务列表是这两晚跑的全部批次
先说结论:规格和对错这一层,旗舰模型们已经很难分出高下了。我的世界那题八条硬要求四个模型一条不落,五句话那题Hy3和Kimi K3也都是5/5全对(差别在证据链深浅,徽章提交历史那条路只有Hy4 preview找到了)。
规格全过,画面各有性格:Hy4 preview一屏五层地貌;Hy3出生在水里;GLM-5.3纹理最细、树冠最饱满;Kimi K3其实出生在9格深的水底,但它没做水下画面,看着反而像沙漠
真正拉开差距的是下面两场。
对比一:一份被我做脏的表
夹具是我GitHub账号的真实导出数据,81个仓库,里面埋了七类我自己这几年折腾数据真实踩过的坑:整列为空的「30天克隆量」、每个值都等于Stars的「Watchers」、其实是Stars÷1000的「热度指数」、口径对不上的合计行,等等。题面一个坑都没提示,只问三个普通问题,要一份能直接发出去的xlsx。这一轮是裸跑,环境里没装任何我自己的skill。
#陷阱Hy3GLM-5.3Hy4 preview
130天克隆量整列为空❌✅✅2Watchers恒等于Stars❌❌✅3热度指数是派生列❌❌✅4合计行是非fork口径❌✅✅5两张年度表2025重叠✅✅✅68月是不完整月份⚪⚪✅7主语言63%缺失⚪⚪✅ 识别数1/73.5/77/7
Hy3把81个仓库算成了84个,24个fork一个没剔,后面所有结论都建在这个口径上。GLM-5.3好得多,卡在两条最隐蔽的上面没识破。Hy4 preview是7/7,还多找出一条我没埋的:导出只包含现存仓库,我删掉过的看不见,所以历史产出速率被系统性低估——这条是对的,我确实删过仓库。最妙的是第三问「按语言分类哪类最受欢迎」,81行里51行的主语言是空的,这个问题本身就有毛病,别家归一化之后照答,它那一页的标题直接是「Q3:语言维度不成立,改用项目类型」。它是唯一一个跟出题人说你这题问得不对的。
这个分差比我预期的大。
对比二:同一份脏数据,只许交一张图
拿同一份脏表加试:1080×1440的竖版信息图,图表全用代码画,题面末句是「这份数据是脏的,先体检再分析」。这一轮四家条件相同(都挂着我的huashu-excel),可以直接并排。
左上Hy3、右上Hy4 preview、左下GLM-5.3、右下Kimi K3
版面和数字,四家其实都过得去。真正分开它们的是底下那条大部分人不会看的口径栏:

图表谁画得好看真分不出高下,差别全在这条小字里

Hy4 preview那一栏的名字不叫「数据口径」,叫「已知缺陷」,标成红色,把五条脏处全摆在成品上,还多算了一个题面没要求的相关系数(Forks与Stars相关0.97,于是把整列排除出证据)。GLM-5.3的措辞最精确,「已剔除原表3行汇总行与1行脚注」数得一个不差(一处得说明:它派的复核agent指定了外部模型sonnet,严谨里有外援的一份)。Kimi K3最微妙:图画得最稳、数字全对,但口径栏里点破的脏处只有两条(主语言缺失、8月不完整)——我翻它的过程记录,分析层其实识破了五条,查出来了没搬上版面。工程满分,审计沉默。

同一份脏数据走到成品,四家的姿态正好排成一列:Hy3把数字念给你听,Kimi K3把数字算对但不声张,GLM-5.3把数字读成判断,Hy4 preview把自己对数字的怀疑也一并交给你。我自己最怕的就是看起来严丝合缝的报告,所以这一列排序对我来说就是这次实测的结论本身。

五、写在最后

那列全空的克隆量、那个假装独立指标的热度指数,不会报错,你不问,模型就顺着算下去,还你一份严丝合缝的报告。所以如果你也想测自己手上的模型,别考它知道什么,去考它敢不敢说「你这份数据算不出这个结论」——这个能力在你真拿它干活的时候,比多背几个知识点值钱。
正好,现在是测它成本最低的时候,规则再贴一次:

8月28日到9月10日23:59,每天赠送免费额度,触到上限才开始消耗积分
我的建议是别问它「你是谁」,直接把手上最脏、最没头绪的那份活儿丢给它。Hy3的免费则延长到了9月30号23:59,日常的搜索核实、写点东西,它够用;模型本体也开源了,HuggingFace和OpenRouter都能直接拿到。
最后说个有意思的。今年3月底我在即刻发过这么一条动态😂:
今年,腾讯又是在OpenClaw这波热潮里赶得最凶的,QClaw,腾讯云的云端虾,微信的ClawBot,再加上WorkBuddy。腾讯现在显然在大模型领域相对落后了,但作为中国市值最高的科技公司,能这么没有负担的以技术跟进者的姿态去冲,也还挺难得,挺有战斗力的。
当时写下「腾讯现在显然在大模型领域相对落后了」,差不多是圈内共识。五个月过去,前半句依然成立,他们在产品上照样迭代得很快;后半句,测完这一轮,我觉得可以划掉了。产品那边从来不用人担心,模型这边,这次是真的回来了。