说一个反常识的真相,Agent如今在真实工作场景的成功率依然很低。
本文作者:数字生命卡兹克(@Khazix0918)。版权归作者所有,未经授权禁止转载。
上周一,我发了自己做的AIHOT大模型排行榜。
有很多朋友感兴趣,在文章下面评论,最高赞的一条,是在问能不能有个分类测评,能够评估不同模型做不同任务的表现。
讲道理,这其实一直是我想做的,也是我觉得特别特别核心的痛点。
现在的大模型榜单很多,比如LiveBench、DeepSWE之类的,可以很快知道哪个模型在某一个能力维度上更强,像Coding、数学、浏览器操作等等。
但是有一类评测集,其实是最稀缺的。
就是模型在真实工作中的实际完成效果。