本文作者:Orange AI(@oran_ge)。版权归作者所有,未经授权禁止转载。
昨晚 Kimi K3 发布后,我看到参数量真的很意外,当时有点激动,随口发了一条推。
我个人也不喜欢天天震惊体,而且我很少用「震惊」形容一个模型,之前今年唯一的一次,是在吐槽 GPT 5.6 的极丑审美,那个丑是真的震撼到我。

其实我最大的意外是,K3 的模型参数已经来到了 2.8T,我原以为这个参数规模的开源模型,要等到 Q4 才会有,因为这是很多国内模型下半年最重要的计划,而 Kimi 在 7 月中旬已经训练完成了(通常实际训练完成的时间比发布时间更早,很有可能是在 6 月就训练完成的)。
有人从推理速度和价格推断,Opus 模型的参数量大约是 2.5T,马斯克有一次说大概是 5T,都不一定准确,但大概率就是在 2-5T 之间,GPT 5.6 Sol 也差不多这样,大差不差。
而 Mythos/Fable 明显是 next level 的模型参数量,很多人预估接近 10T,估计下个月发布的 GPT 6 也会差不多。
所以我说,K3 这个参数量,已经达到了 Opus 的级别,代表了中国开源模型追平了今年年初 Opus 4.5/4.6 的参数量。也就是说中国模型距离世界一线开源模型的差距,可能缩短到了半年左右。
训练超大参数模型这件事绝非易事,预训练做大,除了需要很多钱之外,还需要充足的算力是多次的试错,参数量翻1倍,训练成本和风险可能要翻3倍。一次训练崩掉,数千万美元可能就蒸发了。
这就是为什么 K3 的发布,意义是非常重大的,因为在今年上半年, Opus 是一座高山,人人都说超越 Opus,但要真正超越 Opus,2T 以上的参数几乎是必须的,全球能把模型训练到这个规模的公司也是一只手能数的过来的。
K3 是第一个有望全面对齐甚至在部分领域超越 Opus 的开源模型。
如果真的如此,那 K3 就把大模型两个代差缩短到了一个代差。
这也是为什么我会说,Kimi 接下来的模型,是要照着 Fable 去了。
越过一座山丘,望向下一座更高的山,next level。
模型的指标方面,其实业界都知道指标意义没那么大,看看就好,相对和体感比较共识的是 AA 的指标,Kimi K3 排名第三,能和世界顶级的两个模型 Fable 5 和 GPT 5.6 Sol 掰掰手腕。

一个模型的真实能力,最终还是得放到真实的复杂项目里实测一段时间才能给出论断,所以姑且再用几天再给出结论。 像 Coding 和 Agent 这类的的指标相对客观,大家可以参考一些指标来做判断,不过在 Coding 之外,我确实还有三个特别关心的点。 第一个我在意的点是模型的独立思考。 这个我真的很 care,模型本来就有幻觉,很容易顺着人的话往下走,这样的模型会给人也造成很大的幻觉。 比如我们把一句有争议的话,放到美国豆包 Gemini 里试试

emmm,就很美国豆包,用更通俗的话来说,就是极度谄媚。 我们再放到 Kimi K3 里试试,模型明显在以独立思考的方式来判断,并且指出了这句话的盲区。

在此之前,独立思考最强的模型是 Opus,连 GPT 5.6 都有一点略带迎合。 第二个我在意的点是模型的文字驾驭能力。 虽然大家都知道 coding 是第一生产力,但程序员这个群体的 AI 渗透率已经很高了,人群也就那么少,Agent 最终突破 DAU 还要靠白领,白领的工作里就是有很多文字工作。 之前的开源模型,在 coding 方面有些能达到 Opus 水平,但没有一个能在写作方面接近。 要写好一篇文章,比想象的更难,因为缺乏明确的奖励信号,也没有人专门去训练这方面的能力(相比 coding,ROI太低了),一般都是靠模型参数和语料的 scaling 自然变好。 现代模型都太厉害了,写的文章信息密度过高了,看起来都很难受,我想到可以让他们写散文来测试文风。 这是我让 K3 和 GPT 5.6 Sol 对同一个主题写的一篇散文,都让他们写完之后第一版之后反思 AI 味儿再写第二版。 先看看 K3 写的 散文写得很有画面感,不是流水账也不是议论文,同时一些词的用法非常之地道。

下面这篇是 GPT 5.6 写的,可以对比感受下。

另外令人意外的是在海外的英文写作评估中,Kimi K3 竟然超过了 Fable 5,这也是第一次有开源模型成为写作领域的第一。

第三个我在意的点,就是模型的产品设计能力和工程能力。 在用 K3 的时候,我能明显感觉到模型的「雄心」,它具备自主规划长程任务,且不怕给自己找麻烦的能力倾向。 我让它基于1000条笔记做一个笔记成长看板,它发现我没给它笔记之后,为了真实模拟,先给自己安排了任务,生成了1000条笔记(这种认真的态度大为震撼)。

在设计看板时,它自己规划了超过5种成长系统的展现方式,这些都不是我要求的,是它主动给自己加的难度。 在进行风格设计方面,只需要说清楚参考标的,整个网站的风格都会自主设计,并且遇到素材不足时,会自动创建素材。 这是成品的视频演示,审美也是极好的,我给的参考是几个游戏的名字,它自己总结的风格是「冒险手帐风」。
海外那边,Arena 的前端盲测,Kimi K3 甚至超过了 Fable 5 成为最强前端模型,可见审美的调教很有水平。

价格方面,Kimi K3 对齐了 Sonnet,是 Opus 的三分之二,我认为是个公允的定价,但直接用 API 一般人消费不起,还是建议大家去买个 Coding Plan 来用,根据我对国内算力的预估,这个很快也会和 GLM 一样限购。 总而言之,Kimi K3 是综合模型实力达到世界第一梯队的模型,也已经成为我日常的模型选择之一,值得在真实的项目里多试试。