Axton

我做了个测 AI 味的评分器,翻车了 | AI 精英周刊 046

本文作者:Axton(@AxtonLiu)。版权归作者所有,未经授权禁止转载。 在日常工作流里,我们多半已经在用 AI 给各种内容打分:文章质量、Agent 评估、选题、作业。这些分数看似客观,但它们到底在奖励什么?前几天我做了一个测试文章「含人量」的评分器,在准备交付前抓到了它作弊:作者一个字没改,仅仅因为多给了一份背景资料,分数就从 20% 涨到了

最强模型开始挑人:GPT-5.6 发布了,但你可能根本用不上它 | AI 精英周刊 044

本文作者:Axton(@AxtonLiu)。版权归作者所有,未经授权禁止转载。 GPT-5.6 Sol 发布了,但普通用户现在大概率用不上。OpenAI 把它放进小范围预览,先给受信任合作伙伴;Anthropic 的 Fable 5 / Mythos 5 更直接,发布后三天就因为美国政府指令暂停访问,最新恢复也只先给一部分关键基础设施和网络防御组织。 很多人说,模型越来越强,提示词工程和系统设计就不重要了。
AI一起学
00:00:00 00:00:00