本文作者:波妞PONYO(@ponyodong)。版权归作者所有,未经授权禁止转载。

凌晨一点,我盯着一支已经改到 V4 的 AI 广告片。生成镜头很快,让每一个工具知道客户刚刚改了哪句话,反倒拖住了整个项目。
最早的 Brief 要暖金色,第三版换成冷白;客户上午说片头不要 Logo,晚上又补了一句,可以出现,但要放到第二秒以后。我打开另一个 AI 工具,它能读很长的上下文,也能从历史记录里准确找到“片头不要 Logo”,然后一本正经地执行一条已经作废的要求。
这类时刻让我意识到,Agent 的下一轮竞争可能并不在“能接多少工具”。一个 AI 就算拥有更长的窗口、更多的工作流和更大的知识库,只要它分不清旧要求与当前状态,也无法把一次次修改沉淀成下一次可复用的判断,那么每次新任务开始,它仍然要从头学起。
我原本把这理解成记忆问题。读完 Alloomi 公布的两篇技术报告后,我发现记忆只是整条技术路线的第一层。一个能进入长期专业工作的 AI,至少要跨过三道门:记得住、学得会、做得成。

第一层:记得住,理解过去如何变成现在
传统 Agent Memory 常沿用 RAG 的办法:存下历史,向量检索,再把相似片段拼进提示词。它能找到“客户曾经说过片头不要 Logo”,却未必知道这条要求已经过期。
Alloomi 的 **Holistic Context 技术报告** 把上下文视为持续变化的工作状态。人物、项目、会话、文件与任务被归到统一实体和时间线上;新证据推翻旧结论后,系统保留来源、有效时间与替代关系。召回解决“找到过去”,全域上下文要解决“过去如何演变成现在”。
这层能力有三项公开结果:
- LongMemEval\-S:97\.6%,对照 Mem0 V3 的 94\.4%,公开人类参考为 82\.9%。它覆盖长期信息提取、知识更新与多会话综合推理。
- LoCoMo\-V2:97\.4%,对照 Mem0 V3 的 92\.5%。它考察跨会话问答、人物与事件关系、时间关系和多跳推理。
- BEAM 10M:67\.0%,对照 Hindsight 的 64\.1%。它检验 Agent 在 1000 万 Token 历史里维持全局任务理解的能力。
团队开源的 **OpenContext** 是这条路线的一扇工程窗口。它仍处于早期阶段,我的上手结果更适合作为技术方向的辅助证据,而不是整篇文章的主题。
记得住只是起点。下一步要看这些上下文和修改反馈,能不能沉淀成模型下一次可以复用的能力。

第二层:学得会,把修改和反馈变成能力
记住 V4 的要求,只能让这一次交付少出错。真正拉开差距的是,做完这次项目后,AI 能不能把“为什么采用 V4”带进下一次工作。
Alloomi 的 **Self\-Evolving Agent 技术报告** 给出了一条闭环:真实任务产生上下文、行动与反馈;系统先做质量筛选和专家锚定,再进入后训练;新版本通过评测才能准入,效果变差则回滚。它不是让模型自己复盘自己,而是让专家标准、任务结果和版本控制共同决定什么经验值得学。
这层能力有三项具体对照:
- CL\-Bench:47\.6%,对照 GPT 5\.6 Sol 的 21\.5%。它考察 Agent 能否从复杂上下文中学会新知识、新规则并用于后续执行。
- CL\-Bench\-Life:32\.1%,对照 GPT\-5\.5 High 的 22\.2%。它考察长周期、多阶段任务中的经验积累与迁移。
- Con\.L Bench:32\.6%,对照 Claude Sonnet 4\.6 的 22\.3%。它考察跨任务持续学习、环境适应和抗遗忘;该结果比对照高 10\.3 个百分点。
技术报告里还有一组更适合判断机制是否有效的同 backbone 结果:固定 Qwen3\.6\-35B\-A3B 后,CL\-Bench 从 FewShot 的 24\.5% 提升到 47\.6%。参数底座没换,改变的是筛选、回放、蒸馏与受控更新这套学习闭环。
__XPOSTER_gmwdj_IMAGE_3__
第三层:做得成,让学习落到真实交付
AI 记住了历史,也学会了规则,最后仍要接受真实工作的检验。它能不能处理高经济价值职业任务?能不能修复真实 GitHub 问题?连续工作时,前一个任务学到的经验会不会在下一个任务里派上用场?
- GDPval\-AA Normalized:74\.2%,对照 Claude Opus 5 的 67\.9%。这项评测覆盖 44 类职业中的高经济价值任务。
- JobBench:57\.5%,对照 Kimi K3 的 54\.7%。它考察真实职业任务、复杂工作流程和专业结果交付。
- SWE\-Bench\-CL:80\.6%,对照 OpenCode \+ Kimi K3 \+ FAISS 的 73\.3%。它要求 Agent 修复真实 GitHub 问题,同时检验跨版本连续软件工程中的经验迁移与抗遗忘。
这些 benchmark 使用的模型、任务与评分协议并不完全相同,不能把九个百分比相加,也不能把每一行都当成同条件横评。它们共同回答的是三个连续问题:AI 能否保持长期工作状态,能否从任务与反馈中学到新能力,学到的能力最终能否改善真实交付。
这三层背后,是同一条技术闭环:
真实任务轨迹 → 质量筛选 → 专家锚定 → 后训练 → 评测准入 → 版本回滚。
应用进入真实工作,捕获公开互联网里没有的专家判断与修改依据;Holistic Context 把碎片组织成可追溯的经验;Self\-Evolving Agent 再把经过筛选的经验写回模型能力;评测与回滚控制更新风险。

回到那支凌晨一点还在修改的广告片。我想要的并不是一个永远记得所有聊天记录的 AI。我想要的是:它知道哪条要求已经失效,理解我为什么接受 V4,并在下一个项目里少让我解释一遍,甚至交出更好的第一版。
人类同事会随着项目经验增长。数字员工也应该如此。
Alloomi 想做的,正是让 AI 每完成一次交付,就获得一次成长。
了解 Alloomi
官网:https://alloomi.ai 官方 X:https://x.com/AlloomiAI 官方账号:@AlloomiAI #Alloomi
延伸阅读
- Holistic Context 技术报告
- Self\-Evolving Agent 技术报告