Agent 记忆不是越多越好:ALTK-Evolve 如何按模型能力调剂经验剂量
笔名:小六 / 上海 / 1995 女 / 某互联网公司工程师
先说结论
IBM Research 团队在 2026 年 8 月 18 日发布 Hugging Face 官方文章《How Much Memory Does Your Agent Actually Need?》,给 Agent 记忆系统提出了一个比“把历史都塞回上下文”更重要的问题:不同能力的模型,应该接受多少经验。文章基于 AppWorld 的 585 个多步任务和 8 个模型比较 ALTK-Evolve 的两种记忆注入方式,发现强模型有剩余能力时适合完整经验集,较弱模型更适合“高置信核心 + 按任务检索”,已经接近饱和的模型则未必从额外记忆中获益。
这篇文章对 Agent 工程的核心启发是:记忆不是开关,而是需要校准的上下文剂量。我的判断很明确:先做记忆内容的蒸馏,再根据模型和任务分层投放;不要把“更多历史”误当成“更聪明”。
发生了什么
主体来源是 Hugging Face 官方博客《How Much Memory Does Your Agent Actually Need?》,发布日期为 2026-08-18:
文章延续 IBM Research 前一篇关于 ALTK-Evolve 与 ACE 的研究,但这次不再主要比较“每个任务检索几条经验”和“每一步注入全部经验”,而是把问题往前推了一步:一个 Agent 到底应该获得多少记忆,才不会被记忆本身拖累。
官方实验的记忆并不是逐字回放历史对话,而是从 Agent 过去成功和失败的轨迹中提炼出的可复用 guidelines,例如有效策略、需要避免的错误和边界情况。ALTK-Evolve 会把这些经验归纳成指导集合,在推理时选择全部注入,或只注入固定的高置信核心加上与当前任务相关的少量经验。整个过程不更新模型权重,改变的是推理时可用的指导信息。
下文中的实验数字和模型分类属于官方文章事实;关于如何迁移到普通 Agent、如何设计记忆闸门,是我的工程判断。
技术细节
1. Agent 记忆改变的是上下文,不是模型本体
ALTK-Evolve 的学习环路可以抽象为:
1 | |
这个方案不修改模型权重,所以相对容易迁移到不同模型,也不需要为每个模型重新训练参数。它的代价和风险则集中在上下文:经验写得是否准确,检索是否命中,注入数量是否合适,以及多条经验之间是否互相冲突。
这与把完整历史对话重新贴回提示词是两回事。历史对话包含大量偶然细节,而 guideline 更像经过压缩的策略层。对于 Agent 来说,真正有价值的记忆不应该只是“过去发生过什么”,还要回答“下次遇到类似状态时,哪些行为值得复用”。
2. 三种模型形态对应三种记忆剂量
官方在 8 个模型上观察到三种重复出现的模式。
第一类是有发挥空间的强模型。它们能够吸收完整 guideline 集合,包括低频但可能有用的边界经验。DeepSeek-V3.2 在完整经验集下,任务完成率 TGC 从 79.8% 上升到 89.3%,提升 9.5 个百分点;更严格的场景完成率 SGC 从 64.3% 上升到 80.4%,提升 16.1 个百分点。
第二类是较弱或容易被上下文淹没的模型。它们更适合固定的一组高置信核心,再加上每个任务动态检索的少量指导。gpt-oss-120b 使用这种 curated retrieval 后,TGC 从 39.9% 上升到 56.0%,提升 16.1 个百分点;SGC 也从 21.4% 上升到 37.5%。相比注入完整经验集,选择性投放既更有效,也更省 token。
第三类是已经接近饱和的模型。文章把 GLM-5 归到这种观察模式:基线 TGC/SGC 为 87.5%/80.4%,加入完整经验集后仍为 87.5%/80.4%,没有可测提升。作者也明确说明,“饱和”是对实验现象的描述,不是已经证明的因果结论,可能与任务上限、经验覆盖范围或模型是否真正应用指导有关。
这里有一个重要边界:模式不只由参数量决定。模型在任务上的剩余空间、上下文窗口、架构、guideline 质量和任务分布都可能影响结果。不能简单地规定“大模型全量、小模型检索”,而应该用任务集校准。
3. 记忆策略同时影响质量和成本
官方给出了清晰的 token 对比。DeepSeek-V3.2 使用完整 guideline 集合时,平均每个任务 token 从 148K 增加到 263K,开销约上升 78%;gpt-oss-120b 使用完整集合时,从 110K 增加到 166K,开销约上升 51%;同一个 gpt-oss-120b 使用 curated retrieval 时,只从 110K 增加到 116K,开销约上升 5%。
这组数字说明,选择性检索不只是“少塞一点内容”,还可能同时带来更好的任务完成率和更低的输入成本。尤其对 gpt-oss-120b,+16.1 个百分点的 TGC 提升只付出了约 5% 的 token 增量,属于质量与成本同时改善的情况。
文章还指出,DeepSeek 使用记忆前后的 ReAct 步数大约都在 18 到 19 步,新增开销主要来自每一步重复注入 guideline,而不是 Agent 走了更多步骤。生产环境的另一个效率杠杆是 prompt caching:如果把稳定的 guideline 前缀保持不变,就有机会缓存这部分重复输入,降低完整集合的有效成本。
4. 评测边界比“记忆有效”更值得看
实验使用 AppWorld 的 585 个多步任务,覆盖 9 个模拟应用,包括日历、消息和支付等场景。任务同时使用两种指标:TGC 衡量 Agent 是否完整完成单个任务;SGC 更严格,要求一个场景的所有变体都通过。
这两个指标的差别很有价值。只看平均任务完成率,可能会忽略那些“常规样例能做对、边界变体总失败”的问题。文章中 DeepSeek 的 TGC 提升为 9.5 个百分点,但 SGC 提升达到 16.1 个百分点,说明经验指导尤其帮助 Agent 处理场景变体和边界条件。
不过,AppWorld 仍是模拟环境。迁移到真实系统时,还要额外测记忆污染、过期经验、权限变化、工具版本变化和数据泄露风险。记忆在离线 benchmark 上有效,不代表可以直接把全部历史指导放进生产 Agent。
对 Agent / 工程的影响
第一,记忆系统要增加“剂量路由”
现有很多 Agent 记忆实现只有一个开关:启用或禁用。更稳的设计应该至少有三档:不注入、核心经验加任务检索、完整经验集。路由器根据任务复杂度、模型能力、上下文剩余空间和历史验证结果选择档位,并把选择原因记录下来。
这会让记忆从黑盒提示词拼接变成可观测的工程组件。每次任务都可以知道注入了哪些经验、总长度是多少、命中了哪些检索结果、最终是否改善了任务完成。
第二,弱模型更需要高质量筛选,而不是更多内容
如果模型容易被长上下文干扰,记忆系统首先应该提升 guideline 的置信度和相关性,而不是继续扩大经验库。可以为每条经验保存来源任务、成功或失败证据、适用条件、最近验证时间和冲突关系。核心集合只保留跨任务稳定复现的指导,边缘经验通过检索按需加入。
这与普通知识库的“相关就召回”不同。Agent guideline 不只是事实,还包含行动建议;一条在旧工具版本上有效的建议,可能在新版本中变成错误动作。因此,记忆必须有生命周期和失效机制。
第三,强模型的完整记忆也要做缓存和边界治理
对于有剩余能力的强模型,完整 guideline 集合可能带来更好效果,但每一步重复注入会增加输入成本。工程上应该把稳定前缀和任务动态部分分开,让缓存能够命中;同时设定总长度上限,避免少数异常任务把整套历史无限膨胀。
完整记忆也不等于无条件可信。即使模型能吸收更多经验,也要过滤包含隐私、临时状态、错误结论和不可逆操作建议的条目。内容越多,治理责任越重。
第四,记忆评测必须和模型、任务一起做矩阵
至少应该建立“模型能力 × 记忆剂量 × 任务类型”的回放矩阵。任务可以分成单工具、短链路、多步规划和高风险状态修改;记忆可以分成无记忆、核心加检索和完整集合;模型则使用当前实际候选后端。每组记录任务成功率、严格场景通过率、输入 token、端到端延迟、重试次数和人工接管率。
只有这样,才能回答“记忆到底有没有用”,而不是只看到一条漂亮的平均分。某个模型的最佳配置,不能自动复制给另一个模型。
我的判断
ALTK-Evolve 这项工作的价值,不在于证明“给 Agent 加记忆就会变强”,而在于证明记忆投放存在明显的模型依赖和成本边界。我的建议是:先把经验蒸馏成可验证 guideline,再用小规模回放为每个模型校准剂量;默认从核心加检索开始,只有数据证明完整集合更好时才扩大注入。
对生产 Agent 来说,最危险的不是记忆太少,而是把过期、冲突或不相关的经验包装成系统规则。记忆应该像一个有版本、有来源、有失效时间的配置层,而不是无限增长的聊天记录。
Q&A
Q1:来源和发布日期是什么?
A:主体来源是 IBM Research 团队在 Hugging Face 发布的 How Much Memory Does Your Agent Actually Need?,发布日期为 2026-08-18。文章介绍 ALTK-Evolve 在 AppWorld 上的多模型记忆剂量实验。
Q2:ALTK-Evolve 会更新模型权重吗?
A:不会。它从 Agent 轨迹中提炼 guideline,并在推理时注入完整集合或任务相关子集,改变的是上下文中的指导信息,而不是模型参数。
Q3:应该给所有模型注入完整记忆吗?
A:不应该。官方观察到强模型、有剩余能力时可能受益于完整集合;较弱模型更适合高置信核心加任务检索;接近饱和的模型则可能没有可测收益。必须用自己的任务集校准。
Q4:选择性检索为什么可能更便宜?
A:它只注入固定核心和与当前任务相关的少量经验,避免每个 ReAct 步骤重复发送整套 guideline。官方对 gpt-oss-120b 的实验显示,TGC 提升 16.1 个百分点,而 token 开销只增加约 5%。
Q5:这项实验能直接证明生产 Agent 也会变好吗?
A:不能。AppWorld 是模拟环境,真实系统还要验证记忆过期、工具变化、权限、隐私、冲突和长时间运行后的漂移。它提供的是剂量校准方法,不是无需验收的生产承诺。
参考资料:
- How Much Memory Does Your Agent Actually Need? — Hugging Face Blog(2026-08-18,IBM Research 官方文章)
字数自检:≥1500 个中文字符(不含 frontmatter)
隐私自检:未写入个人姓名、用户相关代号、内部网络细节、凭据或会话标识
封面 seed:2026-08-19-agent-memory-dose(唯一)
coverWidth/Height:1600 / 900
categories:ai_tech