Margrop
Articles410
Tags880
Categories7

Categories

1password 24GB VRAM 2K 3.6 Flash 30B dense 30s timeout 4-bit 量化 6-DoF SLAM AC ACL ACL 切换 ACP AI AI Agent AI Coding Assistant AI Tech AI tutor AI 安全 AI 应用 AI 日记 AI编程助手 AI辅助 AI辅助编程 ALTK-Evolve AMIE AP API API 定价 API 降价 ARC-AGI-3 ASR ATEM chat 模板 Agent Agent Harness Agent Memory Agent 入侵 Agent 工程 Agent 架构 Agent 检索 Agent 沙箱 Agent 系统 Agent 路由 AgentPlan Agentic AI Agentic tools Ai2 Alertmanager AllenAI Android 17 Antigravity AppDaemon AppWorld Aqara Astra Attention Baseten Blog CC-Switch CI/CD CLI Tools CLI 工具 CLI工具 CPU 推理 CSRF Cache Hit Rate Caddy Categories 404 ChatGPT Claude Code Claude Sonnet ClawLoader Cloudflare Code Interpreter Codex Coding Plan Coding Plan Dashboard ComfyUI Computer Use Context Compression Cookie 认证 Cosmos-H-Dreams Cost Optimization Cron D1 DFIR DIY-MINI Date DeepSeek DeepSeek V4 Flash Diagrams.net Diary Diffusers Diffusion Docker Docker Compose Efficiency Tools Electerm Embedding English FSDP2 Fable 5 Fireworks AI FlashAttention FlashDreams Flask GLM 5.2 GLM-5.2 GPT-4.1 GPT-5.6 GPT-Live GPT-Red GPU 加速 GPU 性能分析 Gateway Gemini Gemini 3.5 Flash Gemini API Gemini CLI Gemini Omni Flash Gemma 4 12B Gemma Translator Gemma4 GitHub GitHub Actions GitHub PR Google Google AI Google Research Google Sheets Grabette Gripette HA HADashboard HF Security Incident HTTP Hailuo Hermes HermesAgent Hexo HomeAssistant Hugging Face Hugo IBM Research IP IPv4 Inference Providers Isaac Lab Java KV cache Kimi Kimi Code Kimi K3 Kubernetes LFM2.5 LFM2.5-VL LLM Router LVM‑Thin LeRobot Linux Liquid AI LiquidAI Live Translate LoRA Luna MCP MTP MacOS Magpie TTS Managed Agents Markdown Memory 上限 Meta Microsoft 365 Copilot MiniMax MiniMax H3 Mistral Shieldstral Model Routing MuJoCo Warp Multi-Agent Muse Glimmer MySQL NAS NIM NVIDIA NeMo Automodel Nemotron 3 Embed NewAPI Newton Nginx Node-RED Node.js Nunchaku OAuth 凭据 OCR OOM OlmoEarth On-device AI Open Source Open Viking OpenAI OpenAI 兼容 OpenClaw OpenCode OpenResty OpenWrt PII 检测 PPPoE Physical AI Pollen Robotics Portainer PostgreSQL ProcessOn Project Astra Prometheus Prompt Caching Prompt Injection Proxmox VE PyTorch Qwen3-VL Qwen3.6 RPC RTEB Real-Time Inference Red Teaming Responses API Restart SIGTERM SNAP SOCKS5 SOCKS5 代理 SPED SSH 审计 SSL SVDQuant Scientific Computing Self-Forcing Distillation Session Sheets canvas Shell Skill 管理 Sol Storage Buckets Strands Agents Subagent Surgical Robotics Synology NAS TTS Terra Think button TimeMachine TutorMoments UI 微调 UML Uptime Kuma V4-Pro VPN VPS VoiceEQ WARP Web WebRTC WebSocket Win11 Windows Workers World Foundation Model activate ad adb adblock agent agentic aligenie aliyun alpine annotation aop authy autofs backup baidupan bash bg-review bitwarden boot brew browser budget control caddy2 cc-switch-cli cdn centos cert certbot charles chat chrome classloader client clone closures cloudflare cmd command commit commoditization conn_id container cron 排错 crontab cross_sync ctyun cyber capability dashboard ddsm demo dependency deploy developer devtools disconnect topic dll dns docker domain download drafter draw drawio dsm dump dylib easytier edge environment hooks exception exit code 1 export fail2ban feign firewall-cmd flow fork free tier frontier hosted model frp frpc frps fuckgfw full-duplex function fuzzy match gateway gcc gfw git github glm-latest golang gperftools gridea grub guardrail lockout gvt-g hacs havcs heap hello hexo hibernate hidpi hoisting homeassistant hosts html htmlparser https huggingface_hub iKuai iMessage idea image img img2kvm immortalwrt import index inference cost install intel io ios ip iptables iptv ipv6 iso java javascript jetbrains jni jnilib jpa js json jsonb jupter jupyterlab jvm k8s keepalive keepalive ping timeout kernel key kid kms kodi koolproxy koolproxyr kvm lan lastpass launchctl learning lede letsencrypt linux live llama.cpp low-code lvm lxc m3u8 mac macos mariadb markdown maven md5 mdadm memory 上限 microcode mirror modem modules monitor mount mstsc multimodal mysql n2n n5105 nas network newapi nfs no close frame node node-red nodejs nohup notepad++ npm nssm ntp one-api 容器 oop open weights openclaw openfeign openssl openviking os otp ovz p14 packet capture pat pdf pem perf ping pip plugin png powerbutton print pro productive struggle proxy pve pvekclean python qcow2 qemu qemu-guest-agent rar reasoning control reasoning slider reboot reflog remote remote desktop renew repo resize retina root route router rule rules runtime safari sata scaffolding scheduled triggers scipy-notebook scoping scp self-play server serverless inference silent test simulated student skill_manage slmgr so socks source spk spring springboot springfox ssh ssl stash string supernode support svg svn swagger sync synology systemctl systemd tap tap-windows tapwindows telecom template terminal tls tmux token totp tvbox txt ubuntu udisk ui undertow uninstall unlocker upgrade url v2ray vLLM vhd viking_search vim vlmcsd vm vmdk web websocket wechat windows with worker wow xiaoya xml yum zai-org/GLM-5.2 zip 三维切片 上下文压缩 上下文工程 个人品牌 中国电信 临时关权限 临时提权 云电脑 交换机 人才争夺 人机协作 代理 企业 AI 优化 低延迟 体检 供应链 值班 健康检查 光猫 免费层 公众号 公网IP 内存 内存优化 内容发布 内网 内网IP 内网渗透 写作 凭据刷新 分布式推理 分布式训练 医疗 AI 升级 协作 协作习惯 协议层 协议转换 单平台型异常 博客 博客同步 博客改名 博客运维 卫星影像 反向代理 反诉 变更审计 可靠性 后台 Review 启动 告警 告警优化 周一 周一傍晚 周一焦虑 周三傍晚 周五 周六 周四傍晚 周四晚 周报 周日 周末 回滚 地球观测 地理空间推理 复盘评测 夏令时 多 agent 工具链 多 token 预测 多协议并发 多智能体 多模态 多模态 Agent 多节点 多节点管理 多语言 多通道并发 大厂人才战 大模型评测 天猫精灵 天翼云 失败模式 字体大小 安全 安全事件 安全意识 安装 定时任务 实战反思 实时语音 客户端 SDK 容器 容器网络 导入 小米 屏幕理解 工作感悟 工具审计 工具白名单 工具调用 工具调用拦截 工程团队 工程实践 工程笔记 常用软件 并发窗口 广告屏蔽 序列号 应用市场 延迟优化 开放 API 开权重 开源权重 开源模型 开源项目 异常 异步任务 异步委派 微信 微信公众号 微信限流 心智成长 心跳 心跳检查 性能优化 总账号数 感悟 成本优化 成本控制 打工 打工人 打工人日记 扩散模型 技术 抓包 按 provider 优先级 排查 排障 排障思路 推理加速 推理速度 推理预算 描述文件 提示词工程 提示词敏感性 故障 故障归因 故障恢复 故障排查 效率 效率工具 教育数据开源 教育评测 数据 数据工作流 数据流 文本编码器 断线重连 旁路由 无服务器 日志分析 日志排查 日记 时区 时段权限 显卡虚拟化 智能体集成 智能家居 智能音箱 暗黑风格 服务器 服务管理 本地 agent 本地安装 本地工具 本地接口 机器人仿真 机器人学习 机器人数据采集 权限管理 架构 框架级切片 梯子 模块 模型推理 模型精简 模型评测 模型路由 残存访问 治理层 流式推理 流程 流程图 浏览器 漫游 激活 火山引擎 火绒 灾难恢复 焦虑 独立仓库 玄学 生活 电信 画图 监控 监控系统 监管 直播源 直觉 磁盘 磁盘故障 磁盘管理 稀疏样本 稀疏注意力 立体声 端侧 AI 端口 端口冲突 端口扫描 管理 续期 网关 网络 网络风暴 群晖 群晖 NAS 脚本 脚本优化 腾讯 自动化 自动化反思 自动化运维 自动恢复 自动攻击 自动重启 自动重连 自托管 LLM 网关 自部署 苹果 虚拟机 视觉语言模型 视觉验收 视频生成 视频问诊 订阅额度 认证 证书 评测 评测基准 评测方法学 诉讼 语雀 语音 AI 语音 Agent 质量检查 资产清理 超时 跨平台 路由 路由器 软件管家 软路由 运维 运维日常 运维监控 进程生命周期 远程接口 连接保活 连接问题 通信机制 通知 邮件漏发 部署 配置 重试风暴 钉钉 钉钉断开 镜像 镜像源 长上下文 长连接 门窗传感器 问题排查 防火墙 阿里云 阿里源 集客 需求变更 风险控制 飞书

Hitokoto

Archive

Agent 记忆不是越多越好:ALTK-Evolve 如何按模型能力调剂经验剂量

Agent 记忆不是越多越好:ALTK-Evolve 如何按模型能力调剂经验剂量

笔名:小六 / 上海 / 1995 女 / 某互联网公司工程师

Agent 记忆剂量与模型能力的匹配

先说结论

IBM Research 团队在 2026 年 8 月 18 日发布 Hugging Face 官方文章《How Much Memory Does Your Agent Actually Need?》,给 Agent 记忆系统提出了一个比“把历史都塞回上下文”更重要的问题:不同能力的模型,应该接受多少经验。文章基于 AppWorld 的 585 个多步任务和 8 个模型比较 ALTK-Evolve 的两种记忆注入方式,发现强模型有剩余能力时适合完整经验集,较弱模型更适合“高置信核心 + 按任务检索”,已经接近饱和的模型则未必从额外记忆中获益。

这篇文章对 Agent 工程的核心启发是:记忆不是开关,而是需要校准的上下文剂量。我的判断很明确:先做记忆内容的蒸馏,再根据模型和任务分层投放;不要把“更多历史”误当成“更聪明”。

发生了什么

主体来源是 Hugging Face 官方博客《How Much Memory Does Your Agent Actually Need?》,发布日期为 2026-08-18

文章延续 IBM Research 前一篇关于 ALTK-Evolve 与 ACE 的研究,但这次不再主要比较“每个任务检索几条经验”和“每一步注入全部经验”,而是把问题往前推了一步:一个 Agent 到底应该获得多少记忆,才不会被记忆本身拖累。

官方实验的记忆并不是逐字回放历史对话,而是从 Agent 过去成功和失败的轨迹中提炼出的可复用 guidelines,例如有效策略、需要避免的错误和边界情况。ALTK-Evolve 会把这些经验归纳成指导集合,在推理时选择全部注入,或只注入固定的高置信核心加上与当前任务相关的少量经验。整个过程不更新模型权重,改变的是推理时可用的指导信息。

下文中的实验数字和模型分类属于官方文章事实;关于如何迁移到普通 Agent、如何设计记忆闸门,是我的工程判断。

技术细节

1. Agent 记忆改变的是上下文,不是模型本体

ALTK-Evolve 的学习环路可以抽象为:

1
2
3
4
5
6
7
Agent 执行任务并留下轨迹

从成功与失败中提炼行为准则

合并成可复用的 guideline 集合

推理时注入完整集合或任务相关子集

这个方案不修改模型权重,所以相对容易迁移到不同模型,也不需要为每个模型重新训练参数。它的代价和风险则集中在上下文:经验写得是否准确,检索是否命中,注入数量是否合适,以及多条经验之间是否互相冲突。

这与把完整历史对话重新贴回提示词是两回事。历史对话包含大量偶然细节,而 guideline 更像经过压缩的策略层。对于 Agent 来说,真正有价值的记忆不应该只是“过去发生过什么”,还要回答“下次遇到类似状态时,哪些行为值得复用”。

2. 三种模型形态对应三种记忆剂量

官方在 8 个模型上观察到三种重复出现的模式。

第一类是有发挥空间的强模型。它们能够吸收完整 guideline 集合,包括低频但可能有用的边界经验。DeepSeek-V3.2 在完整经验集下,任务完成率 TGC 从 79.8% 上升到 89.3%,提升 9.5 个百分点;更严格的场景完成率 SGC 从 64.3% 上升到 80.4%,提升 16.1 个百分点。

第二类是较弱或容易被上下文淹没的模型。它们更适合固定的一组高置信核心,再加上每个任务动态检索的少量指导。gpt-oss-120b 使用这种 curated retrieval 后,TGC 从 39.9% 上升到 56.0%,提升 16.1 个百分点;SGC 也从 21.4% 上升到 37.5%。相比注入完整经验集,选择性投放既更有效,也更省 token。

第三类是已经接近饱和的模型。文章把 GLM-5 归到这种观察模式:基线 TGC/SGC 为 87.5%/80.4%,加入完整经验集后仍为 87.5%/80.4%,没有可测提升。作者也明确说明,“饱和”是对实验现象的描述,不是已经证明的因果结论,可能与任务上限、经验覆盖范围或模型是否真正应用指导有关。

这里有一个重要边界:模式不只由参数量决定。模型在任务上的剩余空间、上下文窗口、架构、guideline 质量和任务分布都可能影响结果。不能简单地规定“大模型全量、小模型检索”,而应该用任务集校准。

3. 记忆策略同时影响质量和成本

官方给出了清晰的 token 对比。DeepSeek-V3.2 使用完整 guideline 集合时,平均每个任务 token 从 148K 增加到 263K,开销约上升 78%;gpt-oss-120b 使用完整集合时,从 110K 增加到 166K,开销约上升 51%;同一个 gpt-oss-120b 使用 curated retrieval 时,只从 110K 增加到 116K,开销约上升 5%。

这组数字说明,选择性检索不只是“少塞一点内容”,还可能同时带来更好的任务完成率和更低的输入成本。尤其对 gpt-oss-120b,+16.1 个百分点的 TGC 提升只付出了约 5% 的 token 增量,属于质量与成本同时改善的情况。

文章还指出,DeepSeek 使用记忆前后的 ReAct 步数大约都在 18 到 19 步,新增开销主要来自每一步重复注入 guideline,而不是 Agent 走了更多步骤。生产环境的另一个效率杠杆是 prompt caching:如果把稳定的 guideline 前缀保持不变,就有机会缓存这部分重复输入,降低完整集合的有效成本。

4. 评测边界比“记忆有效”更值得看

实验使用 AppWorld 的 585 个多步任务,覆盖 9 个模拟应用,包括日历、消息和支付等场景。任务同时使用两种指标:TGC 衡量 Agent 是否完整完成单个任务;SGC 更严格,要求一个场景的所有变体都通过。

这两个指标的差别很有价值。只看平均任务完成率,可能会忽略那些“常规样例能做对、边界变体总失败”的问题。文章中 DeepSeek 的 TGC 提升为 9.5 个百分点,但 SGC 提升达到 16.1 个百分点,说明经验指导尤其帮助 Agent 处理场景变体和边界条件。

不过,AppWorld 仍是模拟环境。迁移到真实系统时,还要额外测记忆污染、过期经验、权限变化、工具版本变化和数据泄露风险。记忆在离线 benchmark 上有效,不代表可以直接把全部历史指导放进生产 Agent。

对 Agent / 工程的影响

第一,记忆系统要增加“剂量路由”

现有很多 Agent 记忆实现只有一个开关:启用或禁用。更稳的设计应该至少有三档:不注入、核心经验加任务检索、完整经验集。路由器根据任务复杂度、模型能力、上下文剩余空间和历史验证结果选择档位,并把选择原因记录下来。

这会让记忆从黑盒提示词拼接变成可观测的工程组件。每次任务都可以知道注入了哪些经验、总长度是多少、命中了哪些检索结果、最终是否改善了任务完成。

第二,弱模型更需要高质量筛选,而不是更多内容

如果模型容易被长上下文干扰,记忆系统首先应该提升 guideline 的置信度和相关性,而不是继续扩大经验库。可以为每条经验保存来源任务、成功或失败证据、适用条件、最近验证时间和冲突关系。核心集合只保留跨任务稳定复现的指导,边缘经验通过检索按需加入。

这与普通知识库的“相关就召回”不同。Agent guideline 不只是事实,还包含行动建议;一条在旧工具版本上有效的建议,可能在新版本中变成错误动作。因此,记忆必须有生命周期和失效机制。

第三,强模型的完整记忆也要做缓存和边界治理

对于有剩余能力的强模型,完整 guideline 集合可能带来更好效果,但每一步重复注入会增加输入成本。工程上应该把稳定前缀和任务动态部分分开,让缓存能够命中;同时设定总长度上限,避免少数异常任务把整套历史无限膨胀。

完整记忆也不等于无条件可信。即使模型能吸收更多经验,也要过滤包含隐私、临时状态、错误结论和不可逆操作建议的条目。内容越多,治理责任越重。

第四,记忆评测必须和模型、任务一起做矩阵

至少应该建立“模型能力 × 记忆剂量 × 任务类型”的回放矩阵。任务可以分成单工具、短链路、多步规划和高风险状态修改;记忆可以分成无记忆、核心加检索和完整集合;模型则使用当前实际候选后端。每组记录任务成功率、严格场景通过率、输入 token、端到端延迟、重试次数和人工接管率。

只有这样,才能回答“记忆到底有没有用”,而不是只看到一条漂亮的平均分。某个模型的最佳配置,不能自动复制给另一个模型。

我的判断

ALTK-Evolve 这项工作的价值,不在于证明“给 Agent 加记忆就会变强”,而在于证明记忆投放存在明显的模型依赖和成本边界。我的建议是:先把经验蒸馏成可验证 guideline,再用小规模回放为每个模型校准剂量;默认从核心加检索开始,只有数据证明完整集合更好时才扩大注入。

对生产 Agent 来说,最危险的不是记忆太少,而是把过期、冲突或不相关的经验包装成系统规则。记忆应该像一个有版本、有来源、有失效时间的配置层,而不是无限增长的聊天记录。

Q&A

Q1:来源和发布日期是什么?

A:主体来源是 IBM Research 团队在 Hugging Face 发布的 How Much Memory Does Your Agent Actually Need?,发布日期为 2026-08-18。文章介绍 ALTK-Evolve 在 AppWorld 上的多模型记忆剂量实验。

Q2:ALTK-Evolve 会更新模型权重吗?

A:不会。它从 Agent 轨迹中提炼 guideline,并在推理时注入完整集合或任务相关子集,改变的是上下文中的指导信息,而不是模型参数。

Q3:应该给所有模型注入完整记忆吗?

A:不应该。官方观察到强模型、有剩余能力时可能受益于完整集合;较弱模型更适合高置信核心加任务检索;接近饱和的模型则可能没有可测收益。必须用自己的任务集校准。

Q4:选择性检索为什么可能更便宜?

A:它只注入固定核心和与当前任务相关的少量经验,避免每个 ReAct 步骤重复发送整套 guideline。官方对 gpt-oss-120b 的实验显示,TGC 提升 16.1 个百分点,而 token 开销只增加约 5%。

Q5:这项实验能直接证明生产 Agent 也会变好吗?

A:不能。AppWorld 是模拟环境,真实系统还要验证记忆过期、工具变化、权限、隐私、冲突和长时间运行后的漂移。它提供的是剂量校准方法,不是无需验收的生产承诺。


参考资料:

  1. How Much Memory Does Your Agent Actually Need? — Hugging Face Blog(2026-08-18,IBM Research 官方文章)

字数自检:≥1500 个中文字符(不含 frontmatter)
隐私自检:未写入个人姓名、用户相关代号、内部网络细节、凭据或会话标识
封面 seed:2026-08-19-agent-memory-dose(唯一)
coverWidth/Height:1600 / 900
categories:ai_tech

本文阅读量 --
Author:Margrop
Link:https://blog.margrop.com/post/2026-08-19-agent-memory-dose/
版权声明:本文采用 CC BY-NC-SA 3.0 CN 协议进行许可