为什么给智能体注入更多记忆并不总是更好?
因为模型对指南的吸收和应用能力不同:强模型可以从完整指南集中获益,较弱模型可能被大量指南淹没,而已饱和模型几乎没有可测量的提升,所以记忆剂量需要根据模型能力校准。
(翻译)你的智能体到底需要多少记忆?

A Blog post by IBM Research on Hugging Face
IBM Research 发布博客,介绍 ALTK-Evolve 在智能体记忆规模上的研究。通过对八种模型在 AppWorld 基准上的测试,发现智能体记忆并非越多越好,需按模型能力调节:强模型适合完整指南集合,弱模型宜采用核心指南加按任务检索,已饱和模型无明显收益。检索最优方案可提升任务完成率并控制推理成本。
因为模型对指南的吸收和应用能力不同:强模型可以从完整指南集中获益,较弱模型可能被大量指南淹没,而已饱和模型几乎没有可测量的提升,所以记忆剂量需要根据模型能力校准。
对较弱模型采用固定高置信核心指南加按任务检索子集的策略,gpt-oss-120b 仅增加约 5% 的 token,任务完成率提升 16.1 个百分点;提示缓存可进一步降低生产环境成本。
它从智能体自身成功与失败的轨迹中抽取行为指南,并在推理时注入完整指南集或按任务检索的指南子集,不更新模型权重,也不需要人工标注。