为什么给智能体注入更多记忆并不总是更好?
因为模型对指南的吸收和应用能力不同:强模型可以从完整指南集中获益,较弱模型可能被大量指南淹没,而已饱和模型几乎没有可测量的提升,所以记忆剂量需要根据模型能力校准。
(翻译)你的智能体到底需要多少记忆?

A Blog post by IBM Research on Hugging Face
IBM Research 发布博客,介绍 ALTK-Evolve 在智能体记忆规模上的研究。通过对八种模型在 AppWorld 基准上的测试,发现智能体记忆并非越多越好,需按模型能力调节:强模型适合完整指南集合,弱模型宜采用核心指南加按任务检索,已饱和模型无明显收益。检索最优方案可提升任务完成率并控制推理成本。
因为模型对指南的吸收和应用能力不同:强模型可以从完整指南集中获益,较弱模型可能被大量指南淹没,而已饱和模型几乎没有可测量的提升,所以记忆剂量需要根据模型能力校准。
对较弱模型采用固定高置信核心指南加按任务检索子集的策略,gpt-oss-120b 仅增加约 5% 的 token,任务完成率提升 16.1 个百分点;提示缓存可进一步降低生产环境成本。
它从智能体自身成功与失败的轨迹中抽取行为指南,并在推理时注入完整指南集或按任务检索的指南子集,不更新模型权重,也不需要人工标注。
全球扩散语言模型最大融资诞生:经纬、顺为、君联数亿元押注扩散智能DiffuSpace土耳其禁止15岁以下儿童使用社交媒体���号国内航线燃油附加费今起上调.NET多类型数据库通用库更新升级到V26.10.9北京:加大新能源汽车推广力度 培育汽车消费新增长点Cloudflare 让决策模型打起了价格战:Clef 降价、提速、上多模态英国拟未来四年投,10亿英镑扶持创新集群Nano Banana 2.1 九种实战用法:从多图一致性到"养图",附完整提示词独家丨阿维塔酝酿高层调整:董事长王辉已开始负责长安海外业务海航控股旗下北京新华顺航商贸公司增资至22亿阿里开始给AI算账了:用AI的钱,以后各业务线自己出
三星钱包默认用 USDC:能留住多少美元?
乱序 HTML 流技术从 JavaScript 框架转移到浏览器中Claude、GPT“跨界”做视频,Seedance们的护城河还牢吗?
Sui 难民:华语开发者为什么选择离开?人人皆可为师:全球首个物理AI数据众包服务平台“觅蜂派”正式发布ToolForge v0.1.8 正式发布:一口气新增 11 款实用工具,开源桌面工具箱持续进化!Cloudflare 收购 Deno,Deno 停止开发近期海外进出口传闻的政策限制对公司是否有影响? 天孚通信回应AI数据中心用电狂飙,美国密西西比州发出电力预警国内金饰价格集体上涨独家丨蔚来李斌最新内部讲话:明年将有重量级新车,未来3年的核心是三个聚焦为什么 AI 产品需要体验评测App+1|专注星空:让「少刷手机」这件事更愉悦一点公司是否有提价计划?五粮液:不存在固定的价格比值关系
COIN、HOOD、CRCL:链上金融三种模式JEPA、空间智能路线正面交锋:WorldArena 2.0 挑战赛开考「能不能被机器人真正用起来」| IROS 2026
Modal 破解 Kubernetes 限制,在几秒内扩展 100 万个并发沙箱当所有人都用AI写内容,你的个人IP靠什么胜出?AI时代,注意力经济终局,意图经济登场