提示缓存能带来多大的成本节省?
缓存命中的输入 token 成本比标准输入低 90%,缓存写入 token 则高 25%,1 小时 TTL 的写入成本为标准输入的两倍。对重复上下文的工作负载,输入 token 成本净节省约 75%。
(翻译)使用 Amazon Bedrock 提示缓存优化成本与延迟
Prompt caching in Amazon Bedrock can cut input token costs by up to 90% when you repeatedly send the same context to foundation models. This post walks through six practical prompt caching scenarios using the Converse API: message content, system prompt, tool definition, mixed TTL, tenant isolation,
本文介绍 Amazon Bedrock 提示缓存机制,通过 cachePoint 标记复用重复上下文,缓存命中的输入 token 成本可降低约 90%,并减少首 token 延迟。文章给出消息内容、系统提示、工具定义、混合 TTL、租户隔离及 LangChain 集成六个实践场景,并说明缓存作用域、token 阈值、TTL 与计费规则,附带完整可运行示例代码。
缓存命中的输入 token 成本比标准输入低 90%,缓存写入 token 则高 25%,1 小时 TTL 的写入成本为标准输入的两倍。对重复上下文的工作负载,输入 token 成本净节省约 75%。
需在请求中加入 cachePoint 标记,且标记前的内容需达到最低 token 阈值,例如 Claude Sonnet 4.5 与 4.6 为 1024 token,Opus 模型为 4096 token。缓存按 AWS 账号和区域隔离,默认 TTL 为 5 分钟,部分模型支持最长 1 小时。
共六种,从基础到进阶:消息内容缓存、系统提示缓存、工具定义缓存、混合 TTL 缓存、多租户缓存隔离以及 LangChain 框架集成。
不止一颗CPU?智能体经济时代,Arm对算力平台有了新理解和Jeff Dean押注同一方向,27岁清华助理教授创业,两个月融资数亿
“裁判”不想给阿莫迪吹暂停AI大模型工场2026 AI产业生态大会今日举办,大咖同台共探智能生长与产业共生
美团发布“手艺人Agent”,发型师可“吩咐”AI小帮手打理线上作品
具透 | Liquid Glass 设计改进、性能提升……iPadOS 27 中值得一瞥的新特性
芯片从业者拆解OpenAI造芯,还能再快3个月?
Uniswap v4上的恶意HooksFAST 发现极短周期、最轻双中子星系统
基元律动与无问芯穹达成战略合作,推进高质量Token供给与应用
AI 减速还是不减速:一场周末点燃的行业与政府对垒
美联储今起议息 沃什或成关键一票西门子不造机器人,为什么机器人进厂的故事里总有它?
CoinShares Q2 挖矿季报:矿企倒贴钱退出
早报|iOS27正式推送/比亚迪高管:燃油车在中国没有未来/iPhone 18 Pro渠道降价900元,苹果称不干预
豆包 2.1 Pro模型更新,已接入豆包工作
从”边卖边补”到”准备好再卖”:产品商品化的四步闭环9月21日,深圳前海!聊聊工业AI与生态共创的下一步
Agent开始调用基础设施,Kubernetes准备好了吗?企业案例分享:坤煜量子|36氪2026产业未来大会
英伟达开源 IMO 金牌配方:不仅是「人海战术」,1.5TB 显存做实 AI「 推恩令」?量子位2026人工智能年度榜单,正式启动!8点1氪丨8月一线城市房价上涨;携程上架510万一张的太空旅行船票;字节跳动上半年净利润出现下滑,但海外收入占比再创新高SDL3 移植到 HarmonyOS / OpenHarmony
号称人类造的最后一个 AI 要来了,刷屏全网的 RSI 是什么清华稳准智能联合发布LimiX-2,结构化数据基础模型登顶国际评测榜单
稳定币挤兑与套利集中化Meta新研究:字节模型蒸馏后,天花板破了华为GTS让Agent学会「看着网络排障」,双防火墙难题几乎全拿下