KV Cache为什么会拖慢大模型推理?
会话历史越长,缓存占用的显存越多;显存装不下时部分缓存会被清理,下一轮需要时就要重新做Prefill,用户等待首个Token的TTFT随之增加。
让GPU去忙生成Token
量子位报道,AI Agent长时间运行会让KV Cache在显存中不断膨胀,缓存被清走后需重新Prefill,导致首Token等待时间TTFT上升并浪费GPU算力。文章以Qwen3-8B推演每Token约147KB的缓存开销,介绍以存代算的分层卸载思路,以及英特尔围绕KV Cache提出的KV Shrink、KV Fuse、KV Cascade、KV Infinity四个方向,其中KV Shrink结合QAT硬件压缩,在测试中实现空间节省约20%至30%。
会话历史越长,缓存占用的显存越多;显存装不下时部分缓存会被清理,下一轮需要时就要重新做Prefill,用户等待首个Token的TTFT随之增加。
它把分层缓存管理与QAT硬件压缩结合,并提供冷热调度API;通过重新排列KV Cache存储格式,压缩节省的空间从10%以上提升到20%至30%,且为无损压缩。
显存还要存放模型权重和运行时数据,缓存占得越多,能同时服务的请求就越少,因此需要在保存、搬运和重算之间寻找平衡。
豆包工作打出“团队Agent”牌,Workbuddy、千问会跟吗?
一年28倍妖王:谁在爆炒?首个AIGC长片大赛!RunningHub单项大奖100万,科幻IP免费改编
上市前交易市场:永续合约化的Pre-IPO资产
特朗普“一再让步”:美国加密法案仍未过关
2人团队0融资,用AI搓的复古相机APP霸榜韩国总榜第4,还做到了3个月10亿销售额?
让AI真正赋能企业(初探)
百度做了一堆AI产品,却没有一个能代表百度?
碧桂园服务与支付宝全面深化合作,共筑“智慧物业”数字化新标杆
清晰法案投票失败 后续还有机会吗?英伟达带动AI数据中心大变革,中国厂商不想当边缘人产品观察丨xTool做了一台3000元起步的激光雕刻机,难的不只是价格
Your Agent Aced the Task. Will It Do It Again?
被AI放大的光学「戏份」,让「配角」舜宇的生意越做越大高性能电动船艇动力系统公司获近亿A轮融资,海外收入增长450%丨36氪首发
CLARITY折戟 多方博弈撕裂行业预期 市场怎么看?
Anthropic CEO自爆行业黑幕
旧消费品,正长出新生意
AI风口之下,明星们又想“挤上”牌桌了
豆包工作还想反超WorkBuddy?
Building AI to accelerate science and improve lives
产品经理的体面,是一块不能失守的 “括约肌”
实习生1天消耗1亿Token被约谈:如何衡量Token的ROI
电商对账的设计逻辑:四层核对,逐层下钻
对话蚂蚁灵波 CEO 朱兴:机器人还吃不了「粗粮」SDL3 移植到 HarmonyOS / OpenHarmony
耐克和lululemon双双失速,运动品牌进入碎片化时代
CLARITY法案未通过程序性表决 OpenAI拟IPO前融资
Uniswap v4上的恶意Hooks支付宝 xUI -- “阿宝”背后的 Agentic 终端交互引擎