这项技术如何降低知识蒸馏的显存占用?
文章提出两种方法:离线缓存教师模型每个位置最可能的前100个logits,训练时不再同时加载教师模型;以及融合分块KL损失,按序列块端到端计算投影和损失,不保留完整词汇×序列网格,反向传播时按需重算,峰值显存随序列长度线性增长。
(翻译)让知识蒸馏成本足够低以实现大规模运行

A Blog post by Multiverse Computing on Hugging Face
Multiverse Computing 提出两种系统优化,使大模型知识蒸馏可大规模运行:离线缓存教师模型前100个logits,避免训练时同时加载师生模型;融合分块KL散度损失,按块计算并丢弃中间结果,峰值显存显著下降。在32K上下文下显存减少15.6倍,256K上下文仍可运行,并将GPT-OSS 20B蒸馏从四个节点缩减至一个。
文章提出两种方法:离线缓存教师模型每个位置最可能的前100个logits,训练时不再同时加载教师模型;以及融合分块KL损失,按序列块端到端计算投影和损失,不保留完整词汇×序列网格,反向传播时按需重算,峰值显存随序列长度线性增长。
实验显示,四种设置在8K上下文下训练损失几乎重合,说明用缓存的前100个logits做离线蒸馏相对于在线蒸馏几乎无损。
在32K上下文蒸馏GPT-OSS 20B时,显存释放使配置从四个GPU节点缩减到一个,单步时间从57秒降至12.23秒,单卡吞吐从74.2提升至345.7 TFLOP/s。
这届 AI PC,太烧心了特朗普政府要求AI公司在发生安全事件后立即上报阿斯麦将对韩国零部件涨价10%外交部副部长马朝旭同澳大利亚外交贸易部秘书长安思捷举行中澳外交部政治磋商JEPA、空间智能路线正面交锋:WorldArena 2.0 挑战赛开考「能不能被机器人真正用起来」| IROS 2026报道称OpenAI和Anthropic正在聘用前特朗普政府官员
美债失控狂飙:冲击到底有多大?
冷钱包遭经销商投毒 超8600万美元被盗 请立刻排查芯片专家试图劝退马斯克:Terafab芯片项目可比发射星舰火箭更难阿里开始给AI算账了:用AI的钱,以后各业务线自己出当代码不再稀缺:大型工程 AI 狂欢下的确定性底座|QCon上海Nano Banana 2.1 深度实测:4K 直出、中文排版大进步,连续改图的坑也要看清名创优品:中国内地第三季度总GMV同比增长25-30%智能咖啡机 10 天内产生 1TB 数据流量GMIF 2026:日均140万亿Token调用,正在改变SSD的能力与分工
同样是珍珠,为啥价格能差10倍?成年人要的「安心」,有时是一支笔给的微信聊天记录终于能正经交给 AI 了,官方开的口子不怕封号OPC企业容易陷入的三个增长误区我让豆包工作看了30个爆款AI封面,它总结出了八个规律
10后中学生捧红统一“呆毛”发型,这回轮到老非主流们看不惯了美图披露AI创新产品进展:Picchi ARR达111万美元
3.76亿人集体抛弃,保健品跌出银发消费前三,精准营养成“香饽饽”北京:增加人工智能手机和电脑、智能机器人等新一代智能终端产品有效供给Claude 动态多 Agent 工作流开始公测,支持庞大的工作负载
8600万美元被盗 官方授权也不能保证硬件钱包安全?
华尔街新高藏隐忧小红书+AI+知识库,我现在无敌了商务部欧洲司负责人解读中欧贸易投资磋商机制第二次例会成果Impactful scheduling for GPU clusters