字节级蒸馏与传统Token蒸馏的核心区别是什么?
传统蒸馏让学生学习教师在庞大Token词表上的概率分布,Llama 3-8B词表有128256个Token,通常只能做top-k截断;字节级蒸馏把学习单位换成字节,每个位置只有256种基础取值,预测空间更小,且不随分词器改变,完整分布更容易保留。
Meta FAIR与华盛顿大学提出字节级蒸馏方法,把教师模型的Token概率分布转换为字节级分布,让学生模型直接从字节概率学起。团队提出Marginalize-It与End-Of-Token两种方案,以Llama 3-8B为教师实验。预测显示End-Of-Token下游平均准确率上限比传统Token蒸馏高约4个百分点,训练文本量约为其六分之一、存储量约五分之一,但训练计算量更高。
传统蒸馏让学生学习教师在庞大Token词表上的概率分布,Llama 3-8B词表有128256个Token,通常只能做top-k截断;字节级蒸馏把学习单位换成字节,每个位置只有256种基础取值,预测空间更小,且不随分词器改变,完整分布更容易保留。
Marginalize-It直接聚合并重新归一化候选概率,只需一次教师前向计算,效率高,但会丢失已结束Token的部分概率信息;End-Of-Token在每个Token末尾加入特殊结束符号,让“Token结束”有明确预测位置,从而更完整地保留教师分布。
以Llama 3-8B为教师,预测平均准确率上限为Token蒸馏48.4%、Marginalize-It蒸馏50.5%、End-Of-Token蒸馏52.4%,后者高出4个百分点。End-Of-Token实际处理的文本量约为Token方案六分之一,存储量约为五分之一,但训练计算量比普通字节模型高约30.94%,推理成本也尚未做等成本比较。
AI不断进步 不得不把才华埋葬在昨天高通技术公司携手中兴努比亚和豆包手机助手,共同推动智能手机迈入个人AI新时代
月下载暴增366%,上海真人社交公司切入东南亚AI陪伴,AI角色也能“奔现”
Cloudflare将每天90亿次请求的JavaScript CDN迁移到其开发者平台
电商对账的设计逻辑:四层核对,逐层下钻手机替我跑了一整套流程!我就说了一句话,AI执行了100步华为GTS让Agent学会「看着网络排障」,双防火墙难题几乎全拿下
AI for everyone in every language
YC 最值钱的这 20家公司,没有一家来自最近5年
美联储今起议息 沃什或成关键一票
金色Web3.0日报 | 黄仁勋批驳「AI末日论」Mozilla 报告称中国开放权重模型与美国前沿模型仅相差 4.4 个月
微软 CEO 纳德拉:AI 应用的机会正在变大,模型成本将继续下降
CLARITY法案投票失败 加密监管立法再度搁浅
碧桂园服务与支付宝全面深化合作,共筑“智慧物业”数字化新标杆B站AI无限竞技场今日上线!全球百大AI模型同场竞技,GPT-6高居榜首豆包手机明日开卖,AI能帮你操作App了吗?
上市前交易市场:永续合约化的Pre-IPO资产Denuvo 起诉黑客违反 DMCA 反规避条款
Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking
自主团队被捧过头了?Simon Rohrer 直言:你们交付的根本不是产品
分析师:四大关键因素驱动 Robinhood 链快速增长
早报|iOS27正式推送/比亚迪高管:燃油车在中国没有未来/iPhone 18 Pro渠道降价900元,苹果称不干预
清晰法案投票失败 后续还有机会吗?
豆包工作还想反超WorkBuddy?
这种国民鱼一直被低估、被当廉价鱼!现在才知道钙和 DHA 这么多!快试试实时互动、实时改视频、探索空间视频,Vidu S2一次放了三个大招支付宝 xUI -- “阿宝”背后的 Agentic 终端交互引擎
具透 | 精心优化, 体验感愉悦升华:iOS 27 中值得关注的新特性科学家演示水下太阳能电池