DSpark 如何保证加速推理时输出质量不变?
草稿模型生成候选 token,目标模型逐 token 验证;贪心解码下只有与目标模型分布一致的 token 才会被接受,因此最终输出与不使用投机解码时完全相同。
(翻译)LFM2.5-DSpark 最高可将推理速度提升 3.2 倍

A Blog post by Liquid AI on Hugging Face
Liquid AI 发布 LFM2.5 系列三款模型的 DSpark 草稿模型,通过投机解码在仅增加少量显存的情况下实现最高 3.18 倍 GPU 推理加速和 2.87 倍端侧加速,并显著降低函数调用延迟。模型支持 llama.cpp 与 SGLang,已开放 Safetensors 和 GGUF 权重。
草稿模型生成候选 token,目标模型逐 token 验证;贪心解码下只有与目标模型分布一致的 token 才会被接受,因此最终输出与不使用投机解码时完全相同。
发布时已支持 llama.cpp 和 SGLang,相关实现基于官方 DSpark 代码并在上游开源;同时提供 Safetensors 与 GGUF 权重。
在 M4 Max MacBook 上平均吞吐提升约 2.27 倍,多工具场景函数调用延迟平均降低 57%,更适合端侧代理式推理。