Hugging Face Blog 发布于 08/21 00:52

Up to 3.2x Faster Inference with LFM2.5-DSpark

(翻译)LFM2.5-DSpark 最高可将推理速度提升 3.2 倍

查看原文

资讯摘要

A Blog post by Liquid AI on Hugging Face

AI 摘要

Liquid AI 发布 LFM2.5 系列三款模型的 DSpark 草稿模型,通过投机解码在仅增加少量显存的情况下实现最高 3.18 倍 GPU 推理加速和 2.87 倍端侧加速,并显著降低函数调用延迟。模型支持 llama.cpp 与 SGLang,已开放 Safetensors 和 GGUF 权重。

AI 问答

DSpark 如何保证加速推理时输出质量不变?

草稿模型生成候选 token,目标模型逐 token 验证;贪心解码下只有与目标模型分布一致的 token 才会被接受,因此最终输出与不使用投机解码时完全相同。

LFM2.5-DSpark 已在哪些推理框架中可用?

发布时已支持 llama.cpp 和 SGLang,相关实现基于官方 DSpark 代码并在上游开源;同时提供 Safetensors 与 GGUF 权重。

端侧使用 DSpark 对 LFM2.5-2.6B 有什么收益?

在 M4 Max MacBook 上平均吞吐提升约 2.27 倍,多工具场景函数调用延迟平均降低 57%,更适合端侧代理式推理。

打开原文