Liquid AI与Hugging Face正式发布LFM2.5-1.2B-Instruct、LFM2.5-2.6B和LFM2.5-8B-A1B的DSpark草稿模型检查点。该方案引入投机解码路径,在不影响输出质量的前提下提升推理吞吐量,GPU端最高提升3.18倍,端侧最高提升2.87倍。测试显示,LFM2.5-2.6B在智能体场景中函数调用延迟平均降低57%,M4 Max MacBook Pro上输出速度最高达139 token/秒。
Liquid AI与Hugging Face正式发布LFM2.5-1.2B-Instruct、LFM2.5-2.6B和LFM2.5-8B-A1B的DSpark草稿模型检查点。该方案引入投机解码路径,在不影响输出质量的前提下提升推理吞吐量,GPU端最高提升3.18倍,端侧最高提升2.87倍。测试显示,LFM2.5-2.6B在智能体场景中函数调用延迟平均降低57%,M4 Max MacBook Pro上输出速度最高达139 token/秒。