在近日举行的 AICon 大会上,蚂蚁集团副总裁周俊介绍大模型效率优化进展。他表示,万亿参数模型算力消耗高,团队将优化重点从“更多 Token”转向“更高 Token 密度”,采用“7份 Lightning Attention 加1份 MLA”的混合线性注意力架构,使 256K 上下文处理成本由指数级降为线性级。团队还引入 Kpop 算法区分工具调用与自然语言 Token,并结合思维链剪枝、自蒸馏等技术,将 Token 输出减少约4倍且能力未下降。其千亿参数模型在 LongBench、BFCL 等 Agent 基准中超过部分更大模型,小型模型 flash 吞吐率达2.4倍,五轮对话算力成本降低超10倍。