智谱联合TileRT推出GLM-5.1高速版API(GLM-5.1-highspeed),面向部分企业客户开放,模型推理速度达400tokens/s,刷新当前大模型API输出速度上限。该版本在保持旗舰级模型能力的同时实现低延迟,打破高性能与高响应速度难以兼顾的行业限制。性能提升主要得益于TileRT推理引擎的编译期静态编排、动态批处理与KV缓存调度优化,以及多卡协同架构优化。在AI编程、实时建模和多Agent并行等场景中,可显著降低等待时间并提升交互效率。目前产品已上线智谱MaaS平台,适用于实时交互、代码生成与语音等对延迟敏感的应用场景。