智谱发布GLM-5.1高速版API,输出速度达400 tokens/s

5月22日,智谱正式推出GLM-5.1高速版API(GLM-5.1-highspeed),面向企业客户在MaaS平台定向开放。该模型在保留旗舰级能力基础上,实现最高约400 tokens/s的稳定输出速度,刷新大模型官方API性能记录,并支持200K上下文窗口及最高128K单次输出。产品由智谱GLM团队与TileRT团队联合优化,通过推理引擎重构、动态批处理与KV缓存调度、集群协同等系统级改进提升吞吐效率。该能力主要面向高频交互场景,包括AI编程、多智能体协作、实时交互与语音应用等。

上一篇:

下一篇:

发表回复

登录后才能评论