智谱上线GLM-5.3-FlashX,推理速度最高达200 tokens/s

智谱发布并上线新模型GLM-5.3-FlashX,官方称其推理速度最高可达每秒200个token,面向企业开发者提供API调用,Model Key为GLM-5.3-FlashX。该模型基于此前以“Ox Alpha”名称面向全球开发者开放的GLM-5.3-Flash升级,依托10万张国产芯片推理算力,并通过基础设施建设和推理优化提升响应效率,重点覆盖对低延迟有需求的生产场景。

上一篇:

下一篇:

发表回复

登录后才能评论