Featured image of post 智谱AI上线GLM-5.3-FlashX:国产芯片集群推理速度突破200 token/s

智谱AI上线GLM-5.3-FlashX:国产芯片集群推理速度突破200 token/s

智谱AI推出FlashX加速版,基于国产芯片实现200 tokens/s推理 speed。

核心事件概览

智谱AI于2026年9月正式上线GLM-5.3系列再升级版本——GLM-5.3-FlashX,主打超高速推理性能。该版本此前以"Ox Alpha"匿名身份在OpenCode和OpenRouter双平台运营,一度成为调用量最大的开源模型。

  • 发布时间:2026年9月18日前后正式发布
  • 新版本:GLM-5.3-FlashX(GLM-5.3系列加速版)
  • 核心指标:最高推理速度达200 tokens/s
  • 硬件基础:运行于10万张国产芯片组成的集群
  • 权重状态:原文未明确是否开放权重
  • 可用性:已上线OpenCode和OpenRouter平台

技术细节与平台表现

GLM-5.3-FlashX是智谱AI在国产芯片基础设施上的又一次重要突破。团队在上一代GLM部署时,即面临在10万张国产芯片集群上从零搭建推理服务的挑战。此次FlashX版本通过深度优化,将推理吞吐量提升至200 token/s,显著优于前代版本——尽管原文未提供前代具体数值,但200 token/s在国产芯片推理场景中属于较高水平。

一个值得留意的反差点是:GLM-5.3系列在匿名测试阶段(Ox Alpha身份)即已登顶OpenCode与OpenRouter双平台调用量最大模型,说明开发者对其实用性高度认可;而正式上线的FlashX版本进一步强化了工程能力,使高性能推理在国产芯片上成为常态。

OpenCode和OpenRouter均为国际主流开源模型测试与分发平台,这意味着该模型不仅通过了国内工程验证,也在国际技术社区接受了调用压力测试。

模型版本对比(基于公开信息)

特性GLM-5.3-FlashXGLM-5.3 (Ox Alpha)
推理速度最高200 token/s未公开,低于FlashX
运行平台OpenCode、OpenRouterOpenCode、OpenRouter
调用量排名未公开双平台第一
硬件集群10万张国产芯片10万张国产芯片

注:表格仅涉及标题及摘要中提及的信息,未公开参数未列入。

落地应用建议

  • 适合立即尝试的用户:对国产芯片推理性能有实际需求的开发者,尤其是需要高吞吐量API服务的中小团队;已在OpenCode或OpenRouter集成GLM模型的项目可快速对比FlashX的性能提升。
  • 建议继续观望的用户:若对模型能力细节(如支持语言、上下文长度、具体任务准确率)有强要求,需等待官方进一步披露;若当前仅依赖商用API计费模式,需评估FlashX是否涉及计费策略调整。

写在最后

国产大模型推理服务正从"能跑起来"迈向"跑得快"阶段。GLM-5.3-FlashX的200 token/s性能,标志着基于本土算力基础设施的大模型服务已具备商业化所需的吞吐基础,为后续更大规模落地扫除关键技术障碍。