GLM-5.3-FlashX

2026 年 9 月 18 日,智谱正式发布 GLM-5.3-FlashX,API 与体验中心同步开放。官方给出的一句话概括是:推理速度最高 200 tokens/s,比 GLM-5.3-Flash 提速约 5 倍,价格也相应上调到 2.5 倍。

先把最重要的一句放前面:这不是一次能力升级,而是一次“同一个脑子,跑得更快”的提速。下面把它到底快在哪、贵在哪、什么场景值得换,一条条说清楚。

一、核心变化速览

发布时间 2026 年 9 月 18 日
产品定位 面向企业与开发者的高速推理版本
最高速度 200 tokens/s
相对 GLM-5.3-Flash 速度约 5 倍,价格约 2.5 倍
上下文长度 1M
输入模态 图片、视频、文件、文本
能力是否提升 官方未公布能力、参数或上下文的变化
获取方式 API(Model Key:GLM-5.3-FlashX),体验中心已开放

二、这次涨价的账:2.5 倍,但便宜旗舰 4 倍

价格是这次最值得算清楚的部分。三档模型的官方单价如下(单位:元 / 百万 Tokens):

模型 上下文 输入 输出 缓存命中 输入模态
GLM-5.3 1M 8 28 2 文本
GLM-5.3-Flash 1M 0.8 2.8 0.23 图片、视频、文件、文本
GLM-5.3-FlashX 1M 2 7 0.57 图片、视频、文件、文本

缓存存储三档都标着“限时免费”。

把数字对一下就能看出官方那句“2.5 倍”是怎么来的:输入单价 0.8 → 2,输出 2.8 → 7,缓存命中 0.23 → 0.57,三项都正好是 2.5 倍。

但换个角度看更有意思——它比旗舰 GLM-5.3 便宜整整 4 倍:输入 8 ÷ 2 = 4,输出 28 ÷ 7 = 4。

所以 FlashX 的定位其实很清楚:它刚好卡在中间那一档。以前你想要低延迟,基本只能去买最贵的旗舰;现在中间多了一个“速度接近旗舰、价格只有旗舰四分之一”的选项。这个空隙,才是这次发布真正的意义。

三、200 tokens/s 是什么概念

单说数字没感觉,换算一下:一段 1000 字左右的中文回答,大约 1500~2000 tokens,按 200 tokens/s 算,理论出字时间在 8~10 秒左右。

反过来说,官方讲“提升 5 倍”,也就意味着原来的 GLM-5.3-Flash 峰值大约在 40 tokens/s——同样一段回答,要 40 秒以上。(这个反推是笔者的推算,官方只公布了 FlashX 的 200 tokens/s。)

这个差距在聊天里接近“另一个产品”的体感:一字一字往外蹦,和成句成段地涌出来,是两种完全不同的使用感受。官方点名的场景也正是这些——代码生成、Agent、智能客服,共同点都是“用户就坐在屏幕前等”。

四、官方这次没说的事

有几点需要划重点,免得被“5 倍”这个数字带偏:

  • 能力、参数、上下文都没提。官方目前公布的与 GLM-5.3-Flash 的差异,只有速度。也就是说,FlashX 不是“更强的模型”,是“跑得更快的同一个模型”。
  • 它的底座是开源的。GLM-5.3-Flash 早在 2026 年 8 月 26 日就已开源:总参数 320B、激活 18B、1M 上下文。发布前它还以“Ox Alpha”这个名字匿名对外测试过,在开发者圈子里攒了不少口碑,调用量一直往上走。
  • FlashX 本身是否开源,这次没说。把它理解成“给这个开源底座配的一条高速服务通道”,比理解成“新模型”更准确。

顺带放一下这一代底座的能力基线,方便判断要不要押注在这个系列上。据官方技术报告及第三方汇总:Terminal-Bench 3.0 从 4.6 提升到 28.3,DeepSWE v1.1 从 46.2 提升到 66.9,Agents' Last Exam 从 23.8 提升到 28.5;在 Artificial Analysis 智能指数上,GLM-5.3 与 Kimi K3 并列开源第一。注意——这些数字属于 GLM-5.3 这一代底座,不是 FlashX 单独跑出来的,FlashX 目前没有独立的评测公开。

五、它凭什么能快:一次“AI 优化 AI 基础设施”的实操

这一节是全文最有料的部分,也是这次发布里真正值得看的东西。官方披露的信息量不小,摘几个关键点。

底子首先是算力:10 万张国产芯片提供的推理算力。但光堆卡堆不出 5 倍,真正的差别在 Infra(推理基础设施)侧——官方说这次进一步加大了对 Infra 的投入和推理优化。

而更有意思的是这件事:跑 Flash 的这套推理系统,是由 GLM-5.3 驱动的 Agent 参与构建的。从模型适配一路做到生产上线,前后不到两周,端到端吞吐做到了初始基线的约 3 倍。官方把它总结成一个闭环:人负责定目标、划边界、搭反馈环境、审关键改动;测试、日志、Trace、微基准这些反馈通道全部交给 Agent,让它自己查问题、改代码、跑实验,局部验证通过再放回完整服务里验收。

官方举了三个具体案例,每一个都很“工程”:

案例一:输入是 FP32,计算却偷偷用了 TF32

KDA 的 CP 路径出现精度偏差,长上下文下尤其明显。Agent 顺着状态合并与更新的过程往下查,最后问题落在两处 tl.dot 上:输入明明是 FP32,计算却默认走了 TF32,误差被逐步累积放大。修法很朴素——两处都显式指定 input_precision="tf32x3"。这个修复已经合入了上游的 Flash Linear Attention 项目。

案例二:一个 GIL,卡住了整条传输链路

同样的 workload,加上 KV Transfer 之后,Prefill 的性能要求是“与单独 Prefill 差距不超过 5%”,实测却跑出了 20% 以上。翻 Trace 发现,KV Transfer 的 Python 侧执行始终没能和 DeepEP 的 dispatch / combine 调用重叠。再往深挖——DeepEP v1.2.1 里有两处 C++ 调用没有释放 GIL,负责 Mooncake Transfer 的 Python 线程拿不到锁,传输任务迟迟交不出去。改完之后,同样测试条件下性能差距降到 1% 以内。

案例三:同一组计算,被做了四遍

KDA Decode 沿 V 维度分块,结果同一组 FP32 归一化和门控计算,被四个分块各自重复算了一遍。Agent 把这些分块合并到同一个线程块里,提前批量计算、共享中间结果——并行度少了一点,重复计算也去掉了。这一步把算子性能提到了优化前的 1.71 倍。

单个看,这三件事都枯燥得不行,没一个是“大新闻”。但 200 tokens/s 这个数字,就是由这种一条条抠出来的收益堆起来的。它还透露出一个信号:在国产芯片上跑推理,这套软件栈的优化空间还没挖完——这对关心“性价比”的人来说,比任何跑分都重要。

六、谁该换,谁先别动

建议上手:

  • 在线客服、对话类产品——用户对“首字延迟”和“吐字速度”最敏感,这是 FlashX 的主场;
  • Agent、代码补全这类多轮、高频、单次请求不大的场景——单次省下的几百毫秒,累积到几十轮就是可感知的体验差;
  • 长文档批量处理——吞吐上去,时间和钱一起省。

建议先别动:

  • 偶尔调一次、对延迟不敏感的批处理任务:继续用 GLM-5.3-Flash,便宜 2.5 倍,没有理由多花钱;
  • 需要最强推理质量的重活(深度分析、复杂长文):直接上旗舰 GLM-5.3;
  • 缓存命中率高的应用要特别算一笔账——缓存命中价从 0.23 涨到 0.57,同样是 2.5 倍。如果你的成本大头本来就在缓存命中上,这次涨价的影响会比直觉更大。

七、怎么接入

Model Key 就是 GLM-5.3-FlashX,API 和体验中心已经同步开放。如果你的代码本来就是照着智谱开放平台的文档写的,通常只需要把请求里的 model 字段换成 GLM-5.3-FlashX,其余参数不变即可先跑通,再按需调。

官方调用文档:智谱开放平台 · 对话补全 API。具体的请求体与鉴权方式,以官方文档为准。

八、结论

GLM-5.3-FlashX 不是“更聪明”,是“更快”。它解决的不是能力问题,是等待问题。

判断要不要换,其实只需要问自己一句:我现在的用户,有没有在等?

如果有——比如客服对话、代码助手、实时 Agent——那 2.5 倍的价格很可能值,因为延迟本身就是产品体验的一部分。

如果没有——批处理、离线生成、低频调用——那你只是在为一笔你用不上的速度付费。留在 GLM-5.3-Flash 就好。

顺便说,这次发布里我个人最看重的一点,反倒不是 200 tokens/s 这个数字,而是官方把“Agent 参与优化推理基础设施、两周上线、吞吐翻 3 倍”这套流程公开了出来。模型之间的差距,接下来很可能不再取决于参数表,而取决于谁的工程闭环转得更快。这条线,比单个模型的定价更值得长期盯着。


本文信息整理自智谱官方发布内容及公开报道,价格为官方公布的当前定价(缓存存储为限时免费),实际以官方最新公布为准。

声明:本站所有文章,如无特殊说明或标注,均为本站原创发布。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益,可联系我们进行处理。