智谱(Zhipu AI)旗下海外品牌 Z.ai 于 9 月 18 日在 OpenRouter 上线了 GLM-5.3-FlashX——这是 GLM-5.3-Flash 的高速变体,主打极致的推理速度与低成本。作为 GLM 家族的最新成员,它延续了 320B 总参数、18B 激活的混合稀疏 + 线性注意力架构,把「多模态、长上下文、高吞吐」三件事塞进了同一个模型里。
核心能力
GLM-5.3-FlashX 最突出的标签是「快」:官方标称最高推理速度可达 200 token/s,OpenRouter 实测 P50 吞吐约 83 token/s、延迟约 2.32 秒。对需要实时响应的场景——代码补全、Agent 循环、多轮对话——这个速度意味着明显的体验提升。
- 原生多模态:文本与视觉理解都是模型自身能力,图片输入不是「外挂」。
- 1M token 超长上下文:能一次性吞下整本技术文档,或长程 Agent 的完整运行轨迹。
- 混合稀疏 + 线性注意力:320B 总参数只激活 18B,用较小算力换来大模型的能力密度。
- 白菜价:挂牌价 $0.37 / $1.25 每百万 token,实际有效输入价仅约 $0.0987,缓存命中率高达 92%。
使用体验 / 局限
从实际部署角度看,GLM-5.3-FlashX 是「跑得快、还跑得起」的典型。它瞄准的场景很清晰:高效编程、视觉理解、长程 Agent 任务。如果你需要一个便宜又快的基座去做大量 API 调用,它的性价比几乎无可挑剔。
但也要说清楚局限:作为 Flash 变体,它在复杂推理、深度数学与代码生成质量上,会比 GLM-5.3 旗舰底座有所妥协——输出质量上限不如旗舰,这是「速度换深度」的必然代价。另外目前 OpenRouter 上只有 Z.ai 一个官方 provider,第三方托管生态还比较有限。
综合评分
| 维度 | 评分 | 评价 |
|---|---|---|
| 功能完整度 | 8.5 / 10 | 多模态 + 1M 上下文齐全,但作为 Flash 变体能力上限略低于旗舰 |
| 易用性 | 8.8 / 10 | 速度快、延迟低,OpenRouter 一键接入,调用体验流畅 |
| 性价比 | 9.2 / 10 | 有效输入价不到 $0.1,高吞吐场景下成本优势巨大 |
| 中文支持 | 9.0 / 10 | 智谱出品,中文理解与生成原生且稳定 |
| 输出质量 | 8.2 / 10 | 日常任务够用,复杂推理与旗舰底座仍有差距 |
综合评分:8.7 / 10
GLM-5.3-FlashX 是一款定位精准的「高速多模态」:用极低的价格和出色的吞吐,把大模型带进了高并发、对延迟敏感的生产场景。如果你在找一款便宜、快、中文友好的通用模型来跑 Agent 或批量任务,它值得一试。想了解更多 AI 工具的真实评测,欢迎访问 AI Dash——发现最好用的 AI 工具。

Pingback: NVIDIA 芯片走私案:加州男子涉 3 亿美元 AI 服务器走私中国被捕 – AI Dash