智谱 GLM-5.3-FlashX 上线,速度 5 倍,价格 2.5 倍
先给数字。GLM-5.3-FlashX 和原来的 Flash 对比(均为每百万 token 人民币单价):
| 模型 | 输入 | 输出 | 缓存命中 | 上下文 |
|---|---|---|---|---|
| GLM-5.3 | 8 元 | 28 元 | 2 元 | 1M |
| GLM-5.3-Flash | 0.8 元 | 2.8 元 | 0.23 元 | 1M |
| GLM-5.3-FlashX | 2 元 | 7 元 | 0.57 元 | 1M |
速度确实上去了:官方口径最高 200 tokens/s,是 Flash 的 5 倍。对于对话类、流式输出类应用,这个提升是能直接感知到的——用户等第一颗字的时间短了一大截。
但这是一次变相涨价。同样的模型系列,同样的能力水平,想要更快的那档就得掏 2.5 倍。智谱今年的动作连贯得有点吓人:2 月发布 GLM-5 时上调 API 与 Coding Plan 价格,3 月 GLM-5-Turbo 再涨 20%,4 月 GLM-5.1 又涨 10%,这次是第四次。公司在财报会上说得很直白:截至 8 月底 MaaS 平台 token 调用量较年初增长 40 倍、用户 740 万,同期 API 定价同比提高 101%,毛利率升到 24.6%。
翻译成人话:低价期结束了。
对一个人做产品的影响很具体:
- 别把单价写进商业模型:如果你的定价是按”调用一次成本 3 分钱”算出来的毛利,那么一次 2.5 倍调价就能把毛利打穿。合同里定价、免费额度上限、甚至要不要做这个功能,都应该以”最坏情况单价”来算,不是今天的单价。
- 模型层必须可替换:把厂商 SDK 直接散落在业务代码里是最常见的坑。抽一层薄的适配:统一的调用签名、统一的参数映射、配置文件里选模型。理想状态是换模型只改一行配置,一小时内可回滚。
- 留一个”贵到什么程度就不用它”的阈值:提前写死,比如”输出单价超过 X 元就降级到本地模型”。真到了那天你不会有心情算账。
- 快也是有收益的:如果你的场景是交互式(客服、写作助手、实时翻译),FlashX 贵的那部分钱换来更好的体验,可能反而提高留存。别本能地拒绝涨价,按”单位任务的综合体验成本”算。
顺带一条行业信号:证券日报的分析口径里提到”大模型价格战基本落幕”。这跟我们上周报的 OpenRouter 出图实测、DeepSeek 峰谷定价拼起来看,是同一件事的三面——厂商开始追求单位算力的毛利,而不是装机量。这意味着未来一年的成本趋势更可能是缓慢上行,而不是继续探底。较优的应对是把”能本地跑的那部分”逐步挪到本地(本站收录的 Ollama、llama.cpp、LiteLLM 都是为这种切换准备的),把云 API 花在真正需要最强模型的地方。
原文出处 · 事实以此为准
IT之家 · 智谱 GLM-5.3-FlashX 模型上线