8月26日晚间,智谱上线并开源 GLM-5.3-Flash。至此,过去一周在开发者圈里迅速走红的匿名模型 Ox-Alpha——中文社区称它「牛来」——终于揭晓了真身。
谜底揭开之前,关于它归属的猜测已经不少。但真正值得记下来的,不只是「它是谁家的」,而是官宣和报道里透露的另一件事:它在测试期间由国产芯片提供全部推理算力,而且接住了过去几天堪称凶猛的请求洪峰。
「牛来」到底是什么
据财新网报道,GLM-5.3-Flash 参数量为 320B,低于 GLM-5.3 与 GLM-5.2 的 744B,但能力超过 GLM-5.2;它是 GLM-5 系列的首个原生多模态模型,拥有百万上下文,价格仅为 GLM-5.3 的十分之一。
从 8 月 20 日起,它就以匿名身份 Ox-Alpha 在第三方平台 OpenRouter 和 OpenCode 上免费测试,很快在开发者社群中爆火。
海量请求的数字
「爆火」两个字,具体下来是一组很硬的数字:
- 在 OpenRouter 上,Ox-Alpha 过去 7 天的调用量达到 23.2T,排名第一,比第二名的 DeepSeek-V4-Flash 正式版高出一倍有余;
- 在 OpenCode 上,它连续 6 天调用量排名第一,累计调用量 44T。
这样的量级,不是一场营销活动能刷出来的,而是大量开发者真金白银、真刀真枪地用出来的。
更关键的是:跑在国产芯片上
最值得注意的,是这波洪峰背后的底层算力。据报道,GLM-5.3-Flash 在测试期间由国产芯片提供全部推理算力;另有多家媒体提及,其测试集群规模约为 10 万张国产卡(这一具体数字尚未在官方公告中确认)。
长期以来,国产芯片在大模型领域更多承担「能用」「够用」的角色,真正在高并发、大规模推理场景下的实战记录并不多。这一次,等于是一场公开的压力测试——而且强度来自真实用户,不是实验室演示。
「接住」两个字,没那么简单
海量请求汹涌而来时,考验的远不止模型本身。推理集群的调度、排队、弹性扩容、稳定性、成本控制,每一项都是硬功夫。接住了,意味着背后有一整套能扛住洪峰的系统在运转。
很多曾经红极一时的 AI 产品,恰恰是在流量高峰时崩掉的。所以「没崩」本身,就是一句很有分量的技术宣言。
一次实战,胜过许多参数
这让我想起这个博客里反复出现的一个观点:能力之外,可靠性和成本才是决定一项技术能否真正落地的关键。
国产芯片过去缺少的,正是这种「在真实洪峰里证明自己」的机会。机会来了,扛住了,比任何宣传都更有说服力。它也顺带回答了一个很多人关心的问题:国产算力到底能不能支撑起一线的大模型服务?这一次,答案是肯定的。
冷静地说
当然,一次成功不等于全面领先。单点突破与全面替代之间,还有很长的路要走。但样本已经摆在那里:从模型到芯片,一条国产的链路,真的能在高强度使用中站住。
这或许才是「牛来」官宣背后,最值得被记住的部分。