先说结论:社区已经拿到一个相当实的证据——被很多人当作“神秘模型”的 ox-alpha,就是智谱的 GLM-5.3-Flash。消息来自一条被删除的社交动态,但截图还在,核心参数包括多模态视觉、1M Token 上下文窗口,以及 DeepSWE 基准约 63% 的成绩。随后官方在博客里间接确认了这个匿名测试,并放出了更多细节。
文章下面很多人吐槽这条动态的互动方式,但更值得关注的是:如果这真是 GLM-5.3-Flash,那么它此前以 ox-alpha 的身份在 OpenCode 和 OpenRouter 上跑了一周流量,已经成为当周最热模型。也就是说,这次发布不是空降,而是先让真实用户打磨过一轮。
“匿名测试”确认:参数和任务定位对上了
这个问题给出的三个关键信息,几乎和 GLM-5.3-Flash 官方页面一一对应:多模态视觉、1M Token 上下文、DeepSWE 约 63%。其中 DeepSWE 是一个偏软件工程智能体能力的基准,63% 这个数字在开源模型里属于相当靠前的水平。有网友直接说,Z.ai CEO 之前对马斯克讲“年底前发布 Mythos 级开源权重模型”不是开玩笑。
不过也有人冷静下来提醒:官方博客里明确写了,GLM-5.3-Flash 是 320B 总参数、18B 激活参数 的 MoE 模型,和之前的 GLM-4.7 Flash 不是同一个体积级别。有人在这个问题下感慨:“我没想到体积会直接放大 10 倍。” 另一位使用者则表示,如果模型尺寸和 4.7 Flash 差不多,自己的 12GB 显存会很高兴,但现在看多半是奢望了。
推理跑在国产芯片上:3 倍性能提升,单 token 成本接近英伟达
官方博客里有一段内容被反复引用:在发布前,团队以 ox-alpha 为名在 OpenCode 和 OpenRouter 上做了匿名测试,所有流量都由国产 AI 芯片承载。相比之前的硬件基线,他们获得了 3 倍端到端推理性能提升,单位 token 成本和硬件效率已经接近主流英伟达 GPU。有人评价说,这个时间点选在英伟达财报当天,像是在对着英伟达“开了一枪”。
价格方面,OpenRouter 上 GLM-5.3-Flash 的定价是 $0.075 / $0.25 每百万 token(输入/输出)。有网友测算,这个价格和 Anthropic 在五月份提供同级别能力的成本相比,低了约 100 倍。不过也有人提醒,这需要结合上下文处理长度和实际任务来看,不能只看单 token 报价。
实测体验:不适合长会话编程,但 agent 任务很能打
已经用过 ox-alpha 的网友反馈分成两派。一位使用者明确说:“模型很好,但长时编程会话不太行。我只会把它用于 agentic 任务,它在那些任务里非常有效。” 这正好和 DeepSWE 63% 的成绩呼应——这类模型本来就是设计来跑多步工具调用和代码修改的,而不是长时间人机对话。
还有人在讨论里建议,想评估这种模型,不要只跑单轮问答,应该给它一个具体的输入输出示例,比如“给你一个仓库,要求修某个 bug,看它怎么调用工具”。这种判断方法比阅读宣传数据更可靠。
开源权重模型的“军备竞赛”真要来了
多数人认为这次发布给开源权重模型生态带来了很大压力。有人指出,如果 GLM-5.3-Flash 真的以接近封闭模型的水平、约 1/100 的成本提供服务,那么后面几家开源权重实验室都得加快节奏。另有人觉得,这种发布速度已经快到“离谱”了,几乎每隔几周就有一个新的能力断层出现。
但也有技术向的网友提醒:不要光看参数宣传,应该关注 MoE 架构的显存占用和实际推理吞吐。320B 总参数意味着即使激活参数只有 18B,要完整跑起来仍然需要足够大的显存或非常强的量化方案,12GB 显存恐怕只能看 GGUF 量化后的结果。
给你一个可操作的处理建议
如果你之前用过 ox-alpha 并觉得效果不错,那大概率已经体验过 GLM-5.3-Flash 了。如果没有,可以先去 OpenRouter 上看一眼它的定价,再根据自己的任务类型决定是否接入:
- 如果主要做短时、多步骤的自动化任务(如代码修改、文件操作、网页操控),它很可能是当前性价比最高的选择之一。
- 如果要做长会话、持续多轮的聊天或结对编程,建议先自己在实际项目里跑一段时间,别只看单轮指标。
- 如果打算本地部署,先确认自己的硬件能不能承受 320B 的量化权重,或者干脆先走 API。
另外,这次发布也验证了国产 AI 芯片在推理场景的可行性。如果你关心供应链层面的问题,可以留意后续关于 GLM-5.3-Flash 部署成本的更多公开数据,但不必急着下结论。