Ox Alpha 坐实为智谱 GLM-5.3-Flash 预览版:完全运行于国产 AI 芯片
上周在用 OpenCode 时,发现列表里多了一个免费的 Ox Alpha 模型。当时也不清楚它是什么底子、能力如何,冲着免费就先用了一段时间,手感还算不错。随后全球最大的 AI 聚合平台 OpenRouter 也跟进了 Ox Alpha 的免费体验,模型上线后调用量迅速攀升,短时间内冲到了该平台榜首。
Ox意为 “牛”,恰逢最近电影《牛来》走红,所以一些中文社区也把Ox Alpha叫作 “牛来大模型”。
没想到的是,在数天时间里,Ox Alpha 已经让全球开发者用掉了数十万亿 Token,远超此前热门的 DeepSeek V4 Flash 0731。

市场反响
Ox Alpha 上线后迅速引爆了开发者社区,几个关键数据:
- 4 天内吸引超过 26.8 万名不重复用户,完成超过 648 万个工作阶段。
- 仅
Hermes Agent、Claude Code等前五款应用,对Ox Alpha的累计调用量就突破 4 万亿 Token。 - 终结了
DeepSeek在OpenCode连续 56 天占据榜首的局面。 - Stripe CEO Patrick Collison 公开称赞其 “非常令人印象深刻”。
从这些数字看下来,它的热度不只是营销造势,确实有一批 Claude Code、OpenCode 用户在拿它当主力或备用 Coding 模型跑。
Ox Alpha 的定位与能力
Ox Alpha 被定位为面向编码(Coding)、持续智能体工作(Sustained Agentic Work)和生产环境任务的推理模型。核心能力我比较关注这几块:
- 超长上下文处理:百万级 Token 上下文窗口,可以一次性读取大型代码仓库、长时间积累的 Agent 执行记录,或者文本、图片和视频共同组成的复杂任务。
- 多模态输入:支持文本、图像和视频三种模态输入,输出仍为文本形式。
- 工具调用能力:支持工具调用和结构化输出,是为 Coding Agent 场景准备的执行模型。
性能方面,Ox Alpha 的中位首 Token 延迟约 1.95 秒,输出速度约 每秒 49 Token,上线初期可用率接近 100%。对编码场景来说,这个延迟和吞吐基本够用,比 Claude Opus 4.8 那类重量级模型更轻快。
官方确认:就是 GLM-5.3-Flash
昨天晚间,官方正式发布了 GLM-5.3-Flash 模型,确认它就是此前在 OpenCode 和 OpenRouter 匿名测试的 Ox Alpha,而且 完全运行于中国 AI 芯片。

这也解释了为什么此前 Ox Alpha 能以免费形态大规模放量,大概率是借匿名测试收集真实 Coding Agent 场景的调用数据,为 GLM-5.3-Flash 正式发布铺路。
GLM-5.3-Flash 有什么变化
GLM-5.3-Flash 将视觉能力原生集成到模型中,是 GLM-5 系列首个原生多模态模型。对开发者来说最直观的感受就是:终于可以识别图片了,这点真的很需要。
原生多模态能力
视觉能力是原生集成进来的,而不是外挂一个视觉头。视觉编码(Visual Coding)拓展了编程所能触及的边界:对前端开发、游戏开发、3D 仿真等任务,模型能够自主判断何时需要 “观察”,并利用视觉反馈指导下一步行动。
这意味着模型可以:
- 主动观察界面、渲染结果与交互反馈。
- 在代码、浏览器和图形界面之间协同完成任务。
- 支持 Blender 3D 场景、BUA、CUA 驱动的真实环境操作。
超越编程的专业能力
模型进一步拓展到 Office、金融研究和专业文档等工作场景,能够自主拆解复杂目标、调用合适工具、检查并优化输出,完成从研究分析到 PPTX、PDF、DOCX、XLSX 成品交付的完整工作流。
长上下文能力
支持 1M 上下文窗口,在保持精准长上下文能力的同时,大幅降低长上下文服务成本。
评分
官方晒出的评分接近 Claude Opus 4.8 的水平:

在 Design Arena 整体排名第 6,初步 Elo 分数为 1343:

[!NOTE]
评分榜数据会随时间和样本量变化,仅作参考。实际编码体验还是建议拿自己的项目跑一轮。
定价策略
| 定价项 | 价格 |
|---|---|
| 每百万 Token 输入 | 0.8 元 |
| 每百万 Token 输出 | 2.8 元 |
| 缓存命中 | 0.23 元 |
| 限时折扣(截至 2026 年 9 月 9 日) | 50% |
横向对比一下:
- 定价为
GLM-5.3的 1/10,限时折扣内为 1/20。 - 为
Claude Opus 4.8的 1/40。 - 比
DeepSeek V4 Flash更便宜,DeepSeek 谷时价格为输入 1.5 元、输出 4.5 元。
这个价位对 Coding Agent 用户来说很有吸引力,尤其是缓存命中只要 0.23 元,长上下文重复调用场景能省下不少成本。
使用与获取方式
几个关键信息:
- 模型代码:
glm-5.3-flash - 开源地址:HuggingFace 上的
zai-org/GLM-5.3-Flash - API 接口:支持 Chat Completion API
- GLM Coding Plan:已全面放开,额度为
GLM-5.3的 3 倍 - 支持能力:思考模式、流式输出、Function Calling、上下文缓存、结构化输出(JSON)、视觉理解
总结
目前看下来,GLM-5.3-Flash(也就是 Ox Alpha)有几个比较明确的特点:
- 定位清晰:面向 Coding 和持续 Agent 工作场景,不是纯通用聊天模型。
- 成本极低:限时折扣内,价格基本是同档位里最便宜的一档。
- 国产芯片全量运行:这点在合规和供应链层面意义不小,值得单独关注。
我的建议是:如果你在用 Claude Code、OpenCode 这类 Coding Agent,可以拿 GLM-5.3-Flash 当备用或主力模型跑一轮真实项目,成本压力会小很多。GLM Coding Plan 额度是 GLM-5.3 的 3 倍,有需要的可以先试起来。多模态和长上下文的实际表现还要以自己的代码仓库和图片任务为准,评分榜只能当起点。
[!IMPORTANT]
限时五折截至 2026 年 9 月 9 日,想试水的尽量赶在折扣期内跑一轮。
更多关于 GLM-5.3-Flash 的介绍,可以去官方平台阅读这篇博客文章:

