神秘「牛来」真身曝光
🐂 神秘「牛来」真身曝光:320B 开源模型 AA 57 分追平 Claude Opus 4.8,价格只有 1/40,还全跑在国产卡上!
一句话看懂: 匿名刷屏六天的「牛来」(Ox Alpha),是智谱 8 月 26 日晚正式发布并开源的 GLM-5.3-Flash——3200 亿总参数、仅 180 亿激活的 GLM-5 系列首个原生多模态模型。它在 Artificial Analysis 综合智能指数拿到 57 分,与 Claude Opus 4.8 持平,价格却只有后者的 1/40;匿名测试期间的全球真实流量,全部由 10 万+ 张国产芯片承载。
📌 先看结论:五个爆点
| # | 爆点 | 数据 |
|---|---|---|
| 1 | 匿名登顶 | 以 Ox Alpha 名义测试,首日冲上 OpenRouter 榜首、刷新单日 Token 用量纪录,终结 DeepSeek 在 OpenCode 连续 56 天霸榜 |
| 2 | 能力追平旗舰 | AA 智能指数 57 分 = Claude Opus 4.8;Z Code Bench 上 max 档 29.0 vs Opus 4.8 的 29.5 |
| 3 | 价格屠夫 | 仅为 GLM-5.3 的 1/10,限时折扣 1/20,约为 Opus 4.8 的 1/40,定价还低于 DeepSeek-V4-Flash |
| 4 | 架构革命 | 320B 总参 / 18B 激活 / 45 层,首用"线性注意力 + 稀疏注意力"混合架构,注意力计算量降 3.0 倍、KV Cache 降 4.4 倍 |
| 5 | 纯血国产 | 10 万+ 张国产芯片集群承载全球真实流量,端到端服务性能较基线提升 3 倍,单 Token 成本与主流英伟达 GPU 相当 |
一、谜底揭晓:这几天刷屏的「牛来」,果然是智谱
过去六天,海外开发者圈被一个代号 Ox Alpha(中文名「牛来」)的神秘模型刷屏了:
- 在 OpenRouter 上,它首日冲上榜首,还刷新了平台单日 Token 用量历史纪录;
- 在 OpenCode 上,它一出世就终结了 DeepSeek 连续 56 天霸榜的纪录;
- 有博主用同一个 Prompt 让它手搓 SpaceX Raptor 猛禽发动机 3D 交互网页,直呼"越用越惊艳"。
8 月 26 日晚,智谱正式认领:「牛来」就是 GLM-5.3-Flash——GLM-5 系列第一个原生多模态模型,发布即开源。它不是在实验室里秀肌肉,而是用真实全球流量在国产芯片上跑了一周,才把这张牌翻开。
二、核心参数速览
| 项目 | GLM-5.3-Flash |
|---|---|
| 总参数 / 激活参数 | 3200 亿 / 180 亿(MoE,45 层) |
| 预训练语料 | 30T Token 多模态语料 |
| 上下文窗口 | 1M Token(最大输出 128K) |
| 输入模态 | 文本、图片(实测可处理长视频) |
| 定位 | GLM-5 系列首个原生多模态模型(非旗舰蒸馏版,为重新训练的基础模型) |
| 开源协议 | MIT License(权重 + 代码,免费商用) |
| 权重规模 | FP8 格式约 328.3 GB(62 个分片) |
| 推理框架 | SGLang、vLLM、TokenSpeed、KTransformers |
| API 模型 ID | glm-5.3-flash |
作为对比:GLM-4.5 是 355B 总参 / 32B 激活 / 92 层;GLM-5.2 体量约 753B。GLM-5.3-Flash 参数更少、层数更浅,能力反而全面超越上一代旗舰 GLM-5.2——"Flash"这次不是把旗舰缩小,而是从架构层面重新设计了推理成本。
三、为什么能打?藏在架构里的"降本增效"革命
① 混合注意力:线性 + 稀疏,第一次用在开源前沿模型上
- 线性注意力通过状态建模处理局部依赖;
- 稀疏注意力用一个轻量级索引器,在长上下文中召回真正相关的全局信息——处理 1M 超长上下文时,不再让所有 Token 彼此做全量计算。
② IndexPool:索引器瘦身 4 倍
针对 1M 上下文下索引器自身的内存与延迟开销,智谱引入 IndexPool,通过加权池化把 4 个索引 key 向量压缩成 1 个。
③ mHC:流形约束超连接
进一步压缩预训练与扩展成本,配合 30T Token 语料,实现"少算一点,但别少干活"。
结果: 与 GLM-5.3 相比,注意力计算量降低 3.01 倍,KV Cache 缩小 4.44 倍;在 GLM-5.3、DeepSeek-V4-Flash、Kimi-K3 等基线中,GLM-5.3-Flash 的注意力计算量最低。这正是"Flash 档位的钱,干前沿档位的活"的技术前提——尤其对动辄跑几十分钟、几小时的 Coding / Agent 长任务,注意力成本和 KV Cache 直接决定推理账单。
四、价格屠夫:57 分 = Opus 4.8,价格只有 1/40
- Artificial Analysis 智能指数(v4.1.1):GLM-5.3-Flash 拿下 57 分,与 Claude Opus 4.8 持平;官方称其把该指数"性价比前沿"推到了每任务仅 0.045 美元(折扣价)——此前同等智能水平大约要贵 10 倍。
- 价格对标: GLM-5.3-Flash 官方定价仅为 GLM-5.3 的 1/10,限时折扣期 1/20;对标 Opus 4.8(API 输入 $5 / 输出 $25 每百万 Token)约为 1/40,且低于 DeepSeek-V4-Flash。
Z API 价格(每百万 Token):
| 档位 | 输入 | 缓存输入 | 输出 |
|---|---|---|---|
| 标准价 | $0.15 | $0.03 | $0.50 |
| 发布期 5 折(至 2026-09-09 24:00,UTC+8) | $0.075 | $0.015 | $0.25 |
需要澄清一点:"1/40"是用户拿到的价格,不是国产芯片硬件成本只有英伟达的 1/40——公开数据不足以支撑那种比较。更准确的说法是:一款完全由国产芯片集群承载的前沿模型服务,把面向用户的 API 价格压到了 Opus 4.8 的约 1/40。
五、原生多模态:智谱 GLM,终于"长眼睛"了
GLM-5.3-Flash 的视觉能力不是简单"看图",而是把视觉直接纳入 Coding 与 Agent 闭环:模型能"看见"自己生成的页面、交互和 3D 场景,再根据视觉反馈继续修改——这才是前端开发、游戏制作、Blender 3D 这类任务"一次做对"的关键。
媒体实测案例(量子位):
- 🎬 给一段多人说话的视频,它能分清谁在说话、捕捉只出现一次的"名签"细节,精准配上字幕;
- 🍿 喂一整部电影《神话》,它能自己截取关键片段、把控剧情,生成完整电影解说视频;
- 🖥️ 给一张产品设计稿图片,直接产出可交互的产品界面;
- 🏠 官方案例:无外部素材,自主运行 16 小时,在 Blender 中搭建约 400 平方米的专业主厨住宅与测试厨房。
这种能力同样延伸到 PPTX、PDF、DOCX、XLSX 与金融、法律等专业任务——模型不仅生成内容,还会通过视觉结果检查并修改自己的输出。用官方的话说:“代码让模型构建和改变世界,视觉让它进入人们看到和使用的世界。”
⚠️ 小提醒:目前 Z 正式 API 文档确认的输入模态为文本与图片(视频输入仍在实测与匿名测试阶段展示过),官方评测对不支持原生视频的模型采用 1fps 抽帧。
六、硬核评测:官方数据一览
以下为智谱官方公布的评测(多为带工具 + max 思考档位,与无工具口径不可直接比较)。
编程与智能体(GLM-5.3-Flash / GLM-5.2 / DeepSeek-V4-Vision-Exp / Opus 4.8 / GPT-5.6 Terra / Gemini 3.7 Flash):
| 评测 | GLM-5.3-Flash | GLM-5.2 | DS-V4-Vision | Opus 4.8 | GPT-5.6 Terra | Gemini 3.7 Flash |
|---|---|---|---|---|---|---|
| Terminal-Bench 2.1 | 84.3 | 81 | 83.9 | 85 | 87.4 | 85.8 |
| DeepSWE v1.1 | 63.4 | 46.2 | 59.3 | 58 | 69.6 | 65.3 |
| NL2Repo | 56.3 | 48.9 | 57.7 | 69.7 | — | — |
| Toolathlon Verified | 78.4 | 59.9 | 75.9 | 76.2 | 74.9 | — |
| AutomationBench v1.0.6 | 48.8 | 26.2 | 38.8 | 41 | 37.2 | 52.3 |
| Agents’ Last Exam | 26.3 | 20.4 | 27.3 | 27 | 28 | — |
| HLE(带工具) | 55.3 | 54.7 | 55.1 | 57.9 | — | — |
| GDPval-AA v2 | 1773 | 1504 | 1675 | 1582 | 1571 | 1527 |
视觉(GLM-5.3-Flash / DeepSeek-V4-Vision-Exp / Opus 4.8 / GPT-5.6 Terra / Gemini 3.7 Flash):
| 评测 | GLM-5.3-Flash | DS-V4-Vision | Opus 4.8 | GPT-5.6 Terra | Gemini 3.7 Flash |
|---|---|---|---|---|---|
| OfficeQA Pro | 62.4 | 57.9 | 48.9 | — | — |
| CharXiv Reasoning(带工具) | 89.4 | 80.4 | 89.9 | 88 | 88.7 |
| Chartography(带工具) | 78.0 | 64.3 | 75 | 68 | 65 |
| BabyVision | 53.4 | 35.1 | 46.8 | 61.6 | 70.9 |
| MVBench | 77.8 | 69.4 | 67.1 | 75 | 82.2 |
| MMVU | 80.5 | 72.7 | 67.4 | 75.8 | 82.3 |
读表要点: 六项编程与智能体评测中,GLM-5.3-Flash 全面碾压 GLM-5.2(DeepSWE 63.4 vs 46.2、AutomationBench 48.8 vs 26.2),总体逼近 Opus 4.8;工具编排(Toolathlon Verified 78.4)甚至反超 Opus 4.8。与旗舰 GLM-5.3 相比,工程类任务差距在 4 分以内,主要差距集中在高难度学术推理 HLE(55.3 vs 62.5)。视觉评测上,文档/图表理解领先,动态视频类(BabyVision/MVBench)则弱于 Gemini 3.7 Flash——领先不是全维度碾压,而是精准的"性价比领先"。
七、更大的意义:10 万+ 张国产卡,接住了全球流量
这次发布最"提气"的一点,藏在算力谜底里:
- 智谱调用超过 10 万张国产芯片组成大规模集群,为 GLM-5.3-Flash 提供线上推理服务(未公布具体芯片型号)——这是国产算力首次大规模直接承载全球开发者的真实线上负载,不是实验室峰值展示。
- 为了在内存、带宽受限的国产单卡上扛住 1M 上下文,智谱基于 SGLang 打造专用推理引擎,叠加节点内张量并行、ReplaySSM、W8A8 量化、INT8/FP8/BF16 混合缓存量化、Layer Split 等优化,用"以算力换带宽、以通信换显存"的思路突破硬件限制。
- 集群层面采用 Encode-Prefill-Decode(EPD)分离式架构:多模态编码、Prompt 预填充、逐 Token 解码拆成三个可独立调度、独立扩缩容的工作池。
- 结果:端到端服务性能较同硬件初始基线提升 3 倍,硬件效率与单 Token 成本达到与主流英伟达 GPU 相当的水平。
更有意思的是,这套推理系统的优化,还借助了 GLM-5.3 驱动的智能体帮忙写 kernel、诊断瓶颈——“模型帮优化服务于模型自己的系统”,一个漂亮的自我强化闭环。匿名测试期间所有推理流量均由国产芯片承载,这意味着:国产算力不仅能"跑通"前沿模型,还能"经济地扛住"全球级的并发流量。
八、MIT 开源:说部署就部署
- 权重已上传 Hugging Face(zai-org/GLM-5.3-Flash),代码在 GitHub(zai-org/GLM-5),协议为 MIT License——同档位限制最少的许可,商用无附加条件;
- 本地部署已支持 SGLang、vLLM、TokenSpeed,KTransformers 等框架也可用;
- 官方 API 推荐参数:
reasoning_effort支持 low / high / max 三档(推荐 max),思考不可关闭,流式调用建议同时开启stream与tool_stream。
怎么体验:
- 💬 在线体验:ZCode(zcode.z),支持 Browser Use / Computer Use,Agent 可以点击并"目视"验证网页、操作桌面应用;
- 🧑💻 GLM Coding Plan 用户已全量开放,可用额度是 GLM-5.3 的 3 倍;
- 🔌 API:模型 ID
glm-5.3-flash,BigModel 开放平台与 Z 同步上线。
九、泼几盆冷水:别被"爆款"冲昏头
- "57 分追平 Opus 4.8"是综合指数,不等于全任务追平。 单项基准、长任务稳定性、真实 Agent 任务仍有差距;高难度学术推理(HLE)与旗舰 GLM-5.3 尚有距离。
- 官方评测口径偏"带工具 + max 档",与无工具成绩不可直接对比;社区曾流传 DeepSWE 小样本 80% 的成绩,扩大样本后实际约 63%——虽仍属第一梯队,但别被孤例误导。
- Token 效率是隐藏变量。 有第三方研究指出,部分场景下中文模型"单价便宜但更费 Token",按任务总成本算未必总是最优——选型要看"每任务成本"而非只看每百万 Token 价格。
- 视频输入尚未在正式 API 全面确认,多模态"完全体"仍需官方后续说明。
十、结语:前沿智能,进入普惠时代
GLM-5.3-Flash 的意义不只是一款新模型:开源权重 + 前沿能力 + 国产算力大规模在线承载 + 极低 API 价格,四件事第一次同时出现。当 OpenRouter 上中国模型的月度 Token 份额从去年初的不到 10% 涨到今年 7 月的 60%+,当一款 57 分的模型把每任务成本压到 0.045 美元,价格战的天平正在肉眼可见地倾斜。
正如智谱官方所说:“前沿智能,不必付出前沿价格。” 能干活,吃得少——而且这回,牛是自己的,草也是自己的。🐂
📚 参考来源
- 智谱官方博客:GLM-5.3-Flash: Frontier Intelligence, Flash Cost
- 智谱开放平台:GLM-5.3-Flash 模型文档
- Hugging Face:zai-org/GLM-5.3-Flash
- GitHub:zai-org/GLM-5
- 腾讯科技:智谱"牛来"模型算力谜底——全部国产卡承载,价格仅为 Opus 4.8 的 1/40
- 量子位(经搜狐转载):神秘「牛来」模型果然是智谱!GLM 首个原生多模态,还用的国产卡
- DataLearner:GLM-5.3-Flash 架构、视觉编程能力、官方评测与价格
- BlockBeats:The “BullSoar” Model GLM-5.3-Flash Officially Open Source
- Edgen:Zhipu’s GLM-5.3-Flash matches Claude Opus 4.8 at 1/40 the price
- OpenRouter:GLM 5.3 Flash - API Pricing & Providers
- DoNews:智谱发布今日上线并开源多模态模型 GLM-5.3-Flash
- 点赞
- 收藏
- 关注作者
评论(0)