神秘「牛来」真身曝光

举报
yd_216821150 发表于 2026/08/27 11:59:21 2026/08/27
【摘要】 🐂 神秘「牛来」真身曝光:320B 开源模型 AA 57 分追平 Claude Opus 4.8,价格只有 1/40,还全跑在国产卡上!一句话看懂: 匿名刷屏六天的「牛来」(Ox Alpha),是智谱 8 月 26 日晚正式发布并开源的 GLM-5.3-Flash——3200 亿总参数、仅 180 亿激活的 GLM-5 系列首个原生多模态模型。它在 Artificial Analysis...

🐂 神秘「牛来」真身曝光:320B 开源模型 AA 57 分追平 Claude Opus 4.8,价格只有 1/40,还全跑在国产卡上!

一句话看懂: 匿名刷屏六天的「牛来」(Ox Alpha),是智谱 8 月 26 日晚正式发布并开源的 GLM-5.3-Flash——3200 亿总参数、仅 180 亿激活的 GLM-5 系列首个原生多模态模型。它在 Artificial Analysis 综合智能指数拿到 57 分,与 Claude Opus 4.8 持平,价格却只有后者的 1/40;匿名测试期间的全球真实流量,全部由 10 万+ 张国产芯片承载


📌 先看结论:五个爆点

# 爆点 数据
1 匿名登顶 以 Ox Alpha 名义测试,首日冲上 OpenRouter 榜首、刷新单日 Token 用量纪录,终结 DeepSeek 在 OpenCode 连续 56 天霸榜
2 能力追平旗舰 AA 智能指数 57 分 = Claude Opus 4.8;Z Code Bench 上 max 档 29.0 vs Opus 4.8 的 29.5
3 价格屠夫 仅为 GLM-5.3 的 1/10,限时折扣 1/20,约为 Opus 4.8 的 1/40,定价还低于 DeepSeek-V4-Flash
4 架构革命 320B 总参 / 18B 激活 / 45 层,首用"线性注意力 + 稀疏注意力"混合架构,注意力计算量降 3.0 倍、KV Cache 降 4.4 倍
5 纯血国产 10 万+ 张国产芯片集群承载全球真实流量,端到端服务性能较基线提升 3 倍,单 Token 成本与主流英伟达 GPU 相当

一、谜底揭晓:这几天刷屏的「牛来」,果然是智谱

过去六天,海外开发者圈被一个代号 Ox Alpha(中文名「牛来」)的神秘模型刷屏了:

  • OpenRouter 上,它首日冲上榜首,还刷新了平台单日 Token 用量历史纪录
  • OpenCode 上,它一出世就终结了 DeepSeek 连续 56 天霸榜的纪录;
  • 有博主用同一个 Prompt 让它手搓 SpaceX Raptor 猛禽发动机 3D 交互网页,直呼"越用越惊艳"。

8 月 26 日晚,智谱正式认领:「牛来」就是 GLM-5.3-Flash——GLM-5 系列第一个原生多模态模型,发布即开源。它不是在实验室里秀肌肉,而是用真实全球流量在国产芯片上跑了一周,才把这张牌翻开。


二、核心参数速览

项目 GLM-5.3-Flash
总参数 / 激活参数 3200 亿 / 180 亿(MoE,45 层)
预训练语料 30T Token 多模态语料
上下文窗口 1M Token(最大输出 128K)
输入模态 文本、图片(实测可处理长视频)
定位 GLM-5 系列首个原生多模态模型(非旗舰蒸馏版,为重新训练的基础模型)
开源协议 MIT License(权重 + 代码,免费商用)
权重规模 FP8 格式约 328.3 GB(62 个分片)
推理框架 SGLang、vLLM、TokenSpeed、KTransformers
API 模型 ID glm-5.3-flash

作为对比:GLM-4.5 是 355B 总参 / 32B 激活 / 92 层;GLM-5.2 体量约 753B。GLM-5.3-Flash 参数更少、层数更浅,能力反而全面超越上一代旗舰 GLM-5.2——"Flash"这次不是把旗舰缩小,而是从架构层面重新设计了推理成本。


三、为什么能打?藏在架构里的"降本增效"革命

① 混合注意力:线性 + 稀疏,第一次用在开源前沿模型上

  • 线性注意力通过状态建模处理局部依赖;
  • 稀疏注意力用一个轻量级索引器,在长上下文中召回真正相关的全局信息——处理 1M 超长上下文时,不再让所有 Token 彼此做全量计算。

② IndexPool:索引器瘦身 4 倍

针对 1M 上下文下索引器自身的内存与延迟开销,智谱引入 IndexPool,通过加权池化把 4 个索引 key 向量压缩成 1 个。

③ mHC:流形约束超连接

进一步压缩预训练与扩展成本,配合 30T Token 语料,实现"少算一点,但别少干活"。

结果: 与 GLM-5.3 相比,注意力计算量降低 3.01 倍,KV Cache 缩小 4.44 倍;在 GLM-5.3、DeepSeek-V4-Flash、Kimi-K3 等基线中,GLM-5.3-Flash 的注意力计算量最低。这正是"Flash 档位的钱,干前沿档位的活"的技术前提——尤其对动辄跑几十分钟、几小时的 Coding / Agent 长任务,注意力成本和 KV Cache 直接决定推理账单。


四、价格屠夫:57 分 = Opus 4.8,价格只有 1/40

  • Artificial Analysis 智能指数(v4.1.1):GLM-5.3-Flash 拿下 57 分,与 Claude Opus 4.8 持平;官方称其把该指数"性价比前沿"推到了每任务仅 0.045 美元(折扣价)——此前同等智能水平大约要贵 10 倍。
  • 价格对标: GLM-5.3-Flash 官方定价仅为 GLM-5.3 的 1/10,限时折扣期 1/20;对标 Opus 4.8(API 输入 $5 / 输出 $25 每百万 Token)约为 1/40,且低于 DeepSeek-V4-Flash。

Z API 价格(每百万 Token):

档位 输入 缓存输入 输出
标准价 $0.15 $0.03 $0.50
发布期 5 折(至 2026-09-09 24:00,UTC+8) $0.075 $0.015 $0.25

需要澄清一点:"1/40"是用户拿到的价格,不是国产芯片硬件成本只有英伟达的 1/40——公开数据不足以支撑那种比较。更准确的说法是:一款完全由国产芯片集群承载的前沿模型服务,把面向用户的 API 价格压到了 Opus 4.8 的约 1/40。


五、原生多模态:智谱 GLM,终于"长眼睛"了

GLM-5.3-Flash 的视觉能力不是简单"看图",而是把视觉直接纳入 Coding 与 Agent 闭环:模型能"看见"自己生成的页面、交互和 3D 场景,再根据视觉反馈继续修改——这才是前端开发、游戏制作、Blender 3D 这类任务"一次做对"的关键。

媒体实测案例(量子位):

  • 🎬 给一段多人说话的视频,它能分清谁在说话、捕捉只出现一次的"名签"细节,精准配上字幕;
  • 🍿 喂一整部电影《神话》,它能自己截取关键片段、把控剧情,生成完整电影解说视频
  • 🖥️ 给一张产品设计稿图片,直接产出可交互的产品界面;
  • 🏠 官方案例:无外部素材,自主运行 16 小时,在 Blender 中搭建约 400 平方米的专业主厨住宅与测试厨房。

这种能力同样延伸到 PPTX、PDF、DOCX、XLSX 与金融、法律等专业任务——模型不仅生成内容,还会通过视觉结果检查并修改自己的输出。用官方的话说:“代码让模型构建和改变世界,视觉让它进入人们看到和使用的世界。”

⚠️ 小提醒:目前 Z 正式 API 文档确认的输入模态为文本与图片(视频输入仍在实测与匿名测试阶段展示过),官方评测对不支持原生视频的模型采用 1fps 抽帧。


六、硬核评测:官方数据一览

以下为智谱官方公布的评测(多为带工具 + max 思考档位,与无工具口径不可直接比较)。

编程与智能体(GLM-5.3-Flash / GLM-5.2 / DeepSeek-V4-Vision-Exp / Opus 4.8 / GPT-5.6 Terra / Gemini 3.7 Flash):

评测 GLM-5.3-Flash GLM-5.2 DS-V4-Vision Opus 4.8 GPT-5.6 Terra Gemini 3.7 Flash
Terminal-Bench 2.1 84.3 81 83.9 85 87.4 85.8
DeepSWE v1.1 63.4 46.2 59.3 58 69.6 65.3
NL2Repo 56.3 48.9 57.7 69.7
Toolathlon Verified 78.4 59.9 75.9 76.2 74.9
AutomationBench v1.0.6 48.8 26.2 38.8 41 37.2 52.3
Agents’ Last Exam 26.3 20.4 27.3 27 28
HLE(带工具) 55.3 54.7 55.1 57.9
GDPval-AA v2 1773 1504 1675 1582 1571 1527

视觉(GLM-5.3-Flash / DeepSeek-V4-Vision-Exp / Opus 4.8 / GPT-5.6 Terra / Gemini 3.7 Flash):

评测 GLM-5.3-Flash DS-V4-Vision Opus 4.8 GPT-5.6 Terra Gemini 3.7 Flash
OfficeQA Pro 62.4 57.9 48.9
CharXiv Reasoning(带工具) 89.4 80.4 89.9 88 88.7
Chartography(带工具) 78.0 64.3 75 68 65
BabyVision 53.4 35.1 46.8 61.6 70.9
MVBench 77.8 69.4 67.1 75 82.2
MMVU 80.5 72.7 67.4 75.8 82.3

读表要点: 六项编程与智能体评测中,GLM-5.3-Flash 全面碾压 GLM-5.2(DeepSWE 63.4 vs 46.2、AutomationBench 48.8 vs 26.2),总体逼近 Opus 4.8;工具编排(Toolathlon Verified 78.4)甚至反超 Opus 4.8。与旗舰 GLM-5.3 相比,工程类任务差距在 4 分以内,主要差距集中在高难度学术推理 HLE(55.3 vs 62.5)。视觉评测上,文档/图表理解领先,动态视频类(BabyVision/MVBench)则弱于 Gemini 3.7 Flash——领先不是全维度碾压,而是精准的"性价比领先"


七、更大的意义:10 万+ 张国产卡,接住了全球流量

这次发布最"提气"的一点,藏在算力谜底里:

  • 智谱调用超过 10 万张国产芯片组成大规模集群,为 GLM-5.3-Flash 提供线上推理服务(未公布具体芯片型号)——这是国产算力首次大规模直接承载全球开发者的真实线上负载,不是实验室峰值展示。
  • 为了在内存、带宽受限的国产单卡上扛住 1M 上下文,智谱基于 SGLang 打造专用推理引擎,叠加节点内张量并行、ReplaySSM、W8A8 量化、INT8/FP8/BF16 混合缓存量化、Layer Split 等优化,用"以算力换带宽、以通信换显存"的思路突破硬件限制。
  • 集群层面采用 Encode-Prefill-Decode(EPD)分离式架构:多模态编码、Prompt 预填充、逐 Token 解码拆成三个可独立调度、独立扩缩容的工作池。
  • 结果:端到端服务性能较同硬件初始基线提升 3 倍,硬件效率与单 Token 成本达到与主流英伟达 GPU 相当的水平。

更有意思的是,这套推理系统的优化,还借助了 GLM-5.3 驱动的智能体帮忙写 kernel、诊断瓶颈——“模型帮优化服务于模型自己的系统”,一个漂亮的自我强化闭环。匿名测试期间所有推理流量均由国产芯片承载,这意味着:国产算力不仅能"跑通"前沿模型,还能"经济地扛住"全球级的并发流量。


八、MIT 开源:说部署就部署

  • 权重已上传 Hugging Face(zai-org/GLM-5.3-Flash),代码在 GitHub(zai-org/GLM-5),协议为 MIT License——同档位限制最少的许可,商用无附加条件;
  • 本地部署已支持 SGLang、vLLM、TokenSpeed,KTransformers 等框架也可用;
  • 官方 API 推荐参数:reasoning_effort 支持 low / high / max 三档(推荐 max),思考不可关闭,流式调用建议同时开启 streamtool_stream

怎么体验:

  • 💬 在线体验:ZCode(zcode.z),支持 Browser Use / Computer Use,Agent 可以点击并"目视"验证网页、操作桌面应用;
  • 🧑‍💻 GLM Coding Plan 用户已全量开放,可用额度是 GLM-5.3 的 3 倍
  • 🔌 API:模型 ID glm-5.3-flash,BigModel 开放平台与 Z 同步上线。

九、泼几盆冷水:别被"爆款"冲昏头

  1. "57 分追平 Opus 4.8"是综合指数,不等于全任务追平。 单项基准、长任务稳定性、真实 Agent 任务仍有差距;高难度学术推理(HLE)与旗舰 GLM-5.3 尚有距离。
  2. 官方评测口径偏"带工具 + max 档",与无工具成绩不可直接对比;社区曾流传 DeepSWE 小样本 80% 的成绩,扩大样本后实际约 63%——虽仍属第一梯队,但别被孤例误导。
  3. Token 效率是隐藏变量。 有第三方研究指出,部分场景下中文模型"单价便宜但更费 Token",按任务总成本算未必总是最优——选型要看"每任务成本"而非只看每百万 Token 价格。
  4. 视频输入尚未在正式 API 全面确认,多模态"完全体"仍需官方后续说明。

十、结语:前沿智能,进入普惠时代

GLM-5.3-Flash 的意义不只是一款新模型:开源权重 + 前沿能力 + 国产算力大规模在线承载 + 极低 API 价格,四件事第一次同时出现。当 OpenRouter 上中国模型的月度 Token 份额从去年初的不到 10% 涨到今年 7 月的 60%+,当一款 57 分的模型把每任务成本压到 0.045 美元,价格战的天平正在肉眼可见地倾斜。

正如智谱官方所说:“前沿智能,不必付出前沿价格。” 能干活,吃得少——而且这回,牛是自己的,草也是自己的。🐂


📚 参考来源

  • 智谱官方博客:GLM-5.3-Flash: Frontier Intelligence, Flash Cost
  • 智谱开放平台:GLM-5.3-Flash 模型文档
  • Hugging Face:zai-org/GLM-5.3-Flash
  • GitHub:zai-org/GLM-5
  • 腾讯科技:智谱"牛来"模型算力谜底——全部国产卡承载,价格仅为 Opus 4.8 的 1/40
  • 量子位(经搜狐转载):神秘「牛来」模型果然是智谱!GLM 首个原生多模态,还用的国产卡
  • DataLearner:GLM-5.3-Flash 架构、视觉编程能力、官方评测与价格
  • BlockBeats:The “BullSoar” Model GLM-5.3-Flash Officially Open Source
  • Edgen:Zhipu’s GLM-5.3-Flash matches Claude Opus 4.8 at 1/40 the price
  • OpenRouter:GLM 5.3 Flash - API Pricing & Providers
  • DoNews:智谱发布今日上线并开源多模态模型 GLM-5.3-Flash
【声明】本内容来自华为云开发者社区博主,不代表华为云及华为云开发者社区的观点和立场。转载时必须标注文章的来源(华为云社区)、文章链接、文章作者等基本信息,否则作者和本社区有权追究责任。如果您发现本社区中有涉嫌抄袭的内容,欢迎发送邮件进行举报,并提供相关证据,一经查实,本社区将立刻删除涉嫌侵权内容,举报邮箱: cloudbbs@huaweicloud.com
  • 点赞
  • 收藏
  • 关注作者

评论(0

0/1000
抱歉,系统识别当前为高风险访问,暂不支持该操作

全部回复

上滑加载中

设置昵称

在此一键设置昵称,即可参与社区互动!

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。