
高盛大幅上调中国大模型收入预期,性价比只是起点,能力才是真正的底牌
高盛大幅上调中国大模型收入预期,预计 2026 年末合计 ARR 达 130 亿美元,2030 年升至 1250 亿美元。Jefferies 指出中国模型在 OpenRouter 平台调用量领先。市场正从 “性价比” 转向 “收入兑现”,Agent 与编码场景重塑 token 消费模式,头部厂商如智谱、MiniMax 获上调评级,呈现高端智能溢价与低端规模效应并存的 “双层结构”。
中国大模型的收入兑现速度,正在超出华尔街此前的预判。
8 月 3 日,高盛亚太互联网团队分析师 Ronald Keung 在最新研报中将中国大模型厂商 2026 年末合计 ARR(年度经常性收入)预期从 100 亿美元上调至 130 亿美元,并预测 2030 年将攀升至 1250 亿美元——五年 25 倍。同日,Jefferies 最新研报中用更密实的数据刻画了另一条暗线:OpenRouter 平台上,中国模型已连续 14 周包揽调用量前五,DeepSeek V4 Flash 单周消耗 7.22 万亿 token 登顶全球。
一条线是收入预期的上调,一条线是 token 消费的结构性爆发。二者交汇之处,正是中国大模型从 “性价比叙事” 迈入 “收入兑现叙事” 的拐点——而驱动这一拐点的核心力量,正是 Agent 与编码场景对 token 消费模式的根本性重塑。
叙事切换:收入兑现时刻已到来
高盛预测,中国大模型的 API 及订阅收入将从 2026 年估算的 350 亿元人民币增长至 2030 年的 8790 亿元,对应每日 token 消耗量从 350 万亿增至 4600 万亿。这意味着,五年间收入与 token 消耗量同增约 25 倍,且增速仍在加速而非递减。
更关键的是收入结构的分化。高盛对智谱和 MiniMax 的收入估计分别上调了 35% 和 22%—64%,反映出市场对中国头部模型公司商业化能力的重新定价。高盛将中国 AI 模型市场描述为正在形成的 “双层结构”:高端市场以智谱 GLM5.2 和阿里 Qwen3.7 Max 为代表,定价约每百万 token 1 美元;低端市场面向 Agent 任务的模型定价低至每百万 token 0.06 至 0.2 美元。两层市场均在快速扩张,但驱动因素截然不同——高端靠智能溢价,低端靠规模效应。
不过,高盛也坦承现实约束:2026 年行业训练总成本 40 亿美元、推理总成本 70 亿美元,合计高于当期 ARR,板块整体仍处于负 EBIT 状态。API 业务毛利率当前仅 20%—30%,盈利拐点要到 2030 年才会出现,届时板块 EBIT 利润率可达 18%,对应总利润 230 亿美元。换言之,这是一条 “先烧钱、后兑现” 的路径,但终点已被清晰标定。

极致性价比:4 到 8 倍的价差
性价比不是新话题,但价差的量级仍令人咋舌。
高盛算过一笔账:一名 Agent 开发者每日约消耗 709 万 token,在美国顶尖模型上运行,单日算力 “燃料费” 为 52 至 104 美元;切换至中国头部模型后,成本骤降至 13 美元。4 到 8 倍的价差,使得 “不使用中国模型” 变成了一项需要向 CFO 作出合理解释的商业决策。
价差的底层是架构红利。中国模型普遍采用 MoE(混合专家)架构,通过极低的参数激活比压低推理成本。以 DeepSeek V4 Flash 为例,输入价格仅为每百万 token 0.14 美元,输出 0.28 美元——而 OpenAI GPT-5.5 的报价是 5 美元,差距在 35 倍以上。更关键的是 DeepSeek 的缓存命中折扣机制:命中缓存只按标价 2% 计费,远超业内普遍的 90% 折扣水平。这意味着,对于 Agent 场景中大量重复性的上下文读取,实际成本还能再降一个数量级。
但价格只是硬币的一面。真正让华尔街重新评估的,是中国模型在能力维度上的快速跃迁”。中国 AI 性价比的真正含义正在被重写:它早已突破了"便宜但凑合"的旧标签,转而代表着"足够好且不可不用"的新标准。

不只是便宜:能力超越的临界时刻
高盛将中国大模型的发展划分为两个阶段:2025 年是 “DeepSeek 时刻”,行业依托 MoE 架构大幅压低推理成本,核心优势落在成本效率;2026 年是 “智谱时刻”,GLM 5.2 跻身代码、智能体等高价值赛道全球第一梯队,证明国产模型性能具备全球竞争力。前者降低了成本,后者证明了能力。
这并非投行的溢美之词。三个月内,中国大模型跻身全球文本赛道前 50% 的模型新增 13 款;代码赛道全球前 30% 新增 5 款;智能体赛道实现从零到一的突破,GLM-5.2 稳居全球前 7。在 Artificial Analysis 视频模型榜单中,MiniMax H3 的视频编辑能力排名全球第一,字节 Seedance 在多模态生成领域同样处于领先梯队。斯坦福 AI Index 数据显示,中美顶尖模型性能差距已缩小至约 2.7%——这个数字在一年前还是两位数。
能力超越的核心在于:中国模型的架构创新并非以牺牲性能为代价换取低成本。恰恰相反,MoE 架构的稀疏激活机制在压低推理成本的同时,通过更大的总参数量实现了更高的模型容量。MiniMax 在 M3 模型中推出的全新注意力架构 MSA(混合稀疏注意力),将 1M 超长上下文的处理成本降至传统架构的极低水平,同时在 Coding 和 Agent 基准测试中跻身全球前列。美团 LongCat 2.0 基于 5 万张国产算力卡完成 1.6 万亿参数全量训练,证明国产软硬件协同栈不仅能跑通,还能跑出竞争力。
更关键的是,能力超越正在从 “通用基准” 向 “高价值场景” 渗透。高盛的评估显示,在基础文本模型领域,智谱和 DeepSeek 表现最突出;在 Agent 工具调用和 Coding 场景中,阿里 Qwen3-Max 处于全球第一梯队。当中国模型不再只有在 “性价比赛道” 上领先,同时在智能体、编码、多模态生成等最考验模型深度理解与长程规划能力的赛道上与全球顶尖模型正面竞争时,“便宜” 就不再是唯一的故事——“更好” 正在成为新的叙事。
这也解释了为什么 OpenRouter 上的 token 消费不只是 “贪便宜” 的产物。当 Agent 开发者需要模型在数百次工具调用中保持指令遵循、长上下文记忆和错误恢复能力时,纯粹的价格优势不足以支撑持续使用——模型必须 “足够聪明且足够便宜”,二者缺一不可。中国模型正在同时满足这两个条件,这才是竞争态势被改写的根本原因。


Token 消费的结构性转向:从 “Chat” 到 “Work”
如果说收入预期上调是 “果”,那么 token 消费模式的转变就是 “因”。
OpenRouter 最新周报(7 月 27 日—8 月 2 日)显示,全球大模型调用量前五全部由中国模型包揽:DeepSeek V4 Flash(7.22 万亿)、小米 MiMo-V2.5(6.3 万亿)、腾讯混元 Hy3(4.82 万亿)、DeepSeek V4 Pro(3.28 万亿)、智谱 GLM5.2(2.89 万亿)。中国模型在全球平台的 token 份额已达 63.5%,美国跌至 35.5%。
但比排名更重要的是消费结构的质变。一个关键数据:同一份编码任务,AI Agent 自动化工作流平均消耗 417 万 token,普通代码问答仅消耗 3390token——相差超过 1000 倍。原因在于,Agent 需要不断读取上下文、调用工具并循环规划。真正昂贵的不是回答问题,而是让 AI 持续工作。
OpenCode 平台披露,DeepSeek V4 Flash 单日处理量已达 8 万亿 token,其中 5 万亿来自免费试用额度,3 万亿来自付费套餐。这种 “免费拉新 + 付费转化” 的路径,直观反映了 Agent 生态正在快速扩张。更值得关注的是,以 Hermes 为代表的 Agent 应用已经超过人类聊天,成为 OpenRouter 上最大的 token 消耗 App。
“Token 的主人正在换人”——过去三年,token 是人买的、人看的;从今年开始,越来越多的 token,人都不会看一眼——那是 Agent 在规划、调用工具、写代码、自我检查时,机器烧给机器的。这种转变不仅改变了需求的计算方式,也重塑了模型竞争的核心维度:衡量一款模型的单位,从 “单次回答有多聪明” 变成了 “完成一项长任务要花多少钱、多久、失败几次”。
这种转变也催生了 “多模型调用” 的新范式。微软已证实正在探索将 DeepSeek V4 部署在 Azure 上,用作 Copilot 的低成本模型选项;Airbnb CEO 公开表示公司依赖阿里 Qwen 模型用于大规模生产场景。企业客户正在从 “绑定单一模型” 转向 “便宜的和高级的搭配着来”——这种混用正在从个别企业的权宜之计,变成默认配置。


多模态与 Agent:竞争新前沿
当 token 消费从 “Chat” 转向 “Work”,竞争的前沿也在迁移。
7 月 31 日,MiniMax 发布新一代多模态生成模型 H3,并宣布近期开源。这是 MiniMax 推出的首款开源多模态生成模型,支持文本、图片、音频和视频等多种输入,可直出 2K 分辨率画面,最长生成 15 秒音画内容。在 Artificial Analysis 视频模型榜单中,H3 的视频编辑能力排名全球第一。
更具冲击力的是定价:H3 视频生成价格为 0.8 元/秒(2K 分辨率),仅为业内同类旗舰模型的三分之一。成本下降来自两个方向的技术优化——高压缩 Tokenizer 减少了视频生成所需的 token 数量,异构训练和 GPU 利用效率的系统性调优则控制了训练与推理成本。MiniMax 股价当日大涨超 14%,市场对 “极致性价比 + 开源” 的商业突围路径投下了赞成票。
在 Agent 应用层,竞争同样白热化。字节跳动发布面向 Agent 与 Coding 场景的 Seed 2.1 Pro,具备复杂任务编排、长程规划和工具调用能力;腾讯 WorkBuddy 在企业 Agent 应用市场占据 34% 的份额;智谱 GLM Coding Plan 同步开放订阅,1GW 级国产 AI 算力数据中心落地。编码场景已成为模型厂商必争之地——因为编码是 Agent 能力最直接的商业化出口,也是 token 消耗最密集的场景之一。
高盛注意到,AI 消耗 token 最多的两大应用——智能代理和编程——已大规模迁移至中国模型上运行。这不是因为中国模型品质超越了美国,而是因为其极低的单价使得规模化部署在经济上变得可行。当 Agent 任务需要调用上百次模型才能完成时,4 到 8 倍的价差会被放大成数百倍的账单差异。

CSP 财报前瞻:云收入加速兑现
模型层的繁荣正在向云收入层传导。
阿里云最新季度收入达 398.24 亿元,同比增长 34%,增速创三年新高。AI 相关产品收入连续第九个季度实现三位数增长,AI 相关服务贡献了云业务对外收入的约 20%。高盛预计,阿里云 AI 收入占比将从 30% 向 50% 迈进,推动整体云收入增速持续加速。
过去四个季度,阿里在 AI+ 云基础设施的资本开支约 1200 亿元。阿里巴巴 CEO 吴泳铭在财报电话会上明确表示:“三年规划 3800 亿的投资目前看说少了。” 阿里云 AI 服务器上架节奏跟不上客户订单增长速度,在手积压订单持续扩大。供应链端 FAB、存储、CPU 均处于紧缺状态,连 3 到 5 年前的老一代 GPU 都满载运行。
Jefferies 在研报中前瞻了即将到来的 CSP 财报季:阿里云收入预计加速至 45% YoY,腾讯云 AI 收入占比持续提升,百度智能云受益于文心系列模型迭代。云厂商正在从 “卖算力” 升级为 “卖 AI 能力”——这种转变意味着收入结构从线性的资源租赁,转向更具弹性的 MaaS+IaaS 混合模式,毛利率天花板也将被打开。

中国大模型正在经历一场双重转型
第一重,从 “性价比” 到 “收入兑现”。高盛将 ARR 预期从 100 亿上调至 130 亿美元,不是因为它突然变得乐观,而是因为 token 消费的数据已经跑出来了——7.22 万亿的周调用量不是预测,而是正在发生的现实。当中国模型连续 14 周包揽 OpenRouter 前五,当 Agent 开发者每天烧掉 8 万亿 token,收入预期的上调只是对既有趋势的滞后确认。
第二重,从 “Chat” 到 “Work”。token 消费的主人正在从人变成 Agent,这不仅是量的爆发,更是质的转变。Agent 任务的 token 消耗是普通问答的 1000 倍,而中国模型 4 到 8 倍的价格优势在这种量级下被放大成不可逾越的成本壁垒。微软在 Azure 上部署 DeepSeek、Airbnb 依赖 Qwen——企业用脚投票的结果,比任何 benchmark 都更有说服力。
两条线交织的结论很清晰:中国大模型的竞争态势正在被改写。竞争的核心不仅仅是谁的参数更大、谁的 benchmark 分数更高,谁能把推理成本压到最低、谁能在 Agent 和编码场景中捕获最多的 token 消费、谁能将模型能力最快地转化为云收入。这是一场关于成本、场景和生态的综合博弈——而中国模型,正在从 “跟跑者” 变为 “规则制定者”。
风险提示及免责条款
市场有风险,投资需谨慎。本文不构成个人投资建议,也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资,责任自负。
