AI 算力需求端深研:渗透率 × Token 爆炸 ×「结构性过剩还是前沿仍紧」
1️⃣ 需求总量:仍在指数级增长,无争议。ChatGPT 周活已达 9 亿(逼近 10 亿);高盛预测 2030 年全球月度 Token 消耗较 2026 年增 24 倍至每月 120 千万亿,2040 年达 55 倍;摩根大通测算中国 AI 推理 Token 2025→2030 增约 370 倍。需求端不存在"失速"证据。
2️⃣ 供给端:总量在宽松化,但出现「代际分层」。四大云厂 2026 年 AI capex 突破 7000 亿美元、英伟达高端 GPU 出货年增约 26%;但与此同时 Meta 开始出售闲置的上一代 H100/H200 算力、北美企业通用 GPU 平均利用率不足 20%、推理 API 价格 2026 上半年仍断崖下滑。
3️⃣ 平衡判断:既不是一刀切过剩,也不是无解紧缺——而是「总量宽松化 + 前沿算力仍紧俏」的结构性分层。上一代算力(H100/H200)已局部过剩并被资本化抛售;而最先进的 GB300/Rubin、HBM、电力与液冷仍是瓶颈(HBM 一度单季涨价近 90%,Rubin 出货递延)。
4️⃣ 对上一篇「3 万亿表外承诺」的含义:短期更安全、中期看需求兑现率。只要 Token 持续高增长,九巨头的资本义务大概率会转实(从"或有"变"承诺"),但可被持续收入覆盖——真正的风险触发点不是"不够紧",而是"利用率/推理价格持续恶化"(见第 7 节证伪清单)。
① 需求总量:AI 渗透率全景(普及到了哪一步)
消费端:头部模型已进入"国民级"渗透
| 指标 | 最新数据 | 说明 |
|---|---|---|
| ChatGPT 周活 | 9 亿(2026-02 确认,7 月报道逼近 10 亿) | 全球最大 AI 产品,同比约翻倍后增速仍未见顶 |
| 企业 Agent 采用率 | 62% 的企业已在部署/试点 | 2026 年企业 AI Agent 统计合集(120+ 数据点) |
| 应用级 Agent 嵌入 | 2026 年末 40% 企业应用嵌入 task-specific agent | Gartner 预测(2026-08 更新) |
| 形态判断 | 从"聊天机器人"向"Agent 工作流"迁移——使用密度(人均 token)远快于用户数增长 | |
② Token 用量:爆炸式增长的量化锚点(核心)
• 2030 年全球月度 Token 消耗较 2026 年 增 24 倍 ≈ 每月 120 quadrillion(120 千万亿);2040 年累计达当前 55 倍。
• 全球日 AI 查询量:2025 年约 50 亿次 → 2030 年 230 亿次,其中约 30% 由智能体完成。
• 拆分:2030 年消费级智能体月消耗约 60 千万亿 Token、企业级约 56 千万亿 Token。
• 单任务消耗梯度:普通聊天 ~1,000 Token/会话 < 嵌入式 Copilot ~5,000/天 < Always-on Agent >10 万/天 < 编程 Agent ~700 万/天(成本仅约 $13)——Agent 是把用量放大 100-1000 倍的杠杆。
• 成本侧:底层单 Token 计算成本每年下降约 60%-70%(英伟达/AMD/谷歌 TPU/亚马逊 Trainium 合力);云厂商与模型厂有望 2026 上半年毛利率转正。
独立测算交叉验证
| 来源 | 预测 | 置信度 |
|---|---|---|
| 高盛(2026-05) | 月度 Token 2030 年 ×24、2040 ×55 | 中高(主流上行) |
| 摩根大通(2026-02) | 中国 AI 推理 Token 2025→2030 ×370 | 中(含乘数假设) |
| 推理算力占比 | 推理已占全球 AI 算力需求约 2/3(2023 年仅 1/3)——从"训练主导"转向"推理主导" | 高(行业共识) |
🔬 双顾问交叉验证:上述量级经两位独立外部模型推演复核(其训练截止早于实采时点,按趋势外推 ChatGPT 2026 周活 4.5–8 亿 vs 本文实采 OpenAI 披露 9 亿——量级互相印证)。并补两个结构性事实:① 训练:推理算力占比 2023 约 55:45,2026 推理预计升至约 80–90%——需求正从"训练一次性消耗"转向"推理持续消耗";② Agent 复杂任务单次消耗 5 万–50 万 Token,较单次对话放大 10–100 倍。③ 终端 on-device 推理(AI PC/AI 手机 2026 渗透预计 40%±)净增加云端 Token 需求(Jevons 悖论:门槛下降拉动多模态/复杂任务上云)。
③ 需求结构性驱动:为什么 Agent 是主引擎、不是聊天
"机机互动" vs "人机互动":Token 密度天壤之别
| 工作负载 | 单任务/单日 Token | 驱动类型 |
|---|---|---|
| 消费者对话 | ~1,000 | 间歇、低频、任务结束即止 |
| 嵌入办公 Copilot | ~5,000/天 | 工作流辅助,仍以人触发为主 |
| Always-on Agent | >100,000 /天 | 持续监控+自动调工具+多轮自校验 |
| 编程 Agent | ~7,000,000 /天 | 高价值文本密集型,已率先进入正 ROI($13/天) |
| 客服语音 Agent | ~$93/天 | 实时语音推理仍偏贵,尚未全面替代人工 |
👉 高盛明确:推动 Token 爆炸的不是聊天机器人,而是"持续在线(Always-on)"的智能体——它反复读取上下文、循环执行、验证结果,消耗呈数量级跃升。企业端目前真正大规模部署的不足 25%,且多为"Copilot 辅助"而非完全自主 Agent——渗透率仍处早期,是最大上行期权。
④ 供给端全景:扩产仍在、但有分层
芯片与资本开支(供给增长侧)
| 维度 | 数据 | 口径/来源 |
|---|---|---|
| 四大云厂 2026 年 AI capex | 突破 7,000 亿美元(Meta 上限 1,450 亿) | 行业公开汇总(2026) |
| 英伟达 2026 高端 GPU 出货 | 年增约 26%(自 26.8% 微幅下修) | TrendForce 2026-04 |
| 出货结构 | Blackwell 71%(升)|Rubin 22%|Hopper 7% | TrendForce(Rubin 递延) |
| NVIDIA 推理 LPU | 2026 需求有望达数十万张、2027 翻倍 | TrendForce |
| HBM 价格 | 2026 上半年一度+90% 暴涨(存储荒);2026-03 起市场预警 2026-27 供应修正 | 行业报道:紧跟最先进算力的瓶颈仍在 |
| 模型侧投入 | 2026 年谷歌/亚马逊/微软+模型公司预计合计投入约 6,000 亿美元 | 多家报道(2026-04/05) |
⑤ 供需证据对撞:过剩派 vs 偏紧派
🔻 供给宽松/过剩派证据
| 证据 | 解读 |
|---|---|
| Meta 2026-07 正式出售闲置算力(H100/H200,并开放自研模型租赁) | 上一代算力"建得比用得快"的官方承认;消息日 Meta 大涨、AI 硬件板块普跌 |
| 北美头部企业通用 GPU 平均利用率 <20% | 训练完即闲置、夜间波谷空载,结构性浪费已成行业通病 |
| 推理 API 价格 2026 上半年仍断崖式下降(GPT-4.1 输出 $8/MTok、Sonnet 4.5 输出 $15/MTok 量级) | 价格战持续 = 算力供给相对充沛的直接定价信号 |
| 微软收缩外部算力租赁、谷歌放缓数据中心新建 | 头部开始从"无限扩产"转向"存量盘活" |
| 一级市场:2026 年 AI 算力硬件融资同比下滑 42%,应用融资翻倍 | 资本从硬件叙事转向落地变现 |
🔺 需求强韧/偏紧派证据
| 证据 | 解读 |
|---|---|
| Anthropic 每月向 xAI 支付约 12.5 亿美元算力费(2026-05 曝光) | 头部模型公司仍在以"不封顶"的价格购买算力,需求购买力极强 |
| 最先进算力不分外租:GB200/GB300/Rubin 全部自留用于下一代模型 | Meta 只卖 H100/H200——"紧"发生在最前沿,不是总量 |
| HBM 一度 +90%、Rubin 因 HBM4/供电/液冷递延 | 先进封装、内存与电力仍是硬瓶颈 |
| 多位行业高管(2026-07):AI 需求"几乎无限",能源才是瓶颈 | 供给约束正从芯片转移到电力/数据中心 |
| 2026 年 AI 总投入预计约 6,000 亿美元、capex 7000 亿(云侧) | 扩产未停,只是结构分化 |
⑥ 平衡判断:「总量宽松化 + 前沿算力仍紧俏」的结构性分层
1. 总量层面:从"永久紧缺"叙事走向"局部宽松"。Meta 卖算力、利用率 <20%、推理价格战,三者共同指向一个事实——上一代通用算力的供给已经追上(并局部超过)需求。"算力永久紧缺"的旧叙事失效,市场对 AI 硬件的估值应切换到周期视角(量价齐升 → 结构性分化)。
2. 前沿层面:仍然紧俏,甚至更紧。GB300 及以上、HBM、电力、液冷构成真正的稀缺链——模型公司愿意付"月付 12.5 亿美元"的天价,是因为最先进算力的产出(对齐/推理/下一代模型)仍供不应求。
3. 对投资的三层含义:① 卖"算力总量"逻辑的标的(上一代 GPU 租赁、低端云)将最先承压;② 卖"最前沿稀缺"逻辑(先进制程、HBM、电力、液冷、GLY 等)仍占优;③ 应用/Agent 层迎来"算力成本下降"的顺风——成本 60-70%/年下降正是 Agent 经济性拐点(高盛:2026H1 毛利转正)的燃料。
4. 真正的总量瓶颈是电力,不是芯片。数据中心核心市场(弗吉尼亚/德州等)空置率 <5%、电网接入排队 3-5 年——即便 GPU 满产,电力交付才是扩产的天花板(高管口径:"需求近乎无限,能源才是瓶颈")。因此"过剩"与"紧缺"可以同时存在:芯片局部过剩、电力始终紧缺。
⑦ 与上一篇《3 万亿表外承诺》的联动:需求端的证伪/验证清单
表外资本义务的"或有"属性如何被需求定生死
| 场景 | 需求含义 | 对 3 万亿表外承诺的影响 |
|---|---|---|
| 乐观路径(基准) | Token 高增长兑现(Agent 放量、成本降) | 资本义务大概率转"实"(或有→承诺),但被快速增长的收入覆盖——信用风险可控,估值更看兑现节奏 |
| 中性路径 | 增速放缓但不过剩恶化 | 义务部分转实、部分重谈(Meta 卖算力就是"重估自己承诺"的缩影) |
| 证伪路径 | 利用率持续 <20% 且恶化 + 推理价格加速崩 | "或有"义务的安全垫消失:闲置资产计提、承诺重谈或违约 → 上游减值 + 债务链条承压(正是上一篇"暗雷"引爆条件) |
量化证伪阈值(双顾问外审补充,可执行监测)
| 证伪指标 | 触发阈值 |
|---|---|
| 全球日均推理 Token 量 | 停滞在 50 万亿以下(远逊于 100 万亿+ 预期) |
| 企业生产级 Agent 采用率 | < 10% |
| 主要云厂 AI GPU 平均利用率 | 长期 < 50%(当前通用卡已 <20%,前沿满载) |
| H100 云租赁价格 | 崩至 < $0.5/小时 |
| 云厂 AI 收入增速 − capex 增速 | 持续转负并扩大(需求增速跟不上投入) |
⑧ 监测仪表盘(5 项前瞻指标)
| # | 指标 | 当前读数 | 方向信号 |
|---|---|---|---|
| 1 | 头部模型日 Token 消耗(OpenAI/Anthropic 披露) | 同比数倍增长(方向向上) | ↑ 需求真实 |
| 2 | 推理 API 价格($/MTok,主流模型) | 断崖下降后趋稳/局部回升 | 企稳 = 供需再平衡前兆 |
| 3 | 算力利用率(云/租赁市场二手价) | 通用 GPU <20%;前沿满载 | 分层是常态,看前沿是否松动 |
| 4 | 云厂商 capex 指引(微软/谷歌/亚马逊/Meta 季报) | 7000 亿美元量级、仍在上修 | 指引下修 = 需求证伪信号 |
| 5 | HBM/CoWoS 价格与交期、电力审批 | HBM 高位、电力趋紧 | 前沿瓶颈解除时 = 扩产周期见顶 |
⑨ 局限与免责(诚实边界)
• 数据时点:本文合成 2026-02 至 2026-08 公开信源(OpenAI 披露、高盛/摩根大通研报转载、TrendForce、上市公司季报与行业报道),Timing 敏感,引用请核对原文。
• "Token ×24/×370"等为投行预测,含 Agent 渗透率与密度假设,属方向参考而非精确路径。
• 供需是动态博弈:本轮判断(结构性分层)可能随任何一个季度的高频数据(利用率、价格、capex 指引)快速失效——请以第 8 节仪表盘为准。
• 本文由 AI 辅助生成,仅供个人学习研究,不构成投资建议。数据来源:AI价值投资研究中心。
加载评论中…