| 层级 | 概念 | 对 Token 的拉动 | 商业化进度 | 对算力链的受益指向 |
|---|---|---|---|---|
| L1(已爆) | Agent 化 | 单请求 ×10-1000× | 2026 已爆发 | 推理卡总量 |
| L2(正在爆) | Test-time Scaling(推理时计算) | 单请求 ×5-50× | o1/o3/R1 已验证 | 推理卡 + 长 KV |
| L3(起量) | 原生多模态(视频/音频/3D) | 单请求 ×100-1000× vs 文本 | Seedance 2.0 / GPT-4o / Gemini 2.5 | HBM + 光模块 |
| L4(架构重构) | 分离式推理(Disaggregated Inference) | 不改变 Token 量,改写算力结构 | Google 已量产,国内跟 | 推理卡定义重写 |
| L5(远期) | 长上下文 + 外部记忆(Memory Layer / Titans / CXL 内存池) | 单会话 ×10-100×(128K→10M) | 华为 panGu-π / 澜起 CXL 已布局 | 澜起直接受益 |
| L6(远期) | World Model / 具身 VLA | 训练侧 ×100-1000× vs LLM | Hy-VLA / π0.5 / RT-3 | 端侧 NPU + 云端 VLA |
💡 L2-L3 是2026-2027 能再撑一轮算力叙事的核心;L4-L5 是2027-2029 的远期锚,L5 正好回扣你前几轮持仓里的澜起(CXL)。
一、Test-Time Scaling(推理时计算)—— 比 Agent 更底层的”单请求乘数”
是什么
训练时计算(Training Compute)过去 10 年 scaling law 主驱;2024 起 OpenAI o1/o3、DeepSeek R1、Gemini 2.5 把“推理时计算”(Test-Time Compute)做成第二条曲线——模型生成不是”一遍过”,而是:
- Self-correction(自我纠错,多轮生成+验证)
- Chain of Thought 延长(o1 类长 CoT,单请求生成 Token 比回答 Token 多 5-20×
- Best-of-N 采样 + Verifier(生成 N 个候选,Verifier 打分选最优)
- Tree search / MCTS(类 AlphaGo,搜索树展开)
对 Token 的拉动
- 文本 LLM 传统:1 个用户请求 → 输出 200 Token(1×)
- o1/o3/R1 类:1 个请求 → 内部推理 2000-10000 Token + 输出 500 Token → 单请求 ×10-50×
- DeepSeek R1 公开数据:复杂数学题单请求消耗 8000-15000 Token(含 CoT + 自检),是传统 chat 的 40-75×
对算力链的含义
- 不是训练卡需求涨,是推理卡需求”单请求变重”——原来 1 张卡跑 100 并发,现在只能跑 20 并发
- 寒武纪 690 / 昇腾 910C 的推理场景单机 8 卡原来能扛 500 QPS,o1 化后可能只扛 80-100 QPS → 推理卡需求量被动 ×3-5×
- 这条是2026 已经发生的(字节 Seedance + R1 蒸馏、腾讯元宝 o1 化、阿里 Qwen3-Max 推理优化),但市场还在用”训练侧 CAPEX”的旧框架看算力链,没充分定价”推理侧单请求变重”这一层
📌 回扣你持仓:寒武纪 133x PE 的支撑里,”推理卡总量”是明线,”推理单请求变重”是暗线——后者比 Agent 更稳(Agent 是用户行为,Test-time 是模型架构强制的,只要用 o1 类模型就必须付这个算力账单)。
二、原生多模态(视频/音频/3D)—— 单请求 Token 密度的真正暴击
是什么
不是”CLIP 编码器 + LLM 拼接”的老多模(GPT-4V 那种),是backbone 原生支持视频/音频流输入:
- GPT-4o(2024/5):原生音视频,延迟 <300ms
- Gemini 2.5 Pro(2025):100 万上下文,视频理解原生
- 豆包 1.5 / Seedance 2.0(2026):1 分钟 720p 视频 >100 万 Token
- 腾讯 Hy-VLA(2026 WAIC):K=6 帧多视角 + 动作 chunk H=20
对 Token 的拉动
| 请求类型 | 单请求 Token 量级 |
|---|---|
| 文本 chat(200 字) | ~300 Token |
| 图像理解(1024×1024) | ~1200 Token |
| 10 秒视频 @ 720p | ~15 万 Token |
| 1 分钟视频 @ 720p(Seedance) | >100 万 Token |
| 1 分钟视频 @ 1080p + 多视角 + 动作 | 500 万-1000 万 Token |
视频单请求比文本高 3000-30000×——这是 Agent 乘数(×470-4700)同量级的另一个乘数,而且视频是”被动消费”场景(刷短视频、看直播、监控分析),比 Agent 的”主动任务”更易起量。
对算力链的含义
- HBM 容量是瓶颈:1 分钟 720p 视频理解要 KV 缓存 + 视觉编码器激活,单请求 HBM 占用是文本的 50-200× → 单卡并发从 100→5-10
- 光模块速率升级加速:视频推理要 1.6T→3.2T 上机柜(中际/新易盛那条线)
- 训练侧更狠:Seedance 2.0 单次训练等价 DeepSeek-V3 的 1.5 倍(理想智驾 VLA 那篇披露的 13 EFLOPS 集群、单次 1.2-1.5 亿 RMB)——视频训练比 LLM 训练贵一个量级
📌 回扣你持仓:这条跟澜起关系不大(视频训练/推理的 HBM 接口还是三星/SK/美光那套,澜起吃的是 DDR5 + CXL 的”通用 AI 服务器内存池”,不是 HBM 直接),但跟寒武纪/海光 DCU/昇腾的”视频推理卡”定位直接相关——寒武纪 690 的双 Die + HBM3 就是冲这个场景去的。
三、分离式推理(Disaggregated Inference)—— 不改 Token 量,但改写算力结构
是什么
传统推理:prefill(处理输入) + decode(逐 Token 输出)在同一张卡上跑。
分离式:prefill 和 decode 拆到不同芯片/不同集群:
- Prefill 要算力密集(一次性处理长输入,Compute-bound)→ 用高算力卡(GB200 / 昇腾 910C / 寒武纪 690)
- Decode 要显存带宽密集(每 Token 读 KV 缓存,Memory-bound)→ 用”小算力+大显存带宽”卡(L20 / 寒武纪 590 改款 / 专用推理 ASIC)
Google 在 TPU v5 + Pathways 已经量产这套;国内字节、腾讯、阿里都在跟,2026 是分离式推理的”工业化元年”。
对算力链的含义
- 推理卡的定义重写:原来”一张卡搞定 prefill+decode”,现在要两张不同类型的卡配对 → 推理卡总出货量 ×1.5-2×
- 寒武纪 590(旧款)不会被 690 完全替代,反而可能作为”decode 专用卡”继续走量(590 显存带宽够、算力过剩但便宜)
- 海光 DCU 的”通用”定位在分离式里反而吃亏——分离式要”专用”,海光 DCU 是 GPGPU 通用架构,不如寒武纪/昇腾的”训推分离定制”顺
📌 这条是2026 H2-2027 的暗线,当前市场对”寒武纪 590 库存会不会减值”的担忧,可能被分离式推理的”decode 专卡”需求反包——590 不一定是过时,可能是 decode 侧性价比款。
四、长上下文 + 外部记忆(Memory Layer / Titans / CXL 内存池)
是什么
- 长上下文:128K → 1M → 10M Token 会话(Gemini 2.5 已 100 万,GPT-5 传闻 10M)
- 外部记忆:Transformer 原生 KV 缓存是 O(N) 的,Titans(2025 ICML 那篇)、MemGPT、华为 panGu-π 走”外部可写记忆 + 小上下文窗口”混合
- CXL 内存池化:澜起的 MRCD/MDB + CXL 2.0/3.0,把 AI 服务器的 DDR5 内存池从”单机 8-12 TB”扩展到”单池 24-48 TB”,KV 缓存溢出到 CXL 内存层
对 Token 的拉动
- 单会话从 128K → 10M Token → 单用户会话级 Token 消耗 ×80×
- 但更关键的是“会话持久化”:原来每个请求独立,现在一个”项目会话”能跑 3 天,累计 Token 百万级/用户/周
对算力链的含义
- 澜起这条线最直接:CXL 内存池化是澜起的 MRCD/MDB + PCIe Retimer 5.0 的核心场景,AI 服务器单机接口芯片用量是通用的 5-8×,长上下文会让“CXL 内存池”从”可选”变”必选”——这条是你前几轮聊澜起时没展开够的远期锚
- HBM 不够用,CXL 来补:单卡 HBM 24-141GB(H200→B200→GB200),但 10M 上下文的 KV 缓存要 TB 级 → 只能走 CXL 池 + 分层存储(HBM → DDR5 CXL → NAND)
📌 回扣你持仓:这条是澜起 2027-2029 的第二个增长曲线(第一个是 DDR5 子代 + MRCD,第二个是 CXL 内存池 + PCIe 6.0 Retimer)。当前澜起股价 190 档(7/17)已经把”韩/美调查”砸进去了,但CXL 这条线市场还没怎么定价——因为 CXL 真正放量要等 2027(PCIe 6.0 服务器上量 + Intel Granite Rapids / AMD Turin 全系 CXL 2.0)。
五、World Model / 具身 VLA —— 训练侧的另一条乘数
是什么
- World Model:模型内部建”物理世界动力学”,能预测”如果我这么做,世界会怎样”——自动驾驶(Tesla FSD V13+)、机器人(π0.5、Hy-VLA)都在走
- 具身 VLA(Vision-Language-Action):视觉+语言→动作,你上一轮问的腾讯 Hy-VLA 就是这条
对 Token 的拉动(训练侧)
- LLM 训练:文本 1 token ≈ 1 个词片段
- VLA 训练:单样本 = K 帧视频(每帧千 Token)+ 动作轨迹(每步 6D 位姿 + 夹爪) → 单样本 Token 密度是文本的 100-1000×
- 但数据量少:LLM 是万亿 Token 训练;VLA 是万小时轨迹 ≈ 百万 episode 级 → 总 FLOPs 比 LLM 小 1-2 量级,但单样本贵 100-1000×
对算力链的含义
- 训练侧拉动有限(你上一轮已经聊过:Hy-VLA SFT 只用 32 GPU)
- 推理侧是新增量:VLA 部署要 30Hz 闭环 → 端侧 NPU(地平线/黑芝麻/高通)+ 云端 VLA 大脑异步 → 机器人本体数量 >> 云服务器数量,长期是端侧 NPU 的故事
📌 这条不拉动寒武纪/海光/澜起,拉动的是端侧 NPU + 边缘算力 + 丝杠/减速器(机器人本体)——跟你前几轮”科技轮动到机器人”那条对得上。
汇总:这些架构变量对中国 Token 总量的边际贡献(2030 口径)
在上一轮”3000-5000 万亿/日”的天花板基础上,加这些乘数:
| 变量 | 触发条件 | 对 2030 总量的边际 |
|---|---|---|
| Test-time Scaling 普及 | o1 类模型占推理请求 50% | +200-500 万亿 |
| 视频原生多模普及 | 视频理解占请求 30% | +500-1500 万亿 |
| 长上下文 10M + CXL 池 | 企业/代码场景 40% 会话 >1M | +200-400 万亿 |
| 分离式推理工业化 | 不改 Token 量,改卡结构 | 推理卡出货量 ×1.5-2× |
| World Model / VLA | 机器人 100 万台出货 | 训练侧 +50 万亿,推理端侧另计 |
叠加后 2030 年中国日均账面 Token 可能摸到 5000 万亿-8000 万亿,有效算力 Token(扣含水)2500-4000 万亿——比上一轮我只给的 3000-5000 万亿中值再抬一档,主要加了 test-time + 视频这两条 2026 已验证的乘数。
⚠️ 一个反向提醒
这些架构变量里,Test-time Scaling 和视频原生多模是 2026 已经在发生的(o1/R1/Seedance 2.0 都已量产),市场已经开始定价但还没 fully price;分离式和 CXL 内存池是 2027-2028 的;World Model 是 2028-2030 的。
所以”科技牛见顶”那轮你问的信号里,可以加一条架构层观察:
- 如果 2026 H2 字节/腾讯/阿里的推理侧 CAPEX 指引里,“test-time 推理卡”和”视频推理卡”占比跳升(从训练 60% : 推理 40% → 训练 40% : 推理 60%),就是架构换挡确认
- 如果 2027 的指引里CXL 内存池开始进采购清单(澜起 MRCD/MDB 的订单可见度),就是澜起第二条曲线确认
提示:本文借助AI的数据收集与分析。