下一个还没被市场充分定价、但可能再推一波Token/算力需求的架构级变量

层级概念对 Token 的拉动商业化进度对算力链的受益指向
L1(已爆)Agent 化单请求 ×10-1000×2026 已爆发推理卡总量
L2(正在爆)Test-time Scaling(推理时计算)单请求 ×5-50×o1/o3/R1 已验证推理卡 + 长 KV
L3(起量)原生多模态(视频/音频/3D)单请求 ×100-1000× vs 文本Seedance 2.0 / GPT-4o / Gemini 2.5HBM + 光模块
L4(架构重构)分离式推理(Disaggregated Inference)不改变 Token 量,改写算力结构Google 已量产,国内跟推理卡定义重写
L5(远期)长上下文 + 外部记忆(Memory Layer / Titans / CXL 内存池)单会话 ×10-100×(128K→10M)华为 panGu-π / 澜起 CXL 已布局澜起直接受益
L6(远期)World Model / 具身 VLA训练侧 ×100-1000× vs LLMHy-VLA / π0.5 / RT-3端侧 NPU + 云端 VLA

💡 L2-L3 是2026-2027 能再撑一轮算力叙事的核心;L4-L5 是2027-2029 的远期锚,L5 正好回扣你前几轮持仓里的澜起(CXL)。


一、Test-Time Scaling(推理时计算)—— 比 Agent 更底层的”单请求乘数”

是什么

训练时计算(Training Compute)过去 10 年 scaling law 主驱;2024 起 OpenAI o1/o3、DeepSeek R1、Gemini 2.5 把“推理时计算”(Test-Time Compute)做成第二条曲线——模型生成不是”一遍过”,而是:

  • Self-correction(自我纠错,多轮生成+验证)
  • Chain of Thought 延长(o1 类长 CoT,单请求生成 Token 比回答 Token 多 5-20×
  • Best-of-N 采样 + Verifier(生成 N 个候选,Verifier 打分选最优)
  • Tree search / MCTS(类 AlphaGo,搜索树展开)

对 Token 的拉动

  • 文本 LLM 传统:1 个用户请求 → 输出 200 Token(1×)
  • o1/o3/R1 类:1 个请求 → 内部推理 2000-10000 Token + 输出 500 Token​ → 单请求 ×10-50×
  • DeepSeek R1 公开数据:复杂数学题单请求消耗 8000-15000 Token(含 CoT + 自检),是传统 chat 的 40-75×

对算力链的含义

  • 不是训练卡需求涨,是推理卡需求”单请求变重”——原来 1 张卡跑 100 并发,现在只能跑 20 并发
  • 寒武纪 690 / 昇腾 910C 的推理场景单机 8 卡原来能扛 500 QPS,o1 化后可能只扛 80-100 QPS → 推理卡需求量被动 ×3-5×
  • 这条是2026 已经发生的(字节 Seedance + R1 蒸馏、腾讯元宝 o1 化、阿里 Qwen3-Max 推理优化),但市场还在用”训练侧 CAPEX”的旧框架看算力链,没充分定价”推理侧单请求变重”这一层

📌 回扣你持仓:寒武纪 133x PE 的支撑里,”推理卡总量”是明线,”推理单请求变重”是暗线——后者比 Agent 更稳(Agent 是用户行为,Test-time 是模型架构强制的,只要用 o1 类模型就必须付这个算力账单)。


二、原生多模态(视频/音频/3D)—— 单请求 Token 密度的真正暴击

是什么

不是”CLIP 编码器 + LLM 拼接”的老多模(GPT-4V 那种),是backbone 原生支持视频/音频流输入

  • GPT-4o(2024/5):原生音视频,延迟 <300ms
  • Gemini 2.5 Pro(2025):100 万上下文,视频理解原生
  • 豆包 1.5 / Seedance 2.0(2026):1 分钟 720p 视频 >100 万 Token
  • 腾讯 Hy-VLA(2026 WAIC):K=6 帧多视角 + 动作 chunk H=20

对 Token 的拉动

请求类型单请求 Token 量级
文本 chat(200 字)~300 Token
图像理解(1024×1024)~1200 Token
10 秒视频 @ 720p~15 万 Token
1 分钟视频 @ 720p(Seedance)>100 万 Token
1 分钟视频 @ 1080p + 多视角 + 动作500 万-1000 万 Token

视频单请求比文本高 3000-30000×——这是 Agent 乘数(×470-4700)同量级的另一个乘数,而且视频是”被动消费”场景(刷短视频、看直播、监控分析),比 Agent 的”主动任务”更易起量

对算力链的含义

  • HBM 容量是瓶颈:1 分钟 720p 视频理解要 KV 缓存 + 视觉编码器激活,单请求 HBM 占用是文本的 50-200×​ → 单卡并发从 100→5-10
  • 光模块速率升级加速:视频推理要 1.6T→3.2T 上机柜(中际/新易盛那条线)
  • 训练侧更狠:Seedance 2.0 单次训练等价 DeepSeek-V3 的 1.5 倍(理想智驾 VLA 那篇披露的 13 EFLOPS 集群、单次 1.2-1.5 亿 RMB)——视频训练比 LLM 训练贵一个量级

📌 回扣你持仓:这条跟澜起关系不大(视频训练/推理的 HBM 接口还是三星/SK/美光那套,澜起吃的是 DDR5 + CXL 的”通用 AI 服务器内存池”,不是 HBM 直接),但跟寒武纪/海光 DCU/昇腾的”视频推理卡”定位直接相关——寒武纪 690 的双 Die + HBM3 就是冲这个场景去的。


三、分离式推理(Disaggregated Inference)—— 不改 Token 量,但改写算力结构

是什么

传统推理:prefill(处理输入) + decode(逐 Token 输出)在同一张卡上跑。

分离式:prefill 和 decode 拆到不同芯片/不同集群

  • Prefill 要算力密集(一次性处理长输入,Compute-bound)→ 用高算力卡(GB200 / 昇腾 910C / 寒武纪 690)
  • Decode 要显存带宽密集(每 Token 读 KV 缓存,Memory-bound)→ 用”小算力+大显存带宽”卡(L20 / 寒武纪 590 改款 / 专用推理 ASIC)

Google 在 TPU v5 + Pathways 已经量产这套;国内字节、腾讯、阿里都在跟,2026 是分离式推理的”工业化元年”。

对算力链的含义

  • 推理卡的定义重写:原来”一张卡搞定 prefill+decode”,现在要两张不同类型的卡配对​ → 推理卡总出货量 ×1.5-2×
  • 寒武纪 590(旧款)不会被 690 完全替代,反而可能作为”decode 专用卡”继续走量(590 显存带宽够、算力过剩但便宜)
  • 海光 DCU 的”通用”定位在分离式里反而吃亏——分离式要”专用”,海光 DCU 是 GPGPU 通用架构,不如寒武纪/昇腾的”训推分离定制”顺

📌 这条是2026 H2-2027 的暗线,当前市场对”寒武纪 590 库存会不会减值”的担忧,可能被分离式推理的”decode 专卡”需求反包——590 不一定是过时,可能是 decode 侧性价比款。


四、长上下文 + 外部记忆(Memory Layer / Titans / CXL 内存池)

是什么

  • 长上下文:128K → 1M → 10M Token 会话(Gemini 2.5 已 100 万,GPT-5 传闻 10M)
  • 外部记忆:Transformer 原生 KV 缓存是 O(N) 的,Titans(2025 ICML 那篇)、MemGPT、华为 panGu-π 走”外部可写记忆 + 小上下文窗口”混合
  • CXL 内存池化:澜起的 MRCD/MDB + CXL 2.0/3.0,把 AI 服务器的 DDR5 内存池从”单机 8-12 TB”扩展到”单池 24-48 TB”,KV 缓存溢出到 CXL 内存层

对 Token 的拉动

  • 单会话从 128K → 10M Token → 单用户会话级 Token 消耗 ×80×
  • 但更关键的是“会话持久化”:原来每个请求独立,现在一个”项目会话”能跑 3 天,累计 Token 百万级/用户/周

对算力链的含义

  • 澜起这条线最直接:CXL 内存池化是澜起的 MRCD/MDB + PCIe Retimer 5.0 的核心场景,AI 服务器单机接口芯片用量是通用的 5-8×,长上下文会让“CXL 内存池”从”可选”变”必选”——这条是你前几轮聊澜起时没展开够的远期锚
  • HBM 不够用,CXL 来补:单卡 HBM 24-141GB(H200→B200→GB200),但 10M 上下文的 KV 缓存要 TB 级 → 只能走 CXL 池 + 分层存储(HBM → DDR5 CXL → NAND)

📌 回扣你持仓:这条是澜起 2027-2029 的第二个增长曲线(第一个是 DDR5 子代 + MRCD,第二个是 CXL 内存池 + PCIe 6.0 Retimer)。当前澜起股价 190 档(7/17)已经把”韩/美调查”砸进去了,但CXL 这条线市场还没怎么定价——因为 CXL 真正放量要等 2027(PCIe 6.0 服务器上量 + Intel Granite Rapids / AMD Turin 全系 CXL 2.0)。


五、World Model / 具身 VLA —— 训练侧的另一条乘数

是什么

  • World Model:模型内部建”物理世界动力学”,能预测”如果我这么做,世界会怎样”——自动驾驶(Tesla FSD V13+)、机器人(π0.5、Hy-VLA)都在走
  • 具身 VLA(Vision-Language-Action):视觉+语言→动作,你上一轮问的腾讯 Hy-VLA 就是这条

对 Token 的拉动(训练侧)

  • LLM 训练:文本 1 token ≈ 1 个词片段
  • VLA 训练:单样本 = K 帧视频(每帧千 Token)+ 动作轨迹(每步 6D 位姿 + 夹爪)​ → 单样本 Token 密度是文本的 100-1000×
  • 数据量少:LLM 是万亿 Token 训练;VLA 是万小时轨迹 ≈ 百万 episode 级 → 总 FLOPs 比 LLM 小 1-2 量级,但单样本贵 100-1000×

对算力链的含义

  • 训练侧拉动有限(你上一轮已经聊过:Hy-VLA SFT 只用 32 GPU)
  • 推理侧是新增量:VLA 部署要 30Hz 闭环 → 端侧 NPU(地平线/黑芝麻/高通)+ 云端 VLA 大脑异步 → 机器人本体数量 >> 云服务器数量,长期是端侧 NPU 的故事

📌 这条不拉动寒武纪/海光/澜起,拉动的是端侧 NPU + 边缘算力 + 丝杠/减速器(机器人本体)——跟你前几轮”科技轮动到机器人”那条对得上。


汇总:这些架构变量对中国 Token 总量的边际贡献(2030 口径)

在上一轮”3000-5000 万亿/日”的天花板基础上,加这些乘数:

变量触发条件对 2030 总量的边际
Test-time Scaling 普及o1 类模型占推理请求 50%+200-500 万亿
视频原生多模普及视频理解占请求 30%+500-1500 万亿
长上下文 10M + CXL 池企业/代码场景 40% 会话 >1M+200-400 万亿
分离式推理工业化不改 Token 量,改卡结构推理卡出货量 ×1.5-2×
World Model / VLA机器人 100 万台出货训练侧 +50 万亿,推理端侧另计

叠加后 2030 年中国日均账面 Token 可能摸到 5000 万亿-8000 万亿,有效算力 Token(扣含水)2500-4000 万亿——比上一轮我只给的 3000-5000 万亿中值再抬一档,主要加了 test-time + 视频这两条 2026 已验证的乘数。


⚠️ 一个反向提醒

这些架构变量里,Test-time Scaling 和视频原生多模是 2026 已经在发生的(o1/R1/Seedance 2.0 都已量产),市场已经开始定价但还没 fully price;分离式和 CXL 内存池是 2027-2028 的World Model 是 2028-2030 的

所以”科技牛见顶”那轮你问的信号里,可以加一条架构层观察

  • 如果 2026 H2 字节/腾讯/阿里的推理侧 CAPEX 指引里,“test-time 推理卡”和”视频推理卡”占比跳升(从训练 60% : 推理 40% → 训练 40% : 推理 60%),就是架构换挡确认
  • 如果 2027 的指引里CXL 内存池开始进采购清单(澜起 MRCD/MDB 的订单可见度),就是澜起第二条曲线确认

提示:本文借助AI的数据收集与分析。

Comments

No comments yet. Why don’t you start the discussion?

发表回复