2026 年 7 月 31 日,DeepSeek 悄悄把 V4-Flash 正式版 API 推上了公测。没有发布会,没有长篇 PR,只有官网文档里几行冷冰冰的数字。但就是这几行数字,让开发者社区在一夜之间炸开了锅——一个模型骨架完全没改、只是重做了一遍后训练的版本,在 Agent 基准上把三个月前的 Pro 预览版按在地上摩擦,而价格却低到令人失语:缓存命中输入 0.02 元/百万 token,输出 2 元/百万 token。
这篇文章想说清楚的,不是”DeepSeek 又便宜了”这种废话,而是这次更新到底改变了什么游戏规则,以及它为什么可能比很多人意识到的更重要。
一、先把硬数字摆桌上
DeepSeek 官方 API 文档给出的 V4-Flash 规格:
- 架构:MoE,总参数 2840 亿,激活参数 130 亿
- 上下文:1M token
- 最大输出:384K token
- 模式:支持思考/非思考双模式
- 功能:Json Output、Tool Calls、FIM 补全、对话前缀续写
- 价格(每百万 token):
- 输入(缓存命中):0.02 元
- 输入(缓存未命中):1 元
- 输出:2 元
- 兼容:OpenAI 格式 BASE URL + Anthropic 格式 BASE URL 双通道
- 原生适配:Responses API、OpenAI Codex
美元口径下,输入(缓存未命中)0.14 美元、输出 0.28 美元。
和 Claude 的对比(以 DeepSeek 官方对比页数据为准):
| 模型 | 输入(缓存未命中) | 输出 |
|---|---|---|
| DeepSeek V4-Flash | $0.14 | $0.28 |
| Claude Sonnet 5 | $2.00 | $10.00 |
| Claude Opus 5 | $5.00 | $25.00 |
按输出价算,V4-Flash 约为 Claude Opus 5 的 1/89,也就是大家常说的”1/90″。需要补一句的是,Claude Sonnet 5 的 2/10 是 8 月 31 日前的促销价,9 月 1 日起将涨到 3/15——换句话说,DeepSeek 的价格优势在未来只会进一步扩大。
但”1/90″这个数字有它的适用边界:它严格成立在”输出价 vs Opus 5″这个对比上。缓存命中输入的场景下,V4-Flash 的价格优势夸张到 1/1800。所以准确的说法是——在日常 Agent 高频调用、长上下文复用率高的场景下,V4-Flash 的成本优势远超”1/90″这个平均值。
二、真正炸裂的不是价格,是”模型没改,能力翻了 6 倍”
如果只是一味降价,那不过是价格战的老套路。V4-Flash 这次最值得玩味的,是 DeepSeek 官方明确说的这句话:
V4-Flash-0731 与预览版维持相同模型架构、相同模型尺寸与参数规模,唯一变化就是重新进行了后训练流程。
模型骨架一点没动,只是重做了一遍后训练(post-training),结果在 9 项 Agent 基准上全面碾压三个月前的 V4-Pro 预览版。官方给出的一组核心数字:
| 基准测试 | 评测内容 | V4-Flash 预览版 | V4-Flash 正式版 | V4-Pro 预览版 | 参考:Opus 4.8 |
|---|---|---|---|---|---|
| DeepSWE | 长周期多步骤编程 | 7.3 | 54.4 | — | — |
| Terminal Bench 2.1 | Linux 终端自主规划 | 61.8 | 82.7 | 72.1 | 85.0 |
| Cybergym | 安全攻防 | 38.7 | 76.7 | — | — |
| Toolathlon | 工具调用 | — | 70.3 | 76.2 | — |
| NL2Repo | 自然语言转代码仓库 | — | 54.2 | — | — |
注:数据来源 DeepSeek 官方公布及第三方整理
最刺眼的是 DeepSWE:7.3 → 54.4,七倍多的跃升。这意味着模型在”真实、长周期、多步骤编程任务”中的自主解决能力,从”基本不能干活”变成了”能干不少活”。
Terminal Bench 2.1 的 82.7 分更值得玩味:它不仅翻过了自家 Pro 预览版的 72.1,也越过了 GLM-5.2 的 81.0,距离 Claude Opus 4.8 的 85.0 只差 2.3 分。
在海外评测机构 Artificial Analysis 的智能指数测试中,V4-Flash-0731(最高推理档位)拿下 50 分,而同级可比模型的中位数仅 17 分。
三、但有几个折扣必须打
作为一篇负责任的博客文章,我不能只转述官方通稿。DeepSeek 这次公布的基准有几处需要冷静看待:
折扣一:这是自家 harness 跑的
DeepSeek 这次同步首发了自研的 Agent 测试框架 DeepSeek Harness,所有成绩都是在 DeepSeek 指定的 harness 和参数下完成的。Agent 类基准对脚手架极度敏感——同一个模型换个 harness,Terminal Bench 掉十几分是常事。所以”82.7 逼近 Opus 4.8 的 85.0″这个差距,在独立第三方复现时可能会缩小。
折扣二:对比组不对等
表里用来对比的 V4-Pro 是 4 月的预览版,不是即将发布的正式版。用自己 7 月的正式版打自己 3 个月前的预览版,赢是应该的。真正的对照要等 V4-Pro 正式版出来才能下结论。
折扣三:短板也很真实
根据早期开发者的实测反馈:
- 一次性生成含大量字符串的脚本会翻车
- 指令遵循不稳定
- 长上下文记忆检索偏弱
- Agent 模式下推理语言被锁定为英文
- 世界知识维度距离前沿闭源模型还差 3-6 个月
所以更准确的描述是:V4-Flash 在代码和 Agent 执行这条赛道上性价比做到了第一,但”全面超越 Claude”是过度解读。
四、这次更新的产业意义:后训练 > 堆参数
抛开跑分争议,V4-Flash 正式版真正值得记入 2026 年 AI 史的一件事是:
它证明了”后训练”的杠杆效应,可能比”扩大参数”大得多。
同样是 2840 亿总参数、130 亿激活的骨架,仅仅通过后训练重做,就在 Agent 能力上实现了 6-7 倍的跃升。这对整个行业的启示是颠覆性的:
- 大模型竞争的主战场,正从”预训练 scaling”转向”后训练效率”。堆参数的边际收益在递减,而 post-training 的优化空间可能还很大。
- 这意味着”模型迭代”的速度会显著加快。改一次后训练的成本和时间,远低于重新预训练一个模型。未来我们可能会看到同一个模型骨架,在一年内通过多次后训练迭代持续进化。
- 对算力的需求结构也在变:训练算力的边际增速可能放缓,但推理算力因为调用量暴增而需求陡升——这与我们前面聊的”RSI(递归自我改进)驱动 2028 Capex”的叙事完全吻合。
五、对 A 股的实际影响:推理算力是确定性最高的受益方向
回到我们前面几轮在聊的 A 股主线。V4-Flash 正式 API 上线,叠加 7 月 30 日 GPT 降价 80%,两件事在周末叠加,形成”全球大模型成本商品化”的双重确认。但具体利好怎么传导演,需要精细化:
第一层:国产推理算力硬件(确定性最高)
V4-Flash 的 1M 上下文 + 极低价格 + 原生 Codex 适配 → 开发者调用量将暴增 → 推理算力需求指数级扩张。
直接受益:
- 海光信息(DCU 推理,950162 第二大权重 9.98%)
- 寒武纪(思元 590 系列完成 V4 全适配)
- 浪潮信息、中科曙光(推理服务器)
- 澜起科技(DDR5 接口芯片是推理服务器标配,950162 第一大权重 10.47%)
第二层:云 / IDC / AI Infra
东方财富研报明确推荐 AI Infra 机会,受益标的包括优刻得、首都在线、润泽科技、青云科技等。但这一层弹性大、确定性低于硬件龙头,且部分标的此前已有一波炒作,周一若高开 5% 以上追高风险大。
第三层:企业级 Agent 应用
拥有成熟行业 know-how 的公司最能受益:
- 汉得信息:H-ONE 企业 AI 中台全面集成 V4 全系列,AI-CAMP 原生集成 OpenClaw 架构
- 金山办公:WPS AI 月活 2951 万
- 恒生电子、同花顺:金融 Agent 落地
需要冷静看待的
市场可能会炒作”所有软件公司都受益于 API 降价”。但国内软件公司绝大多数本来就用国产模型(文心、通义、讯飞、DeepSeek),不是 GPT。V4-Flash 降价的直接受益者是”调用 DeepSeek API 的开发者”,而不是”所有软件公司”。真正能吃到大模型降本红利的,是那些 token 消耗大、场景清晰、能形成收费闭环的应用公司。
一个必须警惕的点:DeepSeek 官方已经打了预防针——V4 正式版会引入峰谷定价,北京时间每天 9:00-12:00、14:00-18:00 高峰时段价格翻倍。这意味着”1/90″的价格是平峰时段的价格,实际企业级调用的综合成本会高于这个理论值。
六、作为开发者,我为什么兴奋
抛开投资视角,从一个写代码的人角度,V4-Flash 正式版最让我兴奋的不是跑分,而是这几个组合特性:
1. 可以放心塞进流水线了
1M 上下文 + 0.02 元/百万 token 的缓存命中价 + 原生 Codex 适配 = “便宜到你愿意把它嵌入每天的 CI/CD 流水线”。有开发者实测:4 小时重度 Agent 任务烧掉 1 亿 token,缓存命中率 99%,花费不到 0.1 美元。
2. 思考/非思考双模式
简单任务用非思考模式(快、便宜),复杂任务切思考模式(慢、准)。这种灵活性是以往”一个模型走天下”做不到的。
3. 双 BASE URL 兼容
OpenAI 格式和 Anthropic 格式的双通道支持,意味着原本调用 GPT 或 Claude 的代码,改个 BASE URL 就能切到 DeepSeek,迁移成本几乎为零。这也是为什么开发者社区喊”退订 Claude”——不是因为 DeepSeek 全面超越 Claude,而是在代码/Agent 这个高频场景上,V4-Flash 的性价比让 Claude 的溢价失去了合理性。
4. 但短板也要认清
它是个话痨——Artificial Analysis 测它完成智能指数评测时烧掉了 2.1 亿输出 token,是可比模型中位数的 3 倍多。指令遵循偶尔翻车,长上下文检索一般,Agent 模式下推理语言锁死英文。所以它最适合”边界清晰、任务明确”的工程任务,不适合”开放式、需要微妙指令遵循”的创作类任务。
七、结语:桌子被掀了,但掀桌子的人不是唯一的赢家
DeepSeek V4-Flash 正式 API 的上线,本质上是把 Agent 工作流的边际成本打到了”可以忽略不计”的水平。这件事的意义,远比”国产大模型又进步了”要深远:
- 对开发者:Agent 应用的实验成本趋近于零,创新速度会指数级提升
- 对企业:可以把 LLM 嵌入每一个业务流程,而不用担心账单爆炸
- 对算力提供商:推理芯片、推理服务器、IDC 的需求会因为调用量暴增而水涨船高
- 对模型厂商:后训练的杠杆效应被验证,行业竞争焦点转移
- 对投资市场:国产推理算力链是这次事件确定性最高的受益方向
但作为博客作者,我必须泼一盆冷水:V4-Flash 的跑分是 DeepSeek 自家 harness 跑的,V4-Pro 正式版还没出,世界知识维度还差闭源模型 3-6 个月。它不是”Claude 杀手”,而是”Agent/代码赛道的性价比之王”。
真正的变化是结构性的:当 Agent 能力的单位成本下降到这个水平,”AI 应用能否爆发”就不再是”模型够不够好”的问题,而是”你的产品场景够不够清晰、用户愿不愿意为结果付费”的问题。模型侧的瓶颈正在消失,应用侧的瓶颈才刚刚暴露。