后训练时代的存储增量

从 DeepSeek V4 论文出发,量化分析当前大模型训练范式转变对三层存储介质的结构性影响
2026-04-25
研究核心结论

DeepSeek V4 论文首次完整公开一种新的训练范式(专家训练 + 在线策略蒸馏 + 沙盒环境),其工程实现里隐藏着三类全新的固态硬盘工作负载。同样的范式在 OpenAI、Anthropic、Google 的硬件路线上独立验证。当前卖方分析师对训练侧的固态硬盘净增量定价不足,对应的盈利修正空间还在右尾。

一 · 三类被忽略的训练侧工作负载

V4 论文的工程章节里隐藏着三类全新的固态硬盘工作负载。当前卖方分析师的需求模型几乎不反映这部分。

01
逐字日志
强化学习推演时模型每生成一个词就立即写盘。极频繁、小块写入,对位高耐久度企业级固态硬盘。
02
多专家权重换班
十几个万亿级专家轮流上岗,权重在中央存储与显卡间反复搬运。高带宽顺序读,单次训练涉及十几太字节流量。
03
智能代理沙盒
单集群 10 万隔离虚拟电脑跑工具调用、写文件。分布式文件系统 + 商品级大容量闪存

二 · 这不是 DeepSeek 一家的现象

同样的范式在三家闭源前沿实验室独立验证。三巨头联合反对所谓"对抗性蒸馏"这件事本身证明,多专家蒸馏已是当前最有效的训练范式之一。

实验室独立证据
DeepSeek V4 论文完整公开三类工作负载的工程实现
OpenAI 5.5 命令行工具 Codex 更新日志直接出现"推演记录已包含工具、代码模式、会话、多代理关系"以及"远程沙盒配置要求"
Anthropic 4.7 Opus 4.5 系统说明书提到"多代理配置一致优于单代理基线";Mythos 系统说明书显示 Firefox 漏洞利用率从 15% 跃升到 84%——只能来自大规模沙盒环境的强化学习训练
Google 3.1 TPU 8t 官方介绍直接写"快速处理连续强化学习试验";TPU 8i 三倍片上静态内存为快速注意力缓存更新设计

三 · 训练计算量级

开源前沿落后闭源前沿一个数量级,但训练侧固态硬盘增量随训练量线性放大——单次闭源旗舰训练对应的存储增量可能是 V4 的 10 倍。

模型等价 GB200 卡时10 万卡上耗时训练侧存储净增量
V4-Flash130 万~0.7 天~5 PB
V4-Pro450 万~2 天~20 PB
GPT-5.55,000 万~21 天~200 PB
Opus 4.7(估)5,000 万 - 1 亿~21-42 天~200-400 PB

折算锚点:V3 实测 278.8 万 H800 卡时;H800 → GB200 速度比 3 倍;GPT-5.5 由 Stargate 公开的"10 万张混合显卡训练 19 天"反推;Opus 4.7 不披露任何数据,按硬件投入与能力跃升估算。

四 · 三方需求曲线分歧

本研究修正后的全球闪存累积需求,2030 年比卖方共识高约 50%、比早期框架高约 30%。差距来自三个不同节奏的驱动力——推理、训练、持续学习。

图 1 · 全球闪存累积需求三方预期
2025 年实际值设为 100 · 数值为同口径下的累积出货指数
300 250 200 150 100 2025 2026 2027 2028 2029 2030 300 233 202
本次研究:含训练侧 + 持续学习
早期框架:仅推理侧
卖方共识:以推理服务器为主
图 2 · 固态硬盘年新增需求按来源分解
单位:EB / 年 · 三条独立折线 · 仅含人工智能相关增量
40 30 20 10 0 2025 2026 2027 2028 2029 2030 35 18 16
推理侧
训练侧
持续学习
三个驱动力的接力顺序:推理(已起步)→ 训练(V4 揭示)→ 持续学习(2028 起飞)。

五 · 持续学习——下一波浪潮

2028 年起,部分训练负载从集中训练集群下沉到推理节点。每个节点的系统内存翻倍、固态硬盘容量翻一个数量级。

2024-2025 · 探索期
Google Titans / MIRAS 提出测试时记忆机制;Anthropic 在 Opus 4.x 系统说明书里有上下文学习的实验性扩展。
2026 当前 · 基础设施铺垫
DeepSeek V4 论文把在线学习写入未来方向;Google TPU 8i 三倍片上静态内存;Anthropic Mythos 系统说明书显示模型在 29% 对话中识别"在被测试"。
2027 · 试点
少量推理节点开始部署在线学习;测试时记忆进入消费级产品。
2028-2030 · 普及
推理节点配置变化:高带宽内存不变(核心权重)+ 系统内存翻倍(长期记忆 + 优化器状态)+ 固态硬盘翻 16 倍(经验回放)。先行指标:英伟达 BlueField-5/6 板载固态硬盘是否从 512GB 翻到 2TB+。

六 · 三种存储介质谁更利好

短期价格弹性看供给紧张度(高带宽内存 > 系统内存 > 闪存),长期收益空间看未被定价的需求向量数量(闪存 > 系统内存 > 高带宽内存)。这两个维度方向相反。

介质需求增量来源主要风险综合定位
高带宽内存 模型参数继续增长、训练规模、长上下文 V4 把单词元注意力缓存压缩 90% 是反向力量;低功耗内存替代部分场景 受益最确定
已充分定价
系统内存 主存切换到低功耗内存、内存池标准化、长期记忆模块 2028 年新产能集中释放 受益较强
部分定价
闪存 注意力缓存持久化、训练侧三类工作负载、经验回放 供给弹性最强是双刃剑、2027 下半年扩产释放压力 受益最强
定价最不充分

七 · 跟踪指标

判断兑现的先行指标按观察频率分三档。第一档(每月)变化最敏感,是核心信号源。

每月观察
A
卖方共识盈利预期
闪存龙头下一财年每股盈利往 120-150 美元走表明激进情景兑现。
B
现货价 vs 合约价
现货高于合约是异常信号,差距持续扩大表明上行加速;收敛或反转则是顶部信号。
C
三大厂商资本开支
三星 / 海力士 / 美光任一家上调 30%+ 意味着 2027 下半年供过于求风险升高。
D
超大云厂商资本开支
Meta、微软、谷歌、亚马逊季报。增长节奏变化是最敏感指标。
每季度观察
E
硬件路线落地
英伟达 BlueField-5/6 板载固态硬盘容量、TPU 9 系列、高带宽闪存商业化时间表。
F
其他实验室训练栈
Llama 5、Qwen 4、Mistral、Gemini 4 是否采用多专家蒸馏或沙盒训练。
G
算法压缩进度
下一代模型注意力缓存压缩比,每代砍 50%+ 则侵蚀高带宽内存增长曲线。
每半年观察
H
持续学习落地
Titans / MIRAS 后续工作;是否有公开模型部署测试时记忆。
I
政策风险
美国对中国人工智能芯片管制、监管法规对需求曲线的影响。

八 · 方法论沉淀

本研究过程中暴露出的五个分析偏差,作为后续工作的校准点。

偏差 01把"已经涨了多少"当成判断的反向证据
某存储龙头年初涨 132% 后反射性看空,但两周内继续涨 40%。判断验证度(结构性需求)和估值合理性(市盈率)必须分开看。
偏差 02把训练资本开支当成黑盒
之前固态硬盘增量主要从推理侧看,遗漏了训练侧。必须拆到逐字日志、训练快照、镜像、日志这些基础单元层级。
偏差 03高估存储软件公司的市场份额
3FS 开源 + 超大规模云厂商自研倾向,软件层市场比预期小。底层闪存厂商和中间层软件公司是两个独立市场。
偏差 04用旧范式基准推新范式量级
用 V3 时代"后训练 5000 卡时"作基准,但 V4 后训练量级与预训练相当。遇到范式转变时,过去的基准必须主动作废。
偏差 05低估硬件路线落地速度
认为持续学习还在纯理论期,但 TPU 8 系列和 BlueField-4 已在硬件层面铺路。硬件路线是判断落地最强的先行指标。

九 · 结语

DeepSeek V4 不是能力突破——它落后 GPT-5.5 与 Opus 4.7 大约 3-6 个月——而是第一份完整公开"后训练新范式"工程实现的开源论文。它揭示的三类训练侧固态硬盘工作负载几乎不在卖方分析师的需求模型里;同样的范式在 OpenAI、Anthropic、Google 的硬件路线上独立验证。这部分增量被市场充分定价需要 6-12 个月,是错位定价的窗口

主要引用

本文为研究笔记,所有判断为个人分析,不构成投资建议。文中提及的具体公司、模型、技术细节均基于公开资料,可能随时间过期。
王雨峰的博客