Executive Thesis

从“经验学习”重读 AI 存储需求

2026-06-23 重编版 四篇论文
HBM / DRAM / NAND 分层推演

我会把这组材料读成一个基础设施命题:未来智能体不只调用模型,还会持续产生、筛选、检索、回放和蒸馏经验。存储需求的核心不再是“保存更多数据”,而是管理不同温度、不同生命周期的状态。

最适合的阅读顺序:先看四篇论文分别改变什么学习对象,再把这些对象放到热状态、工作记忆、温层经验库、冷归档四层里。
HBM只关心进入模型热路径的上下文、键值缓存、训练和蒸馏工作集。
DRAM负责在线检索、候选记忆池、重排、预取和任务状态,是最容易被低估的组织层。
NAND承接轨迹、失败样本、经验摘要、评测版本和回放缓冲,但会被抽象、去重和留存周期约束。
  1. 01Online Experiential Learning for Language Models2026-03-17部署轨迹变成经验抽取和蒸馏燃料,最直接强化温层经验资产。
  2. 02Learning, Fast and Slow: Towards LLMs That Adapt Continually2026-05-12
    v2 05-14
    上下文从提示词升级为快权重,强化 HBM 热路径和 DRAM 上下文池。
  3. 03From Storage to Experience: A Survey on the Evolution of LLM Agent Memory Mechanisms2026-05-07把智能体记忆拆成保存、反思、经验三阶段,是全篇的分类器。
  4. 04When Continual Learning Moves to Memory2026-04-29指出外部记忆会把瓶颈迁移到检索、组织和上下文竞争。

Reading Map

先把四篇论文放进同一张地图

二轴定位学习来源 × 记忆形态
部署后经验生产真实交互轨迹、失败路径和环境反馈成为学习原料。
上下文快适应提示、反馈和上下文被优化成可复用的快权重。
轨迹到经验演化从保存日志,走向反思、抽象、探索和技能化。
记忆访问瓶颈存得多不等于用得好,检索污染会成为新约束。
OEL
FST
Survey
Memory CL

这张图决定后续图表怎么画

不要按论文逐条堆结论那会变成四份摘要。更好的方式是先识别每篇论文改变的“学习对象”。
不要把 memory 译成同一种存储同一个词可能指热上下文、候选池、经验摘要、向量索引或冷归档。
不要先问利好谁先问它改变了哪类状态、保存多久、是否进入热路径、能否被抽象。
横轴:从外部轨迹到运行期上下文纵轴:从原始保存到抽象组织

Unified Frame

把所有“记忆”统一成状态生命周期

统一框架对象先于介质

四篇论文最容易被误读的地方,是把“记忆”当成一个单一东西。更好的抽象是:智能体持续产生状态,系统决定哪些状态被抽取、组织、调用、回放和归档。

轨迹产生

用户任务、工具调用、环境反馈、失败路径。先落到便宜容量层。

经验抽取

从轨迹里提炼规则、偏好、反思和可迁移策略。

在线组织

索引、候选记忆池、去重、聚合、重排和上下文预算。

热调用

被选中的上下文进入推理、训练或蒸馏热路径。

回放更新

私有评测、强化学习、蒸馏和周期训练推高活跃工作集。

淘汰归档

抽象、压缩、短删和合规约束决定长期容量弹性。

因此图表的核心不是“数据量越来越大”的线性箭头,而是不同状态在不同介质之间迁移。

Study Protocol

每篇论文只问四个问题

阅读协议机制 → 对象 → 介质 → 反证
问题要读出的内容对应图表存储映射
它改变什么学习机制?部署经验、快权重、记忆演化、检索组织。机制链决定需求是否真实进入系统。
它新增什么状态对象?轨迹、经验摘要、上下文池、检索索引、回放样本。对象表决定保存在哪里、多久、是否热。
它最强化哪层介质?HBM、DRAM、NAND 的相对强度,而不是绝对预测。三层条形图 / 热力图决定投资表达的纯度。
什么会让结论下修?抽象效率、短留存、离线检索、真实收益有限。反证清单避免把论文标题当需求证明。
这套读法会让 PPT 从“论文摘要合集”变成“需求传导手册”。

Paper 1 · Online Experiential Learning

部署后的真实交互,不再只是日志

Online Experiential Learning for Language Models2026-03-17
arXiv:2603.16856
作者Tianzhu Ye, Li Dong, Qingxiu Dong, Xun Wu, Shaohan Huang, Furu Wei一句话用户侧交互轨迹被抽取为可迁移经验,再通过同策略上下文蒸馏内化进模型。

论文要解决的问题

传统训练依赖离线标注或模拟环境,真实部署中积累的经验没有被系统性利用。

关键机制

先从用户侧轨迹抽取经验知识,再在服务端用带经验教师对学生做蒸馏。

对需求的第一性影响

部署数据从副产品变成训练闭环燃料,温层经验库和回放管道成为核心资产。

这篇最像 NAND thesis 的根,但它同时告诉我们:原始轨迹不是终点,能提升行为的经验抽取才是资产。

Paper 1 · Mechanism

OEL 是一个经验生产闭环

Online Experiential Learning轨迹 → 经验 → 蒸馏 → 更好轨迹
用户侧轨迹真实任务中的观察、动作、文本反馈、错误路径和成功路径。
经验抽取把噪声轨迹提炼成规则、偏好、策略和可复用提示。
经验积累形成版本化经验库,支持后续查询、治理和样本选择。
同策略蒸馏学生在自己的分布上采样,再匹配带经验教师。
再次部署更强模型产生更高质量轨迹,经验质量继续上升。

为什么不是普通日志系统

日志系统保存发生过什么;OEL 关心哪些轨迹能被抽取成经验、能否进入蒸馏、能否提高下轮表现。

为什么不能线性外推容量

论文强调抽取经验比直接使用原始轨迹更有效,所以成熟系统会压缩、筛选和淘汰低价值轨迹。

Paper 1 · Objects

新增的不是一种数据,而是一条加工链

Online Experiential Learning状态对象拆解
对象生命周期最像哪层需求含义
原始轨迹短热、温层、审计归档NAND / 对象存储容量取决于保留周期、任务体积和失败样本比例。
经验知识温层资产,高频检索NAND + DRAM体积更小但价值更高,需要版本化、去重和索引。
训练前缀样本训练期高吞吐SSD + DRAM短期管道吞吐和样本调度需求强。
教师/学生分布蒸馏热路径HBM只有进入训练和蒸馏的小批次才推高 HBM。
图表含义:OEL 不是单点容量故事,而是从数据资产到训练工作集的分层传导。

Paper 1 · Storage Impact

OEL:NAND 最强,DRAM/HBM 随回放放大

Online Experiential Learning三层影响

相对影响强度

HBM
72
DRAM
78
NAND
95

研究打分,不是论文原始数值。

向上变量多模态轨迹、企业审计、私有评测、失败样本回放、持续蒸馏。
向下变量只保留摘要、短留存、强去重、高效经验抽取、低频回放。
投资读法容量层最直接,但真正有杠杆的是经验治理、控制器吞吐和训练管道。

Paper 2 · Learning, Fast and Slow

学习不一定先写进参数,也可以先写进上下文

Learning, Fast and Slow: Towards LLMs That Adapt Continually2026-05-12 / v2 05-14
arXiv:2605.12484
作者Rishabh Tiwari 等一句话模型参数是慢权重,优化后的上下文是快权重;二者协同能提高持续适应并降低遗忘。

问题

参数更新吸收任务信息,但可能导致灾难性遗忘和可塑性下降。

机制

让文本反馈优化上下文,把任务特定信息先留在快权重里。

存储含义

上下文池、反馈文本、候选提示和快权重版本成为新的可管理状态。

FST 更像 HBM/DRAM thesis:上下文进入热路径,候选上下文池成为在线组织层。

Paper 2 · Mechanism

快慢协同把学习压力分流到上下文层

Learning, Fast and Slow慢参数 + 快上下文
任务反馈推理错误、文本反馈、工具执行结果。
上下文优化反思式优化器改写提示和任务上下文。
快权重池保留多个候选上下文,而不是一个手工 prompt。
慢权重更新参数训练在不同上下文条件下发生。
持续适应新任务先动上下文,参数漂移减少。

热路径为什么增强

快权重最终以上下文形式进入推理和训练,增加活跃上下文与键值缓存压力。

组织层为什么增强

上下文池需要按任务、表现、反馈和时效性检索、排序、淘汰。

Paper 2 · Evidence

快权重让模型少漂移,也更能继续学

Learning, Fast and Slow实验读法
论文结果系统含义存储含义
最高约 3 倍样本效率上下文能快速吸收任务反馈。反馈文本和上下文版本变成训练资产。
最高约 70% 更低 KL 漂移慢权重不必承载全部任务信息。外部上下文层替代部分参数记忆。
连续任务更稳模型不易被单一任务锁死。上下文池需要长期可检索、可迁移。
参数-only
易漂移
快慢协同
更可塑

Paper 2 · Storage Impact

FST:热上下文和候选池比原始容量更重要

Learning, Fast and Slow三层影响

相对影响强度

HBM
88
DRAM
84
NAND
68
核心变量快权重长度、候选上下文数量、在线选择频率、训练/推理共用度。
反证变量快权重迅速蒸馏回参数,运行期上下文变短,候选池离线化。
产业映射HBM、DRAM、CXL、上下文缓存、提示/记忆中间件。

Paper 3 · From Storage to Experience

记忆系统从保存轨迹走向抽象经验

From Storage to Experience: A Survey on the Evolution of LLM Agent Memory Mechanisms2026-05-07
arXiv:2605.06716
作者Jinghao Luo 等;ACL 2026 Findings一句话智能体记忆从 Storage 到 Reflection 再到 Experience,核心驱动是长程一致性、动态环境和持续学习。
这篇不是新增一个系统,而是给我们一个分类器:一个产品或论文处在哪个记忆阶段,决定它的存储介质权重。

Storage

轨迹保存,一对一记录发生过什么。容量和生命周期管理最重要。

Reflection

从轨迹中生成批评、偏好、纠错和经验片段。检索和重排变重要。

Experience

跨轨迹抽象为规则、技能、程序或模型能力。训练和评测回放更重要。

Paper 3 · Stage Model

三阶段不是线性扩容,而是数据形态变化

From Storage to ExperienceStorage / Reflection / Experience
阶段主要数据系统瓶颈介质权重变化
Storage原始对话、工具调用、环境状态、日志。容量、成本、留存、合规。NAND 最直接,冷归档也重要。
Reflection错误总结、反思文本、偏好、纠错路径。去噪、索引、相似检索、版本管理。DRAM 组织层上升,NAND 仍是底座。
Experience规则、技能、程序、潜变量、微调权重。抽象质量、可迁移性、评测和回放。原始容量压力下降,热检索和训练压力上升。
Storage
保存
Reflection
提炼
Experience
抽象

Paper 3 · Interpretation

经验不是更长的日志,而是更短、更可迁移的策略

From Storage to Experience存储叙事修正

被加强的方向

  • 早期智能体产品会产生大量可保存轨迹。
  • 反思和经验抽象需要保留代表性样本和评测版本。
  • 主动探索会增加环境状态和失败样本回放。

被削弱的方向

  • 成熟系统不会无限保留所有原始轨迹。
  • 经验抽象会让单位能力对应的数据体积下降。
  • 真正瓶颈转向组织、评测和更新,而非容量本身。
对投资研究来说,这篇论文最有用的地方,是把产品阶段和介质权重绑定起来。

Paper 3 · Storage Impact

Survey:长期利好分层架构,不利好单一口号

From Storage to Experience三层影响

相对影响强度

HBM
58
DRAM
88
NAND
90
核心变量产品处于 Storage、Reflection 还是 Experience;抽象效率;探索和评测频率。
最强启发同样叫 memory,不同阶段对应完全不同的容量、延迟和训练压力。
投资用法把新产品/论文/云厂架构先归类到三阶段,再映射到介质。

Paper 4 · When Continual Learning Moves to Memory

存得越多,不等于学得越好

When Continual Learning Moves to Memory: A Study of Experience Reuse in LLM Agents2026-04-29
arXiv:2604.27003
作者Qisheng Hu, Quanyu Long, Wenya Wang一句话持续学习难题不会消失,而是在有限上下文窗口下迁移到记忆表示和检索组织。

核心反证

旧经验还在,并不代表能被正确取出;取错会污染上下文。

系统瓶颈

有限上下文里,旧经验、新经验、任务输入和工具状态竞争入口。

对容量叙事的修正

原始轨迹跨任务可能负迁移,抽象程序记忆更可靠。

Paper 4 · Mechanism

持续学习瓶颈从参数空间搬到记忆空间

When Continual Learning Moves to Memory瓶颈迁移
学习方式旧瓶颈新瓶颈
参数持续学习新任务更新权重,覆盖旧知识。稳定性与可塑性冲突。
外部记忆学习旧经验仍被保留。有限上下文下取错、取多、取不到。
真正问题不再是有没有记忆。而是表示、组织、检索和重排是否正确。
检索污染看似相似但任务特定的原始轨迹误导新任务。
上下文竞争更多记忆会挤占任务输入、工具状态和推理预算。
记忆稀释经验越积越多,正确经验更难在正确时刻被取到。

Paper 4 · Evidence

抽象记忆比原始轨迹更安全

When Continual Learning Moves to Memory表示与组织

论文结果的投资读法

发现解释存储含义
原始轨迹可能负迁移细节携带任务特定动作脚本。不是越细越好,需要抽象和过滤。
困难样本更易受害越需要帮助时越依赖检索质量。检索错误代价集中在高价值场景。
细粒度组织不总是更好强前向迁移可能带来严重遗忘。组织策略比容量本身更关键。

直观比较

原始轨迹
风险
抽象程序记忆
更稳
候选池重排
关键

Paper 4 · Storage Impact

Memory CL:最强变量是取对,而不是存多

When Continual Learning Moves to Memory三层影响

相对影响强度

HBM
52
DRAM
92
NAND
64
强化对象候选记忆池、向量索引、去重聚合、重排、上下文构建。
削弱叙事记得越多越好、原始轨迹越细越好、外部记忆自动解决持续学习。
产业落点DRAM/CXL、控制器、向量检索、记忆中间件、数据治理。

Cross-paper Synthesis

四篇论文其实是一条系统链

统一机制生产 → 适应 → 演化 → 治理
OEL真实部署轨迹进入经验生产闭环。
FST上下文成为快速适应的可学习状态。
Survey记忆从保存走向反思和经验抽象。
Memory CL长期记忆的瓶颈迁移到检索和组织。
Storage thesis状态管理基础设施分层扩张。

热层

上下文、KV cache、训练回放、蒸馏小批次。

组织层

候选池、索引、重排、预取、上下文预算。

资产层

轨迹、经验、失败样本、评测版本、回放缓冲。

Impact Heatmap

四篇论文对三层介质的相对影响

研究打分方向性,不是论文原始数据
HBM
DRAM
NAND
OEL
72 · 蒸馏热路径
78 · 样本/索引
95 · 轨迹经验库
FST
88 · 快权重上下文
84 · 上下文池
68 · 版本底座
Survey
58 · 周期训练
88 · 反思组织
90 · 轨迹资产
Memory CL
52 · 上下文竞争
92 · 检索重排
64 · 治理后资产
读图结论:NAND 的长期资产层很强,但 DRAM 的在线组织层更可能成为被市场低估的二阶需求;HBM 只在状态进入热路径时受益。

Demand Chain

从论文机制到采购压力,中间有五个环节

传导链机制不能跳读
任务复杂化

工具、网页、代码、企业文档、多模态环境。

轨迹产生

输入、动作、错误、反馈、环境状态。

经验加工

抽取、反思、压缩、聚合、版本化。

记忆调用

检索、重排、预取、上下文构建。

训练回放

评测、强化学习、蒸馏、持续更新。

治理淘汰

隐私、合规、短留存、抽象和压缩。

HBM 放大器

长上下文、并发解码、在线蒸馏、训练回放。

DRAM 放大器

候选池、索引、重排、任务状态和预取。

NAND 放大器

轨迹保留周期、失败样本比例、私有评测频次。

Sizing Model

真正拉开需求差距的是三类变量

数量级估算研究推演,不是论文数据
场景HBM 热层DRAM 热层NAND 热池冷归档
文本私有评测
短文本、低保留
0.2-0.6 TB0.1-0.4 TB0.8-5 TB10-30 TB/年
企业富工作流
文档、工具、代码
1-4 TB0.5-2 TB100-400 TB1-2 PB/年
多模态强化学习
截图、视频、沙箱
4-16 TB2-8 TB5-20 PB50-100 PB/年

口径:每 1000 个并发任务或等效活跃任务池;只看方向和数量级。

NAND 热池
≈(原始轨迹 + 经验摘要 + 回放缓冲)× 热保留天数 × 副本数

DRAM 热层
≈ 并发任务状态 + 热索引 + 候选记忆池 + 重排缓存

HBM 热层
≈ 当前上下文 + 活跃键值缓存 + 训练/蒸馏工作集

Layer Readout

HBM:看热路径,不看长期保存

HBM上下文、KV cache、训练回放
会推高 HBM快权重上下文变长,在线蒸馏放量,多候选上下文评测,长上下文并发解码。
不会直接推高 HBM长期轨迹、冷归档、离线经验库、未进入推理的向量索引。
跟踪指标平均上下文长度、KV cache 占用、在线训练频次、推理尾延迟。

对应论文

FST
最强
OEL
Survey
Memory CL

Layer Readout

DRAM:从缓存变成记忆质量的组织层

DRAM候选池、索引、重排、预取
核心需求候选记忆池、向量索引、检索缓存、重排特征、上下文构建、任务状态。
为什么重要外部记忆不是存进去就能用,有限上下文会让检索质量决定能力。
跟踪指标检索命中率、上下文污染率、候选池大小、CXL/内存池化采用。

对应论文

Memory CL
最强
Survey
很强
FST
很强
OEL

Layer Readout

NAND:经验资产库,不是无限追加日志库

NAND轨迹、摘要、失败样本、评测版本
会推高 NAND多模态轨迹、企业审计、失败样本长期保留、私有评测和回放放量。
会压低 NAND只留摘要、强去重、短留存、隐私限制、经验抽象效率很高。
跟踪指标热保留天数、原始轨迹保留比例、回放倍数、样本压缩率。

对应论文

OEL
最强
Survey
很强
FST
中强
Memory CL
中强

Investment Mapping

标的映射要看变现层,不看故事相似度

Purity容量、控制器、接口、池化
变现层代表方向和四篇论文的连接纯度主要风险
容量层SNDK / Kioxia、企业级 SSD、NAND 供给轨迹、失败样本、回放缓冲和评测版本长期留存经验抽象和短留存压低容量弹性
控制器层SIMO、企业 SSD 控制器、数据管理固件经验库需要吞吐、耐久、QoS 和检索友好数据路径很高云厂自研或客户集中
广义内存层MU、HBM、DRAM、NAND 组合暴露热状态、工作记忆、温层资产都被拉动中高周期和产品结构稀释 thesis
接口 / 池化层RMBS、ALAB、CXL、内存扩展候选池、重排、上下文预取让组织层变关键中高标准采用节奏不确定
数据移动层MRVL、网络、DPU、连接路径跨层状态搬运和存储近端处理主题相关但纯度较低

Falsification Dashboard

哪些信号会削弱这条存储 thesis?

Risk反证优先级

削弱 NAND

  • 企业只保留经验摘要,原始轨迹短期删除。
  • 抽象和去重效率极高,回放样本需求下降。
  • 隐私限制让用户侧轨迹不能集中保存。
  • 多模态智能体没有规模化生产。

削弱 DRAM/HBM

  • 快权重迅速蒸馏回参数,运行期上下文变短。
  • 检索质量靠离线批处理解决,而不是在线热索引。
  • 长上下文成本下降太快,降低分层缓存必要性。
  • 外部记忆在真实任务中收益有限或污染严重。

最该跟踪的验证信号

  • 云厂是否把轨迹、记忆、评测、回放变成标准服务。
  • 是否出现 SSD-backed KV cache / memory tiering 的生产化案例。
  • 企业是否愿意长期保留失败样本和执行轨迹。

最该避免的误判

  • 把“AI 存储”当作一个统一主题。
  • 把论文机制直接外推成采购量。
  • 忽视抽象、去重、短留存和检索污染。

Source Ledger

原始链接、继续阅读和团队讨论题

Links四篇核心论文 + 辅助系统证据
  • Online Experiential Learning for Language Models · 2026-03-17 · arXiv:2603.16856
  • Learning, Fast and Slow: Towards LLMs That Adapt Continually · 2026-05-12 / v2 2026-05-14 · arXiv:2605.12484
  • From Storage to Experience · 2026-05-07 · arXiv:2605.06716
  • When Continual Learning Moves to Memory · 2026-04-29 · arXiv:2604.27003
  • 辅助系统证据:Tutti / KVServe / NVIDIA CMX 等用于观察 SSD-backed KV cache 和上下文记忆平台方向。
课堂问题哪篇论文最强支持 NAND?哪篇最强支持 DRAM?为什么不能只看标题里的 memory?
投研问题如果云厂只保存摘要、不保留原始轨迹,容量 thesis 应该下修多少?
复盘问题下一篇新论文出现时,先把它放入本手册的哪张图?
王雨峰的博客