Executive Thesis
从“经验学习”重读 AI 存储需求
2026-06-23 重编版
四篇论文
HBM / DRAM / NAND 分层推演
部署后经验生产真实交互轨迹、失败路径和环境反馈成为学习原料。
上下文快适应提示、反馈和上下文被优化成可复用的快权重。
轨迹到经验演化从保存日志,走向反思、抽象、探索和技能化。
记忆访问瓶颈存得多不等于用得好,检索污染会成为新约束。
OEL
FST
Survey
Memory CL
这张图决定后续图表怎么画
不要按论文逐条堆结论那会变成四份摘要。更好的方式是先识别每篇论文改变的“学习对象”。
不要把 memory 译成同一种存储同一个词可能指热上下文、候选池、经验摘要、向量索引或冷归档。
不要先问利好谁先问它改变了哪类状态、保存多久、是否进入热路径、能否被抽象。
横轴:从外部轨迹到运行期上下文纵轴:从原始保存到抽象组织
Unified Frame
把所有“记忆”统一成状态生命周期
统一框架对象先于介质
四篇论文最容易被误读的地方,是把“记忆”当成一个单一东西。更好的抽象是:智能体持续产生状态,系统决定哪些状态被抽取、组织、调用、回放和归档。
轨迹产生用户任务、工具调用、环境反馈、失败路径。先落到便宜容量层。
经验抽取从轨迹里提炼规则、偏好、反思和可迁移策略。
在线组织索引、候选记忆池、去重、聚合、重排和上下文预算。
回放更新私有评测、强化学习、蒸馏和周期训练推高活跃工作集。
淘汰归档抽象、压缩、短删和合规约束决定长期容量弹性。
因此图表的核心不是“数据量越来越大”的线性箭头,而是不同状态在不同介质之间迁移。
| 问题 | 要读出的内容 | 对应图表 | 存储映射 |
| 它改变什么学习机制? | 部署经验、快权重、记忆演化、检索组织。 | 机制链 | 决定需求是否真实进入系统。 |
| 它新增什么状态对象? | 轨迹、经验摘要、上下文池、检索索引、回放样本。 | 对象表 | 决定保存在哪里、多久、是否热。 |
| 它最强化哪层介质? | HBM、DRAM、NAND 的相对强度,而不是绝对预测。 | 三层条形图 / 热力图 | 决定投资表达的纯度。 |
| 什么会让结论下修? | 抽象效率、短留存、离线检索、真实收益有限。 | 反证清单 | 避免把论文标题当需求证明。 |
这套读法会让 PPT 从“论文摘要合集”变成“需求传导手册”。
Paper 1 · Online Experiential Learning
部署后的真实交互,不再只是日志
作者Tianzhu Ye, Li Dong, Qingxiu Dong, Xun Wu, Shaohan Huang, Furu Wei一句话用户侧交互轨迹被抽取为可迁移经验,再通过同策略上下文蒸馏内化进模型。
论文要解决的问题
传统训练依赖离线标注或模拟环境,真实部署中积累的经验没有被系统性利用。
关键机制
先从用户侧轨迹抽取经验知识,再在服务端用带经验教师对学生做蒸馏。
对需求的第一性影响
部署数据从副产品变成训练闭环燃料,温层经验库和回放管道成为核心资产。
这篇最像 NAND thesis 的根,但它同时告诉我们:原始轨迹不是终点,能提升行为的经验抽取才是资产。
Paper 1 · Mechanism
OEL 是一个经验生产闭环
Online Experiential Learning轨迹 → 经验 → 蒸馏 → 更好轨迹
用户侧轨迹真实任务中的观察、动作、文本反馈、错误路径和成功路径。
经验抽取把噪声轨迹提炼成规则、偏好、策略和可复用提示。
经验积累形成版本化经验库,支持后续查询、治理和样本选择。
同策略蒸馏学生在自己的分布上采样,再匹配带经验教师。
再次部署更强模型产生更高质量轨迹,经验质量继续上升。
为什么不是普通日志系统
日志系统保存发生过什么;OEL 关心哪些轨迹能被抽取成经验、能否进入蒸馏、能否提高下轮表现。
为什么不能线性外推容量
论文强调抽取经验比直接使用原始轨迹更有效,所以成熟系统会压缩、筛选和淘汰低价值轨迹。
Paper 1 · Objects
新增的不是一种数据,而是一条加工链
Online Experiential Learning状态对象拆解
| 对象 | 生命周期 | 最像哪层 | 需求含义 |
| 原始轨迹 | 短热、温层、审计归档 | NAND / 对象存储 | 容量取决于保留周期、任务体积和失败样本比例。 |
| 经验知识 | 温层资产,高频检索 | NAND + DRAM | 体积更小但价值更高,需要版本化、去重和索引。 |
| 训练前缀样本 | 训练期高吞吐 | SSD + DRAM | 短期管道吞吐和样本调度需求强。 |
| 教师/学生分布 | 蒸馏热路径 | HBM | 只有进入训练和蒸馏的小批次才推高 HBM。 |
图表含义:OEL 不是单点容量故事,而是从数据资产到训练工作集的分层传导。
Paper 1 · Storage Impact
OEL:NAND 最强,DRAM/HBM 随回放放大
Online Experiential Learning三层影响
向上变量多模态轨迹、企业审计、私有评测、失败样本回放、持续蒸馏。
向下变量只保留摘要、短留存、强去重、高效经验抽取、低频回放。
投资读法容量层最直接,但真正有杠杆的是经验治理、控制器吞吐和训练管道。
Paper 2 · Learning, Fast and Slow
学习不一定先写进参数,也可以先写进上下文
Learning, Fast and Slow: Towards LLMs That Adapt Continually2026-05-12 / v2 05-14
arXiv:2605.12484
作者Rishabh Tiwari 等一句话模型参数是慢权重,优化后的上下文是快权重;二者协同能提高持续适应并降低遗忘。
问题
参数更新吸收任务信息,但可能导致灾难性遗忘和可塑性下降。
机制
让文本反馈优化上下文,把任务特定信息先留在快权重里。
存储含义
上下文池、反馈文本、候选提示和快权重版本成为新的可管理状态。
FST 更像 HBM/DRAM thesis:上下文进入热路径,候选上下文池成为在线组织层。
Paper 2 · Mechanism
快慢协同把学习压力分流到上下文层
Learning, Fast and Slow慢参数 + 快上下文
任务反馈推理错误、文本反馈、工具执行结果。
上下文优化反思式优化器改写提示和任务上下文。
快权重池保留多个候选上下文,而不是一个手工 prompt。
慢权重更新参数训练在不同上下文条件下发生。
持续适应新任务先动上下文,参数漂移减少。
热路径为什么增强
快权重最终以上下文形式进入推理和训练,增加活跃上下文与键值缓存压力。
组织层为什么增强
上下文池需要按任务、表现、反馈和时效性检索、排序、淘汰。
Paper 2 · Evidence
快权重让模型少漂移,也更能继续学
Learning, Fast and Slow实验读法
| 论文结果 | 系统含义 | 存储含义 |
|---|
| 最高约 3 倍样本效率 | 上下文能快速吸收任务反馈。 | 反馈文本和上下文版本变成训练资产。 |
| 最高约 70% 更低 KL 漂移 | 慢权重不必承载全部任务信息。 | 外部上下文层替代部分参数记忆。 |
| 连续任务更稳 | 模型不易被单一任务锁死。 | 上下文池需要长期可检索、可迁移。 |
Paper 2 · Storage Impact
FST:热上下文和候选池比原始容量更重要
Learning, Fast and Slow三层影响
核心变量快权重长度、候选上下文数量、在线选择频率、训练/推理共用度。
反证变量快权重迅速蒸馏回参数,运行期上下文变短,候选池离线化。
产业映射HBM、DRAM、CXL、上下文缓存、提示/记忆中间件。
Paper 3 · From Storage to Experience
记忆系统从保存轨迹走向抽象经验
From Storage to Experience: A Survey on the Evolution of LLM Agent Memory Mechanisms2026-05-07
arXiv:2605.06716
作者Jinghao Luo 等;ACL 2026 Findings一句话智能体记忆从 Storage 到 Reflection 再到 Experience,核心驱动是长程一致性、动态环境和持续学习。
这篇不是新增一个系统,而是给我们一个分类器:一个产品或论文处在哪个记忆阶段,决定它的存储介质权重。
Storage
轨迹保存,一对一记录发生过什么。容量和生命周期管理最重要。
Reflection
从轨迹中生成批评、偏好、纠错和经验片段。检索和重排变重要。
Experience
跨轨迹抽象为规则、技能、程序或模型能力。训练和评测回放更重要。
Paper 3 · Stage Model
三阶段不是线性扩容,而是数据形态变化
From Storage to ExperienceStorage / Reflection / Experience
| 阶段 | 主要数据 | 系统瓶颈 | 介质权重变化 |
|---|
| Storage | 原始对话、工具调用、环境状态、日志。 | 容量、成本、留存、合规。 | NAND 最直接,冷归档也重要。 |
| Reflection | 错误总结、反思文本、偏好、纠错路径。 | 去噪、索引、相似检索、版本管理。 | DRAM 组织层上升,NAND 仍是底座。 |
| Experience | 规则、技能、程序、潜变量、微调权重。 | 抽象质量、可迁移性、评测和回放。 | 原始容量压力下降,热检索和训练压力上升。 |
Paper 3 · Interpretation
经验不是更长的日志,而是更短、更可迁移的策略
From Storage to Experience存储叙事修正
被加强的方向
- 早期智能体产品会产生大量可保存轨迹。
- 反思和经验抽象需要保留代表性样本和评测版本。
- 主动探索会增加环境状态和失败样本回放。
被削弱的方向
- 成熟系统不会无限保留所有原始轨迹。
- 经验抽象会让单位能力对应的数据体积下降。
- 真正瓶颈转向组织、评测和更新,而非容量本身。
对投资研究来说,这篇论文最有用的地方,是把产品阶段和介质权重绑定起来。
Paper 3 · Storage Impact
Survey:长期利好分层架构,不利好单一口号
From Storage to Experience三层影响
核心变量产品处于 Storage、Reflection 还是 Experience;抽象效率;探索和评测频率。
最强启发同样叫 memory,不同阶段对应完全不同的容量、延迟和训练压力。
投资用法把新产品/论文/云厂架构先归类到三阶段,再映射到介质。
Paper 4 · When Continual Learning Moves to Memory
存得越多,不等于学得越好
When Continual Learning Moves to Memory: A Study of Experience Reuse in LLM Agents2026-04-29
arXiv:2604.27003
作者Qisheng Hu, Quanyu Long, Wenya Wang一句话持续学习难题不会消失,而是在有限上下文窗口下迁移到记忆表示和检索组织。
核心反证
旧经验还在,并不代表能被正确取出;取错会污染上下文。
系统瓶颈
有限上下文里,旧经验、新经验、任务输入和工具状态竞争入口。
对容量叙事的修正
原始轨迹跨任务可能负迁移,抽象程序记忆更可靠。
Paper 4 · Mechanism
持续学习瓶颈从参数空间搬到记忆空间
When Continual Learning Moves to Memory瓶颈迁移
| 学习方式 | 旧瓶颈 | 新瓶颈 |
|---|
| 参数持续学习 | 新任务更新权重,覆盖旧知识。 | 稳定性与可塑性冲突。 |
| 外部记忆学习 | 旧经验仍被保留。 | 有限上下文下取错、取多、取不到。 |
| 真正问题 | 不再是有没有记忆。 | 而是表示、组织、检索和重排是否正确。 |
检索污染看似相似但任务特定的原始轨迹误导新任务。
上下文竞争更多记忆会挤占任务输入、工具状态和推理预算。
记忆稀释经验越积越多,正确经验更难在正确时刻被取到。
Paper 4 · Evidence
抽象记忆比原始轨迹更安全
When Continual Learning Moves to Memory表示与组织
论文结果的投资读法
| 发现 | 解释 | 存储含义 |
|---|
| 原始轨迹可能负迁移 | 细节携带任务特定动作脚本。 | 不是越细越好,需要抽象和过滤。 |
| 困难样本更易受害 | 越需要帮助时越依赖检索质量。 | 检索错误代价集中在高价值场景。 |
| 细粒度组织不总是更好 | 强前向迁移可能带来严重遗忘。 | 组织策略比容量本身更关键。 |
Paper 4 · Storage Impact
Memory CL:最强变量是取对,而不是存多
When Continual Learning Moves to Memory三层影响
强化对象候选记忆池、向量索引、去重聚合、重排、上下文构建。
削弱叙事记得越多越好、原始轨迹越细越好、外部记忆自动解决持续学习。
产业落点DRAM/CXL、控制器、向量检索、记忆中间件、数据治理。
Cross-paper Synthesis
四篇论文其实是一条系统链
统一机制生产 → 适应 → 演化 → 治理
OEL真实部署轨迹进入经验生产闭环。
FST上下文成为快速适应的可学习状态。
Survey记忆从保存走向反思和经验抽象。
Memory CL长期记忆的瓶颈迁移到检索和组织。
Storage thesis状态管理基础设施分层扩张。
热层
上下文、KV cache、训练回放、蒸馏小批次。
Impact Heatmap
四篇论文对三层介质的相对影响
研究打分方向性,不是论文原始数据
HBM
DRAM
NAND
OEL
72 · 蒸馏热路径
78 · 样本/索引
95 · 轨迹经验库
FST
88 · 快权重上下文
84 · 上下文池
68 · 版本底座
Survey
58 · 周期训练
88 · 反思组织
90 · 轨迹资产
Memory CL
52 · 上下文竞争
92 · 检索重排
64 · 治理后资产
读图结论:NAND 的长期资产层很强,但 DRAM 的在线组织层更可能成为被市场低估的二阶需求;HBM 只在状态进入热路径时受益。
Demand Chain
从论文机制到采购压力,中间有五个环节
传导链机制不能跳读
任务复杂化工具、网页、代码、企业文档、多模态环境。
HBM 放大器
长上下文、并发解码、在线蒸馏、训练回放。
DRAM 放大器
候选池、索引、重排、任务状态和预取。
NAND 放大器
轨迹保留周期、失败样本比例、私有评测频次。
Sizing Model
真正拉开需求差距的是三类变量
数量级估算研究推演,不是论文数据
| 场景 | HBM 热层 | DRAM 热层 | NAND 热池 | 冷归档 |
|---|
文本私有评测 短文本、低保留 | 0.2-0.6 TB | 0.1-0.4 TB | 0.8-5 TB | 10-30 TB/年 |
企业富工作流 文档、工具、代码 | 1-4 TB | 0.5-2 TB | 100-400 TB | 1-2 PB/年 |
多模态强化学习 截图、视频、沙箱 | 4-16 TB | 2-8 TB | 5-20 PB | 50-100 PB/年 |
口径:每 1000 个并发任务或等效活跃任务池;只看方向和数量级。
NAND 热池
≈(原始轨迹 + 经验摘要 + 回放缓冲)× 热保留天数 × 副本数
DRAM 热层
≈ 并发任务状态 + 热索引 + 候选记忆池 + 重排缓存
HBM 热层
≈ 当前上下文 + 活跃键值缓存 + 训练/蒸馏工作集
Layer Readout
HBM:看热路径,不看长期保存
HBM上下文、KV cache、训练回放
会推高 HBM快权重上下文变长,在线蒸馏放量,多候选上下文评测,长上下文并发解码。
不会直接推高 HBM长期轨迹、冷归档、离线经验库、未进入推理的向量索引。
跟踪指标平均上下文长度、KV cache 占用、在线训练频次、推理尾延迟。
Layer Readout
DRAM:从缓存变成记忆质量的组织层
DRAM候选池、索引、重排、预取
核心需求候选记忆池、向量索引、检索缓存、重排特征、上下文构建、任务状态。
为什么重要外部记忆不是存进去就能用,有限上下文会让检索质量决定能力。
跟踪指标检索命中率、上下文污染率、候选池大小、CXL/内存池化采用。
Layer Readout
NAND:经验资产库,不是无限追加日志库
NAND轨迹、摘要、失败样本、评测版本
会推高 NAND多模态轨迹、企业审计、失败样本长期保留、私有评测和回放放量。
会压低 NAND只留摘要、强去重、短留存、隐私限制、经验抽象效率很高。
跟踪指标热保留天数、原始轨迹保留比例、回放倍数、样本压缩率。
Investment Mapping
标的映射要看变现层,不看故事相似度
Purity容量、控制器、接口、池化
| 变现层 | 代表方向 | 和四篇论文的连接 | 纯度 | 主要风险 |
|---|
| 容量层 | SNDK / Kioxia、企业级 SSD、NAND 供给 | 轨迹、失败样本、回放缓冲和评测版本长期留存 | 高 | 经验抽象和短留存压低容量弹性 |
| 控制器层 | SIMO、企业 SSD 控制器、数据管理固件 | 经验库需要吞吐、耐久、QoS 和检索友好数据路径 | 很高 | 云厂自研或客户集中 |
| 广义内存层 | MU、HBM、DRAM、NAND 组合暴露 | 热状态、工作记忆、温层资产都被拉动 | 中高 | 周期和产品结构稀释 thesis |
| 接口 / 池化层 | RMBS、ALAB、CXL、内存扩展 | 候选池、重排、上下文预取让组织层变关键 | 中高 | 标准采用节奏不确定 |
| 数据移动层 | MRVL、网络、DPU、连接路径 | 跨层状态搬运和存储近端处理 | 中 | 主题相关但纯度较低 |
Falsification Dashboard
哪些信号会削弱这条存储 thesis?
Risk反证优先级
削弱 NAND
- 企业只保留经验摘要,原始轨迹短期删除。
- 抽象和去重效率极高,回放样本需求下降。
- 隐私限制让用户侧轨迹不能集中保存。
- 多模态智能体没有规模化生产。
削弱 DRAM/HBM
- 快权重迅速蒸馏回参数,运行期上下文变短。
- 检索质量靠离线批处理解决,而不是在线热索引。
- 长上下文成本下降太快,降低分层缓存必要性。
- 外部记忆在真实任务中收益有限或污染严重。
最该跟踪的验证信号
- 云厂是否把轨迹、记忆、评测、回放变成标准服务。
- 是否出现 SSD-backed KV cache / memory tiering 的生产化案例。
- 企业是否愿意长期保留失败样本和执行轨迹。
最该避免的误判
- 把“AI 存储”当作一个统一主题。
- 把论文机制直接外推成采购量。
- 忽视抽象、去重、短留存和检索污染。
Source Ledger
原始链接、继续阅读和团队讨论题
Links四篇核心论文 + 辅助系统证据
- Online Experiential Learning for Language Models · 2026-03-17 · arXiv:2603.16856
- Learning, Fast and Slow: Towards LLMs That Adapt Continually · 2026-05-12 / v2 2026-05-14 · arXiv:2605.12484
- From Storage to Experience · 2026-05-07 · arXiv:2605.06716
- When Continual Learning Moves to Memory · 2026-04-29 · arXiv:2604.27003
- 辅助系统证据:Tutti / KVServe / NVIDIA CMX 等用于观察 SSD-backed KV cache 和上下文记忆平台方向。
课堂问题哪篇论文最强支持 NAND?哪篇最强支持 DRAM?为什么不能只看标题里的 memory?
投研问题如果云厂只保存摘要、不保留原始轨迹,容量 thesis 应该下修多少?
复盘问题下一篇新论文出现时,先把它放入本手册的哪张图?
提示:浏览器打印时可选择横向,即可作为宽屏讲义导出。