引子:一条容易被误读的新闻
2026年8月底,Qwen3.8-Flash-Next 发布。技术细节里最刺眼的不是 6B 激活参数, 而是它体内那张 51B 的 N-gram embedding 表——两千万条 bigram/trigram 条目, 插在第二层,平时躺在主机内存里,前向开始前地址就已经算好,异步预取,GPU 零争抢。
社区的反应很诚实:“一张巨大的作弊小抄。”
但这件事的真正含义不在小抄本身,而在于它被放在了哪里。 这张表不进注意力、不占上下文窗口、不参与推理计算——它就是一张表,模型查它,用完就走。 这是主流大模型第一次在生产级规模上承认一件事:
知识不一定要住在权重里。
半年前的 DeepSeek Engram 论文(arXiv:2601.07372)把这句话说得更正式: Transformer 一直缺少原生的“查表”原语,被迫用计算模拟检索; 他们补上了这条与 MoE“条件计算”互补的稀疏轴——“条件记忆”, 并且发现了一条 U 形分配律:专家参数和记忆参数之间存在最优配比,纯 MoE 是次优解。
换成人话:“模型该记多少东西”从此不再是一个信仰问题,而是一个有标定曲线的工程变量。
一个被混淆已久的问题
过去五年,持续学习领域的争吵——灾难性遗忘怎么办、memory layer 还是 RAG、 长上下文还是检索——在我看来是同一个问题被错误地放进了错误的坐标系。
这个问题的正确坐标系不在机器学习里,在存储工程里。
任何一台计算机都在运行同一个答案:寄存器、L1/L2 缓存、内存、磁盘、网络。 没有人问“为什么不让 CPU 寄存器装上 1PB 数据”,因为每个人都理解延迟-容量权衡。 但轮到 AI,我们却一直在认真讨论“为什么不让权重记住一切”或“为什么不让上下文窗口装下一切”—— 这两个问题在存储工程师眼里,和给寄存器装硬盘是同一种荒谬。
一旦换到存储层次的坐标系,持续学习的整个问题图景会重新排列:
- 权重是寄存器:零延迟,容量最小,改动最难,只该放“热到每次都用”的东西——能力、常识、取用策略;
- KV cache 是内存:会话内精确,易失,有界;
- 外置记忆是磁盘:容量近乎无限(一个硬盘柜就是 PB 级,纯文本绰绰有余),但访问要付出延迟;
- 互联网是网络存储:无界,不可控,信任度未知。
灾难性遗忘在这个坐标系里甚至不需要“被解决”——它自动降级为缓存替换策略问题。 真正的问题变成了另外三个:索引怎么建、什么该被提升进更快的楼层、信任边界画在哪。
一个具体的形状:运行时三层,离线一层
沿着这个思路,我在 FLUED(Fluid Language Unified Encoder-Decoder, 一个字节级语言接口的架构项目)的 v4 设计中推出了一个相当具体的形状。 FLUED 这个名字本身就是主张:Fluid 指记忆像流体,倒进什么容器就是什么形状—— 会话内是 KV,跨会话是日志,压缩了是状态矩阵,层级化了是树; Unified 指一切与主干共享字节底物的部件以无感方式参与前向, 不共享底物的资源(搜索、命令行、MCP)才以显式工具方式被调用。 以下是工作假设,不是共识。
第一层,权重。只保留推理能力和“什么存、怎么存、取什么、怎么取、怎么用”的元策略。知识从 scaling 方程里被拿掉,从容量维度变成检索维度。
第二层,树状模糊层。这是整个架构唯一真正的新部件。一棵 gist 树: 叶子是近无损的记忆条目,内部节点是其子树的概要。 每次前向,模型默认沿着树做 O(log n) 次 gist 比对——不是每条记忆都被检查, 而是每条记忆都在某个被检查过的 gist 的覆盖范围内。 超过阈值的,指针定位、物化进上下文;没超的,以“背景可知”的方式无感参与。
写入用 delta rule:先查旧记忆的预测,只写回实际值与预测值的差。 已知的东西差值近零、不写;意外的东西强写。 残差沿树上溯,写入强度逐层衰减——粗层慢变,细层快变, 多时间尺度不是调出来的超参,是树深度的自然函数。
第三层,KV cache。现有框架一行不用改。
第零层(离线),append-only 日志。全量、只增不改、唯一事实源。 它不出现在任何一次前向里,但三件事离不开它:树塌了从它重建、 权重周期性蒸馏时从它回放、审计时对它查询。 灾难性遗忘由此从“每次推理的在线结构必然”被搬迁成“每年一次的离线采样率超参问题”—— 后者是这个领域里被研究得最透、工具最多、可以反复重试的那种问题。
连接这一切的是一条接口规范:主干对树节点、KV 条目、自身输出使用同一套 query-key 几何, 任何一层返回的记忆在表示空间里不可区分。 满足这条,“模型对记忆无感”就不是设计目标而是定义性事实—— 层间差异只剩延迟和保真度,而这两者恰好是路由策略可以动态权衡的量。
证据正在向这个方向收敛
这个架构里的大部分零件,过去一年里被不同团队从完全不同的动机独立做出来了:
- Google 的 Titans 证明了“意外驱动写入”(surprise)在 200 万 token 尺度上有效;
- NVIDIA 的 GDN2 把记忆的“擦除”和“写入”解耦,消融显示擦除侧贡献更大——维护已有关联比写入新内容更关键;
- LiveMem 已经实现了“冻结主干 + 并行记忆分支 + KV 逐出后信息留存”的完整骨架;
- DeepSeek 的 Engram 和 Qwen 的 N-gram 表证明了查表记忆可以生产化——并且诚实地报告了天花板:词表扩大单调降 loss,但下游收益饱和;
- 更微妙的两篇:Tokenizer-Agnostic Engram 把 N-gram 建立在字节序列上以摆脱分词器锁死;Cross-Model Memory Transfer 证明冻结的记忆表可以迁移到别的模型——只要寻址、存储、读取三者分离。
最后这一点值得停顿一下。记忆可移植的前提是接口标准化—— 这和一个世纪前螺丝螺纹标准化是同一个逻辑。谁先定下接口,谁定义生态。
而天花板之上——可写的、分层的、随经验在线增长的那部分记忆——目前没人占位。 Qwen 的表是字典,出厂封版、只读、平坦;真正难也真正值钱的是日记:可写、有层级、随生命周期生长。
硬件经济学:另一个被忽略的论据
三条稀疏化路线对应三种资源禀赋。MoE 吃计算;Engram 吃 DRAM 的容量和带宽 (靠数据无关寻址做异步预取,把带宽问题转化为调度问题); 树状记忆吃 SSD 的容量——每 TB 成本和 HBM 差着两个数量级,每次查询只付 O(log n) 次小读取。
软肋也诚实交代:树搜索是数据依赖的指针追逐,下一跳地址由本跳结果决定, 无法像 Engram 那样整体预取。 缓解方案是分层放置(热点 gist 钉在内存,深叶落盘)加批量投机预取(比较当前节点时把子节点一次顺序读入)。
把三条路线放一起看,结论比任何单独一条都大:记忆外置不存在单一的硬件形态,而是一条从 HBM 到硬盘的连续放置谱系——数据温度决定物理楼层。智能的成本结构由架构决定,不由模型决定。
预测(可证伪,欢迎打脸)
- 6 个月内,头部开源基座模型会原生集成“可在线写入的分层记忆”部件(区别于 Engram 的只读静态表),大概率以 GDN 类状态矩阵为基底加分层索引; 状态:[待验证,期限 2027-03-03]
- 12 个月内,会出现记忆接口标准化的认真尝试——“记忆的 CUDA 时刻”,即寻址/存储/读取分离成为设计共识; 状态:[待验证,期限 2027-09-03]
- “可审计性 vs 端到端可微”的张力会成为显学:凡是能被查账的系统必有离散边界,离散边界必然收训练税——围绕“税率”而非“免税”的工程会增多; 状态:[待验证,期限 2028-09-03]
- 周期性离线蒸馏 + 全量日志回放会成为持续学习的主流工程范式,在线权重更新在多数场景被证伪为不值得; 状态:[待验证,期限 2028-09-03]
- 工作记忆容量的认知科学结论(4±1 槽位)会反向约束物化带宽设计——Anthropic 的 J-space 工作及其开源复现已经在给出数量级证据。 状态:[待验证,期限 2028-09-03]
如果以上有一条在期限内被证伪,这篇博客的相应部分就应该被修订——这正是把它写成预测而非观点的原因。
结尾:智能住在哪一层
有一个观察我越想越觉得不是巧合:这套四层结构——慢而稳的内核、快而变的记忆、 易失的工作区、不可变的事实源——和一个运行良好的心智几乎同构。 人的内核(性格、能力)更新极慢且需要睡眠般的离线回放; 日常经验先以概要形式存在,细节按需还原; 而日记和档案之所以被发明,正是因为我们早就知道内核装不下一切。
也许这暗示着,“智能”从来不住在某一层里。 它住在层与层之间的接口上——住在“什么该被记住、什么该被忘掉、什么该被信任、什么时候该去查”的调度里。 模型只是租户,架构才是建筑。
而我们现在正处在建筑图纸刚刚可以被画出来的时刻。