近年来,大语言模型(LLMs)的突破很大程度上归功于Scaling Laws(参数、数据、算力)。
然而,在模型演进的过程中,一个同等重要的维度正变得愈发关键——记忆(Memory)。
从Transformer中伴随计算产生的KV Cache,到线性RNN/SSM的隐式状态压缩,再到近期大火的Titans、TTT(Test-Time Training)以及Engram等显式、可持久化记忆模块,大模型的底层记忆机制正在经历一场深刻的范式转换。
基于此方向,清华大学唐杰教授团队、新加坡国立大学(NUS)以及Bosch AI联合发布了一篇针对大模型记忆架构前沿的详尽综述。文章不仅首次提出了三维记忆分类学(Representation, Update Dynamics, Persistence),还将零散的前沿工作统一到了一个连贯的理论框架下,为下一代更高效、可长效学习的LLM设计指明了方向。
这里需要特别澄清的是,本文探讨的“记忆”特指模型架构层面的内部记忆(Architectural-level Memory)——即模型在网络底层对历史信息的表征、压缩与状态更新;而非目前同样火热的、通过外部Agent框架(如外挂对话日志、本地文件检索引擎等)实现的Agent层面记忆。

传统意义上,LLM的内部“记忆”往往是隐式的、作为计算的副产品存在的。Transformer的自注意力机制提供了一个基于内容的瞬时工作记忆(KV Cache),但其计算与存储开销随序列长度呈二次方增长,且严重依赖于上下文窗口的限制。
近期的研究趋势表明,仅仅“拉长”上下文窗口已经不够了。为了让模型拥有跨越会话的持久学习能力,研究者们开始引入显式的、独立寻址且可持久化的记忆机制(例如在推理阶段可更新的参数模块)。
正如作者在文中所指出的:记忆,正在从单纯的计算副产品,跃升为大模型架构设计的第一性维度。

△
面对海量且碎片化的架构创新(如注意力缓存、循环状态、测试时自适应、检索模块、条件参数路由等),本综述提出了一个统一的三维架构级分类框架,以此理清不同记忆机制的边界与共性:

△
表示形式(Representation):隐式vs.显式
隐式记忆(Implicit): 与模型前向计算深度绑定,无独立控制接口(如注意力机制的KV Cache、RNN/SSM的隐藏状态)。
显式记忆(Explicit): 具备独立的存储组件与明确的读写语义,不局限于标准的前向计算流程(如外部Datastore、测试时可更新参数、记忆槽等)。
更新机制(Update Dynamics):离线vs.在线
离线(Offline): 仅在训练阶段通过梯度更新(如预训练参数、传统的MoE)。
在线(Online): 支持在推理阶段动态更新,赋予模型在不重新微调的情况下吸收新知识的能力(如Titans的惊奇驱动更新、TTT)。
持久性(Persistence):短期vs.长期
短期(Short-Term): 随局部上下文窗口或推理会话结束而消散(如Attention)。
长期(Long-Term): 信息或其影响力能够跨越局部上下文、甚至跨越独立会话持续存在。

△
在统一的分类学下,作者以表示形式为切入点,对目前主流的两大阵营进行了深度技术拆解:
隐式记忆:计算流中的“过客”(Implicit Memory)
隐式记忆虽然效率极高,但其本质是“计算绑定的瞬时态”。
注意力机制: 作为内容寻址的点状瞬时工作记忆,虽然通过稀疏注意力(Sparse Attention)或滑动窗口(如StreamingLLM)缓解了计算开销,但其容量仍受限于短期存储。
循环序列记忆(Recurrent Memory): 包括Mamba等SSM架构以及RWKV、Gated DeltaNet等线性注意力模型。它们将历史信息压缩为结构化的隐状态(Hidden States)。近期的演进方向(如
瓶颈与局限: 隐式记忆的容量受到隐藏层维度和窗口的硬性限制,通常缺乏独立可控的读写语义。

△
这是当前最前沿的研究热点,旨在赋予LLM更长久的生命力和自适应能力:
参数化记忆模块: 如Titans和TTT-E2E,将记忆固化在特定的参数块中,并在推理时 (Test-Time) 执行高频更新。这种将“上下文存储”与“通用知识主干”解耦的设计,大幅缓解了长程灾难性遗忘。
基于查找的记忆(Lookup-based): 如Engram和kNN-LM。信息被存在非参数化的槽位或数据库中,推理时通过稀疏路由检索。这种方式极大拓宽了模型的容量上限,摆脱了密集的计算开销。
条件参数记忆(MoE): Mixtral等MoE架构本质上也是一种显式记忆的变体——通过Router在参数空间中进行依赖上下文的检索寻址。

△
正如前文所见,没有任何单一的记忆范式能解决所有问题:Attention召回率高但极度消耗显存;SSM计算高效但可能损失细粒度信息;参数化记忆自适应强但面临优化漂移。
因此,混合记忆架构(Hybrid Memory Architectures)正在成为主流。
一些更为人熟知的大模型已经采用了这一路线:例如
更前沿的方向是自适应记忆路由:例如,AMOR根据模型的不确定性决定何时启用高成本的Attention精炼;HAM则利用预测误差判断哪些Token值得进入高保真的稀疏KV Cache,其余信息由高压缩率的循环状态处理。
不过,融合多种记忆并不等于简单叠加模块。该领域仍面临几项关键挑战:
写什么、何时写: 惊奇度、熵或预测误差不一定能够准确衡量信息的长期价值;当前看似无关的Token,可能在很久之后才变得关键。
稳定性与可塑性的平衡: 测试时参数更新能够快速吸收新信息,却也可能带来记忆漂移、旧知识干扰和错误累积。如何实现可靠的写入、遗忘与必要时的回滚,仍缺少成熟方案。
容量、精度与系统成本: 高保真KV存储会持续消耗显存和带宽,而固定大小的循环状态又可能过度压缩历史。PagedAttention、KV Cache量化与内存整合需要与模型结构协同设计。
如何真正衡量“记得好”: 长上下文长度并不等同于有效记忆。除RULER、LongBench等长程测试外,未来评测还需区分召回与推理,并衡量持久性、抗干扰性、更新一致性及计算效率。
记忆架构的研究正越发受到关注和重视。在文章的最后,研究团队为未来的工作提出了几个启发性的方向:
大一统的记忆理论: 建立一个能用统一的信息压缩和状态转换视角来量化Attention、SSM与检索机制的理论框架。
终身参数化记忆(Lifelong Parametric Memory): 突破TTT的短期适应性,让模型实现无需全量微调的长期稳定增量学习。
自适应的记忆分配: 摒弃静态的架构设计,引入可学习的控制器,动态决定信息的存储介质 (Cache还是State) 与持久化级别。
算法-硬件协同设计: 随着上下文延伸至百万级Token,记忆的读取与写入必须与GPU内存层次结构进行深度协同。
从“被动遗忘”到“主动掌控”,大模型的记忆机制正在重塑AI的计算边界。无论你是专注于底层Kernel优化的系统工程师,还是致力于探索下一代模型架构的研究人员,这篇综述都将为你提供一份理论地图。
论文链接:https://arxiv.org/abs/2607.25380
