预印本 · 未经同行评审

检索不是记忆

人人都发布一个向量数据库并称之为记忆。但记忆不是对嵌入的检索功能 —— 它是对经验的治理功能。这是记忆中不属于检索的那一部分。

↓ 下载论文(PDF) 已排版 · 与本页面同源可信
预印本 · 工作草稿 论点:记忆即治理 参考技术栈:PROTOTYPE / PILOT
摘要

发布一个被宣传为"AI 记忆"的系统,其门槛已经坍塌到一个周末:把一些文本嵌入、存储向量,然后在查询时返回 top-k 个最近邻。我们认为这一近乎普遍的模式是一种范畴错误。带 top-k 余弦检索的向量数据库恰恰只回答一个问题 —— 哪些已存储的文本在嵌入上与我的查询相似? —— 却回答不了记忆系统实际必须回答的任何问题。我们把记忆定义为并非对嵌入的检索功能,而是对经验的治理功能:即决定什么会变得持久、什么会衰减、什么会重新激活、矛盾如何解决、不同类型的知识如何存储与更新、什么会被整固、什么会被遗忘、什么在表面不相似的情况下仍然相关,以及什么即便被检索到也必须被抑制的纪律。检索是这一功能内部的一项操作,而非功能本身:retrieval ⊂ memory。只执行最近邻查找的系统拥有的是存储,而不是记忆。我们把九项治理决策形式化为该领域跳过的研究问题,给出一套类型化模式(事实 / 情节 / 程序 / 工作状态),并在 PROTOTYPE/PILOT 成熟度上提供一个建设性的存在性证明 —— 然后把记忆治理与执行治理联系起来:一段塑造行为的被检索记忆,就是一个准入决策。

这是一份为征求反馈而流传的早期技术预印本 —— 未经同行评审。核心命题是设计层面的分解,而非已证明的定理。§5 中的参考系统被标注为 PROTOTYPE/PILOT,且仅在属性层面进行描述。

1 · 检索不是记忆

记忆这个词悄悄地发生了一些变化。两年前,赋予语言模型持久记忆还是一个困难的、开放的问题。今天它已经成了一篇教程:把你的文档分块、嵌入、把向量放进一个存储里,然后在查询时返回嵌入与查询最接近的 k 个块。这是一种真正有用的模式 —— 检索增强生成(RAG)[1] —— 它的易用性是一项真实的成就。但它的易用性也正是这个词被向下重新定义的原因。因为机制简单,"记忆"就变成了"向量数据库所做的任何事情"。该领域如今动辄把一个相似度索引称为记忆系统。

这是一种范畴错误,值得精确地陈述,而不只是当作抱怨。最近邻检索回答一个问题:哪些已存储的条目在嵌入上与当前查询相似? 记忆则必须回答一组更大的问题:哪些经验应当持久、哪些应当消失;何时一段旧记忆应当淡去,以及淡去是否等同于删除;何时一段淡去的记忆应当因情境再现而重新涌现;两段相互矛盾的记忆如何调和;一个条目是永恒的事实、带时间戳的事件、被强化的程序,还是短暂的暂存状态 —— 因为这些需要不同的处理;许多原始观察最终提炼成什么;什么应当按设计被遗忘;哪段记忆在表面不相似的情况下依然相关;以及关键的一点,何时一段被检索到的记忆应当被阻止去影响行为。

这些都不是相似度问题。相似度索引对其中的每一个都保持沉默。它恰恰就是带模糊键的存储 —— 而存储不是记忆。存储记住一切却一无所知:它对什么重要没有看法,没有让过去自我纠正的机制,也没有在召回某物与据此行动之间设置任何门。

论点。 记忆不是对嵌入的检索功能;它是对经验的治理功能。检索是记忆内部的一项操作,而非记忆本身 —— 即包含关系 retrieval ⊂ memory。

2 · 范畴错误

对嵌入的检索返回按与查询相似度排序的 top-k 个条目。它是当前查询与当前存储的纯函数 —— 没有自身的状态,除条目所编码之外没有时间概念,除一个排序列表之外没有别的输出。

作为对经验治理的记忆是一组针对经验生命周期的策略:准入(什么进入持久存储,以及以多强的权重)、衰减、重新激活、调和、分类、整固、遗忘、相关性加权,以及抑制。检索是这些策略所包裹的读原语;它是必要的,也是极度不充分的。

命题 1(包含)。 retrieval ⊂ memory。每一项治理策略要么产生检索所读取的存储,要么约束检索可以返回什么,要么在检索的输出付诸行动之前将其覆盖。只提供相似度检索的系统实现的是记忆的一个真子集;我们称之为存储。

向量存储相对哈希表的贡献在于它的键是模糊的 —— 用近似含义代替精确字符串。这是有价值的,而且这就是它所增加的全部。带模糊键的存储仍然无法告诉你某个条目已经陈旧、上周已被取代、属于另一个租户、是一次性情节而非固定事实,或者召回它并不等于允许使用它。余弦距离度量的是文本语义上的接近程度;它并不度量新近性、权威性、溯源、适用性或信任。把接近程度当作所有这些的代理,正是本文其余部分所剖析的错误。

3 · 记忆系统必须做出的九个决策

每一个决策都是默认架构无法回答的问题。表 1 做了总结;表 2 给出类型化模式。

Q1 · 持久性与差异化编码

为什么经验 A 应当变得持久,而经验 B 应当消失?

并非所有经验都值得同等程度的持久,然而扁平的向量存储以同等的持久性和权重编码每一个块。记忆系统必须在准入时做出一个差异化编码决策,由 AI 之外被充分研究的信号驱动:显著性(它对当前目标有多重要)、惊讶 / 预测误差(它违反了某个预期 —— 经典的学习信号)、后果或奖励、重复,以及显式标记。按这些信号为准入加权,重要的东西就会被记住,而噪声会被冲刷掉。同等权重的准入并非中立 —— 它是一个把所有经验都当作同等值得保留的决策,而这是任何相似度分数事后都无法纠正的。

Q2 · 衰减

一段旧记忆何时应当衰减 —— 而衰减是否等同于删除?

在缺乏强化的情况下,人类的保持率会随时间下降 [3]。一套工程化的记忆需要由年龄、弃用和取代驱动的衰减。关键的一点是:衰减 ≠ 删除。 衰减应当是渐进且可逆的 —— 一种逐渐降低的权重,在不销毁条目的前提下降低其默认影响力和可检索性,从而使重新激活(Q3)仍然可能。只做追加的存储没有衰减;按定时器硬删除的存储把衰减与遗忘(Q7)混为一谈,并断送了重新激活。

Q3 · 重新激活与再巩固

一段已衰减的记忆何时应当因某个反复出现的情境回归而重新变得重要?

这是纯相似度错得最厉害的决策。一段已衰减的记忆,按其构造,被相似度索引排在低位 —— 它的低权重恰恰是 top-k 所丢弃的。但应当恢复它的信号并不是"查询与这个条目相似";而是"这段记忆所属的情境已经再次出现"。情境触发的重新激活以实体、任务、时间或环境线索为键 —— 这个项目、这个交易对手、这个错误、每月的这个时候 —— 并使休眠的记忆浮现,因为情境匹配,即便查询文本不匹配。生物记忆在重新激活时会再巩固:一段被召回的记忆变得不稳定并被重新存储,由当前情境更新 [4]。相似度索引重排的是文本,而非情境。最有价值的重新激活,正是相似度查询会抑制掉的那些。

Q4 · 矛盾

相互矛盾的记忆应当如何相互作用?

当两个条目相互不一致时,记忆系统必须在新近性、权威性、溯源、取代和共存之间做出选择 —— 因为它们可能其实并不冲突。这正是分类(Q5)变得举足轻重之处:一个被矛盾的事实是必须解决的真正冲突(一个人不可能既住在波士顿又不住在波士顿),但两个不同的情节根本不是矛盾(周一开了一次会并且周二又开了一次)。扁平的向量存储无法区分它们;它把两个相互矛盾的事实并排返回,任由生成器把它们平均 —— 而这正是自信的矛盾如何抵达用户。检测事实矛盾需要知道某个关系是functional 的(至多持有一个值)—— 这是一个符号属性,而非度量属性。而且"住在波士顿"与"住在西雅图"在嵌入空间中彼此靠近,这对于检测它们相互冲突而言恰恰是反的。

Q5 · 分类

事实、情节、程序与当前工作状态之间有什么区别 —— 以及为什么把它们混为一谈会毒害存储?

四种类型,各自具有不同的持久性、衰减、检索和更新语义(表 2)。永恒事实与带时间戳的情节之间的区别,就是 Tulving 的语义/情节记忆 [8];在此之外我们再加上被强化的程序和短暂的工作状态。扁平向量存储的根本错误在于把这四者放进一个命名空间、施以同一套持久性策略:一个事实和一条暂存笔记得到相同处理;一个情节像事实一样被覆盖;工作状态渗入持久语料库,用已完成任务的残渣毒害未来的检索。分类不是一种优化 —— 它是其他每一个决策得以正确而非千篇一律的前提条件。朴素的持续覆盖也是联结主义记忆灾难性遗忘的方式 [9]。

Q6 · 整固

什么会被整固,以及何时整固?

原始经验冗长且冗余;持久记忆应当紧凑且概括。整固把许多低层条目提炼成更少的高层条目:情节 → 事实或程序(二十次"配置变更后部署失败"的观察变成事实"配置变更是高风险的"以及程序"部署前先验证配置")。自然的实现是一个离线摘要过程 —— 定期地、在请求路径之外,读取原始情节缓冲区并写出经整固的、更高类型的记忆。这是睡眠依赖性整固的工程类比,在其中海马体记录被回放并整合进新皮层结构(互补学习系统的解释)[5]。只在摄入时追加的存储从不整固;它只会堆积。

Q7 · 遗忘

什么应当被遗忘 —— 作为一项设计出来的功能?

遗忘不是失败;它是功能。一套记忆系统应当刻意丢弃任务结束后的工作状态、一旦解决已选出赢家的被取代事实、超过保留期的密钥与 PII,以及整固判定不值得提炼的噪声。有两种机制很重要:卫生性遗忘(保持存储干净且相关)和治理性遗忘(履行删除请求、保留期限、被遗忘权)—— 后者在受监管领域是硬性要求,而在把删除当作事后补丁的仅追加存储中是不可能的。一套无法遗忘的记忆系统无法合规,无法保持相关,也无法阻止已完成任务的残渣降低未来检索的质量。

Q8 · 超越相似度的相关性

尽管嵌入相似度很差,哪些记忆仍应影响当前任务?

相似度是相关性的一个弱代理。最需要触发的那段记忆,往往在表面上与查询不相似。相关性拥有嵌入距离捕捉不到的维度:因果相关性(这个较早的事件导致了你现在所处的状况)、程序适用性(这个操作方法适用,即便其文本与你的查询几乎没有共同词元)、实体与时间关联,以及那个直白却至关重要的"这以前坑过我"信号。这些都不是余弦距离的单调函数;有些甚至与之负相关。仅按接近程度排序会系统性地丢弃因果上和程序上相关的东西,转而青睐仅仅在字面上相似的东西 —— 因此按嵌入的 retrieval@k 有一个低于存储实际所含的相关性上限。

Q9 · 抑制与门控

何时应当阻止一段被检索到的记忆去影响行为?

这一点最尖锐地把记忆与存储区分开来。检索找到某个条目并不等于允许使用它。一段被检索到的记忆必须通过一道能够拒绝的门:该条目陈旧或被取代;超出范围;租户错误;未经验证或低信任;安全敏感;或被更权威的条目矛盾。

命题 2(检索不是授权)。 某个条目可被检索并不意味着它可以影响行为。在召回与使用之间必须有一道门,其在歧义之下的默认行为是拒绝(fail-closed)。

纯检索系统没有门 —— 无论它返回什么都直接流入提示、进而流入行为 —— 这就是为什么"模型自信地使用了一个陈旧/泄露/租户错误的事实"是一个记忆架构的失败,而非模型的失败。

总结表

表 1。九项治理决策。

#决策问题仅靠相似度无法做到什么
Q1持久性 / 差异化编码什么会变得持久?按重要性为准入加权
Q2衰减它何时淡去?在不删除的前提下降低影响力
Q3重新激活 / 再巩固它何时回归?因情境再现而使一个低排名条目浮现
Q4矛盾冲突如何解决?知道某关系是 functional 的;否决一次冲突写入
Q5分类事实 / 情节 / 程序 / 工作状态?在一个命名空间中施加四套不相容的策略
Q6整固什么会提炼成持久形式?把许多情节变成一个事实/程序
Q7遗忘什么必须离开?按设计移除并证明已移除
Q8超越相似度的相关性什么尽管不相似却仍重要?按相关性而非接近程度排序
Q9抑制 / 门控什么即便被召回也不得行动?拒绝其影响;在歧义之下 fail-closed

表 2。类型化记忆模式 —— 每种类型语义各异。

类型持久性衰减检索键更新语义
事实长期;永恒仅因取代实体 / 关系在矛盾规则下替换
情节受相关性窗口约束因年龄时间 / 情境仅追加;从不覆盖
程序随成功复用而增长因弃用;被更好的操作方法取代对任务的适用性强化
工作状态仅限任务范围任务结束时(丢弃)仅限任务内可自由改变;不得泄漏到持久存储

4 · 为什么该领域错过了这一点

这一范畴错误是对某种激励梯度的回应,而非智力上的失败。RAG 一个周末就能发布 —— 嵌入 API、向量存储和 top-k 检索都已商品化;治理是没有开箱即用库的真正工程,因此阻力最小的路径产出的是存储,而存储的演示效果足以被称为记忆。基准奖励的是 retrieval@k,而非治理 —— recall@k、MRR、nDCG 度量的是相关块是否被取回,而非系统是否正确地决定了什么要保留、遗忘、解决或抑制。这就是记忆研究上的 Goodhart 定律 [6]:当 retrieval@k 成为目标,它就不再是记忆的度量;有几项决策(遗忘、抑制)被那些奖励"返回更多"而非"正确扣留"的指标积极地惩罚。嵌入单一文化成了默认本体:如果唯一的操作是在一个扁平命名空间上做最近邻,那么矛盾就变成"两个都返回",分类就变成"一个集合",衰减就变成"什么都不做",而抑制就变成"信任 top-k"。而在这一切之下,缺失的类型化模式是结构性成因 —— 没有类型,就无处挂载差异化持久性,无法说出"这是一个情节,永不覆盖它",也没有类型特定规则的依据。

5 · 一套治理而不仅仅是检索的记忆 —— 参考架构

这个主张很狭窄,而我们坚持它:记忆即治理是可构建的,因为一套可用的技术栈已经强制执行了 §3 中的若干属性。我们仅在属性层面描述这些系统 —— 强制执行的行为,而非内部设计 —— 并按成熟度逐一标注。没有一个是企业级加固的。

表 3。对九项决策的覆盖。 该技术栈对 Q4(矛盾)和 Q9(抑制)实质性地作答,对若干项部分作答,并留下渐进可逆衰减(Q2)、召回时自动再巩固(Q3)、统一的类型化模式(Q5),以及治理级遗忘(Q7)为开放问题。这正是一个存在性证明应有的形状:这些属性是可构建的,其中一些已被构建,且该问题并未被假装已解决。

6 · 记忆治理即执行治理

抑制决策(Q9)就是从一个角度看到的整套理论。我们的姊妹论文 The Orchestration Gap [2] 论证:在多模型运行时中,控制必须通过四条不变量附着到执行链上:环外验证、签名溯源、fail-closed 准入,以及矛盾检查。一段影响行为的被检索记忆就是一个准入决策 —— 当一个被召回的条目流入提示并塑造系统接下来的行为时,它就像一次工具调用被准入执行一样,被准入了执行上下文。这个映射是一一对应的:溯源(一段记忆携带它来自何处,好让门衡量权威)、fail-closed 准入(在歧义之下,扣留)、矛盾检查(否决一段与更权威者冲突的记忆),以及环外权威(记忆参考;一个独立的权威裁决)。

Q9 不是对准入门的类比 —— 它就是同一道门,应用于记忆。记忆治理与执行治理是同一个问题的两副面孔。

7 · 开放问题

把这些决策重述为该领域必须承接的议程:一个有原则的显著性/惊讶/后果模型用于准入(Q1,部分);渐进可逆衰减(Q2,开放);召回时再巩固(Q3,开放);矛盾解决推广到已建模关系之外(Q4,实质性);一套统一的事实/情节/程序/工作状态模式(Q5,开放);可审计的整固(Q6,部分);治理级、可证明的遗忘(Q7,开放且重要);与相似度相结合而非从属于相似度的因果/程序相关性(Q8,部分);以及一道统一、可审计的记忆准入门(Q9,自然的下一步构建)。贯穿所有这些的:评估。 该领域需要能对治理打分的基准 —— 正确的遗忘、抑制、矛盾解决、重新激活 —— 而不仅仅是 retrieval@k。在它们存在之前,Goodhart 会持续把精力引向检索、引离记忆。

8 · 结论

准入门槛坍塌了,而在坍塌之际,它悄悄地把记忆向下重新定义为向量数据库所做的任何事情。这是一个形状精确的范畴错误:它把存储 —— 持久化加上模糊键召回 —— 误认为记忆,而记忆是围绕持久化与召回的治理。九项决策是记忆中不属于检索的那一部分,而它们,逐一地且可证明地,是可构建的。纠正之道不是一个更好的嵌入模型;而是一套类型化模式和一组包裹在检索之外的治理策略,以及一道位于召回一段记忆与让它行动之间的门。

存储记住一切却一无所知。记忆是做决策的纪律。

参考文献

  1. P. Lewis, E. Perez, A. Piktus, et al. "Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks." NeurIPS, 2020. arXiv:2005.11401
  2. Perslis Research. "The Orchestration Gap: Why Model-Level Alignment Cannot Survive Multi-Model Runtimes." Preprint, 2026. research.perslis.com/orchestration-gap.html
  3. H. Ebbinghaus. Memory: A Contribution to Experimental Psychology. 1885 (Eng. trans. 1913). 遗忘曲线。
  4. K. Nader, G. E. Schafe, & J. E. LeDoux. "Fear memories require protein synthesis in the amygdala for reconsolidation after retrieval." Nature 406:722–726, 2000.
  5. J. L. McClelland, B. L. McNaughton, & R. C. O'Reilly. "Why there are complementary learning systems in the hippocampus and neocortex." Psychological Review 102(3):419–457, 1995.
  6. C. A. E. Goodhart. "Problems of Monetary Management: The U.K. Experience." 1975. 由 M. Strathern(1997)推广:"当一项度量成为目标,它便不再是一项好的度量。"
  7. W3C. "OWL 2 Web Ontology Language: Structural Specification and Functional-Style Syntax (Second Edition)." W3C Recommendation. owl:FunctionalProperty
  8. E. Tulving. "Episodic and Semantic Memory." In Organization of Memory, pp. 381–403. Academic Press, 1972.
  9. R. M. French. "Catastrophic forgetting in connectionist networks." Trends in Cognitive Sciences 3(4):128–135, 1999.
  10. A. d'Avila Garcez & L. C. Lamb. "Neurosymbolic AI: the 3rd wave." Artificial Intelligence Review 56(11):12387–12406, 2023.

如何引用

Perslis Research. "Retrieval Is Not Memory: Memory as a Governance Function over Experience." Preprint, 2026. https://research.perslis.com/memory.html

@techreport{perslis_retrieval_is_not_memory_2026,
  title       = {Retrieval Is Not Memory: Memory as a Governance
                 Function over Experience},
  author      = {{Perslis Research}},
  institution = {Perslis Research},
  type        = {Preprint},
  year        = {2026},
  url         = {https://research.perslis.com/memory.html},
  note        = {Preprint, not peer-reviewed}
}

预印本 · 未经同行评审 · Perslis Research · 2026-09-15 · 每一项主张都按其如何被赢得而标注。