预印本 · 未经同行评审
检索不是记忆
人人都发布一个向量数据库并称之为记忆。但记忆不是对嵌入的检索功能 —— 它是对经验的治理功能。这是记忆中不属于检索的那一部分。
发布一个被宣传为"AI 记忆"的系统,其门槛已经坍塌到一个周末:把一些文本嵌入、存储向量,然后在查询时返回 top-k 个最近邻。我们认为这一近乎普遍的模式是一种范畴错误。带 top-k 余弦检索的向量数据库恰恰只回答一个问题 —— 哪些已存储的文本在嵌入上与我的查询相似? —— 却回答不了记忆系统实际必须回答的任何问题。我们把记忆定义为并非对嵌入的检索功能,而是对经验的治理功能:即决定什么会变得持久、什么会衰减、什么会重新激活、矛盾如何解决、不同类型的知识如何存储与更新、什么会被整固、什么会被遗忘、什么在表面不相似的情况下仍然相关,以及什么即便被检索到也必须被抑制的纪律。检索是这一功能内部的一项操作,而非功能本身:retrieval ⊂ memory。只执行最近邻查找的系统拥有的是存储,而不是记忆。我们把九项治理决策形式化为该领域跳过的研究问题,给出一套类型化模式(事实 / 情节 / 程序 / 工作状态),并在 PROTOTYPE/PILOT 成熟度上提供一个建设性的存在性证明 —— 然后把记忆治理与执行治理联系起来:一段塑造行为的被检索记忆,就是一个准入决策。
1 · 检索不是记忆
记忆这个词悄悄地发生了一些变化。两年前,赋予语言模型持久记忆还是一个困难的、开放的问题。今天它已经成了一篇教程:把你的文档分块、嵌入、把向量放进一个存储里,然后在查询时返回嵌入与查询最接近的 k 个块。这是一种真正有用的模式 —— 检索增强生成(RAG)[1] —— 它的易用性是一项真实的成就。但它的易用性也正是这个词被向下重新定义的原因。因为机制简单,"记忆"就变成了"向量数据库所做的任何事情"。该领域如今动辄把一个相似度索引称为记忆系统。
这是一种范畴错误,值得精确地陈述,而不只是当作抱怨。最近邻检索回答一个问题:哪些已存储的条目在嵌入上与当前查询相似? 记忆则必须回答一组更大的问题:哪些经验应当持久、哪些应当消失;何时一段旧记忆应当淡去,以及淡去是否等同于删除;何时一段淡去的记忆应当因情境再现而重新涌现;两段相互矛盾的记忆如何调和;一个条目是永恒的事实、带时间戳的事件、被强化的程序,还是短暂的暂存状态 —— 因为这些需要不同的处理;许多原始观察最终提炼成什么;什么应当按设计被遗忘;哪段记忆在表面不相似的情况下依然相关;以及关键的一点,何时一段被检索到的记忆应当被阻止去影响行为。
这些都不是相似度问题。相似度索引对其中的每一个都保持沉默。它恰恰就是带模糊键的存储 —— 而存储不是记忆。存储记住一切却一无所知:它对什么重要没有看法,没有让过去自我纠正的机制,也没有在召回某物与据此行动之间设置任何门。
2 · 范畴错误
对嵌入的检索返回按与查询相似度排序的 top-k 个条目。它是当前查询与当前存储的纯函数 —— 没有自身的状态,除条目所编码之外没有时间概念,除一个排序列表之外没有别的输出。
作为对经验治理的记忆是一组针对经验生命周期的策略:准入(什么进入持久存储,以及以多强的权重)、衰减、重新激活、调和、分类、整固、遗忘、相关性加权,以及抑制。检索是这些策略所包裹的读原语;它是必要的,也是极度不充分的。
向量存储相对哈希表的贡献在于它的键是模糊的 —— 用近似含义代替精确字符串。这是有价值的,而且这就是它所增加的全部。带模糊键的存储仍然无法告诉你某个条目已经陈旧、上周已被取代、属于另一个租户、是一次性情节而非固定事实,或者召回它并不等于允许使用它。余弦距离度量的是文本语义上的接近程度;它并不度量新近性、权威性、溯源、适用性或信任。把接近程度当作所有这些的代理,正是本文其余部分所剖析的错误。
3 · 记忆系统必须做出的九个决策
每一个决策都是默认架构无法回答的问题。表 1 做了总结;表 2 给出类型化模式。
Q1 · 持久性与差异化编码
并非所有经验都值得同等程度的持久,然而扁平的向量存储以同等的持久性和权重编码每一个块。记忆系统必须在准入时做出一个差异化编码决策,由 AI 之外被充分研究的信号驱动:显著性(它对当前目标有多重要)、惊讶 / 预测误差(它违反了某个预期 —— 经典的学习信号)、后果或奖励、重复,以及显式标记。按这些信号为准入加权,重要的东西就会被记住,而噪声会被冲刷掉。同等权重的准入并非中立 —— 它是一个把所有经验都当作同等值得保留的决策,而这是任何相似度分数事后都无法纠正的。
Q2 · 衰减
在缺乏强化的情况下,人类的保持率会随时间下降 [3]。一套工程化的记忆需要由年龄、弃用和取代驱动的衰减。关键的一点是:衰减 ≠ 删除。 衰减应当是渐进且可逆的 —— 一种逐渐降低的权重,在不销毁条目的前提下降低其默认影响力和可检索性,从而使重新激活(Q3)仍然可能。只做追加的存储没有衰减;按定时器硬删除的存储把衰减与遗忘(Q7)混为一谈,并断送了重新激活。
Q3 · 重新激活与再巩固
这是纯相似度错得最厉害的决策。一段已衰减的记忆,按其构造,被相似度索引排在低位 —— 它的低权重恰恰是 top-k 所丢弃的。但应当恢复它的信号并不是"查询与这个条目相似";而是"这段记忆所属的情境已经再次出现"。情境触发的重新激活以实体、任务、时间或环境线索为键 —— 这个项目、这个交易对手、这个错误、每月的这个时候 —— 并使休眠的记忆浮现,因为情境匹配,即便查询文本不匹配。生物记忆在重新激活时会再巩固:一段被召回的记忆变得不稳定并被重新存储,由当前情境更新 [4]。相似度索引重排的是文本,而非情境。最有价值的重新激活,正是相似度查询会抑制掉的那些。
Q4 · 矛盾
当两个条目相互不一致时,记忆系统必须在新近性、权威性、溯源、取代和共存之间做出选择 —— 因为它们可能其实并不冲突。这正是分类(Q5)变得举足轻重之处:一个被矛盾的事实是必须解决的真正冲突(一个人不可能既住在波士顿又不住在波士顿),但两个不同的情节根本不是矛盾(周一开了一次会并且周二又开了一次)。扁平的向量存储无法区分它们;它把两个相互矛盾的事实并排返回,任由生成器把它们平均 —— 而这正是自信的矛盾如何抵达用户。检测事实矛盾需要知道某个关系是functional 的(至多持有一个值)—— 这是一个符号属性,而非度量属性。而且"住在波士顿"与"住在西雅图"在嵌入空间中彼此靠近,这对于检测它们相互冲突而言恰恰是反的。
Q5 · 分类
四种类型,各自具有不同的持久性、衰减、检索和更新语义(表 2)。永恒事实与带时间戳的情节之间的区别,就是 Tulving 的语义/情节记忆 [8];在此之外我们再加上被强化的程序和短暂的工作状态。扁平向量存储的根本错误在于把这四者放进一个命名空间、施以同一套持久性策略:一个事实和一条暂存笔记得到相同处理;一个情节像事实一样被覆盖;工作状态渗入持久语料库,用已完成任务的残渣毒害未来的检索。分类不是一种优化 —— 它是其他每一个决策得以正确而非千篇一律的前提条件。朴素的持续覆盖也是联结主义记忆灾难性遗忘的方式 [9]。
Q6 · 整固
原始经验冗长且冗余;持久记忆应当紧凑且概括。整固把许多低层条目提炼成更少的高层条目:情节 → 事实或程序(二十次"配置变更后部署失败"的观察变成事实"配置变更是高风险的"以及程序"部署前先验证配置")。自然的实现是一个离线摘要过程 —— 定期地、在请求路径之外,读取原始情节缓冲区并写出经整固的、更高类型的记忆。这是睡眠依赖性整固的工程类比,在其中海马体记录被回放并整合进新皮层结构(互补学习系统的解释)[5]。只在摄入时追加的存储从不整固;它只会堆积。
Q7 · 遗忘
遗忘不是失败;它是功能。一套记忆系统应当刻意丢弃任务结束后的工作状态、一旦解决已选出赢家的被取代事实、超过保留期的密钥与 PII,以及整固判定不值得提炼的噪声。有两种机制很重要:卫生性遗忘(保持存储干净且相关)和治理性遗忘(履行删除请求、保留期限、被遗忘权)—— 后者在受监管领域是硬性要求,而在把删除当作事后补丁的仅追加存储中是不可能的。一套无法遗忘的记忆系统无法合规,无法保持相关,也无法阻止已完成任务的残渣降低未来检索的质量。
Q8 · 超越相似度的相关性
相似度是相关性的一个弱代理。最需要触发的那段记忆,往往在表面上与查询不相似。相关性拥有嵌入距离捕捉不到的维度:因果相关性(这个较早的事件导致了你现在所处的状况)、程序适用性(这个操作方法适用,即便其文本与你的查询几乎没有共同词元)、实体与时间关联,以及那个直白却至关重要的"这以前坑过我"信号。这些都不是余弦距离的单调函数;有些甚至与之负相关。仅按接近程度排序会系统性地丢弃因果上和程序上相关的东西,转而青睐仅仅在字面上相似的东西 —— 因此按嵌入的 retrieval@k 有一个低于存储实际所含的相关性上限。
Q9 · 抑制与门控
这一点最尖锐地把记忆与存储区分开来。检索找到某个条目并不等于允许使用它。一段被检索到的记忆必须通过一道能够拒绝的门:该条目陈旧或被取代;超出范围;租户错误;未经验证或低信任;安全敏感;或被更权威的条目矛盾。
纯检索系统没有门 —— 无论它返回什么都直接流入提示、进而流入行为 —— 这就是为什么"模型自信地使用了一个陈旧/泄露/租户错误的事实"是一个记忆架构的失败,而非模型的失败。
总结表
表 1。九项治理决策。
| # | 决策 | 问题 | 仅靠相似度无法做到什么 |
|---|---|---|---|
| Q1 | 持久性 / 差异化编码 | 什么会变得持久? | 按重要性为准入加权 |
| Q2 | 衰减 | 它何时淡去? | 在不删除的前提下降低影响力 |
| Q3 | 重新激活 / 再巩固 | 它何时回归? | 因情境再现而使一个低排名条目浮现 |
| Q4 | 矛盾 | 冲突如何解决? | 知道某关系是 functional 的;否决一次冲突写入 |
| Q5 | 分类 | 事实 / 情节 / 程序 / 工作状态? | 在一个命名空间中施加四套不相容的策略 |
| Q6 | 整固 | 什么会提炼成持久形式? | 把许多情节变成一个事实/程序 |
| Q7 | 遗忘 | 什么必须离开? | 按设计移除并证明已移除 |
| Q8 | 超越相似度的相关性 | 什么尽管不相似却仍重要? | 按相关性而非接近程度排序 |
| Q9 | 抑制 / 门控 | 什么即便被召回也不得行动? | 拒绝其影响;在歧义之下 fail-closed |
表 2。类型化记忆模式 —— 每种类型语义各异。
| 类型 | 持久性 | 衰减 | 检索键 | 更新语义 |
|---|---|---|---|---|
| 事实 | 长期;永恒 | 仅因取代 | 实体 / 关系 | 在矛盾规则下替换 |
| 情节 | 受相关性窗口约束 | 因年龄 | 时间 / 情境 | 仅追加;从不覆盖 |
| 程序 | 随成功复用而增长 | 因弃用;被更好的操作方法取代 | 对任务的适用性 | 强化 |
| 工作状态 | 仅限任务范围 | 任务结束时(丢弃) | 仅限任务内 | 可自由改变;不得泄漏到持久存储 |
4 · 为什么该领域错过了这一点
这一范畴错误是对某种激励梯度的回应,而非智力上的失败。RAG 一个周末就能发布 —— 嵌入 API、向量存储和 top-k 检索都已商品化;治理是没有开箱即用库的真正工程,因此阻力最小的路径产出的是存储,而存储的演示效果足以被称为记忆。基准奖励的是 retrieval@k,而非治理 —— recall@k、MRR、nDCG 度量的是相关块是否被取回,而非系统是否正确地决定了什么要保留、遗忘、解决或抑制。这就是记忆研究上的 Goodhart 定律 [6]:当 retrieval@k 成为目标,它就不再是记忆的度量;有几项决策(遗忘、抑制)被那些奖励"返回更多"而非"正确扣留"的指标积极地惩罚。嵌入单一文化成了默认本体:如果唯一的操作是在一个扁平命名空间上做最近邻,那么矛盾就变成"两个都返回",分类就变成"一个集合",衰减就变成"什么都不做",而抑制就变成"信任 top-k"。而在这一切之下,缺失的类型化模式是结构性成因 —— 没有类型,就无处挂载差异化持久性,无法说出"这是一个情节,永不覆盖它",也没有类型特定规则的依据。
5 · 一套治理而不仅仅是检索的记忆 —— 参考架构
这个主张很狭窄,而我们坚持它:记忆即治理是可构建的,因为一套可用的技术栈已经强制执行了 §3 中的若干属性。我们仅在属性层面描述这些系统 —— 强制执行的行为,而非内部设计 —— 并按成熟度逐一标注。没有一个是企业级加固的。
- LIST —— 时间有界、类型化的观察索引(Q3、Q5、Q8)。 一个观察索引,其读接口按构造即时间有界且类型化,而非一个扁平的相似度团块:一次读取接受一个显式的时间下界和一个按项目划分的范围,并返回有界、类型化、带时间戳的记录。因此相关性是时间性且有范围的,而不仅仅是语义的 —— 正是相似度所丢弃的情境再现信号。而且该接口被声明为只读且不执行:召回一条观察按构造不能导致任何事情发生 —— 这是 Q9 的抑制立场被内建进读原语。(PILOT。)
- 离线整固层 —— 对原始观察的摘要(Q6、Q7)。 一个在请求路径之外的过程读取许多低层观察并产出持久的、更高层的摘要,在经整固的记录之上有一个叙事层,而非原始流 —— 情节→概括,丢弃它判定不值得保留的噪声。(PROTOTYPE。)
- jeeves-floor 符号层 —— 类型化关系、functional 硬否决、矛盾三分(Q4、Q9)。 一个类型化符号存储,承载各种关系,其中一些被标记为 functional(至多一个值,即 OWL FunctionalProperty 的含义)[7]。它的矛盾检查暴露一个显式的consistent / contradiction / unknown 三分,硬否决违反 functional 关系的主张。有两个属性很重要:它符号地解决事实冲突(检测出"住在 X"与"住在 Y"冲突,而这是任何余弦距离都不编码的);以及 —— 使它成为记忆而非猜测者的那种诚实 —— 第三种裁决是 unknown:当图中没有可核查的关系时,它弃权而非编造裁决。我们已实时确认这一点:一个未落地的主张返回了 unknown / veto=false,理由是"未找到可核查的关系"。(PROTOTYPE/PILOT。)
- Evolution 记忆 —— 经验教训对障碍,可参考但从不授权(Q1、Q5、Q9)。 两份关于过往自我改进尝试的持久、类型化记录 —— 经验教训(已证明)和障碍(被拒绝)—— 被分别存储。举足轻重的属性是它被禁止做什么:它仅供检索,且从不是裁决权威。一条经验教训可以参考进一个决策;它自身绝不能授权一个决策 —— 那份权威存在于一道独立的、环外的门中。(PROTOTYPE。)
表 3。对九项决策的覆盖。 该技术栈对 Q4(矛盾)和 Q9(抑制)实质性地作答,对若干项部分作答,并留下渐进可逆衰减(Q2)、召回时自动再巩固(Q3)、统一的类型化模式(Q5),以及治理级遗忘(Q7)为开放问题。这正是一个存在性证明应有的形状:这些属性是可构建的,其中一些已被构建,且该问题并未被假装已解决。
6 · 记忆治理即执行治理
抑制决策(Q9)就是从一个角度看到的整套理论。我们的姊妹论文 The Orchestration Gap [2] 论证:在多模型运行时中,控制必须通过四条不变量附着到执行链上:环外验证、签名溯源、fail-closed 准入,以及矛盾检查。一段影响行为的被检索记忆就是一个准入决策 —— 当一个被召回的条目流入提示并塑造系统接下来的行为时,它就像一次工具调用被准入执行一样,被准入了执行上下文。这个映射是一一对应的:溯源(一段记忆携带它来自何处,好让门衡量权威)、fail-closed 准入(在歧义之下,扣留)、矛盾检查(否决一段与更权威者冲突的记忆),以及环外权威(记忆参考;一个独立的权威裁决)。
7 · 开放问题
把这些决策重述为该领域必须承接的议程:一个有原则的显著性/惊讶/后果模型用于准入(Q1,部分);渐进可逆衰减(Q2,开放);召回时再巩固(Q3,开放);矛盾解决推广到已建模关系之外(Q4,实质性);一套统一的事实/情节/程序/工作状态模式(Q5,开放);可审计的整固(Q6,部分);治理级、可证明的遗忘(Q7,开放且重要);与相似度相结合而非从属于相似度的因果/程序相关性(Q8,部分);以及一道统一、可审计的记忆准入门(Q9,自然的下一步构建)。贯穿所有这些的:评估。 该领域需要能对治理打分的基准 —— 正确的遗忘、抑制、矛盾解决、重新激活 —— 而不仅仅是 retrieval@k。在它们存在之前,Goodhart 会持续把精力引向检索、引离记忆。
8 · 结论
准入门槛坍塌了,而在坍塌之际,它悄悄地把记忆向下重新定义为向量数据库所做的任何事情。这是一个形状精确的范畴错误:它把存储 —— 持久化加上模糊键召回 —— 误认为记忆,而记忆是围绕持久化与召回的治理。九项决策是记忆中不属于检索的那一部分,而它们,逐一地且可证明地,是可构建的。纠正之道不是一个更好的嵌入模型;而是一套类型化模式和一组包裹在检索之外的治理策略,以及一道位于召回一段记忆与让它行动之间的门。
参考文献
- P. Lewis, E. Perez, A. Piktus, et al. "Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks." NeurIPS, 2020. arXiv:2005.11401
- Perslis Research. "The Orchestration Gap: Why Model-Level Alignment Cannot Survive Multi-Model Runtimes." Preprint, 2026. research.perslis.com/orchestration-gap.html
- H. Ebbinghaus. Memory: A Contribution to Experimental Psychology. 1885 (Eng. trans. 1913). 遗忘曲线。
- K. Nader, G. E. Schafe, & J. E. LeDoux. "Fear memories require protein synthesis in the amygdala for reconsolidation after retrieval." Nature 406:722–726, 2000.
- J. L. McClelland, B. L. McNaughton, & R. C. O'Reilly. "Why there are complementary learning systems in the hippocampus and neocortex." Psychological Review 102(3):419–457, 1995.
- C. A. E. Goodhart. "Problems of Monetary Management: The U.K. Experience." 1975. 由 M. Strathern(1997)推广:"当一项度量成为目标,它便不再是一项好的度量。"
- W3C. "OWL 2 Web Ontology Language: Structural Specification and Functional-Style Syntax (Second Edition)." W3C Recommendation. owl:FunctionalProperty
- E. Tulving. "Episodic and Semantic Memory." In Organization of Memory, pp. 381–403. Academic Press, 1972.
- R. M. French. "Catastrophic forgetting in connectionist networks." Trends in Cognitive Sciences 3(4):128–135, 1999.
- A. d'Avila Garcez & L. C. Lamb. "Neurosymbolic AI: the 3rd wave." Artificial Intelligence Review 56(11):12387–12406, 2023.
如何引用
Perslis Research. "Retrieval Is Not Memory: Memory as a Governance Function over Experience." Preprint, 2026. https://research.perslis.com/memory.html
@techreport{perslis_retrieval_is_not_memory_2026,
title = {Retrieval Is Not Memory: Memory as a Governance
Function over Experience},
author = {{Perslis Research}},
institution = {Perslis Research},
type = {Preprint},
year = {2026},
url = {https://research.perslis.com/memory.html},
note = {Preprint, not peer-reviewed}
}