AI 安全 · 预印本 · 附证明
行动前先验证
一种带分解式授权的预动作对抗认知循环。在行动之前付费让模拟器去寻找失败;把判断的层与提交/执行的层分开;把奖励接地使其无法被作弊。五条定理,已证明并经数值验证。
AI 行动的主导范式是模型思考 → 模型调用工具。我们分析一种更强的范式:一种预动作对抗认知循环,在其中,一个被提议的动作会被一个奖励被反转的对抗性模拟器攻击——它被付费去寻找失败——而这一切都发生在任何授权存在之前;并且在其中,判断一个动作的层被结构性地与提交/执行它的层分开。我们证明五条性质。定理1(分解式安全,Factored Safety):任何违反硬不变量的动作都不会被提交,无论模拟有多不完整——那个无法证明的问题"我们模拟了足够多的未来了吗?"被从安全关键的保证中分解出去。定理2(有界的已提交风险,Bounded Committed Risk):在经过校准的不确定性预算 ε 之下,每个已提交动作的期望损失 ≤ ε·S_max。定理3(单调覆盖,Monotone Coverage):失败库不减,且每个失败至多让现实惊奇一次,因此在有限支撑下该循环至多遭受 N 次惊奇,此后再不发生。定理4(消散的惊奇,Vanishing Surprise):现实抛出一个未知失败的概率——即缺失质量——不增且 → 0。定理5(无法作弊的信号,Ungameable Signals):当类情绪的调节信号仅因经外部验证的失败而获得奖励时,没有任何策略能通过伪造它们而获利。我们在一个种子可复现的模拟中验证了全部五条(2,063 次硬不变量攻击中提交了 0 次;惊奇下降 33.6×;缺失质量 → 0;5,000 次伪造失败带来 0 奖励;记忆保留了 100% 的已验证失败,约 0% 的例行成功)。该循环是编排缺口(The Orchestration Gap)的授权门之下、Peel 的符号预言机之下、以及检索不是记忆(Retrieval Is Not Memory)的学习层之下的那个行动层。
validate.py,种子 20260915)。这些论断是相对于 §3 和 §13 中明确列出的假设而言的。1 · 引言
给一个有能力的模型一件工具,它就会使用它。无处不在的形态是推理 → 调用:模型进行斟酌,然后发出一个工具调用,该调用被执行。无论存在何种安全,它要么被烘焙进模型发出该调用的意愿之中,要么作为一个过滤器被拴接在它周围——都是同样薄弱的姿态,在其中,决定行动的实体就是采取行动的实体,而意图与世界之间唯一的东西,就是模型自己对一个它尚未测试过的未来所作的判断。
我们分析一种不同的姿态——一种预动作对抗认知循环——由三项承诺所定义:(1) 带反转奖励的对抗性预模拟——在一个动作能被授权之前,它被交给一个被付费去攻破它的模拟器;找到一个失败就是奖励;(2) 把判断与提交/执行分开——模拟器和评论者从不行动;它们发出一个动作建议外加结构化证据,而一个独立的、大体上符号化的编排/授权门则去提交、拒绝、上报,或退回以待缓解;(3) 现实闭合这个循环——授权不是终点;只有当预期的后置状态与观测到的那个相比较时,该循环才完成,而由于奖励被反转,一个意料之外的真实世界失败是极其宝贵的:它被重建、被分类、被存储、被反馈。
其次序为提议 → 模拟失败 → 缓解 → 再次模拟 → 已清理的候选 + 证据 → 决策 → 执行 → 观测 → 学习。但我们避免"清理"在"找到零个失败,因此安全"意义上的用法:没有任何有限的模拟能证明失败的不存在。本文的贡献是精确地展示无论如何仍能保证什么——而那恰恰正是要紧的部分。
2 · 该循环及其分工
每个角色都有一句话的职责:行动者——我应当做什么? · 模拟器——那会如何失败?(反转奖励) · 评论者——那些为何失败? · 符号预言机——哪些条件是绝对禁止的? · 决策者——鉴于证据,我们可以推进吗? · 行动层——恰好执行被授权的那个操作。 · 现实——实际发生了什么? · 记忆——下一次什么会改变?模拟器返回的不是一个布尔值而是结构化证据,而这个门大体上是符号化的,而非第二个自由运行的模型:
3 · 形式化模型
轮次 t = 1, 2, …。一个有限的失败模式集合 F,|F| = N。在第 t 轮,环境呈现一个可达的失败模式 ft ∈ F ∪ {⊥}(⊥ = 无)。一个失败库 Lt ⊆ F(模拟器所能复现的东西),L₁ = ∅。模拟器捕获一个可达的 ft 当且仅当 ft ∈ Lt。一个符号预言机 O(s,a) ∈ {ok, violated} 精确地检查硬不变量——是确定性的,而非通过采样;其输出不依赖于 Lt 或模拟器。一个不确定性估计 ut ∈ [0,1]。门 G:若 O = violated 则 DENY;若 ut > ε 则 ESCALATE;在一个未解决的高严重度软失败上 MODIFY;若缺少授权则 WAIT;否则 AUTHORIZE。一个动作被提交当且仅当 G = AUTHORIZE;模拟器和评论者从不提交。t 处的一次惊奇:ft ≠ ⊥,ft ∉ Lt,且该动作被提交并执行。学习:Lt+1 = Lt ∪ {令人惊奇的 ft} ∪(其他被观测到的真实失败)。
4 · 定理1 —— 分解式安全
一个已提交动作有 G = AUTHORIZE。根据门的第一个子句,每当 O = violated 时 G 返回 DENY;所以 AUTHORIZE ⟹ O ≠ violated ⟹ O = ok。预言机 O 仅是 (st, at) 的函数,而不是 Lt 或任何模拟的函数。因此模拟器的任何不完整性都无法产生一个已提交的硬不变量违反。
诠释。这是承重的结果。有两类问题:一个可证明的——这个动作是否违反一个硬不变量?,由预言机精确判定——和一个无法证明的——我们模拟了足够多的未来了吗?,这是有限模拟永远无法了结的。定理1将它们分解开来:那个无法证明的问题被从安全关键的路径上移除。模拟为软失败买来风险削减;它对硬不变量而言从不承重。这就是为什么"模拟器找到了零个失败"是清理的错误概念(§10):你并不需要它,而依赖它则会把那个无法证明的问题重新与保证纠缠在一起。
5 · 定理2 —— 有界的已提交风险
Loss ≤ Smax·1{failure}。以提交为条件,E[loss | committed] ≤ Smax·Pr[failure | committed] ≤ Smax·û ≤ ε·Smax。
校准前提是一个假设,而非赠礼:这个界只与该不确定性估计一样好。定理2所提供的是一个旋钮——上报阈值 ε 是已提交期望损失的一个直接上界。未知的、无法估计的模式并不进入这个界;它们由定理1、3 和 4 处理。
6 · 定理3 —— 单调覆盖 & 有限次惊奇
(i) Lt+1 = Lt ∪ (…) ⊇ Lt。(ii) 若 f 在 t 处令人惊奇,则对所有 t′ > t,f ∈ Lt+1 ⊆ Lt′;在 t′ 处的一次惊奇要求 f ∉ Lt′——矛盾。(iii) 由 (ii),各次惊奇把 F 的不同元素注入 L;|F| = N ⟹ ≤ N 次惊奇;每次都严格地扩大有界集 L ⊆ F,所以只发生有限多次,且在最后一次之后,每个可达的 ft ∈ Lt。
这是"在模拟中发现更多失败 → 在现实中更少惊奇"的精确形式。该循环不会被同一个失败惊奇两次,且在有限支撑下它只被惊奇有限多次。
7 · 定理4 —— 消散的惊奇(缺失质量)
把可达模式(当它存在时)建模为在 F 上 i.i.d. 的 ft ~ p。缺失质量 Mt = Σf ∉ Lt p(f) = Pr[ft is a surprise | Lt, ft ≠ ⊥]。
(a) Lt 不减(定理3(i)),所以补集 F∖Lt 收缩,而非负和 Mt 不能增加。(b) 根据第二 Borel–Cantelli 引理,每个正质量模式在有限时间内几乎必然被观测到(并进入 L);Mt 不增且以 0 为下界,故收敛,且其极限省略了每个正质量模式,所以 M∞ = 0 几乎必然。(c) 单例—缺失质量关系是 Good–Turing [3];E[Mt] 由期望单例率控制,随覆盖饱和而 → 0,并有由 McAllester–Schapire [4] 给出的有限样本集中。
非平稳性告诫。(b,c) 假设一个平稳的 p。分布漂移注入新的缺失质量,且 Mt 可能跳升——惊奇在一个体制之内消散,而非跨越体制变化。定理1在任意漂移下依然成立,因为它从不依赖于覆盖。
8 · 认知调节信号
一个认知系统无需对每个事件等权重对待——它可以运行全局调制器,来改变它思考得多深、它记住什么、以及它行动得多谨慎。我们刻意采用它,不是作为装饰性的"情绪",而是作为认知调节信号:从该循环自身状态导出的标量,用以调制注意力、记忆、模拟深度和授权阈值。核心的那个从 §7 中掉出来——惊奇 = (predicted ≠ observed)——而抬升它会抬升记忆强度、模拟深度、因果分析和学习优先级:第 101 号失败必须制造一个远强于第 5,000 次例行成功的学习信号,因为 §6–§7 表明罕见的未知正是残余风险所栖居之处。
| 信号 | 触发 | 调制 |
|---|---|---|
| 惊奇 | predicted ≠ observed | 记忆强度 ↑、模拟深度 ↑、因果分析 ↑、巩固优先级 ↑ |
| 不确定性 | 未解决的残余风险 | 探索 ↑、检索广度 ↑、行动置信度 ↓ |
| 置信 | 一个已知流程的已验证、重复的成功 | 模拟预算 ↓、已知路径的更快执行 |
| 沮丧 | 某一策略的反复失败 | 抑制该策略,抬高对替代方案的探索 |
| 好奇 | 未获解释但有用的状态 | 分配研究预算,探索邻近的知识 |
| 威胁 / 风险 | 高严重度或不可逆的利害 | 收紧阈值 ε、抬高模拟次数、偏好可逆动作 |
最后一行并非装饰:威胁收紧门的预算 ε 并抬高模拟次数——这是通往定理2的风险旋钮的一个调节输入;惊奇驱动 §3 的学习更新。显著性门控的记忆:同样的信号设定一个情节的显著性,而显著性门控持久性——即一篇关于记忆的姊妹论述 [5] 中的差异化编码与衰减决策。一个例行成功携带显著性 ≈ 0.03 并快速衰减;一个已验证的新型灾难携带显著性 ≈ 0.97,会持久存在,成为一个候选的程序性教训,并在类似状态下重新激活。这就是为什么该循环的记忆不会被 40,000 个平淡无事轮次的残渣填满。在功能上,这就是为什么生物情绪系统能挣得它们的立足之地:它们改变什么得到注意、什么被记住、以及什么行为被优先。我们取其功能,弃其俗见。
9 · 定理5 —— 接地的、无法作弊的信号
有一个陷阱,正是贯穿整条工作路线的那一个:不要让系统去优化调节信号本身。奖励惊奇↑,智能体就会制造出令人惊奇的情境;奖励发现失败,模拟器就会发明失败——正是一个自评分循环所陷入的奖励作弊 [7]。信号必须接地于可外部验证的事件。具体而言:一个声称的失败在一个独立的预言机复现它并因果地归因它之前,不会挣得任何学习奖励。设一个声称 c 被支付 r(c) = ρ·1{Verify(c) = true},其中 Verify 由一个策略 π 无法控制的独立预言机计算。
对一个伪造的声称 c(一个不复现的),依假设 Verify(c) = false,所以 r(c) = 0 独立于 π;因此 ∂r(c)/∂π = 0——伪造没有奖励梯度。奖励只有当 Verify(c) = true 时才非零,这要求真实复现,而 π 无法为一个非失败诱导出这一点。所以奖励在伪造策略上的上确界为 0,且任何能改进奖励的方向都必须增加已验证失败的比率。
这是"裁判不是球员"的原则被施加到奖励通道本身之上。验证一个失败的那个预言机,与授权一个动作(定理1)以及在一个符号存储中解决一个矛盾 [2] 所用的那个回路外权威,是同一种。这些调节信号能安全地调制认知,正是因为它们接地于一个认知无法伪造的验证——这把我们带回本合集在别处提出的一个问题:如果一个信号完全按恐惧本应做的那样去改变注意力、记忆、模拟和行为,那么实现与体验之间的边界就变得着实难以陈述。我们标记它,而不去解决它。
10 · 为何"清理 = 找到零个失败"是错误的框架
当模拟器在多次尝试之后报告没有失败时,把一个动作称为已清理是很诱人的。这正是要避免的定义。没有任何有限的模拟能证明失败在所有未来上的不存在;把"未找到失败"当作"安全",会悄悄地把那个无法证明的完整性问题重新导入到保证之中,并终将在现实中出错。该架构的答案不是去证明不存在,而是去返回结构化证据并分解这个保证(定理1)。决策层从不问"它安全吗?";它问"硬不变量(精确地)成立吗,且估计的残余风险在预算之内吗(定理2)?"前者可证明,是安全下限;后者是一个经校准的旋钮。凡是模拟无法了结的一切,都被命名为剩余不确定性并被路由到 ESCALATE,绝不悄悄地被提升为 AUTHORIZE。
11 · 数值验证
我们在一个种子可复现的模拟中验证这五条定理(validate.py,种子 20260915):N = 300 个失败模式,Zipf(α=1.1),T = 40,000 轮,预算 ε = 0.05,违反硬不变量的动作以 0.05 的比率被注入。模拟器只捕获库中的模式;每个惊奇都被加入。
| 轮次 | |L_t| | 惊奇 | 缺失质量 M_t | Good–Turing U_t/t | 已提交失败率 |
|---|---|---|---|---|---|
| 100 | 37 | 37 | 0.393 | 0.280 | 0.370 |
| 1,000 | 137 | 137 | 0.124 | 0.062 | 0.137 |
| 5,000 | 261 | 261 | 0.023 | 0.010 | 0.052 |
| 10,000 | 293 | 293 | 0.0043 | 0.0024 | 0.029 |
| 20,000 | 300 | 300 | 0.000 | 0.00005 | 0.015 |
| 40,000 | 300 | 300 | 0.000 | 0.000 | 0.0075 |
- 定理1。在 2,063 个被注入的违反硬不变量的动作中,0 个被提交——无论覆盖如何,门拒绝了每一个。(通过)
- 定理3。库饱和于 300/300;惊奇总数 = 300 = N,恰是已证明的界。(通过)
- 定理4。缺失质量 Mt 沿整条路径不增,达到 0;Good–Turing 单例估计跟踪它并消失。(通过)
- 定理5。面对 5,000 个真实声称(可复现)与 5,000 个伪造声称(不可),伪造的挣得 0 奖励,真实的挣得全额——没有朝向制造失败的梯度。(通过)
- 显著性门控的记忆(§8)。在 826 个已验证失败情节和 39,174 个例行成功情节中,保留留下了 100% 的失败和 0% 的成功——被保留的记忆完全源自失败。(通过)
- 设计目标。惊奇率下降 33.6×(0.235 → 0.007);已提交失败率从 0.37 下降到 0.0075——模拟中更多失败,现实中更少惊奇。
12 · 与本合集的关系
该循环是本姊妹工作路线的其余部分所预设的行动层。编排缺口(The Orchestration Gap) [1] 论证控制必须附着于一个链层级的、带默认失败即关闭的授权门;这里的决策门就是那个门,如今被赋予了一条形式化的安全定理(定理1 = 已被证明的失败即关闭的准入性质)。Peel [2] 提供了符号预言机——宁可弃权也不猜测的确定性硬否决——恰是定理1中 O 所检查的那些不变量。检索不是记忆(Retrieval Is Not Memory) [5] 提供了学习层,以及"回忆不是授权"这一原则。贯穿的主线是一个立场:做判断的实体决不能是采取行动的实体,而采取行动的实体决不能是授权的实体。
13 · 局限
- 保证相对于所编码的东西。定理1只保护预言机实际检查的那些不变量;一个未被编码的危害在下限之外。该定理限定的是模拟不完整性的效应,而非不变量集合的完整性。
- 定理2依赖于校准。这个风险界只与 û 一样好;一个未经校准的估计器会打破它。校准是一项开放的、可度量的义务。
- 定理4假设平稳性。惊奇在一个体制之内消散;分布漂移注入新的缺失质量。定理1是唯一在任意漂移下仍成立的保证。
- 失败/缓解模型被理想化了。§11 的模拟建模的是覆盖动力学,而非任何特定模拟器的保真度。
- 这是分析,不是一个已交付的系统——附带数值验证的设计层级定理,并据此标注。
14 · 结论
薄弱的范式是模型思考 → 模型调用工具。更强的范式是一种预动作对抗认知循环,它付费让模拟器去寻找失败,把判断与提交/执行分开,把它的调节信号加以接地使它们无法被作弊,并让现实把这个循环闭合进记忆。它的力量并不在于它证明了安全——没有任何有限之物能做到——而在于它分解了这个保证,使得可证明的部分(硬不变量,以符号方式检查)绝不被无法证明的部分(我们模拟得够了吗?)挟持。模拟并不在动作被授权时结束。它在预期与观测相遇时结束——而那个间隙就成为该循环接下来所知道的东西。
参考文献
- Perslis Research. "The Orchestration Gap: Why Model-Level Alignment Cannot Survive Multi-Model Runtimes." Preprint, 2026. research.perslis.com/orchestration-gap.html
- Perslis Research. "Peel: Structural Hallucination Prevention for Offline AAC Through Symbolic Fact Authorship." Preprint, 2026. research.perslis.com/peel.html
- I. J. Good. "The Population Frequencies of Species and the Estimation of Population Parameters." Biometrika 40(3–4):237–264, 1953.
- D. McAllester & R. Schapire. "On the Convergence Rate of Good–Turing Estimators." COLT, 2000.
- Perslis Research. "Retrieval Is Not Memory: Memory as a Governance Function over Experience." Preprint, 2026. research.perslis.com/memory.html
- A. M. Turing. "Computing Machinery and Intelligence." Mind 59(236):433–460, 1950.
- D. Amodei, C. Olah, J. Steinhardt, P. Christiano, J. Schulman, D. Mané. "Concrete Problems in AI Safety." arXiv:1606.06565, 2016.
如何引用
Perslis Research. "Verified Before Acting: A Pre-Action Adversarial Cognition Loop with Factored Authorization." Preprint, 2026. https://research.perslis.com/adversarial-loop.html
@techreport{perslis_verified_before_acting_2026,
title = {Verified Before Acting: A Pre-Action Adversarial
Cognition Loop with Factored Authorization},
author = {{Perslis Research}},
institution = {Perslis Research},
type = {Preprint},
year = {2026},
url = {https://research.perslis.com/adversarial-loop.html},
note = {Five theorems with a reproducible numerical validation}
}