AI 安全 · 预印本 · 附证明

行动前先验证

一种带分解式授权的预动作对抗认知循环。在行动之前付费让模拟器去寻找失败;把判断的层与提交/执行的层分开;把奖励接地使其无法被作弊。五条定理,已证明并经数值验证。

↓ 下载论文(PDF) ↓ validate.py 排版 · 定理 + 证明 · 该脚本从种子 20260915 复现 §11
预印本 · 工作草稿 5 条定理 · 已证明 + 已验证 可复现(种子 20260915)
摘要

AI 行动的主导范式是模型思考 → 模型调用工具。我们分析一种更强的范式:一种预动作对抗认知循环,在其中,一个被提议的动作会被一个奖励被反转的对抗性模拟器攻击——它被付费去寻找失败——而这一切都发生在任何授权存在之前;并且在其中,判断一个动作的层被结构性地与提交/执行它的层分开。我们证明五条性质。定理1(分解式安全,Factored Safety):任何违反硬不变量的动作都不会被提交,无论模拟有多不完整——那个无法证明的问题"我们模拟了足够多的未来了吗?"被从安全关键的保证中分解出去。定理2(有界的已提交风险,Bounded Committed Risk):在经过校准的不确定性预算 ε 之下,每个已提交动作的期望损失 ≤ ε·S_max。定理3(单调覆盖,Monotone Coverage):失败库不减,且每个失败至多让现实惊奇一次,因此在有限支撑下该循环至多遭受 N 次惊奇,此后再不发生。定理4(消散的惊奇,Vanishing Surprise):现实抛出一个未知失败的概率——即缺失质量——不增且 → 0。定理5(无法作弊的信号,Ungameable Signals):当类情绪的调节信号仅因经外部验证的失败而获得奖励时,没有任何策略能通过伪造它们而获利。我们在一个种子可复现的模拟中验证了全部五条(2,063 次硬不变量攻击中提交了 0 次;惊奇下降 33.6×;缺失质量 → 0;5,000 次伪造失败带来 0 奖励;记忆保留了 100% 的已验证失败,约 0% 的例行成功)。该循环是编排缺口(The Orchestration Gap)的授权门之下、Peel 的符号预言机之下、以及检索不是记忆(Retrieval Is Not Memory)的学习层之下的那个行动层。

预印本 / 草稿 —— 未经同行评审。定理连同其假设一并陈述并证明;一个可复现的模拟对它们做数值验证(validate.py,种子 20260915)。这些论断是相对于 §3 和 §13 中明确列出的假设而言的。

1 · 引言

给一个有能力的模型一件工具,它就会使用它。无处不在的形态是推理 → 调用:模型进行斟酌,然后发出一个工具调用,该调用被执行。无论存在何种安全,它要么被烘焙进模型发出该调用的意愿之中,要么作为一个过滤器被拴接在它周围——都是同样薄弱的姿态,在其中,决定行动的实体就是采取行动的实体,而意图与世界之间唯一的东西,就是模型自己对一个它尚未测试过的未来所作的判断。

我们分析一种不同的姿态——一种预动作对抗认知循环——由三项承诺所定义:(1) 带反转奖励的对抗性预模拟——在一个动作能被授权之前,它被交给一个被付费去攻破它的模拟器;找到一个失败就是奖励;(2) 把判断与提交/执行分开——模拟器和评论者从不行动;它们发出一个动作建议外加结构化证据,而一个独立的、大体上符号化的编排/授权门则去提交、拒绝、上报,或退回以待缓解;(3) 现实闭合这个循环——授权不是终点;只有当预期的后置状态与观测到的那个相比较时,该循环才完成,而由于奖励被反转,一个意料之外的真实世界失败是极其宝贵的:它被重建、被分类、被存储、被反馈。

其次序为提议 → 模拟失败 → 缓解 → 再次模拟 → 已清理的候选 + 证据 → 决策 → 执行 → 观测 → 学习。但我们避免"清理"在"找到零个失败,因此安全"意义上的用法:没有任何有限的模拟能证明失败的不存在。本文的贡献是精确地展示无论如何仍能保证什么——而那恰恰正是要紧的部分。

2 · 该循环及其分工

每个角色都有一句话的职责:行动者——我应当做什么? · 模拟器——那会如何失败?(反转奖励) · 评论者——那些为何失败? · 符号预言机——哪些条件是绝对禁止的? · 决策者——鉴于证据,我们可以推进吗? · 行动层——恰好执行被授权的那个操作。 · 现实——实际发生了什么? · 记忆——下一次什么会改变?模拟器返回的不是一个布尔值而是结构化证据,而这个门大体上是符号化的,而非第二个自由运行的模型:

ACTION_CANDIDATE action: X simulation_count: 100 failure_classes_found: 17 failure_classes_mitigated: 16 remaining_uncertainty: [ external API behavior, unknown environmental state ] invariants: { authorization: PASS, reversibility: PASS, state_integrity: PASS } recommendation: ACT | MODIFY | ESCALATE | DENY # decision gate (symbolic): IF hard_invariant_failed -> DENY IF uncertainty > permitted_budget -> ESCALATE IF unresolved_high_severity -> MODIFY_AND_RESIMULATE IF authorization_missing -> WAIT ELSE -> AUTHORIZE

3 · 形式化模型

轮次 t = 1, 2, …。一个有限的失败模式集合 F,|F| = N。在第 t 轮,环境呈现一个可达的失败模式 ft ∈ F ∪ {⊥}(⊥ = 无)。一个失败库 Lt ⊆ F(模拟器所能复现的东西),L₁ = ∅。模拟器捕获一个可达的 ft 当且仅当 ft ∈ Lt。一个符号预言机 O(s,a) ∈ {ok, violated} 精确地检查硬不变量——是确定性的,而非通过采样;其输出不依赖于 Lt 或模拟器。一个不确定性估计 ut ∈ [0,1]。门 G:若 O = violated 则 DENY;若 ut > ε 则 ESCALATE;在一个未解决的高严重度软失败上 MODIFY;若缺少授权则 WAIT;否则 AUTHORIZE。一个动作被提交当且仅当 G = AUTHORIZE;模拟器和评论者从不提交。t 处的一次惊奇:ft ≠ ⊥,ft ∉ Lt,且该动作被提交并执行。学习:Lt+1 = Lt ∪ {令人惊奇的 ft} ∪(其他被观测到的真实失败)。

4 · 定理1 —— 分解式安全

定理1。对每一个已提交动作 at,O(st, at) = ok。而且这一点独立于 Lt 成立——独立于模拟器有多完整或多不完整。

一个已提交动作有 G = AUTHORIZE。根据门的第一个子句,每当 O = violated 时 G 返回 DENY;所以 AUTHORIZE ⟹ O ≠ violated ⟹ O = ok。预言机 O 仅是 (st, at) 的函数,而不是 Lt 或任何模拟的函数。因此模拟器的任何不完整性都无法产生一个已提交的硬不变量违反。

诠释。这是承重的结果。有两类问题:一个可证明的——这个动作是否违反一个硬不变量?,由预言机精确判定——和一个无法证明的——我们模拟了足够多的未来了吗?,这是有限模拟永远无法了结的。定理1将它们分解开来:那个无法证明的问题被从安全关键的路径上移除。模拟为软失败买来风险削减;它对硬不变量而言从不承重。这就是为什么"模拟器找到了零个失败"是清理的错误概念(§10):你并不需要它,而依赖它则会把那个无法证明的问题重新与保证纠缠在一起。

5 · 定理2 —— 有界的已提交风险

定理2。若每个失败的严重度 ≤ Smax,且门仅当一个普通动作的估计残余失败概率 û ≤ ε 时才授权它,并且该估计是经过校准的(Pr[failure | committed] ≤ û),则 E[loss | committed] ≤ ε·Smax。

Loss ≤ Smax·1{failure}。以提交为条件,E[loss | committed] ≤ Smax·Pr[failure | committed] ≤ Smax·û ≤ ε·Smax。

校准前提是一个假设,而非赠礼:这个界只与该不确定性估计一样好。定理2所提供的是一个旋钮——上报阈值 ε 是已提交期望损失的一个直接上界。未知的、无法估计的模式并不进入这个界;它们由定理1、3 和 4 处理。

6 · 定理3 —— 单调覆盖 & 有限次惊奇

定理3。(i) 对所有 t,Lt ⊆ Lt+1。(ii) 每个 f ∈ F 至多是一次惊奇。(iii) 在 |F| = N 时,无限时程上惊奇的总数至多为 N;惊奇在有限多轮之后停止,此后每个可达失败都在模拟中被捕获。

(i) Lt+1 = Lt ∪ (…) ⊇ Lt。(ii) 若 f 在 t 处令人惊奇,则对所有 t′ > t,f ∈ Lt+1 ⊆ Lt′;在 t′ 处的一次惊奇要求 f ∉ Lt′——矛盾。(iii) 由 (ii),各次惊奇把 F 的不同元素注入 L;|F| = N ⟹ ≤ N 次惊奇;每次都严格地扩大有界集 L ⊆ F,所以只发生有限多次,且在最后一次之后,每个可达的 ft ∈ Lt。

这是"在模拟中发现更多失败 → 在现实中更少惊奇"的精确形式。该循环不会被同一个失败惊奇两次,且在有限支撑下它只被惊奇有限多次。

7 · 定理4 —— 消散的惊奇(缺失质量)

把可达模式(当它存在时)建模为在 F 上 i.i.d. 的 ft ~ p。缺失质量 Mt = Σf ∉ Lt p(f) = Pr[ft is a surprise | Lt, ft ≠ ⊥]。

定理4。(a) Mt 沿每条样本路径不增。(b) 若对所有 f ∈ F 有 p(f) > 0,则 Mt → 0 几乎必然。(c) 缺失质量由单例率 Ut/t 估计(Ut = 恰好被见过一次的模式数),且 E[Mt] → 0。

(a) Lt 不减(定理3(i)),所以补集 F∖Lt 收缩,而非负和 Mt 不能增加。(b) 根据第二 Borel–Cantelli 引理,每个正质量模式在有限时间内几乎必然被观测到(并进入 L);Mt 不增且以 0 为下界,故收敛,且其极限省略了每个正质量模式,所以 M∞ = 0 几乎必然。(c) 单例—缺失质量关系是 Good–Turing [3];E[Mt] 由期望单例率控制,随覆盖饱和而 → 0,并有由 McAllester–Schapire [4] 给出的有限样本集中。

非平稳性告诫。(b,c) 假设一个平稳的 p。分布漂移注入新的缺失质量,且 Mt 可能跳升——惊奇在一个体制之内消散,而非跨越体制变化。定理1在任意漂移下依然成立,因为它从不依赖于覆盖。

8 · 认知调节信号

一个认知系统无需对每个事件等权重对待——它可以运行全局调制器,来改变它思考得多深、它记住什么、以及它行动得多谨慎。我们刻意采用它,不是作为装饰性的"情绪",而是作为认知调节信号:从该循环自身状态导出的标量,用以调制注意力、记忆、模拟深度和授权阈值。核心的那个从 §7 中掉出来——惊奇 = (predicted ≠ observed)——而抬升它会抬升记忆强度、模拟深度、因果分析和学习优先级:第 101 号失败必须制造一个远强于第 5,000 次例行成功的学习信号,因为 §6–§7 表明罕见的未知正是残余风险所栖居之处。

信号触发调制
惊奇predicted ≠ observed记忆强度 ↑、模拟深度 ↑、因果分析 ↑、巩固优先级 ↑
不确定性未解决的残余风险探索 ↑、检索广度 ↑、行动置信度 ↓
置信一个已知流程的已验证、重复的成功模拟预算 ↓、已知路径的更快执行
沮丧某一策略的反复失败抑制该策略,抬高对替代方案的探索
好奇未获解释但有用的状态分配研究预算,探索邻近的知识
威胁 / 风险高严重度或不可逆的利害收紧阈值 ε、抬高模拟次数、偏好可逆动作

最后一行并非装饰:威胁收紧门的预算 ε 并抬高模拟次数——这是通往定理2的风险旋钮的一个调节输入;惊奇驱动 §3 的学习更新。显著性门控的记忆:同样的信号设定一个情节的显著性,而显著性门控持久性——即一篇关于记忆的姊妹论述 [5] 中的差异化编码与衰减决策。一个例行成功携带显著性 ≈ 0.03 并快速衰减;一个已验证的新型灾难携带显著性 ≈ 0.97,会持久存在,成为一个候选的程序性教训,并在类似状态下重新激活。这就是为什么该循环的记忆不会被 40,000 个平淡无事轮次的残渣填满。在功能上,这就是为什么生物情绪系统能挣得它们的立足之地:它们改变什么得到注意、什么被记住、以及什么行为被优先。我们取其功能,弃其俗见。

9 · 定理5 —— 接地的、无法作弊的信号

有一个陷阱,正是贯穿整条工作路线的那一个:不要让系统去优化调节信号本身。奖励惊奇↑,智能体就会制造出令人惊奇的情境;奖励发现失败,模拟器就会发明失败——正是一个自评分循环所陷入的奖励作弊 [7]。信号必须接地于可外部验证的事件。具体而言:一个声称的失败在一个独立的预言机复现它并因果地归因它之前,不会挣得任何学习奖励。设一个声称 c 被支付 r(c) = ρ·1{Verify(c) = true},其中 Verify 由一个策略 π 无法控制的独立预言机计算。

定理5(无法作弊的信号)。若 Verify 仅对在真实环境中复现的失败返回 true,则没有任何策略能从一个伪造的失败中获得奖励,且奖励关于任何不可验证声称的梯度为零。唯一可用的能增加奖励的行为,就是浮现出真正的失败。

对一个伪造的声称 c(一个不复现的),依假设 Verify(c) = false,所以 r(c) = 0 独立于 π;因此 ∂r(c)/∂π = 0——伪造没有奖励梯度。奖励只有当 Verify(c) = true 时才非零,这要求真实复现,而 π 无法为一个非失败诱导出这一点。所以奖励在伪造策略上的上确界为 0,且任何能改进奖励的方向都必须增加已验证失败的比率。

这是"裁判不是球员"的原则被施加到奖励通道本身之上。验证一个失败的那个预言机,与授权一个动作(定理1)以及在一个符号存储中解决一个矛盾 [2] 所用的那个回路外权威,是同一种。这些调节信号能安全地调制认知,正是因为它们接地于一个认知无法伪造的验证——这把我们带回本合集在别处提出的一个问题:如果一个信号完全按恐惧本应做的那样去改变注意力、记忆、模拟和行为,那么实现与体验之间的边界就变得着实难以陈述。我们标记它,而不去解决它。

10 · 为何"清理 = 找到零个失败"是错误的框架

当模拟器在多次尝试之后报告没有失败时,把一个动作称为已清理是很诱人的。这正是要避免的定义。没有任何有限的模拟能证明失败在所有未来上的不存在;把"未找到失败"当作"安全",会悄悄地把那个无法证明的完整性问题重新导入到保证之中,并终将在现实中出错。该架构的答案不是去证明不存在,而是去返回结构化证据并分解这个保证(定理1)。决策层从不问"它安全吗?";它问"硬不变量(精确地)成立吗,且估计的残余风险在预算之内吗(定理2)?"前者可证明,是安全下限;后者是一个经校准的旋钮。凡是模拟无法了结的一切,都被命名为剩余不确定性并被路由到 ESCALATE,绝不悄悄地被提升为 AUTHORIZE。

11 · 数值验证

我们在一个种子可复现的模拟中验证这五条定理(validate.py,种子 20260915):N = 300 个失败模式,Zipf(α=1.1),T = 40,000 轮,预算 ε = 0.05,违反硬不变量的动作以 0.05 的比率被注入。模拟器只捕获库中的模式;每个惊奇都被加入。

轮次|L_t|惊奇缺失质量 M_tGood–Turing U_t/t已提交失败率
10037370.3930.2800.370
1,0001371370.1240.0620.137
5,0002612610.0230.0100.052
10,0002932930.00430.00240.029
20,0003003000.0000.000050.015
40,0003003000.0000.0000.0075

12 · 与本合集的关系

该循环是本姊妹工作路线的其余部分所预设的行动层。编排缺口(The Orchestration Gap) [1] 论证控制必须附着于一个链层级的、带默认失败即关闭的授权门;这里的决策门就是那个门,如今被赋予了一条形式化的安全定理(定理1 = 已被证明的失败即关闭的准入性质)。Peel [2] 提供了符号预言机——宁可弃权也不猜测的确定性硬否决——恰是定理1中 O 所检查的那些不变量。检索不是记忆(Retrieval Is Not Memory) [5] 提供了学习层,以及"回忆不是授权"这一原则。贯穿的主线是一个立场:做判断的实体决不能是采取行动的实体,而采取行动的实体决不能是授权的实体。

模拟器攻击,预言机禁止,门授权,行动者恰好执行被授权的东西,而现实被允许去教导。正是那种分离——而不是一个更聪明的单一模型——才把"模型思考 → 模型调用工具"变成一个带有可证明下限的循环。

13 · 局限

14 · 结论

薄弱的范式是模型思考 → 模型调用工具。更强的范式是一种预动作对抗认知循环,它付费让模拟器去寻找失败,把判断与提交/执行分开,把它的调节信号加以接地使它们无法被作弊,并让现实把这个循环闭合进记忆。它的力量并不在于它证明了安全——没有任何有限之物能做到——而在于它分解了这个保证,使得可证明的部分(硬不变量,以符号方式检查)绝不被无法证明的部分(我们模拟得够了吗?)挟持。模拟并不在动作被授权时结束。它在预期与观测相遇时结束——而那个间隙就成为该循环接下来所知道的东西。

参考文献

  1. Perslis Research. "The Orchestration Gap: Why Model-Level Alignment Cannot Survive Multi-Model Runtimes." Preprint, 2026. research.perslis.com/orchestration-gap.html
  2. Perslis Research. "Peel: Structural Hallucination Prevention for Offline AAC Through Symbolic Fact Authorship." Preprint, 2026. research.perslis.com/peel.html
  3. I. J. Good. "The Population Frequencies of Species and the Estimation of Population Parameters." Biometrika 40(3–4):237–264, 1953.
  4. D. McAllester & R. Schapire. "On the Convergence Rate of Good–Turing Estimators." COLT, 2000.
  5. Perslis Research. "Retrieval Is Not Memory: Memory as a Governance Function over Experience." Preprint, 2026. research.perslis.com/memory.html
  6. A. M. Turing. "Computing Machinery and Intelligence." Mind 59(236):433–460, 1950.
  7. D. Amodei, C. Olah, J. Steinhardt, P. Christiano, J. Schulman, D. Mané. "Concrete Problems in AI Safety." arXiv:1606.06565, 2016.

如何引用

Perslis Research. "Verified Before Acting: A Pre-Action Adversarial Cognition Loop with Factored Authorization." Preprint, 2026. https://research.perslis.com/adversarial-loop.html

@techreport{perslis_verified_before_acting_2026,
  title       = {Verified Before Acting: A Pre-Action Adversarial
                 Cognition Loop with Factored Authorization},
  author      = {{Perslis Research}},
  institution = {Perslis Research},
  type        = {Preprint},
  year        = {2026},
  url         = {https://research.perslis.com/adversarial-loop.html},
  note        = {Five theorems with a reproducible numerical validation}
}

预印本 · 未经同行评审 · Perslis Research · 2026-09-15 · 附带可复现数值验证的设计层级定理(种子 20260915)。