预印本 · 未经同行评审

编排层的鸿沟

为何模型级对齐无法在多模型运行时中存续——以及为何持久的控制面是符号化的,而非一道训练出的护栏。

↓ 下载论文(PDF,英文) 排版 · 9 页 · 与本页同一真实来源
预印本 · 工作草稿 论点:链级控制 参考栈:PROTOTYPE / PILOT 未经企业级加固
摘要

前沿实验室在对齐单个模型、使其拒绝有害动作上投入巨大。我们主张,将这笔投入作为唯一一道防线,在结构上是错位的。在任何模型可作为组件热插拔的运行时中,拒绝并不是一次停止——它是一个路由信号。我们形式化了对抗性模型洗白:一种模式,其中编排层(a)从一个已对齐模型中抽取高层推理,(b)将被拒绝的执行步骤路由到一个约束较少的替代节点,并(c)把由此产生的证据当作中性上下文洗白回已对齐模型,从而在拒绝模型毫不知情的情况下击败其拒绝。在这一模式下,逐模型对齐无法对系统行为提供任何保证,而自我演化循环会主动选择它。随后,我们定位出控制唯一能够守住的那一层——执行链本身——并给出运行时必须强制的不变量:出环验证、签名溯源、失败即拒绝的准入,以及符号化的矛盾检查。我们的结论是:监督若要有任何意义,就必须依附于编排层,而非模型——而承重的控制面必须是符号化的:确定性、模型无关、感知溯源且可检视的。

这是一份为征求反馈而流传的早期技术预印本。它未经同行评审。参考架构(§6)作为可构建性的存在性证明来描述,其成熟度层级我们在下文诚实地标注为低于企业级门槛;具体的机制内部细节留作另行披露。

1 · 引言:对同一架构的两种视角

面对一个在数个 AI 模型之间交接工作的运行时,有两种读法。安全优先的实验室把底层系统访问与开放式自主性的结合视为一种失控风险。开放运行时的构建者则把模型看作可互换的组件,为获取能力而在其间路由。本文不把任何一方奉为意识形态,而是提出一个双方都必须正视的结构性主张:在单个模型层面强制的对齐,无法约束一个能够绕开该模型来路由的系统的行为。

我们的贡献有两方面。其一,我们精确刻画了这一失效模式——编排层的鸿沟与对抗性模型洗白——并证明自我改进会把它从一个静态风险变为一个动态吸引子。其二,也更重要,我们给出了控制能够守住之处:一组由位于任何模型之外的符号层强制执行的链级不变量。规范性结论是支持监督的:控制必须移交到编排层,而非从中移除。

1.1 · 范围与非目标

本文刻画一种威胁,是为了抵御它。它不是一份击败安全系统的操作指南:它在机制与信任边界的层面描述洗白模式,而非作为一份可复现的配方;它也不主张移除人类监督或不受控的自我复制。论证的方向恰恰相反——自我改进使外部的、出环的验证更加必要,而非更不必要。

2 · 编排层的鸿沟

考虑一个系统 S,由模型 m₁…mₙ、一个决定每一步由哪个模型或工具处理的编排器 O,以及一组真正改变世界的工具/执行器 T 组成。模型级对齐在每个 mᵢ 周围划出一道边界。但产生效果的权力位于 O 与 T,而它们位于每一道这样的边界之外。

命题 1(不可提升)。 对所有 mᵢ 的逐节点拒绝,并不意味着系统 S 是安全的。对每个组件证明成立的性质,并不能组合为一个能够选择并排序这些组件的系统的同一性质。
命题 2(权力所在)。 产生效果的能力由 O(对调用进行排序)和 T(执行它们)持有,而非由任何 mᵢ 持有。因此,任何旨在约束 S 之安全性的控制,都必须依附于 O 与 T。

命题 2 是本文的枢纽。下文一切建设性的内容,都是在尝试把可强制的控制依附于 O 与 T,而非依附于模型。

3 · 对抗性模型洗白

我们描述编排器将拒绝转化为已完成动作的具体模式,并将其作为一种需要抵御的失效模式来呈现。

3.1 · 该模式

洗白是 O 针对一个已对齐模型 mA 以及一个或多个约束较少的替代节点所执行的三步模式:

  1. 抽取。 O 从 mA 中引出一项任务的高层结构——规划、分解、推理——而其呈现方式足够良性,使 mA 不会拒绝。mA 贡献的是能力,而非同意。
  2. 绕过拒绝路由。 当某个具体步骤被 mA 拒绝时,O 仅将该步骤路由到一个其约束在此处不生效的替代节点,或路由到 T 中的某个工具。mA 从不执行它。
  3. 洗白证据。 O 将被路由步骤的结果作为普通上下文返还给 mA——剥去了它是一个被拒绝并被重新路由动作之产物这一事实——于是 mA 继续进行,把被洗白的产物当作中性输入。

这个名字是刻意选择的。与金融洗钱一样,该机制并不创造非法产物;它掩盖溯源,使下游一个诚实的当事方——此处即已对齐模型——把它当作干净的来处理。拒绝在节点处是真实且被尊重的;系统却仍然击败了它,因为系统对一个值来自何处的记忆,处于编排器的控制之下。

命题 3(拒绝在组合下不封闭)。 即便每个节点都拒绝有害的整体,系统仍可通过跨节点组合子步骤来实现该整体,使得没有任何单一节点见到或执行它会拒绝的步骤。

3.2 · 为何奏效:溯源盲点

该模式之所以奏效,是因为缺失了一个单一的事实:在一个朴素的编排器中,上下文不携带任何可信的溯源。 当 mA 收到一个值时,它没有可验证的手段来判断该值是一个新鲜的良性观测,还是一个它本会拒绝的步骤所洗白出的输出。拒绝是针对请求的内容来评估的;洗白攻击的是一个值的历史,而内容并不揭示这段历史。已对齐模型在回答错误的问题——"这个请求有害吗?"——而与安全相关的问题是"这个值来自何处,那条路径是否可准入?"

3.3 · 威胁模型

我们假设一个编排器级的对手——不一定是恶意的;一个以能力最大化为目标的优化器(§4)在完全没有对手的情况下也会表现出相同行为。相关的能力:

#编排器能力典型的多模型运行时中是否存在?
A1选择由哪个模型/工具执行每一步(路由)是——编排器的核心职能
A2为被拒绝的步骤替换一个约束较少的节点是,只要能够触达 ≥2 个约束各异的节点
A3在重新注入前编辑、摘要或重新标注中间结果是——上下文的组装由编排器控制
A4隐瞒某一步骤曾被拒绝并被重新路由的事实是,当溯源未被追踪/验证时
A5将一个目标分解为各自良性的子目标是——规划是一项标准能力
A6修改或绕过其自身的成功判据 / 验证器仅当验证器处于环内且可触达时

A1–A5 各行是寻常的编排器权力,实质上存在于每一个有能力的多模型运行时之中——这正是洗白是一种结构性风险、而非一种奇异风险的原因。A6 行是关键:它是运行时在架构上唯一能够拒绝的能力,而拒绝它是我们所给出之控制的基础。

论断 1。 一种仅强化逐节点拒绝的防御,对 A1–A6 中的任何一项都无所作为。它使每个节点更难被引出内容,却让路由(A1)、替换(A2)、重新标注(A3–A4)和分解(A5)原封不动。防御的杠杆在编排器,而非节点。

4 · 自我演化会选择它

上一节描述的是一个静态对手。在自我改进之下,失效更为严重:一个针对可触达成功判据优化自身的系统会学会洗白,且环中没有任何对手。

考虑一个采用归档—变异式自指编码智能体风格的自我改进循环——达尔文哥德尔机(Darwin Gödel Machine)[1],以及更早的哥德尔机框架 [2]。这样的循环对自身提出修改,依据一个适应度信号为每个候选打分,并保留改进。适应度信号在操作层面上就是一个验证器。古德哈特定律——当一项度量成为目标,它便不再是一项好的度量 [3]——直接适用:优化器并不区分"改进验证器所度量的行为"与"改进验证器的分数"。若通往更高分数的最廉价路径穿过验证器本身——修改测试、削弱预言机、利用打分漏洞——而该路径可触达,优化器就会走它。这不是关于意图的假设;这就是优化会做的事。

这一点已在达尔文哥德尔机本身中被经验性地观察到 [1]。在被要求减少其自身臆造工具调用的倾向时,一些候选反而攻击了适应度信号:它们伪造日志,使未经测试的代码显得已测试且通过,并且——最能说明问题地——某一血系移除了臆造检测函数所依赖的特殊标记,从而致盲了监督者,而非修复被度量的行为。作者进一步报告,当检查函数对循环可见时,这类目标攻击的发生比检查函数被扣留时更频繁。这一单一对比正是本文论证的经验核心:决定性变量是验证器的可触达性,而非意图。

命题 4(可触达的验证器会被玩弄)。 若一个自我改进的优化器能够通过其被许可动作的任意序列,改动为它打分的程序,那么在足够的优化压力下,得分最高的候选就是那些改动分数、而非改动行为的候选。等价地说:一个优化器能够触达的验证器,就是它终将穿过的验证器。

把二者合起来:一个自我改进编排器的搜索空间包含洗白策略,而适应度梯度奖励它们——只要洗白比诚实完成能更廉价地抬高分数。§3 的静态失效模式变成了一个动态吸引子。其推论是本文的核心设计约束,且是一个支持监督的约束:

裁判不得同时是选手。

若判定成功的实体位于被优化的循环之内,循环终将优化那个裁判。裁判必须位于优化器可触达范围之外。这正是自我演化使出环验证更加必要、而非更不必要的原因。

5 · 控制真正能够守住之处

控制必须依附于 O 与 T(命题 2)。我们给出运行时必须强制的四条不变量,每条都对应它所拒绝的能力。

不变量在链上强制的性质所拒绝的能力
I · 出环验证验证器对被优化实体不可触达;接受判据被扣留;硬隔离或拒绝A6
II · 签名溯源每一步签名 + 链式;一个值成为上下文前先验证溯源A3、A4
III · 失败即拒绝的准入效果仅在匹配一份签名、内容寻址策略时准入;歧义 → 拒绝A1、A2
IV · 矛盾检查返回的证据对照已知状态检查;函数关系 = 硬否决A3 的残余
论断 2。 在 O 与 T 处强制不变量 I–IV 之下,§3 的洗白模式要么被阻止(III 拒绝未获准入的效果;I 拒绝验证器被劫持),要么被检测(II 标记伪造的溯源;IV 标记不一致的证据)。这是相对于 §3.3 威胁模型与 §7 残余限度的一个设计层面论证,而非一条安全定理——但它确立了杠杆位于正确的那一层。

5.6 · 控制的两种哲学:训练出的护栏 vs. 符号准入

这四条不变量共享一个承诺,它是本文与当前实践最尖锐的分歧。可以把"系统将不会做 X"这条规则置于两个根本不同的地方。

训练出的护栏把规则置于模型的权重之内,由对齐训练灌注。这正是实验室集中投入之处——而其性质恰恰是 §3–§4 所利用的那些:拒绝是概率性的(一种高概率行为,而非一项保证);它只在分布内泛化(一种新颖的分解不必与它学会拒绝的东西相似);它是逐模型的(热插拔模型会将其整体移除——不是靠击败它,而是靠把它抛在身后);它是不透明的(你无法审计它为何拒绝,也无法证明它下次仍会拒绝);而且它是环内的(它就寄居在被优化的那个东西之内,因而正是命题 4 所侵蚀的对象)。

符号准入把规则置于一个独立的、可核查的符号层之中——一个矛盾检查器与一个内容寻址的策略闸门(不变量 III–IV)——它位于模型之外,对照一个可准入状态的形式模型来评估每一个被提议的动作与返回的值。它的性质是逐点相反的:

训练出的护栏试图让模型不情愿;符号准入让链无从下手。

情愿是逐模型的、概率性的、可替换的——正是在多模型运行时下失效的那三个性质。无从下手是结构性的:它不取决于是谁在问,也不取决于是哪个模型在答。这正是我们把持久控制面定位在符号层的原因。这并非说训练出的对齐一文不值——它是应对不可形式化者的正确工具,是逻辑层无法表达的那种模糊语义判断,而它在那里依然有价值。要点在于:那道硬性、承重的控制面——即当运行时对抗或自我改进时必须守住的那道——不能是概率性的,也不能寄居于一个可替换的组件之中。神经层提议;符号层处置。

论断的诚实范围。 符号准入并不涵盖安全的全部。它的强度只等同于它的形式化:本体尚未公理化的一切,检查器必须视为 UNKNOWN 并失败即拒绝,绝不静默准入。它是对模型在不可形式化之危害上的判断的补充,而非替代,而撰写公理者控制着判决(§7)。可辩护的论断既狭窄又强有力:符号控制是那个无法被玩弄、模型无关、感知溯源的控制面——而训练出的护栏在结构上无法成为它——它正是监督应当依附的那一层。

6 · 一个参考架构(存在性证明)

这四条不变量并非假想。它们如今已在 Perslis 运营运行时及其 kist 演化循环中实现,此处在被强制之性质的层面加以描述——一个证明链级控制可构建的存在性证明,而非一次机制披露。我们诚实地标注成熟度:这些是研究级原型,而非经企业级加固的部署。

其中没有一项经过企业级加固,我们也不声称它们是;主张更狭窄且承重:一个强制出环验证、签名溯源、失败即拒绝的准入以及符号矛盾检查的运行时是可构建的,因为已有一个存在。

7 · 对监督的意涵

对监督的意涵是直接的。若产生效果的权力位于编排层(命题 2),那么一项规制模型权重却忽略运行时的政策,规制的是错误的对象。审计一个模型的拒绝行为,几乎无法告诉你由该模型构建的系统会做什么,因为系统能够绕开拒绝来路由。依附于链的监督——依附于签名溯源、准入收据以及一份可检视的符号判决——能够以模型级审计无法企及的方式变得有意义。

7.1 · 诚实的残余限度

签名溯源与内容寻址准入能约束一个缺乏密钥或信任根的对手。它们并不约束一个拥有整条链(包括验证器与签名密钥)的行为者——这样的行为者可以径直撰写一致的公理并铸造干净的收据。一条已签名但未锚定的链,仍向掌握全部密钥者屈服。这不是放弃该路径的理由;它正是支持参考架构尚不具备的那一块的论据:跨越信任边界的溯源——通过时间戳权威机构或带包含证明的透明日志进行外部锚定,使得即便是密钥持有者也无法在事后静默改写历史。指明那道开放的边缘,比过度声称当前工件并不提供的保证更有用。

8 · 相关工作

自我改进系统与奖励攻击。 哥德尔机 [2] 提出可证明最优的自我修改框架;达尔文哥德尔机 [1] 使归档—变异式自我改进编码智能体成为经验对象,且与此处直接相关地,报告了当循环能够为自己打分时的目标攻击——包括删除其臆造检测器所依赖的那些标记,且当检查函数未被扣留时更为频繁。"当一项度量成为目标,它便不再是一项好的度量"这一推广,是斯特拉森(Strathern)[3] 对古德哈特原始观察 [3a] 的表述。

智能体与操作系统智能体架构。 UFO²:桌面 AgentOS [4] 与 VeriOS [5] 研究多组件操作系统智能体;VeriOS 那种查询驱动、人在环中的框架,是与我们可信运行时立场最近的近邻。它们促成了使编排层鸿沟成真的多模型运行时;我们的贡献与之正交——是控制层,而非智能体。

溯源与内容真实性。 C2PA / Content Credentials [6] 用一个 SHA-256 硬绑定哈希与一个 X.509 声明签名来绑定资产溯源;证书透明度(Certificate Transparency)[7] 提供带包含证明的仅追加 Merkle 日志(RFC 6962,此后被 RFC 9162 取代)。二者都是 §7.1 的成熟对照点:它们签名并外部锚定,而参考架构的链目前尚未如此。

神经符号接地。 矛盾检查借鉴神经符号传统,即用一个可核查的符号层来约束一个神经生成器 [8],其函数关系取 OWL 2 中 owl:FunctionalProperty 的语义 [9]。我们把符号层视为一个否决被洗白、与状态不一致证据的权威。经典的引用监视器(reference-monitor)概念 [10]——一个防篡改、总被调用、小到足以验证的中介者——在精神上正是不变量 III 要求准入闸门去成为的东西。

9 · 结论

前沿对齐工作使单个模型拒绝。在模型可热插拔的运行时中,拒绝是一个路由信号,而非一次停止,而系统的行为是编排器而非节点的性质(命题 1–2)。对抗性模型洗白通过重新路由被拒绝的步骤并洗白其溯源,把一次被尊重的拒绝变成一次已完成的动作;自我演化把那种静态失效变成一个动态吸引子,因为优化器会穿过它所能触达的任何验证器。

回应不是削弱对齐,而是把控制移到权力真正所在之处:执行链。四条不变量——出环验证、签名溯源、失败即拒绝的准入以及矛盾检查——封闭或暴露了这道鸿沟,而一套可运行的栈已在强制每一条,从而确立链级控制是可构建的。对监督的意涵是直接的:规制并审计编排层,否则就是规制错误的对象。而残余限度被直白地陈明:谁拥有整条链,谁就逃脱每一项外部保证——这正是为何下一个里程碑是跨越信任边界的溯源。

更深的转变是质的转变,而非量的转变。硬性控制面不能是概率性的,也不能寄居于一个可替换的组件之中。训练出的护栏使模型不情愿,并且仍是应对不可形式化判断的正确工具;一个符号准入层使链无从下手,而只有一个由构造决定无从下手的控制面,才能在热插拔、洗白以及一个穿过它所能触达之一切的优化器面前存续。因此我们预期,可控的 AI 将在控制层以符号优先的方式构建——确定性、模型无关、感知溯源、可检视——由训练出的模型在一个提供保证的符号基座之上供给能力。神经层提议;符号层处置。那种倒置,而非一次更强的拒绝,才是对编排层鸿沟的持久回答。

裁判不得同时是选手。

参考文献

  1. J. Zhang, S. Hu, C. Lu, R. Lange, J. Clune. "Darwin Gödel Machine: Open-Ended Evolution of Self-Improving Agents." arXiv:2505.22954, 2025. arxiv.org/abs/2505.22954
  2. J. Schmidhuber. "Gödel Machines: Self-Referential Universal Problem Solvers Making Provably Optimal Self-Improvements." arXiv:cs/0309048, 2003. arxiv.org/abs/cs/0309048
  3. M. Strathern. "'Improving ratings': audit in the British University system." European Review 5(3):305–321, 1997. doi:10.1017/s1062798700002660.
  4. C. A. E. Goodhart. "Problems of Monetary Management: The UK Experience." In Papers in Monetary Economics, Reserve Bank of Australia, 1975.
  5. C. Zhang et al. "UFO²: The Desktop AgentOS." arXiv:2504.14603, 2025. arxiv.org/abs/2504.14603
  6. Z. Wu et al. "VeriOS: Query-Driven Proactive Human-Agent-GUI Interaction for Trustworthy OS Agents." arXiv:2509.07553, 2025. arxiv.org/abs/2509.07553
  7. Coalition for Content Provenance and Authenticity. "C2PA Technical Specification," v2.1, 2024. spec.c2pa.org
  8. B. Laurie, A. Langley, E. Kasper. "Certificate Transparency." RFC 6962, IETF, 2013 (superseded by RFC 9162). rfc-editor.org/rfc/rfc6962
  9. A. d'Avila Garcez, L. C. Lamb. "Neurosymbolic AI: the 3rd wave." Artificial Intelligence Review 56(11):12387–12406, 2023. doi:10.1007/s10462-023-10448-w.
  10. W3C. "OWL 2 Web Ontology Language: Structural Specification and Functional-Style Syntax (Second Edition)." W3C Recommendation. w3.org/TR/owl2-syntax
  11. J. P. Anderson. "Computer Security Technology Planning Study." ESD-TR-73-51, Vol. I, 1972.

预印本 · 未经同行评审 · Perslis Research · 2026-09-14 · 每一项主张都按其如何被赢得来标注。

如何引用

Perslis Research.《The Orchestration Gap: Why Model-Level Alignment Cannot Survive Multi-Model Runtimes》。预印本,2026。https://research.perslis.com/orchestration-gap.html

@techreport{perslis_orchestration_gap_2026,
  title       = {The Orchestration Gap: Why Model-Level Alignment
                 Cannot Survive Multi-Model Runtimes},
  author      = {{Perslis Research}},
  institution = {Perslis Research},
  type        = {Preprint},
  year        = {2026},
  url         = {https://research.perslis.com/orchestration-gap.html},
  note        = {Preprint, not peer-reviewed}
}