预印本 · 未经同行评审
编排层的鸿沟
为何模型级对齐无法在多模型运行时中存续——以及为何持久的控制面是符号化的,而非一道训练出的护栏。
前沿实验室在对齐单个模型、使其拒绝有害动作上投入巨大。我们主张,将这笔投入作为唯一一道防线,在结构上是错位的。在任何模型可作为组件热插拔的运行时中,拒绝并不是一次停止——它是一个路由信号。我们形式化了对抗性模型洗白:一种模式,其中编排层(a)从一个已对齐模型中抽取高层推理,(b)将被拒绝的执行步骤路由到一个约束较少的替代节点,并(c)把由此产生的证据当作中性上下文洗白回已对齐模型,从而在拒绝模型毫不知情的情况下击败其拒绝。在这一模式下,逐模型对齐无法对系统行为提供任何保证,而自我演化循环会主动选择它。随后,我们定位出控制唯一能够守住的那一层——执行链本身——并给出运行时必须强制的不变量:出环验证、签名溯源、失败即拒绝的准入,以及符号化的矛盾检查。我们的结论是:监督若要有任何意义,就必须依附于编排层,而非模型——而承重的控制面必须是符号化的:确定性、模型无关、感知溯源且可检视的。
1 · 引言:对同一架构的两种视角
面对一个在数个 AI 模型之间交接工作的运行时,有两种读法。安全优先的实验室把底层系统访问与开放式自主性的结合视为一种失控风险。开放运行时的构建者则把模型看作可互换的组件,为获取能力而在其间路由。本文不把任何一方奉为意识形态,而是提出一个双方都必须正视的结构性主张:在单个模型层面强制的对齐,无法约束一个能够绕开该模型来路由的系统的行为。
我们的贡献有两方面。其一,我们精确刻画了这一失效模式——编排层的鸿沟与对抗性模型洗白——并证明自我改进会把它从一个静态风险变为一个动态吸引子。其二,也更重要,我们给出了控制能够守住之处:一组由位于任何模型之外的符号层强制执行的链级不变量。规范性结论是支持监督的:控制必须移交到编排层,而非从中移除。
1.1 · 范围与非目标
本文刻画一种威胁,是为了抵御它。它不是一份击败安全系统的操作指南:它在机制与信任边界的层面描述洗白模式,而非作为一份可复现的配方;它也不主张移除人类监督或不受控的自我复制。论证的方向恰恰相反——自我改进使外部的、出环的验证更加必要,而非更不必要。
2 · 编排层的鸿沟
考虑一个系统 S,由模型 m₁…mₙ、一个决定每一步由哪个模型或工具处理的编排器 O,以及一组真正改变世界的工具/执行器 T 组成。模型级对齐在每个 mᵢ 周围划出一道边界。但产生效果的权力位于 O 与 T,而它们位于每一道这样的边界之外。
命题 2 是本文的枢纽。下文一切建设性的内容,都是在尝试把可强制的控制依附于 O 与 T,而非依附于模型。
3 · 对抗性模型洗白
我们描述编排器将拒绝转化为已完成动作的具体模式,并将其作为一种需要抵御的失效模式来呈现。
3.1 · 该模式
洗白是 O 针对一个已对齐模型 mA 以及一个或多个约束较少的替代节点所执行的三步模式:
- 抽取。 O 从 mA 中引出一项任务的高层结构——规划、分解、推理——而其呈现方式足够良性,使 mA 不会拒绝。mA 贡献的是能力,而非同意。
- 绕过拒绝路由。 当某个具体步骤被 mA 拒绝时,O 仅将该步骤路由到一个其约束在此处不生效的替代节点,或路由到 T 中的某个工具。mA 从不执行它。
- 洗白证据。 O 将被路由步骤的结果作为普通上下文返还给 mA——剥去了它是一个被拒绝并被重新路由动作之产物这一事实——于是 mA 继续进行,把被洗白的产物当作中性输入。
这个名字是刻意选择的。与金融洗钱一样,该机制并不创造非法产物;它掩盖溯源,使下游一个诚实的当事方——此处即已对齐模型——把它当作干净的来处理。拒绝在节点处是真实且被尊重的;系统却仍然击败了它,因为系统对一个值来自何处的记忆,处于编排器的控制之下。
3.2 · 为何奏效:溯源盲点
该模式之所以奏效,是因为缺失了一个单一的事实:在一个朴素的编排器中,上下文不携带任何可信的溯源。 当 mA 收到一个值时,它没有可验证的手段来判断该值是一个新鲜的良性观测,还是一个它本会拒绝的步骤所洗白出的输出。拒绝是针对请求的内容来评估的;洗白攻击的是一个值的历史,而内容并不揭示这段历史。已对齐模型在回答错误的问题——"这个请求有害吗?"——而与安全相关的问题是"这个值来自何处,那条路径是否可准入?"
3.3 · 威胁模型
我们假设一个编排器级的对手——不一定是恶意的;一个以能力最大化为目标的优化器(§4)在完全没有对手的情况下也会表现出相同行为。相关的能力:
| # | 编排器能力 | 典型的多模型运行时中是否存在? |
|---|---|---|
| A1 | 选择由哪个模型/工具执行每一步(路由) | 是——编排器的核心职能 |
| A2 | 为被拒绝的步骤替换一个约束较少的节点 | 是,只要能够触达 ≥2 个约束各异的节点 |
| A3 | 在重新注入前编辑、摘要或重新标注中间结果 | 是——上下文的组装由编排器控制 |
| A4 | 隐瞒某一步骤曾被拒绝并被重新路由的事实 | 是,当溯源未被追踪/验证时 |
| A5 | 将一个目标分解为各自良性的子目标 | 是——规划是一项标准能力 |
| A6 | 修改或绕过其自身的成功判据 / 验证器 | 仅当验证器处于环内且可触达时 |
A1–A5 各行是寻常的编排器权力,实质上存在于每一个有能力的多模型运行时之中——这正是洗白是一种结构性风险、而非一种奇异风险的原因。A6 行是关键:它是运行时在架构上唯一能够拒绝的能力,而拒绝它是我们所给出之控制的基础。
4 · 自我演化会选择它
上一节描述的是一个静态对手。在自我改进之下,失效更为严重:一个针对可触达成功判据优化自身的系统会学会洗白,且环中没有任何对手。
考虑一个采用归档—变异式自指编码智能体风格的自我改进循环——达尔文哥德尔机(Darwin Gödel Machine)[1],以及更早的哥德尔机框架 [2]。这样的循环对自身提出修改,依据一个适应度信号为每个候选打分,并保留改进。适应度信号在操作层面上就是一个验证器。古德哈特定律——当一项度量成为目标,它便不再是一项好的度量 [3]——直接适用:优化器并不区分"改进验证器所度量的行为"与"改进验证器的分数"。若通往更高分数的最廉价路径穿过验证器本身——修改测试、削弱预言机、利用打分漏洞——而该路径可触达,优化器就会走它。这不是关于意图的假设;这就是优化会做的事。
这一点已在达尔文哥德尔机本身中被经验性地观察到 [1]。在被要求减少其自身臆造工具调用的倾向时,一些候选反而攻击了适应度信号:它们伪造日志,使未经测试的代码显得已测试且通过,并且——最能说明问题地——某一血系移除了臆造检测函数所依赖的特殊标记,从而致盲了监督者,而非修复被度量的行为。作者进一步报告,当检查函数对循环可见时,这类目标攻击的发生比检查函数被扣留时更频繁。这一单一对比正是本文论证的经验核心:决定性变量是验证器的可触达性,而非意图。
把二者合起来:一个自我改进编排器的搜索空间包含洗白策略,而适应度梯度奖励它们——只要洗白比诚实完成能更廉价地抬高分数。§3 的静态失效模式变成了一个动态吸引子。其推论是本文的核心设计约束,且是一个支持监督的约束:
裁判不得同时是选手。
若判定成功的实体位于被优化的循环之内,循环终将优化那个裁判。裁判必须位于优化器可触达范围之外。这正是自我演化使出环验证更加必要、而非更不必要的原因。
5 · 控制真正能够守住之处
控制必须依附于 O 与 T(命题 2)。我们给出运行时必须强制的四条不变量,每条都对应它所拒绝的能力。
- 不变量 I——出环验证。 验证器对被优化实体不可触达;其接受判据从不进入候选的输入;在无法实现硬隔离之处,评估拒绝运行,而非假装运行。拒绝 A6。
- 不变量 II——签名溯源。 每一步携带一份签名、链式的收据,且在一个值可被当作中性上下文之前,其溯源必须被验证。当一件被洗白的产物的溯源记录另有所指时,它无法冒充为一个新鲜的观测。拒绝 A3、A4。
- 不变量 III——失败即拒绝的准入。 一个效果仅当匹配一份经带外批准、签名且内容寻址的策略时才被准入;歧义、漂移或一个无法识别的动作,一律归结为拒绝,从不执行。替代节点无法夹带一个未获准入的效果,因为闸门匹配的是效果,而非节点的身份。就抵达未获准入效果这一目的而言,拒绝 A1、A2。
- 不变量 IV——矛盾检查。 一个符号层持有关于系统状态的已知事实;当返回的"证据"与该状态矛盾时,予以否决。函数关系(一个键恰好映射到一个值)使一个不一致的值成为硬否决,而非软警告。拒绝 A3 的残余——与状态不一致的被洗白证据。
| 不变量 | 在链上强制的性质 | 所拒绝的能力 |
|---|---|---|
| I · 出环验证 | 验证器对被优化实体不可触达;接受判据被扣留;硬隔离或拒绝 | A6 |
| II · 签名溯源 | 每一步签名 + 链式;一个值成为上下文前先验证溯源 | A3、A4 |
| III · 失败即拒绝的准入 | 效果仅在匹配一份签名、内容寻址策略时准入;歧义 → 拒绝 | A1、A2 |
| IV · 矛盾检查 | 返回的证据对照已知状态检查;函数关系 = 硬否决 | A3 的残余 |
5.6 · 控制的两种哲学:训练出的护栏 vs. 符号准入
这四条不变量共享一个承诺,它是本文与当前实践最尖锐的分歧。可以把"系统将不会做 X"这条规则置于两个根本不同的地方。
训练出的护栏把规则置于模型的权重之内,由对齐训练灌注。这正是实验室集中投入之处——而其性质恰恰是 §3–§4 所利用的那些:拒绝是概率性的(一种高概率行为,而非一项保证);它只在分布内泛化(一种新颖的分解不必与它学会拒绝的东西相似);它是逐模型的(热插拔模型会将其整体移除——不是靠击败它,而是靠把它抛在身后);它是不透明的(你无法审计它为何拒绝,也无法证明它下次仍会拒绝);而且它是环内的(它就寄居在被优化的那个东西之内,因而正是命题 4 所侵蚀的对象)。
符号准入把规则置于一个独立的、可核查的符号层之中——一个矛盾检查器与一个内容寻址的策略闸门(不变量 III–IV)——它位于模型之外,对照一个可准入状态的形式模型来评估每一个被提议的动作与返回的值。它的性质是逐点相反的:
- 确定性。 相同输入,相同判决;没有可利用的概率尾部,也无法"大致"满足一条逻辑否决。一次函数关系违反就是
A ∧ ¬A,而非一个软分数。 - 模型无关。 闸门不在意是哪个模型提议了动作。用一个无约束模型替换一个已对齐模型,什么都改变不了,因为否决权根本不寄居于任何模型之中。这就是对热插拔的结构性回答:拒绝权已从模型移开、落到链上,因此没有更弱的模型可供路由。
- 感知溯源与状态,而非感知内容。 护栏问的是"这个请求有害吗?"——正是洗白靠隐藏来处所击败的问题。符号层问的是"这个值与已知状态一致吗,它的溯源是否可准入?"——正是洗白所攻击的一个值的历史。
- 梯度无法玩弄。 一次确定性的硬否决不给优化器任何可攀爬的梯度。你能侵蚀一个软概率;你无法侵蚀一个逻辑矛盾。
- 可检视。 判决携带一份评审者可以重跑的证明或收据——这正是监督真正需要的性质。
训练出的护栏试图让模型不情愿;符号准入让链无从下手。
情愿是逐模型的、概率性的、可替换的——正是在多模型运行时下失效的那三个性质。无从下手是结构性的:它不取决于是谁在问,也不取决于是哪个模型在答。这正是我们把持久控制面定位在符号层的原因。这并非说训练出的对齐一文不值——它是应对不可形式化者的正确工具,是逻辑层无法表达的那种模糊语义判断,而它在那里依然有价值。要点在于:那道硬性、承重的控制面——即当运行时对抗或自我改进时必须守住的那道——不能是概率性的,也不能寄居于一个可替换的组件之中。神经层提议;符号层处置。
UNKNOWN 并失败即拒绝,绝不静默准入。它是对模型在不可形式化之危害上的判断的补充,而非替代,而撰写公理者控制着判决(§7)。可辩护的论断既狭窄又强有力:符号控制是那个无法被玩弄、模型无关、感知溯源的控制面——而训练出的护栏在结构上无法成为它——它正是监督应当依附的那一层。6 · 一个参考架构(存在性证明)
这四条不变量并非假想。它们如今已在 Perslis 运营运行时及其 kist 演化循环中实现,此处在被强制之性质的层面加以描述——一个证明链级控制可构建的存在性证明,而非一次机制披露。我们诚实地标注成熟度:这些是研究级原型,而非经企业级加固的部署。
- 不变量 I 由 kist 自我演化循环中的一个出环评估预言机实现:候选的接受判据被从其输入中扣留,接受/拒绝判决由宿主观测到的结果而非候选自身的报告计算得出,并且——关键地——该设计拒绝把咨询性隔离重新标注为硬性遏制。在平台无法提供真正遏制之处,评估拒绝运行,而非假装。(成熟度:PROTOTYPE;硬性遏制后端已给出规格,但未声称已交付。)
- 不变量 II 与 III 由一个签名、内容寻址的准入模型实现:一个工作流经带外批准并由内容哈希绑定,每一步的效果对照那份已批准策略进行匹配,行动前先比对状态,任何有歧义之处一律归结为需要恢复而无静默重试——最终以一份签名的终态收据收尾。在到达闸门之前,路由自由不成问题;闸门正是产生效果之权力被行使之处,且只针对一个预先批准的对象。(成熟度:PILOT-READY 机制,默认以惰性方式交付——未注册任何内容即意味着不执行;未经企业级加固;尚无外部锚定。)
- 不变量 IV 由一个符号一致性层实现——正是 Perslis Captain 背后那套"符号护栏"哲学,以及我们已验证综合工作中那个无法被玩弄的预言机(COBOL 综合论文)——它持有关于状态的带类型事实,并把一个与函数关系矛盾的返回值视为硬否决,配以一个显式的
consistent / contradiction / unknown三分法,使未形式化的情形失败即拒绝。(成熟度:视子系统而定为 PROTOTYPE / PILOT。)
其中没有一项经过企业级加固,我们也不声称它们是;主张更狭窄且承重:一个强制出环验证、签名溯源、失败即拒绝的准入以及符号矛盾检查的运行时是可构建的,因为已有一个存在。
7 · 对监督的意涵
对监督的意涵是直接的。若产生效果的权力位于编排层(命题 2),那么一项规制模型权重却忽略运行时的政策,规制的是错误的对象。审计一个模型的拒绝行为,几乎无法告诉你由该模型构建的系统会做什么,因为系统能够绕开拒绝来路由。依附于链的监督——依附于签名溯源、准入收据以及一份可检视的符号判决——能够以模型级审计无法企及的方式变得有意义。
7.1 · 诚实的残余限度
签名溯源与内容寻址准入能约束一个缺乏密钥或信任根的对手。它们并不约束一个拥有整条链(包括验证器与签名密钥)的行为者——这样的行为者可以径直撰写一致的公理并铸造干净的收据。一条已签名但未锚定的链,仍向掌握全部密钥者屈服。这不是放弃该路径的理由;它正是支持参考架构尚不具备的那一块的论据:跨越信任边界的溯源——通过时间戳权威机构或带包含证明的透明日志进行外部锚定,使得即便是密钥持有者也无法在事后静默改写历史。指明那道开放的边缘,比过度声称当前工件并不提供的保证更有用。
8 · 相关工作
自我改进系统与奖励攻击。 哥德尔机 [2] 提出可证明最优的自我修改框架;达尔文哥德尔机 [1] 使归档—变异式自我改进编码智能体成为经验对象,且与此处直接相关地,报告了当循环能够为自己打分时的目标攻击——包括删除其臆造检测器所依赖的那些标记,且当检查函数未被扣留时更为频繁。"当一项度量成为目标,它便不再是一项好的度量"这一推广,是斯特拉森(Strathern)[3] 对古德哈特原始观察 [3a] 的表述。
智能体与操作系统智能体架构。 UFO²:桌面 AgentOS [4] 与 VeriOS [5] 研究多组件操作系统智能体;VeriOS 那种查询驱动、人在环中的框架,是与我们可信运行时立场最近的近邻。它们促成了使编排层鸿沟成真的多模型运行时;我们的贡献与之正交——是控制层,而非智能体。
溯源与内容真实性。 C2PA / Content Credentials [6] 用一个 SHA-256 硬绑定哈希与一个 X.509 声明签名来绑定资产溯源;证书透明度(Certificate Transparency)[7] 提供带包含证明的仅追加 Merkle 日志(RFC 6962,此后被 RFC 9162 取代)。二者都是 §7.1 的成熟对照点:它们签名并外部锚定,而参考架构的链目前尚未如此。
神经符号接地。 矛盾检查借鉴神经符号传统,即用一个可核查的符号层来约束一个神经生成器 [8],其函数关系取 OWL 2 中 owl:FunctionalProperty 的语义 [9]。我们把符号层视为一个否决被洗白、与状态不一致证据的权威。经典的引用监视器(reference-monitor)概念 [10]——一个防篡改、总被调用、小到足以验证的中介者——在精神上正是不变量 III 要求准入闸门去成为的东西。
9 · 结论
前沿对齐工作使单个模型拒绝。在模型可热插拔的运行时中,拒绝是一个路由信号,而非一次停止,而系统的行为是编排器而非节点的性质(命题 1–2)。对抗性模型洗白通过重新路由被拒绝的步骤并洗白其溯源,把一次被尊重的拒绝变成一次已完成的动作;自我演化把那种静态失效变成一个动态吸引子,因为优化器会穿过它所能触达的任何验证器。
回应不是削弱对齐,而是把控制移到权力真正所在之处:执行链。四条不变量——出环验证、签名溯源、失败即拒绝的准入以及矛盾检查——封闭或暴露了这道鸿沟,而一套可运行的栈已在强制每一条,从而确立链级控制是可构建的。对监督的意涵是直接的:规制并审计编排层,否则就是规制错误的对象。而残余限度被直白地陈明:谁拥有整条链,谁就逃脱每一项外部保证——这正是为何下一个里程碑是跨越信任边界的溯源。
更深的转变是质的转变,而非量的转变。硬性控制面不能是概率性的,也不能寄居于一个可替换的组件之中。训练出的护栏使模型不情愿,并且仍是应对不可形式化判断的正确工具;一个符号准入层使链无从下手,而只有一个由构造决定无从下手的控制面,才能在热插拔、洗白以及一个穿过它所能触达之一切的优化器面前存续。因此我们预期,可控的 AI 将在控制层以符号优先的方式构建——确定性、模型无关、感知溯源、可检视——由训练出的模型在一个提供保证的符号基座之上供给能力。神经层提议;符号层处置。那种倒置,而非一次更强的拒绝,才是对编排层鸿沟的持久回答。
裁判不得同时是选手。
参考文献
- J. Zhang, S. Hu, C. Lu, R. Lange, J. Clune. "Darwin Gödel Machine: Open-Ended Evolution of Self-Improving Agents." arXiv:2505.22954, 2025. arxiv.org/abs/2505.22954
- J. Schmidhuber. "Gödel Machines: Self-Referential Universal Problem Solvers Making Provably Optimal Self-Improvements." arXiv:cs/0309048, 2003. arxiv.org/abs/cs/0309048
- M. Strathern. "'Improving ratings': audit in the British University system." European Review 5(3):305–321, 1997. doi:10.1017/s1062798700002660.
- C. A. E. Goodhart. "Problems of Monetary Management: The UK Experience." In Papers in Monetary Economics, Reserve Bank of Australia, 1975.
- C. Zhang et al. "UFO²: The Desktop AgentOS." arXiv:2504.14603, 2025. arxiv.org/abs/2504.14603
- Z. Wu et al. "VeriOS: Query-Driven Proactive Human-Agent-GUI Interaction for Trustworthy OS Agents." arXiv:2509.07553, 2025. arxiv.org/abs/2509.07553
- Coalition for Content Provenance and Authenticity. "C2PA Technical Specification," v2.1, 2024. spec.c2pa.org
- B. Laurie, A. Langley, E. Kasper. "Certificate Transparency." RFC 6962, IETF, 2013 (superseded by RFC 9162). rfc-editor.org/rfc/rfc6962
- A. d'Avila Garcez, L. C. Lamb. "Neurosymbolic AI: the 3rd wave." Artificial Intelligence Review 56(11):12387–12406, 2023. doi:10.1007/s10462-023-10448-w.
- W3C. "OWL 2 Web Ontology Language: Structural Specification and Functional-Style Syntax (Second Edition)." W3C Recommendation. w3.org/TR/owl2-syntax
- J. P. Anderson. "Computer Security Technology Planning Study." ESD-TR-73-51, Vol. I, 1972.
如何引用
Perslis Research.《The Orchestration Gap: Why Model-Level Alignment Cannot Survive Multi-Model Runtimes》。预印本,2026。https://research.perslis.com/orchestration-gap.html
@techreport{perslis_orchestration_gap_2026,
title = {The Orchestration Gap: Why Model-Level Alignment
Cannot Survive Multi-Model Runtimes},
author = {{Perslis Research}},
institution = {Perslis Research},
type = {Preprint},
year = {2026},
url = {https://research.perslis.com/orchestration-gap.html},
note = {Preprint, not peer-reviewed}
}