AI 系统 · 预印本 · 预注册、对抗性 · Track 2

不可恢复性边界:学习式推断无法恢复确定性计算无法触及之处

学习式推断的席位唯一可能存在的地方——高潜在复杂度,即有界阶数的确定性计算在结构上不足之处——恰恰正是精确推断本身变得难解(不可行)之处,因此学习器唯一可行的选项也继承了同一堵墙。我们试图在每个潜在维度的 40 个留出世界上证伪确定性充分性,却未能做到。

↓ 冻结结论汇总 已抹除护城河 · 每张图都可追溯到一个冻结的结果工件 · 预注册 sha256 b51ee352… · 学习器附录 sha256 94cb2eaa…
结果 A — H0 成立 0 席位 / 160 个 world×L 单元 每个 L 有 40 个留出世界 交互式图表
摘要

本研究计划的 Track 1(推断置放)确立了:在精确确定性计算仍然可行的领域中,学习式推断的"席位"是可达的,但并未被稳健地赢得——这留下了一个未解的问题:在精确确定性计算变得难解(不可行)、确定性一方被迫近似的区域中会发生什么,而这正是学习优势可能"无法靠更多计算恢复"的唯一区域。本文正是进入这一区域。在一个序贯贝叶斯故障诊断领域(噪声或(noisy-OR)生成器,\(K=12\) 个故障,\(M=20\) 个诊断项)中,我们操纵潜在维度 \(L \in \{4, 8, 16, 24\}\),使得潜在配置数 \(2^L\) 跨越 \(16\) 到 \(16{,}777{,}216\),且精确确定性通道在 \(L \geq 16\) 时变得不可行。我们首先构建并验证了一个确定性阶梯(阶数阶梯)(边缘分布、Chow–Liu 树、有界树宽的联合树,以及精确/理想上界(oracle)锚点)——验证到机器精度,与暴力枚举对比,并与 Track 1 逐字节一致——然后,也只有在此之后,才构建一个多项式时间的变分噪声或(noisy-OR)学习器,其可行性之墙与精确确定性之墙重合。面对一个从 Track 1 逐字节继承的冻结、不可调部署门槛(\(\geq 15\%\) 损失下降、成对自助法置信区间下界 \(>0\)、准确率不更差),学习器在 160 个 world×L 单元中的零个里赢得席位。在低复杂度下,即便是理想上界(oracle)相对于可行上限的余量也低于部署阈值;在高复杂度下,确定性上限在结构上崩塌到朴素下界(16 倍数据也无法挽救它),学习器随之一同下落。学习器相对于朴素下界的中位数优势随潜在复杂度衰减——这就是反相变,与所期望的相变恰恰相反。难解性之墙对称地击败了确定性推断与学习式推断。本文的贡献是对(潜在复杂度 × 确定性阶数 × 学习式推断)空间的一张可测量、可证伪的地图,而非"学习无用"的普遍论断。

0 / 160赢得席位的 world×L 单元
40每个 L 的留出世界数
16×数据——崩塌依然存在
+5.7% → −0.2%中位数优势衰减(L=4→24)

1 · 引言

大多数面对推断问题的 AI 系统,都是通过拟合一个灵活的模型、并寄望于拟合能转化为决策优势来回答它。另一种姿态——本研究计划所捍卫的姿态——是让最强的可行确定性计算拥有决策权,并且只有当一个学习式组件能够对着一个冻结的门槛被证明确实赢得了其权威时,才准许它加入。这是失败导向的科学:我们的任务是杀死机器学习假设,而不是帮它取胜。我们所捍卫的零假设 \(H_0\) 是:确定性计算是充分的。我们试图证伪它,却未能做到。

这是本研究计划中的第六次击杀,也是那次映射出整个边界、而非仅仅得一分的击杀。其前身《推断置放》(Track 1)表明,在精确确定性计算始终可行的区域(\(L=4\)),学习式推断的席位是"可达但未被稳健赢得的"。那个结果留下了一处精确的、承重的空缺。如果一个学习模型真要持有不可恢复的权威——一种任何额外的确定性计算都无法夺回的权威——那它只能存在于确定性计算本身耗尽空间之处:即确定性一方本想采用的精确计算变得难解、从而它被迫近似之处。Track 2 有意进入这一区域,方法是把潜在维度 \(L\) 推高,直到精确通道不可行,并追问一个可行的学习式潜在模型能否恢复有界阶数的确定性计算已无法触及的东西。

学习席位唯一可能存在的地方,恰恰正是推断本身变得难解之处——而学习器唯一可行的选项,即近似推断,继承了同一堵墙。确定性计算不再充分之处,可行的学习式推断也不再充分。

本文的科学对象不是一张记分牌。它是对一个三轴空间——潜在复杂度、确定性阶数、学习式推断——在一个诚实的合成领域中的可测量地图,其中部署门槛、种子和成功判据在任何竞争者存在之前就全部被冻结并哈希。我们的贡献是:(1) 一个经过完整验证的确定性阶梯(阶数阶梯),在任何学习器被构建之前就确立了最强的可行确定性标杆及其在难解性下的崩塌;(2) 一项数据规模分析,表明该崩塌是结构性的,而非样本匮乏;(3) 一个多项式时间的变分学习器,其可行性之墙与精确确定性之墙重合,并在可行边界上用对学习器自身参数的精确推断做了稳健性检验;(4) 一次跨世界复现,覆盖每个 \(L\) 的 40 个留出世界,得出反相变以及一个被实时捕获的假阳性席位,并以结果 A 收尾——\(H_0\) 成立,零赢得席位。

2 · 方法 — 阶梯与冻结门槛

2.1 领域与生成器

该领域是序贯贝叶斯故障诊断,具有 \(K=12\) 个故障和 \(M=20\) 个诊断项,每个诊断项带有 \(\{1,2,3\}\) 中的测试成本。被操纵的轴是潜在维度 \(L\),给出 \(2^L\) 个潜在配置。生成器是噪声或(noisy-OR):每个诊断项触发的概率等于 1 减去各个成因的"不触发"(泄漏)项之积,

\[ P(d_j = 1 \mid \mathbf{z}) \;=\; 1 - (1-\ell_j)\prod_{i} (1 - \theta_{ji})^{z_i}, \]

其中一个共享潜在耦合强度 \(\rho\) 控制着制造出多少虚假结构。对照设置 \(\rho=0.0\) 不注入任何被制造的结构,因此高阶模型在那里不得胜过 order-1;工作点为 \(\rho=0.8\)。除非另有说明,下文每个数字都是 \(\rho=0.8\) 处的留出运营损失。

2.2 诊断博弈

每个通道——每一确定性阶级和学习器——都接入同一个逐字节一致的决策博弈。该博弈维护一个关于故障的贝叶斯信念,按最大期望信息增益(EIG)选择下一个测试,并在最大后验信念达到 \(0.90\) 或测试用尽时停止。运营损失为

\[ L_{\mathrm{op}} \;=\; \text{diagnostic\_cost} \;+\; \lambda \cdot \mathbf{1}[\text{misdiagnosis}], \qquad \lambda = 50, \]

即从 Track 1 继承的"结清价格"。由于推断路径在各通道之间完全相同,\(L_{\mathrm{op}}\) 上的差异可完全归因于信念模型本身。

2.3 冻结的部署门槛

门槛(冻结、不可调)。 一个竞争者当且仅当以下合取全部成立时,才对着某基线通过部署门槛:(i) 损失下降 \(\geq 15\%\),(ii) 成对 \(90\%\) 自助法置信区间(1000 次成对重采样)的下界 \(>0\),以及 (iii) 挑战者的准确率在 \(10^{-9}\) 以内不差于基线。\(15\%\) 阈值、成对自助法置信区间规则以及准确率不更差规则均从 Track 1 逐字节继承,在本研究中不可调。

2.4 预注册与种子

预注册——门槛、种子、阶梯(阶数阶梯)规范以及席位判据——在任何竞争者被构建之前就被冻结、sha256 哈希并打上 git 标签(预注册 sha256 b51ee352…)。在预注册时尚不存在的变分学习器,在一份附录中被声明,而该附录本身在学习器被实现之前就被冻结并哈希(学习器附录 sha256 94cb2eaa…)。主种子为 SEED=20260921,确定性地扩展为训练(×7)、测试(×13)、学习器(+999)和跨世界(×2003)数据流。留出测试集为每个世界 200 个事件,与训练不相交;冻结的主训练规模为 \(n_{\text{train}}=1500\)。

2.5 确定性阶梯(阶数阶梯)

最强的可行确定性竞争者是一组闭式模型的阶梯——不含潜在 EM——置于一个统一的 (belief, predict) 接口之后:

阶级模型可行性
order-1拉普拉斯平滑的边缘分布(朴素贝叶斯)对 \(\forall L\) 可行
order-2Chow–Liu / 树增强模型——每个故障的最大互信息生成树,精确树上的 sum-product对 \(\forall L\) 可行
order-3有界树宽的联合树(宽度 \(\leq 2\)),精确变量消元对 \(\forall L\) 可行
exact / oracle\(2^L\) 枚举不可行的锚点;仅对 \(L \leq 12\) 报告

DETERMINISTIC_CEILING 是按留出运营损失衡量的最佳可行阶级;这就是学习器必须以 \(\geq 15\%\) 击败才能赢得席位的标杆。该阶梯在任何学习器存在之前就被验证到机器精度:在 \(L=4\) 处该世界与冻结的 Track 1 逐字节一致;order-2 树上信念传播等于暴力枚举;order-3 变量消元等于暴力枚举;且通用博弈逐条轨迹地复现了 Track-1 的各通道。途中我们捕获并修复了一处 Prim 最小生成树的自环初始化,它本会使 order-2 显得人为地弱——这个 bug 偏向学习一侧,因此修复它是消除了对 ML 的一个虚假优势,而非消除对下界的虚假优势。

2.6 学习器

冻结的 006H2 学习器在训练与推断中都枚举全部 \(2^L\) 个潜在配置,因此对 \(L\) 呈指数级,在 \(L \geq 16\) 时不可行——与精确确定性推断同一堵墙。因此预注册前提"确定性精确不可行时学习器可行"对该学习器并不成立。附录预注册的解决方案是一个多项式时间的变分(平均场)噪声或(noisy-OR)学习器,属于同一个与生成器匹配的族,用平均场后验取代精确的 \(2^L\) 枚举。它在运行前被验证:平均场在所报告的偏差内与精确 \(2^L\) 一致(\(\log Z \approx +0.2\) nats,在各故障上近似均匀,因而在信念 softmax 中抵消;最坏情况预测差距 \(<0.35\));GEM 梯度与有限差分匹配到 \(10^{-8}\);且它从不虚假地击败对其自身模型的精确推断(gate-3,在 \(L=4\) 处检验)。超参数在运行前被冻结(mf_sweeps 10、restarts 8、short_iters 25、polish_iters 150、gem_steps 12、lr 0.6、pz_floor 0.05),且重启选择仅使用训练边缘对数似然。

2.7 席位判据(不可恢复性)

席位判据。 学习器当且仅当以下四个合取项全部成立时,才在某个 \(L\) 处赢得席位:(1) 它对着最佳可行阶级通过门槛;(2) 不可恢复性——它对着每一个直到最强可行阶级的阶级都通过,而不仅仅是某个弱阶级;(3) 可复现性——它在一个 40 个全新世界、种子不相交的族中,在 \(\geq 90\%\) 的世界里通过;以及 (4) 它在整个 \(L \times\) 阶级网格上、以族内错误率 \(\alpha=0.05\) 通过 Holm–Bonferroni。

3 · 确定性上限(图 1)

图 1 — 交互式。 阶梯(阶数阶梯)曲线:各确定性阶级及理想上界(oracle)锚点的留出运营损失相对潜在维度 \(L\) 的关系。越低越好;带环的标记是每个 \(L\) 处的可行上限;理想上界(oracle)仅在 \(L \leq 12\) 处报告。切换 \(\rho\) 可查看对照(\(\rho=0.0\),无被制造的结构)与工作点(\(\rho=0.8\));点击图例小块可隐藏某一系列;将鼠标悬停在任一点上可查看其精确损失。

在此,在引入任何学习器之前,确立了两个决定性的事实。表 1 给出数字。

\(L\)\(2^L\)order-1order-2order-3oracle上限 vs order-1理想上界余量
41633.6232.6530.59 †27.075+9.01%+11.49%
825653.7449.91 †51.8746.40+7.13%+7.03%
1665,53666.755 †68.4369.60不可行0.0%—
2416,777,21677.7375.81 †77.27不可行+2.47% (n.s.)—

表 1。 按阶级的留出运营损失(\(\rho=0.8\))。† 标记每个 \(L\) 处的可行上限。"上限 vs order-1"是上限相对朴素下界的下降;"理想上界余量"是理想上界(oracle)相对可行上限的下降。\(L=4\) 和 \(L=8\) 的上限-vs-order-1 差距的自助法置信区间下界 \(>0\);\(L=24\) 的差距不显著(CI \(\approx 0\))。

事实 (a) — 可解区域已经饱和。 在 \(L=4\) 和 \(L=8\) 处,\(2^L\) 小到理想上界(oracle)可计算,此时理想上界(oracle)——对任何模型(无论是否学习式)的上界——仅以 \(+11.49\%\) 和 \(+7.03\%\) 分别击败可行确定性上限。两者都低于 \(15\%\) 部署阈值。哪怕拟合再好的模型,也无法在连理想上界(oracle)的余量都不能通过门槛之处赢得席位。

事实 (b) — 难解区域使上限崩塌。 在 \(L=16\) 和 \(L=24\) 处,理想上界(oracle)不可计算,此时高阶阶级过拟合并落到 order-1 之下:在 \(L=16\) 处可行上限就是 order-1(order-2 和 order-3 更差),使得上限-vs-order-1 恰为 \(0.0\%\);在 \(L=24\) 处 order-2 恢复了统计上不显著的 \(+2.47\%\)。确定性上限恰恰在精确计算变得难解之处崩塌到朴素下界。\(\rho=0.0\) 对照在各处都成立——在没有被制造的结构时,高阶从不击败 order-1——这证实了阶梯在低 \(L\) 处的优势是真实结构,而非高阶机制的假象。

4 · 数据规模:崩塌是结构性的(图 2)

图 2 — 交互式。 上限-vs-order-1 下降(%)作为训练规模 \(N\)(对数轴)的函数,在 \(L=16\) 和 \(L=24\) 处。阴影带是低于门槛的区域;每个点都靠近 \(0\),且成对 \(90\%\) 自助法置信区间在每个 \(N\) 处都包含 \(0\)。悬停某点可查看其数值。

批评者对事实 (b) 的自然攻击是:某个更高维的估计器被饿了数据。我们直接回应它,方法是在两个难解维度处扫描训练规模 \(N \in \{1500, 3000, 6000, 12000, 24000\}\)。

\(L\)N=1500N=3000N=6000N=12000N=24000
16+0.0%+0.0%+0.06%+0.73%+1.80%
24+2.47%+1.67%+0.75%+0.0%+1.60%

表 2。 跨训练规模的上限-vs-order-1 下降(%)。在每个 \(N\) 处,成对 \(90\%\) 自助法置信区间都跨越 \(0\),因此没有任何下降是显著的。

十六倍的数据并不能挽救有界阶数的确定性模型:上限-vs-order-1 的差距在每个 \(N\) 处,对 \(L=16\) 和 \(L=24\) 都在统计上与零无法区分。事实 (b) 中的崩塌是结构性的——是有界阶数模型在高潜在复杂度下所能表示之物的一个属性——而非估计器被喂养不足的症状。这在样本匮乏这一反对意见被抛向学习器之前就将其关闭。

5 · 学习式竞争者赢不到席位(图 3)

图 3 — 交互式。 设计世界的变分学习器。在决策优势模式下:学习器留出运营损失相对每个确定性阶级的下降(%),按 \(L\) 排列;高于零的柱有利于学习器,虚线是 \(+15\%\) 席位阈值——从未达到。切换到模型拟合可见同一学习器在每个 \(L\) 处都是严格更好的概率模型(更高的观测数据对数似然)。悬停任一柱可查看精确数值。

\(L\)学习器损失准确率vs order-1vs order-2vs order-3席位拟合有效
430.210.800+10.14%+7.47%+1.24%否是
850.590.650+5.86%−1.36%+2.47%否是
1667.6450.335−1.33%+1.15%+2.81%否是
2479.1350.195−1.81%−4.39%−2.41%否是

表 3。 设计世界中学习器相对每个阶级的对比。学习器在任何 \(L\) 处对任何阶级都从未达到 \(+15\%\);在 \(L \geq 16\) 时它落到朴素下界(order-1)本身之下。

学习器在任何地方都赢不到席位。它对任何阶级的最佳边际是 \(+10.14\%\)(在 \(L=4\) 处相对 order-1),仍不足以通过门槛;相对可行上限,它的边际更小,而在 \(L \geq 16\) 时它比朴素下界更差。

关键在于,fit_valid 在各处都为 True:学习器在每个 \(L\) 处都是比 order-1 严格更好的观测概率模型,具有更高的观测数据对数似然——在 \(L=4\) 处为 \(-10.51\) 对 \(-11.84\),在 \(L=8\) 处为 \(-10.59\) 对 \(-11.65\),在 \(L=16\) 处为 \(-9.34\) 对 \(-9.97\),在 \(L=24\) 处为 \(-6.91\) 对 \(-7.28\)。更好的拟合根本没有转化为可部署的诊断优势。这是本文最锐利的单一发现:学习器赢得了建模目标,却输掉了决策目标,而在高 \(L\) 时它彻底输给了朴素下界。

稳健性 — 并非平均场假象。 在 \(L=4\) 和 \(L=8\) 处,\(2^L\) 可行,我们用对其自身参数的精确 \(2^L\) 推断重新运行了已拟合的学习器。在 \(L=4\) 处,精确推断给出损失 \(29.75\)(相对 order-1 为 \(+11.5\%\)),仍 \(<15\%\)。在 \(L=8\) 处,精确推断给出 \(49.29\)(相对 order-1 为 \(+8.3\%\),相对 order-2 上限为 \(+1.3\%\)),仍 \(<15\%\)。两种情况下精确推断都优于平均场——证实了 gate-3,即近似从不虚假取胜——然而精确推断仍未通过门槛。因此,在可解边界处的失败是真正的信号不可及,而非近似误差。

6 · 跨世界复现:反相变(图 4)

图 4 — 交互式。 覆盖每个 \(L\) 的 40 个留出世界:每个点是某一世界学习器相对朴素下界(order-1)的优势;黑条是中位数;虚线趋势线连接各中位数。高于 \(+15\%\) 线的点通过了必要的 vs-order-1 筛选(仅有 world 37,在 \(L=4\) 处,且它未能通过完整的上限检验)。悬停任一点可查看其世界与数值。

对着最佳可行阶级通过门槛,必然要求对着 order-1 通过,因为 order-1 是上限必须支配的阶级之一。因此我们按 \(L\) 报告:在 40 个全新留出世界中,学习器通过这一必要 vs-order-1 筛选的比例——比例为 \(0\) 就已经排除了可复现的席位——连同学习器相对 order-1 的中位数与最大优势。

\(L\)通过 vs order-1中位数优势最大优势可复现席位
41 / 40 (2.5%)+5.74%+15.84%否
80 / 40+4.85%+13.62%否
160 / 40+1.52%+6.94%否
240 / 40−0.17%+3.64%否

表 4。 覆盖每个 \(L\) 的 40 个留出世界的跨世界复现。学习器相对朴素下界的中位数优势随潜在复杂度单调衰减,并在 \(L=24\) 处跌破零。

反相变。 学习器相对朴素下界的中位数优势随潜在复杂度衰减:从 \(L=4\) 到 \(L=24\) 为 \(+5.74\% \rightarrow +4.85\% \rightarrow +1.52\% \rightarrow -0.17\%\)。这与实验所追寻的相变恰恰相反。我们进入 Track 2 时的假设是,上升的复杂度或许会为学习打开一扇门——即确定性计算耗尽空间的区域。相反,上升的复杂度关上了那扇门:那条打破确定性上限的轴,同步地打破了学习器。

world-37 的故事——阶梯在实时数据上捕获的一个假阳性。 恰有一个世界,即 \(L=4\) 处的 world 37,触发了必要的 vs-order-1 筛选,达到 \(+15.84\%\)(学习器 \(31.94\) 对 order-1 \(37.95\))。但它的完整阶级检验表明它并未通过上限:相对 order-3,学习器为 \(31.94\) 对 \(31.82\),边际为 \(-0.36\%\)。world 37 只是恰好有一个偏弱的朴素下界——其 order-1 损失 \(37.9\) 远高于典型的 \(\sim\!33\)——而 order-3 在那里仍击败了学习器。若竞争者仅为 order-1,这本会被记为一个假阳性席位;阶梯(阶数阶梯)在实时数据上捕获了弱基线的失败模式,与设计意图完全一致。在全部 160 个 world×L 单元中,学习器对着最佳可行阶级通过 \(15\%\) 门槛的单元数为零。

7 · 席位判据以及为何无一满足

我们现在可以直接对照证据检验 §2.7 的四合取席位判据,并看到它在每个单元里都在第一个合取项处就失败。

  1. 对着最佳可行阶级通过。 在各处失败。在设计世界(表 3)中,学习器对任何阶级都从未达到 \(+15\%\);跨每个 \(L\) 的 40 个世界(表 4),它甚至只在 \(160\) 个单元中的 \(1\) 个里通过了必要的 vs-order-1 筛选,而那唯一的单元(world 37)未能通过上限检验。160 个单元中,对着最佳可行阶级通过门槛的为零。
  2. 不可恢复性(对着每一个直到最强可行阶级的阶级都通过)。 鉴于合取 1,此项无从谈起,且独立地被 world 37 反驳,其 vs-order-3 边际为 \(-0.36\%\)。
  3. 可复现性(40 个世界的 \(\geq 90\%\))。 任何必要筛选中观测到的最佳通过率为 \(2.5\%\)(\(L=4\)),比 \(90\%\) 标杆低两个数量级。
  4. 在 \(L \times\) 阶级网格上、以 \(\alpha=0.05\) 的 Holm–Bonferroni。 由于没有单元通过合取 1–3,没有任何阳性结果进入多重检验阶段;族内校正只会加强这一否定结论。

席位判据在任何 \(L\) 处都未被满足。判决为结果 A:\(H_0\)——确定性充分性——成立,且无法被杀死,覆盖每个 \(L\) 的 40 个留出世界,在 160 个 world×L 单元中零赢得席位。

8 · 地图

该结果不是"下界击败 ML"。它是对(潜在复杂度 × 确定性阶数 × 学习式推断)空间在一个诚实领域中的可测量地图,其中有两个区域以及它们之间的一堵墙。

那个承重的观察把两个区域联系在一起。学习席位唯一可能存在的地方,恰恰正是推断本身变得难解之处——高潜在复杂度。但难解性并不是有选择的。贝叶斯网络的精确推断在一般情况下是 NP 难的(Cooper, 1990),而且——关键在于——即便是把贝叶斯信念网络中的概率推断近似到某个固定因子以内,也是 NP 难的(Dagum & Luby, 1993)。学习器在难解区域中唯一可行的选项是近似推断,而近似推断继承了同一堵墙。这就是为何这堵墙是对称的:并非确定性一方恰好在这里弱、学习一方也恰好弱,而是两方都在试图做同一件难解的事,而难解性把它们一同击败。在这个领域中,实验所追寻的计算-到-推断的转变并没有打开一扇可行的门。

难解性之墙对称地击败了确定性推断与学习式推断。确定性计算不再充分之处,可行的学习式推断也不再充分。

9 · 局限与范围

这是单一的合成领域——噪声或(noisy-OR)序贯故障诊断——且刻意采用小的池:每个 \(L\) 有 40 个世界,每个世界 200 个测试事件,冻结的主训练规模为 \(n_{\text{train}}=1500\)(以 §4 的数据规模扫描作为对样本匮乏的反驳,而非大样本效力的主张)。潜在维度被 \(2^L\) 理想上界(oracle)和精确锚点封顶在 \(L=24\)。因此该论断被界定在这个生成族和这个运营目标之内;它是一张可证伪的地图,而非"学习式推断无用"的普遍陈述。特别地,对称墙论证依赖于难解性是被共享的——一个被工程化到没有任何有界阶数确定性模型与数据一致、同时仍有可行学习式推断可用的领域,恰恰是预先声明的下一个边界。与本研究计划的姿态一致,结果 A 所指定的行动是去寻找那下一个边界,而不是发明另一个学习器来强行在这个边界里取胜。最后,本页面已抹除护城河:生产用下界的机制被保留;所披露的是这个合成基准、其冻结门槛及其结果。

10 · 结论

我们着手在唯一可能让学习席位不可恢复的区域——高潜在复杂度,即精确确定性计算变得难解之处——杀死确定性充分性,却未能做到。我们首先构建并验证了一个确定性阶梯(阶数阶梯),它确立了最强的可行标杆,并展示它在难解性下的结构性崩塌;我们展示了该崩塌在 \(16\times\) 数据下依然存在;我们构建了一个多项式时间的变分学习器,其可行性之墙与精确确定性之墙重合,并在可解边界处用对其自身参数的精确推断证实,它的失败是信号不可及而非近似误差;我们还在每个 \(L\) 的 40 个留出世界上进行复现,观测到反相变并实时捕获了一个假阳性席位。面对一个在任何竞争者存在之前就被冻结并哈希的门槛,学习器在 160 个 world×L 单元中的零个里赢得席位。本文的贡献是一张可测量、可证伪的地图,标出每种机制在何处赢得权威——以及学习式推断最终会在哪些精确的、预先声明的条件下赢得权威。

References

  1. Chow, C. K., & Liu, C. N. (1968). Approximating discrete probability distributions with dependence trees. IEEE Transactions on Information Theory, 14(3), 462–467.
  2. Shwe, M. A., Middleton, B., Heckerman, D. E., Henrion, M., Horvitz, E. J., Lehmann, H. P., & Cooper, G. F. (1991). Probabilistic diagnosis using a reformulation of the INTERNIST-1/QMR knowledge base. I. The probabilistic model and inference algorithms. Methods of Information in Medicine, 30(4), 241–255.
  3. Cooper, G. F. (1990). The computational complexity of probabilistic inference using Bayesian belief networks. Artificial Intelligence, 42(2–3), 393–405.
  4. Dagum, P., & Luby, M. (1993). Approximating probabilistic inference in Bayesian belief networks is NP-hard. Artificial Intelligence, 60(1), 141–153.
  5. Jordan, M. I., Ghahramani, Z., Jaakkola, T. S., & Saul, L. K. (1999). An introduction to variational methods for graphical models. Machine Learning, 37(2), 183–233.
  6. Lindley, D. V. (1956). On a measure of the information provided by an experiment. The Annals of Mathematical Statistics, 27(4), 986–1005.
  7. Holm, S. (1979). A simple sequentially rejective multiple test procedure. Scandinavian Journal of Statistics, 6(2), 65–70.
  8. Efron, B., & Tibshirani, R. J. (1993). An Introduction to the Bootstrap. Chapman & Hall, New York.
  9. Heckerman, D. (1990). A tractable inference algorithm for diagnosing multiple diseases. In Proceedings of the Fifth Workshop on Uncertainty in Artificial Intelligence (pp. 163–171).

如何引用

@techreport{perslis2026irrecoverability,
  title       = {The Irrecoverability Boundary: Where Learned Inference Cannot Recover What Deterministic Computation Cannot Reach},
  author      = {{Perslis Research}},
  institution = {Perslis Research},
  year        = {2026},
  month       = {9},
  type        = {Preprint},
  note        = {Pre-registered, adversarial. Prereg sha256 b51ee352...; learner addendum sha256 94cb2eaa...},
  url         = {https://research.perslis.com/irrecoverability.html}
}