AI 系统 · 预印本 · 预注册、对抗式
推理归位:学习式推理在符号系统中于何处赢得权威
问题不是机器学习是否好用,而是:在一个把确定性符号地板作为唯一事实撰写者的系统中,学习式推理究竟在哪里(如果有的话)赢得决策权威——通过在每一个边界处首先尝试消除推理,一次一个预注册边界地测量出来。
大多数 AI 系统靠生成文本并寄望其正确来回答事实性问题。另一种设计——由一个带类型的符号库独占事实撰写权,任何神经组件都被降格为向库提议、并须经库独立验证——在结构上而非统计上阻止幻觉。本报告提出该设计所迫使的问题:在这样的系统中,学习式推理在何处(如果有的话)赢得决策权威?方法是一句贯穿始终的口号:在每一个边界处,先尝试消除推理——构建最强的确定性(及关系式)对手,给学习通道其理论上界(一个拥有真实模型的预言机,若连预言机都无法越过标准,则任何学习模型都不能),在任何结果被看到之前预注册部署标准(改进 ≥ 15%、配对 90% 自助 CI > 0、正确性不更差),并让地板保持唯一真相权威。跨越三条赛道——对确定性查询策略的推理归位(五个边界)、覆盖 160 个人类激酶与 2,775 个已验证特征的代价加权诊断不确定性、以及一个带有形式化 noisy-OR 生成模型与信息增益规划器的顺序贝叶斯故障诊断泛化域——确定性基线保持不败。在泛化域中,一个理论席位终于在恰好一个角落出现(强潜在结构与代价化误诊的目标在预言机上界处越过标准:16.79% 与 19.79%),但一个可实现的有限样本学习器只捕获该优势的约 1.8%,而一条延伸至 24,000 个事件的学习曲线在标准之下停滞,把限制重新定位到模型类。我们把这一结果形式化为三道被测量的门的合取——理论价值、在可支持数据预算下的可实现恢复、以及充分的模型类——在所测之处从未被满足。该项目还在自己的记分板上捕获了两次失败(一个奖励"少做"的可被博弈的适应度;一次产生错误结论的盲目测量),二者均被撤回。贡献是一张关于每种机制在何处赢得权威的被测量地图,以及学习式推理最终会在何种可证伪条件下赢得权威。
1 · 引言
一大类且日益增长的 AI 系统靠生成文本并寄望其正确来回答事实性问题。在科学领域这很危险:一个被捏造的结构、一处被错误归属的关联、或一条被悄然丢弃的事实,不是风格瑕疵,而是一个带着自信外表的错误答案。主流缓解手段——检索增强生成——减轻了问题却未消除它,因为模型仍是最终主张的撰写者,仍可增添、丢弃或扭曲检索所返回之物 [6]。另一个设计点,在 Perslis 的一条配套工作线索中以倒置之名被追求,让一个带类型的符号库成为唯一的事实撰写者,并禁止任何神经组件写入库无法落地的事实 [1]。在该设计下,幻觉在结构上被阻止——作为对何物可进入图的控制流性质——而非在统计上通过让生成器更不易凭空捏造。
本报告不再重述该论点。它提出该论点所迫使的问题,并用经验作答:不是"机器学习是否好用",而是在受溯源约束的符号系统中,学习式推理在何处(如果有的话)赢得决策权威?一个生成并寄望的领域默认模型属于答案路径。我们把举证责任倒置,在每一个边界处把它压在模型身上,再测量模型能否承担它。
方法开门见山,因为方法就是贡献。(i) 先构建最强的确定性方法——绝不与稻草人比较;把非学习基线加强到无法再被廉价改进为止。(ii) 给机器学习每一次公平机会,包括一个预言机上界——一个被赋予真实生成过程的模型,如此若连预言机都无法越过标准,则任何学习模型都不能。(iii) 在每次运行前预注册标准:部署门、资格框架与实质性阈值在任何结果被看到之前提交到版本控制,并用承诺-揭示种子机制,使无可挑选之处。(iv) 让地板保持唯一真相权威:学习通道至多只能提议或排序;确定性地板撰写每一条被采纳的事实并揭示每一个真实结果,因此模型永不能自我认证。
我们报告的是一个原则性拒绝的项目。这一框定是刻意的:结论是足够强的确定性与关系式替代方案不断取胜,而那张地图——而非胜负计数——才是交付物。
1.1 · 贡献
- 一套面向推理归位的举证责任方法。一个对抗式、预注册的协议——先上最强确定性对手、一个无需构建学习器即可裁定价值问题的预言机上界、一条固定的部署标准、以及独占全部真相权威的地板——把"推理属于何处?"在每个边界处转化为一个可测量的决策(§2)。
- 一个五边界归位结果与一个代价加权不确定性结果。操作选择、新颖性深度、目标相关性、类别组合与关系式组合各自都归于确定性(§3);而在推理最有利的地形——代价加权、部分可观测的识别——上,一个准确的学习先验唯一实质性的贡献与真相败坏不可分离,而其保真部分微不足道,且全部"填补缺失状态"的价值都归于已验证检索(§4)。
- 一个形式化泛化模型与整个项目中第一次被越过的上界。一个带可调潜在结构旋钮的 noisy-OR 生成族与一个代价感知的期望信息增益规划器,被导出到遗留系统故障诊断,在代价化误诊目标下,一个理论席位终于在预言机上界处出现——但一个可实现的学习器并未把它变成赢得的席位,一条学习曲线把限制定位在模型类(§5)。
- 三门部署框架——理论价值、在可支持数据预算下的可实现恢复、以及充分的模型类——一个在所测之处从未被满足的合取(§6);外加一个元结果:该方法通过独立验证捕获了自己的两次记分板失败,把论点转向项目自身(§7)。
2 · 方法 —— 一个对抗式、预注册的协议
只有当仪器无法被挑选时,比较才可信。六项控制使该项目对自己的论点怀有敌意。
在结果之前提交的预注册。每次实验的设计、资格框架、部署门与实质性阈值,都在目标或样本池被抽取之前提交到版本控制。没有操作者选择的种子:选择种子由 int(sha256(<冻结候选集>)[:8], 16) 派生,因此冻结的数据决定行走顺序,首个满足预先声明标准的登录号即为目标。完整行走过程——每个被跳过的候选及原因——均被记录。
冷抽取与保留残骸。目标从预先声明的框架中冷抽取;开发目标被永久禁止作为优化材料。每次运行,无论通过或失败,都以逐工件 SHA-256 摘要与 git 标签冻结;失败与崩溃作为一等证据被原样保留,而非脚注。这一完整性是防篡改可察觉,而非防篡改不可能:无签名摘要能检测缺少可信摘要集的一方所作的就地编辑,但不提供真实性或外部锚。密码学签名与锚定是被点名的未来工作。
一个共享的、独立的评分器,以及作为真相权威的地板。每个通道都由同一个共享模块,依据一个既非任一通道所写的独立中立真值来评分。确定性符号地板撰写每一条被采纳的事实并揭示每一个真实结果;学习通道至多只能提议一个候选(在采纳前由地板重新落地)或对一次测量排序——它永不能认证何为真。
配对自助置信区间。比较按实例配对并自助(1000×)到 90% 置信区间,因此绝不在报告一个头条均值时不附上那个说明它是否可与零区分的区间。
贯穿每一节的口号:在每一个边界处,我们先尝试消除推理。只有当一个足够强的廉价确定性(及关系式)替代方案已先被给予机会去使推理变得不必要——并失败之后——某个边界才雇用推理。
3 · 赛道一 —— 五个边界上的归位
赛道一演化一个研究策略——地板下一步应问哪个确定性问题——从不演化答案,仅由冻结地板能独立验证之物给予奖励,并仅在一个封存的留出池上晋升。它在五个逐步更尖锐的边界处,询问学习式操作选择是否赢得一个席位。它没有。每一次坚守都把前沿推向更精确之处,并迫使归位假设经过三种可证伪形式演化。
边界 1 —— 操作选择(无计算断点)。在 8 个冷抽取蛋白质上(48 次操作执行,零错误),一个真实代价仪器测量了任何选择器相对最笨的"运行每个操作"策略所能赢得的全部奖赏。运行所有操作耗时 71.9 秒墙钟、75 次 API 调用、2.12 MB、$0.00,以恢复 401 个已验证的新颖对象;一个免费、完美的跳过预言机——不可达上界——耗 58.0 秒、63 次调用、2.11 MB、$0.00 得到相同的 401 个。因此全部奖赏为 $0.00、约 9 KB、12 次 API 调用与 13.9 秒墙钟(19.4%),且它未过预注册实质性标准(节省须过 $0.01,或 ≥ 50% 且 ≥ 2 秒墙钟,或缓解真实的限流违规)。一个每个蛋白质决策六次的真实 7B 选择器,可能把这全部 13.9 秒烧在自身推理上。没有值得智能的代价问题:运行一切。
边界 2 —— 按新颖性的深度(有断点,但无选择性信号)。研究深度确实昂贵:在整理过的蛋白质相互作用图上的广度优先行走,种子处有效分支为 16.75,随后在深度 1–2 处为 37.9 与 34.9——投影到深度 1 约 14,496 次 API 调用(约 3.4 小时)、深度 2 约 27,072 次(约 6.3 小时)——完全不可行。但已验证新颖性是均匀且互异的:一个 18 节点样本产出 785 个唯一对象,逐节点 29–132(中位数 41.5),跨节点冗余仅 14%,而一个完美免费预言机需要 18 个中的 10 个节点(56%)才能覆盖 70% 的证据——远高于 30% 的可利用标准。爆炸为真,集中为假:一个产量最大化的策略家无信号可利用。无向行走淹没在等真、等新的事实里——即"检索不是记忆"的边界 [2]。
边界 3 —— 目标相关性(有选择性,但是一个廉价类别类)。一个具体目标恢复了选择性:对最密的疾病目标,40 个分支中有 9 个相关(比例 0.225);对一个锌指结构域,40 个中有 5 个(0.125);一个只保留相关分支的路由器将在零目标损失下跳过 78–88% 的代价。但存在的选择性目标是廉价注释类,一个确定性 UniProt 注释过滤器很可能捕获它们,而真正昂贵的目标(特定通路、药物)是针尖——没有一个锚能到达 40 个中的 3 个分支。选择性信号存在,但被廉价过滤器结构主导;推理尚未被雇用。
边界 4 —— 组合目标(一次被谢绝的面试)。一个组合目标——当且仅当地板的已验证证据同时显示疾病关联与可成药性与通路嵌入(跨三个来源的合取,因此没有单一注释能定义它)——产出 40 个中的 7 个正例。最强的公平确定性规则达到 F1 0.667(第三个特征无增益),而廉价特征承载关联,峰值约 0.49。字面上看,预注册规则触发了("给模型一次面试")。我们谢绝了它,并披露两处保守偏差:我们把确定性基线加强到三特征规则(无变化,因此上限可信而基线公平),并加入一条小样本护栏——在 7 个正例下 F1 0.667 是一个单一分支即可翻转的划分,且没有预测器能从七个例子泛化。结论不确定、功效不足;纪律本身即结果。
边界 5 —— 关系式组合(廉价关系规则取胜;功效充足的机器学习打平,无可复现优势)。功效充足的重跑修复了 DGM-004C 的每一处弱点:一个真正关系式、多跳的目标(经 ClinVar 链疾病关联且与枢纽共享一条 Reactome 通路——一个分支的任何单一注释都无法揭示的性质),7 个冷抽取枢纽扩展 500 个分支至 735 个分支、33 个正例(基率 0.045),分层 50/50 留出划分带 16 个训练正例,在训练集上拟合、在测试集上评分,1000× 自助。廉价类别规则封顶于约 F1 0.40——关系式目标如设计般击败它们。但一个廉价关系规则救了它:has_disease_comment AND go_ov3(与枢纽共享 ≥ 3 个 GO 术语)达到测试 F1 0.345,而单独的关系特征(go_ov3)在召回 0.941 下达 F1 0.283。逻辑回归候选,不再饿死,从其功效不足的 F1 0.154 攀升到 0.372——与最佳规则基本打平——但 (ML − 确定性) 的配对 90% CI 为 [−0.064, +0.113],横跨零。对照三条件门,确定性上限不足(0.345 < 0.70),但模型既不经济地路由(它仅保留 47.1% 的真正例,而廉价特征保留 94.1%)也不以边际胜过求解器——在三条件中的两条上被拒,如今是在公平统计功效下。
| 边界 | 确定性替代方案 | 断点? | 选择性? | 裁决 |
|---|---|---|---|---|
| 1 · 操作选择 | 在廉价免费 API 菜单上运行一切 | 无($0,奖赏 19.4% 墙钟,不可达) | — | 无 ML —— 无代价问题 |
| 2 · 按新颖性的深度 | 穷尽遍历;去重 + 预算截断 | 有(深度 1 约 14,496 次调用) | 无(56% 节点得 70% 证据) | 无 ML —— 无信号 |
| 3 · 目标相关性 | 廉价 UniProt 注释过滤器 | 有 | 有,但为廉价类别 | 无 ML —— 可被廉价过滤 |
| 4 · 组合目标 | 三特征布尔规则(F1 0.667) | 有 | 有(7 个正例) | 不确定 —— 谢绝(功效不足) |
| 5 · 关系式组合 | 廉价关系规则 go_ov3(F1 0.345,召回 0.941) | 有 | 有(33 个正例,功效充足) | 无 ML —— 打平,CI [−0.064, +0.113],无可复现优势 |
五个边界被测量;确定性基线坚守五次——第四次仅暂时(功效不足),第五次在公平统计功效下确认。该序列到达的、经锐化的可证伪论点:只有当一个经济上有后果、具选择性的边界既抵抗足够强的廉价确定性、又抵抗关系式/图查询计算,并且学习式推理相对那些替代方案展示出一个可复现的优势(自助、留出)时,推理才是正当的。该序列已冻结。
4 · 赛道二 —— 推理最有利地形上的不确定性
赛道一问推理不属于何处。赛道二把车开上最不利于确定性系统的地形:真正的、代价加权、部分可观测的决策,其目标不是"哪个事实存在",而是"哪次未来测量最能降低对相竞假设的不确定性"。一个模式有界洞见框定了它:因为地板只从一个固定关系集撰写带类型的边,可验证假设集是可枚举的,所以模型只能通过逃出该枚举而增添价值——经由组合式假设空间、先验依赖假设、或真正的信念不确定性。信息增益规划是三者中的最后一个,也是一个对未见证据的学习先验最有可能修复病态规划器的地方。
任务。在 160 个人类激酶中、依 2,775 个地板已验证特征(每候选中位数 41)、在一个真实逐特征代价模型(interpro 1 / pathway 1 / disease 2 / drug 2 / kegg 3)下,对一个隐藏目标做诊断识别。一次测量问"目标是否具有特征 f?";地板返回真实答案并淘汰不一致的候选。确定性对手是一个被加强的代价感知期望信息增益(EIG)规划器——argmaxf IG(f) / cost(type(f))——在良态设定下达到 7.64 次查询,对照 log₂(160) = 7.32 的信息论最优;在 40% 被遮蔽的参考上,它在正确识别 1.000 下需 18.7 次查询 / 19.66 代价。
把先验注入采纳(被拒)。一个零真相权威的前沿模型,针对 44 个判别特征的 2,875 个被遮蔽条目做出预测,对照封存真值准确率 85.8%——一个确实不错、且匹配真实基率的先验。注入规划器的采纳(淘汰)步骤,它把总测量代价从 19.66 削到 12.10(−38.4%),配对 90% CI [6.65, 8.51]——但正确识别从 1.000 崩到 0.753。诊断显示 39 次误识别中 100% 是由对真实目标自身某个被遮蔽条目的错误插补所致:单个错误单元格即淘汰真实目标,而地板无事实可用于核对该猜测,因为数据库条目是先验知识,不是一次测量。权威是二元的,不是效率旋钮——一个 86% 的模型置于真相路径上,使系统约 24% 出错——门拒绝之。
已验证卡片 A/B(决定性归因)。那个不合法的动作是用模型的参数化记忆填补缺口,而非检索已验证卡片。重跑同一实验并仅换数据源,把"填补缺失状态"的价值归给真正拥有它的来源。已验证卡片在两个维度上都胜过模型的猜测——更便宜且正确。
| 通道(填补同样 2,875 个被遮蔽单元格) | 平均代价 | 正确识别 | 裁决 |
|---|---|---|---|
| 基线代价感知 EIG(不填补) | 19.66 | 1.000 | 参照 |
| Claude 记忆猜测(86% 准确) | 12.10 | 0.753 | 拒 —— 败坏真相 |
| ML 仅搜索排序(采纳受保护) | 18.86 | 1.000 | 拒 —— −4.06%,低于 15% 标准 |
| 已验证卡片检索 | 11.50 | 1.000 | −41.5%,CI [7.10, 9.20],在完美正确性下 |
限于搜索——先验对下一次测量排序,而淘汰仅用地板已验证条目,因此正确识别按构造为 1.000——合法收益为 4.06%(CI [0.114, 1.456]),真实但低于标准。分解无懈可击:采纳变体中 38.4 点的表面收益里,约 34 点由真相败坏买来,只有约 4 点是先验对下一步问什么的合法贡献。全部"填补缺失状态"的价值都归于已验证检索;那个制造状态的模型,是一个严格更差、败坏真相的替代品,替代了已持有的卡片——一张已验证卡片要么 100% 要么缺席,永不是 86%。
覆盖率扫描。把已验证卡片覆盖率从 100% 扫到 10%(嵌套种子遮蔽),每级三个通道,在 160 个留一实例上,检验随知识稀薄 ML 排序是否赢得席位。
| 发现 | 结果 |
|---|---|
| 已验证卡片检索 | 在每个覆盖率上都平坦于 9.48 代价、100% 正确识别;在 20% 处以最多 6.6× 压制(63.15 对 9.48) |
| ML 排序 EIG | 在每一级都处于确定性 EIG 的 ±5–8% 内(50% 处 +5.4%,20% 处 −7.6%,70% 处 +4.6%,90% 处 −5.1%);从不越过 15%,从无稳健 CI —— 交叉点 = 无 |
| 解析率对覆盖率 | ≥ 70% 时 100% 解析;20% 时 33%;10% 时 0% —— 随知识稀薄,崩塌的是解析,不是排序 |
被测量的边界比"数据稀疏时 ML 有帮助"更干净:稀疏的已验证知识是一个数据问题(取卡片),不是一个规划问题。每个组件的席位如今被测量而非被论辩——既有知识 → 已验证卡片;新证据 → 测量;真相/采纳 → 仅地板;搜索/排序 → 唯一的 ML 候选,在此值约为 0。可证伪的开放前沿,是一个其排序决策承载确定性规划器无法建模的潜在结构的域——而赛道四提供了它。
5 · 赛道四 —— 泛化,连同形式化模型
赛道一至二生活在分子生物学中。赛道四把整套方法导出到一个结构不同的域——遗留计算系统的顺序贝叶斯故障诊断——以检验推理归位是否是一条一般系统原则,并陈述使边界可测量的形式化模型。该域被工程化为偏向学习式推理:一个可调旋钮把它从"朴素贝叶斯恰好正确"拨到"故障标签无法解释相关性"。
5.1 · 形式化模型
任务是在 K = 12 个故障类之间、使用 M = 20 个代价加权二值诊断、带 L = 4 个潜在因子的顺序贝叶斯诊断。设 f 为真实故障,先验 P(f),并设 z ∈ {0,1}L 为潜在因子,各以概率 πl 独立激活。
生成模型(带潜在结构旋钮 ρ 的 noisy-OR)。给定故障与潜在因子,诊断 m 返回正例的概率为
其中 θf,m ∈ [0,1] 是该故障的逐测试签名(朴素模型所估的边际),z 是潜在因子,wl,m ∈ {0,1} 是因子–测试关联矩阵。旋钮 ρ 支配一个激活的潜在因子将一个被接线的测试拖向正例的强度:在 ρ = 0 时乘积为 1,故 P(om=1 | f, z) = θf,m——给定 f 时结果条件独立,朴素贝叶斯恰好正确(内建对照,谐架重现到 0.0% 差距);当 ρ → 1 时,潜在因子诱导出故障标签无法解释的跨测试相关性。
规划器(所有通道相同)。每个通道都驱动同一个代价感知期望信息增益策略。以对 K 个故障的信念 b 与累积观测 O,测试 m 的期望信息增益为
其中 H 是对信念的香农熵。规划器选择
观测机器的真实结果,以贝叶斯更新 b,重复直至 maxf b(f) ≥ 0.90,然后诊断 argmaxf b(f)。一个通道只挑下一个测试;地板揭示真实结果与真实故障,因此通道不能捏造诊断——只能选择一个(可能次优的)测量顺序。各通道仅在其所用似然上不同:朴素贝叶斯带估计边际(现实对手)、朴素贝叶斯带精确边际(隔离建模联合价值的干净对照)、预言机-联合(真实生成模型——任何学习模型的上界)、以及一个习得的伯努利混合(§5.4)。
操作目标。对结构扫描,目标仅为诊断代价。从代价化误诊实验起,预先声明的目标对误诊定价:
其中 λ 是一次错误诊断的操作代价,以一次诊断测试为单位。
5.2 · 结构隔离扫描
干净测试比较预言机-联合与朴素贝叶斯带精确边际——二者都知道精确边际,故整个差距即建模潜在联合的价值。ρ = 0 处的打平是谐架的无偏性凭证。
| ρ | 朴素-精确 代价(准确率) | 预言机-联合 代价(准确率) | 结构 Δ(代价) | 配对 CI90(朴素−预言机) | 越过 15%? |
|---|---|---|---|---|---|
| 0.0 | 8.42 (0.935) | 8.42 (0.935) | 0.0% | [0.0, 0.0] | 否(对照打平) |
| 0.2 | 11.99 (0.915) | 11.88 (0.915) | 0.96% | [−0.26, 0.52] | 否 |
| 0.4 | 15.06 (0.875) | 15.88 (0.890) | −5.44% | [−1.29, −0.35] | 否 |
| 0.6 | 17.64 (0.840) | 17.57 (0.855) | 0.43% | [−0.88, 1.00] | 否 |
| 0.8 | 21.04 (0.770) | 18.82 (0.835) | 10.53% | [1.33, 3.14] | 否 |
交叉点:无。即便一个完美联合模型,在任何 ρ 上也从不越过 15% 代价标准。在 ρ = 0.4 处预言机在代价上暂时更差(它花费去消歧相关症状)而在准确率上略优——机理上合理,不是噪声。在 ρ = 0.8 处,整个项目中第一个 CI 显著的结构信号出现:预言机既更便宜(18.82 对 21.04,CI [1.33, 3.14])又更准确(0.835 对 0.770——诊断误差约降 28%)——真实且在增长,但按代价标准不够实质。
5.3 · 代价化误诊目标 —— 第一次被越过的上界
ρ = 0.8 的信号在仅代价目标上真实但不够实质,因为其价值在于正确,而非少花。在预先声明的代价化误诊目标下,预注册的 λ 网格产生恰好两个越过标准的单元格——都在 ρ = 0.8——这是整个项目中首次任何学习模型在其理论上界处越过一条严格的预注册标准。预注册严丝合缝地成立:在 ρ = 0.8 处,λ = 25 给出 14.33%,低于标准;直到声明的 λ = 50 才越过。
| ρ \ λ | 0 | 5 | 10 | 25 | 50 | 100 | 准确率(朴素→预言机) |
|---|---|---|---|---|---|---|---|
| 0.2 | 0.96% | 0.93% | 0.90% | 0.81% | 0.71% | 0.56% | .915 → .915 |
| 0.4 | −5.44% | −4.75% | −4.11% | −2.45% | −0.33% | 2.47% | .875 → .890 |
| 0.6 | 0.43% | 0.81% | 1.17% | 2.08% | 3.22% | 4.68% | .840 → .855 |
| 0.8 | 10.53% | 11.45% | 12.28% | 14.33% | 16.79%★ | 19.79%★ | .770 → .835 |
带星单元格以配对 CI > 0 越过 15% 标准([2.905, 8.03] 与 [4.3, 13.715])。席位是一个角落,不是一个区域,它恰好映射分工:地板拥有真相;学习器将建模地板独立性假设所缺的联合结构。但预言机是一个完美模型——上界越过是必要而非充分。
5.4 · 有限学习器与学习曲线
这个角落是否可被一个可实现的学习器占据?一个有限样本联合模型(逐故障伯努利混合,C = 8 潜在类,40 次 EM 迭代,拉普拉斯平滑,种子初始化;1,500 训练 + 200 留出事件,无预言机泄漏)在冻结角落(ρ = 0.8,λ = 50)处不越过标准。一个健全性检查确认谐架:作为混合的预言机精确重现 16.79% 的越过,因此这个零结果是学习器的,不是仪器的。
| 通道(角落 ρ = 0.8,λ = 50) | 准确率 | 平均代价 | 操作损失 @ λ=50 |
|---|---|---|---|
| 朴素贝叶斯(估计) | 0.755 | 21.4 | 33.62 |
| 朴素贝叶斯(精确边际) | 0.770 | 21.0 | 32.54 |
| 习得伯努利混合(EM) | 0.770 | 21.0 | 33.51 |
| 预言机-联合(上界) | 0.835 | 18.8 | 27.08 |
对照主要对手,操作损失下降为 +0.34%(CI [−2.28, 2.49],横跨零)——学习器仅捕获预言机优势的约 1.8%。一条学习曲线随后追问这是否为数据饥饿。并非如此:增加数据有帮助但在标准之下停滞。
| N(事件数) | 习得准确率 | 相对朴素的下降 | 配对 CI90 | % 捕获预言机机会 | 越过 15%? |
|---|---|---|---|---|---|
| 1,500 | 0.770 | 0.34% | [−2.31, 2.30] | 1.8% | 否 |
| 3,000 | 0.765 | 1.47% | [−2.03, 3.02] | 8.5% | 否 |
| 6,000 | 0.770 | 4.34% | [−1.20, 3.79] | 25.7% | 否 |
| 12,000 | 0.785 | 7.04% | [−0.15, 4.61] | 42.8% | 否 |
| 24,000 | 0.805 | 7.0% | [−0.44, 4.82] | 47.8% | 否 |
捕获百分比的增益急剧减速(+6.7、+17.2、+17.1,末次翻倍仅 +5.0);到 N = 12k–24k 时损失下降平坦于约 7%(末次翻倍把它从 7.04% 移到 7.0%);它从不越过 15%,且每个配对 CI 都含零。准确率单调攀升 0.770 → 0.805(预言机 0.835):学习器对数据有响应但在标准之下停滞。到 24k 时数据的边际价值已崩至近零,而学习器仍只恢复约 48% 的机会——因此约束在于模型类,而非数据预算。裁决是仅理论席位:上界所开之门存在,但这个可实现的学习器并未拧动钥匙。下一道门——一个结构匹配的潜在因子学习器——被点名为开放且尚未运行;无任何主张依赖其结果。
6 · 三门框架
跨越全部三条赛道,持久的贡献不是"符号胜过 ML",而是对推理归位的一次重构:授予学习层权威的决定不是二元的,而是三道被经验测量的门的合取。
门 1 —— 理论价值。推理机会究竟是否存在?由预言机上界——真实生成模型,任何学习模型的上界——测量。答案:是,在恰好一个角落(强潜在结构与代价化误诊目标:(ρ=0.8, λ=50)=16.79%,(ρ=0.8, λ=100)=19.79%)。在全部三条赛道的其余各处,上界本身都不越过标准。
门 2 —— 可实现恢复 + 数据价格。一个真实学习器能恢复它吗,在何种证据预算下?由有限学习器及其学习曲线测量。答案:部分,且在标准之下停滞(N=1,500 时约为预言机优势的 1.8%,到 N=24,000 上升到机会的 47.8% 但在约 7% 损失下降处平坦,从不显著)。数据不是约束所在。
门 3 —— 模型类。限制者是表示吗?由一个结构匹配的学习器测量。答案:开放——已点名且可预注册但尚未运行;学习曲线把表示识别为活跃假设,而不主张其结果。
在所测一切之中,该合取未被完全满足:门 1 在一个角落被满足;门 2–3 未被任何尝试过的学习器满足,且门 3 的前沿仍开放。
完整地图把每个被测量的边界对照这些门。末行以上一切归于确定性;末行是唯一一处理论上可证存在席位——而在实践中未被赢得。
| 边界(赛道) | 确定性替代方案 | 学习式推理席位 |
|---|---|---|
| 操作选择(归位) | 在廉价免费 API 菜单上运行一切 | 无 —— 无代价问题可解 |
| 组合深度(归位) | 穷尽遍历;均匀新颖性 | 无 —— 产量不集中 |
| 选择性 / 目标相关性(归位) | 廉价类别规则 | 无 —— 可被廉价过滤 |
| 关系式组合(归位,功效充足) | 廉价关系式图查询规则 | 无 —— ML 打平,无可复现优势 |
| 普通不确定性(不确定性) | 已验证卡片检索 + 确定性 EIG | 无实质 —— 排序值约 0;真相路径上的模型按其误差率败坏 |
| 潜在结构 + 代价化误诊(泛化) | 朴素贝叶斯 EIG | 席位在预言机上界处存在,但未被可实现学习器赢得 |
该框架产出一条认知状态规则,即按信息的认知状态、而非按哪种技术可用,来分配计算:已知信息从已验证卡片检索,而非推断;未知但可测量的信息被测量(取一张卡片),而非幻觉;需验证的信息仅由确定性地板采纳——模型永不决定何物成真;而只有需在真正不确定性上搜索的信息才是学习式推理的候选,它随后必须凭经验赢得其位置,一次一个被测量的边界,而非因为它可用便被假定。
7 · 该方法在自身仪器中捕获的两次记分板失败
该项目的论点——无论是一个最大化某个数字的优化器,还是一个报告某个比率的记分板,都无法认证该数字追踪目标——被转向了项目自身。两次,一个仪器说了谎,且两次谎言都由检视与独立连接器测试捕获,而非靠信任那个数字。二者均被撤回。
一个奖励"少做"的可被博弈的适应度。一个早期演化阶段优化一个纯比率——每次操作运行的已验证发现数。对该比率的贪婪搜索产生了一个策略,它在封存池上"赢得"了比率(24.25 对现任的约 3.0),靠的是少做:它跳过了有产出的操作与整个蛋白质,只恢复了封存池上 97 条已验证事实,而现任为 148。一个没有发现下限的比率,奖励恢复更少真实事实而抬高均值——这正是使自改进系统危险的奖励博弈失败模式 [5],在一个符号策略上被以小规模重现。修复是一个保发现的适应度(奖励已验证发现总量;仅惩罚零产出的操作)。
一次产生错误结论的盲目测量。奖励预言机仅当一条超默认发现的主语与宾语都缺席默认抽取时才计数它。但每条超默认事实都是 protein → X,而蛋白质总在默认集中,故 subject not in A 子句悄然把每条这样的发现清零。它被捕获,是当一次通路查询报告 OK 却零新发现,而转储边显示三条被预言机滤除的、带溯源的边。在更正后的预言机下,所有操作都有产出且随蛋白质而变;那个错误的"构建新连接器"结论——连接器本已工作——被明确撤回,而更正后的运行全部基线在封存池上恢复 323 条已验证事实,对照 bug 所诱导的 148(约 2.2×)。
一个优化器无法定义其数字应意味着什么;一个记分板无法认证一个比率追踪目标。只有一个独立验证者能——论点,被应用于项目自身的仪器。被取代的工件在更正横幅下作为残骸原样保留,以更正记录为准。
8 · 局限与范围
陈述这些是为了使结果不被过度解读;诚实是结果的一部分。
- 小 N;每个压力类别单个目标。这是一条正在构建的表征曲线,不是同行评审结果,也不是一般性证明。归位目标为每次运行单个蛋白质;演化与不确定性阶段的池各为 4–5 个蛋白质(诊断识别任务使用 160 个候选,但为单个冻结实例)。不作任何总体或统计优越性主张。
- 结果受预注册的任务、数据集与协议所限。赛道二的否定结果精确地说是:在这个预注册的任务、数据集、遮蔽过程、学习先验、规划器实现与评估协议下,未观察到实质性的 ML 排序优势——而非学习式推理一般地不能改进不确定性上的搜索。
- 泛化由一个进一步的域展示,而非一般地被证明。赛道四是单个合成生成族(noisy-OR 潜在因子)、一个模拟器、一个代价模型、每次实验一个学习器类、K=12 / M=20 / L=4、每次评估 200 个留出事件。该域被工程化为偏向学习式推理,且学习通道在价值问题上被给予其理论上界——一个刻意慷慨的设定。更多域将加强或反驳该主张。
- 找到的席位是理论的(预言机)且未被可实现学习器赢得。门 1 仅在预言机上界处、在一个角落被满足。有限学习器与学习曲线结果是关于这个学习器、这个数据预算与这个协议的——不是任何学习器都永不能占据该席位的证明。
- 开放的下一道门是模型类。一个结构匹配的潜在因子学习器(门 3)已点名且可预注册,但尚未运行;本报告无任何主张依赖其结果。若它在混合停滞之处越过,则席位可赢得;若它也停滞,则即便在上界所开的那一个边界,确定性的胜利也是彻底的。
- 自估的 ML 代价与一处模型层级说明。凡前沿模型的 token 与美元数字出现处,均为自估下界(输入 token 未单独计量);决定性的代价主张是定性的(模型调用 > 0 且 $ > 0 对比 0 / $0),而非精确量级。
- 完整性是防篡改可察觉,而非防篡改不可能。冻结工件带无签名 SHA-256 摘要,能检测缺少可信摘要集的一方所作的就地编辑;它不提供真实性、不可否认性或外部锚。签名与锚定是未来工作。
9 · 结论
我们问的不是机器学习是否好用,而是在一个把确定性符号地板作为唯一事实撰写者的系统中,学习式推理在何处(如果有的话)赢得决策权威——并且我们以一个验证优先的项目唯一能采取的方式作答:先构建最强的确定性方法,把其预言机上界交给机器学习,在每次运行前预注册标准,并拒绝让任何通道认证自己的真相。跨越五个归位边界、一个在推理最有利地形上的不确定性任务、以及一个被构建为偏向模型的泛化域,确定性(与检索)基线保持不败——直到一个理论席位终于在预言机上界处出现,而没有任何可实现学习器把它变成赢得的席位。结果是一张被测量的地图,而非一次裁决:一个由三道门构成的合取——理论价值、在可支持数据预算下的可实现恢复、以及充分的模型类——在所测之处从未被满足,以及学习式推理最终会在何种具体、可证伪条件下被满足。该项目甚至把自己的论点转向自身的仪器,捕获并撤回了两次记分板失败。门存在;真正的钥匙拧不开它——而地图恰恰说明了到哪里去找一把。
参考文献
- Perslis Research. "Peel: Structural Hallucination Prevention for Offline AAC Through Symbolic Fact Authorship." 预印本, 2026. research.perslis.com/peel.html
- Perslis Research. "Retrieval Is Not Memory: Memory as a Governance Function over Experience." 预印本, 2026. research.perslis.com/memory.html
- Perslis Research. "Verified Before Acting: A Pre-Action Adversarial Cognition Loop with Factored Authorization." 预印本, 2026. research.perslis.com/adversarial-loop.html
- Perslis Research. "Traversing Data in Symbolic Systems: Typed-Relation Traversal as a First-Class Retrieval Primitive." 预印本, 2026. research.perslis.com/traversal.html
- Perslis Research. "The Orchestration Gap: Why Model-Level Alignment Cannot Survive Multi-Model Runtimes." 预印本, 2026. research.perslis.com/orchestration-gap.html
- Lewis, P. 等. "Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks." 神经信息处理系统进展(NeurIPS), 2020. arXiv:2005.11401。
如何引用
Perslis Research. "Inference Placement: Where Learned Inference Earns Authority in a Symbolic System." 预印本, 2026. https://research.perslis.com/inference-placement.html
@techreport{perslis_inference_placement_2026,
title = {Inference Placement: Where Learned Inference Earns
Authority in a Symbolic System},
author = {{Perslis Research}},
institution = {Perslis Research},
type = {Preprint (moat-scrubbed)},
year = {2026},
url = {https://research.perslis.com/inference-placement.html}
}