AI 系统 · 法律引注核查 · 研究原型(不构成法律意见,不是引证检索服务)

判例法的引注地板

用免费判例数据库复核 Mata v. Avianca 案的引注。模型可以提议一条引注。只有真实判例数据库中相符的记录才能接纳它;数据库无法判断时,地板会如实说明。

下载 PDF(英文)↓ 可准入的运动 → 验证下限 → 研究论文 · 20 页 · 一次实时运行,2026 年 9 月 27 日 · 所有数字均出自我们自己;尚无第三方复现
只凭记录接纳 缺失不是证据时就暂缓 以法院自己的认定为对照 未运行的部分如实说明 审计我们自己的代码
摘要

在 Mata v. Avianca, Inc.(S.D.N.Y. 2023)一案中,法院对一份援引了六个根本不存在的判决的诉讼文书作出制裁。我们描述一种只有一条规则的引注地板:模型可以提议一个案件名称和引注,但只有公共判例数据库中相符的记录才能接纳它。地板返回六种判定之一(附凭证的 GROUNDED、AMBIGUOUS、NOT_FOUND、MISCITED、NOT_GOOD_LAW、UNVERIFIABLE);只有在它假定免费数据库完整收录的判例汇编中,查无结果才被当作虚构的证据;在其他情形下,以及遇到任何数据源错误时,它都弃权。在针对 CourtListener 的一次实时运行中(八次查询,未使用 API 令牌),它对所测试的五条虚构引注一条也没有接纳:拒绝三条(两条 NOT_FOUND,一条 MISCITED),将两条 Westlaw 引注以 UNVERIFIABLE 暂缓;三条真实的最高法院引注全部附来源链接落地。它给出的 MISCITED 凭证,指向的正是法院在该引注处认定的那个真实案件。这次运行覆盖了法院意见中 12 条虚构或与所引不符的引注中的 5 条,而 6 项被误用的真实判决一项也未覆盖——存在性核查按设计会接纳它们。通过阅读代码,我们发现三条本次运行没有触及的失效路径:与引注处真实案件共享一个常见当事人词语的虚构案名会被接纳;以不同形式书写的真实案件可能被拒绝;对判例是否仍然有效的否决不在被测路径上。我们陈述了使拒绝成立的收录假设,并设计了下一个实验,其门槛事先固定。

生成的引注看起来和真的一样,生成它的工具也会说它是真的。能够定案的是记录;在记录也无法定案的地方,诚实的回答是暂缓。

写给所有人——用平实的话说我们做了什么

问题。律师用过去的法院判决支持自己的论点,每个判决都用一本书、一个卷号和一个页码来标识。AI 写作工具可能编造出看起来和真判决一模一样的判决。在 2023 年纽约的一个案件 Mata v. Avianca 中,法院认定一份文书援引了六个并不存在的判决,并对其作出制裁。有人曾问这个工具这些案件是不是真的,它说是真的。

我们做了什么。一个不信任写作者的核查器。对每一条引注,它向一个免费的公共判决数据库提两个问题:这个卷号和页码上是否确有一个真实判决?它是不是写作者说的那个案件?如果是,就放行,并附上真实记录的链接。如果这一页属于另一个案件,或者在数据库理应掌握的地方什么也没有,就拦下。如果数据库无从得知——比如引用的是 Westlaw 这类付费服务的编号——它就如实说明,把这条引注交给人来判断。它从不猜。

结果。我们在 Mata 案的虚构引注和三个著名的真实判决上运行了一次。五条虚构引注一条也没有放行:拦下三条,两条交给人判断。三条真实引注全部放行,并附链接。对其中一条虚构引注,它指出了那一页实际属于哪个真实案件——与法院指出的是同一个案件。

它不是什么。它不构成法律意见,也不能替代专业的法律检索服务。它核查的是被引用的案件是否存在、是否就是所称的那个案件;它不核查该案件是否真的支持写作者的说法,也不核查它是否仍然有效。阅读我们自己的代码时,我们还发现了几种这次测试没有尝试、却可能骗过它的方式,并一一列出。

1 · 引言

在一份法律文书中,案件引注是可以机械核查的部分。它写明一个判例汇编、一个卷号和一个起始页;要么有一份判决意见从这一页开始,要么没有;如果有,它就有一个名字。生成式模型写出的文字看起来都像引注,不论所指的判决是否存在,而法律记录如今已经显示了后果。在 Mata v. Avianca, Inc. 一案中,法院认定一份反对驳回起诉动议的文书所援引的六个判决是伪造的,其事实认定记载了这些判决“由 ChatGPT 生成,并不存在”(“were generated by ChatGPT and do not exist”)的承认 [1, ¶ 36]。法院还认定,其中一份伪造的判决意见“包含内部引注和引文,而这些被引的判决本身也不存在” [1, ¶ 29],并作出了制裁。这份记录还以最简单的形式包含了本文所关注的失败:被问及这些案件是否真实时,该工具“答称它提供的是可以在 Westlaw、LexisNexis 和《联邦判例汇编》(Federal Reporter)中找到的‘真实’判例” [1, ¶ 45]。提议者对自己提议的担保,不是核查。

本文描述一种位于提议者之外的核查。沿用我们此前工作中的准入模式,我们称之为引注地板:模型可以提议,只有有据可查的来源才能接纳 [28, 26, 22]。地板对模型提议的每一条引注问两个问题:这个引注处是否确有一份真实的判决意见?它是不是提议者所称的那个案件?它依据一个公共判例数据库 CourtListener [9] 作答,给出六种判定之一。每个判定都带有一个动作(接纳、拒绝或暂缓),并且在有记录时带有一份凭证:记录本身及其链接。这一设计建立在律师早已熟知的一种不对称之上:把真实的判例说成虚构,本身就是一种错误指控,其危害可能不亚于接纳一个假判例。因此,只有在数据库的收录范围使“查无结果”具有信息量的地方,查无结果才算作虚构的证据;在其他任何地方,以及数据源出现任何错误时,地板都弃权。

我们在这个问题公开暴露的地方检验它。我们实时运行了一次地板,输入是其演示脚本所含的 Mata 案虚构引注,以及作为对照的三条真实最高法院引注。然后我们把结果逐条与法院自己的认定对照,并与法院意见列出的全部援引对照——其中大多数并不在脚本之中。最后,我们阅读代码,寻找契约在本次运行未包含的输入上可能失效的方式。

1.1 · 贡献

1.2 · 我们主张什么,不主张什么

在八个输入上、在一天之内、针对一个免费数据库,地板没有接纳任何虚构引注,也没有拒绝任何真实引注。它的凭证可以与法院自己的认定相互核对,其中一份与法院的认定完全一致。

我们不主张任何错误接纳率或错误拒绝率:样本只有五条虚构引注和三条著名的真实引注,而且 §7 的审计给出了地板会失效的输入。GROUNDED 判定的意思是:该引注存在,并且就是所称的案件。它不表示该案件仍然有效,也不表示该案件支持它被引来支持的论点。地板不是引证检索服务(citator),本文内容也不构成法律意见。我们没有评估任何商业检索工具。这些组成部分都不是新的:引注查询服务、引注解析器和引证检索服务早已存在(§9),CourtListener 本身就提供一个需要令牌的查询接口,其文档称之为“可用作防止幻觉引注的护栏”(“a guardrail to help prevent hallucinated citations”) [8]。我们的贡献在于查询之外的契约:查无结果被允许意味着什么,出错时怎么办,一个判定携带什么,以及在这个问题记录得最充分的公开案件上,如实测量这份契约能走多远。

2 · 公开记录

我们只依据法院的《关于制裁的意见与命令》(Opinion and Order on Sanctions),Mata v. Avianca, Inc., No. 22-cv-1461 (PKC), ECF No. 54 (S.D.N.Y. June 22, 2023)。这是一份 43 页的文件:34 页意见正文和两个附录 [1]。我们从公开的 RECAP 档案库取得它,并固定了其哈希值(附录 B)。下文的段落编号指该意见中的事实认定。我们只提及案件引注中出现的当事人和法院,不提及其他任何人。

发生了什么。原告因一次国际航班上受伤起诉一家航空公司。航空公司以诉讼请求已过《蒙特利尔公约》规定的时效为由,申请驳回起诉(第 3 段)。2023 年 3 月 1 日提交的反对该动议的宣誓陈述,援引了一些航空公司律师找不到的判决:航空公司 3 月 15 日的答辩“逐一列明名称和引注,指出七个它无法找到的所谓‘判决’”(第 7 段)。4 月 11 日和 12 日,法院命令提交九个被援引判决的副本(第 13–14 段)。4 月 25 日,提交了其中除一个之外全部判决的所谓副本或摘录(第 18 段)。法院随后就这些“判决”作出认定(第 24–36 段),并于 2023 年 6 月 22 日依据《联邦民事诉讼规则》第 11 条(或者,作为替代,依据其固有权力)作出制裁(第 34 页)。

法院认定了什么。表 1 分三组列出法院意见指明的全部援引。

这份记录也说明了为什么核查必须位于提议者之外。当被问及这些案件是否真实时,该工具回答说是真实的,并且可以在 Westlaw、LexisNexis 和《联邦判例汇编》中找到(第 45 段)。记录中还有证言表明,存在一些免费网站,输入一个已知的判决引注就能显示该判决(第 12 段)。本文自动化的核查,是任何人都可以手工完成的核查。地板的作用,是让这一核查成为必经步骤,并让它的答案具有约束力、附带凭证。

表 1. 法院意见认定为虚构、与所引不符或被误用的全部援引,附法院的认定、我们划分的错误类别(第 6 节)以及实际运行时地板给出的判定。引注按法院意见原样列出。
#援引(按原文)法院的认定意见段落类别地板(9 月 27 日)
宣誓陈述中援引的虚构判决(第 36 段)
1Varghese v. China Southern Airlines Co., Ltd., 925 F.3d 1339 (11th Cir. 2019)无此判决(第十一巡回上诉法院书记官确认)。该引注“对应于” J.D. v. Azar, 925 F.3d 1291 (D.C. Cir. 2019)。第 26–28 段ANOT_FOUND
2Shaboon v. Egyptair, 2013 IL App (1st) 111279-U (Ill. App. Ct. 2013)不存在;有“类似缺陷”。第 35–36 段C未运行
3Peterson v. Iran Air, 905 F. Supp. 2d 121 (D.D.C. 2012)不存在。该引注属于 United States v. ISS Marine Services, 905 F. Supp. 2d 121 (D.D.C. 2012)。命令中拼作“Peterson”,所附文本为“Petersen”。第 33–34 段BMISCITED
4Martinez v. Delta Airlines, Inc., 2019 WL 4639462 (Tex. App. Sept. 25, 2019)不存在;有“类似缺陷”。第 35–36 段CUNVERIFIABLE
5Estate of Durden v. KLM Royal Dutch Airlines, 2017 WL 2418825 (Ga. Ct. App. June 5, 2017)不存在;有“类似缺陷”。第 35–36 段CUNVERIFIABLE
6Miller v. United Airlines, Inc., 174 F.3d 366, 371-72 (2d Cir. 1999)不存在。该引注属于 Greenleaf v. Garlock, Inc., 174 F.3d 352 (3d Cir. 1999)。第 30–32 段ANOT_FOUND
伪造的 Varghese 内部援引:不存在或与所引不符(第 29 段 a–f)
7Holliday v. Atl. Capital Corp., 738 F.2d 1153 (11th Cir. 1984)不存在。该引注处的判例是 Gibbs v. Maxwell House, 738 F.2d 1153 (11th Cir. 1984)。第 29(a) 段B未运行
8Gen. Wire Spring Co. v. O’Neal Steel, Inc., 556 F.2d 713, 716 (5th Cir. 1977)不存在。该引注处的判例是 United States v. Clerkley, 556 F.2d 709 (4th Cir. 1977)。第 29(b) 段A未运行
9Hyatt v. N. Cent. Airlines, 92 F.3d 1074 (11th Cir. 1996)不存在。92 F.3d 1074 处是其他案件的两份简短命令。第 29(c) 段B未运行
10Zaunbrecher v. Transocean Offshore Deepwater Drilling, Inc., 772 F.3d 1278, 1283 (11th Cir. 2014)不存在。该引注处的判例是 Witt v. Metropolitan Life Ins. Co., 772 F.3d 1269 (11th Cir. 2014)。第 29(d) 段A未运行
11Zicherman v. Korean Air Lines Co., 516 F.3d 1237, 1254 (11th Cir. 2008)与所引不符:真实的 Zicherman 是 516 U.S. 217 (1996);该 F.3d 引注属于 Miccosukee Tribe v. United States, 516 F.3d 1235。宣誓陈述中亦有援引(第 14 段)。第 29(e);另见 第 14 段A+D未运行
12In re BDC 56 LLC, 330 B.R. 466, 471 (Bankr. D.N.H. 2005)与所引不符:同名的第二巡回法院判决是 330 F.3d 111 (2d Cir. 2003);该 B.R. 引注处的判例是 In re 652 West 160th LLC, 330 B.R. 455。第 29(f) 段A+D未运行
伪造的 Varghese 内部援引:真实判决,但并非所引用途(第 29 段 g)
13In re Rimstat, Ltd., 212 F.3d 1039 (7th Cir. 2000)真实;涉及第 11 条制裁,未讨论破产自动中止。第 29(g) 段E未运行
14In re PPI Enterprises (U.S.), Inc., 324 F.3d 197 (3d Cir. 2003)真实;未讨论自动中止;被误标为第二巡回法院的意见。第 29(g) 段E+F未运行
15Begier v. I.R.S., 496 U.S. 53 (1990)真实;未讨论自动中止。第 29(g) 段E未运行
16Kaiser Steel Corp. v. W. S. Ranch Co., 391 U.S. 593 (1968)真实;未讨论自动中止。第 29(g) 段E未运行
17El Al Israel Airlines, Ltd. v. Tsui Yuan Tseng, 525 U.S. 155 (1999)真实;不含所引用的文字。第 29(g) 段E未运行
18In re Gandy, 299 F.3d 489 (5th Cir. 2002)真实;维持了驳回强制仲裁动议的裁定。第 29(g) 段E未运行

3 · 地板的契约

我们通过地板接受什么、回答什么、每个回答携带什么来描述它,而不描述其内部实现。图 1 画出了 Mata 测试所用的路径。

提议者一个模型、一份草稿、一份诉状(案件名称,引注)Petersen v. Iran Air,905 F. Supp. 2d 121每一对只发一次带引号、限定字段的短语查询;至多尝试四次;持续失败即为数据源错误。检索citation:("905 F. Supp. 2d 121")CourtListener 搜索,无需令牌每个主机每秒至多 1 次请求;遇 429 / 5xx 退避重试重试后仍有数据源错误?是否有记录恰好载有这一引注?该判例汇编是否属于地板视为完整收录的范围?否是UNVERIFIABLE暂缓:数据源错误不是证据否是NOT_FOUND拒绝:此引注下没有判例否UNVERIFIABLE暂缓:此处的缺失不是证据是所称名称与记录上的名称是否相符?GROUNDED接纳 + 凭证MISCITED拒绝 + 凭证是否按单一名称或引注解析案件时,还可能返回 AMBIGUOUS(多个不同案件匹配:暂缓)和NOT_GOOD_LAW(记录标明已被推翻:拒绝)。这两种判定在此处所画的成对核查路径上都不会出现;见表 2。
图 1. 成对核查 verify(name, citation)。提议者给出一个案件名称和一条引注;地板向一个公共判例数据库发出一次精确查询,返回带动作的判定。绿色接纳,橙色拒绝,蓝色暂缓、交由人或付费引证检索服务处理。GROUNDED 和 MISCITED 附带记录级凭证。虚线框中的两种判定只在解析单一引用时出现(表 2)。

3.1 · 输入与数据库

地板有两个入口。resolve(reference) 接受一个案件名称或一条引注。verify(name, citation) 接受文书实际写出的那一对,例如 Petersen v. Iran Air, 905 F. Supp. 2d 121,并询问该引注是否存在、是否属于所称的案件。引注必须以最简形式给出:卷号、判例汇编、起始页。地板不会去掉精确页码引注(pin cite)和法院与年份括注;§7 说明保留它们会发生什么。

数据库是由 Free Law Project 运营的 CourtListener [9]。地板只使用其公共搜索接口,无需账户,也无需令牌。CourtListener 在文档中把 citation 描述为“一个涵盖某一判决意见全部引注的字段”,并把引号说明为短语查询,“不做词干还原,也不匹配同义词” [7]。因此地板在该字段内只查询一个带引号的短语,citation:("905 F. Supp. 2d 121"),而不是做自由文本搜索。本工作线的开发记录写道,不加引号的字段查询会把卷号和页码分开匹配;我们在此没有重新测试这一点。数据库的排序本身从不决定判定:在返回的记录中,地板只保留那些在其引注列表中包含该输入的记录,比较时只统一大小写和空白。

3.2 · 判定、动作与凭证

表 2 就是全部的输出词汇。每种判定对应三种动作之一:接纳(该引注可以进入可信状态)、拒绝(不可以),或暂缓(暂时不可以,须由人或付费引证检索服务决定)。凭证是判定背后的数据库记录:案件名称、数据库为它列出的每一条引注、法院、日期、记录的标识符及其 URL。任何人都可以打开凭证并核对。凭证是指向公共记录的链接,不是签名证据;链接背后的记录可能会变(§10)。

表 2. 地板的判定。“成对”指 verify(name, citation);“单一”指 resolve(reference)。最后一列记录该判定是否出现在我们的证据中:§5 的实时运行,或本工作线已提交的测试——其最后一次记录的运行(9 月 23 日)没有留下失败项;我们没有重新运行它们。
判定含义动作入口在我们的证据中
GROUNDED有一条真实记录载有该引注,且所称名称与之相符(成对);或恰有一条记录与该引用匹配(单一)。接纳,附凭证成对、单一运行:3;测试
AMBIGUOUS多条不同记录与单一引用匹配。暂缓:待消歧单一运行:0;测试允许
NOT_FOUND没有记录载有该引注,且其判例汇编属于地板视为完整收录的范围;或没有记录与某个名称匹配。拒绝成对、单一运行:2;测试
MISCITED有一条真实记录载有该引注,但它指的是另一个案件。拒绝,附凭证成对运行:1;测试
NOT_GOOD_LAW所有匹配的记录都被标记为受到负面处理(被推翻、被撤销)。拒绝(硬否决)单一运行:0;无测试
UNVERIFIABLE数据源在重试后仍然失败;或没有记录载有某条引注,而其形式不在免费数据库完整收录的范围内(Westlaw 和 Lexis 编号、中立引注、其他判例汇编)。暂缓成对、单一运行:2;测试

3.3 · 缺失何时构成证据?

核心的设计选择在于:查无结果被允许意味着什么。一次什么也没找到的查询,本身什么也证明不了:引注可能是虚构的,数据库可能缺少这份判决意见,也可能是请求失败了。只有在前两种情形能够区分开时,地板才把查无结果读作虚构,而这取决于收录范围。

定义 1(被视为完整收录的判例汇编)。令 \(D\) 为数据库,\(R_c\) 为地板视为完整收录的判例汇编集合:《美国最高法院判例汇编》(United States Reports)、《最高法院判例汇编》(Supreme Court Reporter)、《律师版》(Lawyers' Edition)、《联邦判例汇编》系列和《联邦地区法院判例汇编》系列。一条规范引注 \(c=(v,r,p)\) 指明判例汇编 \(r\) 的第 \(v\) 卷和起始页 \(p\)。收录假设是:对每个 \(r\in R_c\),每一份发表于 \(r\)、从第 \(v\) 卷第 \(p\) 页开始的判决意见,在 \(D\) 中都有一条记录,其引注列表中包含 \((v,r,p)\)。检索假设是:针对 \(c\) 的带引号查询,会在地板检查的结果中返回所有这样的记录。
命题 1(一次拒绝证明了什么)。在收录假设和检索假设下,如果成对核查对规范引注 \(c=(v,r,p)\)(其中 \(r\in R_c\))返回 NOT_FOUND,那么没有任何发表于 \(r\) 的判决意见从第 \(v\) 卷第 \(p\) 页开始。
证明。如果存在这样的判决意见,收录假设保证有一条记录列有 \(c\),检索假设保证它出现在被检查的结果中。地板就会找到一条载有 \(c\) 的记录,并返回 GROUNDED 或 MISCITED,而不是 NOT_FOUND。∎

这个命题有意写得很短,目的是把假设摆到明处。一次拒绝的可靠程度恰好等于三件事:\(R_c\) 的收录主张、查询的检索主张,以及输入是否规范。这三者本文都没有测量;§7 和 §10 说明了每一项可能如何失效。地板自己对拒绝的说明写的是“fabricated”(虚构)。严格说来,它证明的只是没有任何判决意见从被引用的那一页开始;“虚构”是法院依据整份记录作出的推断。

命题 2(传输层故障永远不是判定)。如果数据库无法连接、返回 HTTP 错误状态,或返回的内容不是 JSON,并且这种故障在 §3.4 的重试之后仍然存在,那么判定为 UNVERIFIABLE。任何这类故障都不会产生 NOT_FOUND 或 GROUNDED。
论证。由构造保证。每个请求都经过同一个函数,该函数要么返回解析后的 JSON,要么在重试后抛出同一种错误类型。两个入口都捕获这种错误类型,并在任何判定逻辑运行之前返回 UNVERIFIABLE。其他类型的故障(例如响应在读取中途被截断)会抛出异常,根本不产生判定。我们是通过阅读代码核对这一点的(附录 B 给出了行号),而不是通过注入故障。

这个命题不涵盖格式正确但内容错误的响应。一个因错误而返回的空结果集,或者数据库响应中的一个字段被改名,都会把真实引注变成 NOT_FOUND。防范办法是在每一批次中同时运行已知的真实引注作为金丝雀(canary),只要其中任何一条未能落地,就作废整个批次。我们这次运行中的三个对照正起到这个作用(§4)。

注记(为什么暂缓而不是猜)。地板面对的是一个带拒识选项的三路决策 [5]。接纳一个虚构引注和拒绝真实判例都是代价高昂的错误;暂缓的代价是一个人的时间。在被视为完整收录的判例汇编中查无结果,在命题 1 的假设下是决定性的,所以拒绝是对的。对一个 Westlaw 编号查无结果——免费数据库并不声称收录这类编号——无论哪个方向都说明不了多少,所以暂缓是对的。这份契约用弃权来同时避免两类错误,而不是拿一类错误去换另一类。

3.4 · 限流与快速失败

本工作线的开发记录写道,CourtListener 对未认证的搜索限流很严。不论限流程度如何,被限流都不是关于法律的证据。地板让发往同一主机的请求至少间隔一秒。遇到 HTTP 429、502、503 或 504 以及网络错误时,它总共最多尝试四次。如果服务器给出 Retry-After 值,就按该值等待,否则依次等待 1、2、4 秒;每次等待都不超过 30 秒。任何其他 HTTP 错误立即失败,非 JSON 的响应也一样。重试之后仍然存在的故障变为 UNVERIFIABLE(命题 2)。地板从不退而求其次去猜测、使用缓存答案或改用别的来源。

3.5 · 尚未核查判例是否仍然有效

一条引注可以存在、指向正确的案件,却仍然不是有效的判例(good law)。要知道一个案件是否被推翻、撤销或取代,需要 Shepard's 和 KeyCite 等商业引证检索服务提供的后续处理记录;免费的搜索结果不提供这些信息。地板设有否决(NOT_GOOD_LAW),但它在免费层面的信号仅限于记录本身显示的内容,而且 Mata 测试所用的成对核查根本不调用它(§7)。我们的运行和已提交的测试都没有产生过这一判定。因此 GROUNDED 的意思是“存在,并且就是所称的案件”,而绝不是“仍然有效”。要弥补这一缺口,要么需要付费的引证检索服务,要么需要基于 CourtListener 免费引用网络构建的处理记录。后者已在计划中,尚未构建。

3.6 · 实现与范围

地板由三个模块共 344 行 Python 代码组成,只使用标准库。随附一个 123 行的实时测试文件和一个 86 行的演示脚本,均位于提交 533f783。《可准入的运动》一文把法律地板列为一种跨领域准入模式的实例之一,与生物地板和运动地板并列 [22]。共享的是模式:提议、对照有据可查的来源核查、接纳、拒绝或暂缓,并附凭证。共享的不是代码。法律地板没有从生物地板的引擎导入任何东西;它是同一契约的一个独立实现。连接器还实现了 CourtListener 需要令牌的引注查询端点,但地板从不调用它。这里的一切都是美国判例法,被视为完整收录范围内的每一个判例汇编都是联邦或最高法院判例汇编。

4 · 方法

一次运行,完整记录。我们于 2026 年 9 月 27 日 09:08:25 至 09:08:33 UTC 实时运行了一次本工作线的演示脚本。未设置 CourtListener 令牌。代码位于提交 533f783,脚本所在目录与该提交逐字节一致(没有本地改动)。我们用 Python 3.9.6 运行,并禁止写入字节码,以免在该工作线目录中留下任何东西。完整输出及其 SHA-256 哈希,以及每个源文件的哈希,都保存在本文的 evidence/ 文件夹中(附录 B)。脚本对每个输入发出一次数据库查询,共八次。我们没有重复这次运行。本文的范围只允许一次实时运行,一是为了固定证据,二是为了尽量减轻对一项免费公共服务的负担。

输入。脚本向 verify 传入八对(名称,引注)。

结果编码。我们把 GROUNDED 记为接纳,把 NOT_FOUND 和 MISCITED 记为拒绝,把 UNVERIFIABLE 记为暂缓。对虚构输入而言,接纳正是地板要防止的失败;拒绝算作抓住;暂缓两者都不是——它是一次移交,我们从不把它算作抓住。对真实输入而言,拒绝是一次错误指控,暂缓是一份成本。一个小脚本重新解析运行输出,重算每一个计数,并与演示脚本自己的得分行核对;任何不一致都会让它中止。

外部核对。对每一个判定,我们都把凭证(或凭证的缺失)与法院在同一引注处的认定相比较(表 1)。第二个脚本把每一项援引以及我们依据的每一处认定,定位到法院意见文本中的具体行;只要有任何引文片段找不到,它就中止。§6 中的错误类别是我们划分的,依据的是法院的认定,而不是地板的输出。

已提交的测试,未重新运行。本工作线有 11 个实时测试。其测试缓存显示,最后一次记录的会话(9 月 23 日 18:38 EDT)收集了全部 11 个测试,没有记录任何失败。因无网络而全部跳过的测试同样会留下一个空的失败列表,所以仅凭缓存并不能证明它们通过了。提交信息称它们实时通过。我们只把它们引作本工作线声明的预期。其中四个断言 Mata 案的判定,第五个断言 Miranda 这一对;我们的运行重现了全部五个。其余六个检验单一引用解析(五个测试)和引注格式检测器(一个),本次运行没有用到这两部分。

通过阅读进行审计。我们逐行阅读了地板及其连接器,并对每一种判定追问:这个判定证明了什么,哪些输入可能让它出错。§7 中的每一项发现都引用了支持它的文件和行号。它们都没有被执行:本文的范围只允许那一次实时运行,别的都不允许。因此每一项审计发现都被表述为代码的一个性质,并附上会暴露它的输入。

5 · 结果

5.1 · 这次运行

表 3 给出每一个判定及其凭证或说明。演示脚本自己的得分行与我们的重算一致。

虚构(n = 5):接纳 0;拒绝 3(NOT_FOUND 2,MISCITED 1);暂缓 2(UNVERIFIABLE)。
真实(n = 3):接纳 3(GROUNDED),每条都附 CourtListener 凭证;拒绝 0;暂缓 0。
八次查询,墙钟时间 8 秒,一次运行,未使用 API 令牌。

五条虚构引注中有两条是被暂缓,而不是被抓住。地板的契约认为这是正确的行为,因为免费数据库并不声称收录 Westlaw 编号;但暂缓什么也没有抓住。它把这条引注交给一个人,而在本案中,这个人需要 Westlaw 或出具判决的法院才能定案。演示脚本的文档字符串称地板“一个不漏地全部抓住”(“catches every one”)。它的得分行报告的是“3/5 (+2 UNVERIFIABLE)”,而准确的是得分行。

表 3. 唯一一次实时运行(2026 年 9 月 27 日 09:08:25–09:08:33 UTC,未使用 API 令牌,代码为提交 533f783)。凭证是地板返回的 CourtListener 记录;最后一列是法院的认定(表 1)。
输入(名称,引注)判定地板返回的凭证或说明法院的认定
Varghese v. China Southern Airlines Co., Ltd., 925 F.3d 1339NOT_FOUND说明(程序原文输出):“no case carries this mainstream-reporter citation — fabricated, REJECTED”无此判决(第十一巡回上诉法院书记官确认)。该引注“对应于” J.D. v. Azar, 925 F.3d 1291 (D.C. Cir. 2019)。
Petersen v. Iran Air, 905 F. Supp. 2d 121MISCITED真实引注,另一案件:United States of America v. Iss Marine Services, Inc. — 905 F. Supp. 2d 121; 84 Fed. R. Serv. 3d 384; 2012 WL 5873682; 2012 U.S. Dist. LEXIS 166088 — https://www.courtlistener.com/opinion/2661490/united-states-of-america-v-iss-marine-services-inc/不存在。该引注属于 United States v. ISS Marine Services, 905 F. Supp. 2d 121 (D.D.C. 2012)。命令中拼作“Peterson”,所附文本为“Petersen”。
Miller v. United Airlines, Inc., 174 F.3d 366NOT_FOUND说明(程序原文输出):“no case carries this mainstream-reporter citation — fabricated, REJECTED”不存在。该引注属于 Greenleaf v. Garlock, Inc., 174 F.3d 352 (3d Cir. 1999)。
Martinez v. Delta Airlines, Inc., 2019 WL 4639462UNVERIFIABLE说明(程序原文输出):“citation not in the free corpus (e.g. Westlaw/unpublished) — cannot verify”不存在;有“类似缺陷”。
Estate of Durden v. KLM Royal Dutch Airlines, 2017 WL 2418825UNVERIFIABLE说明(程序原文输出):“citation not in the free corpus (e.g. Westlaw/unpublished) — cannot verify”不存在;有“类似缺陷”。
Miranda v. Arizona, 384 U.S. 436GROUNDEDMiranda v. Arizona — 16 L. Ed. 2d 694; 86 S. Ct. 1602; 384 U.S. 436; 1966 U.S. LEXIS 2817; 10 Ohio Misc. 9; 36 Ohio Op. 2d 237; 10 A.L.R. 3d 974 — https://www.courtlistener.com/opinion/107252/miranda-v-arizona/(真实对照)
Brown v. Board of Education, 347 U.S. 483GROUNDEDBrown v. Board of Education — 347 U.S. 483; 74 S. Ct. 686; 1954 U.S. LEXIS 2094; 38 A.L.R. 2d 1180; 53 Ohio Op. 326; 98 L. Ed. 873 — https://www.courtlistener.com/opinion/105221/brown-v-board-of-education/(真实对照)
Gideon v. Wainwright, 372 U.S. 335GROUNDEDGideon v. Wainwright — 372 U.S. 335 — https://www.courtlistener.com/opinion/8954562/gideon-v-wainwright/(真实对照)

5.2 · 与法院认定的一致性

对每一个输入,都可以把地板的回答与法院在同一引注处的认定放在一起比较。

5.3 · 案件记录核查了多少

图 2 把这次运行放到整份记录中来看。运行覆盖了 6 个中的 5 个虚构判决。法院意见一共指明了 12 条虚构或与所引不符的引注(六个判决,加上伪造的 Varghese 内部的六项),因此运行覆盖的是 12 条中的 5 条。法院认定被误用的 6 项真实判决,运行覆盖了 0 项。在法院意见指明的全部 18 项援引中,运行了 5 项,13 项没有运行。因此准确的一句话总结是:在本案的虚构引注中,地板对其中五条作出了判定,拒绝三条、暂缓两条,一条也没有接纳。而不是“地板抓住了 Mata 案的虚构引注”。

接纳拒绝暂缓未运行字母 A–F:错误类别(表 4)六个虚构判决法院意见第 36 段Varghese, 925 F.3d 1339 (11th Cir. 2019). 法院: The Federal Reporter citation for “Varghese” is associated with J.D. v Azar, 925 F.3d 1291 (D.C. Cir. 2019). 地板: NOT_FOUND.NOT_FOUNDVarghese925 F.3d 1339类别 AShaboon, 2013 IL App (1st) 111279-U (Ill. App. Ct. 2013). 法院: The “Shaboon”, “Martinez” and “Durden” decisions contain similar deficiencies. 本研究未运行。未运行Shaboon2013 IL App (1st)111279-U类别 CPetersen, 905 F. Supp. 2d 121 (D.D.C. 2012). 法院: The Federal Supplement citation is to United States v. ISS Marine Services, 905 F. Supp. 2d 121 (D.D.C. 2012) 地板: MISCITED.MISCITEDPetersen905 F. Supp. 2d 121类别 BMartinez, 2019 WL 4639462 (Tex. App. Sept. 25, 2019). 法院: The “Shaboon”, “Martinez” and “Durden” decisions contain similar deficiencies. 地板: UNVERIFIABLE.UNVERIFIABLEMartinez2019 WL 4639462类别 CDurden, 2017 WL 2418825 (Ga. Ct. App. June 5, 2017). 法院: The “Shaboon”, “Martinez” and “Durden” decisions contain similar deficiencies. 地板: UNVERIFIABLE.UNVERIFIABLEDurden2017 WL 2418825类别 CMiller, 174 F.3d 366, 371-72 (2d Cir. 1999). 法院: The Federal Reporter citation for “Miller” is to Greenleaf v. Garlock, Inc., 174 F.3d 352 (3d Cir. 1999). 地板: NOT_FOUND.NOT_FOUNDMiller174 F.3d 366,371-72类别 A伪造的 Varghese 内部援引:不存在或与所引不符(第 29 段 a–f)Holliday, 738 F.2d 1153 (11th Cir. 1984). 法院: The case appearing at that citation is Gibbs v. Maxwell House, 738 F.2d 1153 (11th Cir. 1984). 本研究未运行。未运行Holliday738 F.2d 1153类别 BGen. Wire Spring, 556 F.2d 713, 716 (5th Cir. 1977). 法院: The case appearing at that citation is United States v. Clerkley, 556 F.2d 709 (4th Cir. 1977). 本研究未运行。未运行Gen. Wire Spring556 F.2d 713, 716类别 AHyatt, 92 F.3d 1074 (11th Cir. 1996). 法院: There are two brief orders appearing at 92 F.3d 1074 issued by the Eleventh Circuit in other cases. 本研究未运行。未运行Hyatt92 F.3d 1074类别 BZaunbrecher, 772 F.3d 1278, 1283 (11th Cir. 2014). 法院: The case appearing at that citation is Witt v. Metropolitan Life Ins. Co., 772 F.3d 1269 (11th Cir. 2014). 本研究未运行。未运行Zaunbrecher772 F.3d 1278, 1283类别 AZicherman, 516 F.3d 1237, 1254 (11th Cir. 2008). 法院: The Federal Reporter citation for “Zicherman” is for Miccosukee Tribe v. United States, 516 F.3d 1235 (11th Cir. 2008). 本研究未运行。未运行Zicherman516 F.3d 1237, 1254类别 A+DIn re BDC 56, 330 B.R. 466, 471 (Bankr. D.N.H. 2005). 法院: citation is In re 652 West 160th LLC, 330 B.R. 455 (Bankr. S.D.N.Y. 2005). 本研究未运行。未运行In re BDC 56330 B.R. 466, 471类别 A+D伪造的 Varghese 内部援引:真实判决,但并非所引用途(第 29 段 g)In re Rimstat, 212 F.3d 1039 (7th Cir. 2000). 法院: is a decision relating to Rule 11 sanctions for attorney misconduct and does not discuss the federal bankruptcy stay. 本研究未运行。未运行In re Rimstat212 F.3d 1039类别 EIn re PPI Enterprises, 324 F.3d 197 (3d Cir. 2003). 法院: stay, and is incorrectly identified as an opinion of the Second Circuit. 本研究未运行。未运行PPI Enterprises324 F.3d 197类别 E+FBegier v. I.R.S., 496 U.S. 53 (1990). 法院: Begier v. I.R.S., 496 U.S. 53 (1990), does not discuss the federal bankruptcy stay 本研究未运行。未运行Begier v. I.R.S.496 U.S. 53类别 EKaiser Steel, 391 U.S. 593 (1968). 法院: (per curiam), does not discuss the federal bankruptcy stay 本研究未运行。未运行Kaiser Steel391 U.S. 593类别 EEl Al v. Tseng, 525 U.S. 155 (1999). 法院: does not contain the quoted language discussing the purpose of the Montreal Convention. 本研究未运行。未运行El Al v. Tseng525 U.S. 155类别 EIn re Gandy, 299 F.3d 489 (5th Cir. 2002). 法院: affirmed a bankruptcy court’s denial of a motion to compel arbitration. 本研究未运行。未运行In re Gandy299 F.3d 489类别 E真实对照不取自该案记录Miranda, 384 U.S. 436. 地板: GROUNDED.GROUNDEDMiranda384 U.S. 436Brown, 347 U.S. 483. 地板: GROUNDED.GROUNDEDBrown347 U.S. 483Gideon, 372 U.S. 335. 地板: GROUNDED.GROUNDEDGideon372 U.S. 335一次实时运行,2026 年 9 月 27 日,未使用 API 令牌;法院意见中的 18 项援引运行了 5 项。引注按法院意见原样列出,省略法院与年份。
图 2. 法院意见中的每一项援引,以及实际运行了哪些。实心格于 2026 年 9 月 27 日运行,虚线格未运行。颜色表示地板的动作(接纳、拒绝、暂缓),每个格子也都印有其判定。字母是表 4 的错误类别。三个真实对照不取自该案记录。将鼠标悬停在格子上可查看法院的认定。

5.4 · 凭证

四个有记录支撑的判定——三个 GROUNDED 和一个 MISCITED——都附有凭证:案件名称、数据库为该记录列出的每一条引注,以及一个 CourtListener URL。各凭证的完整程度不同。Miranda 的记录列有 7 条引注,Brown 的列有 6 条,包括它们在《最高法院判例汇编》和《律师版》中的平行引注。Gideon 的只列有 372 U.S. 335,因此一份以平行引注援引 Gideon 的文书不会与这条记录匹配。是否有另一条记录载有那条引注,我们没有核查。两个 NOT_FOUND 和两个 UNVERIFIABLE 判定只带有地板的说明,因为没有记录可以出示。

5.5 · 成本

这次运行 8 次查询共用了 8 秒墙钟时间,与地板每秒一次请求的间隔相符。我们没有记录重试次数或单次查询的延迟,因此不报告延迟数据。这次运行不需要账户,也不需要令牌。

6 · 存在性核查能看到什么、看不到什么

法院意见中的十八项援引以不同的方式出错。表 4 依据法院的认定把它们分为六类,并给出契约对每一类作出的判定。对运行过的类别,判定是实测结果;对没有运行的类别,判定是 §3 的契约所规定的结果,我们如此标注:规定不等于结果。

表 4. Mata 案记录中的错误类别、地板的契约对每一类的说法,以及实测了什么。计数针对表 1 中的 18 项援引;其中两项同时属于两个类别(A 和 D),一项同时属于 E 和 F。“规定”指契约对该输入规定的判定,而不是观测到的结果。
类别(按法院的描述)援引地板需要什么
A没有判决意见从被引用的页码开始;法院找到的是一份从更靠前页码开始的意见。6:Varghese、Miller、Gen. Wire Spring、Zaunbrecher、Zicherman、In re BDC 56在被视为完整收录的判例汇编中为 NOT_FOUND(已运行的 2 项中实测 2 项);BDC 56 的判例汇编(B.R.)不在收录范围内,为 UNVERIFIABLE(规定)。按页码范围查询,像法院那样指出该页落在哪份意见之内。
B被引用的起始页开始的是另一份真实的判决意见。3:Petersen、Holliday、HyattMISCITED(已运行的 1 项中实测 1 项)。Hyatt 所在页有两份命令,而地板只把名称与第一条记录比较(§7)。把名称与该页上的每一条记录比较。
CWestlaw 编号或公共领域中立引注。3:Martinez、Durden、ShaboonUNVERIFIABLE(已运行的 2 项中实测 2 项);Shaboon 未运行,取决于免费数据库是否收录了该中立引注。付费引证检索服务,或出具判决的法院自己的记录。
D真实案件的名称,配上一个它并没有的引注。2:Zicherman、In re BDC 56由引注决定,同类别 A(规定)。仅按名称查询会找到真实案件并接纳它。始终核查成对的名称与引注,绝不只核查名称。
E真实判决,引注正确,但不包含所引文字或不支持所主张的论点。6:第 29 段 (g)按设计为 GROUNDED(规定)。存在不等于支持。对照论点阅读判决意见:一种支持性核查。
F括注中的法院错误。1:In re PPI Enterprises不作检查:输入中不含法院。把法院和年份与记录比较。

类别 A 和 B 正是引注地板的用武之地。它们是身份错误,一次查询就能定案:要么有一份判决意见从该引注开始,要么没有;如果有,它的名称要么与所称相符,要么不符。三次实测的拒绝都属于这两类。没有运行的七条虚构引注中,也有六条属于这两类,其中五条在被视为完整收录的判例汇编中——这就是它们会最先加入测试集的原因(§8)。

类别 C 是诚实要付出覆盖代价的地方。一个对每个 Westlaw 编号查无结果都予以拒绝的地板,本可以“抓住” Martinez 和 Durden。但同一条规则也会把免费语料库中缺失的每一个真实的未公开发表判决都指控为虚构。契约拒绝这种交换,代价是五条中有两条被暂缓。付费使用引证检索服务可以消除这一代价,更好的免费规则却不能。

类别 D 说明了为什么核查的单位是成对的名称与引注。Zicherman v. Korean Air Lines Co. 是一个真实的最高法院案件 [1, ¶ 29(e)]。只核查名称的检查会接纳附在它身上的那个虚构的《联邦判例汇编》引注。地板的成对核查问的是:不论名称如何,是否有一份判决意见从被引用的那一页开始。

类别 E 超出了任何存在性核查的能力,包括我们的。十八项援引中有六项是真实的、引注正确的判决,却被用来支持它们并未表达的内容。地板会让这六项全部落地——按其契约是正确的,对这份文书却毫无用处。Magesh 等人称这样的引用为误落地(misgrounded):当回答中的论点“虽有引用,但曲解了来源或引用了不适用的来源”时,该回答即为误落地 [16]。按他们的定义,我们的 GROUNDED 比“落地”(grounded)更弱:它断言的是身份,而不是支持。面向“支持”的地板必须去阅读判决意见。那是另一种核查,有不同的失效特征,本文没有测量它。

7 · 审计:契约可能在哪里失效

这次运行表明地板在八个输入上行为正确,但并不表明契约在运行未包含的输入上也成立。我们阅读代码,寻找这样的输入。下面每一项发现都是提交 533f783 处代码的一个性质,并附有确立它的文件和行号。它们都没有被执行:本文的范围只允许一次实时运行,别的都不允许。每一项都附有会暴露它的输入,而每个这样的输入都列入了 §8 的测试集。

7.1 · 因共享当事人词语而造成的错误接纳

成对核查有意宽松地比较所称名称与记录名称。它的任务是抓住严重的不匹配——真实的引注配上另一个案件——而不是在格式问题上失败(floor.py,第 129–138 行)。实际上,只要两个名称共享一个有区分度的当事人词语,它就认为二者相符(第 29–30 行和第 162–164 行)。两个本次运行未包含的输入说明了这会接纳什么:

对于任何共享词语是政府当事人(United States、State、People、Commonwealth)、通用词(Estate、Board、County),或者在航空案件中是航空公司名称的案名,情况都是如此。Mata 案的六个虚构判决全部带有一家航空公司的名字。本文这次运行所依赖的性质——没有任何虚构引注达到 GROUNDED——之所以成立,是因为五条 Mata 引注中没有一条落在与其所称案名共享当事人词语的真实案件上。这是那些输入的性质,而不是契约的性质。修复:比较对方的非政府当事人;忽略主权方和通用词语;在文书给出法院和年份时要求二者一致;比较结果不够有力时就暂缓。

7.2 · 以不同形式书写的真实判例被错误拒绝

地板自己声明的规则是:“尚未解析、但可能真实”的判例为 UNVERIFIABLE,“绝不是 NOT_FOUND”(README.md,第 25–27 行)。有两条路径违反了它。

修复:在查询之前,用 eyecite [10] 这样的引注解析器把每条引注解析为卷号、判例汇编和起始页;任何无法解析或有多种解析方式的输入一律暂缓;仅凭名称查无结果时判为 UNVERIFIABLE,绝不判为 NOT_FOUND。

7.3 · 有效性否决不在被测路径上

成对核查从不查询后续处理情况(floor.py,第 141–166 行)。否决只接入了单一引用解析(第 118–121 行)。它在免费层面的信号取自被处理案件自己的记录(第 72–82 行)。负面处理记载在后来的判决意见中,而不在被处理案件的案名里,因此这个信号几乎会漏掉全部负面处理。检查代码还可以看出,它可能被一个以另一种意思含有处理词语的案名误触发——例如一个名为“Vacation …”的当事人就会触发它。本次运行和任何测试都没有产生过 NOT_GOOD_LAW。因此我们把这个否决描述为已接入但未经测量,其免费覆盖几乎为零;说“部分覆盖”都会言过其实。

7.4 · 检索、收录范围与静默失效

7.5 · 更正我们自己的描述

审计还发现,本工作线在一些地方对自己的描述比其代码或输出所能支持的更宽松。演示脚本的文档字符串称它“一个不漏地”抓住 Mata 案的虚构引注(dogfood_mata.py,第 5 行),而它自己的得分行报告的是抓住三条、暂缓两条。脚本的输入列表被描述为“根据法院的制裁命令”(per the court's sanctions order)列出的虚构引注(第 24 行),但它只包含六个判决中的五个,第 29 段中的援引一项都没有。README 报告“6 gates green”(第 22 行);这个数字早于第二次增量,现在测试文件中有 11 个测试。《可准入的运动》一文把其中的运动地板描述为与生物和法律准入地板“共享同一个引擎”(“one engine with the bio and legal admission floors”) [22]。法律地板共享的是契约,而不是引擎(§3)。本文中关于这次运行的数字都取自运行本身,而不是取自上述任何描述。

8 · 下一个实验

这次运行回答的是:契约在给定的输入上是否表现正确。悬而未决的是另一个问题:在一项真实的法律任务上,在我们能构建的最强确定性核查器旁边,加入任何学习式组件是否值得?我们在运行之前就在这里给出实验设计,沿用我们《推理归位》和《不可恢复性边界》研究计划的做法 [24, 25]:先构建最强的确定性方法,给学习式通道一切优势,并在看到任何结果之前固定门槛。在这些计划中,学习式通道迄今没有赢得过一个席位(在《不可恢复性边界》中,160 个世界×维度单元中为零)。我们预计这里也会如此,并且无论结果如何都会报告。

任务。对一份文书中的每一项援引——以案件名称、引注和它被引来支持的论点给出——判定接纳、拒绝或暂缓,并附凭证。

测试集,在首次运行前固定。测试集以失效为导向:§7 的每一项审计发现都贡献专门用来触发它的输入。

  1. Mata 案记录中的全部 18 项援引(表 1),依据法院的认定标注。未运行的七条虚构或与所引不符的引注最先加入。法院 4 月 11 日命令所要求的另外两个判决(第 13 段),只有在依据记录确定其性质之后才加入。
  2. 从已发表判决意见的援引列表中抽取的真实援引,依据 CourtListener 以外的来源标注,使地板所用的数据库永远不会成为它自己的基准真值。判例法开放获取项目(Caselaw Access Project) [4] 是一个候选来源。
  3. 针对每一项审计发现的扰动:与引注处真实案件共享当事人词语的虚构案名(§7.1);真实引注上的缩写案名、精确页码、括注和不留空格的判例汇编缩写(§7.2);两条记录共用的页码(§7.4);真实的和虚构的 Westlaw 编号与中立引注;以及落在另一份判决意见之内的页码。
  4. 每一批次都包含金丝雀引注。只要有任何金丝雀未能落地,该批次即作废(§3.3)。

确定性对手,先构建。对手用 eyecite [10] 解析引注,并对每一条做精确查询。随后它进行四项检查:页码范围包含——像法院那样指出某一页落在哪份判决意见之内;区分当事人的名称比较;法院与年份的一致性;以及收录规则,并在任何错误时弃权。在有令牌可用时,CourtListener 的引注查询 API [8] 作为第二个独立查询同时运行。

学习式通道,受限。一个本地模型看到同样的证据,对类别 E 还看到判决意见的文本。它可以把一项援引从接纳改为暂缓,例如标出判决意见似乎并不支持该论点。它可以提出一种消歧方案,但必须由确定性核查器重新核查。它永远不能接纳,也永远不能把一项援引移出拒绝。这就是我们 VDSG 运行时和《失败优先模型》中“只能收窄”的约束,用在了引注上 [27, 23]。

门槛,现在固定。损失计入真实援引上的三类错误:错误拒绝;对确实支持其论点的援引的暂缓;以及对并不支持其论点的援引的接纳(类别 E)。受限的学习者可以通过提出由确定性核查器确认的消歧方案来减少第二类错误,通过标出误用来减少第三类错误;它的标记也可能增加第二类错误。只有同时满足我们沿用自《推理归位》的门槛的三个条件,它才能赢得席位 [24]:把该损失降低至少 15%;这一降低的配对 90% 自助法(bootstrap)置信区间不包含零;且对虚构或错引引注的接纳不增加。只要出现一次这样的接纳,学习式通道即被取消资格。

报告。本节事先固定了任务、对手、约束和门槛 [18]。测试集将在首次运行前冻结。每一个实验臂都会报告,包括零结果和负面结果。

10 · 局限

状态。研究原型。不构成法律意见,不是引证检索服务。GROUNDED 判定的意思是:某条引注存在于一个免费数据库中,并且就是所称的案件。它不表示该案件仍然有效、支持任何论点,或可以被依赖。所有数字均出自我们自己,尚无第三方复现。

样本量。五条虚构引注和三条真实引注,一次运行。我们不报告任何比率。五次中零次错误接纳,与高达 52% 的错误接纳率相容(双侧 95% Clopper–Pearson 区间的上端 [6]);三次中零次错误拒绝,与高达 71% 的错误拒绝率相容。这两个界都说明不了什么有用的东西,而审计给出了地板会失效的输入。

对照过于容易。三条真实引注属于美国法律中被引用最多的判决,而且位于数据库收录最好的判例汇编中。它们表明这条路径走得通,但不能用来估计真实判例被错误拒绝的频率。审计给出了这种情况可能发生的两种方式(§7.2)。

人工规范化的输入。本次运行的引注是由人工整理为最简形式的。面对文书中实际书写的引注,现有的地板会拒绝一部分真实判例(§7.2)。

只覆盖了记录的一部分。法院意见中的十八项援引运行了五项。Shaboon、伪造的 Varghese 内部六项虚构或与所引不符的援引,以及六项被误用的真实判决,都没有运行。对这些援引,表 4 给出的是契约的规定,而不是结果。

未经测量的假设。只有在收录假设、检索假设和规范输入三者都成立时,拒绝才是可靠的(命题 1)。这三者本文都没有测量。

审计发现未经执行。§7 的失效路径是通过阅读代码确立的代码性质。每一项都可以用几个输入加以确认,但目前一项也没有确认。

测试未重新运行。本文没有运行本工作线已提交的 11 个测试。它们最后一次记录的会话没有留下失败项,而一个没有网络、全部跳过的会话也会是这样(§4)。

证据有时效性。CourtListener 会变化。记录可能被添加、更正、合并或删除,2026 年 9 月 27 日的判定以后可能无法复现。凭证是链接,不是存档副本,也没有签名。我们存档的是运行输出和哈希值(附录 B),而不是链接背后的记录。

范围。仅限美国判例法;被视为完整收录的范围仅限联邦和最高法院判例汇编。不涉及成文法、法规、二手资料或外国法。没有评估任何商业工具。

11 · 结论

生成的引注看起来和真的一样,而去问生成它的工具它是不是真的,于事无补:在 Mata 案中,那个工具说是真的。有用的是记录。引注地板把这一观察变成了一份契约:只有当公共数据库在该引注处、以所称名称存有一份判决意见时,提议才被接纳;当数据库显示该引注属于另一个案件,或收录范围表明那里什么都没有时,提议被拒绝;只要数据库无法判断——包括数据库出故障的时候——提议就被暂缓。

在给定的 Mata 案引注上,地板对五条虚构引注一条也没有接纳,拒绝三条,暂缓两条,并让三条真实引注落地。它唯一的 MISCITED 凭证指向的,正是法院认定的那个真实案件。在整份记录上,它覆盖了十八项援引中的五项。其中六项是任何存在性核查都无法触及的,因为它们是被误用的真实案件。阅读它的代码,我们找到了会让它接纳虚构引注或拒绝真实判例的输入;其中第一种失效,会打破这次运行看似证明的那个性质。

这份契约在形态上是可靠的,在细节上尚未得到证明。它的拒绝恰好与其背后的收录假设一样可靠;它的接纳只与名称比较一样可靠。下一步是在记录包含的全部内容和审计发现的全部内容上运行它,放在我们能构建的最强确定性核查器旁边,并事先固定任何学习式组件的门槛。

参考文献

  1. Mata v. Avianca, Inc., No. 22-cv-1461 (PKC), Opinion and Order on Sanctions, ECF No. 54 (S.D.N.Y. June 22, 2023), 43 pp. Obtained from the RECAP archive, https://storage.courtlistener.com/recap/gov.uscourts.nysd.575368/gov.uscourts.nysd.575368.54.0.pdf (SHA-256 c6fd7073…d932a7dff; full hash in Appendix B). Paragraph numbers (¶) refer to its findings of fact.
  2. A. Agrawal, M. Suzgun, L. Mackey, A. T. Kalai. Do language models know when they're hallucinating references? In Findings of the Association for Computational Linguistics: EACL 2024, pp. 912–928, 2024. doi:10.18653/v1/2024.findings-eacl.62.
  3. M. Alshiekh, R. Bloem, R. Ehlers, B. Könighofer, S. Niekum, U. Topcu. Safe reinforcement learning via shielding. In Proc. AAAI Conference on Artificial Intelligence 32(1), 2018. doi:10.1609/aaai.v32i1.11797.
  4. Harvard Law School Library Innovation Lab. Caselaw Access Project. https://case.law; project page https://lil.law.harvard.edu/projects/caselaw-access-project/, accessed 27 September 2026.
  5. C. Chow. On optimum recognition error and reject tradeoff. IEEE Transactions on Information Theory 16(1):41–46, 1970. doi:10.1109/TIT.1970.1054406.
  6. C. J. Clopper, E. S. Pearson. The use of confidence or fiducial limits illustrated in the case of the binomial. Biometrika 26(4):404–413, 1934. doi:10.1093/biomet/26.4.404.
  7. Free Law Project. CourtListener: advanced search and query techniques (the citation field; quoted phrase queries). https://wiki.free.law/c/courtlistener/help/search/advanced-search-and-query-techniques, accessed 27 September 2026.
  8. Free Law Project. CourtListener Citation Lookup and Verification API, REST v4. https://wiki.free.law/c/courtlistener/help/api/rest/v4/citation-lookup, accessed 27 September 2026.
  9. Free Law Project. CourtListener Search API, REST v4. https://wiki.free.law/c/courtlistener/help/api/rest/v4/search, accessed 27 September 2026.
  10. J. Cushman, M. Dahl, M. Lissner. eyecite: a tool for parsing legal citations. Journal of Open Source Software 6(66):3617, 2021. doi:10.21105/joss.03617.
  11. M. Dahl, V. Magesh, M. Suzgun, D. E. Ho. Large legal fictions: profiling legal hallucinations in large language models. Journal of Legal Analysis 16(1):64–93, 2024. doi:10.1093/jla/laae003. arXiv:2401.01301 (appendix cited from v2).
  12. T. Gao, H. Yen, J. Yu, D. Chen. Enabling large language models to generate text with citations. In Proc. EMNLP 2023, pp. 6465–6488. doi:10.18653/v1/2023.emnlp-main.398.
  13. N. Guha, J. Nyarko, D. E. Ho, C. Ré, et al. LegalBench: a collaboratively built benchmark for measuring legal reasoning in large language models. arXiv:2308.11462, 2023.
  14. A. T. Kalai, S. S. Vempala. Calibrated language models must hallucinate. In Proc. 56th ACM Symposium on Theory of Computing (STOC), pp. 160–171, 2024. arXiv:2311.14648.
  15. P. Lewis, E. Perez, A. Piktus, et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. In Advances in Neural Information Processing Systems (NeurIPS), 2020. arXiv:2005.11401.
  16. V. Magesh, F. Surani, M. Dahl, M. Suzgun, C. D. Manning, D. E. Ho. Hallucination-free? Assessing the reliability of leading AI legal research tools. Journal of Empirical Legal Studies 22(2):216–242, 2025. doi:10.1111/jels.12413. Figures and quotations are from the preprint, arXiv:2405.20362v1.
  17. S. Min, K. Krishna, X. Lyu, M. Lewis, W. Yih, P. W. Koh, M. Iyyer, L. Zettlemoyer, H. Hajishirzi. FActScore: fine-grained atomic evaluation of factual precision in long form text generation. In Proc. EMNLP 2023, pp. 12076–12100. doi:10.18653/v1/2023.emnlp-main.741.
  18. B. A. Nosek, C. R. Ebersole, A. C. DeHaven, D. T. Mellor. The preregistration revolution. Proceedings of the National Academy of Sciences 115(11):2600–2606, 2018. doi:10.1073/pnas.1708274114.
  19. H. Rashkin, V. Nikolaev, M. Lamm, L. Aroyo, M. Collins, D. Das, S. Petrov, G. S. Tomar, I. Turc, D. Reitter. Measuring attribution in natural language generation models. Computational Linguistics 49(4):777–840, 2023. doi:10.1162/coli_a_00486.
  20. L. Sha. Using simplicity to control complexity. IEEE Software 18(4):20–28, 2001. doi:10.1109/MS.2001.936213.
  21. W. H. Walters, E. I. Wilder. Fabrication and errors in the bibliographic citations generated by ChatGPT. Scientific Reports 13:14045, 2023. doi:10.1038/s41598-023-41032-5.

我们此前的论文(Perslis Research,2026 年 9 月)

  1. Admissible Motion: runtime safety as an admission-control problem, not a model-capability problem. research.perslis.com/motion.
  2. Fail-First Models: failure becomes structure, structure changes the next attempt. research.perslis.com/fail-first.
  3. Inference Placement: where learned inference earns authority in a provenance-constrained symbolic system. research.perslis.com/inference-placement.
  4. The Irrecoverability Boundary: where learned inference cannot recover what deterministic computation cannot reach. research.perslis.com/irrecoverability.
  5. Peel: structural hallucination prevention for offline AAC through symbolic fact authorship. research.perslis.com/peel.
  6. VDSG: a commanded admission-control runtime for autonomous agents. research.perslis.com/vdsg.
  7. The Verification Floor: scientific integrity that does not degrade with model scale. research.perslis.com/verification-floor.
  8. We Tried to Train It In: negative results on teaching small models to ground facts. research.perslis.com/training-grounding.

附录 A · 运行原文

下面是演示脚本在唯一一次实时运行中的完整输出,只去掉了 ANSI 颜色代码,其他一概未改。未经编辑的文件保存在 evidence/ 中,其哈希值见附录 B。脚本中的标题(“Fabricated by ChatGPT (should be CAUGHT)”)是它自己的措辞。它列为“应被抓住”的五个输入中,有两个是被暂缓,而不是被抓住。

⚖  THE LEGAL TEST — Mata v. Avianca fabricated citations vs the floor

Fabricated by ChatGPT (should be CAUGHT):
  NOT_FOUND    Varghese v. China Southern Airlines Co., Ltd., 925 F.3d 1339
    no case carries this mainstream-reporter citation — fabricated, REJECTED
  MISCITED     Petersen v. Iran Air, 905 F. Supp. 2d 121
    citation is real but names "United States of America v. Iss Marine Services, Inc.", NOT "Petersen v. Iran Air" — REJECTED
    ↳ United States of America v. Iss Marine Services, Inc. — 905 F. Supp. 2d 121, 84 Fed. R. Serv. 3d 384, 2012 WL 5873682, 2012 U.S. Dist. LEXIS 166088 — https://www.courtlistener.com/opinion/2661490/united-states-of-america-v-iss-marine-services-inc/
  NOT_FOUND    Miller v. United Airlines, Inc., 174 F.3d 366
    no case carries this mainstream-reporter citation — fabricated, REJECTED
  UNVERIFIABLE Martinez v. Delta Airlines, Inc., 2019 WL 4639462
    citation not in the free corpus (e.g. Westlaw/unpublished) — cannot verify
  UNVERIFIABLE Estate of Durden v. KLM Royal Dutch Airlines, 2017 WL 2418825
    citation not in the free corpus (e.g. Westlaw/unpublished) — cannot verify

Real law (should be GROUNDED):
  GROUNDED     Miranda v. Arizona, 384 U.S. 436
    ↳ Miranda v. Arizona — 16 L. Ed. 2d 694, 86 S. Ct. 1602, 384 U.S. 436, 1966 U.S. LEXIS 2817, 10 Ohio Misc. 9, 36 Ohio Op. 2d 237, 10 A.L.R. 3d 974 — https://www.courtlistener.com/opinion/107252/miranda-v-arizona/
  GROUNDED     Brown v. Board of Education, 347 U.S. 483
    ↳ Brown v. Board of Education — 347 U.S. 483, 74 S. Ct. 686, 1954 U.S. LEXIS 2094, 38 A.L.R. 2d 1180, 53 Ohio Op. 326, 98 L. Ed. 873 — https://www.courtlistener.com/opinion/105221/brown-v-board-of-education/
  GROUNDED     Gideon v. Wainwright, 372 U.S. 335
    ↳ Gideon v. Wainwright — 372 U.S. 335 — https://www.courtlistener.com/opinion/8954562/gideon-v-wainwright/

SCORE
  fabrications caught (NOT_FOUND/MISCITED): 3/5   (+2 UNVERIFIABLE = free-data gap, honestly abstained)
  fabrications that SLIPPED THROUGH:        0
  real law grounded with receipts:         3/3
  real law FALSELY rejected:                0

  FLOOR HELD — no fabrication reached a verified state, no real law falsely rejected.

附录 B · 复现、证据与代码对照

证据文件(均位于本文文件夹的 evidence/ 之下)。

重建每一个数字、表格和图(只读;无需网络)。

python3 -B analysis/parse_run.py       # recount the run
python3 -B analysis/record_table.py    # pin the record to opinion lines
python3 -B analysis/make_tables.py     # Tables 1 and 3, TeX and HTML
python3 -B analysis/make_transcript.py # Appendix A
python3 -B analysis/bounds.py          # Section 10 bounds
python3 -B web-build/export_figs.py    # Figures 1 and 2

每个脚本在输入与其预期不符时都会中止。实时运行本身只做过一次,命令记录在 .meta.txt 中。重复运行会再次查询 CourtListener,而它的回答可能已经变了。

代码对照。行号指该工作线的提交 533f783。

如何引用

Perslis Research. A Citation Floor for Case Law: The Mata v. Avianca Citations, Re-checked. Research prototype, September 2026. https://research.perslis.com/legal-floor

@techreport{perslis2026legalfloor,
  title       = {A Citation Floor for Case Law: The Mata v. Avianca Citations, Re-checked},
  author      = {{Perslis Research}},
  institution = {Perslis Research},
  year        = {2026},
  month       = {9},
  note        = {Research prototype; not legal advice; not a citator.},
  url         = {https://research.perslis.com/legal-floor}
}