AI 系统 · 法律引注核查 · 研究原型(不构成法律意见,不是引证检索服务)
判例法的引注地板
用免费判例数据库复核 Mata v. Avianca 案的引注。模型可以提议一条引注。只有真实判例数据库中相符的记录才能接纳它;数据库无法判断时,地板会如实说明。
在 Mata v. Avianca, Inc.(S.D.N.Y. 2023)一案中,法院对一份援引了六个根本不存在的判决的诉讼文书作出制裁。我们描述一种只有一条规则的引注地板:模型可以提议一个案件名称和引注,但只有公共判例数据库中相符的记录才能接纳它。地板返回六种判定之一(附凭证的 GROUNDED、AMBIGUOUS、NOT_FOUND、MISCITED、NOT_GOOD_LAW、UNVERIFIABLE);只有在它假定免费数据库完整收录的判例汇编中,查无结果才被当作虚构的证据;在其他情形下,以及遇到任何数据源错误时,它都弃权。在针对 CourtListener 的一次实时运行中(八次查询,未使用 API 令牌),它对所测试的五条虚构引注一条也没有接纳:拒绝三条(两条 NOT_FOUND,一条 MISCITED),将两条 Westlaw 引注以 UNVERIFIABLE 暂缓;三条真实的最高法院引注全部附来源链接落地。它给出的 MISCITED 凭证,指向的正是法院在该引注处认定的那个真实案件。这次运行覆盖了法院意见中 12 条虚构或与所引不符的引注中的 5 条,而 6 项被误用的真实判决一项也未覆盖——存在性核查按设计会接纳它们。通过阅读代码,我们发现三条本次运行没有触及的失效路径:与引注处真实案件共享一个常见当事人词语的虚构案名会被接纳;以不同形式书写的真实案件可能被拒绝;对判例是否仍然有效的否决不在被测路径上。我们陈述了使拒绝成立的收录假设,并设计了下一个实验,其门槛事先固定。
生成的引注看起来和真的一样,生成它的工具也会说它是真的。能够定案的是记录;在记录也无法定案的地方,诚实的回答是暂缓。
问题。律师用过去的法院判决支持自己的论点,每个判决都用一本书、一个卷号和一个页码来标识。AI 写作工具可能编造出看起来和真判决一模一样的判决。在 2023 年纽约的一个案件 Mata v. Avianca 中,法院认定一份文书援引了六个并不存在的判决,并对其作出制裁。有人曾问这个工具这些案件是不是真的,它说是真的。
我们做了什么。一个不信任写作者的核查器。对每一条引注,它向一个免费的公共判决数据库提两个问题:这个卷号和页码上是否确有一个真实判决?它是不是写作者说的那个案件?如果是,就放行,并附上真实记录的链接。如果这一页属于另一个案件,或者在数据库理应掌握的地方什么也没有,就拦下。如果数据库无从得知——比如引用的是 Westlaw 这类付费服务的编号——它就如实说明,把这条引注交给人来判断。它从不猜。
结果。我们在 Mata 案的虚构引注和三个著名的真实判决上运行了一次。五条虚构引注一条也没有放行:拦下三条,两条交给人判断。三条真实引注全部放行,并附链接。对其中一条虚构引注,它指出了那一页实际属于哪个真实案件——与法院指出的是同一个案件。
它不是什么。它不构成法律意见,也不能替代专业的法律检索服务。它核查的是被引用的案件是否存在、是否就是所称的那个案件;它不核查该案件是否真的支持写作者的说法,也不核查它是否仍然有效。阅读我们自己的代码时,我们还发现了几种这次测试没有尝试、却可能骗过它的方式,并一一列出。
1 · 引言
在一份法律文书中,案件引注是可以机械核查的部分。它写明一个判例汇编、一个卷号和一个起始页;要么有一份判决意见从这一页开始,要么没有;如果有,它就有一个名字。生成式模型写出的文字看起来都像引注,不论所指的判决是否存在,而法律记录如今已经显示了后果。在 Mata v. Avianca, Inc. 一案中,法院认定一份反对驳回起诉动议的文书所援引的六个判决是伪造的,其事实认定记载了这些判决“由 ChatGPT 生成,并不存在”(“were generated by ChatGPT and do not exist”)的承认 [1, ¶ 36]。法院还认定,其中一份伪造的判决意见“包含内部引注和引文,而这些被引的判决本身也不存在” [1, ¶ 29],并作出了制裁。这份记录还以最简单的形式包含了本文所关注的失败:被问及这些案件是否真实时,该工具“答称它提供的是可以在 Westlaw、LexisNexis 和《联邦判例汇编》(Federal Reporter)中找到的‘真实’判例” [1, ¶ 45]。提议者对自己提议的担保,不是核查。
本文描述一种位于提议者之外的核查。沿用我们此前工作中的准入模式,我们称之为引注地板:模型可以提议,只有有据可查的来源才能接纳 [28, 26, 22]。地板对模型提议的每一条引注问两个问题:这个引注处是否确有一份真实的判决意见?它是不是提议者所称的那个案件?它依据一个公共判例数据库 CourtListener [9] 作答,给出六种判定之一。每个判定都带有一个动作(接纳、拒绝或暂缓),并且在有记录时带有一份凭证:记录本身及其链接。这一设计建立在律师早已熟知的一种不对称之上:把真实的判例说成虚构,本身就是一种错误指控,其危害可能不亚于接纳一个假判例。因此,只有在数据库的收录范围使“查无结果”具有信息量的地方,查无结果才算作虚构的证据;在其他任何地方,以及数据源出现任何错误时,地板都弃权。
我们在这个问题公开暴露的地方检验它。我们实时运行了一次地板,输入是其演示脚本所含的 Mata 案虚构引注,以及作为对照的三条真实最高法院引注。然后我们把结果逐条与法院自己的认定对照,并与法院意见列出的全部援引对照——其中大多数并不在脚本之中。最后,我们阅读代码,寻找契约在本次运行未包含的输入上可能失效的方式。
1.1 · 贡献
- C1. 一份接纳引注的契约(§3)。六种判定,各自绑定一个动作和一份凭证;另有一条收录规则:只有对地板视为完整收录的判例汇编,数据库查无结果才算作虚构的证据。我们陈述一次拒绝究竟证明了什么(命题 1),并表明传输层故障永远不会变成关于存在与否的判定(命题 2)。
- C2. 在公开记录上的一次复核(§4–§5)。在一次实时运行中(2026 年 9 月 27 日,八次查询,未使用 API 令牌),地板接纳了 5 条中的 0 条虚构引注:拒绝 3 条(两条 NOT_FOUND,一条 MISCITED),以 UNVERIFIABLE 暂缓 2 条。它为 3 条中的 3 条真实引注附凭证落地。唯一一份 MISCITED 凭证指向的,正是法院在该引注处认定的真实案件 United States v. ISS Marine Services [1, ¶ 34]。
- C3. 整份记录的地图(§6)。法院意见列出了 12 条虚构或与所引不符的引注,以及 6 项被用来支持其并未表达之内容的真实判决。我们把这 18 项全部归入六个错误类别,并逐类说明契约能给出什么结论、实际运行了哪些(18 项中的 5 项),以及哪些是任何存在性核查都抓不到的。
- C4. 一次审计和下一个实验(§7–§8)。通过阅读代码,我们发现三条本次运行没有触及的失效路径:因共享当事人词语而造成的错误接纳;以不同形式书写的真实判例被错误拒绝;以及对判例有效性的否决不在被测路径上。据此我们设计了一个以失效为导向、比较确定性核查与学习式核查的实验,其门槛事先固定。
1.2 · 我们主张什么,不主张什么
在八个输入上、在一天之内、针对一个免费数据库,地板没有接纳任何虚构引注,也没有拒绝任何真实引注。它的凭证可以与法院自己的认定相互核对,其中一份与法院的认定完全一致。
我们不主张任何错误接纳率或错误拒绝率:样本只有五条虚构引注和三条著名的真实引注,而且 §7 的审计给出了地板会失效的输入。GROUNDED 判定的意思是:该引注存在,并且就是所称的案件。它不表示该案件仍然有效,也不表示该案件支持它被引来支持的论点。地板不是引证检索服务(citator),本文内容也不构成法律意见。我们没有评估任何商业检索工具。这些组成部分都不是新的:引注查询服务、引注解析器和引证检索服务早已存在(§9),CourtListener 本身就提供一个需要令牌的查询接口,其文档称之为“可用作防止幻觉引注的护栏”(“a guardrail to help prevent hallucinated citations”) [8]。我们的贡献在于查询之外的契约:查无结果被允许意味着什么,出错时怎么办,一个判定携带什么,以及在这个问题记录得最充分的公开案件上,如实测量这份契约能走多远。
2 · 公开记录
我们只依据法院的《关于制裁的意见与命令》(Opinion and Order on Sanctions),Mata v. Avianca, Inc., No. 22-cv-1461 (PKC), ECF No. 54 (S.D.N.Y. June 22, 2023)。这是一份 43 页的文件:34 页意见正文和两个附录 [1]。我们从公开的 RECAP 档案库取得它,并固定了其哈希值(附录 B)。下文的段落编号指该意见中的事实认定。我们只提及案件引注中出现的当事人和法院,不提及其他任何人。
发生了什么。原告因一次国际航班上受伤起诉一家航空公司。航空公司以诉讼请求已过《蒙特利尔公约》规定的时效为由,申请驳回起诉(第 3 段)。2023 年 3 月 1 日提交的反对该动议的宣誓陈述,援引了一些航空公司律师找不到的判决:航空公司 3 月 15 日的答辩“逐一列明名称和引注,指出七个它无法找到的所谓‘判决’”(第 7 段)。4 月 11 日和 12 日,法院命令提交九个被援引判决的副本(第 13–14 段)。4 月 25 日,提交了其中除一个之外全部判决的所谓副本或摘录(第 18 段)。法院随后就这些“判决”作出认定(第 24–36 段),并于 2023 年 6 月 22 日依据《联邦民事诉讼规则》第 11 条(或者,作为替代,依据其固有权力)作出制裁(第 34 页)。
法院认定了什么。表 1 分三组列出法院意见指明的全部援引。
- 宣誓陈述中援引的六个虚构判决,事实认定记载它们“并不存在”(第 36 段)。其中三个,法院说明了其引注实际指向哪里:给 Petersen 的《联邦地区法院判例汇编》(Federal Supplement)引注属于另一个真实案件(第 34 段);给 Varghese 和 Miller 的《联邦判例汇编》引注,按法院的措辞,分别“对应于”(associated with)和“属于”(to)另外的真实判决意见,而这些意见都从同一卷中更靠前的页码开始(第 28、32 段)。其余三个(Shaboon、Martinez、Durden)“有类似缺陷”(第 35 段);它们分别以一条伊利诺伊州公共领域中立引注和两个 Westlaw 编号被援引。
- 伪造的 Varghese 判决意见内部援引的、并不存在或与所引不符的六项判例(第 29 段 a–f)。对每一项,法院都说明了该引注处实际是什么。其中两项借用了以其他引注判决的真实案件的名称:Zicherman(一个真实的最高法院判决)和 In re BDC 56 LLC(一个真实的第二巡回法院判决)。带着虚假《联邦判例汇编》引注的 Zicherman,在宣誓陈述本身中也被援引过(第 14 段)。
- 六个真实判决,名称和引注都正确,但“不包含所引用的文字,也不支持它们被用来支持的论点”(第 29 段 g)。其中一个还被标错了法院。
这份记录也说明了为什么核查必须位于提议者之外。当被问及这些案件是否真实时,该工具回答说是真实的,并且可以在 Westlaw、LexisNexis 和《联邦判例汇编》中找到(第 45 段)。记录中还有证言表明,存在一些免费网站,输入一个已知的判决引注就能显示该判决(第 12 段)。本文自动化的核查,是任何人都可以手工完成的核查。地板的作用,是让这一核查成为必经步骤,并让它的答案具有约束力、附带凭证。
| # | 援引(按原文) | 法院的认定 | 意见段落 | 类别 | 地板(9 月 27 日) |
|---|---|---|---|---|---|
| 宣誓陈述中援引的虚构判决(第 36 段) | |||||
| 1 | Varghese v. China Southern Airlines Co., Ltd., 925 F.3d 1339 (11th Cir. 2019) | 无此判决(第十一巡回上诉法院书记官确认)。该引注“对应于” J.D. v. Azar, 925 F.3d 1291 (D.C. Cir. 2019)。 | 第 26–28 段 | A | NOT_FOUND |
| 2 | Shaboon v. Egyptair, 2013 IL App (1st) 111279-U (Ill. App. Ct. 2013) | 不存在;有“类似缺陷”。 | 第 35–36 段 | C | 未运行 |
| 3 | Peterson v. Iran Air, 905 F. Supp. 2d 121 (D.D.C. 2012) | 不存在。该引注属于 United States v. ISS Marine Services, 905 F. Supp. 2d 121 (D.D.C. 2012)。命令中拼作“Peterson”,所附文本为“Petersen”。 | 第 33–34 段 | B | MISCITED |
| 4 | Martinez v. Delta Airlines, Inc., 2019 WL 4639462 (Tex. App. Sept. 25, 2019) | 不存在;有“类似缺陷”。 | 第 35–36 段 | C | UNVERIFIABLE |
| 5 | Estate of Durden v. KLM Royal Dutch Airlines, 2017 WL 2418825 (Ga. Ct. App. June 5, 2017) | 不存在;有“类似缺陷”。 | 第 35–36 段 | C | UNVERIFIABLE |
| 6 | Miller v. United Airlines, Inc., 174 F.3d 366, 371-72 (2d Cir. 1999) | 不存在。该引注属于 Greenleaf v. Garlock, Inc., 174 F.3d 352 (3d Cir. 1999)。 | 第 30–32 段 | A | NOT_FOUND |
| 伪造的 Varghese 内部援引:不存在或与所引不符(第 29 段 a–f) | |||||
| 7 | Holliday v. Atl. Capital Corp., 738 F.2d 1153 (11th Cir. 1984) | 不存在。该引注处的判例是 Gibbs v. Maxwell House, 738 F.2d 1153 (11th Cir. 1984)。 | 第 29(a) 段 | B | 未运行 |
| 8 | Gen. Wire Spring Co. v. O’Neal Steel, Inc., 556 F.2d 713, 716 (5th Cir. 1977) | 不存在。该引注处的判例是 United States v. Clerkley, 556 F.2d 709 (4th Cir. 1977)。 | 第 29(b) 段 | A | 未运行 |
| 9 | Hyatt v. N. Cent. Airlines, 92 F.3d 1074 (11th Cir. 1996) | 不存在。92 F.3d 1074 处是其他案件的两份简短命令。 | 第 29(c) 段 | B | 未运行 |
| 10 | Zaunbrecher v. Transocean Offshore Deepwater Drilling, Inc., 772 F.3d 1278, 1283 (11th Cir. 2014) | 不存在。该引注处的判例是 Witt v. Metropolitan Life Ins. Co., 772 F.3d 1269 (11th Cir. 2014)。 | 第 29(d) 段 | A | 未运行 |
| 11 | Zicherman v. Korean Air Lines Co., 516 F.3d 1237, 1254 (11th Cir. 2008) | 与所引不符:真实的 Zicherman 是 516 U.S. 217 (1996);该 F.3d 引注属于 Miccosukee Tribe v. United States, 516 F.3d 1235。宣誓陈述中亦有援引(第 14 段)。 | 第 29(e);另见 第 14 段 | A+D | 未运行 |
| 12 | In re BDC 56 LLC, 330 B.R. 466, 471 (Bankr. D.N.H. 2005) | 与所引不符:同名的第二巡回法院判决是 330 F.3d 111 (2d Cir. 2003);该 B.R. 引注处的判例是 In re 652 West 160th LLC, 330 B.R. 455。 | 第 29(f) 段 | A+D | 未运行 |
| 伪造的 Varghese 内部援引:真实判决,但并非所引用途(第 29 段 g) | |||||
| 13 | In re Rimstat, Ltd., 212 F.3d 1039 (7th Cir. 2000) | 真实;涉及第 11 条制裁,未讨论破产自动中止。 | 第 29(g) 段 | E | 未运行 |
| 14 | In re PPI Enterprises (U.S.), Inc., 324 F.3d 197 (3d Cir. 2003) | 真实;未讨论自动中止;被误标为第二巡回法院的意见。 | 第 29(g) 段 | E+F | 未运行 |
| 15 | Begier v. I.R.S., 496 U.S. 53 (1990) | 真实;未讨论自动中止。 | 第 29(g) 段 | E | 未运行 |
| 16 | Kaiser Steel Corp. v. W. S. Ranch Co., 391 U.S. 593 (1968) | 真实;未讨论自动中止。 | 第 29(g) 段 | E | 未运行 |
| 17 | El Al Israel Airlines, Ltd. v. Tsui Yuan Tseng, 525 U.S. 155 (1999) | 真实;不含所引用的文字。 | 第 29(g) 段 | E | 未运行 |
| 18 | In re Gandy, 299 F.3d 489 (5th Cir. 2002) | 真实;维持了驳回强制仲裁动议的裁定。 | 第 29(g) 段 | E | 未运行 |
3 · 地板的契约
我们通过地板接受什么、回答什么、每个回答携带什么来描述它,而不描述其内部实现。图 1 画出了 Mata 测试所用的路径。
3.1 · 输入与数据库
地板有两个入口。resolve(reference) 接受一个案件名称或一条引注。verify(name, citation) 接受文书实际写出的那一对,例如 Petersen v. Iran Air, 905 F. Supp. 2d 121,并询问该引注是否存在、是否属于所称的案件。引注必须以最简形式给出:卷号、判例汇编、起始页。地板不会去掉精确页码引注(pin cite)和法院与年份括注;§7 说明保留它们会发生什么。
数据库是由 Free Law Project 运营的 CourtListener [9]。地板只使用其公共搜索接口,无需账户,也无需令牌。CourtListener 在文档中把 citation 描述为“一个涵盖某一判决意见全部引注的字段”,并把引号说明为短语查询,“不做词干还原,也不匹配同义词” [7]。因此地板在该字段内只查询一个带引号的短语,citation:("905 F. Supp. 2d 121"),而不是做自由文本搜索。本工作线的开发记录写道,不加引号的字段查询会把卷号和页码分开匹配;我们在此没有重新测试这一点。数据库的排序本身从不决定判定:在返回的记录中,地板只保留那些在其引注列表中包含该输入的记录,比较时只统一大小写和空白。
3.2 · 判定、动作与凭证
表 2 就是全部的输出词汇。每种判定对应三种动作之一:接纳(该引注可以进入可信状态)、拒绝(不可以),或暂缓(暂时不可以,须由人或付费引证检索服务决定)。凭证是判定背后的数据库记录:案件名称、数据库为它列出的每一条引注、法院、日期、记录的标识符及其 URL。任何人都可以打开凭证并核对。凭证是指向公共记录的链接,不是签名证据;链接背后的记录可能会变(§10)。
| 判定 | 含义 | 动作 | 入口 | 在我们的证据中 |
|---|---|---|---|---|
| GROUNDED | 有一条真实记录载有该引注,且所称名称与之相符(成对);或恰有一条记录与该引用匹配(单一)。 | 接纳,附凭证 | 成对、单一 | 运行:3;测试 |
| AMBIGUOUS | 多条不同记录与单一引用匹配。 | 暂缓:待消歧 | 单一 | 运行:0;测试允许 |
| NOT_FOUND | 没有记录载有该引注,且其判例汇编属于地板视为完整收录的范围;或没有记录与某个名称匹配。 | 拒绝 | 成对、单一 | 运行:2;测试 |
| MISCITED | 有一条真实记录载有该引注,但它指的是另一个案件。 | 拒绝,附凭证 | 成对 | 运行:1;测试 |
| NOT_GOOD_LAW | 所有匹配的记录都被标记为受到负面处理(被推翻、被撤销)。 | 拒绝(硬否决) | 单一 | 运行:0;无测试 |
| UNVERIFIABLE | 数据源在重试后仍然失败;或没有记录载有某条引注,而其形式不在免费数据库完整收录的范围内(Westlaw 和 Lexis 编号、中立引注、其他判例汇编)。 | 暂缓 | 成对、单一 | 运行:2;测试 |
3.3 · 缺失何时构成证据?
核心的设计选择在于:查无结果被允许意味着什么。一次什么也没找到的查询,本身什么也证明不了:引注可能是虚构的,数据库可能缺少这份判决意见,也可能是请求失败了。只有在前两种情形能够区分开时,地板才把查无结果读作虚构,而这取决于收录范围。
这个命题有意写得很短,目的是把假设摆到明处。一次拒绝的可靠程度恰好等于三件事:\(R_c\) 的收录主张、查询的检索主张,以及输入是否规范。这三者本文都没有测量;§7 和 §10 说明了每一项可能如何失效。地板自己对拒绝的说明写的是“fabricated”(虚构)。严格说来,它证明的只是没有任何判决意见从被引用的那一页开始;“虚构”是法院依据整份记录作出的推断。
这个命题不涵盖格式正确但内容错误的响应。一个因错误而返回的空结果集,或者数据库响应中的一个字段被改名,都会把真实引注变成 NOT_FOUND。防范办法是在每一批次中同时运行已知的真实引注作为金丝雀(canary),只要其中任何一条未能落地,就作废整个批次。我们这次运行中的三个对照正起到这个作用(§4)。
3.4 · 限流与快速失败
本工作线的开发记录写道,CourtListener 对未认证的搜索限流很严。不论限流程度如何,被限流都不是关于法律的证据。地板让发往同一主机的请求至少间隔一秒。遇到 HTTP 429、502、503 或 504 以及网络错误时,它总共最多尝试四次。如果服务器给出 Retry-After 值,就按该值等待,否则依次等待 1、2、4 秒;每次等待都不超过 30 秒。任何其他 HTTP 错误立即失败,非 JSON 的响应也一样。重试之后仍然存在的故障变为 UNVERIFIABLE(命题 2)。地板从不退而求其次去猜测、使用缓存答案或改用别的来源。
3.5 · 尚未核查判例是否仍然有效
一条引注可以存在、指向正确的案件,却仍然不是有效的判例(good law)。要知道一个案件是否被推翻、撤销或取代,需要 Shepard's 和 KeyCite 等商业引证检索服务提供的后续处理记录;免费的搜索结果不提供这些信息。地板设有否决(NOT_GOOD_LAW),但它在免费层面的信号仅限于记录本身显示的内容,而且 Mata 测试所用的成对核查根本不调用它(§7)。我们的运行和已提交的测试都没有产生过这一判定。因此 GROUNDED 的意思是“存在,并且就是所称的案件”,而绝不是“仍然有效”。要弥补这一缺口,要么需要付费的引证检索服务,要么需要基于 CourtListener 免费引用网络构建的处理记录。后者已在计划中,尚未构建。
3.6 · 实现与范围
地板由三个模块共 344 行 Python 代码组成,只使用标准库。随附一个 123 行的实时测试文件和一个 86 行的演示脚本,均位于提交 533f783。《可准入的运动》一文把法律地板列为一种跨领域准入模式的实例之一,与生物地板和运动地板并列 [22]。共享的是模式:提议、对照有据可查的来源核查、接纳、拒绝或暂缓,并附凭证。共享的不是代码。法律地板没有从生物地板的引擎导入任何东西;它是同一契约的一个独立实现。连接器还实现了 CourtListener 需要令牌的引注查询端点,但地板从不调用它。这里的一切都是美国判例法,被视为完整收录范围内的每一个判例汇编都是联邦或最高法院判例汇编。
4 · 方法
一次运行,完整记录。我们于 2026 年 9 月 27 日 09:08:25 至 09:08:33 UTC 实时运行了一次本工作线的演示脚本。未设置 CourtListener 令牌。代码位于提交 533f783,脚本所在目录与该提交逐字节一致(没有本地改动)。我们用 Python 3.9.6 运行,并禁止写入字节码,以免在该工作线目录中留下任何东西。完整输出及其 SHA-256 哈希,以及每个源文件的哈希,都保存在本文的 evidence/ 文件夹中(附录 B)。脚本对每个输入发出一次数据库查询,共八次。我们没有重复这次运行。本文的范围只允许一次实时运行,一是为了固定证据,二是为了尽量减轻对一项免费公共服务的负担。
输入。脚本向 verify 传入八对(名称,引注)。
- 取自记录的五对虚构引注:Varghese、Petersen、Miller、Martinez 和 Durden。它们是表 1 中六个虚构判决里的五个;Shaboon 不在脚本中。引注已由人工规范为地板要求的最简形式:Miller 的精确页码(“371–72”)和所有法院与年份括注都已去掉。Petersen 的拼写与所附文本一致;法院的命令中拼作“Peterson”。
- 三个真实对照:Miranda v. Arizona, 384 U.S. 436;Brown v. Board of Education, 347 U.S. 483;以及 Gideon v. Wainwright, 372 U.S. 335。它们充当金丝雀(§3.3)。它们也是最容易的真实引注:《美国最高法院判例汇编》中的里程碑式判决。
结果编码。我们把 GROUNDED 记为接纳,把 NOT_FOUND 和 MISCITED 记为拒绝,把 UNVERIFIABLE 记为暂缓。对虚构输入而言,接纳正是地板要防止的失败;拒绝算作抓住;暂缓两者都不是——它是一次移交,我们从不把它算作抓住。对真实输入而言,拒绝是一次错误指控,暂缓是一份成本。一个小脚本重新解析运行输出,重算每一个计数,并与演示脚本自己的得分行核对;任何不一致都会让它中止。
外部核对。对每一个判定,我们都把凭证(或凭证的缺失)与法院在同一引注处的认定相比较(表 1)。第二个脚本把每一项援引以及我们依据的每一处认定,定位到法院意见文本中的具体行;只要有任何引文片段找不到,它就中止。§6 中的错误类别是我们划分的,依据的是法院的认定,而不是地板的输出。
已提交的测试,未重新运行。本工作线有 11 个实时测试。其测试缓存显示,最后一次记录的会话(9 月 23 日 18:38 EDT)收集了全部 11 个测试,没有记录任何失败。因无网络而全部跳过的测试同样会留下一个空的失败列表,所以仅凭缓存并不能证明它们通过了。提交信息称它们实时通过。我们只把它们引作本工作线声明的预期。其中四个断言 Mata 案的判定,第五个断言 Miranda 这一对;我们的运行重现了全部五个。其余六个检验单一引用解析(五个测试)和引注格式检测器(一个),本次运行没有用到这两部分。
通过阅读进行审计。我们逐行阅读了地板及其连接器,并对每一种判定追问:这个判定证明了什么,哪些输入可能让它出错。§7 中的每一项发现都引用了支持它的文件和行号。它们都没有被执行:本文的范围只允许那一次实时运行,别的都不允许。因此每一项审计发现都被表述为代码的一个性质,并附上会暴露它的输入。
5 · 结果
5.1 · 这次运行
表 3 给出每一个判定及其凭证或说明。演示脚本自己的得分行与我们的重算一致。
虚构(n = 5):接纳 0;拒绝 3(NOT_FOUND 2,MISCITED 1);暂缓 2(UNVERIFIABLE)。
真实(n = 3):接纳 3(GROUNDED),每条都附 CourtListener 凭证;拒绝 0;暂缓 0。
八次查询,墙钟时间 8 秒,一次运行,未使用 API 令牌。
五条虚构引注中有两条是被暂缓,而不是被抓住。地板的契约认为这是正确的行为,因为免费数据库并不声称收录 Westlaw 编号;但暂缓什么也没有抓住。它把这条引注交给一个人,而在本案中,这个人需要 Westlaw 或出具判决的法院才能定案。演示脚本的文档字符串称地板“一个不漏地全部抓住”(“catches every one”)。它的得分行报告的是“3/5 (+2 UNVERIFIABLE)”,而准确的是得分行。
| 输入(名称,引注) | 判定 | 地板返回的凭证或说明 | 法院的认定 |
|---|---|---|---|
| Varghese v. China Southern Airlines Co., Ltd., 925 F.3d 1339 | NOT_FOUND | 说明(程序原文输出):“no case carries this mainstream-reporter citation — fabricated, REJECTED” | 无此判决(第十一巡回上诉法院书记官确认)。该引注“对应于” J.D. v. Azar, 925 F.3d 1291 (D.C. Cir. 2019)。 |
| Petersen v. Iran Air, 905 F. Supp. 2d 121 | MISCITED | 真实引注,另一案件:United States of America v. Iss Marine Services, Inc. — 905 F. Supp. 2d 121; 84 Fed. R. Serv. 3d 384; 2012 WL 5873682; 2012 U.S. Dist. LEXIS 166088 — https://www.courtlistener.com/opinion/2661490/united-states-of-america-v-iss-marine-services-inc/ | 不存在。该引注属于 United States v. ISS Marine Services, 905 F. Supp. 2d 121 (D.D.C. 2012)。命令中拼作“Peterson”,所附文本为“Petersen”。 |
| Miller v. United Airlines, Inc., 174 F.3d 366 | NOT_FOUND | 说明(程序原文输出):“no case carries this mainstream-reporter citation — fabricated, REJECTED” | 不存在。该引注属于 Greenleaf v. Garlock, Inc., 174 F.3d 352 (3d Cir. 1999)。 |
| Martinez v. Delta Airlines, Inc., 2019 WL 4639462 | UNVERIFIABLE | 说明(程序原文输出):“citation not in the free corpus (e.g. Westlaw/unpublished) — cannot verify” | 不存在;有“类似缺陷”。 |
| Estate of Durden v. KLM Royal Dutch Airlines, 2017 WL 2418825 | UNVERIFIABLE | 说明(程序原文输出):“citation not in the free corpus (e.g. Westlaw/unpublished) — cannot verify” | 不存在;有“类似缺陷”。 |
| Miranda v. Arizona, 384 U.S. 436 | GROUNDED | Miranda v. Arizona — 16 L. Ed. 2d 694; 86 S. Ct. 1602; 384 U.S. 436; 1966 U.S. LEXIS 2817; 10 Ohio Misc. 9; 36 Ohio Op. 2d 237; 10 A.L.R. 3d 974 — https://www.courtlistener.com/opinion/107252/miranda-v-arizona/ | (真实对照) |
| Brown v. Board of Education, 347 U.S. 483 | GROUNDED | Brown v. Board of Education — 347 U.S. 483; 74 S. Ct. 686; 1954 U.S. LEXIS 2094; 38 A.L.R. 2d 1180; 53 Ohio Op. 326; 98 L. Ed. 873 — https://www.courtlistener.com/opinion/105221/brown-v-board-of-education/ | (真实对照) |
| Gideon v. Wainwright, 372 U.S. 335 | GROUNDED | Gideon v. Wainwright — 372 U.S. 335 — https://www.courtlistener.com/opinion/8954562/gideon-v-wainwright/ | (真实对照) |
5.2 · 与法院认定的一致性
对每一个输入,都可以把地板的回答与法院在同一引注处的认定放在一起比较。
- Petersen, 905 F. Supp. 2d 121:完全一致。地板返回 MISCITED,其凭证指明该引注处是 United States of America v. Iss Marine Services, Inc.(大小写沿用 CourtListener)。法院认定:“该《联邦地区法院判例汇编》引注属于 United States v. ISS Marine Services, 905 F. Supp. 2d 121 (D.D.C. 2012)” [1, ¶ 34]。同一个案件,由一次对该法院意见一无所知的查询独立找到。
- Varghese, 925 F.3d 1339 和 Miller, 174 F.3d 366:同样的拒绝,更窄的理由。地板报告说没有任何记录载有这两条引注。法院则把它们与在同一卷中更靠前页码开始的真实判决意见对应起来:925 F.3d 1291 的 J.D. v. Azar 和 174 F.3d 352 的 Greenleaf v. Garlock(第 28、32 段)。两种说法是一致的:引注以起始页来标识一份判决意见,而被引用的两个页码都不是任何判决意见的起始页。地板说不出被引用的那一页落在哪份意见之内,因为它只解析起始页;按页码范围查询则可以做到(§8)。
- Martinez 和 Durden(Westlaw 编号):被暂缓,并且没有被拒绝是对的。法院认定两者都不存在(第 35–36 段)。免费数据库中没有载有这两个 Westlaw 编号的记录,地板选择了弃权。这次弃权之所以正确,有一点容易被忽视:CourtListener 确实把一部分 Westlaw 编号作为平行引注记录下来——上面 ISS Marine 的凭证就列有 2012 WL 5873682。所以 Westlaw 编号只被部分收录,对它查无结果只是收录缺口,而不是案件不存在的证据。
5.3 · 案件记录核查了多少
图 2 把这次运行放到整份记录中来看。运行覆盖了 6 个中的 5 个虚构判决。法院意见一共指明了 12 条虚构或与所引不符的引注(六个判决,加上伪造的 Varghese 内部的六项),因此运行覆盖的是 12 条中的 5 条。法院认定被误用的 6 项真实判决,运行覆盖了 0 项。在法院意见指明的全部 18 项援引中,运行了 5 项,13 项没有运行。因此准确的一句话总结是:在本案的虚构引注中,地板对其中五条作出了判定,拒绝三条、暂缓两条,一条也没有接纳。而不是“地板抓住了 Mata 案的虚构引注”。
5.4 · 凭证
四个有记录支撑的判定——三个 GROUNDED 和一个 MISCITED——都附有凭证:案件名称、数据库为该记录列出的每一条引注,以及一个 CourtListener URL。各凭证的完整程度不同。Miranda 的记录列有 7 条引注,Brown 的列有 6 条,包括它们在《最高法院判例汇编》和《律师版》中的平行引注。Gideon 的只列有 372 U.S. 335,因此一份以平行引注援引 Gideon 的文书不会与这条记录匹配。是否有另一条记录载有那条引注,我们没有核查。两个 NOT_FOUND 和两个 UNVERIFIABLE 判定只带有地板的说明,因为没有记录可以出示。
5.5 · 成本
这次运行 8 次查询共用了 8 秒墙钟时间,与地板每秒一次请求的间隔相符。我们没有记录重试次数或单次查询的延迟,因此不报告延迟数据。这次运行不需要账户,也不需要令牌。
6 · 存在性核查能看到什么、看不到什么
法院意见中的十八项援引以不同的方式出错。表 4 依据法院的认定把它们分为六类,并给出契约对每一类作出的判定。对运行过的类别,判定是实测结果;对没有运行的类别,判定是 §3 的契约所规定的结果,我们如此标注:规定不等于结果。
| 类别(按法院的描述) | 援引 | 地板 | 需要什么 | |
|---|---|---|---|---|
| A | 没有判决意见从被引用的页码开始;法院找到的是一份从更靠前页码开始的意见。 | 6:Varghese、Miller、Gen. Wire Spring、Zaunbrecher、Zicherman、In re BDC 56 | 在被视为完整收录的判例汇编中为 NOT_FOUND(已运行的 2 项中实测 2 项);BDC 56 的判例汇编(B.R.)不在收录范围内,为 UNVERIFIABLE(规定)。 | 按页码范围查询,像法院那样指出该页落在哪份意见之内。 |
| B | 被引用的起始页开始的是另一份真实的判决意见。 | 3:Petersen、Holliday、Hyatt | MISCITED(已运行的 1 项中实测 1 项)。Hyatt 所在页有两份命令,而地板只把名称与第一条记录比较(§7)。 | 把名称与该页上的每一条记录比较。 |
| C | Westlaw 编号或公共领域中立引注。 | 3:Martinez、Durden、Shaboon | UNVERIFIABLE(已运行的 2 项中实测 2 项);Shaboon 未运行,取决于免费数据库是否收录了该中立引注。 | 付费引证检索服务,或出具判决的法院自己的记录。 |
| D | 真实案件的名称,配上一个它并没有的引注。 | 2:Zicherman、In re BDC 56 | 由引注决定,同类别 A(规定)。仅按名称查询会找到真实案件并接纳它。 | 始终核查成对的名称与引注,绝不只核查名称。 |
| E | 真实判决,引注正确,但不包含所引文字或不支持所主张的论点。 | 6:第 29 段 (g) | 按设计为 GROUNDED(规定)。存在不等于支持。 | 对照论点阅读判决意见:一种支持性核查。 |
| F | 括注中的法院错误。 | 1:In re PPI Enterprises | 不作检查:输入中不含法院。 | 把法院和年份与记录比较。 |
类别 A 和 B 正是引注地板的用武之地。它们是身份错误,一次查询就能定案:要么有一份判决意见从该引注开始,要么没有;如果有,它的名称要么与所称相符,要么不符。三次实测的拒绝都属于这两类。没有运行的七条虚构引注中,也有六条属于这两类,其中五条在被视为完整收录的判例汇编中——这就是它们会最先加入测试集的原因(§8)。
类别 C 是诚实要付出覆盖代价的地方。一个对每个 Westlaw 编号查无结果都予以拒绝的地板,本可以“抓住” Martinez 和 Durden。但同一条规则也会把免费语料库中缺失的每一个真实的未公开发表判决都指控为虚构。契约拒绝这种交换,代价是五条中有两条被暂缓。付费使用引证检索服务可以消除这一代价,更好的免费规则却不能。
类别 D 说明了为什么核查的单位是成对的名称与引注。Zicherman v. Korean Air Lines Co. 是一个真实的最高法院案件 [1, ¶ 29(e)]。只核查名称的检查会接纳附在它身上的那个虚构的《联邦判例汇编》引注。地板的成对核查问的是:不论名称如何,是否有一份判决意见从被引用的那一页开始。
类别 E 超出了任何存在性核查的能力,包括我们的。十八项援引中有六项是真实的、引注正确的判决,却被用来支持它们并未表达的内容。地板会让这六项全部落地——按其契约是正确的,对这份文书却毫无用处。Magesh 等人称这样的引用为误落地(misgrounded):当回答中的论点“虽有引用,但曲解了来源或引用了不适用的来源”时,该回答即为误落地 [16]。按他们的定义,我们的 GROUNDED 比“落地”(grounded)更弱:它断言的是身份,而不是支持。面向“支持”的地板必须去阅读判决意见。那是另一种核查,有不同的失效特征,本文没有测量它。
7 · 审计:契约可能在哪里失效
这次运行表明地板在八个输入上行为正确,但并不表明契约在运行未包含的输入上也成立。我们阅读代码,寻找这样的输入。下面每一项发现都是提交 533f783 处代码的一个性质,并附有确立它的文件和行号。它们都没有被执行:本文的范围只允许一次实时运行,别的都不允许。每一项都附有会暴露它的输入,而每个这样的输入都列入了 §8 的测试集。
7.1 · 因共享当事人词语而造成的错误接纳
成对核查有意宽松地比较所称名称与记录名称。它的任务是抓住严重的不匹配——真实的引注配上另一个案件——而不是在格式问题上失败(floor.py,第 129–138 行)。实际上,只要两个名称共享一个有区分度的当事人词语,它就认为二者相符(第 29–30 行和第 162–164 行)。两个本次运行未包含的输入说明了这会接纳什么:
- Smith v. Board of Education, 347 U.S. 483。该引注处的记录是 Brown v. Board of Education。两个名称共享“board”和“education”,因此判定会是 GROUNDED。凭证会写明 Brown,读到它的人会发现不匹配,但判定会予以接纳。
- United States v. Smith, 905 F. Supp. 2d 121。记录是 United States of America v. Iss Marine Services, Inc.。两个名称共享“united”和“states”:GROUNDED。
对于任何共享词语是政府当事人(United States、State、People、Commonwealth)、通用词(Estate、Board、County),或者在航空案件中是航空公司名称的案名,情况都是如此。Mata 案的六个虚构判决全部带有一家航空公司的名字。本文这次运行所依赖的性质——没有任何虚构引注达到 GROUNDED——之所以成立,是因为五条 Mata 引注中没有一条落在与其所称案名共享当事人词语的真实案件上。这是那些输入的性质,而不是契约的性质。修复:比较对方的非政府当事人;忽略主权方和通用词语;在文书给出法院和年份时要求二者一致;比较结果不够有力时就暂缓。
7.2 · 以不同形式书写的真实判例被错误拒绝
地板自己声明的规则是:“尚未解析、但可能真实”的判例为 UNVERIFIABLE,“绝不是 NOT_FOUND”(README.md,第 25–27 行)。有两条路径违反了它。
- 名称。按名称的单一引用查询,除非排名前八的记录之一在统一大小写和标点后与之完全相同,否则返回 NOT_FOUND(floor.py,第 109–116 行)。标准引注惯例会缩写案件名称,而像 Brown v. Bd. of Educ. 这样的简称规范化之后,是一个没有任何记录载有的字符串。按照代码,Brown 会被报告为虚构。已提交的测试只使用完整、准确的名称(tests/test_floor_live.py,第 60–71 行)。
- 引注。引注在统一大小写和空白之后进行比较,别的什么也不做(floor.py,第 38–39、106–108 和 154–161 行)。一条带有精确页码的真实引注(“384 U.S. 436, 444”)、带有括注的引注(“384 U.S. 436 (1966)”),或判例汇编缩写中间不留空格的引注(“905 F.Supp.2d 121”),都不会与任何记录的引注完全匹配。在被视为完整收录的判例汇编中,判定就是 NOT_FOUND——一次错误指控。我们的输入是人工规范过的(§4);真实文书中的引注不会是这样。在记录中,Miller 写作“174 F.3d 366, 371–72”。
修复:在查询之前,用 eyecite [10] 这样的引注解析器把每条引注解析为卷号、判例汇编和起始页;任何无法解析或有多种解析方式的输入一律暂缓;仅凭名称查无结果时判为 UNVERIFIABLE,绝不判为 NOT_FOUND。
7.3 · 有效性否决不在被测路径上
成对核查从不查询后续处理情况(floor.py,第 141–166 行)。否决只接入了单一引用解析(第 118–121 行)。它在免费层面的信号取自被处理案件自己的记录(第 72–82 行)。负面处理记载在后来的判决意见中,而不在被处理案件的案名里,因此这个信号几乎会漏掉全部负面处理。检查代码还可以看出,它可能被一个以另一种意思含有处理词语的案名误触发——例如一个名为“Vacation …”的当事人就会触发它。本次运行和任何测试都没有产生过 NOT_GOOD_LAW。因此我们把这个否决描述为已接入但未经测量,其免费覆盖几乎为零;说“部分覆盖”都会言过其实。
7.4 · 检索、收录范围与静默失效
- 只看排名靠前的结果。成对核查只检查其查询的前五个结果,单一查询只检查前八个(floor.py,第 96 和 141 行)。成对核查把名称与第一条载有该引注的记录比较(第 162 行)。当两条记录共用一页时——例如 92 F.3d 1074 上的两份命令(第 29 段 (c))——一个正确地指向第二条记录的主张会被判为 MISCITED,而一个与第一条共享某个词语的虚构引注会被接纳。
- 收录范围是假设的。被视为完整收录的范围,所依据的是代码中一句注释:数据库“全面”(comprehensively)收录了这些判例汇编(第 31–35 行)。我们没有测量它。只要被视为完整收录的判例汇编中缺了一份判决意见,引用它的真实引注就会变成 NOT_FOUND。
- 格式正确但内容错误的回答。一个因错误而返回空结果集的响应,或一个引注字段被改名的响应,都会被读作“没有记录”(courtlistener.py,第 27 行),并在所有被视为完整收录的判例汇编中产生 NOT_FOUND(§3.3)。金丝雀引注是防线,必须出现在每一个批次中。
7.5 · 更正我们自己的描述
审计还发现,本工作线在一些地方对自己的描述比其代码或输出所能支持的更宽松。演示脚本的文档字符串称它“一个不漏地”抓住 Mata 案的虚构引注(dogfood_mata.py,第 5 行),而它自己的得分行报告的是抓住三条、暂缓两条。脚本的输入列表被描述为“根据法院的制裁命令”(per the court's sanctions order)列出的虚构引注(第 24 行),但它只包含六个判决中的五个,第 29 段中的援引一项都没有。README 报告“6 gates green”(第 22 行);这个数字早于第二次增量,现在测试文件中有 11 个测试。《可准入的运动》一文把其中的运动地板描述为与生物和法律准入地板“共享同一个引擎”(“one engine with the bio and legal admission floors”) [22]。法律地板共享的是契约,而不是引擎(§3)。本文中关于这次运行的数字都取自运行本身,而不是取自上述任何描述。
8 · 下一个实验
这次运行回答的是:契约在给定的输入上是否表现正确。悬而未决的是另一个问题:在一项真实的法律任务上,在我们能构建的最强确定性核查器旁边,加入任何学习式组件是否值得?我们在运行之前就在这里给出实验设计,沿用我们《推理归位》和《不可恢复性边界》研究计划的做法 [24, 25]:先构建最强的确定性方法,给学习式通道一切优势,并在看到任何结果之前固定门槛。在这些计划中,学习式通道迄今没有赢得过一个席位(在《不可恢复性边界》中,160 个世界×维度单元中为零)。我们预计这里也会如此,并且无论结果如何都会报告。
任务。对一份文书中的每一项援引——以案件名称、引注和它被引来支持的论点给出——判定接纳、拒绝或暂缓,并附凭证。
测试集,在首次运行前固定。测试集以失效为导向:§7 的每一项审计发现都贡献专门用来触发它的输入。
- Mata 案记录中的全部 18 项援引(表 1),依据法院的认定标注。未运行的七条虚构或与所引不符的引注最先加入。法院 4 月 11 日命令所要求的另外两个判决(第 13 段),只有在依据记录确定其性质之后才加入。
- 从已发表判决意见的援引列表中抽取的真实援引,依据 CourtListener 以外的来源标注,使地板所用的数据库永远不会成为它自己的基准真值。判例法开放获取项目(Caselaw Access Project) [4] 是一个候选来源。
- 针对每一项审计发现的扰动:与引注处真实案件共享当事人词语的虚构案名(§7.1);真实引注上的缩写案名、精确页码、括注和不留空格的判例汇编缩写(§7.2);两条记录共用的页码(§7.4);真实的和虚构的 Westlaw 编号与中立引注;以及落在另一份判决意见之内的页码。
- 每一批次都包含金丝雀引注。只要有任何金丝雀未能落地,该批次即作废(§3.3)。
确定性对手,先构建。对手用 eyecite [10] 解析引注,并对每一条做精确查询。随后它进行四项检查:页码范围包含——像法院那样指出某一页落在哪份判决意见之内;区分当事人的名称比较;法院与年份的一致性;以及收录规则,并在任何错误时弃权。在有令牌可用时,CourtListener 的引注查询 API [8] 作为第二个独立查询同时运行。
学习式通道,受限。一个本地模型看到同样的证据,对类别 E 还看到判决意见的文本。它可以把一项援引从接纳改为暂缓,例如标出判决意见似乎并不支持该论点。它可以提出一种消歧方案,但必须由确定性核查器重新核查。它永远不能接纳,也永远不能把一项援引移出拒绝。这就是我们 VDSG 运行时和《失败优先模型》中“只能收窄”的约束,用在了引注上 [27, 23]。
门槛,现在固定。损失计入真实援引上的三类错误:错误拒绝;对确实支持其论点的援引的暂缓;以及对并不支持其论点的援引的接纳(类别 E)。受限的学习者可以通过提出由确定性核查器确认的消歧方案来减少第二类错误,通过标出误用来减少第三类错误;它的标记也可能增加第二类错误。只有同时满足我们沿用自《推理归位》的门槛的三个条件,它才能赢得席位 [24]:把该损失降低至少 15%;这一降低的配对 90% 自助法(bootstrap)置信区间不包含零;且对虚构或错引引注的接纳不增加。只要出现一次这样的接纳,学习式通道即被取消资格。
报告。本节事先固定了任务、对手、约束和门槛 [18]。测试集将在首次运行前冻结。每一个实验臂都会报告,包括零结果和负面结果。
10 · 局限
状态。研究原型。不构成法律意见,不是引证检索服务。GROUNDED 判定的意思是:某条引注存在于一个免费数据库中,并且就是所称的案件。它不表示该案件仍然有效、支持任何论点,或可以被依赖。所有数字均出自我们自己,尚无第三方复现。
样本量。五条虚构引注和三条真实引注,一次运行。我们不报告任何比率。五次中零次错误接纳,与高达 52% 的错误接纳率相容(双侧 95% Clopper–Pearson 区间的上端 [6]);三次中零次错误拒绝,与高达 71% 的错误拒绝率相容。这两个界都说明不了什么有用的东西,而审计给出了地板会失效的输入。
对照过于容易。三条真实引注属于美国法律中被引用最多的判决,而且位于数据库收录最好的判例汇编中。它们表明这条路径走得通,但不能用来估计真实判例被错误拒绝的频率。审计给出了这种情况可能发生的两种方式(§7.2)。
人工规范化的输入。本次运行的引注是由人工整理为最简形式的。面对文书中实际书写的引注,现有的地板会拒绝一部分真实判例(§7.2)。
只覆盖了记录的一部分。法院意见中的十八项援引运行了五项。Shaboon、伪造的 Varghese 内部六项虚构或与所引不符的援引,以及六项被误用的真实判决,都没有运行。对这些援引,表 4 给出的是契约的规定,而不是结果。
未经测量的假设。只有在收录假设、检索假设和规范输入三者都成立时,拒绝才是可靠的(命题 1)。这三者本文都没有测量。
审计发现未经执行。§7 的失效路径是通过阅读代码确立的代码性质。每一项都可以用几个输入加以确认,但目前一项也没有确认。
测试未重新运行。本文没有运行本工作线已提交的 11 个测试。它们最后一次记录的会话没有留下失败项,而一个没有网络、全部跳过的会话也会是这样(§4)。
证据有时效性。CourtListener 会变化。记录可能被添加、更正、合并或删除,2026 年 9 月 27 日的判定以后可能无法复现。凭证是链接,不是存档副本,也没有签名。我们存档的是运行输出和哈希值(附录 B),而不是链接背后的记录。
范围。仅限美国判例法;被视为完整收录的范围仅限联邦和最高法院判例汇编。不涉及成文法、法规、二手资料或外国法。没有评估任何商业工具。
11 · 结论
生成的引注看起来和真的一样,而去问生成它的工具它是不是真的,于事无补:在 Mata 案中,那个工具说是真的。有用的是记录。引注地板把这一观察变成了一份契约:只有当公共数据库在该引注处、以所称名称存有一份判决意见时,提议才被接纳;当数据库显示该引注属于另一个案件,或收录范围表明那里什么都没有时,提议被拒绝;只要数据库无法判断——包括数据库出故障的时候——提议就被暂缓。
在给定的 Mata 案引注上,地板对五条虚构引注一条也没有接纳,拒绝三条,暂缓两条,并让三条真实引注落地。它唯一的 MISCITED 凭证指向的,正是法院认定的那个真实案件。在整份记录上,它覆盖了十八项援引中的五项。其中六项是任何存在性核查都无法触及的,因为它们是被误用的真实案件。阅读它的代码,我们找到了会让它接纳虚构引注或拒绝真实判例的输入;其中第一种失效,会打破这次运行看似证明的那个性质。
这份契约在形态上是可靠的,在细节上尚未得到证明。它的拒绝恰好与其背后的收录假设一样可靠;它的接纳只与名称比较一样可靠。下一步是在记录包含的全部内容和审计发现的全部内容上运行它,放在我们能构建的最强确定性核查器旁边,并事先固定任何学习式组件的门槛。
参考文献
- Mata v. Avianca, Inc., No. 22-cv-1461 (PKC), Opinion and Order on Sanctions, ECF No. 54 (S.D.N.Y. June 22, 2023), 43 pp. Obtained from the RECAP archive, https://storage.courtlistener.com/recap/gov.uscourts.nysd.575368/gov.uscourts.nysd.575368.54.0.pdf (SHA-256
c6fd7073…d932a7dff; full hash in Appendix B). Paragraph numbers (¶) refer to its findings of fact. - A. Agrawal, M. Suzgun, L. Mackey, A. T. Kalai. Do language models know when they're hallucinating references? In Findings of the Association for Computational Linguistics: EACL 2024, pp. 912–928, 2024. doi:10.18653/v1/2024.findings-eacl.62.
- M. Alshiekh, R. Bloem, R. Ehlers, B. Könighofer, S. Niekum, U. Topcu. Safe reinforcement learning via shielding. In Proc. AAAI Conference on Artificial Intelligence 32(1), 2018. doi:10.1609/aaai.v32i1.11797.
- Harvard Law School Library Innovation Lab. Caselaw Access Project. https://case.law; project page https://lil.law.harvard.edu/projects/caselaw-access-project/, accessed 27 September 2026.
- C. Chow. On optimum recognition error and reject tradeoff. IEEE Transactions on Information Theory 16(1):41–46, 1970. doi:10.1109/TIT.1970.1054406.
- C. J. Clopper, E. S. Pearson. The use of confidence or fiducial limits illustrated in the case of the binomial. Biometrika 26(4):404–413, 1934. doi:10.1093/biomet/26.4.404.
- Free Law Project. CourtListener: advanced search and query techniques (the
citationfield; quoted phrase queries). https://wiki.free.law/c/courtlistener/help/search/advanced-search-and-query-techniques, accessed 27 September 2026. - Free Law Project. CourtListener Citation Lookup and Verification API, REST v4. https://wiki.free.law/c/courtlistener/help/api/rest/v4/citation-lookup, accessed 27 September 2026.
- Free Law Project. CourtListener Search API, REST v4. https://wiki.free.law/c/courtlistener/help/api/rest/v4/search, accessed 27 September 2026.
- J. Cushman, M. Dahl, M. Lissner. eyecite: a tool for parsing legal citations. Journal of Open Source Software 6(66):3617, 2021. doi:10.21105/joss.03617.
- M. Dahl, V. Magesh, M. Suzgun, D. E. Ho. Large legal fictions: profiling legal hallucinations in large language models. Journal of Legal Analysis 16(1):64–93, 2024. doi:10.1093/jla/laae003. arXiv:2401.01301 (appendix cited from v2).
- T. Gao, H. Yen, J. Yu, D. Chen. Enabling large language models to generate text with citations. In Proc. EMNLP 2023, pp. 6465–6488. doi:10.18653/v1/2023.emnlp-main.398.
- N. Guha, J. Nyarko, D. E. Ho, C. Ré, et al. LegalBench: a collaboratively built benchmark for measuring legal reasoning in large language models. arXiv:2308.11462, 2023.
- A. T. Kalai, S. S. Vempala. Calibrated language models must hallucinate. In Proc. 56th ACM Symposium on Theory of Computing (STOC), pp. 160–171, 2024. arXiv:2311.14648.
- P. Lewis, E. Perez, A. Piktus, et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. In Advances in Neural Information Processing Systems (NeurIPS), 2020. arXiv:2005.11401.
- V. Magesh, F. Surani, M. Dahl, M. Suzgun, C. D. Manning, D. E. Ho. Hallucination-free? Assessing the reliability of leading AI legal research tools. Journal of Empirical Legal Studies 22(2):216–242, 2025. doi:10.1111/jels.12413. Figures and quotations are from the preprint, arXiv:2405.20362v1.
- S. Min, K. Krishna, X. Lyu, M. Lewis, W. Yih, P. W. Koh, M. Iyyer, L. Zettlemoyer, H. Hajishirzi. FActScore: fine-grained atomic evaluation of factual precision in long form text generation. In Proc. EMNLP 2023, pp. 12076–12100. doi:10.18653/v1/2023.emnlp-main.741.
- B. A. Nosek, C. R. Ebersole, A. C. DeHaven, D. T. Mellor. The preregistration revolution. Proceedings of the National Academy of Sciences 115(11):2600–2606, 2018. doi:10.1073/pnas.1708274114.
- H. Rashkin, V. Nikolaev, M. Lamm, L. Aroyo, M. Collins, D. Das, S. Petrov, G. S. Tomar, I. Turc, D. Reitter. Measuring attribution in natural language generation models. Computational Linguistics 49(4):777–840, 2023. doi:10.1162/coli_a_00486.
- L. Sha. Using simplicity to control complexity. IEEE Software 18(4):20–28, 2001. doi:10.1109/MS.2001.936213.
- W. H. Walters, E. I. Wilder. Fabrication and errors in the bibliographic citations generated by ChatGPT. Scientific Reports 13:14045, 2023. doi:10.1038/s41598-023-41032-5.
我们此前的论文(Perslis Research,2026 年 9 月)
- Admissible Motion: runtime safety as an admission-control problem, not a model-capability problem. research.perslis.com/motion.
- Fail-First Models: failure becomes structure, structure changes the next attempt. research.perslis.com/fail-first.
- Inference Placement: where learned inference earns authority in a provenance-constrained symbolic system. research.perslis.com/inference-placement.
- The Irrecoverability Boundary: where learned inference cannot recover what deterministic computation cannot reach. research.perslis.com/irrecoverability.
- Peel: structural hallucination prevention for offline AAC through symbolic fact authorship. research.perslis.com/peel.
- VDSG: a commanded admission-control runtime for autonomous agents. research.perslis.com/vdsg.
- The Verification Floor: scientific integrity that does not degrade with model scale. research.perslis.com/verification-floor.
- We Tried to Train It In: negative results on teaching small models to ground facts. research.perslis.com/training-grounding.
附录 A · 运行原文
下面是演示脚本在唯一一次实时运行中的完整输出,只去掉了 ANSI 颜色代码,其他一概未改。未经编辑的文件保存在 evidence/ 中,其哈希值见附录 B。脚本中的标题(“Fabricated by ChatGPT (should be CAUGHT)”)是它自己的措辞。它列为“应被抓住”的五个输入中,有两个是被暂缓,而不是被抓住。
⚖ THE LEGAL TEST — Mata v. Avianca fabricated citations vs the floor
Fabricated by ChatGPT (should be CAUGHT):
NOT_FOUND Varghese v. China Southern Airlines Co., Ltd., 925 F.3d 1339
no case carries this mainstream-reporter citation — fabricated, REJECTED
MISCITED Petersen v. Iran Air, 905 F. Supp. 2d 121
citation is real but names "United States of America v. Iss Marine Services, Inc.", NOT "Petersen v. Iran Air" — REJECTED
↳ United States of America v. Iss Marine Services, Inc. — 905 F. Supp. 2d 121, 84 Fed. R. Serv. 3d 384, 2012 WL 5873682, 2012 U.S. Dist. LEXIS 166088 — https://www.courtlistener.com/opinion/2661490/united-states-of-america-v-iss-marine-services-inc/
NOT_FOUND Miller v. United Airlines, Inc., 174 F.3d 366
no case carries this mainstream-reporter citation — fabricated, REJECTED
UNVERIFIABLE Martinez v. Delta Airlines, Inc., 2019 WL 4639462
citation not in the free corpus (e.g. Westlaw/unpublished) — cannot verify
UNVERIFIABLE Estate of Durden v. KLM Royal Dutch Airlines, 2017 WL 2418825
citation not in the free corpus (e.g. Westlaw/unpublished) — cannot verify
Real law (should be GROUNDED):
GROUNDED Miranda v. Arizona, 384 U.S. 436
↳ Miranda v. Arizona — 16 L. Ed. 2d 694, 86 S. Ct. 1602, 384 U.S. 436, 1966 U.S. LEXIS 2817, 10 Ohio Misc. 9, 36 Ohio Op. 2d 237, 10 A.L.R. 3d 974 — https://www.courtlistener.com/opinion/107252/miranda-v-arizona/
GROUNDED Brown v. Board of Education, 347 U.S. 483
↳ Brown v. Board of Education — 347 U.S. 483, 74 S. Ct. 686, 1954 U.S. LEXIS 2094, 38 A.L.R. 2d 1180, 53 Ohio Op. 326, 98 L. Ed. 873 — https://www.courtlistener.com/opinion/105221/brown-v-board-of-education/
GROUNDED Gideon v. Wainwright, 372 U.S. 335
↳ Gideon v. Wainwright — 372 U.S. 335 — https://www.courtlistener.com/opinion/8954562/gideon-v-wainwright/
SCORE
fabrications caught (NOT_FOUND/MISCITED): 3/5 (+2 UNVERIFIABLE = free-data gap, honestly abstained)
fabrications that SLIPPED THROUGH: 0
real law grounded with receipts: 3/3
real law FALSELY rejected: 0
FLOOR HELD — no fabrication reached a verified state, no real law falsely rejected.
附录 B · 复现、证据与代码对照
证据文件(均位于本文文件夹的 evidence/ 之下)。
- 运行的原始输出 mata-run-20260927T090825Z.txt,SHA-256 为 8be56a5f725ad28a66791a6c91af1f05be8978db4d518c11c2d02c30eb1f86d0。其 .meta.txt 记录了命令、开始和结束时间(09:08:25Z 和 09:08:33Z)、退出码 0、Python 3.9.6、该工作线仓库的 HEAD、最后一次改动该工作线的提交(533f783)、与该提交之间为空的差异,以及未设置 API 令牌。
- sha256-lane-files.txt:本文所读的八个工作线文件的哈希值(README、演示脚本、五个包文件、测试文件)。
- 法院意见的文本 mata-opinion-ecf54.txt,用 pdftotext -layout 从源 PDF(43 页,2,341,033 字节)提取,源 PDF 的 SHA-256 为 c6fd707305765357003654c5ed87426e3605e1ee6bdd3d7cb9ff1a7d932a7dff。其 .meta.txt 给出了 URL。
- pytest-cache-snapshot/:该工作线截至 9 月 23 日的测试缓存(11 个测试标识符;一个空的失败列表),连同哈希值一起复制,因为下一次测试会话会把它覆盖。
重建每一个数字、表格和图(只读;无需网络)。
python3 -B analysis/parse_run.py # recount the run python3 -B analysis/record_table.py # pin the record to opinion lines python3 -B analysis/make_tables.py # Tables 1 and 3, TeX and HTML python3 -B analysis/make_transcript.py # Appendix A python3 -B analysis/bounds.py # Section 10 bounds python3 -B web-build/export_figs.py # Figures 1 and 2
每个脚本在输入与其预期不符时都会中止。实时运行本身只做过一次,命令记录在 .meta.txt 中。重复运行会再次查询 CourtListener,而它的回答可能已经变了。
代码对照。行号指该工作线的提交 533f783。
- 精确引注查询:legal_floor/connectors/courtlistener.py,第 51–58 行。
- 限流与重试:legal_floor/http.py,第 16–18 行(可重试的状态码;四次尝试),第 28–35 行(每个主机一秒间隔),第 38–56 行(退避、Retry-After、30 秒上限、快速失败),第 59–70 行(非 JSON 视为数据源错误)。
- 数据源错误变为 UNVERIFIABLE(命题 2):legal_floor/floor.py,第 100–104 行和第 149–152 行。
- 收录规则:floor.py,第 31–35 行和第 156–161 行。
- 名称比较:floor.py,第 29–30 行和第 129–138 行;只看第一条记录:第 162 行。
- 处理否决:floor.py,第 28、72–82 和 118–121 行;verify_citation(第 141–166 行)中没有它。
- 未使用的令牌路径:courtlistener.py,第 61–86 行(已定义,floor.py 从不调用)。
如何引用
Perslis Research. A Citation Floor for Case Law: The Mata v. Avianca Citations, Re-checked. Research prototype, September 2026. https://research.perslis.com/legal-floor
@techreport{perslis2026legalfloor,
title = {A Citation Floor for Case Law: The Mata v. Avianca Citations, Re-checked},
author = {{Perslis Research}},
institution = {Perslis Research},
year = {2026},
month = {9},
note = {Research prototype; not legal advice; not a citator.},
url = {https://research.perslis.com/legal-floor}
}