以 LOCUS 解放法律:美国地方法令语料库

Freeing the Law with LOCUS: A Local Ordinance Corpus for the United States

arXiv: 2606.19334v1

论文信息

标题: Freeing the Law with LOCUS: A Local Ordinance Corpus for the United States

作者: Denis Peskoff, Joe Barrow, Christopher Vu, et al.

发布日期: 2026-06-17

arXiv ID: 2606.19334v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:美国地方法律(市、县级法令)虽然对日常生活影响巨大,但长期缺乏可用于大规模机器学习分析的结构化语料库,无法被现有法律 AI 系统检索和推理。
  • 核心方法:通过浏览器自动化和 OCR 技术,从分散的商业供应商平台抓取并处理了 9239 个市县的完整法令文本,构建了名为 LOCUS 的语料库,并提供了以县为单位的 “和谐化” 访问层,覆盖美国大部分人口。
  • 关键结果:LOCUS-v1 覆盖了美国 3144 个县中的 2309 个,通过文本长度作为代理指标,为每个县选择最有代表性的地方律法文本,覆盖了美国 94% 的人口(见论文第 4.5 节)。
  • 主要局限:LOCUS 的 “和谐化” 访问层是一个有意的简化,它仅选择一个最具代表性的文本,不处理州、县、市法律之间的管辖权重叠、冲突或层级关系,不能直接用于判断具体案件中哪条法律适用(见论文第 1 节和第 6 节)。
  • 适合读者:对法律人工智能、计算社会科学、公共政策分析和自然语言处理(NLP)感兴趣的研究者与从业者,特别是那些希望在地方性法规基础上构建检索、问答或对比分析系统的读者。

论文背景和研究动机

法律人工智能(Legal AI)的快速发展使得系统能够处理判例法、成文法、合同和行政材料。然而,对普通居民、企业和地方政府影响最直接、最频繁的法律层面——地方法令(Local Ordinances)——却一直是大规模语料库中的 “盲区”。这些法令管辖着区划(zoning)、住房、营业执照、公共卫生、噪音和动物管控等日常事务。

这种缺失并非因为地方法律不重要或非公开。恰恰相反,正如论文所引用的乔治城大学法律图书馆评论所述,根本 “没有一个单一来源可以找到所有市政法典的综合集合”。这些代码被分割在不同的商业供应商平台上,设计初衷是供人在浏览器中逐条查阅,而非批量研究访问。不同平台有不同的导航结构、打印流程和动态生成的 PDF,甚至没有一个中央注册表能完整列出哪个平台托管了哪些司法管辖区的法律。乔治亚州诉 Public.Resource.Org 案的判决明确了法律属于公共领域,但技术上的获取壁垒仍然存在。

因此,构建 LOCUS 的动机是双重的:第一,解放这些 “被禁锢” 的法律文本,将其转变为可被机器读取和计算分析的公共资源;第二,为下一阶段的法律 AI 研究奠定基础。一个在地方层面有用的法律 AI 系统,不仅要能检索到条款,更要理解州、县、市三级法律的复杂互动,包括自制条例(home-rule)、优先权(preemption)和权力委托等问题。LOCUS 通过提供一个覆盖全国的、统一地理基础的访问层,使得这类结构化的检索和推理任务成为可能。

核心方法和技术细节

构建 LOCUS 是一个涉及系统工程、光学字符识别(OCR)和机器学习标注的层层递进过程,其流水线如论文图 4 所示。

第一步:数据收集与 OCR 处理 研究团队从各大主流法律托管平台,通过浏览器自动化和特定于供应商的下载逻辑,收集了 9239 个市县的有效原始 PDF 文件,总计约 700 万页,数据量约 80GB(见论文第 4.1 节)。这个过程充满了工程挑战,包括服务器端 PDF 组装限制、非唯一城市名导致的文件名冲突、反爬虫措施等,需要针对性的恢复技术而非单一的抓取脚本。

所有 PDF 页面随后通过一个名为 LightOnOCR-2-1B 的轻量级视觉语言模型(VLM)被转换为 Markdown 格式。该模型基于 Qwen-3 微调,参数量仅为 10 亿,在 OCR 基准测试中表现出色,并且能够鲁棒地处理单栏、双栏、扫描件等多样化版式,生成正确阅读顺序的文本。

第二步:语料后处理与律法切分 统一的 Markdown 输出被清洗,以去除页眉、页脚、页码等重复性伪影,并将跨页的段落和表格合并。关键的一步是将连续的文本切分成 “个体律法(individual laws)”,即识别出章节和小节标题作为边界。

第三步:大规模标注与分类器训练 为了组织海量的法令文本,团队设计了三个层级的分类体系:实质/非实质(substantivity)、功能(function,包括规则、执法、结构、上下文、过程)和主题(topic,包括建筑、商业、区划、滋扰等)。由于人工标注成本过高,他们采用了一种 “LLM(大语言模型)作为裁判” 的两阶段策略。首先,从处理后的语料中采样 10 万个段落,使用 GPT-5.4-nano 进行零样本标注(见论文第 4.4 节)。然后,将标注结果作为训练数据,分别微调了基于 ModernBERT-base(参数量约 1 亿)的三个分类器。这些高效的编码器模型使得对整个语料库进行推理变得可行。

第四步:构建 “和谐化” 访问层 为了提供一个简洁、可复现的分析入口,LOCUS-v1 为美国的每个县确定一份最具代表性的地方法律文本。算法是:如果一个县同时存在该县的法规和其最大城市的法规,则选择文本长度较长的那个;如果只有其一,则选择存在的那个。论文明确指出,这个基于长度的选择是一个透明化的简化,并不代表在法理上决定了哪一层法律拥有控制权。但它创造了一个互斥且穷尽的全国地理网格,使得法律文本能够与人口、地理和人口普查数据无缝连接。

创新点和贡献

LOCUS 项目的核心创新和贡献体现在多个层面,超越了单纯的数据集发布。

  1. 填补了关键的数据空白:这是首个大规模的、全国范围内的美国地方法令机器可读语料库。它将长期分散、仅供浏览的公共法律文本,转变为可用于大规模计算分析的国家级基础设施,直接响应了 “解放法律”(Freeing the Law)的号召。
  2. 系统化的工程与标注方法:论文不仅提供了数据,更详细阐述了工程化挑战的解决思路。其结合现代 VLM(LightOnOCR)进行文档数字化、利用高效编码器(ModernBERT)进行标注推理的流水线,为处理大规模、非结构化、格式多样化的公共领域文本提供了一个低成本($0.30/千页)且可扩展的实施蓝图(见论文第 4.3 节)。
  3. 引入了规范性的维度分析框架:LOCUS 不仅对法律进行了主题和功能分类,还创造性地引入了四个连续性维度对每条法令进行评分:执法裁量权(Enforcement Discretion)、不透明度(Opacity)、家长主义(Paternalism)和问题显著性(Salience)。为了获得这些维度的评分,研究团队创新地使用了 “LLM 成对比较 + TrueSkill 贝叶斯评级系统 + 回归模型微调” 的方法论(见论文第 5.1 节)。生成的评分模型能高效地为整个语料库打上维度分数,使得在千万级文本中发现宏观模式(如 “佛罗里达州的法律不透明度很高,但家长主义色彩不强”,见论文图 5)和微观联系(如 “涉及‘宵禁’的条款家长主义评分高”)成为可能。
  4. 揭示了地方法律的内在结构:通过对大规模语料的分析,论文发现地方法律并非杂乱无章的规则集合,而是普遍遵循一种稳定的编纂结构(如:前列常规条款和政府架构,后接商业法规、滋扰法规等),并且市、县两级法律在功能上存在显著差异——县级代码包含更多区划内容,而市级代码包含更多滋扰和公共秩序法则。这些发现对设计更精准的法律 AI 检索和分块策略具有重要指导意义。

实验结果分析

LOCUS 的贡献主要在于资源构建和基于此的维度分析。

  • 语料库规模与质量:LOCUS-v1 经过处理后,公开发布的版本包含了 2,211,516 个文本块,其中大多数被分类为实质性法律(规则或执法)。分类器的性能通过标准的训练/验证/测试集分割进行了评估,尽管论文未直接报告精确率/召回率,但展示了其能够有效过滤结构性内容。
  • 维度评分模型性能:这是实验部分可量化的核心结果。为验证维度评分的可靠性,研究者在 1000 条法令的测试集上计算了微调后的 ModernBERT 回归模型预测分数与 TrueSkill 基准分数之间的皮尔逊相关系数。四个维度的相关系数介于 0.82 到 0.94 之间(见论文图 6),表明 BERT 模型能够很好地捕捉到 LLM 成对比较所隐含的维度排序,验证了该方法的有效性。
  • 宏观法律地理分析:维度模型的应用揭示了一些有趣的模式。例如,对不透明度和家长主义的全国分析(见论文图 5)显示,这两个维度在法令级别上仅呈弱相关(Pearson r=0.11),表明它们是独立的分析轴。更重要的是,县级法律的平均不透明度高于市级,佛罗里达州的不透明度是其他州的两倍以上。这些洞察在没有 LOCUS 语料库之前是无法被观察到的。

实践建议

对于希望利用 LOCUS 或借鉴其方法论的研究者和开发者,可以从以下几个方面着手实践:

  1. 构建地方性法律问答系统:可以直接基于 LOCUS 的文本和元数据,搭建面向民众或企业的法律信息检索和问答应用。在设计系统时,必须将论文揭示的法律结构特征工程化:例如,利用 “功能” 和 “主题” 分类器作为重排序或预筛选步骤;将法律条文在法典中的 “位置信息” 作为一个重要的检索特征,因为类似主题的法规在编码结构上具有一致性。
  2. 开发跨管辖区的合规检查工具:企业(如连锁零售商、开发商)常常需要对比不同城市的法规(如区划、噪音、标牌规定)。可以利用 LOCUS 的县市级 “和谐化” 访问层,结合维度评分模型,快速筛查出在某些政策取向上(如高家长主义或高执法裁量权)的 “异常值” 区域,然后再针对性地进行人工合规审查。
  3. 为法律 AI 系统增加 “管辖权推理” 能力:当前的法律语言模型普遍缺乏处理法律层级和冲突的能力。研究者可以基于 LOCUS 设计新的基准测试任务(如论文所述)。具体操作可以是:构造一条同时受州、县、市法规约束的查询,测试模型是否能正确识别三个层级的法律法规,并判断在特定法律教义(如州法优先)下,哪个层级的规则具有最终控制权。这将是推动法律 AI 从文本匹配走向真正法律推理的关键一步。
  4. 代码复用与方法迁移:论文所描述的 “OCR 流水线 + LLM 标注 + 高效编码器分类/回归” 的全流程具有很强的可扩展性。在将其他同样处于 “公共但不可计算” 状态的文档(如国际组织协议、历史档案等)转化为结构化语料库时,可以复用此方法论。例如,其用于维度评分的 “成对比较 + TrueSkill + 回归” 范式,对于任何需要构建连续性文本质量或属性评分器的场景,都是一种成本可控、效果良好的方案。