释放法律:LOCUS——一个美国地方法规语料库
论文信息
标题: Freeing the Law with LOCUS: A Local Ordinance Corpus for the United States
作者: Denis Peskoff, Joe Barrow, Christopher Vu, et al.
发布日期: 2026-06-17
arXiv ID: 2606.19334v1
PDF 链接: 下载 PDF
释放法律的力量:LOCUS 语料库如何让美国地方法规走向开放研究
研究背景与动机
法律人工智能(Legal AI)的进步越来越依赖于大规模权威法律文本的可用性。然而,在美国法律体系中,最直接影响日常生活的层级——地方性法规(local ordinances)——长期以来在机器可读的语料库中缺席。这些法规涉及分区规划、住房、商业许可、公共卫生、噪音控制、动物管理等诸多领域,与居民、企业和地方政府的切身利益紧密相关。
当前的地方性法规分布在商业供应商的平台上,这些平台专为人类浏览而非批量研究访问而设计。供应商拥有不同的导航结构、打印工作流程、动态生成的 PDF 和司法管辖区索引。正如乔治城大学法律图书馆所言:“不幸的是,没有单一来源可以找到所有市政法规的全面集合。” 这种碎片化状态使得构建国家级研究语料库变得异常困难。
LOCUS 项目的核心动机正是解决这一 “公共但不可获取” 的悖论。地方性法规在法律上是公共领域资源——2020 年美国最高法院在 Georgia v. Public.Resource.Org 案中确认了法律文本的公共属性——但实际上,研究人员无法以机器可读的形式系统地获取和分析这些文本。LOCUS 的诞生旨在将这一碎片化的公共法律权威转化为可检索、可比较、可计算的基础设施。
核心方法与技术架构
LOCUS 的构建涉及一套复杂的数据处理流水线,其技术架构如图所示,从原始 PDF 采集到最终的结构化语料库需要经过多个处理阶段。
数据采集与 OCR 处理
原始语料库包含 9,239 个有效的 PDF 文件,总计约 700 万页、80GB 数据。采集过程面临诸多技术挑战:服务器端 PDF 组装限制、同名城市导致的文件名冲突、隐藏的界面阈值、反爬虫措施以及多县合并城市等特殊情况。研究团队采用浏览器自动化和供应商特定的下载逻辑,针对主要托管平台(如 Municode、Code Publishing 等)开发了定制化的采集策略。
PDF 文档的格式极为多样,包括单栏和双栏布局、原生数字文档、导出文档和扫描件等。为统一处理这些差异,流水线采用 LightOnOCR-2-1B 模型进行光学字符识别。这是一个基于 Qwen-3 的 10 亿参数视觉语言模型,在 1600 万 PDF 页面上微调而成,在 OlmOCR-Bench 基准测试中表现优异。该模型将页面图像转换为 Markdown 格式,能够稳健地处理各种版式,生成正确的自然阅读顺序。
后处理流水线消耗统一的 Markdown 输出来拼接跨页法律文本、去除重复的页眉页脚和页码等伪影,并合并跨页的段落和表格。整个 OCR 流水线在 Modal 平台上运行,得益于 LightOnOCR-2-1B 相对较小的模型规模和 Modal 的批量推理支持,每千页的处理成本仅为 0.30 美元,实现了经济高效的大规模文档处理。
法律文本的结构化分割与标注
处理后的文本需要进一步分割为独立的法律条款(chunk),并识别出实质性的法律内容。研究团队采用两阶段标注策略:首先使用 GPT-5.4-nano 进行大规模零样本标注,然后对最具挑战性的 5.5% 样本使用更强大的 GPT-5.4 模型进行二次审核。
标注体系包含三个分类维度:
- 实质性(Substantivity):判断文本是否包含实质性法律内容,还是纯粹的结构性、程序性或背景性文本
- 功能(Function):将法律文本分为规则(Rules)、执法(Enforcement)、结构性(Structural)、背景(Context)和程序(Process)五类
- 主题(Topic):对实质性法律进一步分类为建筑(Buildings)、商业(Business)、分区(Zoning)、妨害(Nuisance)和其他(Other)
基于 10 万条人工标注的样本,研究团队训练了基于 ModernBERT-base(约 1 亿参数)的分类器,可对整个数据集进行高效推理。这些分类器使得 LOCUS 能够过滤掉结构性内容,仅保留实质性的法律条款。最终发布的数据集包含 2,211,516 个文本块,其中大多数被判定为实质性法律。
县域协调的访问层设计
LOCUS 采用了一个透明简化的协调策略:对于每个美国县,在县法规和该县最大城市的法规中选择篇幅更长的作为代表性法典。这一设计承认了地方性法律的层级复杂性——州法律、县法规、市政条例、地方自治条款、优先权原则和特定问题的授权都可能交互作用——但提供了可复现的地理基础以支持检索和比较。最终,LOCUS 为 2,309 个县(美国共 3,144 个县)提供了代表性法典,覆盖了美国 94% 的人口。
创新性贡献
LOCUS 的核心贡献体现在多个维度。首先,它实现了法律文本获取的根本性突破,首次将分散在数千个司法管辖区的法规整合为统一的机器可读语料库。这不仅是一项工程壮举,更重新定义了法律 AI 的研究边界。
其次,LOCUS 引入了多维度的法规评分体系,包括四个连续维度:执法裁量权(从高度自由裁量到非自由裁量)、不透明性(从晦涩难懂到清晰易懂)、家长主义(从保护行为主体自身到保护他人/公众)和问题显著性(从高度突显到不重要)。这些维度通过 TrueSkill 贝叶斯技能评级系统和 ModernBERT 回归模型的组合进行评分。评分过程使用 20 万对成对比较来生成每个维度的 10,000 个分数,最终训练出的 BERT 回归模型的皮尔逊相关系数在 0.82 到 0.94 之间,表明模型很好地捕捉了 TrueSkill 评分的动态变化。
这一维度评分体系的意义在于,它将法规从分类对象转变为可在连续轴上排序和比较的分析单元。例如,研究发现佛罗里达州的法律不透明性远远超过其他州,是排名第二的州的两倍以上;而不透明性和家长主义之间的皮尔逊相关系数仅为 0.11,表明它们是两个相对独立的维度。这种分析能力使得研究者可以发现前所未有的宏观模式。
重要发现与分析
LOCUS 揭示的法律结构模式具有重要的理论和实践意义。研究发现,城市法典和县法典并非可互换的法律对象:县法典包含更多的分区规划内容,而城市法典包含更多的妨害和公共秩序法规。这与地方权威的功能分工一致——县更多地管理土地、开发和非建制领土,而城市更多地管理密度、邻近性和日常公共秩序。
更有趣的是,地方法典共享一种共同的表现架构。当法规按在法典中的位置排序时,主题倾向于以稳定的顺序出现:前方是总则和政府结构,随后是商业监管、妨害和公共秩序规则、分区规划和建筑法规。这一发现表明,地方法律不仅仅是规则的袋子,而是通过重复出现的文献形式组织起来的。这种结构对法律 AI 系统至关重要——忽略法典内部位置的检索系统和分块策略可能会错失编码在法典结构本身中的信息。
区域性差异同样显著。在美国大部分地区,县和城市遵循上述功能模式,但在东北部,这种关系发生了变化:县显得不那么分区导向,而更偏向执法导向。这与不同的制度历史一致,即城镇和市镇保留了更多的一级土地使用权力,而县通常执行行政、卫生或执法功能。
实践应用与未来方向
LOCUS 为法律 AI 研究者和从业者开启了多条应用路径。在检索层面,它支持对术语各异的地方规则进行搜索和问答,其术语在不同司法管辖区差异显著。在表示层面,它支持对受监管活动、许可、费用、处罚、生效日期和交叉引用进行结构化提取。在推理层面,它为基准测试创造了基础,测试系统能否在多层法律中导航、识别相关司法管辖权威、并推理州-地方或县-市政之间的重叠。
对于量化交易和金融科技领域,LOCUS 提供了理解地方监管环境的系统窗口。商业许可、建筑规范和环境法规的差异直接影响企业合规成本和市场准入门槛。投资者和分析师可以利用 LOCUS 分析不同司法管辖区的监管密度和模式,评估特定行业的监管风险敞口。
在人工智能领域,LOCUS 为法律领域语言模型提供了独特的评估和微调资源。未来的基准测试可以基于 LOCUS 构建,测试模型处理多层法律权威、解决管辖冲突和执行对比法律分析的能力。LegalBench 中的 162 个任务目前未包含任何地方性法规,LOCUS 填补了这一空白。
项目团队明确规划了未来的发展方向。LOCUS-v1 被设计为访问层,而非地方性法律权威的最终理论——其协调策略是有意透明的简化。未来的版本将纳入完整的问题特定层级和冲突建模,这不仅是法律复杂性的要求,也是为法律推理基准测试保留未受污染评估设置的需要。此外,团队还收集了另外 7,000 份文件和城市的资料,计划采用类似 MIMIC 数据集的数据使用协议向研究者开放。
总结与展望
LOCUS 代表了法律 AI 领域的一项基础设施级贡献。它将地方性法规从实际上不可获取的状态转化为可供机器阅读、系统比较和计算法律分析的国家级对象。这一转变的意义超越了数据集的创建本身——它证明了 “释放法律” 不仅是访问问题,更是表征问题。地方性法规在 LOCUS 之前是公共的,但不能作为国家级的机器阅读对象存在。
LOCUS 揭示的法律结构——法典化的重复架构、管辖形式之间的功能分工、区域特定的制度变异——正是法律 AI 系统必须学会尊重的那种结构,如果它们要从文本检索走向对公共权威的可靠推理。这一努力不仅推进了法律 NLP 的技术前沿,也为实证法律研究、比较政策分析和计算社会科学开辟了新的研究范式。
随着大语言模型在更多领域得到应用,LOCUS 提供的结构化法律数据将成为训练和评估 AI 系统法律推理能力的关键资源。在未来,我们可能看到能够自动理解地方性法律层级、识别适用管辖权和解决规范冲突的 AI 系统出现,这将从根本上改变人们获取和理解法律的方式,真正实现 “释放法律” 的理想。