移动代理法律数据
判例法和法规是经过刻意安排的,由各司法管辖区分别发布,所采用的服务是专为律师而非网络爬虫设计的。重点在于覆盖范围和引文的完整性,而非访问便利性。
- 每个司法管辖区都有自己的服务平台——BAILII、Legifrance、EUR-Lex和CourtListener是四个截然不同的世界,而非四个镜像。
- 判决书中包含个人数据——一些司法管辖区会刻意进行假名化处理,而重新识别身份是一件非常严重的事情。
- 引文是一个棘手的问题——同一条判例在不同的系统中拥有不同的标识符。
- 这些是公共服务——耐心、温和地收集信息既正确又更可靠。
访问各司法管辖区的法律数据库。
记录每个系统所使用的标识符。
法律数据收集
法律资料是经过刻意规划的,按各司法管辖区分别发布,通过专为法律从业者而非网络爬虫构建的服务进行发布。访问通常不是问题,问题在于覆盖范围和引文的完整性。
这些服务在结构上几乎没有任何共同之处。英格兰和威尔士有BAILII和国家档案馆判决服务;法国有Legifrance;欧盟有EUR-Lex;美国联邦法院则依托PACER系统,而CourtListener和RECAP档案库则提供大量判决的免费访问。 每个系统都有自己的标识符、覆盖深度、对“文件”的定义以及搜索语义。并不存在“一次构建,覆盖五个国家”的方案。
| 管辖权 | 主要服务 | 访问字符 |
|---|---|---|
| 英格兰和威尔士 | BAILII, 国家档案馆的裁决 | 开放、免费、对利率敏感 |
| 法国 | Legifrance | 开放,并按设计采用假名化判决书 |
| 欧洲联盟 | EUR-Lex | 开放且结构清晰,并具有已文档化的接口 |
| 美国(联邦) | PACER, CourtListener, RECAP | 按检索的页面数收费;免费镜像站点涵盖了其中很大一部分 |
请注意美国案例中限制措施的性质。PACER 并非在阻止你,而是向你收费。在那里进行非定向爬取不仅会被拒绝,还会产生高昂费用,因此,缩小查询范围才是正确的应对方式——而扩大地址池则是一种完全错误的做法。
robots.txt 和请求限流因来源而异
BAILII 和国家档案馆的判决服务都发布了一个 robots.txt 文件,该文件排除了特定的搜索和管理路径,同时允许访问判决文本本身;若忽略该文件,则会遭遇与其他公共服务对无视其规定规则的客户端所施加的相同限流措施。 EUR-Lex 提供了一个带有文档说明的 Web 服务,该服务拥有独立的 SOAP 和 REST 接口,这才是正确的访问入口,而非渲染后的 HTML 页面——当服务端点已存在时,对页面进行抓取只是重复了发布者已经完成的工作。 CourtListener 的 API 需通过 API 密钥访问,每个密钥都有独立的速率限制,且该限制会叠加在 IP 地址本身的限制之上;因此,如果使用的是共享地址或曾被标记过的地址,即使客户端行为规范,也可能因与其自身请求速率无关的原因而受到限流。
判例法研究
判例法中的难点不在于检索,而在于身份识别。同一份判决可能以中立引证、一项或多项法律报告引证、法院案号以及数据库内部标识符的形式出现,而不同的系统偏好不同的标识方式。 跨管辖区的法律研究能否成功,关键在于能否将这些标识符解析为单一实体;而在实践中,这项工作所耗费的精力远超法律汇编本身。
neutral_citation … report_citations [ … ] # frequently several, from different reports docket_number … source_id … # the database's own identifier court … decided_on … source bailii | legifrance | eurlex | courtlistener fetched_at 2026-08-24T09:14:02Z
第二个原则是版本管理。司法判决会经过修正并重新发布,法律法规也会不断修订——虽然汇编文本会发生变化,但其引用地址始终不变。记录下您阅读的是哪个版本以及阅读的时间,才能让我们明确在特定日期法律的内容,而不仅仅是当前的法律内容。
引用格式本身并不存在共同的逻辑
诸如 [2024] EWCA Civ 12 之类的中立引用仅能告知法院名称和年份,但无法说明文本的具体位置;而像 ECLI:EU:C:2023:456 则以欧盟采用的固定结构编码了国家、法院和年份,其目的正是为了使成员国的引文能够通过程序进行比对;而美国联邦案卷号虽可识别案件,却无法标识该案件内的具体文件,这正是 RECAP 文档编号系统的用途所在。 建立一个将每种格式映射到其实际所代表的字段的查找表——而不是将这四种格式都视为可互换的字符串——这才是实现自动化交叉引用所必需的。
监管信息收集
监管是该垂直领域中发布量较大、商业需求更旺盛的一半。国家公报、监管机构出版物、咨询文件、指导说明和执法决定,其更新速度均快于判例法,且对试图在多个市场保持合规的企业而言,其影响更为直接。
在此情况下,本地出口往往确实是必要的。一些国家服务会限制或降低来自国外IP地址范围的访问质量,还有一些服务会根据访问者显示的位置,以不同的方式呈现界面、搜索行为和文档的可用性。 从某司法管辖区内部访问该管辖区的服务,是查看当地从业者所见内容最可靠的方式,同时还能消除一类间歇性故障——这类故障若不通过此方式,往往很难查明原因。
- 关注索引,而非文档simplified-chinese (Mainland) — 公报和监管机构会按计划发布信息。查询列表,仅获取最新内容。
- 记录咨询过程及结果 — 草案和相关反馈往往在最终文件出台数月前就已预示其走向。
- 保留原文语言 — 先保存源文本,再进行翻译。已翻译的法律文本仅为摘要,并非证据。
执法决定不属于判例法
监管机构的执法决定、指导说明或咨询答复仅具有说服力,而非像法院判决那样具有约束力,且其内容可被修订或取代,而无需遵循法律体系中推翻先例所要求的任何程序性要件。 从一开始就在数据集中将执法材料与判决书分别标注——仅仅因为这两类文件都属于法律文本而将其合并,会使使用该数据集的律师无法立即辨别两者的区别;而且,在数据采集过程中将它们分开保存,远比事后进行分类要经济得多。
跨司法管辖区数据
开展比较研究正是构建该数据库的初衷,这也带来了一项单纯收集数据所不具备的责任。一些司法管辖区特意以假名化形式公布判决书,以避免个人信息被永久检索——法国的做法便是众所周知的例子。 按原样收集已公布的文本通常没有问题。但试图重新识别当事人身份,或者通过跨来源汇总数据的方式,从而破坏某个来源刻意实施的假名化处理,则属于严重问题。
这是一个需要寻求法律意见的问题,而非工程决策,而且在管道建成之前提出这个问题是值得的。跨司法管辖区的数据集可能会在无人察觉的情况下,悄然恢复某个司法管辖区曾费尽心力消除的可检索性,而这并非任何人有意为之。
数据集存储在何处是第二个问题
在法国境内收集经过假名化处理的法国判决书,随后将完整数据集镜像到欧盟以外的基础设施上,这会引发一个与数据收集问题相独立的国际数据传输问题,尽管在实践中这两个问题常被混为一谈。 对于跨司法管辖区的法律档案库而言,更稳妥的默认做法是:将存储方式与数据来源中最为严格的监管制度保持一致,而非最为宽松的制度;并将此视为在数据收集开始前就应做出的数据架构决策,而不是在档案库建立后才进行的事后调整。
这些是公共服务,通常预算有限,且由正在履行职责的人员使用。耐心、单线程、非高峰时段的数据读取既是一种正确的做法,也——由于它绝不会触发防御性响应——是一种更可靠的做法。
关于收款纪律,请参见 网络爬虫的最佳实践,以及邻近的公共部门来源, 政府数据.
从内部全面覆盖每个司法管辖区
PXM2实时位置——选择您研究涵盖的辖区,并联系当地的相关服务机构:
法国
新加坡
印度
常见问题解答
判例法实际上是在哪里公布的?
在结构上几乎毫无共通之处的各国及超国家服务中,英格兰和威尔士有BAILII以及国家档案馆的判决服务;法国有Legifrance;欧盟有EUR-Lex;而美国联邦法院则依托PACER系统运行,同时通过CourtListener和RECAP档案库提供大量判决的免费查阅服务。 这些服务各自拥有独立的标识符、不同的收录深度,以及对“何为文件”的独特定义。
是否存在费用或准入障碍?
有时,了解具体是哪种情况很有必要。有些服务是免费且开放的,有些则虽然免费阅读,但设有速率限制。PACER按检索的每页收费,这使得非定向爬取虽然未被封锁,但成本高昂。当涉及收费时,正确的应对方式是缩小查询范围,而不是扩大地址池。
判决书中的个人数据又该如何处理?
这是真实存在的,且受到法规约束。一些司法管辖区正是为了避免个人身份信息被永久检索,才以假名化形式公布判决书,法国的做法便是众所周知的例子。 收集已公布的文本通常没有问题;但试图重新识别当事人,或通过跨来源汇总数据的方式规避假名化处理,则属于严重问题,应寻求法律建议而非仅由工程团队自行决定。
训练中最难的部分是什么?
引文,这方面差距明显。同一份判决可能会以中立引文、法律报告引文、案号以及数据库内部标识符等不同形式出现,而不同的系统又各有所偏好。跨司法管辖区的文献检索能否成功,关键在于能否将这些形式解析为单一实体,而这项工作所耗费的精力远超文献收集本身。
对于法律来源而言,本地出口为何重要?
一些国家的服务会限制或降低来自国外IP地址范围的访问质量,还有一些服务会根据访问者的显示位置,以不同的方式呈现界面、搜索行为和文档的可用性。从该司法管辖区内部访问其服务,是查看当地从业者所见内容的最可靠方式。
相关移动代理指南
法律资源与政府资源之间存在大量重叠——两者都是按管辖区域逐一发布的公共服务。