lex-articles
收藏数据链接:
官方服务:
资源简介:
机器可读的卢森堡和经审阅的欧盟法律:每篇文章的Markdown和JSON格式,包含有效期区间,以及链接到官方发布证据的哈希链。
Machine-Readable Luxembourg and Curated EU Legislation: Each legislative article is available in both Markdown and JSON formats, with its validity period included, along with hash chains that link to official published evidence.
创建时间:
2026-08-02
原始信息汇总
数据集概述
lex-articles 是一个机器可读的卢森堡及欧盟法律数据集,按条款(per article)组织,支持时间点查询(point-in-time)与可验证性。数据集每晚自动更新,源自官方发布渠道,并通过哈希链保证与官方发布内容一致。
核心特征
- 覆盖范围:包含卢森堡 Legilux 综合版本中所有机器可读版本,以及欧盟法律的法语和英语版本(包括原始文本、综合文本及修正时间线)。
- 数据格式:提供 Markdown 和结构化 JSON 文件,同时发布 JSONL 和 parquet 格式的扁平文件(每个条款版本占一行)。
- 时间点查询:每个条款记录其有效起始与结束日期,可通过
history.json查看条款随时间演变的全部文本状态,并支持条款插入、删除和自动检测的重新编号事件。 - 可验证性:每个文本的 sha256 哈希链接到官方原始文件的哈希(保存在独立的 evidence 层仓库中),提取过程使用确定性的开源代码,不依赖 LLM。
- 使用方式:支持 Python 直接读取 JSON,通过 DuckDB 查询 parquet 文件,或通过托管的 MCP 端点(无需密钥)进行搜索、按日期查询、历史比较等操作。
数据可信度与维护
- 数据源自官方允许爬取的渠道,原始文件经 sha256 哈希后仅追加存储。
- 每晚自动重新生成;若派生文件在语料库未变化时发生变动,会触发确定性保护阻止提交。
- 提取配置文件不可变,修复以新 profile 形式发布,确保已固定的引用可永久验证。
许可与引用
- 派生合集采用 CC-BY-4.0 许可;卢森堡内容为 CC-BY-4.0(来源:Legilux);欧盟内容须按欧盟委员会第 2011/833/EU 号决定署名复用,综合文本无法律效力,仅官方公报具有权威性。
- 引用建议:"Lex, point-in-time Luxembourg and EU law (github.com/SFHAJJI/lex-articles)"。
访问入口
- 实时演示与浏览:https://law.soufien.lu
- 发布资产(JSONL + parquet):https://github.com/SFHAJJI/lex-articles/releases
- MCP 端点:https://law.soufien.lu/mcp
- 提取引擎:https://github.com/SFHAJJI/lex
- 证据层仓库:lex-corpus-lu-legilux、lex-corpus-eu-eurlex
搜集汇总
数据集介绍

构建方式
该数据集源自卢森堡及欧盟官方法律出版物的机器可读版本,通过严谨的采集与处理流程构建。其底层证据层存储了官方发布的原始文件(如Akoma Ntoso XML、Formex 4/XHTML),并附有SHA-256哈希以确保完整性。提取过程采用确定性的、版本化的开源代码,而非人工智能生成,从而保证了从原始字节到最终数据的可追溯性。数据集以每一条法律条款为基本单位,整理成简洁的Markdown和结构化的JSON格式,并包含生效日期、稳定的发布者ID以及链接回官方发布数据的哈希链。
特点
该数据集的核心特点在于其点对点的时间追溯能力与高度的可验证性。每个法律条款的每个合并版本均被独立记录,附有有效期限,并能通过哈希链验证其与官方发布数据的严格一致性。历史文件完整保存了条款的每次文本变化,并机械检测条款的插入、删除及重新编号,使得研究某一法律条款的演变过程变得像读取文件一样简单。此外,数据集在维护上设有确定性守卫,防止提取器漂移导致的虚假变更,确保数据纯净。
使用方法
使用者可通过多种便捷方式获取数据。直接克隆仓库后,可访问每个法律版本的结构化JSON文件,通过简单的Python代码即可逐条读取条款内容。更高效的方式是下载发布资产中的Parquet或JSONL文件,这些文件每行对应一个条款版本,可直接使用SQL查询(如通过DuckDB)进行时间点检索。同时,还提供了托管的MCP端点,允许任何MCP客户端通过HTTP协议进行只读查询,包括搜索、按日期查看条款、时间线、历史记录及来源验证等功能,无需本地安装任何解析器,极大简化了法律文本的RAG应用开发。
背景与挑战
背景概述
lex-articles数据集由Soufien Hajji及其团队于2023年创建,旨在提供卢森堡及欧盟法律的机器可读逐条版本,实现时间点追溯与可验证性。该数据集的核心研究问题在于克服法律文本的异构性与动态性,通过结构化JSON和Markdown格式,为每一条款提供精确的生效日期、官方ID及哈希链,确保数据来源的可信与可复现。其影响力体现在为法律科技、人工智能辅助法律分析及时间点检索(point-in-time RAG)提供了标准化、高可靠性的数据基础,推动了法律数据互操作性与透明度的提升。
当前挑战
该数据集面临的挑战涵盖多层面。首先,法律文本的复杂性与修订频繁性要求精准的时间戳及版本管理,确保任何历史状态的准确追溯,这对数据抽取算法的精确性提出极高要求。其次,构建过程中需处理来自Legilux和Eurlex等不同源的异构格式(Akoma Ntoso、Formex 4),并保证提取过程的确定性,避免人工智能模型引入误差。此外,面对未官方合并的修正案,数据集需如实保留状态而非伪造合并文本,这增加了数据完整性与合规性的平衡难度。最后,持续的法律变更要求夜间自动更新机制,并需抵御提取器漂移,确保数据长期可信。
常用场景
经典使用场景
lex-articles数据集将卢森堡与欧盟的法律条文拆解为机器可读的结构化条目,每一条款附带生效时间、来源哈希链及稳定标识,特别适用于时间点法律检索(point-in-time retrieval)与基于检索增强生成(RAG)的智能法律问答系统。研究者可直接利用其提供的JSON或Parquet格式,无需自建解析器,即可对特定条款进行历史版本回溯,或构建面向法律条文的时间敏感型语义搜索,极大简化了法律文本的预处理流程。
衍生相关工作
基于该数据集,已衍生了多项经典工作,包括时间点条款对比工具、法律文本一致性校验框架及面向AI的法律MCP服务器等。其‘消费层’与‘证据层’分离的设计理念催生了可验证的哈希链追溯方法,被后续研究用于构建不可篡改的立法档案库。此外,与知识图谱结合生成的法规演进图谱,以及用于预训练法律语言模型的按条款级语料,均为法律人工智能领域贡献了高价值的资源,促进了以数据驱动方式探索法律时间的动态性。
数据集最近研究
最新研究方向
该数据集聚焦于法律文本的细粒度时间感知与可验证性,为人工智能驱动的法律检索与推理提供了机器可读的逐条结构化数据。研究前沿在于利用点对点的时间戳、稳定标识符及哈希链,实现法律条款的精确历史追踪与溯源验证,从而支持高性能的时点检索(point-in-time retrieval)与合规性分析。该方向与当前法律科技(LegalTech)中可解释人工智能及可信数据基础的建设热潮紧密相关,尤其在大规模语言模型应用于法律问答时,此类数据集能有效减少幻觉现象。其意义在于推动法律数据标准化与开放共享,促进跨司法管辖区的法律信息互操作,并为法律预测、义务追踪及法规影响评估等研究提供可靠的数据基石。
以上内容由遇见数据集搜集并总结生成



