遇见数据集

ipfs_germany_laws_ir

收藏
Hugging Face2026-09-05 更新2026-09-06 收录
官方服务:

资源简介:

该数据集是德国法律信息检索(IR)的研究版本,打包为country-laws-ir-graphrag/v1格式,源自endomorphosis/ipfs_germany_laws的快照。它专门用于法律文本的检索、BM25和向量搜索以及图检索增强生成(GraphRAG)场景。数据集包含112,963篇规范文档(文章级别),每个文档由唯一的entry_cid标识。数据字段涵盖法律元数据(如管辖权、语言、法律文书编号和标题、文章编号、标题、正文、来源URL、快照日期、覆盖范围、许可证等)。索引结构包括:BM25词汇索引(510,018个术语,10,076,902个倒排记录)、向量嵌入(112,963个384维向量,使用thenlper/gte-small模型)、属性图(131,340个节点,1,508,300条边)以及邻接表。BM25使用Okapi BM25算法(k1=1.2, b=0.75),标题权重为5,正文权重为1。图结构包含三种边类型:BM25邻居边(基于相似度得分和匹配术语)、文章与法律之间的ARTICLE_OF边,以及当存在时标识符边(如ELI)。所有数据以Zstandard压缩的parquet分片存储。该数据集仅供研究使用,不构成法律建议,官方德国法律公报优先。

This dataset is a research version of German legal information retrieval (IR), packaged as country-laws-ir-graphrag/v1 format, derived from a snapshot of endomorphosis/ipfs_germany_laws. It is specifically designed for legal text retrieval, BM25 and vector search, and Graph Retrieval-Augmented Generation (GraphRAG) scenarios. The dataset contains 112,963 normative documents (at article level), each identified by a unique entry_cid. Data fields include legal metadata (e.g., jurisdiction, language, legal instrument number and title, article number, title, body, source URL, snapshot date, coverage, license, etc.). The index structure includes: BM25 lexical index (510,018 terms, 10,076,902 inverted records), vector embeddings (112,963 384-dimensional vectors using the thenlper/gte-small model), property graph (131,340 nodes, 1,508,300 edges), and adjacency list. BM25 uses Okapi BM25 algorithm (k1=1.2, b=0.75) with title weight 5 and body weight 1. The graph structure contains three edge types: BM25 neighbor edges (based on similarity scores and matching terms), ARTICLE_OF edges between articles and laws, and identifier edges (e.g., ELI) when present. All data is stored as Zstandard-compressed parquet shards. This dataset is for research purposes only, does not constitute legal advice, and official German legal gazettes take precedence.

创建时间:
2026-09-04
原始信息汇总

数据集概述

Germany legislation IR (CID-keyed sparse GraphRAG) 是一个面向德国法律文本的研究型信息检索数据集,用于支持包括BM25、向量检索和图检索在内的多种检索范式。


基本信息

  • 数据集名称: Germany laws IR (CID-keyed GraphRAG)
  • 许可证: 其他(非标准许可)
  • 任务类别: 文本检索
  • 标签: 法律、德国、GraphRAG、BM25、研究等
  • 声明: 数据集为研究快照,非法律建议;官方公报或权威来源优先于本语料库

数据规模

项目 数值
法律条文(语料单元) 0
文章条目(语料单元) 112,963
规范文档总数 112,963
BM25 词项数 510,018
BM25 倒排记录数 10,076,902
图节点数 131,340
图边数 1,508,300
向量数 112,963 × 384维(thenlper/gte-small 嵌入)

数据内容与结构

规范字段(Canonical fields)

包括 entry_cidlaw_cidrecord_typejurisdictionlanguageinstrument_idinstrument_titlearticle_numberarticle_titletitlebodysource_urlsnapshot_datecoveragelicensecollectorsource_datasetsource_revision

单元选取策略:优先使用文章/章节级条目;当 articles.parquet 为空时回退到法律文件级。

主键与索引

  • 主键为 entry_cid(CIDv1 raw sha2-256);document_index 仅作为分片指针,非身份标识。
  • 数据以 Zstandard 压缩的 Parquet 分片形式存储,每个分片最多 4,096 行。
  • 索引文件包括:
    • bm25_keyword_shards.parquet:词项范围 → BM25 posting 分片
    • vector_chunks.parquet:语义路由质心
    • corpus_chunks.parquet:文档范围 → 语料分片
    • 图节点、图边及出入邻接表分片

检索与图模型配置

  • BM25: Okapi 参数 k1=1.2,b=0.75,标题权重=5,正文权重=1,采用 FTS5 unicode61 风格分词器。
  • 图结构: 每个 entry_cid 对应一个节点,另有面向法域、语言、法律文件、来源和状态的面状节点。边类型包括:
    • BM25_NEIGHBOR_OF(k=8):携带分数和匹配词项的邻居关系边
    • ARTICLE_OF:文章 → 所属法律的结构边
    • IDENTIFIED_BY_ELI / IDENTIFIED_BY:仅当源数据中存在这些标识符时生成

配置与数据文件

数据集包含以下 config,每个 config 对应不同的数据模块:

配置名 对应路径
corpus data/corpus/*.parquet
bm25_documents data/bm25/documents/*.parquet
bm25_postings data/bm25/postings/*.parquet
bm25_keyword_index indexes/bm25_keyword_shards.parquet
vectors data/vectors/*.parquet
vector_meta_index indexes/vector_chunks.parquet
graph_nodes data/graph/nodes/*.parquet
graph_edges data/graph/edges/*.parquet
graph_outgoing_adjacency data/graph/adjacency/outgoing/*.parquet
graph_incoming_adjacency data/graph/adjacency/incoming/*.parquet

查询方式(示例命令)

  • BM25检索:python scripts/query_country_laws_hf.py --local-dir . bm25 "constitution" --top-k 10
  • 向量检索:python scripts/query_country_laws_hf.py --local-dir . vector "money laundering" --top-k 10
  • 图邻居查询:python scripts/query_country_laws_hf.py --local-dir . graph neighbors <entry_cid>

来源与溯源

  • 上游数据来源为 endomorphosis/ipfs_germany_laws(修订版 62477e216917df268f186972ef49581b02144156)。
  • 上游收集方及官方许可证信息保持不变。
  • CIDs 仅标识本地内容,不证明公共 IPFS 固定状态。
搜集汇总
数据集介绍
ipfs_germany_laws_ir 数据集图片
构建方式
该数据集以德国法律法规为对象,基于`endomorphosis/ipfs_germany_laws`的特定修订版本,历经精细的加工流程构建而成。其核心构造策略在于将法律条文按文章或章节粒度进行单元划分,并辅以法规级别的信息,从而形成112,963个规范文档。每个文档均被赋予基于CIDv1的`entry_cid`作为唯一主键,确保了数据身份的稳固与可追溯。为了适应多种检索范式,数据集封装了稀疏词法索引(BM25)、稠密向量索引(基于`thenlper/gte-small`模型的384维向量)以及图结构索引,后者通过节点和边捕捉法规间的内在关联,如“ARTICLE_OF”结构边和基于相似度的“BM25_NEIGHBOR_OF”邻居边。数据采用Zstandard压缩的parquet分片存储,极大优化了大规模存取效率。
特点
该数据集在设计上体现出鲜明的多模态整合特性,将词法稀疏检索、向量语义检索与图谱遍历能力集于一身,为信息检索研究提供了坚实基底。其图结构包含131,340个节点和1,508,300条边,不仅链接了文档与法规父条目,还融入了根据内容相似性计算出的邻居关系,极大丰富了上下文线索。BM25索引涵盖逾51万个词汇项,配备超过一千万的倒排记录,并精心设置标题与正文的权重比例,以凸显法律文本中的关键元素。数据集每一行均提供完整元数据谱系,从法规编号到获取链接,充分遵循可溯源性与透明性原则。此外,其分片式布局和明确的查询脚本接口,降低了研究者的使用门槛,有助于在法律科技与GraphRAG等前沿领域深入开展实验。
使用方法
使用者能够借助提供的Python脚本灵活实施多类检索操作。通过指定`--local-dir`指向本地数据集副本,既可以运行BM25查询获得基于词法匹配的有序结果,也可以执行向量查询以捕获语义层面的相似条文,更可利用图模块查询特定节点的邻居关系,展开上下文相关的探索。数据集内嵌的索引配置文件从词条范围、向量质心至文档分片映射,为检索算法提供了精确的导航指引。为保障效率,官方推荐将数据上传至HuggingFace Hub以进行大规模存取与分发。考虑到该数据集的学术研究属性,必须明确其非官方法律参考,正式法律文本应以权威公报为准,但在司法判决预测、法律条文语义关联分析及智能法律咨询系统研发等场景中,其完备的结构与丰富的连接信息提供了不可多得的实验素材。
背景与挑战
背景概述
在信息检索与法律科技交叉领域,构建面向大规模法律文本的高效检索系统是当前研究热点。德国法律体系庞大复杂,传统关键词检索难以满足语义理解与关联挖掘需求。此背景下,ipfs_germany_laws_ir数据集于2023年由JusticeDAO团队创建,旨在提供基于CID键控的稀疏GraphRAG检索资源,整合了112,963篇德国法律文章,并辅以BM25词项索引、向量嵌入及属性图结构。该数据集不仅支持法律文本的精确与语义检索,还促进图增强生成(GraphRAG)研究,对法律信息学、智能法律助手及开放司法数据研究具有重要参考价值,推动了法律大语言模型测评与检索增强生成技术的发展。
当前挑战
该数据集所解决的领域问题聚焦于法律文本检索中的长尾查询与复杂语义关系。一项核心挑战是融合稀疏与稠密检索,以应对法律术语的严谨性与跨引用;例如,基于CID的图结构需有效组织130万条边,以支持邻域检索而不产生语义噪声。构建过程中,面临数据清洗难题,需从非结构化法律源中提取篇章级单元,并维护规范的元数据(如法律编号、章节层级)。此外,大规模嵌入生成(112,963×384维)及BM25索引构建(超千万条postings)对算力与存储提出高要求,同时确保版本可溯源性、内容无篡改,以及在不同检索模式(BM25/向量/图)间的无缝集成,亦是重大技术挑战。
常用场景
经典使用场景
该数据集以德国法律体系为蓝本,构建了一个大规模、多层次的文本检索基准,覆盖超过11万条法律条文,并附有基于CID的规范标识与结构化元数据。其设计初衷在于支持跨模态检索任务的标准化评估,尤其适用于法律文本的语义匹配、关键词检索与图结构查询的联合建模。研究者可借此开展基于BM25的稀疏检索、基于向量的稠密检索以及图增强的混合检索实验,从而系统性地验证不同检索策略在法律语料上的性能差异,为法律领域的信息获取技术提供可复现的测试平台。
解决学术问题
此数据集直面法律文本检索中的多重挑战,包括法律条文的层级关系复杂、术语使用高度专业化以及跨条文语义关联稀疏等问题。通过提供统一的文章级粒度、标准化的索引结构(如BM25倒排表、嵌入向量与属性图),它有效填补了现有法律检索基准在数据规模、结构丰富度与真实立法来源方面的空缺。其引入的CID主键与图节点关联机制,为多跳推理、条文溯源及知识图谱辅助的检索研究提供了坚实的数据支撑,促进了法律自然语言处理中可解释性与透明性的学术探索。
衍生相关工作
该数据集的发布直接催生了若干下游研究方向,包括基于GraphRAG的法律条文问答系统、结合稀疏与稠密表示的混合检索模型,以及利用图邻接信息进行法律文本链式推理的尝试。其CID键控架构也被借鉴于跨数据集的法律文本对齐研究,用于验证不同立法版本间的溯源与一致性。此外,其公开的BM25参数与图构建策略,成为后续工作评估检索效率与扩展性的参考基准,推动了法律知识图谱与信息检索交叉领域的实证进展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务