遇见数据集

ipfs_laos_laws_ir

收藏
Hugging Face2026-09-06 更新2026-09-07 收录
官方服务:

资源简介:

该数据集为老挝法律信息检索数据集(CID-keyed sparse GraphRAG),是 `endomorphosis/ipfs_laos_laws` 的研究检索版本。数据集旨在支持法律文本的检索、图增强检索(GraphRAG)以及基于BM25和向量嵌入的语义搜索。数据包含10757条法律条文(articles),无完整法律文件(laws为0),并构建了属性图:包含11277个节点(每个条目对应一个节点,外加管辖区域、语言、法律文件、来源等分面节点)和142513条边(包括BM25邻居边、文章-法律归属边等)。BM25索引包含13738个词项和333334条倒排记录,向量嵌入使用 `thenlper/gte-small` 模型生成384维向量。规范字段涵盖条目CID、法律CID、记录类型、管辖区域、语言、法律文件ID和标题、文章编号和标题、正文、来源URL、快照日期、覆盖范围、许可证、收集者、源数据集和版本等。数据以Zstandard Parquet分片存储,索引包括BM25词项分片、向量路由质心、文档范围分片以及图的节点、边和邻接表。该数据集仅供研究用途,不构成法律建议,官方来源应优先。

This dataset is a Lao legal information retrieval dataset (CID-keyed sparse GraphRAG), a research retrieval version of `endomorphosis/ipfs_laos_laws`. It is designed to support legal text retrieval, graph-enhanced retrieval (GraphRAG), and semantic search based on BM25 and vector embeddings. The data contains 10,757 legal articles (no full legal documents, laws=0) and builds a property graph with 11,277 nodes (each entry corresponds to a node, plus facet nodes for jurisdiction, language, legal document, source, etc.) and 142,513 edges (including BM25 neighbor edges, article-law belonging edges, etc.). The BM25 index includes 13,738 terms and 333,334 inverted records. Vector embeddings are generated using the `thenlper/gte-small` model with 384 dimensions. Standard fields include entry CID, law CID, record type, jurisdiction, language, legal document ID and title, article number and title, body text, source URL, snapshot date, coverage, license, collector, source dataset, and version. Data is stored in Zstandard Parquet shards, with indexes including BM25 term shards, vector routing centroids, document range shards, and graph nodes, edges, and adjacency lists. This dataset is for research purposes only and does not constitute legal advice; official sources should be prioritized.

创建时间:
2026-09-06
原始信息汇总

数据集概述

该数据集是老挝法律信息检索研究数据集(Laos legislation IR),由 justicedao/ipfs_laos_laws_ir 提供,作为 country-laws-ir-graphrag/v1 研究型检索版本发布,源自上游数据集 endomorphosis/ipfs_laos_laws(修订版本 e12c6a7b89377d6c2732ac7fccc48a2dfe6f818a)。

基本信息

  • 许可证:other(具体许可需参考上游来源)
  • 任务类别:文本检索(text-retrieval)
  • 标签:法律、老挝、GraphRAG、BM25、研究用途(非法律建议)
  • 主要标识entry_cid(CIDv1 raw sha2-256 规范标识记录的哈希值),整数 document_index 仅为紧凑分片指针,不构成身份标识

数据规模

项目 数量
法律(语料单元) 0
条款(语料单元) 10,757
规范文档 10,757
BM25 词项 13,738
BM25 倒排记录 333,334
图节点 11,277
图边 142,513
向量 10,757 × 384 维(thenlper/gte-small 嵌入)

规范字段

每条记录包含:entry_cidlaw_cidrecord_typejurisdictionlanguageinstrument_idinstrument_titlearticle_numberarticle_titletitlebodysource_urlsnapshot_datecoveragelicensecollectorsource_datasetsource_revision

单元策略:优先选取条款/章节级别行;当 articles.parquet 为空时回退到法律级别。

索引结构

使用 Zstandard 压缩的 Parquet 分片,每个分片最多 4,096 行。包含以下配置:

  • corpus:语料数据(data/corpus/*.parquet
  • bm25_documents / bm25_postings / bm25_keyword_index:BM25 检索文档、倒排记录及关键词分片索引
  • vectors / vector_meta_index:向量数据及语义路由质心索引(按与分片质心的余弦相似度排序)
  • graph_nodes / graph_edges:属性图节点与边
  • graph_outgoing_adjacency / graph_incoming_adjacency:按分数排序的出边/入边邻接页

BM25 参数:Okapi k1=1.2,b=0.75,标题权重=5,正文权重=1,采用 FTS5 unicode61 风格分词器。

图谱结构:每个 entry_cid 对应一个节点,并包含面向(管辖权、语言、文书、来源、状态)的方面节点;邻居边 BM25_NEIGHBOR_OF(k=8)携带分数与匹配词项;结构边包括 ARTICLE_OF(条款→所属法律),以及仅在源数据存在时出现的 IDENTIFIED_BY_ELI / IDENTIFIED_BY

查询示例

bash

BM25 关键词查询

python scripts/query_country_laws_hf.py --local-dir . bm25 "constitution" --top-k 10

向量语义查询

python scripts/query_country_laws_hf.py --local-dir . vector "money laundering" --top-k 10

图谱邻居查询

python scripts/query_country_laws_hf.py --local-dir . graph neighbors <entry_cid>

重要说明

  • 非法律建议:本数据集为研究快照,不构成法律意见。官方公报/老挝权威来源优先于本语料库。检索到的文档和图谱边仅作为检索证据,未虚构任何法律文本。
  • 来源与溯源:由 country-laws-ir 打包发布。上游收集者和官方许可证归属于 endomorphosis/ipfs_laos_laws。CID 标识的是本地内容,不证明公共 IPFS 固定。
搜集汇总
数据集介绍
ipfs_laos_laws_ir 数据集图片
构建方式
本数据集以老挝现行法律法规为对象,基于IPFS存储的原始语料(endomorphosis/ipfs_laos_laws)进行深度加工与重組。构建过程遵循严格的单元切分策略,优先提取法律条文中的条、款层级,当条文缺失时则回退至法律全文层级,最终形成10,757个规范的语料单元。每条单元均附带详尽的元数据,包括法律标识、条文序号、标题、正文、来源URL及快照日期等。同时,为支持多维度信息检索,数据集构建了层级化索引体系:利用Okapi BM25算法(k1=1.2, b=0.75,标题权重5,正文权重1)生成词项-倒排索引;通过gte-small模型将每个单元编码为384维向量,构建语义路由索引;并且构建了包含节点(11,277个)和边(142,513条)的属性图,其中文章至法律的归属关系及基于BM25相似度的邻居关系(k=8)被显式建模,从而形成一种融合词汇、语义与图结构的复合检索资源。
特点
数据集的核心特色在于其多模态索引的集成设计,它不仅提供原始的语料文本,还预置了BM25关键词索引、向量索引以及图结构索引,使得研究者和开发者能够直接对老挝法律进行稀疏检索、稠密检索或图遍历,无需额外的预处理流程。特别地,图结构引入了方面节点(facet nodes),涵盖司法辖区、语种、法律文书等维度,便于基于法律体系的实体关系进行探索性分析。此外,所有数据以Parquet格式分片存储,并采用Zstandard压缩,单片大小不超过4,096行,兼顾了大规模数据的读取效率与分布式处理的灵活性。每条记录的全局唯一标识符(CIDv1)基于内容寻址,确保了数据来源的可溯源性,同时明确声明了该资源为研究快照,不具备法律效力。这种工程设计将数据与索引封装于同一数据集中,极大降低了信息检索系统的部署复杂性。
使用方法
使用该数据集需借助其提供的Python查询脚本(scripts/query_country_laws_hf.py),该脚本支持三种检索模式:关键词检索(bm25)、语义检索(vector)以及图邻域检索(graph neighbors)。用户可指定数据集的本地路径并决定使用本地文件或通过HuggingFace datasets库加载。例如,运行`python scripts/query_country_laws_hf.py --local-dir . bm25 "constitution" --top-k 10`即可获取与“constitution”最相关的前10条法律条文,输出结果包含文档标识、得分及匹配词项。向量检索接受自然语言查询,通过计算余弦相似度返回语义相关的内容。图检索则需要输入节点的CID,以获取其评分排序的邻居节点。这种多样化的接口使得数据集可灵活适用于法律条文检索、知识图谱构建和RAG系统的开发。
背景与挑战
背景概述
该数据集由justicedao于2023年构建,旨在为老挝法律文本提供结构化的信息检索基准。研究团队针对法律领域长期存在的检索精度不足问题,以老挝官方法律文书的10757个条文为核心单元,整合了BM25词项索引、稠密向量表征及图谱邻接关系,形成多模态检索语料库。其核心研究问题在于探索法律条文间隐含的语义关联与引用网络,推动GraphRAG在法律场景的落地应用。该数据集为低资源法律NLP研究提供了稀缺的语料支持,尤其在东南亚法律智能化进程中具有开创性意义,为后续法律检索系统的评估与优化奠定了数据基石。
当前挑战
构建过程中面临多重挑战:法律文本的层级结构复杂,条文与法律文件间的归属关系需精确解析,且官方来源的数字化文本噪声显著。语义检索需兼顾条文间的显性引用与隐性主题关联,而稀疏词汇表与高重复性法律术语则对BM25权重调优提出严苛要求。图结构构建需在确保边语义准确性的前提下平衡计算开销,同时需规避法律文本的释义歧义。此外,语料覆盖时效性受限于官方公报的发布周期,且多语言混合语段干扰了向量编码的鲁棒性,这些难点共同构成了法律IR领域实践中的典型瓶颈。
常用场景
经典使用场景
该数据集专为法律信息检索(Legal Information Retrieval)而生,其核心设计围绕老挝法律体系的多粒度检索需求,涵盖法条、条文、主题词等多层级的检索单元。其独特的CID-keyed结构支持词法检索(BM25)、语义向量检索以及图结构邻接探索,为法律领域的垂直搜索、智能问答系统提供了结构化、多模态的基准数据。典型应用场景包括基于自然语言的法规条文查找、法律条文间的关联性挖掘,以及跨语言法律知识获取。借助包含10757条条文及142513条图边的丰富语料,研究者可模拟真实法律咨询中的信息检索流程,评估算法在精准匹配、语义理解及知识图谱推理上的综合表现。
衍生相关工作
基于此数据集,研究者已衍生出多种创新成果。一方面,催生了融合稀疏检索与图神经网络的法律检索模型,利用BM25邻接边作为监督信号,增强条文间语义关联的建模能力;另一方面,推动了法律问答系统向知识增强方向进化,将条文向量与图结构嵌入联合训练,提升对复杂查询的应答准确性。此外,其CID-keyed布局启发了多文档交叉引用等任务的新范式,如自动生成法律条文之间的“引用图谱”辅助解析,部分工作还将此方法论迁移至其他东南亚语言的法律语料,形成跨语种法律检索的基准测试。这些后续研究不仅深化了法律人工智能的内涵,也为领域内模型的可解释性发展铺设了新路基。
数据集最近研究
最新研究方向
该数据集聚焦于老挝法律文本的检索增强生成(RAG)前沿探索,采用CID键控的稀疏图结构,融合BM25与向量检索双通道,辅以属性图语义关联,为低资源语境的司法人工智能提供实证基石。其研究导向在于构建多模态索引布局,通过图节点与边的拓扑编码法律条文间的内在脉络,推动法律信息检索向知识图谱驱动的混合推理范式演进。此举不仅响应了法律科技中对精确性与可解释性的迫切需求,也隐含着对跨境法律数据互操作性与知识产权边界的审慎考量,其意义在于为后续基于区块链存证的法律智能系统奠定数据基础设施,并引发关于AI辅助立法、司法透明及法律数据治理的深层学术思辨。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务