遇见数据集

ipfs_ethiopia_laws_ir

收藏
Hugging Face2026-09-06 更新2026-09-07 收录
官方服务:

资源简介:

该数据集是埃塞俄比亚立法信息检索的研究快照,基于CID键控稀疏图RAG架构,源自 endomorphosis/ipfs_ethiopia_laws 数据集。它专为文本检索任务设计,尤其适用于法律领域的BM25检索、向量检索和图邻居检索。数据集包含1862条文章级别记录(无完整法律文本),每个记录对应一个规范文档,采用384维向量(由 thenlper/gte-small 模型嵌入),并配有BM25索引(24825个词条、166909个帖子)和属性图(2220个节点、19285条边)。图结构以 entry_cid 为主键,包含方面节点(如司法管辖区、语言、法律文书、来源、状态)和邻居边(BM25_NEIGHBOR_OF,k=8),以及 ARTICLE_OF 等结构边。数据字段包括 entry_cid、law_cid、record_type、jurisdiction、language、instrument_id、instrument_title、article_number、article_title、title、body、source_url、snapshot_date、coverage、license、collector、source_dataset、source_revision。索引布局采用Zstandard压缩的Parquet分片,支持高效检索。该数据集仅供研究使用,不构成法律建议,官方公报或权威来源应优先于本数据集。

This dataset is a research snapshot of Ethiopian legislative information retrieval, based on the CID-keyed sparse graph RAG architecture, derived from the endomorphosis/ipfs_ethiopia_laws dataset. It is specifically designed for text retrieval tasks, especially suitable for BM25 retrieval, vector retrieval, and graph neighbor retrieval in the legal domain. The dataset contains 1,862 article-level records (without full legal text), each corresponding to a canonical document, using 384-dimensional vectors (embedded by the thenlper/gte-small model), along with a BM25 index (24,825 terms, 166,909 postings) and a property graph (2,220 nodes, 19,285 edges). The graph structure uses entry_cid as the primary key, including aspect nodes (e.g., jurisdiction, language, legal instrument, source, status) and neighbor edges (BM25_NEIGHBOR_OF, k=8), as well as structural edges like ARTICLE_OF. Data fields include entry_cid, law_cid, record_type, jurisdiction, language, instrument_id, instrument_title, article_number, article_title, title, body, source_url, snapshot_date, coverage, license, collector, source_dataset, source_revision. The index layout uses Zstandard-compressed Parquet shards for efficient retrieval. This dataset is for research purposes only and does not constitute legal advice; official gazettes or authoritative sources should take precedence over this dataset.

创建时间:
2026-09-06
原始信息汇总

数据集概述

该数据集为 埃塞俄比亚法律信息检索数据集(Ethiopia laws IR),是一个面向研究用途的检索就绪版本,主要用于法律文本的图检索增强生成(GraphRAG)、BM25 检索及向量检索等场景。

数据集由 endomorphosis/ipfs_ethiopia_laws(修订版 d7d1a67b60d00f3eb93c99037e75f8478cedb8dc)打包而来,打包格式为 country-laws-ir-graphrag/v1。许可证类型为 other,且明确标注 非法律建议,官方公报或权威来源优先于本语料库。

数据规模

项目 数量
法律(语料单元) 0
条款(语料单元) 1862
规范文档数 1862
BM25 词项数 24825
BM25 倒排记录数 166909
图谱节点数 2220
图谱边数 19285
向量数 1862 × 384 维(thenlper/gte-small 嵌入)

主键与字段

主键entry_cid(CIDv1 raw sha2-256 规范身份记录)。整数 document_index 仅为分片指针,不构成身份标识。

规范字段包括:entry_cidlaw_cidrecord_typejurisdictionlanguageinstrument_idinstrument_titlearticle_numberarticle_titletitlebodysource_urlsnapshot_datecoveragelicensecollectorsource_datasetsource_revision

单元策略:优先采用条款/章节行;当 articles.parquet 为空时,回退至法律级单元。

索引与数据结构

数据使用 Zstandard 压缩的 parquet 分片存储,每个分片至多 4096 行。共包含 10 个配置(config):

配置名 路径 用途
corpus data/corpus/*.parquet 语料主体
bm25_documents data/bm25/documents/*.parquet BM25 文档
bm25_postings data/bm25/postings/*.parquet BM25 倒排记录
bm25_keyword_index indexes/bm25_keyword_shards.parquet 词汇范围 → BM25 记录分片
vectors data/vectors/*.parquet 向量数据
vector_meta_index indexes/vector_chunks.parquet 语义路由质心(按余弦相似度排序)
graph_nodes data/graph/nodes/*.parquet 属性图节点
graph_edges data/graph/edges/*.parquet 属性图边
graph_outgoing_adjacency data/graph/adjacency/outgoing/*.parquet 出边邻接(按分数排序)
graph_incoming_adjacency data/graph/adjacency/incoming/*.parquet 入边邻接(按分数排序)

额外索引indexes/corpus_chunks.parquet 提供文档范围到语料分片的映射。

检索参数与图结构

  • BM25:Okapi 算法,k1=1.2,b=0.75,标题权重=5,正文权重=1(采用 FTS5 unicode61 风格分词器)。
  • 图节点:每个 entry_cid 一个节点,外加侧面节点(_facet_cid(kind, value),涵盖法域、语言、法律文书、来源、状态等维度)。
  • 图边BM25_NEIGHBOR_OF(k=8)携带分数与匹配词项;结构边 ARTICLE_OF(条款 → 父法律,当条款存在时),以及 IDENTIFIED_BY_ELI / IDENTIFIED_BY(仅在源数据包含这些标识符时出现)。

数据溯源

该数据集由 country-laws-ir 打包,上游收集器及官方许可证归属 endomorphosis/ipfs_ethiopia_laws。CID 仅标识本地内容,不证明公开 IPFS 固定(pinning)。

搜集汇总
数据集介绍
ipfs_ethiopia_laws_ir 数据集图片
构建方式
该数据集源于对埃塞俄比亚法律文献的系统性整理与深度加工,以IPFS上的法律语料为基础,通过精细的文本解析将1862条法律条文与章节单元化,每条记录均标注唯一的CID标识符,确保内容可溯源。构建过程融合了稀疏检索与图结构,采用Okapi BM25算法对文本进行词项索引,生成包含24825个词项与166909条倒排记录的词项分片;同时,利用句子嵌入模型将所有单元映射为384维向量,构建语义路由索引。此外,基于法律条文间的引用与归属关系,提炼出包含2220个节点与19285条边的属性图,形成多层次的检索证据链。
特点
该数据集以三元检索架构为特色,兼具词法、语义与图关系三类检索路径,其BM25索引支持高精度词项匹配,向量索引实现跨语言的语义查询,而图结构则揭示法律条文间的隐性关联,如ARTICLE_OF与BM25_NEIGHBOR_OF边,为法律研究提供上下文扩展能力。数据单元严格对齐法律分条,保留下属关系与来源URL,且所有内容均源自官方或已验证语料,未做任何虚构补充,具有学术研究的可靠性与透明度。索引通过细化分片设计支持大规模快速访问,尤其适合GraphRAG等复合检索场景。
使用方法
使用该数据集时,开发者可通过提供的查询脚本,对本地仓库执行三类检索操作:基于BM25的词法查询适用于已知术语的精准定位;向量查询则利用语义相似度检索,回答‘洗钱’等主题性提问;图邻居查询以特定法律条文ID为起点,探测相关节点及其关联强度,支撑法律知识图谱的构建。所有结果以CID为键值返回,便于与原始语料对照。该数据集严禁作为法律建议使用,仅供研究参考,检索到的文档与图边缘仅作为证据线索,实际法律效力以官方公报为准。
背景与挑战
背景概述
该数据集名为“ipfs_ethiopia_laws_ir”,由justicedao团队于近期创建,旨在为埃塞俄比亚法律文本提供一种基于CID(内容标识符)的稀疏图检索(GraphRAG)资源。其核心研究问题在于如何利用去中心化存储(IPFS)和法律文本的结构化信息,构建一个高效、可复现的法律信息检索系统。该数据集整合了1862部法律条文,通过BM25词法索引、384维向量语义索引以及属性图结构,支持混合检索,对法律科技和自然语言处理领域具有潜在影响力,尤其为资源受限地区的法律文本数字化提供了新范式。
当前挑战
该数据集面临的挑战包括:其一,法律文本的领域特殊性,如埃塞俄比亚法律体系繁杂,条文之间关联性强,传统检索难以捕捉语义和引用关系,需图结构辅助;其二,构建过程中,数据来源分散且格式不一,需清洗、标准化并确保法律原文的真实性,避免法律建议误导;此外,去重和CID生成需处理跨版本一致性,向量嵌入和BM25参数调优需兼顾多语言(阿姆哈拉语等)和检索效率,以及图索引的存储和更新开销,均是构建时的关键难点,而数据集的规模与覆盖范围有限,也限制了其在通用法律检索任务中的泛化能力。
常用场景
经典使用场景
该数据集作为埃塞俄比亚法律文本的深度结构化检索资源,其经典使用场景聚焦于法律信息检索系统的构建与评估。研究者可借助其丰富的语料划分,如BM25稀疏检索所需的词项与倒排索引,以及基于神经编码器的稠密向量索引,开展混合检索策略的基准测试。尤为突出的是,其图谱结构(包含节点、边及邻接信息)为法律条文间的语义关联挖掘提供了数据根基,适用于法律知识图谱的构建、法律文本的语义相似度计算以及跨法条推理等研究任务。
衍生相关工作
围绕此数据集,可衍生出一系列有价值的学术工作。其一,是开发针对法律文本特性的新型稀疏与稠密混合检索模型,利用其条文级的粒度设计与图结构作为训练与评估的基础。其二,是探索将法律文本切片映射到图节点之上,研究法律知识图谱的自动构建方法,特别是基于其细致的图谱边关系(如ARTICLE_OF)进行法律文书的自动分类与关联分析。其三,该数据集的发布格式与基线设置,可为后续工作提供基准,以推动在低资源法律NLP中更具鲁棒性的检索与问答系统研究。
数据集最近研究
最新研究方向
在数字化治理与法律科技深度融合的浪潮下,基于IPFS的埃塞俄比亚法律信息检索数据集应运而生,其突破了传统法律数据库的范式,将1862条法律条文经嵌入式向量与稀疏图结构双重索引,构建了首个面向非洲法域的可复现检索基准。该数据集融合BM25词项匹配与GraphRAG语义导航,支持多跳邻接查询,为低资源语言的法律文本挖掘提供了创新性解决路径。其前沿意义在于,通过CID(内容标识符)锚定法律文书原真性,既确保了溯源可靠性,又回应了法律人工智能中对『可解释检索证据』的迫切需求。尤为重要的是,该工作为跨法域法律知识图谱的自动构建树立了范式,尤其在非洲联盟推进数字单一市场(Digital Single Market)的背景下,为区域法律协调提供了技术支撑,预示着法律信息学从词面匹配迈向语义关联的时代转折。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务