遇见数据集

ipfs_angola_laws_ir

收藏
Hugging Face2026-09-06 更新2026-09-07 收录
官方服务:

资源简介:

该数据集是安哥拉法律的信息检索(IR)研究快照,基于`endomorphosis/ipfs_angola_laws`的特定修订版打包而成,采用CID键控的稀疏图RAG(GraphRAG)布局。数据集包含法律条款的语料库、BM25倒排索引、向量嵌入(384维,使用`thenlper/gte-small`模型)以及属性图结构。主要键为`entry_cid`(CIDv1原始sha2-256)。统计信息:0部法律(但包含17212个条款/规范文档)、76668个BM25词项、1899002个BM25倒排记录、18654个图节点、217816条图边。规范字段包括:entry_cid、law_cid、record_type、jurisdiction、language、instrument_id、instrument_title、article_number、article_title、title、body、source_url、snapshot_date、coverage、license、collector、source_dataset、source_revision。索引布局采用Zstandard压缩的Parquet分片,包含BM25关键词索引、向量块索引、语料块索引、图节点/边以及入/出邻接索引。BM25参数为Okapi k1=1.2, b=0.75,标题权重5,正文权重1。图节点包括每个条目节点和方面节点(如jurisdiction、language等),边包括BM25邻居边(k=8)和结构边(如ARTICLE_OF)。该数据集适用于文本检索、图检索、BM25和向量混合检索等研究任务。注意:此数据集仅为研究用途,不构成法律建议,官方公报或权威来源应以安哥拉官方版本为准。

This dataset is a snapshot of information retrieval (IR) research for Angolan laws, packaged from a specific revision of `endomorphosis/ipfs_angola_laws` using a CID-keyed sparse graph RAG (GraphRAG) layout. It contains a corpus of legal articles, BM25 inverted index, vector embeddings (384-dimensional, using the `thenlper/gte-small` model), and property graph structure. The primary key is `entry_cid` (CIDv1 raw sha2-256). Statistics: 0 laws (but includes 17,212 articles/normative documents), 76,668 BM25 terms, 1,899,002 BM25 inverted records, 18,654 graph nodes, and 217,816 graph edges. Schema fields include: entry_cid, law_cid, record_type, jurisdiction, language, instrument_id, instrument_title, article_number, article_title, title, body, source_url, snapshot_date, coverage, license, collector, source_dataset, source_revision. Index layout uses Zstandard-compressed Parquet shards, including BM25 keyword index, vector chunk index, corpus chunk index, graph nodes/edges, and inbound/outbound adjacency indexes. BM25 parameters are Okapi k1=1.2, b=0.75, with title weight 5 and body weight 1. Graph nodes include each entry node and facet nodes (e.g., jurisdiction, language), and edges include BM25 neighbor edges (k=8) and structural edges (e.g., ARTICLE_OF). The dataset is suitable for research tasks such as text retrieval, graph retrieval, BM25 and vector hybrid retrieval. Note: This dataset is for research purposes only and does not constitute legal advice. Official gazettes or authoritative sources should refer to the official Angolan version.

创建时间:
2026-09-06
原始信息汇总

数据集概述

安哥拉法律信息检索数据集(Angola laws IR) 是一个面向研究用途的法律文本检索数据集,基于 endomorphosis/ipfs_angola_laws 的特定修订版本打包而成,采用 CID 键控的稀疏 GraphRAG 布局。该数据集并非法律建议,仅作为研究快照使用,官方公报或权威来源仍具有优先效力。

核心统计信息

项目 数量
法律(语料单元) 0
条文(语料单元) 17,212
规范文档数 17,212
BM25 词项数 76,668
BM25 倒排记录数 1,899,002
图节点数 18,654
图边数 217,816
向量数 17,212 × 384 维(thenlper/gte-small 嵌入)

数据组织与配置

数据集包含多个可独立加载的配置(config),覆盖语料、检索索引和图结构:

  • corpus:主语料库,Parquet 格式
  • bm25_documents / bm25_postings:BM25 检索所需的文档与倒排记录
  • bm25_keyword_index:词项到倒排分片的映射索引
  • vectors:文档的语义向量表示
  • vector_meta_index:语义路由的质心索引
  • graph_nodes / graph_edges:属性图的节点与边
  • graph_outgoing_adjacency / graph_incoming_adjacency:按分数排序的邻接分页

所有分片采用 Zstandard 压缩的 Parquet 格式,每分片最多 4,096 行。

字段结构

语料单元包含以下规范字段:entry_cid(主键)、law_cidrecord_typejurisdictionlanguageinstrument_idinstrument_titlearticle_numberarticle_titletitlebodysource_urlsnapshot_datecoveragelicensecollectorsource_datasetsource_revision

单元策略优先使用条文级数据;当条文章节为空时,回退到法律级数据。

检索能力

数据集提供三种检索方式:

  1. BM25 检索:基于 Okapi BM25 算法(k1=1.2,b=0.75,标题权重=5,正文权重=1),支持词项级精确匹配。
  2. 向量检索:基于 384 维语义向量进行稠密检索,适用于语义相似度查询。
  3. 图谱邻居查询:基于属性图结构,可查询与指定 entry_cid 相邻的节点及关联边。图的邻居边 BM25_NEIGHBOR_OF(k=8)携带分数和匹配词项;结构边包括 ARTICLE_OFIDENTIFIED_BY_ELI / IDENTIFIED_BY(仅在源数据中存在相应标识符时生成)。

主键说明

数据集以 entry_cid(基于规范身份记录的 CIDv1 raw sha2-256 哈希)为主键;整数 document_index 仅为紧凑的分片指针,不代表身份标识。

来源与许可

数据集的打包方为 country-laws-ir,上游数据来源于 endomorphosis/ipfs_angola_laws,其收集方和官方许可均沿用该上游数据集。CID 仅标识本地内容,不构成公开 IPFS 固定的证明。

搜集汇总
数据集介绍
ipfs_angola_laws_ir 数据集图片
构建方式
该数据集是基于安哥拉立法文本构建的检索增强型语料库,源自`endomorphosis/ipfs_angola_laws`的特定修订版本,经过系统化加工形成`country-laws-ir-graphrag/v1`布局体系。构建过程遵循单元优先策略,以法律条文或章节为基本单元,当条文缺失时回退至法律级文本,确保语料完整性。数据经规范化处理后,以CIDv1原始SHA-256哈希作为主键,并整合BM25词项与倒排索引、稠密向量表示及属性图结构,形成多模态检索索引。文本分割后经`thenlper/gte-small`模型生成384维向量,同时抽取图节点与边,构建稀疏与稠密相结合的混合检索架构。
使用方法
该数据集专为文本检索研究设计,支持多种查询方式。用户可通过专用Python脚本执行BM25词法检索,利用Okapi BM25算法(k1=1.2, b=0.75)查询标题与正文加权匹配文档;亦可进行向量语义检索,基于余弦相似度快速定位相关语义内容。对于图结构探索,脚本提供邻居检索功能,允许输入文档CID访问其图连接,发现相关法规或分面关系。数据以Zstandard压缩parquet分片存储,便于高效加载,适合构建法律领域问答系统或进行检索评估实验,但需注意其数据快照性质,宜配合官方来源验证。
背景与挑战
背景概述
该数据集名为ipfs_angola_laws_ir,由country-laws-ir团队于近期创建,旨在为安哥拉法律文本提供面向检索增强生成(RAG)的标准化语料库。其核心研究问题在于构建一个融合稀疏检索(BM25)、稠密向量检索与图结构邻接关系的多模态法律信息检索基准,以支持法律领域的语义理解与图谱推理。数据集以CIDv1为唯一标识,整合了17212条法律条文、76668个词项及217816条图边,源于endomorphosis/ipfs_angola_laws的特定版本,并经过结构化清洗与索引布局优化。该资源对法律科技社区具有显著影响力,为GraphRAG在法律领域的实证研究提供了可复现的公共基准,尤其服务于低资源语言环境下的法律信息抽取与问答系统开发。
当前挑战
数据集所面临的挑战首先体现在法律信息检索的固有复杂性上,即安哥拉法律文本的多义性与上下文依赖性使得传统基于关键词的BM25方法难以捕获语义关联,而单纯向量检索又面临长文本切片后的信息碎片化问题,亟需图结构来恢复条文间的层级关系与引用网络。其次,构建过程中遭遇了数据源异构性与法律文本规范化难题,如不同法律文书格式迥异、条款引用方式非标准化,且官方公报与公开镜像间的差异需通过快照日期与CID内容寻址来协调。此外,确保数据集的合法性与伦理合规性亦为挑战,其声明非法律建议并明确来源优先性,防止因检索结果误导用户,同时需维护与上游收集器版本间的可追溯性,以避免数据漂移与内容篡改风险。
常用场景
经典使用场景
该数据集是针对安哥拉法律条文精心构建的检索增强生成(RAG)语料库,其核心应用在于支撑法律领域的语义检索与图检索任务。研究者可利用其BM25词项索引、稠密向量索引及属性图结构,对安哥拉法律条文进行多模态的精确检索,例如针对特定条款的全文匹配、基于语义相似度的法律概念查询,或是通过图遍历探析法律条款之间的引用与关联关系。这为法律科技领域的研究提供了标准化的数据基准,尤其适用于开发面向特定司法管辖区的法律问答系统与知识图谱。
解决学术问题
该数据集有效回应了低资源法律文本信息检索研究中高质量结构化数据稀缺的困境。它通过提供包含17,212条法律条文、超过21万条图边的精细标注语料,使研究者得以深入探索法律文本的跨语言检索、长文档语义匹配以及法律知识图谱构建等学术难题。其精细的篇章切分(条文级别)、统一的法律元数据框架(如instrument_id、article_number)以及可复现的索引布局,促进了法律信息检索领域实验的可比较性,为验证混合检索策略、图增强生成模型在法律领域的适用性提供了坚实的实验基础。
实际应用
在实际应用中,该数据集可赋能面向法律专业人士及公众的智能法律服务平台。在法律咨询方面,它支持高效检索安哥拉现行有效的具体法律条款,辅助解答关于特定法律问题的详细条文依据。对于安哥拉及葡语系国家的法律科技创业公司,该数据集可作为构建合同审查、法律尽职调查等工具的核心知识底座。同时,由于数据集构建注重溯源,可与官方公报联动,为法律合规系统提供可信的法规条文验证,从而提升法律实务操作的效率与准确性。
数据集最近研究
最新研究方向
该数据集聚焦于安哥拉法律文本的稀疏图检索(GraphRAG)研究,融合了BM25词法索引、384维向量语义嵌入及属性图结构,为法律人工智能领域提供了细粒度的检索基准。其以CID为键的文档单元设计,结合篇章级切分与结构化邻接关系,支撑了复杂法律条文间关联的查询与分析。当前研究前沿侧重于利用此类多模态索引架构优化司法知识图谱的构建,提升法律文本检索的精准度与可解释性,并探索在低资源语言场景下法律智能助手的应用潜力。该资源对促进葡语非洲地区法律数字化、辅助法学研究及法律科技发展具有重要价值,同时也为信息检索社区提供了面向特定法域的可复现实验平台。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务