遇见数据集

ipfs_iran_laws_ir

收藏
Hugging Face2026-09-06 更新2026-09-07 收录
官方服务:

资源简介:

这是一个用于伊朗法律信息检索的研究数据集,基于 CID 键控的稀疏 GraphRAG 结构。数据源自 `endomorphosis/ipfs_iran_laws` 的特定版本,打包为 `country-laws-ir-graphrag/v1` 布局。数据集包含 11,249 篇法律文章(Articles)作为规范文档,无独立法律条目(Laws 计数为 0)。BM25 索引包含 3,708 个术语和 43,282 个 posting,图结构包含 12,055 个节点和 147,164 条边,向量嵌入为 11,249 条 384 维的 `thenlper/gte-small` 向量。每条记录的主键为 `entry_cid`(CIDv1 raw sha2-256 规范身份记录),规范字段包括:entry_cid, law_cid, record_type, jurisdiction, language, instrument_id, instrument_title, article_number, article_title, title, body, source_url, snapshot_date, coverage, license, collector, source_dataset, source_revision。数据优先以文章/节为单元,若 `articles.parquet` 为空则回退至法律级。索引布局采用 Zstandard 压缩的 Parquet 分片,每片最多 4,096 行,包括:BM25 关键字分片、向量路由质心分片、语料库分片、属性图节点/边、以及入度/出度邻接表。BM25 使用 Okapi BM25 算法(k1=1.2, b=0.75, title_weight=5, body_weight=1,基于 FTS5 unicode61 分词器)。图节点包括每个 `entry_cid` 对应的节点以及基于 jurisdiction、language、instrument、source、status 等构建的面节点;邻居边(BM25_NEIGHBOR_OF, k=8)携带分数和匹配词,结构边包括 ARTICLE_OF(文章到父法律)等。数据集仅供研究使用,不构成法律建议,官方公报或伊朗真实来源优先。查询可通过 Python 脚本执行 BM25、向量或图邻居搜索。

This is a research dataset for Iranian legal information retrieval, based on a CID-keyed sparse GraphRAG structure. The data originates from a specific version of `endomorphosis/ipfs_iran_laws` and is packaged in the `country-laws-ir-graphrag/v1` layout. The dataset contains 11,249 legal articles as canonical documents, with no independent law entries (Laws count is 0). The BM25 index includes 3,708 terms and 43,282 postings, the graph structure has 12,055 nodes and 147,164 edges, and vector embeddings consist of 11,249 384-dimensional vectors from `thenlper/gte-small`. Each records primary key is `entry_cid` (CIDv1 raw sha2-256 canonical identity record). Canonical fields include: entry_cid, law_cid, record_type, jurisdiction, language, instrument_id, instrument_title, article_number, article_title, title, body, source_url, snapshot_date, coverage, license, collector, source_dataset, source_revision. Data is prioritized at the article/section level, falling back to the law level if `articles.parquet` is empty. The index layout uses Zstandard-compressed Parquet shards, each with up to 4,096 rows, including: BM25 keyword shards, vector routing centroid shards, corpus shards, property graph nodes/edges, and in-degree/out-degree adjacency lists. BM25 uses the Okapi BM25 algorithm (k1=1.2, b=0.75, title_weight=5, body_weight=1, based on FTS5 unicode61 tokenizer). Graph nodes include nodes corresponding to each `entry_cid` and facet nodes built from jurisdiction, language, instrument, source, status, etc.; neighbor edges (BM25_NEIGHBOR_OF, k=8) carry scores and matching words, and structural edges include ARTICLE_OF (article to parent law). The dataset is for research use only and does not constitute legal advice; official gazettes or authentic Iranian sources take precedence. Queries can be executed via Python scripts for BM25, vector, or graph neighbor search.

创建时间:
2026-09-06
原始信息汇总

数据集概述

数据集名称:Iran legislation IR (CID-keyed sparse GraphRAG)

数据集链接:https://huggingface.co/datasets/justicedao/ipfs_iran_laws_ir

许可证:other(非标准许可,具体条款需参考上游数据集)

任务类别:文本检索(text-retrieval)

标签:法律、伊朗、GraphRAG、BM25、研究用途(非法律建议)


数据集内容

该数据集是伊朗立法文本的研究检索快照,源自 endomorphosis/ipfs_iran_laws 数据集的一个修订版本(revision cc3e6e1f1e29cf1d7b58bf7ad248d812b4ff94a4),并按 country-laws-ir-graphrag/v1 布局重新打包。

关键统计信息

项目 数量
法律(语料单元) 0
条款(语料单元) 11,249
规范文档数 11,249
BM25 词项数 3,708
BM25 倒排记录数 43,282
图节点数 12,055
图边数 147,164
向量数 11,249 × 384维(thenlper/gte-small 嵌入)

数据单元策略:优先使用条款/章节行;当 articles.parquet 为空时,回退至法律级数据。


数据字段(Canonical Fields)

每条记录包含以下字段:

  • entry_cid(主键,CIDv1 raw sha2-256)
  • law_cidrecord_typejurisdictionlanguage
  • instrument_idinstrument_title
  • article_numberarticle_titletitlebody
  • source_urlsnapshot_datecoverage
  • licensecollectorsource_datasetsource_revision

数据配置(Configs)

数据集包含多个子配置(config),均为 train 分割,使用 parquet 格式:

配置名 对应数据路径 说明
corpus data/corpus/*.parquet 语料单元
bm25_documents data/bm25/documents/*.parquet BM25 文档
bm25_postings data/bm25/postings/*.parquet BM25 倒排记录
bm25_keyword_index indexes/bm25_keyword_shards.parquet 词项索引(词项范围→倒排分片)
vectors data/vectors/*.parquet 向量数据
vector_meta_index indexes/vector_chunks.parquet 语义路由质心(按余弦相似度排序)
graph_nodes data/graph/nodes/*.parquet 属性图节点
graph_edges data/graph/edges/*.parquet 属性图边
graph_outgoing_adjacency data/graph/adjacency/outgoing/*.parquet 按得分排序的出边邻接表
graph_incoming_adjacency data/graph/adjacency/incoming/*.parquet 按得分排序的入边邻接表

索引另含 indexes/corpus_chunks.parquet(文档范围→语料分片)。

存储格式:Zstandard 压缩的 parquet 分片,每分片最多 4,096 行。


检索算法参数

  • BM25:Okapi 算法,k1=1.2,b=0.75,标题权重=5,正文权重=1(FTS5 unicode61 风格分词器)
  • 图结构:每个 entry_cid 一个节点,另有侧面节点(facet nodes,按司法辖区、语言、文书、来源、状态生成);邻居边 BM25_NEIGHBOR_OF(k=8)携带得分和匹配词项;结构性边包括 ARTICLE_OF(条款→父法律)、IDENTIFIED_BY_ELI / IDENTIFIED_BY(仅在源数据中存在相应标识符时使用)

重要声明

  • 非法律建议:这是研究快照,伊朗官方公报/权威来源优先于本语料库。检索出的文档和图边仅为检索证据,未发明任何法律文本。
  • 主键说明entry_cid 是规范身份记录的 CID;整数 document_index 只是紧凑的分片指针,而非身份标识。
  • 来源说明:CID 标识本地内容,不证明公共 IPFS 固定。

用途建议

该数据集适用于法律文本检索、图检索增强生成(GraphRAG)等研究场景,尤其适合对伊朗法律体系进行自然语言查询、语义检索和知识图谱分析的研究工作。

搜集汇总
数据集介绍
ipfs_iran_laws_ir 数据集图片
构建方式
该数据集源自`endomorphosis/ipfs_iran_laws`的特定修订版,由country-laws-ir项目以`country-laws-ir-graphrag/v1`格式重新封装,遵循`skillcenter-huggingface-release/v3`布局规范。构建过程以伊朗法律文本为原始素材,依据篇章结构优先切分条款,缺失时回退至法律整体,形成以`entry_cid`为主键的规范文档集。数据经标准化处理后,分别构建了词法索引(BM25)、语义向量索引(基于`thenlper/gte-small`模型生成384维嵌入)以及属性图谱,其中图节点涵盖法律条款与司法辖区、语言、文种等分面节点,边则包括条款归属关系与基于BM25相似度的邻居连接,从而形成多模态检索资源。
特点
该数据集具备显著的层级化与多索引特性,收录了11,249个条款及4,096行分片数据,包含BM25倒排索引、密集向量索引与属性图谱三套检索体系。图谱结构融合结构边(如ARTICLE_OF)与语义边(BM25_NEIGHBOR_OF),后者携带相关度分数和匹配词项,支撑从关键词到语义再到图遍历的渐进式检索。所有数据均经Zstandard压缩并以parquet分片存储,索引按范围路由,确保高效查询。数据集明确标记为非法律建议,仅作为研究快照,忠实于原始来源,未生成任何虚构法律文本,保障了内容的法律严肃性与可追溯性。
使用方法
用户可通过配套查询脚本`query_country_laws_hf.py`便捷使用此数据集,支持三种检索模式:`bm25`适用于基于关键词的精确词汇匹配,`vector`则利用语义嵌入实现概念级检索,`graph`能够通过指定`entry_cid`探索文档间的拓扑邻接关系,每种模式均允许通过`--top-k`参数控制返回数量。该数据集面向法律检索、图增强生成(GraphRAG)及比较法研究等场景,研究者可依据需求选择相应索引,并将其集成至下游管道。数据读取遵循HuggingFace datasets库规范,各配置子集(如corpus、graph_edges等)均可独立加载,便于灵活分析与实验复现。
背景与挑战
背景概述
伊朗法律信息检索数据集(ipfs_iran_laws_ir)由country-laws-ir团队于近期构建,旨在为伊朗成文法提供结构化的文本检索与图增强检索(GraphRAG)研究资源。该数据集源于endomorphosis/ipfs_iran_laws的快照,通过内容寻址标识(CID)确保数据的可溯源性,覆盖超过1.1万条法律条文,并集成BM25稀疏检索、稠密向量(基于gte-small模型)及属性图结构,支持法律文本的语义关联与邻居检索。其发布面向自然语言处理、法律信息学及知识图谱领域,为跨语言法律文本挖掘、司法智能助手及法律知识推理提供了基准语料,对伊朗法律数字化与开放获取具有重要推动作用。
当前挑战
该数据集面临的首要挑战源于法律文本的特殊性:法律条文语义高度依赖上下文,且常有修订与废止,需精准区分现行有效条款与历史版本,检索系统需兼顾词法匹配(如BM25)与语义理解(如向量检索),以应对口语化查询与正式法律术语间的鸿沟。构建中,数据清洗需消除源文档的结构异构性(如条款拆分、嵌套引用),确保单元粒度一致性;同时,法律识别符(如ELI)缺失或格式不一,需通过启发式规则与人工校准确立规范节点。此外,基于CID的标识体系虽保证本地内容完整,但无法证明公网IPFS固定状态,导致分布式存储的可用性与持久性存疑,影响数据长期可复现性。
常用场景
经典使用场景
该数据集以伊朗法律文本为核心,构建了包含11,249条法律条款的结构化语料库,并配备了基于CID键控的稀疏图检索(GraphRAG)索引,涵盖BM25词汇索引、向量嵌入(384维)及属性图节点与边。其经典使用场景聚焦于法律文本的混合检索,支持关键词精确匹配与语义相似度查询,同时利用图结构揭示条款间的引用关系和主题聚类,适用于法律信息检索系统的基准测试与学术研究中的法律文本挖掘。
实际应用
在实际应用中,该数据集可支撑法律科技产品的开发,如法律咨询问答系统、司法案例相似性检索工具以及法规变更追踪平台。其图结构索引尤其适合构建法规知识图谱,辅助律师和公众快速定位相关法条,减少人工查阅成本。此外,数据集的CID键控设计便于跨系统数据溯源,为法律数据的去中心化存储与验证提供了参考,有望促进开放法律数据的标准化与互操作性。
衍生相关工作
该数据集可能衍生出若干相关工作,包括基于其图检索框架改进的混合检索模型、面向法律文本的专用嵌入模型微调实验,以及法律知识图谱的自动构建与推理方法。其标注的条目关系,如‘ARTICLE_OF’和‘BM25_NEIGHBOR_OF’,为图神经网络在法律文本分类和法规推荐中的应用提供了训练基准,进一步推动法律人工智能在智能合约审核、合规检查等领域的落地研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务