遇见数据集

ipfs_azerbaijan_laws_ir

收藏
Hugging Face2026-09-06 更新2026-09-07 收录
官方服务:

资源简介:

该数据集是阿塞拜疆法律的信息检索(IR)数据集,采用CID-keyed稀疏GraphRAG格式,基于endomorphosis/ipfs_azerbaijan_laws的快照打包而成。数据集包含多个组件:语料库(2262条法律条文)、BM25索引(14259个词条、287910条倒排记录)、向量嵌入(2262个384维向量,使用thenlper/gte-small模型)、属性图结构(2711个节点、30866条边)。数据字段包括entry_cid、law_cid、record_type、jurisdiction、language、instrument_id、instrument_title、article_number、article_title、title、body、source_url、snapshot_date、coverage、license、collector、source_dataset、source_revision等。图结构支持基于BM25的邻居关系、文章-法律隶属关系以及标识符关联。数据集主要用于法律文本检索、GraphRAG研究和语义搜索,但请注意:该数据集仅为研究快照,不构成法律建议,引用时应以阿塞拜疆官方公报为准。

This dataset is an information retrieval (IR) dataset for Azerbaijani laws, formatted as CID-keyed sparse GraphRAG, packaged from a snapshot of endomorphosis/ipfs_azerbaijan_laws. It contains multiple components: a corpus (2262 legal articles), a BM25 index (14259 terms, 287910 postings), vector embeddings (2262 384-dimensional vectors using the thenlper/gte-small model), and a property graph structure (2711 nodes, 30866 edges). Data fields include entry_cid, law_cid, record_type, jurisdiction, language, instrument_id, instrument_title, article_number, article_title, title, body, source_url, snapshot_date, coverage, license, collector, source_dataset, source_revision, etc. The graph structure supports BM25-based neighbor relationships, article-law affiliations, and identifier associations. The dataset is primarily intended for legal text retrieval, GraphRAG research, and semantic search. Note: this dataset is a research snapshot only and does not constitute legal advice; citations should refer to the official gazette of Azerbaijan.

创建时间:
2026-09-06
原始信息汇总

数据集概述

数据集名称:Azerbaijan legislation IR (CID-keyed sparse GraphRAG)

数据集标识country-laws-ir-graphrag/v1,布局族为 skillcenter-huggingface-release/v3 / publicus-ir

主要用途:面向阿塞拜疆法律文献的信息检索(IR)研究数据集,可用于 BM25 稀疏检索、向量稠密检索和基于图的检索(GraphRAG)等任务。

数据集性质

  • 研究快照,非官方法律文本,不构成法律建议。
  • 基于 endomorphosis/ipfs_azerbaijan_laws(revision 543d3aea2e9d2765ece99497210267f156f99636)打包。
  • 官方公报/权威来源优先于本语料库,检索结果仅作为证据。

数据统计

项目 数量
法律(语料单元) 0
条款(语料单元) 2262
规范文档数 2262
BM25 词项数 14259
BM25 倒排记录数 287910
图节点数 2711
图边数 30866
向量条数 2262 × 384 维(thenlper/gte-small 嵌入)

数据结构

主键entry_cid(基于规范身份记录的 CIDv1 原始 SHA2-256)。document_index 仅作为紧凑分片指针,不是身份标识。

规范字段entry_cidlaw_cidrecord_typejurisdictionlanguageinstrument_idinstrument_titlearticle_numberarticle_titletitlebodysource_urlsnapshot_datecoveragelicensecollectorsource_datasetsource_revision

单元策略:优先条款/章节行;若 articles.parquet 为空则回退到法律级。

索引与配置布局

所有数据以 Zstandard 压缩的 Parquet 分片存储,每片最多 4096 行。

  • BM25 配置:Okapi k1=1.2,b=0.75,标题权重=5,正文权重=1(FTS5 unicode61 风格分词器)。
  • 图结构:每个 entry_cid 一个节点,外加方面节点(按法域、语言、法律文书、来源、状态生成)。相邻边 BM25_NEIGHBOR_OF(k=8)携带分数和匹配词项。结构边包括 ARTICLE_OF(条款→父法律),以及仅在源中存在时的 IDENTIFIED_BY_ELI / IDENTIFIED_BY

数据文件配置

  • corpus — 数据主体(条款/法律原始内容)
  • bm25_documents — BM25 文档数据
  • bm25_postings — BM25 倒排记录数据
  • bm25_keyword_index — 词汇词项范围 → BM25 分片映射
  • vectors — 向量嵌入数据
  • vector_meta_index — 语义路由质心(按与分片质心的余弦相似度排序)
  • graph_nodesgraph_edges — 属性图数据
  • graph_outgoing_adjacency / graph_incoming_adjacency — 按分数排序的邻居页数据

查询方式

支持三种查询途径:

  • BM25 查询:命令行示例 python scripts/query_country_laws_hf.py --local-dir . bm25 "constitution" --top-k 10
  • 向量查询:命令行示例 python scripts/query_country_laws_hf.py --local-dir . vector "money laundering" --top-k 10
  • 图查询:命令行示例 python scripts/query_country_laws_hf.py --local-dir . graph neighbors <entry_cid>

来源与许可

  • 由 country-laws-ir 打包,上游采集方和官方许可证归属 endomorphosis/ipfs_azerbaijan_laws
  • CIDs 标识本地内容,不证明公共 IPFS 固定。
搜集汇总
数据集介绍
ipfs_azerbaijan_laws_ir 数据集图片
构建方式
本数据集基于阿塞拜疆法律文本的权威来源,通过系统化的流程构建,涵盖2262篇法律条文,并以条文级(article-level)为最小检索单元。每个单元通过内容寻址标识符(CIDv1)进行唯一标识,确保数据的一致性与可追溯性。数据集的构建融合了词法、语义与图谱三种索引范式:采用Okapi BM25算法进行稀疏检索,利用thenlper/gte-small模型生成384维稠密向量以支持语义检索,同时构建了包含2711个节点与30866条边的属性图,捕捉法律条文间的结构关联,如条文归属关系(ARTICLE_OF)与相似邻接关系(BM25_NEIGHBOR_OF)。所有索引数据均以Zstandard压缩的Parquet分片存储,单分片行数上限为4096,确保了高效的数据访问与扩展性。
特点
该数据集的核心特色在于其多模态检索能力的整合,实现了词法、向量与图谱检索的无缝互通。BM25索引支持高精度关键词匹配,并对标题域赋予5倍于正文的权重;向量索引则提供语义层面的相似性搜索,适应概念性查询需求;图谱索引通过邻接关系与结构边,能够探索法律条文间的隐性关联。此外,数据集提供统一的CID键体系,保证了跨模态引用的稳定性,同时采用规范化字段结构,涵盖法律文号、条文编号、标题、正文等多元化元数据,极大便利了法律检索系统的开发与法律文本的深度分析。
使用方法
数据集的使用方法灵活多样,支持Python脚本进行命令行交互查询。用户可通过BM25模式开展关键词检索,如查询“constitution”以获取最相关的法律条文;或切换到vector模式进行语义查询,如寻找与“money laundering”相关的概念性内容;亦可利用graph模式,通过指定entry_cid探索法律条文的图谱邻居。为适应规模化应用,数据集明确区分语料库、BM25索引、向量索引及图谱数据等不同配置,并提供了对应的高效加载接口,便于研究人员及开发者依据实际需求集成至检索系统或研究流程中。
背景与挑战
背景概述
该数据集由研究人员于2023年创建,隶属于country-laws-ir项目,旨在构建阿塞拜疆法律体系的信息检索基准。其核心研究问题在于如何高效地从法律文本中提取和检索语义信息,以支持法律智能应用。数据集整合了2262条法律条文,构建了图结构、稀疏向量索引及BM25检索模式,为法律自然语言处理提供了多模态检索资源。其发布对法律科技领域产生了显著影响,成为阿塞拜疆法律文本检索研究的重要参考,促进了法律数据标准化与检索算法的创新。
当前挑战
当前法律信息检索面临多重挑战。领域层面,法律文本的模糊性、上下文依赖性及多语言性使得传统检索技术难以精准捕捉语义,而法律语言的规范性要求检索结果的高度可靠性,错误或误导性信息可能引发法律风险。构建过程中,数据清洗与标准化需在保留法律原文完整性的同时去除噪声;多格式法律文件(如文档、表格)的集成增加了数据处理的复杂性;法律术语的专业性与跨文本引用关系(如条文间指代)的建模难度高,且需规避版权与隐私问题。此外,构建高效的多模态索引(如稀疏图与稠密向量融合)并保持检索性能的平衡,亦是显著的技术挑战。
常用场景
经典使用场景
该数据集为阿塞拜疆法律条文的信息检索研究提供了结构化的语料库,涵盖了2262条法律条文、BM25词项索引、向量嵌入及图结构。其经典使用场景在于利用BM25关键词检索和基于向量的语义检索(如gte-small嵌入)进行法律文书的相关性排序,同时结合图节点与边(如ARTICLE_OF、BM25_NEIGHBOR_OF)实现条文间关联的探索。研究者可以借此开发混合检索系统,融合稀疏检索与稠密向量,在法律文本理解任务中评估不同检索策略的性能。
解决学术问题
该数据集解决了低资源语言法律领域缺乏高质量、结构化检索基准的问题。它提供了完整的索引布局(词项分片、向量分片、图邻接表)和统一的检索接口,支持可复现的实验。通过CID键控的实体标识和属性图,它促进了关于法律文档结构建模、跨语言检索(阿塞拜疆语)以及法律图嵌入的学术探讨。其设计涵盖了BM25参数调优和语义路由的标准化,为法律信息检索中的可比较评估奠定了数据基础。
衍生相关工作
该数据集衍生的相关工作包括基于BM25和图邻接的混合检索模型的研究,例如利用BM25_NEIGHBOR_OF边进行查询扩展或结果重排序。其向量分片可用于微调法律领域的句子嵌入模型。此外,属性图结构激发了关于法律知识图谱构建、法规演进分析以及多跳问答数据集生成的研究。CID键控设计也为分布式存储和内容寻址在法律档案中的适用性提供了案例。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务