遇见数据集

ipfs_cyprus_laws_ir

收藏
Hugging Face2026-09-05 更新2026-09-06 收录
官方服务:

资源简介:

该数据集为塞浦路斯立法信息检索研究数据集,基于CID-keyed稀疏GraphRAG结构构建。它源自`endomorphosis/ipfs_cyprus_laws`数据集的特定修订版本,经过重新打包以支持检索任务。数据内容包含塞浦路斯法律条文的文章级别文本(共24026篇规范文档),以及对应的BM25全文索引、向量嵌入(384维,使用thenlper/gte-small模型)和属性图(包含节点与边,以及邻接索引)。数据集字段包括:唯一标识符(entry_cid)、法律标识符、记录类型、管辖权、语言、法律文号、标题、条款编号、条款标题、正文、来源URL、快照日期、覆盖范围、许可证、收集者、源数据集和修订版本。此外,数据集提供了BM25(Okapi参数k1=1.2, b=0.75,标题权重5,正文权重1)和向量检索的索引,以及图结构(节点包括文档节点和方面节点,边包括邻居边和结构边)。该数据集仅用于研究目的,不构成法律建议,官方公报或权威来源优先。

Cyprus legislative information retrieval research dataset, built on CID-keyed sparse GraphRAG structure, derived from a specific revision of the `endomorphosis/ipfs_cyprus_laws` dataset, repackaged for retrieval tasks. Contains article-level texts of Cyprus laws (24,026 normative documents), along with BM25 full-text index, vector embeddings (384-dim, using thenlper/gte-small model), and property graph (nodes and edges with adjacency index). Fields include: entry_cid, law identifier, record type, jurisdiction, language, legal number, title, article number, article title, body, source URL, snapshot date, coverage, license, collector, source dataset, and revision. Provides BM25 (Okapi parameters k1=1.2, b=0.75, title weight 5, body weight 1) and vector retrieval indices, and graph structure (document nodes and aspect nodes, neighbor edges and structural edges). For research purposes only, not legal advice; official gazette or authoritative sources take precedence.

创建时间:
2026-09-05
原始信息汇总

数据集概述:Cyprus legislation IR (CID-keyed sparse GraphRAG)

基本信息

  • 数据集名称:Cyprus laws IR(CID-keyed GraphRAG)
  • 数据集标识justicedao/ipfs_cyprus_laws_ir
  • 任务类型:文本检索(text-retrieval)
  • 许可协议:other(自定义许可,非标准开源许可)
  • 标签:法律、GraphRAG、BM25、研究用途、塞浦路斯、非法律建议
  • 来源:基于 endomorphosis/ipfs_cyprus_laws 的研究检索版本(revision c46312ea702229228f76c228a26f54058f3482fd

内容统计

指标 数值
法律(整体单元) 0
条款(语料单元) 24,026
规范文档数 24,026
BM25 词条数 220,658
BM25 倒排记录数 1,144,709
图谱节点数 25,792
图谱边数 331,894
向量数 24,026 × 384维(由 thenlper/gte-small 模型嵌入)

核心字段说明

数据集包含以下规范字段: entry_cid(主键,CIDv1 raw sha2-256)、law_cidrecord_typejurisdictionlanguageinstrument_idinstrument_titlearticle_numberarticle_titletitlebodysource_urlsnapshot_datecoveragelicensecollectorsource_datasetsource_revision

单元策略:优先采用条款/章节级内容;当法律文件缺少条款数据时,回退至法律级内容。

索引与数据布局

数据集采用 Zstandard 压缩的 parquet 分片存储,每个分片最多 4,096 行,包含以下核心配置:

  • corpus:语料库主数据(data/corpus/*.parquet
  • bm25_documents / bm25_postings:BM25 检索所需文档与倒排数据
  • bm25_keyword_index:词条范围 → BM25 分片索引映射
  • vectors / vector_meta_index:语义向量数据与路由索引
  • graph_nodes / graph_edges:属性图谱节点与边
  • graph_outgoing_adjacency / graph_incoming_adjacency:按分数排序的邻居分页数据

BM25 参数:Okapi k1=1.2, b=0.75,标题权重为5,正文权重为1,使用 FTS5 unicode61 风格分词器。

图谱结构

  • 节点:每个 entry_cid 一个节点,外加方面节点(按司法辖区、语言、法律文书、来源、状态等维度生成)
  • BM25_NEIGHBOR_OF 邻居边(k=8),携带分数与匹配词条;结构性边包括 ARTICLE_OF(条款→所属法律)、IDENTIFIED_BY_ELI / IDENTIFIED_BY(仅在源数据中存在相应标识时生成)

查询方式

数据集提供了查询脚本,支持三种检索模式:

  • BM25 检索:对文本进行词法匹配
  • 向量检索:基于语义相似度检索
  • 图谱邻居查询:根据 entry_cid 检索相邻节点

重要声明

  • 非法律建议:该数据集为研究快照,官方公报或权威来源优先于本语料库
  • 内容真实性:检索文档与图谱边仅作为检索证据,未虚构任何法律文本
  • CID 性质:CID 仅标识本地内容,不保证 IPFS 公网存储可用性
  • 来源与许可:上游数据由 endomorphosis/ipfs_cyprus_laws 收集,其官方许可适用于本数据集
搜集汇总
数据集介绍
ipfs_cyprus_laws_ir 数据集图片
构建方式
该数据集源自对塞浦路斯法律文本的深度加工与重构,以《ipfs_cyprus_laws》为基础,通过严格的规范化流程,将原始法律条文分割为文章级单元,并为每个单元赋予基于CIDv1的内容标识符,确保数据的可追溯性与唯一性。构建过程融合了稀疏检索与图结构技术,采用Okapi BM25算法对文档进行词项索引,同时嵌入GTE-small模型生成384维语义向量,最终以Parquet分片格式存储,形成涵盖语料库、索引、图节点及边等多层次的数据结构。
特点
该数据集的核心特色在于其多模态的检索架构,同时支持词汇级BM25检索、语义向量检索以及知识图谱邻接查询,满足不同粒度的信息获取需求。其图结构不仅包含法律条文间的归属关系,还引入基于BM25相似度的邻居边及结构化标识边,极大地增强了法律条文间关联的可探索性。此外,详尽的数据元数据与来源追踪机制,确保了数据集的学术严谨性与法律领域的严肃性,虽非官方法律建议,但为法律信息学研究提供了宝贵的实验材料。
使用方法
使用该数据集时,用户可运行附带查询脚本,通过命令行直接执行BM25关键词检索或向量语义查询,亦或指定图节点探索其网络邻域。数据集内部分为多个配置模块,分别对应语料、索引及图数据结构,便于依据具体任务灵活加载。研究者可利用其构建法律领域的GraphRAG系统,或作为基准测试集评估信息检索算法性能。仓库还提供了完整的发布与更新指南,支持大规模数据的高效上传与迭代维护。
背景与挑战
背景概述
该数据集由country-laws-ir团队于近期创建,旨在为塞浦路斯法律文本提供高效的信息检索支持。核心研究问题在于如何将法律条文构建为多模态索引结构,以支持基于关键词、语义向量及图结构的混合检索。数据集包含24,026个条文单元,覆盖了法律文本的多种颗粒度,并集成了BM25、向量嵌入及图邻接关系,为法律人工智能研究提供了可复现的基准。其影响力体现在推动法律领域的检索增强生成(RAG)技术发展,尤其适用于小语种法律体系的研究。
当前挑战
该数据集所应对的领域问题包括法律文本的复杂结构、多语种术语差异以及条文间语义关联的捕捉,法律条文具有层级性(如条款、章节),且引用关系密集,传统检索模型难以兼顾。在构建过程中,挑战包括从异构来源解析并标准化法律文本、处理不完整或矛盾的法条数据,以及设计混合索引以确保稀疏检索与密集检索的协同性能。此外,保持数据版本的可追溯性和法律准确性亦为重要难题。
常用场景
经典使用场景
该数据集为法律信息检索领域的深度学习与图检索增强生成(GraphRAG)研究提供了结构化的语料基础。其经典使用场景聚焦于塞浦路斯法律条文的语义检索与混合查询,研究者可基于BM25稀疏索引与稠密向量索引构建双路召回系统,亦可利用图节点与边信息进行知识图谱增强的文档排序。数据集的粒度细化至条款级,每条记录包含规范化的元数据字段,适合用于法律文档段落重排、跨语言法律检索及长文本匹配等任务,为司法人工智能的基准测试提供了高保真度的实验平台。
实际应用
在实际应用层面,该数据集可作为法律科技产品中检索模块的开发资源,支持律师、法务人员对塞浦路斯法规的快速精准核查。其GraphRAG布局便于构建面向法律咨询的生成式AI系统,通过图遍历增强答案的事实一致性,减少模型幻觉。同时,索引结构的工程化设计(如分片存储与邻接表)契合生产环境的低延迟要求,可支撑法律数据库的增量更新与多租户服务。数据集明确标示“非法律建议”的使用边界,为合规化应用提供了伦理参照。
衍生相关工作
该数据集衍生的相关工作集中于两类:一是基于BM25与稠密检索的混合排序模型优化,包括跨编码器重排序与对比学习微调;二是图神经网络与大型语言模型结合的法律文本分析,如利用图边进行条文影响力的传播预测,或通过检索增强生成生成法律文书的摘要。其CID索引机制启发了区块链存证的法律数据溯源研究,而条款级元数据模式则推广至其他法域的数据集构建,形成“country-laws-ir”系列,促进了多语言法律检索基准的统一评估与跨司法管辖区的迁移学习实验。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务