遇见数据集

crossjur-citation-coupling

收藏
Hugging Face2026-07-25 更新2026-07-27 收录
官方服务:

资源简介:

该数据集名为“跨司法管辖区法律引文耦合——乌克兰数据与工具”,旨在支持论文《文献耦合作为法律案例检索的跨司法管辖区评估框架:民法与普通法引文图比较》的可复现性研究。数据集核心为乌克兰民法体系的法律案例引文数据,来源于乌克兰的EDRSR(统一国家法院判决登记册)公共注册机构,并包含用于分析的衍生数据与工具。数据内容包括:1) 乌克兰引文图样本统计(文献耦合与共引);2) 完整的案例间引文时间序列分析及Mann-Kendall趋势检验(基于659万条先例边);3) 一个格式化为COLIEE Task 1标准的法律案例检索基准,包含约2000个查询案例和约7700个决策池文档(总计约9700个文本文件,文本内容经过截断),以及查询到黄金先例的标注文件;4) 用于时效性加权的文档决策年份映射文件。数据集规模约为10K到100K级别。该数据集适用于法律信息检索、引文网络分析(如文献耦合、共引分析)、法律先例检索的评估,以及跨司法管辖区(民法vs普通法)的法律文本比较研究。配套的Python/R工具可用于构建引文图、运行检索实验(支持E5、BGE-M3等密集编码器)和生成图表。数据以研究基准为目的提供,案例文本已截断,符合伦理使用要求。

This dataset is titled "Cross-Jurisdiction Legal Citation Coupling - Ukraine Data and Tools" and aims to support reproducibility for the paper "Bibliographic Coupling as a Cross-Jurisdiction Evaluation Framework for Legal Case Retrieval: A Comparison of Citation Graphs in Civil Law vs. Common Law." The core of the dataset consists of legal case citation data from Ukraines civil law system, sourced from the public EDRSR (Unified State Register of Court Decisions) registry, and includes derived data and tools for analysis. The data content comprises: 1) Sample statistics of Ukrainian citation graphs (bibliographic coupling and co-citation); 2) Complete inter-case citation time series analysis with Mann-Kendall trend tests (based on 6.59 million precedent edges); 3) A legal case retrieval benchmark formatted to COLIEE Task 1 standards, containing approximately 2,000 query cases and about 7,700 decision pool documents (totaling around 9,700 text files, with text content truncated), along with annotation files for query-to-gold-precedent mappings; 4) A document decision year mapping file for timeliness weighting. The dataset scale is approximately at the 10K to 100K level. It is suitable for legal information retrieval, citation network analysis (e.g., bibliographic coupling, co-citation analysis), evaluation of legal precedent retrieval, and cross-jurisdiction (civil law vs. common law) legal text comparative studies. Accompanying Python/R tools are provided for constructing citation graphs, running retrieval experiments (supporting dense encoders like E5 and BGE-M3), and generating charts. The data is provided for research benchmarking purposes, with case texts truncated to comply with ethical use requirements.

创建时间:
2026-07-13
原始信息汇总

跨法域法律引文耦合数据集(乌克兰数据与工具)

数据集概述

该数据集为论文《Bibliographic Coupling as a Cross-Jurisdictional Evaluation Framework for Legal Case Retrieval: Civil-Law and Common-Law Citation Graphs Compared》的可复现性工件,提供工具乌克兰侧派生数据。研究在统一的耦合/共引/时间方法论下,对比了大陆法系(乌克兰,源自EDRSR国家法院判决登记处)与普通法系(加拿大,源自COLIEE 2026任务1语料库)的引文图。加拿大侧文本因受COLIEE数据备忘录约束不在此重新分发

数据集信息

  • 许可证:cc-by-4.0
  • 语言:乌克兰语、英语
  • 标签:法律、引文图、书目耦合、共引、法律案例检索、时间性、乌克兰法律、COLIEE
  • 规模:10K < n < 100K
  • 数据观察器:不可用

数据内容

数据目录包含以下乌克兰侧派生文件(源自EDRSR):

文件 内容
ua_graph_stats.json 乌克兰文章级耦合/共引样本统计
ua_temporal_stats.json 乌克兰完整案例间引文年龄逐年序列及Mann-Kendall检验(含659万条先例边)
ua_retrieval_results.json 乌克兰案例检索宏平均P/R/F1 @k(基线 vs 时间衰减加权扫描,E5、BGE-M3)
ua_case_retrieval.zip 乌克兰案例检索基准(COLIEE任务1格式):2000个查询 + 约7700个决策池(文本截断)及查询→黄金先例标签
ua_years.json 文档ID到决策年份的映射(用于时间加权)
bc_diagnostics_{ua,ca}.json 耦合诊断输出(流行度下限、覆盖率分解、耦合层增长)
rg_{ua,ca}.json 可达性增益输出

工具

tools/目录提供Python/R标准库及sentence-transformers工具,依赖PostgreSQL源和GPU(用于检索):

  • 图构建build_canada_citation_graph.py(COLIEE格式zip构建加拿大图)、build_ua_coupling_sample.py(乌克兰耦合/共引样本)、build_ua_temporal.py(乌克兰时间趋势)
  • 检索任务build_ua_case_retrieval_package.py(构建COLIEE格式乌克兰检索任务)、probe_ua_case_retrieval.py(只读范围探查)
  • 检索实验retrieval_experiment.py(E5、BGE-M3密集检索 + 指数时间加权扫描)
  • 分析工具(2026年7月25日新增):bc_diagnostics.py(流行度下限、覆盖率分解、耦合层增长)、reachability_gain.py(可达性增益,其边界情况可精确复现扩展精确率和覆盖率)、dump_rankings.py(导出密集编码器top-k列表)
  • 图表与验证figures/(JSON→CSV、R + tikzDevice图表脚本)、build_claims_source.py(扁平化统计用于事实验证)

关键发现

  • 指数时间加权在两国均降低案例检索性能(乌克兰λ=0.2时下降37%-41%,加拿大下降64%-67%),但能改进乌克兰法规检索——效应取决于目标类型(被取代的法规 vs 累积先例),而非法律传统。
  • 耦合密度依赖法律传统:乌克兰判决耦合密度约为加拿大的18倍。
  • 乌克兰查询平均携带1.31个黄金案例(84.5%恰好一个),加拿大查询平均为4.12个。

来源与伦理

乌克兰数据源自公开的EDRSR(Єдиний державний реєстр судових рішень,国家法院判决统一登记处)。判决文本已截断,仅作为研究基准使用。相关数据集包括 overthelex/ukrainian-court-decisionsoverthelex/ua-court-citation-graph

引用

Bibliographic Coupling as a Cross-Jurisdictional Evaluation Framework for Legal Case Retrieval. 工作草案,2026年 — UAlberta / COLIEE合作;作者名单待定。

搜集汇总
数据集介绍
crossjur-citation-coupling 数据集图片
构建方式
该数据集基于乌克兰国家法院判决电子登记册(EDRSR)与加拿大COLIEE 2026任务一的语料库构建,旨在比较大陆法系与普通法系的引文网络。构建过程包括从EDRSR中提取乌克兰判决的案案引用关系,生成包含约6.59百万条先例边的完整时间序列数据,同时利用COLIEE格式的加拿大语料库进行对照。数据集通过文献耦合与共引分析框架构建,采用固定种子的判决样本进行文章级耦合计算,并整合了引用年龄趋势与Mann-Kendall统计检验。此外,研究团队开发了一系列标准化工具,如引文图构建、检索实验与诊断脚本,以确保跨法域结果的完全可复现性。
特点
该数据集的核心特点在于其跨法域比较视角与多维分析指标。乌克兰数据集中包含约2000条查询案例与7700份决策池文档,其中查询案例平均携带1.31个黄金标准案例,显示出大陆法系中先例引用高度集中的特性。数据集创新性地整合了引用密度分析,发现乌克兰判决的文献耦合密度约为加拿大的18倍,凸显了不同法律传统对引用行为的深刻影响。此外,数据集还提供了检索实验的宏平均精确率、召回率与F1值,并展示了指数衰减的时效性加权策略对案例检索的负向效应,这一发现揭示了被取代法律与累积先例之间的本质差异。
使用方法
用户可通过HuggingFace下载乌克兰侧派生数据及全套工具脚本进行复现。使用前需获取COLIEE加拿大部分数据的授权许可。典型工作流程包括:首先使用build_ua_coupling_sample.py脚本在EDRSR数据库上构建乌克兰文章级耦合样本,或通过retrieval_experiment.py执行稠密检索实验,支持E5与BGE-M3模型,并配合--years-json参数指定时间权重文件。输出的诊断结果存储于JSON格式文件中,用户可通过bc_diagnostics.py和reachability_gain.py等工具进一步分析引用覆盖率、流行度阈值与可达性增益等指标。整个过程依赖标准库与sentence-transformers,仅需PostgreSQL后端与GPU支持即可运行。
背景与挑战
背景概述
本数据集是跨法域法律引文耦合研究的重要成果,由加拿大阿尔伯塔大学与COLIEE合作团队于2026年创建。其核心研究问题在于探索大陆法系与英美法系背景下,引文耦合密度及时间权重对法律案例检索性能的差异化影响。通过构建乌克兰(大陆法系)与加拿大(英美法系)的双边引文图谱,该工作揭示了传统引文耦合方法在不同法律传统中的表现异同,为法律信息检索领域提供了首个跨法域基准框架。数据集包含乌克兰约10万份法院判决的完整引文关系与检索标注,显著推动了法律人工智能领域对结构主义方法论的重新审视。
当前挑战
该领域面临的核心挑战在于法律传统差异导致的引文行为异质性:大陆法系中法官对先例的引用密度远高于英美法系(乌克兰案例耦合密度约为加拿大的18倍),使得统一的检索评估指标难以兼顾两种体系。数据集构建过程中遭遇了双重困难:其一,乌克兰判决文本需从国家司法登记系统提取并清洗,涉及约7000份文书引文链的实体对齐;其二,加拿大COLIEE语料因许可限制无法直接分发,迫使研究团队开发独立可复现工具链以平衡数据开放性与法律合规性。此外,时间权重参数(如指数衰减因子)对检索效果的负向影响表明,传统时间衰减假设在累积性判例法中并不成立,这要求研究者重新设计法律文本的时效性建模方案。
常用场景
经典使用场景
该数据集为跨法域法律判例检索评估提供了基础框架,特别适用于比较大陆法系与普通法系下的判例引用图结构。通过构建乌克兰(大陆法系)与加拿大(普通法系)的双边引用耦合与共引网络,研究者可系统评估不同法律传统对判例检索性能的影响。数据集内含超过六千五百万条判例引用边、两千查询案例及对应的黄金标准判决,支持文献耦合度量、共引分析和时间加权检索实验等经典任务。
衍生相关工作
该数据集的衍生工作包括对耦合覆盖率的诊断分析工具(bc_diagnostics.py)和可达性增益评估指标(reachability_gain.py),后者在数学上统一了扩展精确率与覆盖率的边界情形。基于该框架的后续研究进一步探索了图谱基序(graph motifs)在跨法域检索中的可迁移性,以及将引用时间序列与曼-肯德尔趋势检验结合的动态检索模型。相关工具链已支持对稠密编码器排名列表的转储分析,为排序感知评估提供了标准化接口。
数据集最近研究
最新研究方向
在法律案例检索领域,跨法系文献耦合分析正成为评估框架的前沿热点。该数据集以乌克兰大陆法系与加拿大普通法系为双轴,通过构建法条引用图谱、共引与时间序列分析,首次实证比较了两大法系在案例检索中的耦合密度差异——乌克兰判决的耦合密度约是加拿大的18倍。研究同时揭示了时效性加权策略对检索效果的复杂影响:指数衰减权重在案例检索中表现退化(乌克兰下降37%-41%,加拿大下降64%-67%),却在乌克兰成文法检索中呈现正向改进,表明检索效果主要受目标类型(已废止成文法 vs. 累积性判例)而非法系传统的驱动。这一发现挑战了既有法系二分法的假设,为构建跨法域、时序敏感的司法智能检索系统提供了关键基准与理论支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务