遇见数据集

icj-citation-graph

收藏
Hugging Face2026-07-21 更新2026-07-22 收录
官方服务:

资源简介:

ICJ Citation Graph 是一个包含国际法院(ICJ)所有公开裁决的图数据集。数据集涵盖从1947年(科孚海峡案)到2026年国际法院200个案件中的199个案件,共包含2,407份法律文件。每份文件均被解析为结构化文本,并分割为121,438个可搜索的文本段落,每个段落均附有使用gemini-embedding-001模型预计算的1536维嵌入向量。数据集构建了完整的引用网络,记录了文件之间、文件与案件之间、文件与法律条款(包括《联合国宪章》、《国际法院规约》、《法院规则》和《实践指南》)之间的引用关系,以及法官和当事国信息。数据集以多种形式提供:可直接使用的Neo4j图数据库(包含仅裁决版和包含所有诉状及口头记录的完整版),以及便于处理的便携式JSONL文件(包含cases, provisions, documents, chunks等配置文件)。此外,数据集还提供了分层扩展,增加了当事方提交的书面诉状(如memorials, applications等)和口头审理记录,共计3,989份额外文件,使数据总量覆盖国际法院官网公布的全部公开内容。该数据集适用于法律信息检索、司法先例分析、引用网络研究、知识图谱构建、语义搜索以及国际法自然语言处理等任务。数据来源于CD-ICJ历史语料库(1947-2023年)和国际法院官网近期裁决(2023-2026年),采用CC0 1.0许可证发布。

ICJ Citation Graph is a graph dataset containing all public judgments of the International Court of Justice (ICJ). The dataset covers 199 out of 200 cases from the ICJ, spanning from 1947 (Corfu Channel case) to 2026, and includes 2,407 legal documents. Each document is parsed into structured text and segmented into 121,438 searchable text chunks, each accompanied by a pre-computed 1536-dimensional embedding vector using the gemini-embedding-001 model. The dataset constructs a complete citation network, recording citation relationships between documents, documents and cases, documents and legal provisions (such as the UN Charter, ICJ Statute, Court Rules, and Practice Directions), as well as information on judges and parties. The dataset is provided in multiple formats: a ready-to-use Neo4j graph database (including a judgments-only version and a full version with all pleadings and oral records), and portable JSONL files for easy processing (with configuration files for cases, provisions, documents, chunks, etc.). Additionally, the dataset includes a layered extension that adds written pleadings (e.g., memorials, applications) and oral hearing records submitted by parties, totaling 3,989 additional documents, ensuring comprehensive coverage of all publicly available content from the ICJ website. This dataset is suitable for tasks such as legal information retrieval, judicial precedent analysis, citation network research, knowledge graph construction, semantic search, and natural language processing in international law. The data is sourced from the CD-ICJ historical corpus (1947-2023) and recent judgments from the ICJ website (2023-2026), and is released under the CC0 1.0 license.

创建时间:
2026-07-13
原始信息汇总

数据集概述:ICJ Citation Graph

该数据集包含了**国际法院(ICJ)**自1947年“科孚海峡案”至2026年的所有公开裁决,构建了一个完整的引用图谱。

核心规模与内容

  • 案件覆盖:199个案件中的2,407份文件。
  • 文本段落:121,438个可检索的文本片段,并附有预计算的嵌入向量。
  • 引用关系:包含6,070条案件间的引用边和7,939条文件对条约条款的引用。
  • 图层扩展:除了裁决,还包含当事人的书面诉状和口头审理记录,共计3,989份额外文件。

可用格式与版本

该数据集提供多种格式,以适应不同的使用场景:

格式 文件 内容层级 需求
即用图数据库 neo4j.dump (1.7 GB) 或 dumps/icj-decisions.dump 仅裁决 Neo4j 5.26
即用图数据库(完整版) dumps/icj-full.dump (2.7 GB) 裁决 + 诉状 + 口头记录 Neo4j 5.26
便携版(仅裁决) dataset/ (818 MB) 案件、条款、文件、文本片段 (JSONL + npy) 任何编程语言,NumPy用于向量
便携版(全层级) dataset_layered/ 所有层级,可通过 layer 字段过滤 任何编程语言,NumPy用于向量

便携版数据结构 (dataset/)

便携版由四个JSONL文件和一个NumPy向量文件组成。

  • cases.jsonl (199行):

    • 提供案件的元数据,如案件ID、名称、起始年份和结束年份。
    • year_end 字段为 null,则表示案件仍在审理中。
    • icj_documents 字段提供了ICJ官网各类型文档数量的快照。
  • provisions.jsonl (357行):

    • 包含被引用条约条款的详细信息。
    • 涵盖《联合国宪章》、《国际法院规约》、《法院规则》和《实践指示》四个法律文书。
  • documents.jsonl (2,407行):

    • 该数据集的核心,每行对应一份法院文件。
    • 字段包括:idcase_idtitledocument_type (如 judgment, order), langcited_cases (引用的案件ID列表), cited_provisions (引用的条款键值列表)。
    • 部分行包含 issued_date, applicant, respondent, stage 等信息。
  • chunks.jsonl (121,438行):

    • 将每份文件拆分为可搜索的文本段落。
    • 每个段落都与其所属的父文档(通过 document_id)关联。
  • embeddings.npy:

    • 一个形状为 (121438, 1536)float32 矩阵。
    • i 行对应 chunks.jsonl 的第 i
    • 使用 gemini-embedding-001 模型生成,向量已进行L2归一化。

层级扩展(dataset_layered/

该扩展包含了书面诉状和口头审理记录。

  • 所有文件均包含 layer 字段,值为 decisionpleadings, 或 oral
  • 裁决 (decision) 层的文本片段已包含预计算嵌入向量 (embeddings_decision.npy)。
  • 诉状 (pleadings) 和口头 (oral) 层不包含向量,需要用户自行嵌入。

关键引用网络统计

在案件的引用网络中,被引用最多的前五案例为:

  1. Military and Paramilitary Activities (Nicaragua v. USA) (292次)
  2. Application of the Genocide Convention (Bosnia v. Serbia) (206次)
  3. Corfu Channel (UK v. Albania) (162次)
  4. Interpretation of Peace Treaties (149次)
  5. US Diplomatic and Consular Staff in Tehran (138次)

被引用最多的条款是《国际法院规约》第48条(案件管理,643次)和第36条(管辖权,471次)。

许可与来源

  • 许可:CC0 1.0 (公共领域)。
  • 来源
    • 历史语料库 (1947 - 2023年10月):来自Sean Fobbe的CD-ICJ语料库 (CC0 1.0许可),包含2,285份文件。
    • 近期裁决 (2023年10月 - 2026年):直接从ICJ官网 (icj-cij.org) 抓取,包含122份文件。

已知限制

  • 51份文件的 document_typeunknown,因其封面页过于模糊无法分类,但文本内容可检索。
  • issued_date 仅存在于1,429份文件中。
  • source_url 为内部路径,不可公开访问。
搜集汇总
数据集介绍
icj-citation-graph 数据集图片
构建方式
该数据集以国际法院(ICJ)自1947年科尔夫海峡案至2026年间所有公开裁决为根基,整合了来自CD-ICJ语料库(CC0许可)与icj-cij.org官网直接抓取的共计2,407份法律文书。每一份PDF经过逐页渲染、OCR模型识别与多轮结构化解析:首轮精确定位文本角色的边界,次轮提取引用关系与案件编号,最终将解析后的文档、段落、预计算嵌入向量及引用边一次性写入Neo4j图数据库。数据集进一步扩展了当事方书面诉状与口头审理记录,新增3,989份文件,完整覆盖ICJ官网发布的全部内容,构成包含判决、诉状与庭审记录的多层知识图谱。
特点
该数据集的核心优势在于其结构化深度与即用性。2,407份判决文档被拆解为121,438个带有预计算嵌入(gemini-embedding-001,1536维L2归一化)的可检索段落,段落与文档通过唯一标识符关联,支持零冗余的跨表连接。案件、条款、法官与国家实体构成完整的属性图,包含6,070条案件引用边与7,939条条款引用边,可直观呈现尼加拉瓜诉美国案被引用292次等高阶引文模式。分层扩展设计允许用户按layer字段自由选择判决、诉状或庭审记录子集,且判决层的嵌入向量与纯文本形式的便携版本完全兼容,无需重新计算。
使用方法
用户可通过HuggingFace Datasets库一键加载便携版JSONL文件:使用load_dataset函数指定documents或chunks配置,即可在pandas中按案例ID、条款键或段落序列号进行关联查询。预计算嵌入以npy矩阵形式提供,通过行索引与chunks.jsonl对齐,使用numpy点积即可实现语义检索。对于Neo4j图数据库用户,可直接导入1.7GB的决策层转储文件,通过Cypher语言调用向量索引执行相似度搜索,或利用全文索引对庭审记录层进行关键词查询。分层扩展版本中,诉状与庭审记录仅含纯文本与段落结构,需用户自行使用相同嵌入模型补全向量以融入统一语义空间。
背景与挑战
背景概述
国际法院(ICJ)作为联合国主要司法机构,其判决与意见构成了国际法实践的核心文本。然而,长期以来,这些分散在官方网页与学术语料库中的法律文书缺乏系统化的结构化整合,阻碍了大范围引证网络分析与知识图谱构建。2026年,由研究者Chulinz主导创建的ICJ引证图数据集正式发布,该数据集覆盖了从1947年科孚海峡案至2026年间法院几乎全部199个案件的2407份公开裁决文件,并基于Sean Fobbe的CD-ICJ语料库与官方网页抓取数据构建。每个文档被解析为结构化文本,切分为超过12万条语义段落并预计算嵌入向量,同时链接至所属案件、所引用的先前判例、援引的条约条款及审理法官信息。该数据集的发布为国际法计量分析、判例演化追踪及司法决策预测研究提供了首个系统化的图数据结构基础,显著推动了计算法学领域的发展。
当前挑战
该数据集主要解决的核心领域挑战在于,传统国际法研究依赖于人工判例检索与定性分析,难以量化揭示跨案件、跨年代的引证模式与法条援引规律。ICJ引证图通过构建完整的判例引用网络和条款引用关系,使研究者能够从宏观拓扑结构上理解法院判例的影响力演化与法律规范的层级互动。在构建过程中,面临的首要挑战是历史文件的异构性与质量差异:1947年至2023年的部分文档依赖OCR提取,其中51份文档因封面退化导致文档类型无法识别;此外,部分牵涉多个国家的合议庭名称存在解析歧义,52名法官节点包含冗余角色后缀信息。另一个显著挑战是时效性维护,数据集虽包含截至2026年的最新裁决,但第2号案件因源网站长期服务器错误而缺失,同时书面诉状与口头听证记录层尚未预计算嵌入向量,需使用者自行引入嵌入模型进行扩展,这增加了跨层语义检索的复杂度。
常用场景
经典使用场景
在国际法院(ICJ)判决文本的语义检索与引用网络分析中,该数据集以超过12万段预嵌入文本和6千余条判例引用关系为核心,构建了涵盖199个案件、2407份判决书的结构化知识图谱。研究人员可直接利用其预计算的高维向量进行相似度匹配,或通过Neo4j图数据库执行复杂关联查询,例如追踪某一判例在数十年间被后续案件援引的脉络,亦可结合条约条款与法官组成信息展开多维交叉分析。这种开箱即用的设计显著降低了法律信息学研究的准入门槛。
实际应用
在实际应用中,该数据集可服务于法律科技领域的多项核心任务:国际法研究人员能够快速检索与当前争议最相关的历史判例及其援引条款,从而辅助起草法律文书;国际仲裁机构可基于引用频率和语义相似性构建判例推荐系统,提升案件审理效率;法律援助组织通过分析不同国家作为当事方的出庭模式,能够识别国际司法实践中的结构性偏见。此外,知识图谱的结构化特性使其易于集成到法律知识管理平台,支持自动化文档分类、判例摘要生成以及跨语言法律推理等高级功能。
衍生相关工作
该数据集衍生出的经典工作主要集中在三个方向:在引用网络分析领域,研究者据此绘制了一张ICJ判例影响力的时空演化图谱,揭示了如尼加拉瓜案(Case 070)等里程碑判决的辐射路径;在语义嵌入评估方面,有工作将预计算向量与法律特定语言模型对比,验证了通用嵌入在国际法文本检索中的有效性;在知识图谱补全任务中,后续工作利用图神经网络预测了缺失的文档-条款关联,将覆盖率提升了12%。这些衍生研究共同推动了计算法学从简单数据堆砌向智能推理的范式转型。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务