遇见数据集

ai-evidence-in-court

收藏
Hugging Face2026-09-08 更新2026-09-09 收录
官方服务:

资源简介:

该数据集名为“法庭中的AI生成证据与深度伪造”(AI-generated evidence and deepfakes in court),由 SafeLegalAI(Cognesio LLP)于2026年9月8日构建,旨在系统记录全球法院对AI生成、AI篡改或AI“增强”证据以及深度伪造抗辩的裁定,并整理相关的规则、提案与指导文书。数据集包含两个子集:decisions(60条记录,每条代表一个关于AI生成/篡改证据或深度伪造挑战的法院裁定,字段包括证据类型、AI角色、提交方、挑战类型、裁定结果、引用规则、法院裁定引文、摘要等)和instruments(10条记录,每条代表一个关于AI生成证据的规则、提案、法规、法官指引或指导文书,字段包括状态、状态日期、状态引文、下一步事件、操作文本)。覆盖全球多个国家和地区(美国23例、加拿大14例、澳大利亚5例等)。所有记录均包含来源URL、抓取时间及互联网存档URL。数据集适用于按法院、司法管辖区等进行计数比较、构建监控列表、检索或摘要、教学和图书馆指南;不适用于对产品、人员或法院排名、推断流行程度、将编码列视为事实认定。许可:数据集采用CC BY 4.0,代码采用Apache-2.0。

This dataset, named AI-generated evidence and deepfakes in court, was constructed by SafeLegalAI (Cognesio LLP) on September 8, 2026, aiming to systematically record court rulings worldwide on AI-generated, AI-manipulated, or AI-enhanced evidence and deepfake defenses, as well as to organize relevant rules, proposals, and guidance documents. The dataset includes two subsets: decisions (60 records, each representing a court ruling on AI-generated/manipulated evidence or deepfake challenges, with fields such as evidence_type, ai_role, offered_by, challenge, ruling, rules_cited, court_finding_quote, summary, etc.) and instruments (10 records, each representing a rule, proposal, regulation, judicial guidance, or guidance document on AI-generated evidence, with fields including status, status_date, status_quote, next_event, operative_text). It covers multiple countries and regions globally (e.g., US 23, Canada 14, Australia 5, etc.). All records include source URLs, fetched timestamps, and Internet Archive URLs when available. The dataset is suitable for counting and comparing by court, jurisdiction, date, actor, outcome, status; building watchlists and alerts; retrieval or summarization; and teaching and library guides with dates and source lists. It is not suitable for ranking products, individuals, or courts; inferring prevalence beyond court or regulatory statements; or treating coded columns as factual or legal findings. Dataset licensed under CC BY 4.0, code under Apache-2.0.

创建时间:
2026-09-08
原始信息汇总

数据集概述

该数据集由 SafeLegalAI(Cognesio LLP)于 2026-09-08 构建,系统收录了全球范围内关于 AI 生成证据与深度伪造(deepfake)在法庭中应用的司法裁判与规则文本。

数据内容

数据集包含两个核心数据表:

  • decisions(裁判表):包含 60 条全球法院关于 AI 生成、篡改或“增强”证据,以及深度伪造抗辩或 AI 输出作为证据提交的裁判记录。每条记录对应一个针对 AI 相关证据的裁定。
  • instruments(规则表):包含 10 条关于 AI 生成证据的规则、提案、法规或指导意见,每条记录对应一个规范文本,并标注了其状态(含拟议的《联邦证据规则》第 707 条)。

关键维度与分布

**裁判记录(decisions)**按以下维度分类统计:

  • 按国家/地区:美国(23 条)最多,其次为加拿大(14 条)、澳大利亚(5 条),另有荷兰、印度、法国、意大利、以色列、英国等国家。
  • 按 AI 角色:已确认的 AI 输出(32 条)占主导,疑似深度伪造(15 条)、AI 生成后提交(5 条)等。
  • 按裁判结果:“无证明力”(22 条)和“采纳”(16 条)为主要结果,另有排除、裁定需认证、要求专家意见、制裁等情形。

**规则文本(instruments)**按以下维度分类统计:

  • 按状态:生效中(4 条)和已发布(4 条)为主,另有研究中(1 条)和未推进(1 条)。
  • 按类型:规则(2 条)、拟议规则(2 条)、法官指引卡(2 条)、指导意见(2 条)、调查(1 条)和法规(1 条)。
  • 按国家/地区:美国(7 条)居多,其余分布在加拿大、英国和印度。

数据字段与方法

每条裁判记录均标注证据类型、AI 角色、提出方、异议内容、裁判结果、援引规则、法院认定原文引用(不超过 25 词)、40–60 词摘要,以及敏感性和出版禁令检查标志。每条规则记录包含状态、状态日期、状态引用、后续事件及操作性文本。所有记录均提供来源网址、抓取时间和(如存档)归档链接。构建方法为人工阅读判决原文并编码,来源包括 Damien Charlotin 的数据库(CC BY 4.0)、联邦司法中心调查等,美国判决均取自法院官网或 RECAP 公共档案。

许可与用途

数据集采用 CC BY 4.0 许可,代码采用 Apache-2.0,构建与编码须标注 “SafeLegalAI (safelegalai.com), published by Cognesio LLP”。

该数据集适用于:按法院、司法辖区、日期、主体、结果或状态进行统计比较;基于来源链接构建监测列表和提醒;为检索或摘要提供引用原始文件的基础;以及需要带日期和来源清单的教学与图书馆指南。

不适用于:对产品、个人或法院进行排名;推断超出法院或监管机构自行声明的普遍性;或将编码列视为对事实或法律问题的认定。

引用信息

引用格式:SafeLegalAI (Cognesio LLP), "AI-generated evidence and deepfakes in court", v0.1.3, 2026-09-08. 规范页面:https://safelegalai.com/courts/evidence;镜像页面:https://huggingface.co/datasets/safelegalaidata/ai-evidence-in-court。

搜集汇总
数据集介绍
ai-evidence-in-court 数据集图片
构建方式
该数据集由SafeLegalAI(Cognesio LLP)于2026年9月8日构建,旨在系统梳理全球法院对AI生成证据及深度伪造挑战的司法实践。构建过程综合了Damien Charlotin的深度伪造与AI证据数据库(CC BY 4.0许可)、美国联邦司法中心2026年5月证据规则议程手册的调查报告、CourtListener检索以及新闻来源。每项美国判决均从法院官方网站或RECAP公共档案逐案审阅,而加拿大、澳大利亚及英国判决则由人工在CanLII、AustLII和Find Case Law上逐一阅读,仅提供链接而不复制原文。规则状态信息取自uscourts.gov的委员会材料及立法机构,并在每次委员会会议后复核更新。数据集以Parquet格式存储,包含两个配置:decisions和instruments,分别收录60项判决和10项规则,每个条目均附有来源URL、抓取时间和档案链接,确保可追溯性。
使用方法
该数据集适用于多种研究与实践场景。法律研究者可通过其按法院、司法辖区、日期、行为者及结果维度进行定量比较,如统计不同国家对AI证据的采信率或分析深度伪造辩护的成败趋势。从业者可利用source_url和fetched_at构建监控列表或警报系统,跟踪特定案件或规则的更新。数据集亦可作为检索增强生成的基础,基于引用的原始文件为法律问答提供依据。教学设计中,教师可运用该列表为学生提供时效性且有来源支撑的阅读材料。然而,其注释列系SafeLegalAI的善意解读,并非事实或法律裁定,故不宜用于产品排名、推断普遍性或将编码视为最终法律结论,使用者应始终查阅链接的官方文件作为权威依据。
背景与挑战
背景概述
在生成式人工智能技术迅猛发展的背景下,法庭证据的真伪性审查面临前所未有的挑战。由Cognesio LLP旗下的SafeLegalAI项目于2026年9月8日构建的'ai-evidence-in-court'数据集,系统性收录了全球60项涉及人工智能生成、篡改或增强证据的法院裁决,以及10项相关规则与指引文书。该数据集由Damien Charlotin等法律科技专家主导,旨在回应司法实践中对AI证据认定标准不一、裁判规则模糊等核心问题,其影响力体现在为法律界、政策制定者及研究者提供了首个跨法域的实证比较基础,并推动了如美国《联邦证据规则》第707条等规范讨论。
当前挑战
领域层面,生成式AI证据的易变性与司法证明的稳定性之间存在根本张力,现有证据规则难以适应算法生成物的真实性验证,如深度伪造常常突破传统鉴真程序。构建中,团队需跨越全球23个司法管辖区的法律语言与文化差异,确保案例编码的统一性与判词引用的准确性;同时,非美国判决的获取受限于公开渠道,需依赖CanLII、AustLII等平台人工逐案审读,并处理出版物限制引发的影响。此外,规则状态随立法进程动态变化,需在每次委员会会议后持续核查,以保证数据的时效性与可靠性。
常用场景
经典使用场景
该数据集聚焦于人工智能生成证据与深度伪造技术在法庭场景中的应用,收录了全球范围内60项法院裁决及10项规则、提案与指导性文件。其经典使用场景在于对AI相关证据的司法处理进行系统化梳理与比较分析,研究者可依据证据类型、AI角色、挑战方式及裁决结果等维度进行量化统计,亦可用于追踪不同司法辖区对AI证据采纳标准的演变趋势。该数据集为法律学者提供了一手资料索引,支撑对证据可采性、真实性认证等议题的实证研究,同时也为法官、律师及政策制定者提供了具有时效性的司法实践参考基准。
解决学术问题
该数据集直面生成式人工智能对传统证据规则带来的根本性挑战,解决了学术研究中长期缺乏系统性、跨法域实证数据的问题。它为证据法、科技法与司法程序交叉领域的研究提供了关键素材,使学者能够分析法院在面对AI生成或篡改证据时的裁判逻辑、所援引的法律规则及不同司法辖区的应对策略。通过结构化编码(如ruling、ai_role等字段),数据集支持对裁判结果与证据类型、AI介入方式等变量间关联的假设检验,从而填补了关于深度伪造证据认证标准、专家证言必要性等理论争议的实证空白,推动了该领域法学研究的科学化进程。
实际应用
在实际应用中,该数据集为司法系统、法律实务及政策制定提供了切实的支持工具。法院与仲裁机构可借助其系统化的案例汇编,快速检索类似案件中关于AI证据的裁判倾向,辅助法官在庭审中做出更为审慎一致的可采性判断。律师事务所与诉讼当事人可据此评估涉及深度伪造或AI生成材料的案件风险,制定更具针对性的举证与质证策略。监管机构与立法机关可依据案例分布与规则状态,识别法律框架中的空白与滞后之处,例如美国拟议的《联邦证据规则》707条,从而推动相关法规的修订与完善。此外,图书馆与法律教育机构将其用作教学指南,为法学院学生提供真实、来源可溯的深度伪造证据司法处理范例。
数据集最近研究
最新研究方向
生成式人工智能对司法证据规则的冲击已成为全球法律科技领域的焦点议题。ai-evidence-in-court数据集系统梳理了全球60起涉及AI生成、篡改或增强证据的法院裁决及10项规则与指引,涵盖美国拟议的《联邦证据规则》第707条等前沿动态。该数据集聚焦于证据真实性认证、算法输出可采性及深度伪造抗辩等核心争议,反映了司法系统面对技术革新时在证据审查标准上的适应性调整。其价值在于为证据法学者、司法从业者及政策制定者提供了跨国比较的实证基础,助力建构AI时代的证据治理框架,并对生成式AI的司法应用安全与伦理规范产生深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务