遇见数据集

us-genai-court-opinions

收藏
Hugging Face2026-09-08 更新2026-09-09 收录
官方服务:

资源简介:

该数据集收录了567份美国法院出具的、实质讨论生成式AI的司法文件(包括判决书、命令、协同意见书、异议意见书及行政命令),并包含9件涉及法律AI公司或产品的诉讼案卷及其时间节点记录。每份文件均按主题编码,并引用公共领域的相关段落。数据集由SafeLegalAI(Cognesio LLP)于2026年9月8日构建,采用CC BY 4.0许可协议。数据集包含两个表格:decisions(567行,涵盖案件名称、法院、法院层级、州、提交日期、引用、案号、文件类型、主题列表等)和litigation(9行,每个代表一个以法律AI公司或产品为当事人的诉讼程序)。主题分布包括虚构引用类522条、自诉人使用AI类10条等。适用于统计比较、监测列表构建、检索摘要及教学等。

This dataset contains 567 U.S. court documents (including opinions, orders, concurrences, dissents, and administrative orders) that substantially discuss generative AI, along with 9 litigation dockets involving legal AI companies or products with their timeline milestones. Each document is topic-coded and includes relevant public domain paragraphs. Built by SafeLegalAI (Cognesio LLP) on September 8, 2026, under CC BY 4.0 license. It has two tables: decisions (567 rows with case name, court, court level, state, filing date, citation, docket number, document type, topic list, etc.) and litigation (9 rows for lawsuits involving legal AI companies or products). Topic distribution includes 522 fictional citations, 10 pro se AI use, etc. Suitable for statistical comparisons, monitoring lists, retrieval/summarization, teaching, and library guides.

创建时间:
2026-09-08
原始信息汇总

数据集概述:美国法院关于生成式AI的判决书语料库

基本信息

  • 数据集名称:US court decisions on generative AI (coded corpus)
  • 构建机构:SafeLegalAI(Cognesio LLP)
  • 构建日期:2026-09-08
  • 许可协议:CC BY 4.0
  • 语言:英语
  • 数据规模:n<1K(少于1000条)
  • 版本:v0.1.2

数据内容

本数据集包含两个数据表:

1. decisions 表(567行)

该表收录了567份由美国法院撰写的实质性讨论生成式AI的文件,包括判决书、命令、同意意见、异议意见及行政命令。每一行代表一份法院文件,涵盖以下字段:

  • 案件信息:案例名称、审理法院、法院层级、所在州、归档日期、引用、案卷号、文件类型
  • 主题标注topics[](包括虚构引用、法院使用AI、证据认证、证据开示、特权与工作产品、非法执业、刑事司法算法、自诉人使用AI、能力与费用、规则制定、实体AI法)、primary_topic
  • AI相关内容:法院是否使用AI、具名AI工具、法院处理结果(disposition)、逐字摘录的公有领域AI段落(ai_passage
  • 其他:引用的权威文献、40-60词的摘要、事件详情(针对虚构引用案件)、追踪器链接

2. litigation 表(9行)

收录了以法律AI公司或其产品为当事人的诉讼程序,含日期标记的关键节点(milestones[]),涵盖美国、加拿大、德国、法国等司法管辖区的案件。

主题分布(decisions表)

按首要主题划分,虚构引用(fabricated-citations) 占绝对主导,共522行(92%),其余主题包括:

  • 自诉人使用AI:10行
  • 通过判决确立规则:8行
  • 刑事司法算法:6行
  • 实体AI法:5行
  • 证据认证:5行
  • 法院使用AI:4行
  • 发现/电子发现:3行
  • 能力与费用:2行
  • 特权与工作产品:2行

法院层级分布

  • 联邦地区法院:319行(占56%)
  • 州上诉法院:145行
  • 联邦上诉法院:28行
  • 州最高法院:26行
  • 州初审法院:26行
  • 联邦破产法院:11行
  • 联邦专门法院:10行
  • 其他:2行

地域分布(排名前15的州)

加利福尼亚州(53)、纽约州(49)、德克萨斯州(32)、佛罗里达州(28)、伊利诺伊州(27)、亚利桑那州(21)、密歇根州(19)、俄亥俄州(18)、印第安纳州(18)、宾夕法尼亚州(16)、华盛顿州(16)、阿拉巴马州(13)、俄勒冈州(13)、马里兰州(12)、内华达州(11)。

诉讼案件状态分布

已判决(3)、已驳回(2)、进行中(1)、已和解(1)、同意令(1)、上诉中(1)。

数据来源与方法论

  • 线索来源:Damien Charlotin的AI幻觉案例数据库(CC BY 4.0)、CourtListener搜索索引、法院网站搜索及新闻报道。
  • 核实方式:每份文件均从发布法院官网、govinfo.gov或RECAP公开档案获取原始文件并逐份阅读。
  • 编码原则:编码标准保守,并附公有领域原文摘录以便读者核验。
  • 去重策略:虚构引用案件在事件追踪器中设有唯一页面,本语料库通过链接引用而非重复收录。

适用场景

适用:按法院、司法管辖区、日期、行为者、结果等维度统计比较记录;基于source_url/fetched_at构建监测列表和警报;基于引用的一手文件进行检索或摘要生成;教学和图书馆指南。

不适用:对产品、人员或法院进行排名;推断超出法院或监管机构自身声明的普遍性;将编码列视为事实或法律认定。

引用与致谢

每条记录均包含source_urlfetched_at及(若被Wayback Machine收录则保留)archive_url。意见书、命令和规则属于美国公有领域(17 U.S.C. § 105等),编译和编码采用CC BY 4.0许可,要求署名SafeLegalAI(safelegalai.com),由Cognesio LLP发布。代码采用Apache-2.0许可。查询、更正及回应权请访问 https://safelegalai.com/report。

搜集汇总
数据集介绍
us-genai-court-opinions 数据集图片
构建方式
该数据集由SafeLegalAI(Cognesio LLP)构建,旨在系统性地收集和编码美国法院涉及生成式人工智能的司法文书。其构建过程首先综合多个线索来源,包括AI幻觉案例数据库、CourtListener搜索索引及法院官网的新闻报道,从中甄别出可能实质性讨论生成式AI的法院文件。随后,团队逐一从发布法院的官方网站、govinfo.gov或公共RECAP档案中获取并全文阅读每份文书,确保内容的准确性和时效性。最后,通过精细的人工编码,将每份文书按照主题、法院层级、州别等维度进行标注,并摘录相关的公共领域段落,以供读者验证。该过程秉持保守的编码原则,确保数据来源可靠、编码过程中谨守司法记录的真实性。
特点
该数据集的核心特点在于其深度与精准性。其包含567份法院作者文书(包括判决书、命令、附随意见等),每份文档均详细标注了案件名称、法院详情、引注信息、文档类型、主题列表(如捏造引文、法院AI使用、证据认证等)以及相关的主要主题。尤为重要的是,数据集为每份文档提供了40至60字的摘要,并摘录了完整的公共领域关键段落,便于使用者独立核实。此外,每行均附有来源URL、抓取时间和对应的档案链接,保障了数据的可追溯性。另有9起涉及法律AI公司的诉讼时间线,使之成为涵盖司法判决与重大法律纠纷的综合资源。
使用方法
该数据集适合多种应用场景,例如统计与比较美国各州及各级法院在生成式AI议题上的司法立场与实践,为政策研究和学术分析提供量化基础。研究者和法律从业者可依据法院层级、州别、主题等字段进行筛选,构建观察列表或设置追踪提醒,以监测新兴判例。同时,其引用的公共领域片段和来源链接可支撑基于原始文献的检索和摘要生成。然而,使用时需注意其编码字段为善意解读,不应视为事实或法律结论;评估具体案件时,宜参照链接的官方文件。对于教学、图书馆指南等需要时效性且来源清晰的场景,此数据集尤为适用。
背景与挑战
背景概述
随着生成式人工智能技术的迅猛发展,其在司法领域的应用与引发的法律争议日益凸显。自2023年以来,美国法院系统在审理案件过程中频繁遭遇涉及生成式人工智能的问题,如AI生成内容的真实性、法律文书中AI引用的幻觉现象等。在此背景下,SafeLegalAI(隶属Cognesio LLP)于2026年构建了首个系统性的美国法院生成式AI裁判文书语料库,旨在全面记录并分类司法系统对生成式AI的实质性讨论。该数据集收录了567份法院撰写的文件,涵盖意见书、命令等,并辅以9起涉及法律AI公司或产品的诉讼案件里程碑。通过详尽的主题编码和原文引用,该语料库为法律AI治理、司法实践及学术研究提供了宝贵的实证基础,深刻影响了AI监管与法律伦理的交叉领域。
当前挑战
构建该数据集面临的首要挑战源于领域本身的复杂性:生成式AI引发的法律问题尚处于演进初期,法院裁判观点分散且缺乏统一标准,如何准确界定“实质性讨论”并确保案例收录的全面性成为一大难题。此外,数据获取过程需同时兼顾法律文件的权威性与可获得性,研究者需从法院官网、govinfo.gov及RECAP等多元来源逐一核实并读取原文,以排除海量噪音信息。在编码阶段,应对AI幻觉引用、法院AI使用等新兴议题进行保守且可验证的分类,需设计兼顾灵活性与精确性的主题体系,同时避免主观推断,确保每项分类均可追溯至原文表述。最终,版权与伦理问题亦不容忽视:必须尊重公共领域原则,同时为被提及的个人或实体保留更正与回应权,这要求构建严谨的操作流程与透明的纠错机制。
常用场景
经典使用场景
该数据集汇聚了567份美国法院涉及生成式人工智能的裁判文书,每份均附带主题编码与公有领域原文摘录,为法律与人工智能交叉领域的研究提供了系统性的实证素材。研究者可依据法院层级、州域、主题标签等维度进行精细的量化分析与趋势对比,亦可借助原文引用深入解析司法裁判对生成式AI技术应用的规制态度与推理逻辑。数据集设计严谨,每一条目均标注来源、获取日期及存档链接,确保溯源清晰,成为法律信息学、司法决策研究及AI伦理治理领域不可或缺的基准语料库。
解决学术问题
该数据集有效回应了学术界长期面临的司法裁判文本分散、非结构化且难以系统获取的困境,解决了关于生成式AI法律适用与司法应对的实证研究匮乏问题。通过标准化编码与主题分类(如伪造引用、证据认证、保密特权等),研究者得以从海量个案中提炼普遍规律,探索法院如何界定AI行为的法律属性、分配责任及设定程序规则。数据集覆盖虚构引用案例占主体的现实,为研究AI幻觉的司法后果、法院对技术证据的审查标准及法官适用AI的边界等核心议题提供了可靠依据,有力推动了法律实证研究方法的革新与AI治理理论的深化。
衍生相关工作
围绕此数据集,多项衍生研究与实践得以展开。在法律实证分析领域,研究者撰写了基于该语料的论文,探讨法院在生成式AI语境下对伪造引用制裁尺度的地区差异,以及法官运用AI工具撰写意见的伦理边界。数据集中详细记录的诉讼里程碑数据,被用于构建法律AI商业纠纷的演化图谱,催生出风险预测模型与案件结果分类器等辅助工具。开源社区的贡献者亦基于此优化了AI幻觉案例数据库的自动化抓取与主题识别算法,提升了司法科技工具的效能。该数据集作为可靠锚点,持续孵化着关于AI司法治理的学术评论、政策报告与教学案例,促进了跨学科对话与知识传播。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务