遇见数据集

tax_court_opinions

收藏
Hugging Face2026-05-26 更新2026-05-27 收录
官方服务:

资源简介:

该数据集包含从1995年到2026年4月期间的美国税务法院意见书,总计14,789个文本文件。原始数据以PDF格式发布,并通过pdfminer工具转换为文本格式。数据集涵盖四种意见类型:reported(报告意见)、memo(备忘录意见)、summary(摘要意见)和bench(法庭意见)。文本文件的命名遵循特定格式:YYYY_MM_DD_意见类型_意见名称_页数_案卷号_法官.txt,其中意见名称被截断至100个字符并移除了某些特殊字符,页数基于原始PDF文件。数据经过了一系列文本格式化处理,包括移除所有换行符和分页符、将破折号转换为连字符、尝试修复行末连字符单词、标准化空格以及在法律节标记后调整空格。需要注意的是,2009年至2012年期间的PDF文件包含OCR识别的文本,其准确性低于其他年份。数据集附带一个简短的Python脚本,可用于搜索文本文件内容。该数据集适用于法律文本分析、信息检索、自然语言处理任务以及税务法律研究。

This dataset comprises 14,789 text files containing United States Tax Court opinions, covering the period from 1995 through April 2026. The original data was released in PDF format and converted to text format using the pdfminer tool. The dataset includes four types of opinions: Reported Opinions, Memorandum Opinions, Summary Opinions, and Bench Opinions. The text files follow a specific naming convention: YYYY_MM_DD_<opinion_type>_<opinion_name>_<page_count>_<docket_number>_<judge>.txt. The opinion name is truncated to 100 characters with certain special characters removed, and the page count is derived from the original PDF files. The text data has undergone a series of formatting processing steps, including removing all newline and page break characters, converting em dashes to hyphens, attempting to repair hyphenated words split at line ends, standardizing whitespace, and adjusting spacing following legal section markers. It should be noted that the PDF files from 2009 to 2012 contain OCR-scanned text, which has lower accuracy compared to other years. The dataset includes a concise Python script for searching the contents of the text files. This dataset is applicable to legal text analysis, information retrieval, natural language processing tasks, and tax law research.

创建时间:
2026-05-25
原始信息汇总

数据集概述

  • 数据集名称:Tax Court Opinions
  • 许可证:MIT
  • 数据规模:包含14,789个文本文件
  • 时间范围:约1995年至2026年4月
  • 数据来源:美国税务法院(U.S. Tax Court)发布的PDF意见书,通过pdfminer工具转换为文本文件

文件命名格式

文本文件的命名格式为:
YYYY_MM_DD_opiniontype_opinionname_numpages_docketnum_judge.txt

其中:

  • opiniontype:意见类型,包括 reported(报告)、memo(备忘录)、summary(摘要)、bench(法庭)
  • opinionname:意见名称,已截断至100个字符,并移除了某些特殊字符
  • numpages:基于原始PDF的页数

数据质量说明

  • 较旧的PDF文件包含由OCR生成的文本
  • 2009年至2012年期间的OCR结果准确度低于其他年份

文本预处理

已对文本进行以下格式化处理:

  • 移除所有换行符和换页符
  • 将长破折号和短破折号转换为连字符
  • 尝试移除行末连字符(用于断词)
  • 将多个连续空格替换为单个空格
  • 在节符号(§)后插入空格(如无空格)
  • 移除多个节符号(§§)之间的空格

附加工具

  • 提供了用于搜索文本文件的Python脚本,可从GitHub页面下载:https://github.com/InternationalTaxAttorney/tax_court_opinion_search
  • 也可通过pip安装该Python代码
搜集汇总
数据集介绍
tax_court_opinions 数据集图片
构建方式
该数据集汇集了自1995年至2026年4月间美国税务法院发布的14,789份意见书文本,原始资料以PDF格式存储于官方平台。通过采用pdfminer工具将PDF文件批量转换为纯文本,并针对早期文件中由OCR技术产生的文本误差进行了特殊说明,尤其指出2009至2012年间的识别精度相对较低。文件名遵循严格的命名规范,包含日期、意见类型、截断名称、页数、案卷号及法官姓名等要素,其中意见类型细分为已报告、备忘录、摘要和当庭裁决四种。
使用方法
数据集的便捷使用是其核心优势之一。用户可直接访问GitHub页面下载作者提供的短小Python脚本,该脚本专为高效搜索这些文本文件而设计;亦可通过pip命令安装Python代码包,实现更灵活的集成调用。无论是法律研究中的判例检索,还是自然语言处理领域的文档分析任务,研究者均能快速搭建起针对海量税务法院意见的文本挖掘管道。
背景与挑战
背景概述
税务法庭意见数据集(tax_court_opinions)由独立研究者于2026年构建,收录了美国税务法院自1995年至2026年4月期间发布的14,789份裁判意见文本。这些意见原以PDF格式公布于法院官方平台,涵盖报告、备忘录、摘要和审判席四种类型。数据集通过pdfminer工具将PDF文件转换为文本,并进行了系统的格式化处理,包括移除换行符、转换破折号、修正连字符、处理节符号等。该数据集为法律文本挖掘、司法判决预测、税务法律实证研究等领域提供了大规模、结构化的语料资源,尤其填补了税务领域公开裁判文书数据集的空白,为自然语言处理在法律场景中的应用奠定了重要基础。
当前挑战
该数据集面临的核心挑战包括:其一,原始PDF文件质量参差不齐,早期文件多依赖OCR技术识别,导致2009至2012年间的文本准确率显著低于其他年份,这为下游任务带来噪声干扰;其二,裁判意见中法定节符号的格式不一致增加了文本规范化难度,尽管进行了后处理,仍可能存在残留问题;其三,文件命名规则虽然结构化,但意见名称被截断至100字符且去除了特殊字符,可能导致部分案件信息的损失;其四,PDF页数与文本内容的对应关系可能因排版差异而存在偏差,影响细粒度分析。这些挑战要求在数据清洗与模型训练中采取针对性策略以提升数据质量。
常用场景
经典使用场景
税务法院意见数据集(tax_court_opinions)收集了自1995年至2026年间的14,789份美国税务法院裁决文书,涵盖reported、memo、summary和bench四种意见类型。该数据集最经典的使用场景在于法律文本挖掘与司法判决预测研究。研究者可借助自然语言处理技术,从这些结构化的法律文本中提取关键实体,如法官姓名、案号、判决日期与法律条款,进而构建税务法律领域的知识图谱。此外,该数据集也常被用于训练文本分类模型,以自动区分不同类型的税务争议焦点,或预测特定案件的可能判决结果,为税务法律智能化分析提供了宝贵的数据基础。
解决学术问题
该数据集有效解决了税务法律领域长期存在的结构化文本数据稀缺问题。在学术研究中,传统的法律判决分析多依赖于人工阅读和统计,效率低下且难以大规模开展。tax_court_opinions集成了近三十年税务法院的权威裁决文书,使研究者能够系统性地探索税务法律适用的演变趋势、法官判决风格的差异以及先例对后续判决的影响力。基于这些数据,学术工作得以实证检验法律推理中的决策一致性,量化分析不同时期税收政策对司法裁判的影响,并揭示法律语言中隐含的语义模式,从而推动计算法学与司法实证研究向纵深发展。
实际应用
在实际应用中,该数据集极大赋能了税务法律科技行业。律师事务所和税务咨询机构可借助该数据集开发智能法律检索系统,通过关键词匹配与语义搜索快速定位相关判例,显著提升案件研究效率。法律科技公司利用这些数据训练自动化合同审阅与税务合规风险分析模型,帮助企业在税务筹划中更精准地预判潜在法律风险。此外,政府部门与税法教育机构也利用该数据集构建教学案例库,用于模拟法庭训练与税法政策评估,使理论与实践紧密结合,推动税务司法实践的数字化与智能化转型。
数据集最近研究
最新研究方向
依托tax_court_opinions数据集,当前研究聚焦于税务司法领域的法律文本挖掘与人工智能辅助判决分析。该数据集涵盖了美国税务法院近三十年间的判例意见,为研究者提供了大规模、结构化的法律语料库,支撑起自然语言处理技术在法律信息检索、判例相似度计算与裁判预测模型构建中的前沿探索。在司法智能化与透明化趋势下,该数据集的价值尤为凸显,有助于推动法律大语言模型的开发,提升税务争议处理的效率与一致性,其影响力正从学术研究延伸至司法实务与公共政策制定。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务