遇见数据集

bva-decisions-structured-sample2019Present

收藏
Hugging Face2026-06-11 更新2026-06-12 收录
官方服务:

资源简介:

BVA结构化决定(2019–2025)是一个从美国退伍军人上诉委员会(BVA)公开决定中提取的结构化、问题级别记录的数据集,专为训练和评估退伍军人残疾裁决领域的法律人工智能模型而设计。数据集包含5600个BVA决定样本,在2019年至2025年七年间平衡分布(每年约800个),以确保对整个语料库的代表性。数据以CSV格式提供,每行代表一个决定,共23个字段,关键字段包括决定ID、原始来源URL、上诉问题、医学条件(规范化词汇表,共107种独特条件)、决定级别结果(如发回重审、驳回、批准等)、按问题划分的结果、推理原子、引用(法规)、证据类型、决定日期和法官信息等。数据集覆盖关键信息:约99%的行包含提取的问题和引用,约96%的行包含推理原子;结果分布包括发回重审、驳回、批准、重新审理和撤回等,并标注上诉制度(遗留制度、AMA或未知)。标签为银标签,由确定性提取引擎生成,基于LLM标注参考集评估,在2019年问题上的结果提取准确率约为96%,但未经过人工验证(非金标签)。每个数据行附带原始公共决定的来源链接以供验证。数据集适用于索赔结果预测、问题和引用提取、退伍军人法律领域的法律检索增强生成(RAG),以及BVA实践微调助手等任务。基于CC BY-NC 4.0许可发布,允许用于研究和非商业目的,需注明出处;原始决定文本属公共领域,但结构化注释层受此许可约束。

The BVA Structured Decisions (2019–2025) dataset is a structured, issue-level record extracted from publicly available decisions of the U.S. Board of Veterans Appeals (BVA), designed for training and evaluating legal AI models in the field of veterans disability adjudication. It contains 5,600 BVA decision samples, balanced across the seven years from 2019 to 2025 (approximately 800 per year) to ensure representativeness of the entire corpus. The data is provided in CSV format, with each row representing a decision and comprising 23 fields, including key fields such as decision ID, original source URL, appeal issues, medical conditions (normalized vocabulary with 107 unique conditions), decision-level outcomes (e.g., remand, denial, grant), issue-level outcomes, reasoning atoms, citations (statutes), evidence types, decision date, and judge information. The dataset covers critical information: about 99% of rows contain extracted issues and citations, and about 96% contain reasoning atoms; outcome distributions include remand, denial, grant, reconsideration, and withdrawal, with annotations for the appeal system (legacy, AMA, or unknown). The labels are silver labels generated by a deterministic extraction engine, evaluated against an LLM-annotated reference set with approximately 96% accuracy in outcome extraction for 2019 issues, but not manually verified (non-gold labels). Each data row includes a source link to the original public decision for independent verification. The dataset is intended for tasks such as claim outcome prediction, issue and citation extraction, legal retrieval-augmented generation (RAG) in veterans law, and fine-tuning assistants for BVA practice. It is released under the CC BY-NC 4.0 license, permitting use for research and non-commercial purposes with attribution; the original decision texts are in the public domain, but the structured annotation layer is subject to this license.

创建时间:
2026-06-09
原始信息汇总

数据集概述

数据集名称:BVA Structured Decisions (2019–2025)

数据集来源:美国退伍军人上诉委员会(BVA)在 va.gov 上公开发布的裁决。

许可协议:CC BY-NC 4.0(非商业用途),结构化注释部分受此许可约束;原始裁决文本属于公共领域。

语言:英语(en)

数据集大小:1,000 < 样本数 < 10,000(具体为 5,600 条裁决)

任务类别

  • 文本分类
  • 令牌分类
  • 文本检索
  • 问答

标签:法律、法律-NLP、退伍军人事务、残疾、BVA、结构化提取、行政法


核心内容

  • 时间跨度:2019 年至 2025 年,每年约 800 条裁决,共 5,600 条,年度分布均衡。
  • 数据格式:CSV 文件,每条裁决一行,共 23 列。
  • 覆盖范围:99% 的行包含提取的问题和引用,96% 的行包含推理原子。
  • 数据性质:标签为“银标”(引擎自动生成,经 LLM 参考基准验证,结果准确率约 96%),非人工认证的“金标”。

结果分布(裁决级别)

结果类型 数量
发回重审(remanded) 1,539
拒绝(denied) 1,103
批准(granted) 973
驳回(dismissed) 253
重新审理(reopened) 68
撤回(withdrawn) 3

上诉制度(Appeals Regime)

  • 遗留制度(legacy):1,083 条
  • 上诉现代化法案(AMA):60 条
  • 未知(unknown):1,762 条(从裁决文本中标记,而非按年份)

医疗条件(Conditions)

  • 总计:107 种不同的医疗条件。
  • 前十大高频条件:背部残疾(490)、膝盖残疾(438)、听力损失(341)、关节炎(302)、精神障碍(289)、PTSD(287)、周围神经病变(272)、睡眠呼吸暂停(212)、高血压(195)、足部残疾(177)。

数据列说明

列名 描述
doc_id BVA 引用/案卷号(两位数字前缀表示财政年度)
source_url 原始裁决在 va.gov 上的链接
schema 使用的提取模式(bva
issues 被上诉的问题(以管道符分隔)
conditions / conditions_raw / conditions_detailed / condition_other 规范条件令牌、原始措辞、侧边性/限定词、以及词汇外标记
outcomes 裁决级别的处理结果
outcome_by_issue 每个问题及其对应的结果(核心训练单元)
reasoning_by_issue 每个问题的推理原子(“为什么”)
reasoning_completeness full / partial / none —— 质量等级,用于选择干净数据
reasoning_unfillable 当源信件完全没有推理时标记为 True
regime / ama_docket 遗留制度 vs. 上诉现代化法案制度 + AMA 案卷标记
citations 法定/监管引用(38 U.S.C. / 38 C.F.R.),归一化并去重
evidence 引用的证据类型(VA 检查、私人意见、外行陈述等)
reasoning_atoms 规范推理结果(建立关联/未建立、疑点利益、协助义务等)
judge_dates 裁决日期 + 退伍军人法律法官信息
signals_extracted / matrix_cells_used / avg_route_score / char_length 提取遥测数据 + 原始长度

主要用途

  • 训练/评估用于索赔结果预测、问题和引用提取、退伍军人法律领域的法律 RAG、以及针对 BVA 实践的助手微调等模型。

质量与准确性说明

  • 准确率基准:约 96%(针对 2019 年问题的结果提取准确率,基于 LLM 参考基准)。
  • 高覆盖字段:问题、条件、结果、引用和推理原子(96-99% 的行已填充)。
  • 已知限制
    • none/partial 的推理行是可恢复的空白,非精心策划的空白。
    • regime 对于许多文本中不明确的行标记为 unknown
    • 条件提取遵循受控词汇表(107 个令牌),对于长尾情况使用 condition_other 标记。

出处、隐私与伦理

  • 来源:BVA 裁决是美国联邦记录,在 va.gov 上公开发布。底层文本属于公共领域;结构化层受许可协议保护。
  • PII 处理:已通过自动化 PII 门控(屏蔽 SSN/电话/邮箱/出生日期/地址)进行筛查,但可能仍包含法官姓名等地名等固有内容。
  • 声明:此为研究/机器学习数据,不构成法律建议。

访问与许可

  • 非商业使用:免费,需注明出处。
  • 商业使用/完整语料库:可单独获取(含商业许可),联系维护者。

引用方式

BVA Structured Decisions (2019–2025). Structured extraction of public Board of Veterans Appeals decisions. Derived from va.gov public records; structured layer © the maintainer, released under CC BY-NC 4.0.


更新日志

  • v1:5,600 条裁决,2019–2025 年平衡分布;23 列文档模式;银标标签(约 96% 基准准确率)。
搜集汇总
数据集介绍
bva-decisions-structured-sample2019Present 数据集图片
构建方式
该数据集源自美国退伍军人上诉委员会(BVA)公开发布于va.gov的裁决文书,通过确定性抽取引擎对每份裁决进行结构化解析,将其拆解为上诉议题、医疗状况、裁决结果、法律引证及推理过程等细粒度字段。样本规模为5600份裁决,按七年间(2019–2025)每年约800份的比例均衡采集,确保了时间维度上的代表性。标签为银标(机器生成),经与大型语言模型标注的参考集比对,裁决结果提取准确率约为96%,且每行均附有来源网址与完整性标志,便于用户自行验证与筛选。
特点
数据集的核心特色在于提供了议题级别的监督信号,通过“逐议题结果”与“逐议题推理”字段将每项上诉议题与其处置结论和理由直接关联,突破了传统文书级标签的限制。此外,推理完整性分级(完整/部分/无)、上诉制度标识(传统与现代现代化法案)以及107种规范化的医疗条件词汇表,为用户灵活选择高质量子集或进行制度间对比分析提供了便利。每行记录还携带抽取遥测数据,支持对抽取过程本身的可审计性。
使用方法
本数据集适用于多种法律自然语言处理任务,包括文本分类(如结果预测)、令牌分类(如条件与引证抽取)、信息检索及问答系统的训练与评估。用户可根据推理完整性字段筛选完整样本进行模型训练,或利用上诉制度字段分离不同制度下的数据以进行对比分析。对于高风险应用,建议通过每行附带的来源网址核对原始文书,以弥补银标可能存在的误差。非商业用途遵循CC BY-NC 4.0协议,商业使用及完整语料库需另行联系维护者获取授权。
背景与挑战
背景概述
美国退伍军人事务部(VA)的退伍军人上诉委员会(BVA)每年处理数以万计的伤残福利纠纷,其裁决文书蕴含丰富的法律与医学交叉信息。为提升此类争议解决的效率与透明度,该数据集于2025年由相关研究者创建,基于2019至2025年间公开发布于va.gov的BVA裁决,构建了一个包含5600份判决的结构化样本库。核心研究问题在于如何通过自然语言处理技术,从非结构化的法律文书中自动抽取出具体争议点、医疗条件、裁决结果及其推理路径,从而支持索赔结果预测、法律信息检索等下游任务。该数据集以问题级别的细粒度标注和跨年度均衡采样为特色,为行政法领域的人工智能模型训练提供了稀缺的基准资源,有望推动法律科技在退伍军人福利领域的应用与发展。
当前挑战
该数据集所解决的领域核心挑战在于:法律文书通常篇幅冗长、术语专业且论证链条复杂,传统方法难以实现从全文到单争议点及其裁决理由的自动对齐与结构化解析。构建过程中的主要挑战则包括:第一,标签为引擎生成的银级标注,虽经LLM基准验证达到约96%的结果提取准确率,但缺乏人工金标验证,存在潜在误差;第二,推理完整性存在分层(全/部分/无),部分判决文本本身缺乏明确理由陈述,导致标注覆盖不完全;第三,法案体制(Legacy与AMA)的区分在文中模糊不清,大量样本的体制标签缺失;第四,疾病术语需在受控词汇表(107种)与长尾多样表述之间平衡,自动映射可能产生偏差。
常用场景
经典使用场景
在法律自然语言处理领域,该数据集为研究者提供了精细的行政诉讼裁决分析资源。其核心价值在于将冗长的美国退伍军人上诉委员会裁决书,拆解为结构化的问题、结果、引用和法律推理单元,实现了从文档级标签到议题级标注的范式跃迁。经典使用场景涵盖文本分类、序列标注和检索式问答任务,尤其是针对退伍军人残疾裁定的裁判结果预测、争议问题抽取以及相关法规条文的自动提取,为法律文本的深度语义解析开辟了新的路径。
解决学术问题
该数据集精准回应了法律文本分析中长期存在的粒度不足与信号稀疏困境。传统上,法律裁决研究多停留于案件最终判决的分类,而此数据集通过提供每条上诉理由的独立处置结果与推理原子,使得学术研究能够深入探究裁决的内在逻辑与裁量权运用模式。它解决了从非结构化文本中可靠抽取法律推理链路、识别不同上诉体制(传统与现代化法案)下的审判差异,以及评估跨年度司法实践稳定性等关键学术问题,显著提升了行政诉讼人工智能研究的可复现性与结论纵深。
衍生相关工作
围绕该数据集,一系列具有影响力的经典工作应运而生。在信息抽取领域,它催生了面向行政法文本的推理原子抽取与标准化基准任务,推动了裁决论点图谱的自动构建。在语义检索方向,研究者基于其条件与引用字段,开发了针对退伍军人事务法律数据库的检索增强生成系统。此外,该数据集还支撑了跨时间维度的司法行为分析研究,通过对比2019至2025年的裁决模式,揭示了立法变迁如上诉现代化法案对审判倾向的实际影响,为法律实证分析提供了关键的量化工具。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务