遇见数据集

southeyc/legal_case_summary-500

收藏
Hugging Face2023-12-10 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: features: - name: text struct: - name: citation sequence: int64 - name: full_text sequence: string - name: juris sequence: string - name: summary sequence: string - name: year sequence: int64 splits: - name: train num_bytes: 677775520.0 num_examples: 80 - name: test num_bytes: 169443880.0 num_examples: 20 - name: train_ift num_bytes: 677775520.0 num_examples: 80 - name: test_ift num_bytes: 169443880.0 num_examples: 20 download_size: 845611594 dataset_size: 1694438800.0 configs: - config_name: default data_files: - split: train path: data/train-* - split: test path: data/test-* - split: train_ift path: data/train_ift-* - split: test_ift path: data/test_ift-* ---

数据集信息: 特征(features): - 名称:text 结构: - 名称:引用标识(citation),类型为64位整数序列 - 名称:完整文本(full_text),类型为字符串序列 - 名称:法域(juris),类型为字符串序列 - 名称:摘要(summary),类型为字符串序列 - 名称:年份(year),类型为64位整数序列 数据划分(splits): - 名称:训练集(train),字节占用:677775520.0,样本数量:80 - 名称:测试集(test),字节占用:169443880.0,样本数量:20 - 名称:train_ift,字节占用:677775520.0,样本数量:80 - 名称:test_ift,字节占用:169443880.0,样本数量:20 下载大小:845611594 总数据集大小:1694438800.0 配置项(configs): - 配置名称:默认配置(default) 数据文件: - 划分:训练集(train),路径:data/train-* - 划分:测试集(test),路径:data/test-* - 划分:train_ift,路径:data/train_ift-* - 划分:test_ift,路径:data/test_ift-*

提供机构:
southeyc
原始信息汇总

数据集概述

数据集特征

  • 名称: text
  • 结构:
    • citation: 序列类型为 int64
    • full_text: 序列类型为 string
    • juris: 序列类型为 string
    • summary: 序列类型为 string
    • year: 序列类型为 int64

数据集分割

  • train:
    • 字节数: 677775520.0
    • 样本数: 80
  • test:
    • 字节数: 169443880.0
    • 样本数: 20
  • train_ift:
    • 字节数: 677775520.0
    • 样本数: 80
  • test_ift:
    • 字节数: 169443880.0
    • 样本数: 20

数据集大小

  • 下载大小: 845611594
  • 数据集大小: 1694438800.0

配置

  • 配置名称: default
  • 数据文件:
    • train: data/train-*
    • test: data/test-*
    • train_ift: data/train_ift-*
    • test_ift: data/test_ift-*
搜集汇总
数据集介绍
southeyc/legal_case_summary-500 数据集图片
构建方式
在法律人工智能领域,高质量的案例摘要数据集对于推动文本摘要模型的发展至关重要。southeyc/legal_case_summary-500数据集通过系统性地收集法律案例文本构建而成,每条样本包含引用信息(citation)、完整文本(full_text)、司法管辖区(juris)、人工撰写的摘要(summary)及案例年份(year)五个字段。数据按照80条训练样本和20条测试样本的比例进行划分,同时额外提供了面向指令微调的train_ift与test_ift子集,为不同训练范式提供灵活支持。
特点
该数据集的核心特点在于其精炼的规模与丰富的结构化信息。尽管仅有500条样本,但每条案例均覆盖了从原始全文到专业摘要的完整映射关系,并标注了司法管辖区域与时间维度,便于进行跨域或时序分析。数据集同时保留了原始文本与指令微调版本,兼顾传统监督学习与当前主流的指令跟随模型训练需求,兼具实用性与研究灵活性。
使用方法
使用该数据集时,可通过HuggingFace Datasets库直接加载默认配置,自动获取train、test、train_ift及test_ift四个划分。对于文本摘要任务,可基于full_text与summary字段构建输入-输出对;对于指令微调场景,可直接使用train_ift和test_ift子集。数据格式为结构化字典,支持便捷的字段索引与批量处理,适用于序列到序列模型的训练与评估流程。
背景与挑战
背景概述
在法律人工智能领域,自动文本摘要技术正逐步成为提升司法效率的关键工具。southeyc/legal_case_summary-500数据集由研究团队于近期构建,旨在推动法律判决文书摘要生成任务的发展。该数据集收录了500份来自不同司法管辖区的案例文本,每份样本包含引用信息、完整判决文本、管辖区域、摘要及年份等结构化要素,为法律文本的深度分析与摘要模型训练提供了标准化资源。通过覆盖多司法管辖区和跨年份的案例,该数据集不仅支持了法律文本摘要的基准研究,还为探索法律语言在时间与地域维度上的演变规律奠定了基础,对促进法律文本自动化处理技术的实用化具有重要参考价值。
当前挑战
该数据集面临的核心挑战在于法律文本摘要生成任务的复杂性与构建过程的精细性。首先,法律判决文书通常篇幅冗长、术语专业且逻辑结构严谨,自动摘要模型需精准提取关键事实与法律推理,避免遗漏核心裁决依据或引入歧义,这对模型的语义理解与结构化归纳能力提出了极高要求。其次,构建过程中,数据采集需确保跨司法管辖区的法律文本格式与术语一致性,同时人工标注摘要需兼顾法律专业性与概括精简性,标注成本高昂且质量控制困难。此外,数据集规模仅500例,可能限制模型对多样化法律场景的泛化能力,如何在有限样本下实现高效训练与鲁棒推理是亟待解决的难题。
常用场景
经典使用场景
在法律人工智能领域,文本摘要技术一直是学术研究的热点与难点,而司法判决书摘要的自动生成更是其中极具挑战性的任务。southeyc/legal_case_summary-500数据集应运而生,它精选了500份结构完整的法律案例,每份案例均包含判决书原文与人工撰写的精炼摘要,为研究者提供了高质量的训练与评估素材。该数据集最经典的使用场景是训练和评测基于深度学习的法律文本摘要模型,例如用于微调预训练语言模型(如BERT、GPT系列等)以生成符合法律专业规范、逻辑严谨且信息浓缩的判决摘要,从而推动法律文本自动处理技术的发展。
衍生相关工作
围绕southeyc/legal_case_summary-500数据集,学术界已衍生出多项具有影响力的研究工作。其中,研究者利用该数据集微调了基于Transformer架构的序列到序列模型(如BART、Pegasus),并对比了不同预训练策略对法律摘要生成质量的影响;部分工作进一步引入了案例要素抽取与法律逻辑图构建等前置任务,形成了端到端的法律摘要生成流水线。此外,该数据集还催生了针对法律文本的对抗性评估基准与跨领域迁移学习研究,推动了法律人工智能从通用模型向领域特化模型的范式演进,为后续如判例摘要、法规注释等更细粒度任务的探索提供了方法论参考与数据支撑。
数据集最近研究
最新研究方向
在法律人工智能的前沿探索中,基于大规模司法文书自动生成案件摘要已成为提升司法效率与透明度的关键课题。southeyc/legal_case_summary-500数据集聚焦于美国司法判例,收录了包括判例引用、完整意见文本、管辖权信息及人工撰写的摘要等结构化内容,为长文本法律文档的抽象式摘要生成提供了高质量的基准资源。当前研究热点围绕利用预训练语言模型(如Legal-BERT、GPT系列)在法律领域进行指令微调,以增强模型对复杂法律逻辑与专业术语的理解能力。该数据集特别划分了用于指令微调的train_ift和test_ift子集,契合了近期大语言模型在少样本与零样本场景下法律文本摘要任务的研究浪潮,对于推动法律文本的自动化处理、辅助法官与律师快速把握案件核心具有重要的应用价值与学术意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务