遇见数据集

clairebarale/AsyLex

收藏
Hugging Face2023-10-18 更新2024-03-04 收录
官方服务:

资源简介:

AsyLex数据集包含1996年至2022年加拿大难民身份认定的59,112份文档,为研究人员和从业者提供了训练和评估法律研究和案例审查的NLP模型的重要材料。数据集包含两个主要部分:Case Covers和Main Text,分别包含案例的元信息和全文。数据集还提供了24种法律相关实体类型的标注和1,682份案例结果的标注。数据集的结构包括多个配置文件,每个文件包含不同的数据内容,如原始文档、句子、实体提取、案例结果等。数据集的使用仅限于研究目的,不得用于商业用途。

The AsyLex dataset contains 59,112 documents related to Canadian refugee status determinations spanning from 1996 to 2022, serving as a critical resource for researchers and practitioners to train and evaluate NLP models for legal research and case review. The dataset comprises two core components: Case Covers and Main Text, which respectively hold the metadata and full text of each case. It also provides annotations for 24 legal-related entity types and labels for 1,682 case outcomes. The dataset is structured with multiple configuration files, each containing distinct data contents such as original documents, sentence segments, entity extractions, and case outcomes. Usage of the dataset is restricted solely for research purposes, and commercial use is prohibited.

提供机构:
clairebarale
原始信息汇总

数据集概述

基本信息

  • 名称: AsyLex
  • 语言: 英语
  • 许可证: CC BY-NC-SA 4.0
  • 多语言性: 单语种
  • 大小类别: 1M<n<10M
  • 标签: 法律NLP, 难民法
  • 任务类别: 文本分类, 标记分类, 文本检索
  • 任务ID: 多标签分类, 命名实体识别, 文档检索, 话语检索

数据集详情

  • 包含文档数量: 59,112份
  • 时间范围: 1996年至2022年
  • 来源: 加拿大法律信息研究所(CanLII)
  • 标注: 24种法律相关实体类型的人工标注,以及1,682份案件结果的黄金标准标注

数据集结构

  • 配置:
    • raw_documents: 包含所有文档的原始文本,按案件分类,带有相应的案件标识符。
    • raw_sentences: 包含所有检索文档的原始文本,按句子分割,带有相应的案件标识符。
    • all_legal_entities: 包含结构化数据集,所有提取的实体(每种实体类型一列),带有相应的案件标识符。
    • casecover_legal_entities: 仅包含案件封面衍生的结构化数据集(每种实体类型一列),带有相应的案件标识符。
    • casecover_entities_outcome: 与上述相同,但增加了案件的决定结果。
    • determination_sentences: 包含所有已提取的带有“determination”实体类型的句子。所有这些句子应直接陈述决定的结果,带有相应的案件标识符。
    • outcome_classification: 包含用于结果分类任务的训练和测试集。每个集包括案件标识符和决定结果(0,1,2)。测试集仅包含人工标注的黄金标准数据。

使用限制

  • 许可: 仅用于研究目的,不得用于商业用途。

个人和敏感信息

  • 所有文档均已匿名化。
搜集汇总
数据集介绍
clairebarale/AsyLex 数据集图片
构建方式
AsyLex数据集聚焦于加拿大难民身份认定领域,收录了1996年至2022年间共计59,112份司法裁决文档。其构建过程严谨而系统,首先从加拿大法律信息研究所(CanLII)的在线服务平台采集原始案例文本,随后对全部文档进行匿名化处理以保护隐私。在此基础上,数据集分别以原始文档和按句子切分的形式存储,并借助法律专家的专业知识,对24种法律相关实体类型进行了高质量的人工标注,同时为案件结果提供了1,682份金标准标签。数据被划分为案例封面(包含半结构化元信息)与主文本(案件完整正文)两大集合,最终形成多配置的标准化结构。
使用方法
使用AsyLex数据集时,可通过HuggingFace的datasets库便捷加载,只需调用load_dataset函数并指定配置名称即可获取对应子集。例如,加载结果分类数据可使用load_dataset("clairebarale/AsyLex", "outcome_classification"),而原始文档则对应raw_documents配置。数据集遵循cc-by-nc-sa-4.0许可协议,仅限于非商业研究用途。用户可根据研究目标选择不同配置:实体抽取任务可选用all_legal_entities或casecover_legal_entities,法律判决预测则优先使用outcome_classification中的金标准测试集。所有文件均包含案件标识符,便于跨配置关联分析。
背景与挑战
背景概述
AsyLex数据集由Claire Barale等研究人员于2023年构建,隶属于爱丁堡大学与加拿大法律信息研究所(CanLII)的合作项目,旨在推动自然语言处理(NLP)在难民法律领域的应用。该数据集收录了1996年至2022年间加拿大难民身份判定相关的59,112份法律文档,涵盖半结构化的案件封面与完整判决正文。其核心研究问题聚焦于法律实体提取与判决结果预测两大任务,通过法律专家标注的24类实体类型及1,682份黄金标准判决结果,为法律NLP研究提供了稀缺的高质量资源。作为首个大规模、多任务标注的难民法律数据集,AsyLex显著提升了法律文本分析的自动化水平,对辅助法律从业者进行案例审查、减轻司法负担具有开创性意义。
当前挑战
AsyLex所解决的领域挑战在于法律文本的复杂性与领域特异性:法律文书包含大量专业术语、嵌套实体及隐含逻辑关系,传统NLP模型难以准确提取关键信息(如‘determination’实体)并预测判决结果。此外,构建过程中面临多重困难:首先,原始文档需从CanLII在线服务爬取,涉及异构格式与海量数据的清洗与脱敏;其次,法律专家需耗时手工标注24类实体,且判决结果需区分‘驳回’、‘批准’与‘不确定’三类标签,标注一致性难以保证;最后,数据集需平衡隐私保护(如匿名化处理)与信息完整性,确保研究伦理合规。这些挑战共同制约了法律NLP模型的泛化能力与实用性。
常用场景
经典使用场景
AsyLex数据集在自然语言处理与法律智能交叉领域开辟了独特的应用范式,其核心经典使用场景聚焦于难民身份认定裁决的自动化分析。该数据集收录了加拿大1996年至2022年间59112份难民身份认定法律文书,涵盖案件封面与完整判决正文两种结构形态,为法律文本挖掘提供了兼具规模与深度的语料资源。研究者可借助该数据集开展法律实体提取任务,精准识别24类经法律专家标注的法理相关实体,亦可进行判决结果预测,基于金标准标注的1682份案例构建多分类模型,从而实现对难民申请结果(驳回、批准、不确定)的智能推断。这一场景将法律专业性与机器学习技术深度融合,为法律NLP领域提供了标准化的评估基准。
解决学术问题
该数据集系统性地回应了法律NLP研究中的两个核心学术难题:一是法律文本中专业实体识别的细粒度标注匮乏,二是难民法领域判决预测任务的高质量监督数据稀缺。通过引入法律专家参与标注的24类实体类型(如‘determination’等关键法理要素),AsyLex填补了非英语国家法律语料库中难民法专项数据的空白,为多标签分类、命名实体识别等任务提供了可复现的实验平台。同时,其提供的金标准判决结果标注使研究者得以探索法律推理的自动化边界,推动从规则驱动到数据驱动的司法决策研究范式转型,对理解法律语言中的语义歧义与裁判逻辑具有重要理论价值。
实际应用
在实际应用中,AsyLex数据集为法律从业者与公共政策制定者提供了智能辅助工具的开发基础。例如,基于该数据集训练的实体识别模型可自动从海量难民申请文书中提取案件关键要素(如申请人国籍、迫害形式、法律依据等),大幅降低人工审阅的时间成本;而判决结果预测系统则能帮助法律诊所或非政府组织初步评估案件胜诉概率,优化有限的法律援助资源配置。此外,该数据集的匿名化处理保障了隐私合规性,使其可安全部署于加拿大移民与难民委员会的案例管理平台,或集成至面向难民申请人的自助法律咨询系统中,提升司法可及性与程序效率。
数据集最近研究
最新研究方向
AsyLex数据集聚焦于难民法律领域的自然语言处理前沿研究,特别是加拿大难民身份认定文档的自动化分析。该数据集涵盖1996年至2022年间59,112份司法案例,为法律实体抽取和判决预测两大核心任务提供标注资源。当前研究热点集中于利用该数据集构建法律NLP流水线,例如通过24种法律相关实体的精细标注与1682份人工标注的判决结果,训练模型实现难民案件审理的智能辅助。这一方向与全球难民危机背景下对高效、公正的法律裁决需求紧密相连,其意义在于推动法律文本的语义理解与推理能力,为法律从业者提供可扩展的自动化工具,同时为司法透明度和可及性研究奠定数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务