遇见数据集

somosnlp/Reglamento_Aeronautico_Colombiano_2024

收藏
Hugging Face2024-04-24 更新2024-04-19 收录
官方服务:

资源简介:

该数据集包含来自哥伦比亚航空法规(RAC)的标注样本,涵盖了其所有章节。经过细致的标注和整理,数据集已达到100%的进度,相当于总共25,174个整理好的样本,可供使用。数据集设计用于文本生成和问答系统,以促进对哥伦比亚航空法规的导航和理解。它包括以下列:rac(法规文本)、pagina(页码)、pregunta(问题)和respuesta(答案)。数据集以Gemma格式提供,并优化用于语言模型的训练。数据集是通过自动化过程创建的,涉及PDF到文本的转换以及通过GPT API或类似的开源模型进行处理。使用Hugging Face环境中的Argilla框架进行整理,确保高质量的标注。数据集在Apache-2.0许可下分发,适用于与航空航天领域相关的NLP应用。

This dataset contains annotated samples sourced from the Colombian Aviation Regulations (RAC), covering all its chapters. After meticulous annotation and curation, the dataset has reached 100% completion, with a total of 25,174 curated samples available for use. It is designed for text generation and question answering systems to facilitate navigation and comprehension of the Colombian Aviation Regulations. The dataset includes the following columns: rac (regulatory text), pagina (page number), pregunta (question), and respuesta (answer). Provided in Gemma format and optimized for language model training, it was created through an automated pipeline involving PDF-to-text conversion and processing via GPT API or comparable open-source models. The dataset was curated using the Argilla framework within the Hugging Face environment to ensure high-quality annotations, and is distributed under the Apache-2.0 license, suitable for NLP applications related to the aerospace domain.

提供机构:
somosnlp
原始信息汇总

数据集概述

数据集基本信息

  • 名称: RAC Corpus: Base de Datos del Reglamento Aeronáutico Colombiano
  • 语言: 西班牙语 (es-CO)
  • 许可证: Apache-2.0
  • 大小类别: 10K<n<100K
  • 标签: legal, Aerospace, Aeronautics

数据集内容

  • 特征:
    • rac (字符串): 法规文本。
    • pagina (字符串): 文本页码。
    • pregunta (字符串): 关于内容的问题。
    • respuesta (字符串): 提出的问题的答案。
  • 分割:
    • 训练集: 24,479个样本,大小为6,692,842字节。
  • 下载大小: 1,844,154字节
  • 数据集大小: 6,692,842字节

数据集来源

数据集版本与格式

  • 格式: Gemma,优化用于语言模型的训练。

数据集使用

  • 直接使用: 设计用于文本生成和问答系统,以促进对哥伦比亚航空法规的理解和导航。
  • 超出范围的使用: 在没有专家监督的情况下,可能不适合需要精确法律解释的应用。

数据集结构

  • 总计: 25,174个样本
  • 结构: 包含rac, pagina, pregunta, respuesta四个字段。

数据集创建

  • 创建过程: 通过自动化过程从RAC创建,包括将PDF文件转换为文本,并通过GPT API或类似的开源模型处理,以两页为单位迭代提取数据。

数据集标注理由

  • 标注: 使用Argilla框架在Hugging Face环境中进行结构化标注,由Fundación Universitaria Los Libertadores的航空工程专家评估样本质量。

偏差、风险和限制

  • 潜在偏差: 可能包含航空领域官方文件中使用的正式语言的固有偏差。建议谨慎推广基于此数据集的结果。

许可证

  • 许可证: 本数据集根据Apache-2.0许可证分发,允许广泛使用和修改,限制较少。
搜集汇总
数据集介绍
somosnlp/Reglamento_Aeronautico_Colombiano_2024 数据集图片
构建方式
该数据集的构建源于对哥伦比亚航空法规(RAC)PDF文档的系统性转化。首先,通过自动化工具将PDF文件批量转换为纯文本,随后利用GPT API或类似开源大语言模型,以每次处理两页的方式迭代提取结构化信息。此过程循环生成包含法规原文、页码、相关提问及对应答案的四元组数据。最终,经由Argilla框架组织专家团队进行人工标注与质量筛选,由航空工程领域的专业评审员依据评分标准(保留评分高于3的样本)完成精细化的数据清洗与验证,形成了涵盖全部章节的完整语料库。
特点
该数据集具备鲜明的领域专业性与结构完整性。它全面覆盖哥伦比亚航空法规的全部章节,总计包含25,174条经过严格标注的高质量样本,每条记录均包含法规文本、页码、问题与答案四个维度,尤其适合构建基于检索增强生成(RAG)的问答系统。数据集以西班牙语(es-CO)呈现,并针对大语言模型训练进行了格式优化,提供了Gemma兼容版本。其独特的双阶段构建流程——自动化提取与专家人工审核——确保了数据在法律文本的准确性与语义理解的深度之间取得平衡。
使用方法
该数据集主要面向西班牙语法律文本的自动问答与文本生成场景。用户可直接加载HuggingFace平台上的数据集,利用其提供的训练/验证划分进行模型微调。建议基于预训练语言模型(如Gemma系列)构建问答管道,将数据集中的‘pregunta’字段作为输入,‘respuesta’字段作为目标输出。同时,数据集中的‘rac’与‘pagina’字段可用于实现上下文检索增强。需注意,该数据集不适用于需要精确法律裁决的场合,其输出应被视为辅助参考而非权威法律意见。
背景与挑战
背景概述
在航空法规领域,哥伦比亚民用航空法规(RAC)作为规范该国航空活动的核心法律文本,其复杂性与专业性长期构成从业人员与研究者获取精准信息的壁垒。为突破这一瓶颈,由哥伦比亚自由大学基金会主导,联合SomosNLP、HuggingFace及Argilla等机构,于2024年创建了Reglamento_Aeronautico_Colombiano_2024数据集。该数据集以西班牙语(es-CO)为语言载体,系统收录了RAC全部章节的24,479条标注样本,涵盖法规原文、页码、问答对等结构化字段,旨在通过自然语言处理技术提升航空法规的可访问性与理解效率。其研发过程依托Argilla框架进行精细标注与质量筛选,最终达成100%的标注完成率,为拉丁美洲航空法规的数字化与智能化研究奠定了重要数据基础。
当前挑战
该数据集面临的核心挑战集中于两大维度。其一,在领域问题层面,航空法规文本具有高度专业化与法律严谨性,其语言风格与术语体系对通用自然语言模型构成显著障碍,亟需构建能够精准解析法规语义、逻辑关联与隐含约束的专用模型,以支持诸如法规检索、合规性问答等下游任务。其二,在构建过程中,团队需应对从PDF源文档到结构化数据的复杂转换难题,包括多栏布局、表格与非连续文本的提取,以及通过GPT API或开源模型生成高质量问答对时的语义保真度控制。此外,借助Argilla平台进行人工标注时,需协调航空工程专家的专业知识与标注效率,确保每一样本经专家评分(阈值>3)筛选后方可纳入,这一流程对数据质量与团队协作提出了严苛要求。
常用场景
经典使用场景
在航空法规与自然语言处理交叉领域,Reglamento_Aeronautico_Colombiano_2024数据集为构建面向西班牙语法律文本的问答系统提供了典范性资源。该数据集完整覆盖哥伦比亚航空条例(RAC)全部章节,包含24,479条经过航空工程专家精细标注的样本,每条样本由法规原文、页码、基于内容生成的问题及对应答案四部分组成。其经典使用场景聚焦于训练和评估能够从冗长、结构复杂的航空法规中精准抽取信息并生成自然语言答案的模型,尤其适用于检索增强生成(RAG)范式下的法律文本理解任务,为专业领域的知识获取开辟了高效路径。
解决学术问题
该数据集直面了低资源语言(西班牙语)与高度专业化领域(航空法)交织下的学术研究困境。传统自然语言处理模型在应对蕴含大量术语、逻辑严密且具有法律约束力的航空法规时,往往因缺乏领域对齐的训练数据而表现欠佳。此数据集通过提供经过严格质量筛选(仅保留评分高于3的样本)的问答对,有效弥合了通用语言模型与专业法律文本之间的语义鸿沟。它为研究领域内少样本学习、跨领域迁移学习以及法律文本的语义解析提供了基准,推动了针对特定法规体系的智能信息检索与理解方法的理论发展。
衍生相关工作
围绕此数据集已催生一系列具有影响力的衍生工作。其中,研究团队基于此数据微调了Gemma-1.1-2b-it模型,发布了名为somosnlp/gemma-1.1-2b-it_ColombiaRAC的专用语言模型,该模型在RAC问答任务上展现出优异性能。此外,相关的Argilla标注空间与Colab笔记本公开了从PDF解析到数据标注的完整方法论,为其他法律领域(如税法、海事法)构建类似资源提供了可复现的技术框架。这些工作共同构建了一个从数据构建、模型训练到应用部署的完整生态系统,推动了法律NLP在航空领域的纵深发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务