遇见数据集

projecte-aina/MentorES

收藏
Hugging Face2024-05-30 更新2024-03-04 收录
官方服务:

资源简介:

Mentor_ES是一个包含10,175条西班牙语指令的开源数据集,这些指令按照InstructGPT论文中概述的多个行为类别进行组织,包括封闭问答、开放问答、一般问答、分类、信息提取、摘要、创意写作和头脑风暴。数据集的结构为JSON格式,每个记录对应一个指令跟随实例,包含类别、指令、上下文(如果可用)和响应。数据集由西班牙语母语者生成,上下文字段的文本来自网络,而响应字段则被重写。数据集可用于微调大型语言模型以执行下游任务。

Mentor_ES是一个包含10,175条西班牙语指令的开源数据集,这些指令按照InstructGPT论文中概述的多个行为类别进行组织,包括封闭问答、开放问答、一般问答、分类、信息提取、摘要、创意写作和头脑风暴。数据集的结构为JSON格式,每个记录对应一个指令跟随实例,包含类别、指令、上下文(如果可用)和响应。数据集由西班牙语母语者生成,上下文字段的文本来自网络,而响应字段则被重写。数据集可用于微调大型语言模型以执行下游任务。

提供机构:
projecte-aina
原始信息汇总

数据集概述

数据集名称

  • Mentor_ES

数据集大小

  • 1K<n<10K

语言

  • 西班牙语 (es-ES)

许可

  • CC BY 4.0

任务类别

  • 问答
  • 摘要
  • 文本生成

数据集结构

数据实例

  • 格式: JSON
  • 结构: 每个记录包含类别、指令、上下文(如有)和响应。

数据字段

  • category: 指令类型
  • instruction: 提示
  • context: 上下文信息
  • answer: 响应

数据分割

  • 未提供标准分割,仅根据生成数据集的类别进行分类。

数据集创建

来源数据

  • 人类生成数据: 注释者创建了八种不同指令类别的提示/响应对。
  • 网络: 对于需要参考文本的指令类别,贡献者从任何网站选择段落。

初始数据收集和规范化

  • 注释者根据简短的任务描述和格式规范创建数据。

注释者

  • 语言: 数据由西班牙语母语注释者生成。
  • 过程: 分为两组,一组收集参考文本并提问,另一组提供响应。

数据集用途

  • 用于微调大型语言模型以执行下游任务。

数据集创建者

  • 机构: 巴塞罗那超级计算中心(BSC)的语言技术部门。
  • 资助: 加泰罗尼亚政府数字政策和领土部门,项目AINA框架内。
搜集汇总
数据集介绍
projecte-aina/MentorES 数据集图片
构建方式
Mentor_ES数据集由巴塞罗那超级计算中心语言技术单元主导构建,旨在为西班牙语大语言模型提供指令微调资源。其构建灵感源自InstructGPT论文中的行为分类体系,涵盖封闭式问答、开放式问答、通用问答、分类、信息抽取、摘要生成、创意写作和头脑风暴八类任务。数据集通过人工标注方式生成:标注者被分为两组,一组负责从互联网搜集参考文本并设计指令,另一组则基于指令撰写回复。为确保数据质量,标注者被要求对直接取自网络的回答进行改写,并均衡分配话题与问题数量,最终形成10,175条高质量的西班牙语指令-回复对。
使用方法
该数据集主要用于西班牙语大语言模型的指令微调与下游任务适配。使用时可直接加载JSON格式文件,通过'category'字段筛选特定任务类型(如仅使用'closed_qa'数据训练问答能力),或利用'context'字段进行基于上下文的推理训练。对于摘要与信息抽取任务,需确保模型能正确处理上下文与回复的映射关系。建议将数据按类别划分训练集与验证集,以评估模型在不同行为维度上的表现。由于数据量适中,可结合数据增强或与其他西班牙语指令数据集(如Alpaca-ES)联合使用,以提升泛化能力。
背景与挑战
背景概述
Mentor_ES数据集由巴塞罗那超级计算中心(BSC)的语言技术团队于2023年创建,隶属于加泰罗尼亚政府资助的Aina项目,旨在推动西班牙语自然语言处理技术的发展。该数据集聚焦于指令微调这一核心研究问题,包含10,175条西班牙语指令,覆盖InstructGPT论文中定义的七类行为(如封闭问答、分类、摘要生成等)及额外的一般问答类别。其构建参考了Databricks Dolly数据集的结构,通过人工标注与网络文本结合的方式生成高质量指令-响应对,为西班牙语大语言模型在对话交互、信息提取和创造性写作等下游任务中的表现提供了关键基准。Mentor_ES的发布填补了西班牙语指令数据集的空白,促进了低资源语言大模型的研究与开发,对多语言AI生态的多样化具有重要影响。
当前挑战
Mentor_ES所解决的领域问题在于提升西班牙语大语言模型在指令遵循任务中的泛化能力,尤其是在对话交互、信息提取和分类等场景中的表现。然而,其构建过程面临多重挑战:首先,数据来源依赖人工标注和网络文本,标注者需严格遵循类别边界(如区分封闭问答与信息提取),但指南的简洁性可能导致标注不一致;其次,网络文本中的偏见、事实错误和主题偏倚可能被引入数据集,影响模型的公平性与可靠性;此外,标注者人口统计特征与主题分布的潜在偏差,可能限制数据集的代表性;最后,指令类别间的平衡性(如创造性写作仅475条)可能影响模型对少数类别的学习效果,需要后续扩展以增强多样性。
常用场景
经典使用场景
Mentor_ES数据集的核心应用场景在于为西班牙语大语言模型提供指令微调(instruction tuning)的优质资源。该数据集精心构建了涵盖封闭式问答、开放式问答、通用问答、分类、信息抽取、摘要生成、创意写作和头脑风暴等八大行为类别的10,175条指令-响应对,其设计灵感源自InstructGPT论文中的行为分类体系。研究者可利用该数据集对预训练语言模型进行监督式微调,使其掌握遵循多样化指令的能力,进而提升模型在西班牙语环境下的对话交互质量与任务执行精准度。
解决学术问题
在学术研究层面,Mentor_ES有效解决了西班牙语自然语言处理领域长期存在的指令微调数据集匮乏问题。此前,高质量的指令数据集多集中于英语,导致西班牙语大语言模型在理解复杂指令、执行多类型下游任务时表现欠佳。该数据集通过系统化的行为类别划分和人工标注的精准响应,为探究跨语言指令学习、多任务泛化能力以及模型对齐(alignment)等关键学术问题提供了标准化基准。其开放获取特性更促进了可重复性研究,推动了非英语语言大模型领域的发展。
实际应用
在实际应用场景中,Mentor_ES为构建西班牙语智能助手、自动问答系统、内容摘要工具和创意写作平台等产品提供了关键支撑。企业可利用该数据集微调模型,打造能够理解西班牙语用户复杂指令的客服机器人;新闻机构可训练模型自动生成西班牙语新闻摘要;教育领域则可开发智能辅导系统,实现西班牙语知识问答与分类任务。该数据集涵盖的头脑风暴与创意写作类别,还特别适用于辅助西班牙语内容创作和营销文案生成等商业场景。
数据集最近研究
最新研究方向
Mentor_ES数据集作为西班牙语指令微调资源,正推动低资源语言大模型在对话交互与多任务对齐上的前沿探索。该数据集涵盖InstructGPT论文中定义的八类行为任务,包括封闭式问答、开放式问答、分类、信息抽取、摘要生成、创意写作与头脑风暴,为西班牙语大模型提供了标准化、多样化的指令遵循训练样本。当前研究热点聚焦于如何利用此类高质量人工标注数据,缓解西班牙语大模型在指令理解与生成中的偏差问题,并探索其与多语言迁移学习、跨任务泛化能力的结合。随着Aina项目的推进,Mentor_ES在促进加泰罗尼亚语及西班牙语自然语言处理生态建设方面具有深远意义,为低资源语言的智能系统开发树立了可复现的基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务