遇见数据集

saillab/taco-datasets

收藏
Hugging Face2023-12-01 更新2024-03-04 收录
官方服务:

资源简介:

该数据集包含用于TaCo论文的四个数据集:Multilingual Alpaca-52K GPT-4数据集、Multilingual Dolly-15K GPT-4数据集、TaCo数据集和Multilingual Vicuna Benchmark数据集。这些数据集通过Google Cloud Translation进行了翻译。TaCo数据集是通过结合Alpaca-52K和Dolly-15K数据集创建的。数据集支持多种语言,包括英语、尼泊尔语、梵语、迈蒂利语、波斯语、印地语等。数据集适用于学术和研究用途,并遵循CC BY-NC许可。

该数据集包含用于TaCo论文的四个数据集:Multilingual Alpaca-52K GPT-4数据集、Multilingual Dolly-15K GPT-4数据集、TaCo数据集和Multilingual Vicuna Benchmark数据集。这些数据集通过Google Cloud Translation进行了翻译。TaCo数据集是通过结合Alpaca-52K和Dolly-15K数据集创建的。数据集支持多种语言,包括英语、尼泊尔语、梵语、迈蒂利语、波斯语、印地语等。数据集适用于学术和研究用途,并遵循CC BY-NC许可。

提供机构:
saillab
原始信息汇总

数据集概述

语言支持

  • 数据集支持多种语言,包括但不限于:
    • 英语 (en)
    • 尼泊尔语 (ne)
    • 绍纳语 (sn)
    • 迈蒂利语 (mai)
    • 波斯语 (fa)
    • 印地语 (hi)
    • 阿非利卡语 (af)
    • 阿尔巴尼亚语 (sq)
    • 阿姆哈拉语 (am)
    • 阿拉伯语 (ar)
    • 亚美尼亚语 (hy)
    • 阿萨姆语 (as)
    • 艾马拉语 (ay)
    • 阿塞拜疆语 (az)
    • 班巴拉语 (bm)
    • 巴斯克语 (eu)
    • 白俄罗斯语 (be)
    • 孟加拉语 (bn)
    • 比哈尔语 (bh)
    • 波斯尼亚语 (bs)
    • 保加利亚语 (bg)
    • 加泰罗尼亚语 (ca)
    • 宿务语 (ceb)
    • 奇切瓦语 (ny)
    • 中文 (zh)
    • 科西嘉语 (co)
    • 克罗地亚语 (hr)
    • 捷克语 (cs)
    • 丹麦语 (da)
    • 迪维希语 (dv)
    • 多格拉语 (dog)
    • 荷兰语 (nl)
    • 世界语 (eo)
    • 爱沙尼亚语 (et)
    • 埃维语 (ee)
    • 塔加洛语 (tl)
    • 芬兰语 (fi)
    • 法语 (fr)
    • 弗里斯兰语 (fy)
    • 加利西亚语 (gl)
    • 格鲁吉亚语 (ka)
    • 德语 (de)
    • 希腊语 (el)
    • 瓜拉尼语 (gn)
    • 古吉拉特语 (gu)
    • 海地克里奥尔语 (ht)
    • 豪萨语 (ha)
    • 夏威夷语 (haw)
    • 希伯来语 (he)
    • 赫蒙语 (hmn)
    • 匈牙利语 (hu)
    • 冰岛语 (is)
    • 伊博语 (ig)
    • 伊洛卡诺语 (ilo)
    • 印度尼西亚语 (id)
    • 爱尔兰语 (ga)
    • 意大利语 (it)
    • 日语 (ja)
    • 爪哇语 (jv)
    • 卡纳达语 (kn)
    • 哈萨克语 (kk)
    • 高棉语 (km)
    • 卢旺达语 (rw)
    • 孔卡尼语 (kok)
    • 韩语 (ko)
    • 克里奥尔语 (kri)
    • 库尔德语 (ku)
    • 吉尔吉斯语 (ky)
    • 老挝语 (lo)
    • 拉丁语 (la)
    • 拉脱维亚语 (lv)
    • 林加拉语 (ln)
    • 立陶宛语 (lt)
    • 卢干达语 (lg)
    • 卢森堡语 (lb)
    • 马其顿语 (mk)
    • 马拉雅拉姆语 (ml)
    • 马耳他语 (mt)
    • 毛利语 (mi)
    • 马拉地语 (mr)
    • 梅泰语 (mni)
    • 马来语 (ms)
    • 马尔加什语 (mg)
    • 缅甸语 (my)
    • 挪威语 (no)
    • 奥里亚语 (or)
    • 奥罗莫语 (om)
    • 普什图语 (ps)
    • 波兰语 (pl)
    • 葡萄牙语 (pt)
    • 旁遮普语 (pa)
    • 罗马尼亚语 (ro)
    • 俄语 (ru)
    • 萨摩亚语 (sm)
    • 苏格兰盖尔语 (gd)
    • 塞尔维亚语 (sr)
    • 塞索托语 (st)
    • 塞茨瓦纳语 (tn)
    • 信德语 (sd)
    • 僧伽罗语 (si)
    • 斯洛伐克语 (sk)
    • 斯洛文尼亚语 (sl)
    • 索马里语 (so)
    • 西班牙语 (es)
    • 巽他语 (su)
    • 斯瓦希里语 (sw)
    • 瑞典语 (sv)
    • 塔吉克语 (tg)
    • 泰米尔语 (ta)
    • 鞑靼语 (tt)
    • 泰卢固语 (te)
    • 泰语 (th)
    • 提格利尼亚语 (ti)
    • 汤加语 (to)
    • 土耳其语 (tr)
    • 土库曼语 (tk)
    • 特威语 (tw)
    • 乌克兰语 (uk)
    • 乌尔都语 (ur)
    • 维吾尔语 (ug)
    • 乌兹别克语 (uz)
    • 越南语 (vi)
    • 威尔士语 (cy)
    • 科萨语 (xh)
    • 意第绪语 (yi)
    • 约鲁巴语 (yo)
    • 祖鲁语 (zu)

数据集组成

  • 数据集包含以下四个子数据集:
    • Multilingual Alpaca-52K GPT-4 dataset
    • Multilingual Dolly-15K GPT-4 dataset
    • TaCo dataset
    • Multilingual Vicuna Benchmark dataset

数据集创建

  • 前三个数据集通过Google Cloud Translation进行翻译。
  • TaCo数据集是通过结合Alpaca-52K和Dolly-15K数据集,采用TaCo方法创建的。

数据集大小

  • 数据集大小范围为100K到1M条记录。

模型权重

  • 已发布多个语言模型的适配器,包括:
    • Taco Nepali-33B
    • Taco Sanskrit-33B
    • Taco Maithili-33B
    • Taco Persian-33B

版权和使用

  • 数据集遵循CC BY-NC许可,仅限学术和研究用途。
  • 使用前请查看Alpaca-52K、Dolly-15K和Google Cloud Translation的许可和条款。
搜集汇总
数据集介绍
saillab/taco-datasets 数据集图片
构建方式
在跨语言自然语言处理领域,低资源语言的指令微调数据集匮乏是制约大型语言模型性能提升的关键瓶颈。TaCo数据集正是为应对这一挑战而构建,其核心思想源自TaCo论文中提出的翻译辅助链式思维方法。该数据集通过融合Alpaca-52K与Dolly-15K两个英文指令数据集,并借助谷歌云翻译服务将其扩展至涵盖尼泊尔语、梵语、迈蒂利语、波斯语等百余种语言的多语种版本。具体而言,数据集的每条样本包含翻译后的指令、输入以及输出,其中输出部分巧妙地将英文指令、英文回复与目标语言回复串联,为模型提供了跨语言对比学习的结构化信息。这种构建方式不仅保留了原始数据集中丰富的指令多样性,更通过翻译对齐实现了知识的高效迁移。
特点
TaCo数据集最显著的特点在于其卓越的多语言覆盖范围,横跨非洲、亚洲、欧洲及美洲的百余种语言,尤其关注尼泊尔语、梵语等低资源语言,填补了现有数据集在这些语种上的空白。其数据规模介于十万至百万级别,兼顾了训练效率与样本多样性。每条数据采用独特的嵌套式结构设计,将英文与目标语言信息有机整合,这种设计既保持了指令的原始语义,又通过双语对照强化了模型的跨语言理解能力。此外,数据集严格遵循CC BY-NC许可协议,明确限定于学术研究用途,确保了使用的合规性与伦理性。
使用方法
对于研究人员而言,TaCo数据集的使用路径清晰而灵活。用户可直接从HuggingFace平台加载预处理好的多语种版本,适用于指令微调、跨语言迁移学习等任务。若需针对特定语言进行定制,可参照论文方法,利用谷歌云翻译服务对Alpaca-52K和Dolly-15K的英文原版进行翻译,再通过TaCo方法合成新数据集。模型适配方面,项目已开源尼泊尔语、梵语等四种语言的33B参数规模适配器权重,用户可直接加载这些预训练权重进行下游任务微调。在应用该数据集时,务必注意遵守原始数据集及翻译服务的许可条款,确保仅用于非商业性的学术探索。
背景与挑战
背景概述
在低资源语言的自然语言处理领域,大型语言模型(LLM)的性能往往受限于高质量指令数据的匮乏。为突破这一瓶颈,Bibek Upadhayay与Vahid Behzadan于2023年提出了TaCo方法,并构建了saillab/taco-datasets数据集。该数据集由四位研究者在Sail实验室主导创建,核心研究问题在于如何通过翻译辅助的思维链(Chain-of-Thought)过程,增强LLM在低资源语言上的跨语言迁移能力。数据集融合了Alpaca-52K与Dolly-15K的GPT-4翻译版本,覆盖超过100种语言,涵盖尼泊尔语、梵语、迈蒂利语、波斯语等低资源语种,为跨语言指令微调提供了关键资源。其影响力体现在推动了多语言LLM的公平性研究,并为低资源语言社区提供了可复现的基线。
当前挑战
该数据集面临的核心挑战在于解决低资源语言领域指令数据稀缺的难题。一方面,现有模型如GPT-4在低资源语言上的表现常因训练数据不足而受限,导致翻译质量与语义保真度难以保障,尤其在语法结构迥异的语言(如梵语)中,思维链推理的准确性易受噪声干扰。另一方面,构建过程中需克服多语言翻译的规模化难题:依赖Google Cloud Translation虽能快速扩展语种覆盖,但自动翻译可能引入文化偏见或术语误译,且需严格遵循Alpaca-52K、Dolly-15K及翻译服务的许可条款。此外,数据集的跨语言一致性验证、指令与输出的对齐,以及低资源语言评估基准的缺失,均为后续研究提出了持续挑战。
常用场景
经典使用场景
在跨语言自然语言处理与低资源语言大语言模型微调领域,TACO数据集被广泛用于构建多语言指令微调数据。该数据集融合了Alpaca-52K与Dolly-15K的翻译版本,并通过翻译辅助链式思维(TaCo)方法生成高质量的多语言指令-输出对,尤其适用于尼泊尔语、梵语、迈蒂利语等资源匮乏的语言。研究人员常利用该数据集对预训练语言模型进行参数高效微调,以提升模型在低资源语言上的指令遵循与推理能力。
衍生相关工作
基于TACO数据集,研究者已发布了多个低资源语言的适配器模型,如Taco Nepali-33B与Taco Sanskrit-33B,这些工作验证了翻译辅助链式思维方法在跨语言迁移中的有效性。此外,该数据集所倡导的TaCo方法启发了后续关于数据增强与知识蒸馏的研究,推动了多语言指令微调数据集的自动构建范式。相关论文在Arxiv上公开后,已成为低资源语言大模型微调领域的重要参考基准。
数据集最近研究
最新研究方向
在低资源语言的大语言模型研究中,跨语言迁移能力与指令遵循的协同优化成为前沿焦点。TaCo数据集通过融合Alpaca-52K与Dolly-15K的多语言翻译版本,结合谷歌云翻译技术,构建了覆盖百余种语言的高质量指令微调资源。其核心创新在于翻译辅助的链式思维(Chain-of-Thought)过程,有效缓解了低资源语言在生成任务中的语义偏移与逻辑断裂问题。当前热点聚焦于利用该数据集探索多语言模型在尼泊尔语、梵语等低资源场景下的可控生成与知识对齐,推动了大语言模型在全球化语言生态中的公平性部署。该工作不仅为多语言指令微调提供了标准化基准,更通过开源模型适配器加速了跨语言推理能力的实证研究,对弥合数字语言鸿沟具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务