MBZUAI/Bactrian-X
收藏资源简介:
Bactrian-X数据集是一个包含52种语言的3.4M指令-响应对的集合。这些数据是通过将67K英文指令(来自alpaca-52k和dolly-15k)翻译成51种语言,并使用ChatGPT生成响应得到的。每个指令-响应对包含一个唯一的指令、可选的输入、ChatGPT生成的输出以及一个唯一的ID。数据集支持多语言指令跟随模型的开发,并涵盖了广泛的语言范围。
The Bactrian-X dataset is a collection of 3.4 million instruction-response pairs covering 52 languages. These data were obtained by translating 67K English instructions from alpaca-52k and dolly-15k into 51 languages, then generating responses via ChatGPT. Each instruction-response pair contains a unique instruction, an optional input, a ChatGPT-generated output, and a unique ID. This dataset supports the development of multilingual instruction-following models and covers a wide range of languages.
数据集概述:Bactrian-X
数据集描述
数据集总结
Bactrian-X 数据集包含3.4M个指令-响应对,涵盖52种语言。这些数据是通过将67K个英语指令翻译成51种其他语言,并使用ChatGPT (gpt-3.5-turbo)生成自然响应得到的。
语言
数据集支持52种语言,这些语言遵循mBART-50的标准。
数据集结构
数据字段
instruction: 描述模型应执行的任务,每个指令都是唯一的。input: 任务的上下文或输入,约40%的示例包含此字段。output: 由gpt-3.5-turbo生成的指令答案。id: 每个数据项在特定语言中的唯一索引。
数据示例
数据集提供了多种语言的示例,包括英语、阿拉伯语、印度尼西亚语、德语和法语。
数据在52种语言中的分布
数据集在52种语言中均匀分布,每种语言包含67017个实例。
数据集创建
- 英语指令来源于alpaca-53k和dolly-15k。
- 使用Google翻译API将指令翻译成51种其他语言。
- 使用
gpt-3.5-turbo为每种语言生成输出。
使用数据的注意事项
数据集的社会影响
该数据集有助于在52种语言中普及先进的指令遵循模型,并允许首次实验多语言LoRA-based LLaMA模型。
偏见讨论
存在翻译偏见和潜在的英语文化偏见。
其他已知限制
数据由语言模型生成,可能包含错误或偏见,建议谨慎使用并提出改进方法。
附加信息
数据集管理员
Haonan Li 和 Fajri Koto
许可信息




