kaist-ai/Multilingual-CoT-Collection
收藏资源简介:
Multilingual CoT Collection 是一个旨在通过微调语言模型来生成Chain-of-Thought(CoT)能力的数据集。该数据集包含了1060个任务,涵盖了多种自然语言处理任务,如自然语言推理、问答、科学、算术等。数据集提供了1837928个训练样本,支持英语语言。每个样本包含source、target、rationale和task四个部分。实验结果表明,使用该数据集进行微调可以提高零样本学习和少样本学习的性能。
Multilingual CoT Collection 是一个旨在通过微调语言模型来生成Chain-of-Thought(CoT)能力的数据集。该数据集包含了1060个任务,涵盖了多种自然语言处理任务,如自然语言推理、问答、科学、算术等。数据集提供了1837928个训练样本,支持英语语言。每个样本包含source、target、rationale和task四个部分。实验结果表明,使用该数据集进行微调可以提高零样本学习和少样本学习的性能。
数据集概述
数据集名称
Multilingual CoT Collection
数据集描述
- 目的: 旨在诱导多语言语言模型具备Chain-of-Thought (CoT)能力。
- 规模: 包含1.84百万个Chain-of-Thoughts,覆盖1060个任务。
- 效果: 通过在CoT Collection上进行微调,模型在零样本学习和少样本学习中表现更佳。
支持的任务
- 自然语言推理
- 抽取式问答
- 闭书问答
- 科学
- 毒性分类
- 算术
- 程序执行
- 对话
- 伦理
- 常识推理
- 多选题问答
语言
- 英语
数据集结构
- source: 输入给语言模型的内容。
- target: 源内容的正确答案。
- rationale: 解释如何从源内容推导出目标内容的Chain of Thought。
- task: 显示源内容和目标内容来自哪个数据集的类别。
数据分割
- 训练集: 1837928个样本
许可证
- cc-by-4.0
配置文件
- fr: "./data/CoT_collection_fr.json"
- ja: "./data/CoT_collection_ja.json"
- ko: "./data/CoT_collection_ko.json"
- ru: "./data/CoT_collection_ru.json"
- zh: "./data/CoT_collection_zh.json"
引用信息
@article{kim2023cot, title={The CoT Collection: Improving Zero-shot and Few-shot Learning of Language Models via Chain-of-Thought Fine-Tuning}, author={Kim, Seungone and Joo, Se June and Kim, Doyoung and Jang, Joel and Ye, Seonghyeon and Shin, Jamin and Seo, Minjoon}, journal={arXiv preprint arXiv:2305.14045}, year={2023} }




