wmt26-mist-sample
收藏资源简介:
wmt26-mist-sample数据集是由WMT26 MIST共享任务组织者提供的多语言混合数据,旨在作为微调多语言大语言模型(LLMs)的起点种子数据。它涵盖三种核心任务类型:基于上下文的问答、开放式问答以及单语言与跨语言摘要,以支持同语言和跨语言的理解与生成能力。数据集结构包含五个关键字段:task(标识任务类型,取值为qa或sum)、lang_code(输出语言代码,格式为语言_文字,如zho_Hans)、source(数据来源的子数据集名称)、input(自包含的输入文本,已整合任务提示和上下文等信息)和output(对应的预期输出文本)。数据整合了来自八个子数据集(MCIF-QA、TyDi QA、Aya Dataset、BELEBELE、WMT25-MIST-OEG、CrossSum、MCIF-Sum、Wikilingua)的样本,覆盖超过25种语言,包括阿拉伯语、孟加拉语、中文、捷克语、英语、法语、德语、印地语、意大利语、日语、韩语、俄语、西班牙语、土耳其语、越南语等。数据来源于多个公开数据集,并遵循其各自的原始许可协议(如Apache 2.0、CC BY-SA 4.0等)。该数据集适用于多语言指令微调、问答系统、文本摘要等自然语言处理任务的模型训练与评估。
The wmt26-mist-sample dataset is a multilingual mixed dataset provided by the WMT26 MIST shared task organizers, designed as a starting seed data for fine-tuning multilingual large language models (LLMs). It covers three core task types to support monolingual and cross-lingual understanding and generation capabilities: context-based QA, open-ended QA, and mono- and cross-lingual summarization. The dataset structure includes five key fields: `task` (identifying the task type, with values qa or sum), `lang_code` (output language code in the format language_script, e.g., zho_Hans), `source` (indicating the sub-dataset name from which the data originates), `input` (self-contained input text that integrates task prompts, context, and other information), and `output` (the corresponding expected output text). In terms of data scale, it integrates samples from eight well-known sub-datasets (MCIF-QA, TyDi QA, Aya Dataset, BELEBELE, WMT25-MIST-OEG, CrossSum, MCIF-Sum, Wikilingua), covering over 25 languages, including Arabic, Bengali, Chinese, Czech, English, French, German, Hindi, Italian, Japanese, Korean, Russian, Spanish, Turkish, Vietnamese, among others. The data is sourced from multiple public datasets and adheres to their respective original licensing agreements (e.g., Apache 2.0, CC BY-SA 4.0, etc.). This dataset is suitable for model training and evaluation in natural language processing tasks such as multilingual instruction fine-tuning, question-answering systems, and text summarization.
数据集概述
WMT26 MIST 样本数据集(wmt26-mist-sample)是由 WMT26 MIST 共享任务 组织者提供的多语言混合数据集,旨在作为微调多语言大语言模型(LLMs)的起点。
任务类型
数据集包含三类任务:
- 基于上下文的问答(Context-based QA)
- 开放域问答(Open-ended QA)
- 单语和跨语言摘要(Monolingual & Cross-lingual Summarization)
数据字段
每条样本包含以下字段:
task:任务类型,值为qa(问答)或sum(摘要)lang_code:输出语言的语言代码,格式为lang_Script(如eng_Latn)source:样本的来源数据集名称input:输入内容,包含任务提示和上下文output:期望的输出
数据来源与许可协议
数据集从以下来源收集,每个子集按其原始许可协议重新分发:
| 数据集 | 许可协议 |
|---|---|
| CohereLabs/aya_dataset | Apache 2.0 |
| google-research-datasets/tydiqa | Apache 2.0 |
| facebook/belebele | CC BY-SA 4.0 |
| wmt25-mist-oeg-gpt-4.1 | TBD |
| FBK-MT/MCIF | CC BY 4.0 |
| csebuetnlp/CrossSum | CC BY-NC-SA 4.0 |
| esdurmus/Wikilingua / GEM/wiki_lingua | CC BY-NC-SA 3.0 |
语言覆盖
数据集涵盖 28 种语言(含文字变体):阿拉伯语(阿拉伯字母)、孟加拉语、捷克语、中库尔德语(阿拉伯字母)、德语、英语、芬兰语、法语、海地克里奥尔语、印地语、印度尼西亚语、意大利语、日语、韩语、马拉地语、波斯语(阿拉伯字母)、葡萄牙语、俄语、斯洛伐克语、西班牙语、斯瓦希里语、泰卢固语、泰语、土耳其语、越南语、约鲁巴语、汉语(简体汉字)。
数据规模与分布
数据集包含 问答 和 摘要 两类任务,数据按以下子集划分(示例语言数据量):
| 子任务 | 包含的子集 |
|---|---|
| 问答(QA) | MCIF-QA、TyDi QA、Aya Dataset、BELEBELE、WMT25-MIST-OEG |
| 摘要(Summarization) | CrossSum、MCIF-Sum、Wikilingua |
各语言样本数量从数十到数百条不等,例如:
- 德语:QA 含 MCIF-QA 220 条、Aya Dataset 241 条、BELEBELE 300 条、WMT25-MIST-OEG 46 条;摘要含 MCIF-Sum 100 条、Wikilingua 100 条
- 英语:QA 含 MCIF-QA 220 条、TyDi QA 300 条、WMT25-MIST-OEG 46 条;摘要含 CrossSum 376 条、MCIF-Sum 100 条
- 汉语(简体):QA 含 MCIF-QA 220 条、Aya Dataset 300 条、BELEBELE 300 条、WMT25-MIST-OEG 46 条;摘要含 CrossSum 359 条、MCIF-Sum 100 条
版本与更新
- 2026年6月16日:首个版本发布
- 2026年6月22日(最新):修复了 BELEBELE 样本中部分不正确的样本,建议使用此版本
使用方式
使用 datasets 库加载:
python
from datasets import load_dataset
mist26_sample_data = load_dataset("pinzhenchen/wmt26-mist-sample")
数据集旨在作为种子数据使用,用户可以自行划分训练集、开发集等。




