遇见数据集

wmt26-mist-test

收藏
Hugging Face2026-07-20 更新2026-07-21 收录
官方服务:

资源简介:

WMT26 MIST共享任务测试集是一个用于多语言指令理解评估的数据集,发布于2026年7月。该数据集采用JSONL格式,包含24种语言和三种任务类型:开放问答(qa-oeg)、上下文问答(qa-context)和文本摘要(sum-sum)。每个数据样本包含四个字段:唯一标识符id、自包含的提示词prompt(包含所有上下文和问题)、任务类型task以及问题语言question_lang。id字段由任务类型、数字标识符、问题语言和上下文语言(若存在)四部分拼接而成。该数据集适用于多语言自然语言处理任务的评估,特别是问答和摘要系统的性能测试。参与者可根据任务类型或语言对测试集进行过滤使用。

The WMT26 MIST Shared Task Test Set is a dedicated dataset for multilingual instruction understanding evaluation, released in July 2026. It utilizes the JSONL format and encompasses 24 languages alongside three task categories: open-domain question answering (qa-oeg), contextual question answering (qa-context), and text summarization (sum-sum). Each data sample comprises four fields: a unique identifier id, a self-contained prompt that incorporates all relevant context and questions, the task type task, and the question language question_lang. The id field is formed by concatenating four components: task type, numeric identifier, question language, and context language (if applicable). This dataset serves as an evaluation resource for multilingual natural language processing tasks, with a particular emphasis on performance testing of question answering and summarization systems. Participants may filter and utilize the test set based on task type or language.

创建时间:
2026-07-14
原始信息汇总

数据集概述:WMT26 MIST Shared Task Test Release

基本信息

  • 许可证:CC-BY-4.0
  • 发布时间:2026年7月14日(测试集发布)
  • 最后更新:2026年7月20日

数据集规模与内容

  • 语言数量:24种语言
  • 子任务数量:3个子任务

子任务类型

任务标识 任务说明
qa-oeg 开放式问答(Open-ended QA)
qa-context 基于上下文的问答(Context-based QA)
sum-sum 摘要生成(Summarization)

数据格式

  • 格式:JSONL(每行一个JSON对象)
  • 字段说明
    • id:测试实例的唯一标识符
    • prompt:自包含的系统输入,包括所有上下文、约束和问题
    • task:任务类型(qa-oeg / qa-context / sum-sum)
    • question_lang:问题的语言

ID结构说明

每个ID由四部分组成,格式为 任务_整数标识符_问题语言_上下文语言,例如:

  • qa-oeg_44_zho_zho(开放式问答,问题与上下文均为中文)
  • qa-context_2_ita_spa(基于上下文的问答,问题为意大利语,上下文为西班牙语)
  • sum-sum_64_ind_eng(摘要生成,问题为印尼语,上下文为英语)

使用说明

  • 若仅参与部分任务或语言子集,可通过 taskquestion_lang 字段进行过滤筛选

重要更新

  • 2026年7月20日:修复部分英语QA-OEG提示未本地化的问题,此前下载的用户需重新下载
  • 2026年7月15日:修复英语QA-OEG提示为空的问题
  • 提交截止日期:2026年8月1日(AoE时间)

参考资料

更多详情请访问官方网站

搜集汇总
数据集介绍
wmt26-mist-test 数据集图片
构建方式
WMT26 MIST共享任务测试集以JSONL格式发布,每行数据包含id、prompt、task和question_lang四个字段。id字段由任务类型、整数标识符、问题语言及上下文语言四部分拼接而成,确保每个测试实例的唯一性。任务类型涵盖开放域问答(qa-oeg)、基于上下文的问答(qa-context)和摘要生成(sum-sum)三个子任务,覆盖24种语言。prompt字段为自包含的输入指令,整合了所有上下文、约束条件及问题,便于直接输入参与系统。
使用方法
用户可直接从HuggingFace平台下载JSONL格式数据,每行为独立JSON对象。若仅参与部分任务或语言,可通过task或question_lang字段过滤数据。prompt字段为系统输入,无需额外处理。数据集提供明确的截止日期(2026年8月1日),参与者需在指定前完成提交,详细信息可参考任务官方网站。
背景与挑战
背景概述
WMT26 MIST共享任务测试集发布于2026年,由统计机器翻译研讨会(WMT)组织,旨在推动多语言指令遵循与机器翻译的交叉研究。该数据集聚焦于三个核心子任务:开放域问答(QA-OEG)、基于上下文的问答(QA-Context)和摘要生成(Sum-Sum),覆盖24种语言,为评估多语言大语言模型的指令遵循与生成能力提供了标准化基准。其发布标志着机器翻译领域从单一语言对转向多语言、多任务泛化能力的研究趋势,对推动多语言自然语言处理系统在真实跨语言场景下的应用具有重要影响力,尤其为低资源语言和跨语言生成任务提供了关键测试平台。
当前挑战
该数据集面临的挑战首先体现在多语言多任务联合评估的复杂性上,不同语言的语言学差异和任务类型的多样性要求模型具备跨语言指令理解与生成能力,尤其在开放域问答中需处理知识异质性与文化偏见。其次,构建过程中面临高质量多语言数据标注的困境,特别是对于低资源语言,需确保提示文本的本地化与任务一致性,如README提及的英语提示空值及本地化修复问题,反映出多语言数据质量控制与迭代维护的技术难点。此外,测试集的生命周期短暂(提交截止于2026年8月),迫使研究者需在有限时间内开发适应新任务与语言的鲁棒系统。
常用场景
经典使用场景
WMT26 MIST共享任务测试集专为多语言指令跟随与机器翻译领域的前沿探索而设计,其经典用途在于评估模型在开放域问答、上下文依赖问答及摘要生成这三种核心子任务上的跨语言泛化能力。该数据集覆盖24种语言,通过自包含的提示格式确保评估的公平性与可复现性,成为检验多语言大语言模型在复杂指令理解、多语言知识检索与信息压缩方面表现的权威基准。研究者常利用此数据集进行零样本或少样本场景下的跨语言迁移学习实验,以揭示模型在不同语言对间转移推理与生成能力的内在机理。
解决学术问题
该数据集系统性地解决了多语言自然语言处理中长期存在的评价标准碎片化问题,为学术研究提供了统一、标准化的测试框架。它弥合了不同语言间评估任务不对等的鸿沟,使得研究者能够公平地比较模型在问答与摘要等生成任务上的跨语言表现。通过精细化的任务分类与多语言设计,其促进了关于模型在多语言环境中能否保持语义忠实性与指令遵循能力这一核心学术问题的深入探索,有力地推动了多语言模型普适性与鲁棒性评估方法论的发展。
实际应用
在实际应用层面,该数据集对于部署全球化智能客服系统、多语言内容生成工具以及跨语言信息检索平台具有直接的指导价值。例如,企业可利用此数据集测试其多语言助手在西班牙语、中文或阿拉伯语等场景下的问答准确性,或评估新闻聚合服务在将英语摘要准确迁移至印度尼西亚语等目标语言时的可靠性。此外,针对开放域问答任务的测试结果为开发面向多元文化背景用户的知识查询系统提供了关键的性能基线,助力实现无缝的跨语言人机交互体验。
数据集最近研究
最新研究方向
WMT26 MIST共享任务测试集聚焦于多语言指令微调的前沿探索,涵盖开放域问答、上下文问答与摘要生成三大子任务,支持24种语言。该数据集通过自包含提示设计,推动多语言生成模型在跨语言语义理解与指令遵循能力上的评估,尤其关注低资源语言的泛化表现。其发布恰逢多模态与多语言模型交叉研究的热点期,为评估模型在复杂多语言场景下的零样本迁移与任务泛化提供了关键基准,对促进包容性自然语言处理技术发展具有重要学术价值与现实意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务