遇见数据集

FBK-MT/MCIF

收藏
Hugging Face2026-02-25 更新2025-12-20 收录
官方服务:

资源简介:

MCIF(多模态跨语言指令遵循)是一个基于科学讲座的多语言人工标注基准测试数据集,旨在评估跨语言和多模态环境下的指令遵循能力,涵盖长格式和短格式输入。MCIF包含语音、视觉和文本三种核心模态,支持英语、德语、意大利语和中文四种语言,能够全面评估多语言大模型(MLLMs)在不同语言和模态上下文信息中的指令解释能力。数据集分为长格式和短格式输入,以及固定提示和混合提示两种提示类型,适用于自动语音识别、问答、摘要、视觉问答和翻译等多种任务。

MCIF (Multimodal Crosslingual Instruction Following) is a multilingual human-annotated benchmark based on scientific talks that is designed to evaluate instruction-following in crosslingual, multimodal settings over both short- and long-form inputs. MCIF spans three core modalities -- speech, vision, and text -- and four diverse languages (English, German, Italian, and Chinese), enabling a comprehensive evaluation of MLLMs abilities to interpret instructions across languages and combine them with multimodal contextual information. The dataset is organized into long and short tracks with fixed and mixed prompt types, supporting tasks such as automatic speech recognition, question answering, summarization, visual question answering, and translation.

提供机构:
FBK-MT
搜集汇总
数据集介绍
构建方式
MCIF(多模态跨语言指令遵循基准)是一个基于科学演讲的人工标注数据集,旨在评估多模态大语言模型在跨语言和跨模态场景下的指令遵循能力。该数据集覆盖语音、视觉和文本三种核心模态,并包含英语、德语、意大利语和中文四种语言。其构建遵循双维度划分:一是输入时长维度,分为长片段(完整演讲)和短片段(预切分片段);二是提示类型维度,分为固定提示和混合提示。由此形成四个配置子集,每个子集包含约362至1560个测试样本,所有样本均标注了多语言指令、音频路径、视频路径以及元数据信息。
特点
MCIF数据集的核心特点在于其多模态、跨语言与多任务融合的设计。它不仅涵盖了自动语音识别、翻译、问答和摘要等典型任务,还通过长短片段和固定/混合提示的组合,系统地测试模型在不同输入长度与指令变异性下的鲁棒性。特别地,问答样本进一步区分了音频、视觉、视听及不可回答四类来源,使得评估维度更为精细。此外,所有原始音视频文件在不同配置间共享,确保了子集之间的可比性,同时支持对模型跨语言与跨模态对齐能力的深度剖析。
使用方法
使用MCIF数据集时,研究者可通过Hugging Face的`load_dataset`函数加载指定配置,例如`load_dataset("FBK-MT/MCIF", "long_fixedprompt")`。音频与视频路径为仓库内相对路径,需通过克隆仓库获取完整数据。对于特定任务(如翻译、摘要),可根据元数据中的`task`字段筛选样本,并通过`id`字段与外部参考文件进行匹配。评估需使用官方提供的脚本及参考文件,这些资源均托管于MCIF的GitHub仓库中,确保了评估流程的标准化与可复现性。
背景与挑战
背景概述
MCIF(Multimodal Crosslingual Instruction Following)是由意大利布鲁诺·凯斯勒基金会(FBK)与卡尔斯鲁厄理工学院等机构的研究人员于2025年联合构建的多模态跨语言指令遵循基准数据集。该数据集以科学演讲为核心素材,涵盖英语、德语、意大利语和中文四种语言,以及语音、视觉和文本三种模态,旨在系统评估多模态大语言模型(MLLMs)在跨语言环境下理解和执行指令的能力。作为ICLR 2026的收录成果,MCIF填补了现有基准在跨语言、多模态指令遵循评估方面的空白,为相关领域提供了标准化测试框架,其影响力已延伸至IWSLT 2025国际评测任务。
当前挑战
MCIF所应对的核心挑战在于多模态跨语言指令遵循的评估复杂性:现有基准多聚焦单一语言或模态,难以反映模型在真实场景中同时处理多语言指令与多感官信息的能力。数据集构建过程中面临两大难题:一是如何从科学演讲中设计出自然且具有区分度的指令,涵盖识别、翻译、问答和摘要等多样化任务;二是跨语言提示的语义对齐与质量控制,需确保四种语言版本的指令在难度和意图上保持等价。此外,长视频与短视频两种输入形式的设计要求同时兼顾上下文理解与细粒度定位,对数据标注的精确性和一致性提出了极高要求。
常用场景
经典使用场景
MCIF数据集的核心应用场景在于对多模态大语言模型(MLLMs)进行跨语言指令跟随能力的系统性评估。该基准基于科学演讲内容,精心设计了短时与长时两种输入时长模式,并覆盖语音、视觉与文本三种核心模态。通过引入英语、德语、意大利语和中文四种语言,MCIF能够全面检验模型在多样语言环境下理解并执行跨模态指令的鲁棒性。其独特之处在于同时考虑了固定提示与混合提示两种变体,从而能够深入剖析模型在不同指令复杂性下的表现差异,为多模态跨语言理解研究提供了标准化的测试平台。
实际应用
在实际应用中,MCIF所模拟的场景与全球化知识传播需求高度契合。例如,在国际学术会议中,系统需同时处理演讲者的语音、幻灯片视觉内容以及多语言字幕,并依据用户指令生成摘要或回答特定问题。该数据集为此类跨语言、多模态人机交互系统的性能验证提供了关键资源。在智能会议助手、多语言教育平台以及全球媒体内容分析等产品中,MCIF可用于测试系统能否准确理解中文用户对英文演讲的图文混合提问,从而保障服务在真实多语言环境下的可靠性与用户体验。
衍生相关工作
MCIF的发布催生了多项具有影响力的学术工作。其数据被直接选为IWSLT 2025指令跟随评测赛道的官方测试集,吸引了全球研究团队参与跨语言多模态系统的竞赛。围绕该基准,衍生工作聚焦于提示工程优化、长上下文建模以及跨语言模态对齐等前沿方向。研究者基于MCIF提出的评估框架,进一步探索了如何在少样本与零样本条件下提升模型的跨语言指令跟随能力,并开发了针对性的训练策略。这些工作共同推动了多模态大模型在全球化应用场景下的适应性研究,形成了从基准构建到算法优化的完整研究链条。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务