遇见数据集

omnilingual-gaia2

收藏
Hugging Face2026-08-11 更新2026-08-13 收录
官方服务:

资源简介:

OmnilingualGAIA2 是一个多语言智能体基准数据集,是 GAIA2 基准的多语言扩展。它包含 6400 个场景,覆盖 10 种目标语言:简体中文、德语、法语、印地语、印度尼西亚语、意大利语、日语、葡萄牙语、西班牙语和土耳其语。每种语言包含 640 个场景,均匀分布在四个能力子集上:执行(execution)、搜索(search)、歧义(ambiguity)和适应性(adaptability),每个子集 160 个场景。数据集的每个配置对应一个 (语言_文字, 子集) 对,仅提供 test 分割。每条记录包含以下字段:scenario_id(跨语言共享的场景标识符)、scenario(以 JSON 字符串表示的完整场景定义,包含 metadata、apps、events、version 和 augmentation)、language(ISO 639-3 语言代码)、script(ISO 15924 文字代码)、subset(GAIA2 能力子集)。场景 ID 在不同语言中对齐,因此同一子集下的任意两个配置可以逐行比较。翻译通过机器翻译管线生成,使用了 google/gemma-4-31B-it 模型,并强制执行跨表面保真度约束,但未经过完全人工验证。该数据集适用于评估多语言智能体在工具使用、任务执行等场景中的能力,特别是衡量前沿 AI 智能体在多语言环境下的表现差距。

OmnilingualGAIA2 is a multilingual agent benchmark dataset, a multilingual extension of the GAIA2 benchmark. It contains 6400 scenarios covering 10 target languages: Simplified Chinese, German, French, Hindi, Indonesian, Italian, Japanese, Portuguese, Spanish, and Turkish. Each language includes 640 scenarios evenly distributed across four capability subsets: execution, search, ambiguity, and adaptability, with 160 scenarios per subset. Each configuration of the dataset corresponds to a (language_script, subset) pair, and only the test split is provided. Each record contains the following fields: scenario_id (a cross-language shared scenario identifier), scenario (a complete scenario definition in JSON string format, including metadata, apps, events, version, and augmentation), language (ISO 639-3 language code), script (ISO 15924 script code), and subset (GAIA2 capability subset). Scenario IDs are aligned across languages, so any two configurations under the same subset can be compared row by row. Translations are generated via a machine translation pipeline using the google/gemma-4-31B-it model, with cross-surface fidelity constraints enforced but not fully manually verified. This dataset is suitable for evaluating multilingual agents capabilities in tool use, task execution, etc., particularly measuring the performance gap of frontier AI agents in multilingual environments.

提供机构:
AI at Meta
创建时间:
2026-08-11
原始信息汇总

OmnilingualGAIA2 数据集概述

基本信息

  • 数据集名称: OmnilingualGAIA2
  • 发布机构: Facebook (Hugging Face 平台)
  • 许可证: CC BY-NC 4.0(非商业使用)
  • 任务类型: 其他(智能体基准测试)
  • 相关论文: arXiv:2608.08775(访问地址

数据集简介

OmnilingualGAIA2 是 GAIA2 智能体基准测试的多语言扩展版本,包含 6400 个场景,覆盖 10 种目标语言。所有场景均通过机器翻译管道从英文参考版本转换而来,并强制执行跨表面保留契约。

语言覆盖

语言 执行 搜索 歧义 适应性 总计
中文(简体) 160 160 160 160 640
德语 160 160 160 160 640
法语 160 160 160 160 640
印地语 160 160 160 160 640
印度尼西亚语 160 160 160 160 640
意大利语 160 160 160 160 640
日语 160 160 160 160 640
葡萄牙语 160 160 160 160 640
西班牙语 160 160 160 160 640
土耳其语 160 160 160 160 640

总计: 6400 个场景

数据配置与结构

  • 配置方式: 每个(语言, 子集)组合对应一个独立配置,共 40 个配置(10 语言 × 4 子集)
  • 数据分割: 每个配置仅包含一个 test 分割
  • 文件格式: Parquet 格式

数据列说明

列名 描述
scenario_id 跨语言共享的稳定 GAIA2 场景标识符
scenario 完整的场景定义(JSON 字符串)
language ISO 639-3 语言代码
script ISO 15924 文字代码
subset GAIA2 能力子集

场景对象结构

scenario 对象包含以下顶层键:metadata(场景 ID、持续时间、开始时间、提示、标签)、apps(智能体操作的序列化应用环境)、events(预言事件 DAG)、versionaugmentation

使用说明

可通过 datasets 库加载数据,例如: python from datasets import load_dataset ds = load_dataset("facebook/omnilingual-gaia2", "spa_Latn_execution", split="test")

基准测试可通过将配置物化为场景 JSON 文件后,使用 gaia2-runner run-dataset 命令运行。

验证器说明

使用标准英文验证器对非英语轨迹进行评分并非公平比较。多语言验证器正在通过 PR 形式发布在 Meta Agents Research Environments 仓库中,在合并前,使用默认判断器进行的跨语言比较结果仅作参考。

数据来源与局限性

引用格式

bibtex @misc{caciolai2026omnilingualgaia2evaluatingmultilingualgap, title={OmnilingualGAIA2: Evaluating the Multilingual Gap in Frontier AI Agents}, author={Andrea Caciolai and Pere-Lluís Huguet Cabot and Chierh Cheng and Albert Ventayol-Boada and Gabriel Mejia Gonzalez and Christophe Ropers and Lucas Bandarkar and Sebastian Ruder and Darlene Sakakihara and Elliot Yun and Pierre Andrews and Grégoire Mialon and Romain Froger and Marta R. Costa-jussà}, year={2026}, eprint={2608.08775}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2608.08775}, }

搜集汇总
数据集介绍
omnilingual-gaia2 数据集图片
构建方式
OmnilingualGAIA2数据集是在GAIA2基准测试基础上构建的多语言扩展,涵盖10种目标语言,每种语言包含640个场景,总计6400个场景。构建过程采用机器翻译管线,将英文参考场景通过一种强制执行跨表面保留契约的流程翻译成各语言版本。数据集按(语言,子集)对划分为多个配置,每个配置包含一个测试集,列与原始GAIA2保持一致,包括scenario_id、scenario、language、script和subset字段。scenario对象包含metadata、apps、events、version和augmentation等标准GAIA2场景定义字段。场景ID在不同语言间对齐,确保相同子集的配置可以逐行比较。
特点
该数据集的核心特点在于其多语言覆盖与任务多样性。覆盖语言包括中文、德语、法语、印地语、印尼语、意大利语、日语、葡萄牙语、西班牙语和土耳其语,并区分脚本(如拉丁、汉字、天城文等)。每个语言包含四个能力子集:execution、search、ambiguity和adaptability,各160个场景,全面评估智能体的多维度能力。数据集的场景ID跨语言对齐,便于进行多语言对比研究。此外,翻译过程中采用严格的契约保真机制,力求在内容保持上达到高度一致性,为评测多语言智能体在不同语言环境下的性能提供了可靠基准。
使用方法
使用该数据集时,可通过HuggingFace的datasets库加载指定配置,如load_dataset("facebook/omnilingual-gaia2", "spa_Latn_execution", split="test"),并按需将每个scenario字段的JSON字符串解析为字典。为运行基准测试,可将配置物化为包含scenario JSON文件的目录,供gaia2-runner直接消费。特别需要注意的是,使用默认英文验证器评估非英语轨迹可能不公正,建议使用论文中提供的多语言验证器进行跨语言比较。数据集仅包含测试集,适合作为评估多语言AI代理能力的标准benchmark。
背景与挑战
背景概述
OmnilingualGAIA2数据集于2026年由Meta及多家研究机构联合构建,旨在系统评估前沿AI智能体在多语言环境下的性能表现。该数据集作为GAIA2基准的多语言扩展,覆盖10种目标语言,包含6400个场景,每个场景均通过严格的机器翻译流程从英文原版转换而来,确保跨语言表面结构的一致性。其核心研究问题在于揭示并量化当前AI智能体在不同语言中的能力差异,即所谓的“多语言鸿沟”,为多语言智能体的研究与开发提供了关键基准。该数据集的出现填补了现有智能体评估体系在多语言维度上的空白,对推动全球范围内AI智能体的公平性与普适性研究具有重要意义。
当前挑战
OmnilingualGAIA2数据集所面临的挑战体现在多个层面。在领域问题层面,其旨在解决多语言AI智能体评估中缺乏标准化基准的难题,尤其是在非英语环境下智能体性能的准确度量。构建过程中,团队需应对机器翻译带来的语义保真挑战,确保翻译后的场景在功能上与原版等价,同时兼顾不同语言的文化差异与表达习惯。此外,各语言配置的验证器开发亦是一大挑战,因为默认的英文验证器无法公平评估非英语轨迹。为此,团队专门研发了多语言验证器,并通过跨语言研究验证了其有效性,确保了基准的可靠性与公平性。
常用场景
经典使用场景
OmnilingualGAIA2作为GAIA2基准的多语言扩展,旨在评估前沿AI代理在非英语环境中的通用问题解决能力。该数据集包含10种目标语言、6400个场景,覆盖执行、搜索、歧义处理与适应性四种能力子集,每个场景均保持与英文原版的结构一致性。其经典使用场景是跨语言代理基准测试,研究者可加载特定语言配置,通过gaia2-runner运行代理,比较不同语言下代理的性能,从而探究语言多样性对代理推理、工具使用和规划能力的潜在影响。
衍生相关工作
该数据集的发布催生了一系列多语言代理评测与改进的相关工作。研究者基于其跨语言对比框架,提出了语言特定的验证器校准方法,以解决非英语轨迹评分不公的问题。同时,其翻译管线中强调的跨表面保留契约激发了针对机器翻译质量对下游任务影响的研究,衍生出更鲁棒的翻译与适配策略。此外,该基准常被用作微调多语言代理模型的标准测试集,推动开发出语言自适应模块、多语提示优化算法等创新技术,加速了通用人工智能代理向多语言生态的演进。
数据集最近研究
最新研究方向
OmnilingualGAIA2数据集作为GAIA2基准的多语言扩展,聚焦于评估前沿AI代理在多语言环境下的能力差距。其6400个场景覆盖10种目标语言,通过机器翻译和跨表面一致性保障机制构建,特别关注执行、搜索、歧义处理和适应性四个能力子集。该数据集的前沿研究指向多语言代理的泛化能力,尤其强调在非英语环境中验证代理的鲁棒性和公平性。随着多语言AI代理在全球化应用中的普及,该基准为衡量代理在语言多样性下的表现提供了重要工具,推动了多语言智能体评估标准的发展,并揭示了当前模型在跨语言任务中的潜在局限。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务