遇见数据集

omnilingual-gaia2-results

收藏
Hugging Face2026-08-28 更新2026-08-29 收录
官方服务:

资源简介:

Omnilingual-GAIA2 Results 是一个用于多语言AI Agent评估的数据集,记录了Omnilingual-GAIA2排行榜中多个提交在11种语言上的评分结果。数据集包含来自7个提供商的agent在11种FLORES语言(包括英语、中文、德语、法语、印地语、印度尼西亚语、意大利语、日语、葡萄牙语、西班牙语、土耳其语)上的评估数据,覆盖四种能力:执行(execution)、搜索(search)、歧义(ambiguity)和适应性(adaptability)。数据规模为147,840行,22列,77个分片,总大小约279 MB。关键字段包括:submission(提交标识)、scenario_id(场景ID)、capability(能力)、lang(语言)、run(运行编号)、success(是否成功,null表示不可评分)、num_agent_events(agent事件数)、failure_reason(失败原因)、trace_published(是否发布轨迹)、harness(评估框架)、judge_model(评判模型)、judge_prompt_version(评判提示版本)等。此外还包含三个JSON字符串字段:judgments(逐轮评判细节)、events(工具调用轨迹,每项含app, fn, args, ret, write, turn, is_agent)、reasoning(思维链,含seq, turn, reasoning)。注意:n_events是真实未截断的事件计数,但events字段截断为150条;n_turns记录了用户与agent的轮次,但对某些提交可能不完整。reasoning字段仅对三个本地部署的开放权重提交有效。该数据集可用于复现排行榜指标、进行细粒度分析、研究agent行为等。数据集当前为私有,需通过认证的HF_TOKEN访问。许可为CC-BY-NC-4.0。

Omnilingual-GAIA2 Results is a dataset for multilingual AI Agent evaluation, recording the scoring results of multiple submissions in 11 languages on the Omnilingual-GAIA2 leaderboard. The dataset contains evaluation data from agents of 7 providers across 11 FLORES languages (including English, Chinese, German, French, Hindi, Indonesian, Italian, Japanese, Portuguese, Spanish, Turkish), covering four capabilities: execution, search, ambiguity, and adaptability. The dataset has 147,840 rows, 22 columns, 77 shards, and a total size of approximately 279 MB. Key fields include: submission, scenario_id, capability, lang, run, success (null if not scorable), num_agent_events, failure_reason, trace_published, harness, judge_model, judge_prompt_version, etc. Additionally, there are three JSON string fields: judgments (per-turn judging details), events (tool call traces with app, fn, args, ret, write, turn, is_agent), and reasoning (chain-of-thought with seq, turn, reasoning). Note: n_events is the true untruncated event count, but the events field is truncated to 150; n_turns records user-agent turns but may be incomplete for some submissions. The reasoning field is only valid for three locally deployed open-weight submissions. This dataset can be used to reproduce leaderboard metrics, perform fine-grained analysis, and study agent behavior. The dataset is currently private and requires an authenticated HF_TOKEN for access. License: CC-BY-NC-4.0.

提供机构:
AI at Meta
创建时间:
2026-08-27
原始信息汇总

Omnilingual-GAIA2 Results 数据集详情

数据集概述

Omnilingual-GAIA2 Results 是一个多语言智能体评测结果数据集,包含 7 个模型提交在 11 种语言上的 GAIA2 基准测试评分结果,支撑 Facebook 的 Omnilingual-GAIA2 排行榜。该数据集目前为私有状态,需授权访问。

基本信息

  • 许可证: CC-BY-NC-4.0
  • 语言: 英语、中文、德语、法语、印地语、印尼语、意大利语、日语、葡萄牙语、西班牙语、土耳其语(共11种)
  • 标签: agents, multilingual, omnilingual, gaia2, leaderboard
  • 数据量: 147,840 行,77 个分片,279 MB,22 列

数据组织

数据文件以 data/<provider>__<model>__<harness>__<lang>.parquet 格式存储,每个文件对应一个(提交, 语言)组合。语言使用 FLORES 代码标识:

  • 比较基准: eng_Latn
  • 其他语言: cmn_Hans, deu_Latn, fra_Latn, hin_Deva, ind_Latn, ita_Latn, jpn_Jpan, por_Latn, spa_Latn, tur_Latn

评测能力维度包含:execution(执行)、search(搜索)、ambiguity(歧义处理)、adaptability(适应性)。

核心字段说明

已发布指标相关字段(12列)

  • submission: 模型提交标识
  • scenario_id: 场景ID
  • capability: 能力类型
  • lang: 语言
  • run: 运行编号
  • success: 成功与否(不可评分时为null而非false,共195行)
  • num_agent_events: 智能体事件数量
  • failure_reason: 失败原因
  • trace_published: 是否发布轨迹
  • harness: 评测框架
  • judge_model: 评判模型(当前为 gpt-oss-120b)
  • judge_prompt_version: 评判提示版本(当前为 omnilingual-gaia2)

滚动形状字段(3列)

  • num_oracle_events: 参考解决方案的Oracle事件数(场景属性,范围1-41,中位数7)
  • n_turns: 用户与智能体交互轮数(Kimi提交为部分重建,可能低估)
  • n_events: 真实未截断事件数(Kimi提交为null)

记录字段(4列)agent_response, model, started_at, pass_at

JSON字符串字段(3列)

  • judgments: 逐轮评判详情
  • events: 工具调用轨迹(上限150条,超出部分截断)
  • reasoning: 思维链(无长度限制,共1,069,891,434字符,覆盖1,024,523条记录)

特殊说明

  • 多语言基准: 所有单元格以 eng_Latn 为比较基准进行评分
  • 评判标准: 所有行使用 gpt-oss-120b 作为评判模型,omnilingual-gaia2 作为评判提示版本(按语言本地化的评分标准),与其他GAIA2官方结果不可直接比较
  • 缺失值语义: 各字段的null值具有明确含义(如Kimi提交无轨迹、Bedrock不返回思考内容等)
  • Kimi提交限制: moonshotai__kimi-2.6__opencode 未发布任何轨迹,其事件、推理等字段为null,轮数统计仅为下界

访问与验证

  • 数据集当前为私有,需通过 HF_TOKEN 认证访问
  • 排行榜的五个派生表公开存储在 Space 仓库的 data/tables/ 目录下,无需访问此数据集即可查看
  • 可通过 load_dataset("facebook/omnilingual-gaia2-results", split="train") 加载,或使用 DuckDB 直接查询 Parquet 文件
  • 可通过运行 rederive.py 脚本验证已发布表格与原始数据的字节级一致性
搜集汇总
数据集介绍
omnilingual-gaia2-results 数据集图片
构建方式
该数据集源自Omnilingual-GAIA2排行榜的评分轨迹,由七个大型语言模型在十一语种(包括英语、中文、德语等)的GAIA2场景中执行任务时生成。每个文件对应一个提交与语言的组合,通过Parquet格式存储,共77个分片。数据构建过程中,每个场景的评估结果以统一的schema记录,包含任务执行、搜索、歧义处理和适应性四类能力维度。特别地,数据集中的`num_oracle_events`列通过回溯GAIA2场景定义来填充,确保了参考解决方案的完整描述。此外,推理链(reasoning)字段被无截断地保存,为训练和评估提供了丰富的上下文信息。
特点
该数据集具有显著的多语言覆盖性,支持从英语到土耳其语的十一语种,且采用FLORES编码确保跨语言的一致性。数据集的评分采用统一的法官模型(gpt-oss-120b),并针对每个语言本地化了评估准则,使得分数具有内部可比性。数据集中包含了完整的工具调用轨迹(events)和长篇推理链(可达222,665字符),为研究复杂的多智能体交互提供了宝贵资源。此外,数据集特别标注了截断和缺失情况(如`n_events`和`reasoning`字段的空值),保证数据透明度和可靠性。
使用方法
该数据集主要供具有读取权限的HuggingFace用户使用,可通过`load_dataset`函数加载train分割,或使用DuckDB直接查询Parquet文件进行聚合分析。为验证排行榜的公开表格,用户可克隆相关Space仓库,运行`rederive.py`脚本来进行字节级校验。此外,研究者可通过`json.loads`解析`events`、`judgments`和`reasoning`字段以获取详细轨迹,用于多智能体评估、提示词优化或语言模型性能分析。由于数据集采用CC-BY-NC-4.0许可,使用时需遵循非商业用途规定。
背景与挑战
背景概述
Omnilingual-GAIA2 Results数据集由Meta AI的研究团队于2025年创建,旨在评估多语言环境下智能体在GAIA2基准上的表现。该数据集收录了七种主流模型在十一种语言上的交互轨迹,共计147,840行细粒度数据,涵盖了执行、搜索、歧义消解和适应性四大核心能力。作为Omnilingual-GAIA2排行榜的底层支撑,该数据集首次系统性地揭示了多语言智能体在复杂任务中的性能差异,为跨语言人工智能研究提供了宝贵的实证资源。其严格的评分体系与可复现性设计,使其成为多语言智能体评估领域的重要参考基准,推动了该领域从单一语言向多语言范式的转型。
当前挑战
该数据集面临多重挑战。首先,跨语言性能不均衡现象显著,不同模型在非英语语言上的表现差异较大,且部分模型推理记录缺失,影响了评估的全面性。其次,数据构建过程中需处理大量异构数据,包括不同工具调用格式、推理链与事件轨迹,导致数据粒度不一致与解析复杂度高。此外,模型轨迹的截断问题(如Kimi模型无原始痕迹)与评分标准的地域适配(如法官模型与提示词版本)进一步增加了数据可比性的难度。最后,数据集的私有访问限制与许可证约束,限制了学术界的广泛复用与验证,成为其影响力扩展的潜在瓶颈。
常用场景
经典使用场景
Omnilingual-GAIA2 Results数据集作为多语言智能体基准评估的核心资源,其经典使用场景聚焦于跨语言环境下智能体任务执行能力的系统评测。该数据集基于GAIA2基准,覆盖11种语言,包含147,840条细化轨迹数据,每条记录均标注了场景能力类型(如执行、搜索、歧义消解与适应性)及多维度判断信息。研究者可借此对多语言智能体的性能进行细粒度剖析,例如分析不同语言对同一任务的影响,或对比不同模型在特定能力维度上的优劣。此外,数据集中丰富的工具调用事件与思维链记录,为深入理解智能体决策过程提供了宝贵素材,支持从行为层面到认知层面的多层次研究。
解决学术问题
该数据集有效解决了多语言智能体评估中数据稀缺与评测标准不统一的核心学术难题。传统基准多聚焦单语场景,难以反映真实世界的多语种需求,而此数据集首次大规模提供跨11种语言、基于统一评分协议的智能体执行轨迹,使研究者能够在控制语言变量的前提下,探究语言多样性对智能体性能的深层影响。数据集的细粒度事件标注(如Oracle事件数、工具调用序列)及明确的失败原因记录,为复现实验和误差分析提供了坚实基础,推动了多语言智能体泛化能力研究的科学化与规范化,显著提升了该领域研究的可重复性与可比性。
衍生相关工作
该数据集催生了一系列影响深远的相关研究。其一,基于其细粒度的轨迹数据,衍生出关于智能体工具调用策略与失败模式的分析工作,揭示了不同模型在复杂场景中的行为差异与常见错误类型。其二,数据集中丰富的思维链记录推动了多语言推理机制的研究,使研究者能够剖析模型在不同语言下的推理路径一致性。其三,针对数据集中不同能力维度(特别是搜索和歧义消解)的评测,衍生了专项能力提升的训练方法探索。此外,其可复现的聚合与验证流程,为后续多语言智能体基准的构建树立了范式,促进了更公平、更全面的评测体系的建立。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务