meta-agents-research-environments/gaia2-cli
收藏资源简介:
--- pretty_name: GAIA2 CLI configs: - config_name: default data_files: - split: test path: data/* - config_name: adaptability data_files: - split: test path: data/adaptability-* - config_name: ambiguity data_files: - split: test path: data/ambiguity-* - config_name: execution data_files: - split: test path: data/execution-* - config_name: search data_files: - split: test path: data/search-* - config_name: time data_files: - split: test path: data/time-* default_config_name: default --- # GAIA2 CLI Benchmark dataset for [gaia2-cli](https://github.com/meta-agents-research-environments/gaia2-cli), the CLI-based agent evaluation harness. ## Schema Each row has two columns: | Column | Type | Description | |--------|------|-------------| | `scenario_id` | string | Unique scenario identifier (e.g. `scenario_universe_21_1qgjj6`) | | `scenario` | string | Complete scenario as a JSON string | ## Usage ```python from datasets import load_dataset import json # Load a specific config (160 scenarios) ds = load_dataset("meta-agents-research-environments/gaia2-cli", "adaptability", split="test") # Access a scenario scenario = json.loads(ds[0]["scenario"]) print(scenario.keys()) # dict_keys(['metadata', 'apps', 'events', 'version', 'augmentation']) # Load all configs (800 scenarios) ds = load_dataset("meta-agents-research-environments/gaia2-cli", split="test") ``` Available configs: `adaptability`, `ambiguity`, `execution`, `search`, `time`. ## With the runner The `gaia2-runner` downloads and caches this dataset automatically: ```bash gaia2-runner run-dataset \ --dataset meta-agents-research-environments/gaia2-cli \ --splits adaptability \ --image localhost/gaia2-oc:latest \ --provider anthropic --model claude-opus-4-6 \ --judge-provider anthropic --judge-model claude-opus-4-6 ``` Or in a TOML config: ```toml [target] dataset = "meta-agents-research-environments/gaia2-cli" splits = "all" ``` ## Export to JSON To export scenarios as individual JSON files: ```bash python scripts/export_hf_to_json.py --splits all --dest ~/gaia2_datasets/gaia2-cli ```
--- 数据集展示名称:GAIA2 CLI 配置列表: - 配置名称:默认 数据文件: - 划分:测试集 路径:data/* - 配置名称:适应性 数据文件: - 划分:测试集 路径:data/adaptability-* - 配置名称:歧义性 数据文件: - 划分:测试集 路径:data/ambiguity-* - 配置名称:执行性 数据文件: - 划分:测试集 路径:data/execution-* - 配置名称:搜索性 数据文件: - 划分:测试集 路径:data/search-* - 配置名称:时效性 数据文件: - 划分:测试集 路径:data/time-* 默认配置名称:默认 --- # GAIA2 CLI 本数据集为基于命令行界面(Command Line Interface, CLI)的智能体评估工具gaia2-cli(访问地址:https://github.com/meta-agents-research-environments/gaia2-cli)的基准测试数据集。 ## 数据模式 每一行包含两列: | 列名 | 数据类型 | 描述 | |--------|------|-------------| | `scenario_id` | 字符串 | 唯一的场景标识符(例如:`scenario_universe_21_1qgjj6`) | | `scenario` | 字符串 | 以JSON字符串形式存储的完整场景内容 | ## 使用示例 python from datasets import load_dataset import json # 加载指定配置(包含160个场景) ds = load_dataset("meta-agents-research-environments/gaia2-cli", "adaptability", split="test") # 读取单个场景 scenario = json.loads(ds[0]["scenario"]) print(scenario.keys()) # 输出:dict_keys(['metadata', 'apps', 'events', 'version', 'augmentation']) # 加载所有配置(共800个场景) ds = load_dataset("meta-agents-research-environments/gaia2-cli", split="test") 可用配置项包括:`adaptability`(适应性)、`ambiguity`(歧义性)、`execution`(执行性)、`search`(搜索性)、`time`(时效性)。 ## 配合运行工具使用 `gaia2-runner`会自动下载并缓存本数据集: bash gaia2-runner run-dataset --dataset meta-agents-research-environments/gaia2-cli --splits adaptability --image localhost/gaia2-oc:latest --provider anthropic --model claude-opus-4-6 --judge-provider anthropic --judge-model claude-opus-4-6 也可通过TOML配置文件进行配置: toml [target] dataset = "meta-agents-research-environments/gaia2-cli" splits = "all" ## 导出为JSON格式 若需将场景导出为独立的JSON文件,可执行如下命令: bash python scripts/export_hf_to_json.py --splits all --dest ~/gaia2_datasets/gaia2-cli



