遇见数据集

Orchestra-Bench

收藏
Hugging Face2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

Orchestra-Bench 是一个面向三机器人高级协作规划的英文多模态数据集。该数据集旨在支持高层次的协同规划任务,每个样本包含来自同一场景中三个不同位置的视图、一个广泛的用户请求,以及为每个机器人分配的一个协调文本子任务。数据集共包含 12,000 个样本,覆盖 24 个场景类别(每类 500 个样本),其中 17 个室外类别(8,500 个样本)和 7 个室内类别(3,500 个样本)。图像来源为 3,334 个不同的真实视频帧,共 36,000 张图像引用,每个样本提供三个不同的地面视角(ground_1、ground_2、ground_3)。室外场景来自 EgoSchema 数据集中的 14 个源场景,提供 7,000 个样本。所有图像均为真实视频帧,无合成或透视变换的鸟瞰图。数据以 JSONL 格式存储,主文件为 manifest.jsonl,每条记录包含唯一标识符、场景类别、环境类型、场景描述、源场景、协作模式、视图列表(每个视图包含 robot_id、view_type、image 路径、source_video、timestamp_seconds)、用户任务以及每个机器人的子任务。每个机器人子任务均包含明确的移动动作,规划涉及导航、观察、路线检查、盲区覆盖、报告和相互引导等高级别指令,而非底层控制或轨迹。图像路径相对于数据集根目录。多个记录可复用同一源帧,但每个记录中的三视图组合是唯一的。该数据集由北京大学计算机学院 Hao Tang 团队与北京人工智能研究院(BAAI)联合研究创建。

Orchestra-Bench is an English multimodal dataset for high-level collaborative planning of three robots. The dataset is designed to support high-level cooperative planning tasks, where each sample contains views from three different positions in the same scene, a broad user request, and a coordinated text subtask assigned to each robot. The dataset contains a total of 12,000 samples, covering 24 scene categories (500 samples per category), including 17 outdoor categories (8,500 samples) and 7 indoor categories (3,500 samples). The images are sourced from 3,334 different real video frames, with a total of 36,000 image references, and each sample provides three different ground-level perspectives (ground_1, ground_2, ground_3). Outdoor scenes come from 14 source scenes in the EgoSchema dataset, providing 7,000 samples. All images are real video frames, without synthetic or perspective-transformed birds-eye views. The data is stored in JSONL format, with the main file being manifest.jsonl. Each record contains a unique identifier, scene category, environment type, scene description, source scene, collaboration mode, view list (each view includes robot_id, view_type, image path, source_video, timestamp_seconds), user task, and subtasks for each robot. Each robot subtask includes explicit movement actions, and the planning involves high-level instructions such as navigation, observation, route checking, blind area coverage, reporting, and mutual guidance, rather than low-level control or trajectories. Image paths are relative to the dataset root directory. Multiple records can reuse the same source frame, but the combination of three views in each record is unique. The dataset was created by the Hao Tang team from the School of Computer Science, Peking University, in collaboration with the Beijing Academy of Artificial Intelligence (BAAI).

创建时间:
2026-09-03
原始信息汇总

数据集概述:Orchestra-Bench

Orchestra-Bench 是一个面向三机器人高层协作规划的英文多模态数据集。每个样本提供同一场景中三个不同位置的视角图像、一个宽泛的用户请求,以及为每个机器人分配的协调文本子任务。

核心规模

  • 总计 12,000 个样本,覆盖 24 个场景类别,每类 500 个样本
  • 包含 36,000 个图像引用,基于 3,334 个唯一提取的视频帧
  • 每个样本含三个不同的地面视角:ground_1ground_2ground_3
  • 场景分布:17 个室外类别(8,500 样本)、7 个室内类别(3,500 样本)
  • 数据来源:EgoSchema 贡献 14 个室外源场景,共 7,000 个样本
  • 使用真实视频帧,不含合成或透视变换的鸟瞰图

场景分布

环境 样本数
室外 8,500
室内 3,500

室外场景涵盖公园路径、公园路口、建筑入口、高尔夫球场、网球场、草坪设备场、花园工作区、夜间道路、运动场、住宅道路、公共广场、花园小径、人行道、城市步道、草地、泥地等。室内场景包括办公室与实验室、零售与餐饮、卧室、厨房、客厅、浴室、走廊。

数据格式

主文件为 manifest.jsonl,每行包含:

  • id / scene_class / environment:识别与分类信息
  • scene_description:场景文字描述
  • source_scene:源场景引用
  • collaboration_pattern:协作模式描述
  • views:三个地面视角的图像路径、源视频及时间戳
  • user_task:英文用户任务描述
  • subtasks:三机器人的高层协调子任务,包含明确的移动动作,覆盖导航、观察、路线检查、盲区覆盖、报告与相互引导等,不涉及底层控制或轨迹

图像路径相对于数据集仓库根目录,允许不同记录复用同一源帧,但每条记录的三视角组合唯一。

使用示例

python from datasets import load_dataset

dataset = load_dataset( "BAAI/Orchestra-Bench", data_files="manifest.jsonl", split="train", ) print(dataset[0])

来源说明

该数据集由北京大学计算机学院 Hao Tang 团队与北京人工智能研究院(BAAI)联合研究成果。

搜集汇总
数据集介绍
Orchestra-Bench 数据集图片
构建方式
在具身智能与多机器人协同领域,构建贴近真实场景的高层规划数据集需兼顾视觉多样性与任务协作性。Orchestra-Bench通过从EgoSchema等真实视频源中提取3344个独特帧,为每个样本组合来自同一场景三个不同地面视角的图像,并依据24个户外与室内场景类别均匀采样,每类500例,形成总计12000个样本。每条样本由大范围用户请求及分配给三个机器人的协调子任务构成,子任务均包含明确的移动动作,并覆盖导航、观察、路径检查、盲区覆盖与相互引导等高层行为,而非低层控制轨迹。
使用方法
研究人员可通过HuggingFace datasets库直接加载Orchestra-Bench,在主文件中指定manifest.jsonl并采用训练分割,即可获取包含场景类别、环境类型、场景描述、协作模式、三个视角图像路径、用户任务及三个机器人子任务的完整样本。每条记录中,views字段给出机器人标识、视角类型、相对图像路径、源视频与时间戳,subtasks字段则为每个机器人提供具体的高层协作指令。该数据集适用于视觉语言模型的多机器人协同规划训练与评测,支持图像到文本任务,推动具身智能体在复杂室内外环境中的联合决策研究。
背景与挑战
背景概述
多机器人协同规划长期是具身智能与机器人学习领域的核心议题,传统方法多依赖低层控制信号或精确环境建模,难以泛化至开放动态场景。2024年,北京大学计算机学院Hao Tang团队与北京智源人工智能研究院联合发布Orchestra-Bench,该数据集面向三机器人高层协作规划,融合多视角视觉观测与自然语言指令,涵盖24类室内外场景共12,000个样本及36,000条图像引用,旨在推动视觉语言模型在真实世界多智能体协作中的推理与规划能力。其构建填补了多机器人协调与多模态指令理解交叉领域的基准空白,为后续研究提供了可复用的评测框架。
当前挑战
该数据集所应对的领域问题——多机器人高层协作规划——本身极具挑战:智能体需在动态、部分可观测环境中基于异构视角理解模糊的用户意图,并生成语义一致且互补的子任务,同时兼顾导航、侦察与盲区覆盖等复杂行为。构建过程中亦面临显著困难:多视角真实视频帧的采集与对齐需确保时序一致性与空间多样性,高层协作模式的设计需避免低层控制细节并保证任务可执行性,场景类别间的平衡与图像帧的跨记录复用则要求精细的数据管理策略,以维持基准的公平性与泛化评估效力。
常用场景
经典使用场景
在多机器人协同与具身智能领域,Orchestra-Bench的经典使用场景聚焦于高层协作规划:给定同一场景下三个不同地面视角的图像,以及一段宽泛的用户指令,模型需为每台机器人生成协调的子任务。该数据集以12,000个样本覆盖24类室内外场景,每样本提供三路真实视频帧视图,并附有明确的移动动作与协作模式标签,从而支持视觉-语言模型进行多视角信息融合与任务分配研究。
解决学术问题
该数据集直击多机器人协作中任务分解与角色分配的学术难题,尤其是高层规划缺乏大规模、多视角、真实场景基准的问题。通过提供协同模式标签与显式移动子任务,它使模型能够学习跨视角的盲区覆盖、路径检查与相互引导,推动了视觉-语言模型在具身多智能体系统中的泛化与评估,为多机器人协调研究建立了可复现的基准。
实际应用
在实际应用中,Orchestra-Bench可服务于户外巡检、室内服务与搜救等场景。例如,在公园小径或办公走廊中,机器人团队需根据高层指令协同完成路径清理、障碍检查与目标搜索。数据集中的真实视频帧与协作模式标签,使模型能够直接部署于多机器人系统,实现从自然语言指令到分布式动作的映射,提升任务执行效率与鲁棒性。
数据集最近研究
最新研究方向
在多机器人协同与具身智能交叉领域,Orchestra-Bench正推动高层协作规划研究从单一视角向多视角联合推理演进。该数据集以三机地面视角、宽泛用户指令及显式子任务标注为核心,为视觉语言模型在非结构化环境中的角色分配、盲区覆盖与动态路径协调提供了系统性评测基准。其融合户外EgoSchema真实视频帧与室内场景的混合设计,呼应了当前具身AI对跨场景泛化能力的迫切需求,亦为多智能体通信效率与任务分解策略的实证研究创设了可复现的实验条件,对推动协作式机器人规划的可解释性与鲁棒性具有基准性意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务