OmniEAR
收藏资源简介:
OmniEAR是一个全面评估语言模型在具身任务中推理能力的框架。该数据集涵盖了1500个场景,跨越家庭和工业领域,通过文本表示连续的物理属性和复杂的空间关系。OmniEAR的目的是评估模型在理解物理属性如何影响动作、能力以及协调需求方面的能力,从而揭示当前模型在具身推理方面的局限性。
OmniEAR is a comprehensive framework for evaluating the reasoning capabilities of language models in embodied tasks. This dataset encompasses 1500 scenarios across household and industrial domains, utilizing text to represent continuous physical properties and complex spatial relationships. The goal of OmniEAR is to evaluate models' capacity to comprehend how physical properties impact actions, functional capabilities, and coordination demands, thus uncovering the current limitations of existing models in embodied reasoning.
OmniEAR 数据集概述
基本信息
- 数据集名称: OmniEAR (OmniEmbodied)
- 研究论文: Benchmarking Agent Reasoning in Embodied Tasks
- 机构: 浙江大学
- 许可证: MIT
- GitHub Stars:
数据集简介
OmniEAR 是一个评估语言模型在具身任务中推理能力的综合框架,专注于物理交互、工具使用和多智能体协作的动态推理。
关键贡献
- 新颖评估框架: 首个通过需要理解物理属性决定动作、能力和协作需求的场景来评估具身推理的框架。
- 全面基准: EAR-Bench 提供1,500个具有连续物理属性和动态能力的场景。
- 基础洞察: 实证显示当前语言模型缺乏核心具身推理能力,性能下降超过60%。
数据集统计
基础统计
- 总场景数: 1,500
- 总任务文件: 1,481
- 总任务实例: 16,592
- 交互对象: 64,057
- 空间节点(房间): 6,634
- 平均每场景对象数: 42.7
- 平均每场景房间数: 4.4
- 协作智能体对: 1,481
对象类别与材料
- 对象分布: 容器 (27.5%)、工具 (23.6%)、电器 (14.0%)、家具 (9.7%)、消耗品 (7.6%)、其他 (17.6%)
- 主要材料: 塑料 (21.5%)、金属 (17.6%)、木材 (12.9%)、玻璃 (9.8%)、织物 (7.9%)、陶瓷 (6.0%)
领域覆盖
- 应用领域: 实验室 (39.0%)、办公室 (18.8%)、工业 (11.5%)、医疗 (6.2%)、家庭 (6.2%)、教育 (4.2%)、零售 (3.2%)、服务 (2.0%)、娱乐 (1.8%)、交通 (1.5%)
- 房间类型: 实验室 (28.3%)、存储 (18.6%)、工作区 (14.9%)、办公室 (11.5%)、车间 (8.2%)
任务分类
单智能体任务
- 直接命令 (L1): 基本指令跟随
- 属性推理 (L2): 连续属性比较和推理
- 工具使用 (L2): 通过工具操作动态获取能力
- 复合推理 (L3): 集成多步规划与多重挑战
多智能体任务
- 显式协作 (L1): 明确的协调指令
- 隐式协作 (L2): 自主协调需求识别
- 复合协作 (L3): 需要工具使用和协调的复杂多智能体场景
数据集访问
- EAR-Bench 数据集: 位于
data/目录,包括任务定义、场景配置和评估指标。 - 专家轨迹 SFT 数据集: 高质量专家演示轨迹 (1,982 样本),托管于 🤗 HuggingFace。
主要结果
- 性能下降: 所有模型在从显式指令到基于约束的推理时表现显著下降。
- 规模效应: 较大模型表现更好,但在复合推理任务中仍困难。
- 微调限制: 监督微调显著提高单智能体性能,但对多智能体增益有限。
引用
bibtex @misc{wang2025omniearbenchmarkingagentreasoning, title={OmniEAR: Benchmarking Agent Reasoning in Embodied Tasks}, author={Zixuan Wang and Dingming Li and Hongxing Li and Shuo Chen and Yuchen Yan and Wenqi Zhang and Yongliang Shen and Weiming Lu and Jun Xiao and Yueting Zhuang}, year={2025}, eprint={2508.05614}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2508.05614}, }

- 1OmniEAR: Benchmarking Agent Reasoning in Embodied Tasks浙江大学 · 2025年



