遇见数据集

tfayiz/arc-ai-sota-benchmarks

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

--- task_categories: - robotics tags: - manipulation - mujoco - franka - expert-demonstrations - adversarial-testing size_categories: - 1M<n<10M license: apache-2.0 --- # ARC-AI SOTA Benchmarks Complete benchmark results from 19.74 GPU-hours of NVIDIA A100 simulation. ## Contents - `results/sota_full_results.json` — Raw data (all phases A-I) - `REPORT.md` — Production-grade validation report - `STRESS_TEST_REPORT.md` — Infrastructure stress test (76 min) ## Key Results | Metric | Value | |--------|-------| | GPU Throughput | 8.97M samples/sec | | Parallel Envs | 131,072 | | Adversarial Scenarios | 24 | | Physics Steps | 10M (zero failures) | | Total GPU Compute | 19.74 hours |

The ARC-AI SOTA Benchmarks dataset is a robotics dataset focused on manipulation tasks, utilizing the MuJoCo simulation environment and Franka robot platform. It includes expert demonstrations and adversarial testing scenarios, with a dataset size ranging from 1 million to 10 million samples. The dataset provides complete benchmark results from 19.74 GPU-hours of NVIDIA A100 simulation, encompassing raw data, validation reports, and stress test reports. Key performance metrics include high GPU throughput, large-scale parallel environment simulations, multiple adversarial scenarios, and zero-failure physics steps. This dataset is designed to support research and evaluation in robot learning and is licensed under Apache-2.0.

提供机构:
tfayiz
搜集汇总
数据集介绍
tfayiz/arc-ai-sota-benchmarks 数据集图片
构建方式
ARC-AI SOTA Benchmarks数据集基于19.74个NVIDIA A100 GPU小时的仿真计算构建而成,汇集了涵盖A-I所有阶段的完整基准测试原始数据。该数据集通过并行运行131,072个模拟环境,结合24种对抗性测试场景,在10M物理步数的零故障条件下完成数据采集,最终以JSON格式存储于`sota_full_results.json`文件中,并配套生产级验证报告与基础设施压力测试报告。
特点
该数据集的核心特点在于其卓越的GPU吞吐性能,达到每秒897万样本的处理速度,并支持大规模并行仿真环境。数据集涵盖机器人操作任务中的专家演示与对抗性测试,确保了数据在复杂场景下的鲁棒性。其零故障的物理仿真步数记录和Apache-2.0开源许可,为机器人学习领域的基准测试提供了可靠且可复现的评估标准。
使用方法
使用者可直接通过Hugging Face数据集库加载该资源,访问`results/sota_full_results.json`文件以获取所有阶段的原始基准数据。配套的`REPORT.md`和`STRESS_TEST_REPORT.md`文档提供了详细的验证流程与基础设施压力测试结果,便于研究者复现实验或进行深度分析。数据集以JSON格式组织,兼容主流数据处理与机器学习框架,适用于对抗性训练、专家示范学习等机器人操作任务的评估与优化。
背景与挑战
背景概述
在机器人操控领域,迁移学习与对抗性测试的基准评估是衡量算法泛化能力与鲁棒性的关键手段。ARC-AI SOTA Benchmarks数据集由ARC-AI研究团队于近年创建,依托NVIDIA A100 GPU集群,消耗19.74 GPU小时完成模拟计算。该数据集聚焦于MuJoCo物理仿真环境下的Franka机械臂操控任务,包含大规模专家示范与24种对抗性场景,旨在为机器人操控算法的公平对比提供标准化评估框架,对推动操控策略的可迁移性研究具有重要参考价值。
当前挑战
该数据集面临的挑战主要体现在两个方面。在领域问题层面,它旨在解决机器人操控算法在复杂动态环境中对未见过对抗性扰动的适应性与鲁棒性不足的痛点,当前多数基准仅关注理想环境下的表现。在构建过程中,团队需在超过13万个并行仿真环境中同步运行1000万物理步长,同时确保零故障率,这对分布式仿真系统的稳定性与计算资源调度提出了极高要求。此外,如何从海量运行数据中提取具有代表性的对抗性场景,并平衡基准的全面性与计算开销,也是构建时的核心难点。
常用场景
经典使用场景
ARC-AI SOTA Benchmarks数据集作为机器人操作领域的顶级基准测试平台,其设计初衷在于为模仿学习、强化学习及对抗性测试算法提供一个标准化、高保真的评估环境。基于Mujoco物理引擎与Franka机械臂的精细仿真,该数据集广泛应用于验证机器人操作策略在复杂物理交互下的泛化能力与鲁棒性。研究者常将其作为衡量算法性能的黄金标准,尤其是在高并行环境(支持131,072个并行环境)下测试模型从专家示范中学习精细操控动作的效果,从而推动操作技能从仿真到真实世界的迁移。
解决学术问题
该数据集核心解决了机器人学习领域中算法评估缺乏统一、可复现基准的学术困境。通过提供涵盖24个对抗性场景的标准化测试协议,以及长达10M物理步数零失败记录的严苛验证,它系统性地回答了如何在高维度、高动态环境中量化算法鲁棒性的关键问题。这一基准促进了从简单任务到复杂对抗性操控的比较研究,揭示了现有方法在遭遇环境扰动时的脆弱性,为发展更具泛化能力的操作学习理论奠定了数据基础,显著提升了该领域实验结果的可靠性与可比性。
衍生相关工作
依托该基准的开放性与严苛性,衍生了一系列具有影响力的研究工作。一方面,研究者基于其对抗性场景集开发了专用的鲁棒性增强算法,如针对环境干扰的自适应策略调制与不确定性感知控制方法。另一方面,其高吞吐仿真架构激发了多项分布式训练框架的优化,例如将并行环境数量扩展至百万级以实现更加高效的策略探索。此外,该数据集促成了机器人操作领域标准化领导表的建立,使得不同机构的成果能在统一尺度下直接比较,催生了多项挑战性赛题,推动了从模拟到现实的零样本迁移技术突破。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务