遇见数据集

GLM-5.3-Flash Skills Embodied Dataset

收藏
github2026-08-30 更新2026-08-31 收录
官方服务:

资源简介:

一个自主的智能体技能,将自然语言转化为经过物理验证的机器人操作数据集。每个任务都会生成一个LIBERO兼容的HDF5数据集,包含指令、模型文件、动作、观测(图像、关节位置等)和状态信息,经过验证确保可重复性。

An autonomous agent skill that converts natural language into physically validated robotic manipulation datasets. Each task generates a LIBERO-compatible HDF5 dataset containing instructions, model files, actions, observations (such as images, joint positions, etc.) and state information, which has been validated to ensure reproducibility.

创建时间:
2026-08-28
原始信息汇总

GLM-5.3-Flash Skills · Embodied Data Engine 数据集概述

一、数据集简介

该数据集由 GLM-5.3-Flash Skills · Embodied Data Engine 项目生成,旨在将自然语言自动转化为经过物理验证的机器人操作数据集。项目通过智能体技能(Agent Skill)实现场景设计、MuJoCo 编译、四重验证门控、IK 专家生成以及 LIBERO 兼容的 HDF5 数据集收集,全程无需人工干预。

二、数据集内容

任务与数据集

任务名称 成功次数
Put red cube in box(参考任务) 6/6
Green bottle in tray 8/8
Flip open the hinged lid 1/1

每个任务均提供 LIBERO 兼容的 HDF5 数据集,存储于 data/ 目录下,示例结构如下:

text data/put_red_in_box/demo.hdf5 ├─ attrs: instruction, model_file (完整MJCF), env_args, success_rate ├─ actions (T, 8) ├─ obs/ │ ├─ agentview_image (T, 480, 640, 3) │ ├─ robot0_eef_pos / quat / joint_pos / gripper_qpos ├─ states (T, nq + nv) ← 完整仿真状态,可逐帧准确回放 └─ dones (T,)

数据验证

通过 pipeline/verify_libero_compat.py 脚本验证以下内容:

  • model_file 可成功编译
  • states 回放能复现末端执行器位姿(误差 < 1 mm)
  • env_args 可通过 robosuite.make 重建环境
  • 终止状态 dones=True

三、环境依赖

  • Python 版本:3.12
  • 依赖库:MuJoCo 3.4、robosuite 1.5.2、mink、h5py、imageio
  • 运行方式:支持无头模式(offscreen rendering),无需图形界面

四、使用方式

bash

克隆仓库

git clone https://github.com/hxwxss/glm-skills-embodied.git cd glm-skills-embodied pip install -r requirements.txt

运行完整流水线:场景IR → 验证 → 抓取 → 收集数据集

python tasks/put_red_in_box/mujoco_env/run_pipeline.py --episodes 3

五、仓库结构

text ├── skills/agentic-sim2data/ 技能定义(阶段、门控、陷阱参考) ├── tasks/ │ ├── put_red_in_box/mujoco_env/ 参考任务(run_pipeline.py) │ ├── bottle_tray/ 瓶子放置任务(8个片段) │ ├── lid_open/ 铰链盖翻转任务(预览) ├── videos/ MP4录像 ├── data/ 各任务的HDF5数据集 ├── images/ GIF、帧、横幅 └── docs/ ├── PIPELINE.md 架构与阶段详情 ├── VALIDATION.md 门控捕获的所有缺陷 └── ITERATION_LOG.md 完整调试历史

六、文档参考

  • Pipeline架构:https://github.com/hxwxss/glm-skills-embodied/blob/main/docs/PIPELINE.md
  • 验证门控(发现并修复26个缺陷):https://github.com/hxwxss/glm-skills-embodied/blob/main/docs/VALIDATION.md
  • 完整迭代日志:https://github.com/hxwxss/glm-skills-embodied/blob/main/docs/ITERATION_LOG.md
  • 场景溯源:https://github.com/hxwxss/glm-skills-embodied/blob/main/docs/PIPELINE.md#scene-provenance

七、关键特性

  1. 自动生成:从自然语言指令到物理有效的机器人操作数据集,全流程自动化
  2. 多任务支持:包含3个典型操控任务(放置、转移、翻转),覆盖不同操作类型
  3. 标准兼容:数据集与 LIBERO 标准兼容,便于后续模型训练与评估
  4. 可复用技能:完整工作流封装为可复用Agent技能,可迁移至新场景或任务
搜集汇总
数据集介绍
GLM-5.3-Flash Skills Embodied Dataset 数据集图片
构建方式
GLM-5.3-Flash Skills Embodied Dataset 的构建源于一个自主的智能体技能流水线,核心在于将自然语言指令转化为经过物理验证的机器人操作数据集。构建流程起始于场景设计,利用Blender进行原型建模后导出为中间表示,再编译至MuJoCo仿真环境,历经四重验证门控,最终自主编写逆运动学专家策略并采集数据。整个流程无需人工干预,自动化完成场景生成、仿真验证、轨迹规划与数据记录,生成的HDF5数据集兼容LIBERO格式,包含动作序列、视觉观测、关节状态及完整仿真状态,确保每一条数据均经过物理引擎的严格校验。
特点
该数据集以强自主性和高可靠性著称,每一任务均配备完整的状态记录,可实现帧级精确回放,末端执行器位置误差小于1毫米。数据集的构建过程内嵌了26条实践陷阱参考,全部源自真实构建中遇到的缺陷,并通过验证门控自动捕获与修复,充分体现了数据的严谨性与可追溯性。此外,场景设计从Blender的交互式建模到MuJoCo的无头渲染,全程支持无图形界面运行,兼顾了环保与高效。数据集还提供了多任务示例,涵盖放置、抓取、开盖等多样操作,展现了其在复杂操作任务中的广泛适用性。
使用方法
使用者可通过简便的克隆与依赖安装快速上手,运行参考任务的流水线脚本即可生成新数据集。该技能包可部署至智能体环境中,使智能体能够基于新的场景或任务自动复现完整方法论,实现数据集的持续扩展。数据集本身兼容LIBERO工具链,可直接用于机器人学习模型的训练与评估,其中的环境参数与模型文件支持通过robosuite重新构建仿真环境,便于研究者在统一框架下进行对比实验。此外,交互式Blender面板为人工场景调整提供了直观界面,进一步降低了使用门槛。
背景与挑战
背景概述
GLM-5.3-Flash Skills Embodied Dataset 是智谱AI团队于2025年推出的具身智能数据集,旨在将自然语言指令自动转化为物理验证的机器人操作数据集。该数据集由GLM-5.3-Flash模型驱动,通过场景设计、MuJoCo编译、四重验证门控及逆运动学专家系统,自主生成符合LIBERO标准的HDF5格式数据。其核心研究问题在于探索大语言模型在机器人操作任务中的自主数据生成能力,以解决传统人工数据采集成本高昂、效率低下的痛点。该数据集涵盖物体抓取、放置、开盖等操作任务,其自动化pipeline和验证机制为机器人学习提供了可扩展的高质量数据源,对具身智能领域的数据驱动研究具有重要推动作用。
当前挑战
该数据集面临的挑战主要来自两方面。其一,在领域问题层面,机器人操作任务需应对复杂多变的物理环境,如物体形状、摩擦系数、关节自由度等不确定性,且任务指令的语义歧义性对数据生成准确性构成考验。其二,在构建过程中,需确保生成的HDF5数据集与LIBERO环境完全兼容,包括模型文件可编译、状态重放误差小于1毫米以及环境重构无误,这一过程涉及多轮迭代与验证,共发现并修复了26个缺陷。此外,场景设计需从Blender原型过渡到MuJoCo模拟,跨平台转换中的物理一致性维护亦是一大技术难点。
常用场景
经典使用场景
GLM-5.3-Flash Skills Embodied Dataset的核心应用场景聚焦于机器人操作技能的自主生成与仿真数据采集。该数据集通过将自然语言指令自动解析为场景描述,并编译至MuJoCo物理仿真环境,进而生成与LIBERO基准兼容的HDF5格式操作数据集。其典型使用方式包括:基于给定的任务描述(如'将红色方块放入盒子'),驱动完整的pipeline完成场景构建、四重验证门控、逆运动学专家求解及轨迹数据采集,最终产出包含视觉观测、关节状态及完整动力学状态的可复现数据样本。这一流程不仅支持单任务快速定制,亦可通过技能模块(SKILL)的复用拓展至新型场景,为机器人学习社区提供了端到端、规范化的数据生产效率工具。
衍生相关工作
该数据集催生了若干衍生研究方向:首先,其提出的agentic sim2data技能模式启发了后续将大语言模型嵌入机器人数据生成流水线的工作,如自动场景推理与任务规划的深度结合。其次,验证门控机制和错误履历的公开为生成数据质量审计提供了参照基准,衍生出面向仿真数据可信度评估的度量工具。此外,基于GLM-5.3-Flash产出的高保真数据集已开始用于训练视觉-语言-动作模型(VLA),并延伸至多任务技能融合与超长时域操作规划的研究。该数据引擎本身也演化为可嵌入代理框架的标准化插件,推动了开放科学背景下机器人数据共建生态的形成。
数据集最近研究
最新研究方向
在具身智能与仿真到数据自动化的交汇前沿,GLM-5.3-Flash Skills Embodied Dataset开创了以大型语言模型为驱动核心的自主数据生成范式。该数据集依托GLM-5.3-Flash的推理能力,将自然语言指令直接转化为MuJoCo物理仿真环境,并借助四重验证门控与自动编写的逆运动学专家策略,产出兼容LIBERO标准的HDF5格式机器人操作数据。其深远意义在于,它打破了传统遥操作或手工标注在数据规模与成本上的瓶颈,为实现机器人技能学习的规模化、低成本数据供给提供了全新路径,同时也为多任务泛化、仿真到现实迁移等热点研究奠定了坚实基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务