遇见数据集

lecrop-data

收藏
Hugging Face2026-06-28 更新2026-06-29 收录
官方服务:

资源简介:

TerraSentia冠层下导航数据集是一个专注于农业机器人领域的数据集,包含了TerraSentia机器人在作物冠层下进行导航任务时收集的多元时序数据。该数据集源自ROS1数据包,并经过处理以适用于机器学习任务。数据集包含三种配置:cpp配置使用作物跟随/纯追踪控制器,记录路径信息;crow配置使用iLQR控制器,记录作物行、目标点和iLQR时间信息;lecrop配置使用MPPI/强化学习结合视觉的方法,记录距离误差、航向误差、MPPI调试信息和关键点数据。数据以episodes形式组织,每个episode代表机器人连续运动片段,包含多列时间序列数据,每列对应一个ROS主题信号,并配有独立的时间戳向量。此外,每个episode还包含MP4/H.264格式的视频数据,如RGB相机视频、LiDAR点云可视化图和关键点可视化视频。数据字段包括元数据、机器人状态信号、控制命令信号、任务相关信号以及特定于lecrop配置的感知与控制信号。数据集在转换过程中移除了ROS数据包头信息和重型原始传感器数据,以精简结构,适用于机器人导航、控制策略学习、农业自动化、时序预测、模仿学习、强化学习及多模态机器学习模型的研究与开发。

The TerraSentia Canopy Navigation Dataset is a dataset focused on the agricultural robotics domain, containing multivariate time-series data collected during navigation tasks of the TerraSentia robot under crop canopies. It originates from ROS1 data bags and has been processed for machine learning tasks. The dataset includes three configurations: the cpp configuration uses a crop-following/pure pursuit controller and records path information; the crow configuration uses an iLQR controller and records crop rows, target points, and iLQR timing information; the lecrop configuration uses an MPPI/reinforcement learning approach combined with vision, recording distance errors, heading errors, MPPI debugging information, and keypoint data. Data is organized into episodes, each representing a continuous motion segment of the robot, with multiple columns of time-series data corresponding to ROS topic signals and independent timestamp vectors. Additionally, each episode includes MP4/H.264 format video data, such as RGB camera videos, LiDAR point cloud visualizations, and keypoint visualization videos. Data fields encompass metadata, robot state signals, control command signals, task-related signals, and perception and control signals specific to the lecrop configuration. During conversion, ROS data bag headers and heavy raw sensor data were removed to streamline the structure, making it suitable for research and development in robot navigation, control strategy learning, agricultural automation, time-series prediction, imitation learning, reinforcement learning, and multimodal (vision + state) machine learning models.

创建时间:
2026-06-26
原始信息汇总

数据集概要

  • 数据集名称: TerraSentia Under-Canopy Navigation
  • 任务类型: 机器人学(robotics)
  • 标签: 机器人学、农业、冠层下、导航、rosbag、terrasentia
  • 许可证: 其他(other)
  • 主要语言: 葡萄牙语(描述性文字)
  • 来源: 基于 ROS1 bags 提取的 TerraSentia 农业机器人在作物冠层下(under-canopy)的导航数据。

数据配置

数据集包含三个子配置,对应不同的控制器来源:

配置名 规模(episodes) 来源 / 控制器描述 特殊话题特征
cpp 143 Crop-follow / pure-pursuit 控制器 记录 path 话题
crow 31 iLQR 控制器 记录 crop_lines, goal, ilqr_time
lecrop 137 MPPI/RL + 视觉控制器 记录 dist_err, head_err, mppi_*, keypoint

数据结构

  • 每行 = 一个 episode: 代表机器人在地里行驶直至停下的一段连续轨迹。通过里程计速度(经平滑处理)进行分割:行驶速度 > 0.05 m/s 判定为“移动”;静止时间 >= 5 秒则开启新 episode。时长不足 2 秒或消息数少于 20 的 episode 被丢弃。无里程计的 bag 被作为一个完整 episode。
  • 每列 = 一个信号(ROS topic): 存储为列表形式的时间序列。不同话题具有不同采样率,每个话题拥有独立的时间向量 *_t(单位秒,相对于 episode 开始)。
  • 视频列: rgblidar_plotkeypoint_vis_* 采用 Video 类型(MP4/H.264 编码),每个 episode 一个视频,帧率约 10 fps,时间信息记录在对应的 *_t 列中。
  • 已移除字段: 原始 ROS 的元数据(header, seq, stamp, frame_id, covariance, layout)、原始深度传感器和 LiDAR/PointCloud 点云数据、以及 tfcamera_info 等中间传递话题。

数据列说明

元数据(标量)

  • source, episode, bag, duration_s, n_msgs

信号列(列表类型,每组附有时间向量 <g>_t

组名 包含列 原始 ROS 话题
odom_* odom_t, odom_pos_{x,y,z}, odom_quat_{x,y,z,w}, odom_vel_{x,y,z}, odom_angvel_{x,y,z} /…/dlio/odom_node/odom
imu_* imu_t, imu_acc_{x,y,z}, imu_gyro_{x,y,z}, imu_quat_{x,y,z,w} /…/imu
cmd_* cmd_t, cmd_lin_{x,y,z}, cmd_ang_{x,y,z} /…/cmd_vel
motion_* motion_t, motion_lin_{x,y,z}, motion_ang_{x,y,z} /…/motion_command
path_* path_t, path_pos_{x,y,z}, path_quat_{x,y,z,w}(多折线,每个时间步一个列表) /…/path
goal_* goal_t, goal_pos_{x,y,z}, goal_quat_{x,y,z,w} /…/goal(仅 crow
crop_lines_* crop_lines_t, crop_lines_{m1,b1,m2,b2}(表示作物行的直线参数) /…/crop_lines(仅 crow
ilqr_* ilqr_t, ilqr_time /…/ilqr_time(仅 crow
dist_err, head_err 横向和航向误差(预测值) /…/*_error_predicted(仅 lecrop
mppi_dist, elite_scores, value_info MPPI/RL 调试信息,每个为列表的列表 /…/rl_debug/*(仅 lecrop
keypoint 视觉关键点,列表的列表 /…/vision/keypoint(仅 lecrop

视频列(Video 类型,MP4/H.264,约 10 fps,帧时间记录在对应 *_t 列)

列名 内容 原始 ROS 话题
rgb RGB 摄像头视频(640×360) /…/rgb/image_rect_color/compressed(所有配置)
lidar_plot LiDAR 点云与作物行绘图视频(224×224) /lidar_plot(仅 crow
keypoint_vis_argmax, keypoint_vis_heatmap 关键点可视化视频 /…/vision/keypoint_vis_*/compressed(仅 lecrop

注意: 特定配置独有的列在其他配置的 episode 中显示为空(null)。例如 cpp 配置中的部分 cropfollowpp_lecropfollow bags 也会携带 lecrop 的列。

数据来源与预处理

  • 原始数据: 来自 cpp_runscrow_runslecrop_runs 三个 bag 文件夹(包括 rebuttal 经历和已命名的 runs,相同名称的重复 bag 已被去重)。
  • 生成流程: rosbags → 基于移动状态进行运动段分割 → 转换为 Parquet 格式。

使用示例(Python)

python from datasets import load_dataset ds = load_dataset("arthurpompeu/lecrop-data", "cpp", split="train") ep = ds[0]

ep["odom_pos_x"], ep["odom_vel_x"], ep["cmd_lin_x"], ...

搜集汇总
数据集介绍
lecrop-data 数据集图片
构建方式
该数据集源自TerraSentia农业机器人在作物冠层下导航时记录的ROS1 bag文件,经过系统化的分割与清洗流程构建而成。原始bag数据依据机器人里程计速度进行运动状态分割:当平滑后速度超过0.05米/秒时判定为行进状态,静止超过5秒则切分新片段;同时剔除时长不足2秒或消息数低于20条的无效片段。随后移除原始bag中的冗余元数据字段、深度传感器与激光雷达点云等大型原始数据,仅保留核心导航信号,最终将每个有效运动片段转化为Parquet格式的一个独立样本行。
特点
数据集以“一个样本对应一个导航片段”为核心结构,每行包含标量元数据(来源、时长等)和多组时间序列信号列,各信号组拥有独立的相对时间戳。信号涵盖里程计、IMU、速度指令、运动指令、路径与目标点,以及特定于不同控制器的错误预测、MPPI/RL调试信息和视觉关键点等多维模态数据。尤为独特的是,数据集中集成了每段对应的RGB视频、LiDAR点云可视化及关键点可视化视频,以MP4/H.264压缩格式存储,既保持时间对齐又大幅压缩存储空间。
使用方法
用户可通过HuggingFace Datasets库加载,使用`load_dataset`函数并指定配置名称(`cpp`、`crow`或`lecrop`)即可获取对应控制器的数据集分割,并选择`train`划分进行访问。每个样本即为一个导航片段,其下的信号列均为Python列表形式的时序数据,可与对应时间戳联合进行轨迹分析或控制策略研究;视频列则可直接通过HuggingFace Viewer播放或编程读取。对于跨控制器的共享样本,缺少特定信号时对应列自动填充为空值,便于下游分析与建模。
背景与挑战
背景概述
在农业机器人领域,冠层下导航(under-canopy navigation)是精准农业中一项极具挑战性的任务,要求机器人在密集作物行间自主移动,同时避免对植株造成损伤。为此,美国伊利诺伊大学厄巴纳-香槟分校的TerraSentia团队于近年构建并发布了lecrop-data数据集,该数据集源自TerraSentia农业机器人在真实农田环境中的导航实验,由137个运行片段(episodes)组成,涵盖了基于MPPI(模型预测路径积分)与强化学习的视觉导航控制过程。数据集通过ROS1 bag格式采集,并精炼为结构化Parquet文件,每行代表一个连续运动轨迹,包括里程计、IMU、控制指令、路径误差及关键点可视化等多模态信号。lecrop-data的发布为农业机器人领域的导航算法研究提供了标准化的基准资源,尤其推动了基于学习的冠层下运动规划与视觉控制方法的发展。
当前挑战
该数据集所解决的领域核心挑战在于:农田冠层下环境高度结构化但动态变化,作物行间距、光照条件及地面不平整等因素使得传统几何导航方法难以鲁棒泛化,而基于学习的控制需依赖大量标注且时序连续的实地数据,采集成本极高。在构建过程中,lecrop-data面临的主要挑战包括:原始ROS bag数据需要精确的轨迹分割,通过速度阈值(>0.05 m/s)过滤静止时段并将连续运动片段独立成episode,同时剔除短于2秒或少于20条消息的劣质片段;多源控制类型(cpp、crow、lecrop)的数据结构异构,需统一字段命名并处理缺失列;视频流与时间序列的同步存储则需权衡压缩效率与检索精度,最终采用每段视频独立编码为MP4/H.264格式,并记录对应的时间戳向量。
常用场景
经典使用场景
该数据集聚焦于农业机器人在作物冠层下的自主导航任务,尤其适用于评估和训练基于视觉与运动控制的导航算法。经典使用场景包括利用纯追踪(pure-pursuit)、迭代线性二次型调节器(iLQR)以及模型预测路径积分与强化学习(MPPI/RL)等控制策略,通过ROS bag记录的时序信号(如里程计、IMU、命令速度、路径与作物行线)和多模态视频数据(RGB、激光雷达热图、关键点可视化),在真实农田环境下构建端到端的导航学习基准。研究者可将其作为仿真与现实之间过渡的桥梁,测试从传统控制到深度强化学习方法的泛化能力与鲁棒性。
解决学术问题
该数据集系统性地解决了农业机器人田间导航中数据稀少的核心瓶颈,为学术研究提供了多源异构时序数据与视频的标准化测试平台。它涵盖了冠层下导航面临的典型挑战,如光照变化、作物行线检测误差、非结构化地形导致的运动偏差等,从而服务于轨迹跟踪误差分析、控制策略对比、视觉关键点估计与强化学习策略迁移等研究方向。通过提供可直接使用的预处理信号与统一的事件分割格式,该数据集显著降低了研究工作复现成本,推动了从经典控制向数据驱动控制过渡的学术探索,对提升农业自动化和精准农业的智能化水平具有深远意义。
衍生相关工作
该数据集衍生并推动了多个相关工作的开展,包括基于视觉的作物行线检测与关键点回归模型(例如利用lecrop配置中的keypoint和MPPI调试信号进行弱监督学习)、跨控制器策略蒸馏(从iLQR或纯追踪专家轨迹中学习鲁棒导航策略),以及利用多模态视频与激光雷达可视化数据的端到端导航框架。此外,该数据集也激发了针对农业机器人时序数据的数据增强方法研究和行为克隆与强化学习结合的混合导航算法设计,成为连接实验室算法验证与田间实际部署的关键基准资源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务