OSResight/tartanair-fish-v3-parquet
收藏资源简介:
--- dataset_info: features: - name: episode_id dtype: int32 - name: frame_idx dtype: int32 - name: jpeg dtype: binary - name: depth sequence: float32 - name: seg sequence: uint16 - name: pose sequence: dtype: float64 length: 16 - name: intrinsics sequence: dtype: float32 length: 4 - name: gravity sequence: dtype: float32 length: 3 - name: scene dtype: string - name: trajectory dtype: string - name: dataset dtype: string - name: camera_model dtype: string - name: image_h dtype: int32 - name: image_w dtype: int32 - name: num_frames_in_episode dtype: int32 config_name: default splits: - name: train num_examples: 0 license: bsd-3-clause task_categories: - robotics tags: - slam - visual-odometry - episode-data - parquet --- # tartanair-fish-v3-parquet Per-frame Parquet dataset for ReCAST tracker training. ## Schema One row per frame, grouped by `episode_id`. Arrow memory-mapped access enables reading specific frames without loading entire episodes. | Column | Type | Description | |--------|------|-------------| | episode_id | int32 | Episode identifier | | frame_idx | int32 | Frame index within episode | | jpeg | binary | JPEG-encoded RGB frame | | depth | list\<float32\> | Flat H×W depth map | | seg | list\<uint16\> | Semantic segmentation (empty if absent) | | pose | fixed\_size\_list\<float64, 16\> | 4×4 camera-to-world pose (vision convention) | | intrinsics | fixed\_size\_list\<float32, 4\> | [fx, fy, cx, cy] in pixels | | gravity | fixed\_size\_list\<float32, 3\> | World-frame gravity direction | | camera_model | string | "pinhole" or "equidistant" | ## Conventions - **Poses**: Vision convention (X=right, Y=down, Z=forward). Normalized during conversion. - **Depth**: Projective z-depth (all datasets, normalized during conversion). - **Gravity**: Unit vector pointing downward in world frame. ## Provenance - Dataset: tartanair - Episodes: 0 - Frames: 0 - Created: 2026-03-15T19:46:29.610714+00:00 - Build script: `scripts/convert_episodes_to_parquet.py` - Git commit: `652912ed324118c3d69a652be186f0ca129de190`
数据集信息: 特征: - 字段名:episode_id,数据类型:int32 - 字段名:frame_idx,数据类型:int32 - 字段名:jpeg,数据类型:binary - 字段名:depth,数据类型:float32序列 - 字段名:seg,数据类型:uint16序列 - 字段名:pose,数据类型:float64序列,长度为16 - 字段名:intrinsics,数据类型:float32序列,长度为4 - 字段名:gravity,数据类型:float32序列,长度为3 - 字段名:scene,数据类型:string - 字段名:trajectory,数据类型:string - 字段名:dataset,数据类型:string - 字段名:camera_model,数据类型:string - 字段名:image_h,数据类型:int32 - 字段名:image_w,数据类型:int32 - 字段名:num_frames_in_episode,数据类型:int32 配置名称:default 数据集划分: - 名称:train,示例数量:0 许可证:BSD-3条款许可证 任务类别: - 机器人学(Robotics) 标签: - 同步定位与建图(SLAM) - 视觉里程计(Visual Odometry) - 片段数据(Episode Data) - Parquet格式 # tartanair-fish-v3-parquet 适用于ReCAST跟踪器训练的逐帧Parquet格式数据集。 ## 模式(Schema) 每帧对应一行数据,按`episode_id`分组。借助Arrow内存映射访问方式,可在无需加载完整片段的情况下读取指定帧。 | 列名 | 数据类型 | 描述 | |--------|------|-------------| | episode_id | int32 | 片段标识符 | | frame_idx | int32 | 片段内的帧索引 | | jpeg | binary | JPEG编码的RGB帧 | | depth | list<float32> | 展平的H×W深度图 | | seg | list<uint16> | 语义分割结果(若不存在则为空) | | pose | fixed_size_list<float64, 16> | 4×4相机到世界坐标系的位姿(遵循视觉坐标系约定) | | intrinsics | fixed_size_list<float32, 4> | 以像素为单位的[fx, fy, cx, cy]相机内参 | | gravity | fixed_size_list<float32, 3> | 世界坐标系下的重力方向 | | camera_model | string | "pinhole"(针孔相机)或"equidistant"(等距相机) | ## 约定 - **位姿**:遵循视觉坐标系约定(X轴向右,Y轴向下,Z轴向前),转换过程中已完成归一化。 - **深度**:投影式z深度(适用于所有数据集),转换过程中已完成归一化。 - **重力向量**:世界坐标系下指向下方的单位向量。 ## 数据集来源 - 数据集名称:tartanair - 片段总数:0 - 总帧数:0 - 创建时间:2026-03-15T19:46:29.610714+00:00 - 构建脚本:`scripts/convert_episodes_to_parquet.py` - Git提交哈希:`652912ed324118c3d69a652be186f0ca129de190`



