遇见数据集

Caltech Tennis Dataset (CalTennis)

收藏
arXiv2026-06-19 更新2026-06-20 收录
官方服务:

资源简介:

CalTennis是由加州理工学院创建的大规模多视角网球视频数据集,旨在为单目到三维姿态估计提供野外环境下的基准评估。该数据集包含超过1100万帧(51小时)的网球训练和比赛视频,覆盖40名运动员,采用2-6台同步消费级相机以60Hz频率采集,其数据规模达到现有野外数据集的10倍。数据集通过标准化采集协议实现低成本自动化采集,利用网球场的几何特征进行相机校准与同步。该数据集主要应用于计算机视觉和运动分析领域,致力于解决单目三维姿态估计在深度感知、足部接触检测和身体形态一致性等关键问题上的性能评估瓶颈,为体育科学和生物力学分析提供高质量数据支撑。

CalTennis is a large-scale multi-view tennis video dataset developed by the California Institute of Technology (Caltech), designed to provide benchmark evaluations for monocular-to-3D pose estimation in unconstrained outdoor environments. This dataset contains over 11 million frames (51 hours) of tennis training and competition videos, covering 40 athletes. It is captured using 2 to 6 synchronized consumer-grade cameras at 60Hz, with a data scale 10 times that of existing outdoor datasets. The dataset enables low-cost automated data collection via a standardized acquisition protocol, and utilizes the geometric features of tennis courts for camera calibration and synchronization. Primarily applied in the fields of computer vision and motion analysis, this dataset aims to resolve performance evaluation bottlenecks of monocular 3D pose estimation in key scenarios including depth perception, foot contact detection, and body shape consistency, while offering high-quality data support for sports science and biomechanical analysis.

提供机构:
加州理工学院
创建时间:
2026-06-19
原始信息汇总

数据集概况

CalTennis 是一个大规模、多视角的网球视频数据集,专门用于评估野外环境下单目到三维(monocular-to-3D)人体姿态估计任务。

核心规模

  • 总帧数:超过1100万帧(约51小时),涵盖40名运动员的网球练习与比赛片段
  • 采集频率:60Hz
  • 视角数量:每段录像使用2至6台同步摄像机
  • 数据集规模:比现有野外人体动作视频数据集大10倍

主要特点

  • 大规模野外数据:1103万帧,51小时未编排的真实运动
  • 多视角同步:每段会话2-6个同步视角,支持通过多视角一致性进行无标签评估
  • 专家级运动:聚焦高速、大幅度的网球动作(发球、截击、冲刺)
  • 远距离估计:90%的姿态距离相机13.4–16.7米,比Human3.6M等实验室基准更具深度估计挑战
  • 隐私保护:所有面部已模糊处理,数据经IRB批准并取得知情同意

数据划分

数据集提供两个子集,便于快速迭代:

子集 数据文件
mini metadata_mini.jsonl
mid metadata_mid.jsonl

数据特征

每条记录包含以下字段:

  • video(字符串):视频文件路径
  • timestamps(字符串):时间戳
  • calibration(字符串):标定信息
  • session_id(字符串):会话标识
  • video_id(字符串):视频标识

目录结构

. ├── [session文件夹]/ # 会话视频 ├── camera_calibration/ # 内参和外参标定文件 ├── metadata_mini.jsonl # mini子集索引 ├── metadata_mid.jsonl # mid子集索引 └── README.md

许可与标签

  • 许可协议:cc-by-nc-4.0(仅限非商业使用)
  • 任务类型:关键点检测(keypoint-detection)
  • 标签:人体姿态估计、3D姿态、多视角、体育、SMPL-X
搜集汇总
数据集介绍
Caltech Tennis Dataset (CalTennis) 数据集图片
构建方式
CalTennis数据集依托标准网球场地的几何约束,采用低成本消费级设备(iPhone 14及以上机型)与可折叠三脚架(约40美元/个)进行多视角视频采集。研究团队在球场周围部署2至6台60Hz同步摄像机,覆盖半场与全场范围,记录40名运动员(涵盖大学校队至业余水平)的真实训练与比赛场景。视频以1920×1080像素高清格式录制,总计捕获超过1100万帧(51小时)数据。摄像机标定依托场地线交点自动解算外参,并通过全局时间偏移优化实现毫秒级同步,全程无需专业设备或人工标注。
特点
该数据集是首个大规模多视角真实运动场景基准,具有三方面突出特点:其一,规模达1100万帧,较现有野外人体运动数据集大10倍,包含最多6个同步视角、13.4-16.7米的深度变化范围及85%的姿态空间覆盖率,显著超越此前基准;其二,引入无标签评估范式,利用多视角一致性作为单目3D姿态估计算法误差的下界,无需MOCAP或穿戴传感器;其三,提出足部动作、稳定性与体形一致性三类创新评估指标,可揭示深度漂移、足部滑步和肢体比例不一致等传统基准无法检测的失效模式。
使用方法
用户可通过Hugging Face平台(demalenk/caltennis)直接下载数据集,包含原始多视角视频及标定参数。使用时应将各视角视频输入任意单目3D姿态估计模型(如PromptHMR、WHAM等),获取SMPL-X参数后,通过提供的相机标定与时间同步模块将预测结果统一至世界坐标系。利用跨视角一致性指标(平移误差、姿态误差、足部速度一致性、稳定性差异)进行无标签评估,或使用最大似然估计融合多视角结果获得共识姿态。项目网站提供完整的数据采集协议与评估代码,支持复现与扩展。
背景与挑战
背景概述
单目三维人体姿态估计是计算机视觉领域的核心课题之一,在医疗康复、体育分析、影视动画及具身智能中具有广泛应用前景。然而,现有基准数据集多依赖昂贵且受限的动作捕捉系统,难以捕捉真实、无脚本且高速运动的人体姿态。2026年,加州理工学院的研究团队由Ilona Demler、Pietro Perona等人主导,发布了Caltech Tennis Dataset(CalTennis),旨在填补这一空白。该数据集包含超过1100万帧(51小时)从40名运动员的网球训练与比赛中采集的多视角视频,采用2至6台60Hz消费级相机同步拍摄,规模是此前同类数据集10倍以上。研究团队利用网球场的标准化几何结构,开发了一套低成本、可复制的数据采集协议,并引入无标签的多视角一致性评估框架。CalTennis不仅为单目姿态估计算法提供了前所未有的挑战性基准,也推动了面向真实场景的运动分析研究。
当前挑战
CalTennis所面临的挑战集中体现于三个方面。其一,在领域问题层面,当前最先进的单目姿态估计模型在深度估计、足地接触检测及人体形状重建上表现出显著的不稳定性。实验表明,尽管关节角度恢复已较为准确,但各模型在度量尺度深度估计上出现剧烈且不真实的抖动,帧间与视角间的足部接触判断相互矛盾,同一运动员在不同视角下的肢体长度与身体比例亦存在系统性偏差,这直接制约了下游生物力学分析与精细运动评价的可靠性。其二,在数据集构建过程中,实现无标记、低成本且高精度的多视角数据采集是一大挑战。团队需在消费级相机间实现毫秒级的时序同步与亚像素级的空间标定,并借助仅有的球场线交点信息完成每部相机的内外参恢复,这要求算法对视角变化、光照波动及运动员高速运动具备鲁棒性。此外,在40名运动员、11余万帧数据的规模上,自动化处理不仅需要高效的计算流程,还需确保隐私保护与伦理合规,进一步加剧了构建的复杂性。
常用场景
经典使用场景
在计算机视觉与运动分析领域,CalTennis数据集被广泛用于评估与改进单目到三维人体姿态估计算法在野外的表现。由于该数据集包含了超过1100万帧、51小时的真实网球训练与比赛视频,且由2至6台同步消费级摄像机以60Hz频率拍摄,它特别适用于测试模型在快速、复杂、非脚本化运动场景中的泛化能力。研究者利用其多视角一致性特性,无需昂贵的动作捕捉设备即可对单目姿态估计器进行无标签误差衡量,从而深入剖析深度估计、足部接触与身体形状等关键维度的性能瓶颈。
衍生相关工作
CalTennis的发布催生了一系列重要的衍生研究工作。一方面,研究者基于其多视角一致性评估协议,开发出更鲁棒的深度校正模块与足部接触优化策略,如改进的迭代姿态精炼网络和视频级身体形状一致性预测器。另一方面,该数据集启发了面向特定运动的姿态估计基准构建方法,推动了如WorldPose等大规模野外运动数据集的设计理念革新。此外,针对CalTennis上不同模型在平移、姿态与稳定性指标上的表现差异,学界探索了多任务联合训练与模型集成策略,以期在临床生物力学分析和精细运动分析等实际任务中实现更可靠的估计,进一步拓展了计算机视觉与人类运动科学的交叉研究边界。
数据集最近研究
最新研究方向
CalTennis作为目前规模最大的野外多视角专业运动视频数据集,引领了基于多视角一致性的无标签式单目三维人体姿态评估新范式。当前前沿研究聚焦于剖析深度估计不稳定性、足部触地检测不一致性及体型参数跨视角漂移等隐性失效模式,并创新性地提出了步法、稳定性等面向下游生物力学应用的评估指标。该数据集揭示了现有最优模型在绝对距离、地面接触与体态恢复上的系统性缺陷,为运动分析、临床步态评估及人形机器人模仿学习等应用领域指明了亟待突破的关键瓶颈。
相关研究论文
  • 1
    CalTennis: Large Multi-View Tennis Video Dataset and Benchmark of Monocular-to-3D Pose Estimation加州理工学院 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务