遇见数据集

tartanaviation-atc-adsb

收藏
Hugging Face2026-06-01 更新2026-06-02 收录
官方服务:

资源简介:

TartanAviation ATC + ADS-B 是一个配对数据集,包含来自匹兹堡KAGC和KBTP机场的空中交通管制(ATC)音频和自动相关监视广播(ADS-B)数据。该数据集由卡内基梅隆大学AirLab的TartanAviation项目对齐整理而成。每个数据样本对应一个由ADS-B触发的音频捕获片段(16kHz单声道),并包含在该时间段内出现的飞机轨迹信息。数据集共包含41,823个音频片段,其中约67%的片段携带ADS-B数据。每个片段的持续时间为2至14分钟,这些是ADS-B触发的连续捕获,而非经过语音活动检测的独立语句(约85%的内容为静默)。数据字段包括:clip_id(格式为{airport}/{date}/{n}的唯一标识符)、airport(机场代码,kagc或kbtp)、date(日期,MM-DD-YY格式)、start/end(片段起止时间戳,音频和ADS-B使用统一时钟)、duration_s(片段持续时间,单位秒)、n_aircraft(片段内飞机数量)、tails(飞机呼号列表,无ADS-B数据时为空列表)、tracks(片段内所有ADS-B数据点列表,每个数据点包含时间戳、呼号、飞机ID、纬度、经度、高度、速度和航向)、audio(16kHz单声道音频数据)。该数据集适用于空中交通管制语音识别、航空语音处理、多模态航空数据分析等任务,为研究终端空域操作提供了宝贵的语音与轨迹配对资源。数据集采用CC-BY-4.0许可证,需引用相关论文。

TartanAviation ATC + ADS-B is a paired dataset comprising air traffic control (ATC) audio and automatic dependent surveillance-broadcast (ADS-B) data from Pittsburgh's KAGC and KBTP airports. This dataset was curated and aligned by the TartanAviation project at the AirLab of Carnegie Mellon University. Each data sample corresponds to an ADS-B-triggered audio capture clip (16 kHz, mono), and contains aircraft trajectory information recorded during the corresponding time period. The dataset contains a total of 41,823 audio clips, of which approximately 67% are accompanied by ADS-B data. Each clip has a duration ranging from 2 to 14 minutes; these are continuous captures triggered by ADS-B, rather than independent utterances processed via voice activity detection, with approximately 85% of the content being silence. The data fields include: clip_id (unique identifier in the format {airport}/{date}/{n}), airport (airport code, either kagc or kbtp), date (date formatted as MM-DD-YY), start/end (start and end timestamps of the clip, using a unified clock for both audio and ADS-B), duration_s (clip duration in seconds), n_aircraft (number of aircraft in the clip), tails (list of aircraft call signs, which is an empty list when no ADS-B data is available), tracks (list of all ADS-B data points within the clip, where each data point includes timestamp, call sign, aircraft ID, latitude, longitude, altitude, speed, and heading), and audio (16 kHz mono audio data). This dataset is applicable to tasks such as air traffic control speech recognition, aviation speech processing, and multimodal aviation data analysis, providing a valuable paired resource of speech and trajectory data for research on terminal airspace operations. The dataset is licensed under CC-BY-4.0, and relevant papers should be cited when using it.

创建时间:
2026-06-01
原始信息汇总

数据集概述:TartanAviation ATC + ADS-B

该数据集提供了配对的全天候空中交通管制(ATC)语音录音与广播式自动相关监视(ADS-B)轨迹数据,来源于卡内基梅隆大学的 TartanAviation 项目。

核心信息

  • 数据来源:美国匹兹堡的 KAGC 和 KBTP 机场。
  • 数据规模:包含 41,823 个音频片段。
  • 音频规格:16 kHz 单声道,WAV 格式。
  • 覆盖范围:约 67% 的片段同时包含 ADS-B 轨迹数据。
  • 许可协议:CC-BY-4.0。

数据结构

每个数据行(一个样本)包含一个 ADS-B 触发的音频片段及该时间段内的飞机轨迹信息。

字段名 类型 说明
clip_id 字符串 片段唯一标识符,格式为 {机场}/{日期}/{序号}
airport 字符串 机场代码,值为 kagckbtp
date 字符串 日期,格式为 MM-DD-YY
start / end 时间戳 音频片段的起止时间(音频与ADS-B共用同一时钟)。
duration_s 浮点数 音频片段时长(秒)。
n_aircraft 整数 该时间段内出现的飞机数量(无ADS-B时为 0)。
tails 字符串列表 该时间段内出现的飞机呼号(无ADS-B时为空列表 [])。
tracks 结构体列表 该时间段内每个ADS-B数据点,包含时间戳(t)、纬度(lat)、经度(lon)、高度(alt)、速度(speed)、航向(heading)和呼号(tail)。
audio Audio(16000) 16 kHz 单声道音频数据。

重要说明

  • 数据特性:音频片段是基于ADS-B信号触发捕获的,时长在2到14分钟之间,并非基于语音活动检测(VAD)的短句,因此约85%的内容为静音。
  • 构建工具:使用 squawk 工具构建。
  • 任务类型:该数据集主要面向自动语音识别(Automatic Speech Recognition, ASR)任务。
搜集汇总
数据集介绍
tartanaviation-atc-adsb 数据集图片
构建方式
TartanAviation ATC + ADS-B数据集由卡内基梅隆大学AirLab团队构建,聚焦于匹兹堡地区KAGC和KBTP机场的空中交通管制场景。该数据集通过ADS-B信号触发机制,将机场管制音频(16kHz单声道)与同步的航空器轨迹数据进行对齐配对。每一条样本记录对应一次ADS-B触发的音频片段,同时包含该时段内所有可检测到的航空器轨迹信息,包括经度、纬度、高度、速度、航向等参数。数据集的构建依托squawk工具完成,共收录41,823个剪辑片段,其中约67%的样本携带有ADS-B数据,形成了音频与轨迹协同的独特多模态资源。
特点
该数据集的核心特点在于时间同步下的多模态对齐能力,音频片段与ADS-B轨迹记录共享同一时间基准,支持精准的声学-运动学关联分析。每个剪辑时长介于2至14分钟之间,虽然大部分时间为静默状态,但这一设计保留了实际的空中交通运行节律。数据字段涵盖机场标识、时间戳、航空器数量、呼号及完整的轨迹结构,特别适合进行航空器识别、轨迹预测与语音活动检测等任务。此外,数据集采用开源CC-BY-4.0许可,便于学术研究与模型复现。
使用方法
使用者可通过HuggingFace Datasets库直接加载该数据集,推荐采用streaming模式以支持大规模流式处理。加载示例中可获取audio字典(包含音频数组与16000Hz采样率)、tails列表(当前时刻航空器呼号)及tracks结构(每个ADS-B探测点的时空参数)。数据以Parquet格式分片存储,支持高效的列式访问。研究人员可将音频特征与轨迹特征融合,构建端到端的航空管制语音理解系统,或利用无ADS-B标签的样本进行半监督学习实验。
背景与挑战
背景概述
TartanAviation ATC + ADS-B数据集由卡内基梅隆大学(CMU)AirLab团队于2024年创建,核心研究问题在于构建航空交通管制语音与广播式自动监视(ADS-B)轨迹数据的多模态对齐资源。该数据集覆盖匹兹堡地区KAGC与KBTP两个机场,包含41,823条语音片段(16kHz单声道音频),每个片段均与ADS-B轨迹同步标注,数据规模达10k-100k级别。其创新性地将ATC语音与飞行轨迹耦合,为航空安全研究、空域态势感知及语音-感知多模态学习提供了标准化的基准资源,对推动终端空域操作的智能化分析具有重要影响力。
当前挑战
该数据集所解决的领域问题挑战在于,航空交通管制场景中语音与轨迹数据长期处于分离状态,现有数据集缺乏细粒度的时间同步多模态信息,难以支撑端到端的语音-轨迹联合建模。构建过程中的核心挑战体现在:1)需要精确对齐16kHz音频信号与高频率ADS-B数据,确保时间戳在微秒级同步;2)约33%的航迹缺乏ADS-B支持,导致部分标注存在轨迹缺失,需要在无监督条件下推断飞机身份;3)音频剪辑长度为2-14分钟且约85%为静音,需设计有效的阈值触发机制以捕获有效语音事件,同时避免数据冗余。
常用场景
经典使用场景
在航空通信与语音识别交叉领域,TartanAviation ATC + ADS-B数据集为研究者提供了高度对齐的空中交通管制语音与广播式自动相关监视轨迹数据。该数据集最经典的使用场景是构建基于语音的飞行器识别与跟踪系统,研究者可借助2至14分钟不等的音频片段及其对应的飞机尾号、经纬度、高度等时空信息,训练模型将语音指令实时关联至具体航空器,从而提升终端空域态势感知的智能化水平。
衍生相关工作
围绕这一数据集,学术界已涌现出一系列衍生工作。基于TartanAviation提供的对齐多模态形式,Patrikar等人提出的TartanAviation项目率先发布了完整的图像、语音与轨迹基准;后续研究者借鉴其数据组织形式,进一步开发了面向语音驱动的飞行轨迹预测模型,以及基于自监督学习的管制员意图推断方法。此外,该数据集也催生了squawk这样的高效数据处理框架,为更大规模、多机场的航空语音与ADS-B联合数据集构建提供了可复现的技术路线,助力形成开放、标准化的空域研究生态。
数据集最近研究
最新研究方向
TartanAviation ATC + ADS-B数据集代表了航空语音与轨迹数据融合研究的前沿方向。该数据集通过将匹兹堡KAGC和KBTP机场的空中交通管制音频与ADS-B广播式自动相关监视轨迹进行精确对齐,构建了41,823个多模态样本,其中67%包含飞机识别信息。这为空管语音识别、飞行轨迹预测及人机协同决策等核心问题提供了珍贵的同步数据资源。特别值得关注的是,该数据集独创性地采用ADS-B信号触发的片段截取策略,保留了2至14分钟连续空域运行场景,克服了传统VAD(语音活动检测)方法割裂管制的时序依赖性的局限。结合CMU团队在终端空域运行领域的前沿探索,该数据集有望推动基于深度学习的管制指令理解与多目标跟踪系统迈向更鲁棒、更接近真实运行环境的性能边界,为未来智慧空管系统的发展奠定关键数据基座。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务