UniTalk-ASD
收藏资源简介:
UniTalk-ASD数据集包含训练和验证集,数据以CSV文件、音频文件(WAV格式)和视频帧(JPEG格式)的形式存储。CSV文件中包含视频ID、时间戳、人脸边界框坐标、标签(SPEAKING_AUDIBLE或NOT_SPEAKING)、实体ID、标签ID和实例ID等信息。音频文件按视频ID和实体ID组织,视频帧按视频ID和实体ID组织,并以25fps采样。数据集用于评估说话者活跃度,使用mAP指标进行评估。
The UniTalk-ASD dataset includes training and validation sets, with data stored in CSV files, WAV-format audio files, and JPEG-format video frames. The CSV files contain metadata such as video ID, timestamp, face bounding box coordinates, labels (either SPEAKING_AUDIBLE or NOT_SPEAKING), entity ID, label ID, and instance ID. Audio files are organized by video ID and entity ID, while video frames are also organized by video ID and entity ID, with a frame rate of 25fps. This dataset is intended for speaker activity evaluation, and the mAP metric is adopted for performance assessment.
UniTalk-ASD 数据集概述
数据集基本信息
- 项目页面: https://plnguyen2908.github.io/UniTalk-ASD-project-page/index.html
- 论文地址: https://arxiv.org/abs/2505.21954
- 数据集存储: https://huggingface.co/datasets/plnguyen2908/UniTalk-ASD
数据集下载与结构
-
下载方式: 执行
python download_dataset.py --save_path /path/to/the/dataset -
存储需求: 约100-200GB
-
下载时间: 约834.38秒(MacBook Air M4)
-
数据集结构:
root/ ├── csv/ │ ├── val_orig.csv │ └── train_orig.csv ├── clips_audios/ │ ├── train/ │ │ └── <video_id>/ │ │ └── <entity_id>.wav │ └── val/ │ └── <video_id>/ │ └── <entity_id>.wav └── clips_videos/ ├── train/ │ └── <video_id>/ │ └── <entity_id>/ │ ├── <time>.jpg (face) │ └── <time>.jpg (face) └── val/ └── <video_id>/ └── <entity_id>/ ├── <time>.jpg (face) └── <time>.jpg (face)
数据集内容
- CSV文件:
- 包含训练和验证集的CSV文件。
- 每行代表一个面部,包含以下列:
video_id: 视频IDframe_timestamp: 面部时间戳entity_box_x1,entity_box_y1,entity_box_x2,entity_box_y2: 面部边界框坐标label: SPEAKING_AUDIBLE 或 NOT_SPEAKINGentity_id: 面部轨迹ID(格式: video_id:number)label_id: 1 或 0instance_id: 连续面部轨迹ID(格式: entity_id:number)
- 音频文件:
- 存储在
clips_audios文件夹中,按训练和验证集划分。 - 每个视频ID文件夹包含对应实体ID的WAV音频文件。
- 存储在
- 视频文件:
- 存储在
clips_videos文件夹中,按训练和验证集划分。 - 每个视频ID文件夹包含对应实体ID的面部图像。
- 存储在
评估方法
- 评估指标: 使用mAP(平均精度)作为评估指标。
- 评估脚本:
python tool/get_ava_active_speaker_performance.py -g groundtruth.csv -p prediction.csv
子类别评估数据集
- 创建方法: 执行
python trim_dataset.py --path /path/to/your/dataset --new_path /path/to/store/your/new/evaluation/set --list sub_categories/test_(category).csv
数据集转换
- 转换为ASC结构: 执行
python convert_to_ASC.py --source /path/to/your/data --destination /path/to/new/dataset
通过Hugging Face加载数据
-
加载方式: python from datasets import load_dataset dataset = load_dataset("plnguyen2908/UniTalk", split="train|val", trust_remote_code=True)
-
返回内容:
entity_id: 面部轨迹IDimages: 面部裁剪图像列表audio: 从WAV文件读取的音频frame_timestamp: 每个面部裁剪的时间戳label_id: 每个面部的标签(0或1)
预训练权重
- Top performing models:
- TalkNCE: Checkpoint
- LoCoNet: Checkpoint
- TalkNet: Checkpoint
- Fine-tuned on AVA:
- 3h: Checkpoint
- 5h: Checkpoint
- 10h: Checkpoint
- 15h: Checkpoint
- full AVA: Checkpoint




