遇见数据集

HKUSTAudio/Talker-T2AV-Data

收藏
Hugging Face2026-05-24 更新2026-05-31 收录
官方服务:

资源简介:

Talker-T2AV-Data 是一个用于 Talker-T2AV 模型的干净训练数据包,支持联合说话音频-视频生成,采用自回归扩散建模。数据集包含元数据文件(如 train.csv,其中包含样本ID、数据源、分割、文本、音频路径、运动路径、视频路径等列)、分片归档文件(按模态和数据源分组)以及提取后的音频、运动和视频目录。该数据集适用于文本到视频和文本到语音任务,涉及说话人头部、音频视频生成、语音和视频处理,支持中文和英文语言。

--- license: apache-2.0 language: - 中文 - 英文 task_categories: - 文本到视频(text-to-video) - 文本到语音(text-to-speech) tags: - 人脸讲话(talking-head) - 音视频生成(audio-video-generation) - 语音(speech) - 视频(video) --- # Talker-T2AV-Data **基于自回归扩散建模的联合讲话音视频生成** [论文(arXiv 2604.23586)](https://arxiv.org/abs/2604.23586) · [代码(GitHub)](https://github.com/zhenye234/Talker-T2AV) · [模型(Hugging Face)](https://huggingface.co/HKUSTAudio/Talker-T2AV) · [示例(项目官网)](https://talker-t2av.github.io/) 本数据集为Talker-T2AV提供纯净训练数据包。解压分片归档后,`metadata/train.csv` 中的文件路径均相对于数据集根目录。 ## 内容 - `metadata/train.csv`: Talker-T2AV使用的训练索引文件。 - `shards/*.tar`: 按模态与数据集来源分组的干净归档分片。 - `audio/`, `motion/`, `video/`: 解压分片后生成的目录。 `train.csv` 包含以下列: - `sample_id`:样本标识符 - `dataset_source`:数据集来源 - `split`:数据集划分 - `text`:输入文本 - `wav_path`:音频文件路径 - `motion_pt_path`:运动参数文件路径 - `video_path`:视频文件路径 - `pt_length`:参数序列长度 - `fps`:帧率 ## 下载与解压 bash hf download HKUSTAudio/Talker-T2AV-Data --repo-type dataset --local-dir ./Talker-T2AV-Data cd ./Talker-T2AV-Data for f in shards/*.tar; do tar -xf "$f"; done ## 配合Talker-T2AV训练使用 bash export TRAIN_CSV=$(pwd)/metadata/train.csv export DATA_ROOT=$(pwd) `Talker-T2AV/training/dataset.py` 会基于`DATA_ROOT`解析`wav_path`、`motion_pt_path`与`video_path`的相对路径。 ## 引用格式 bibtex @misc{ye2026talkert2avjointtalkingaudiovideo, title={Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling}, author={Zhen Ye and Xu Tan and Aoxiong Yin and Hongzhan Lin and Guangyan Zhang and Peiwen Sun and Yiming Li and Chi-Min Chan and Wei Ye and Shikun Zhang and Wei Xue}, year={2026}, eprint={2604.23586}, archivePrefix={arXiv}, primaryClass={cs.CV}, url={https://arxiv.org/abs/2604.23586}, }

提供机构:
HKUSTAudio
二维码
社区交流群
二维码
科研交流群
商业服务