TA2.0_animation_dataset
收藏资源简介:
TA2.0 Animation Dataset 是一个用于说话头像的动漫风格动画数据集,包含11,255个AI生成的视频剪辑,总时长约30.3小时。每个剪辑展示一个动漫角色说话,分辨率为1280×1280,帧率25fps,使用H.264视频和AAC音频编码,每段约10秒。视频由美团LongCat团队开发的LongCat-Video-Avatar音频驱动头像生成模型生成,以参考角色图像为条件,由9种语言(英语、韩语、德语、法语、荷兰语、意大利语、西班牙语、葡萄牙语、波兰语)的语音音频驱动。生成后经过自动和人工质量控制:自动过滤运动伪影和字幕,人工审查移除角色身份偏离的剪辑,对于多脸情况只保留音视频同步评分最高的面部。数据集提供每段剪辑的元数据,包括文件路径、唯一剪辑ID、参考角色ID(可用于身份不重叠的分割)、运动模式(active/static)、语言、帧数、时长、视频质量评分(vqa_score)、语音清晰度(c50)、信噪比(snr)以及黑边填充大小(pad_*)。音频来源于多个开放许可的语音语料库(如Multilingual LibriSpeech等),均允许商业使用。数据集以单一训练集划分提供,可通过Hugging Face datasets库加载或直接下载文件使用。注意:所有视频内容为合成动画,质量评分为自动估计值,无逐剪辑唇同步评分,左右黑边可通过pad_*列裁剪。数据集采用Apache 2.0许可证,但嵌入的音频保留其原始许可(CC BY 4.0/3.0/CC0 1.0)。
TA2.0 Animation Dataset is an anime-style animation dataset for talking avatars, containing 11,255 AI-generated video clips with a total duration of approximately 30.3 hours. Each clip shows an anime character speaking, with a resolution of 1280×1280, frame rate of 25fps, H.264 video and AAC audio encoding, and each clip lasts about 10 seconds. The videos are generated by the LongCat-Video-Avatar audio-driven avatar generation model developed by Meituans LongCat team, conditioned on a reference character image and driven by speech audio in 9 languages (English, Korean, German, French, Dutch, Italian, Spanish, Portuguese, Polish). After generation, automatic and manual quality control is applied: automatic filtering of motion artifacts and subtitles, manual review to remove clips with identity deviation, and for multi-face cases, only the face with the highest audio-visual synchronization score is retained. The dataset provides metadata for each clip, including file path, unique clip ID, reference character ID (usable for non-overlapping identity splits), motion mode (active/static), language, number of frames, duration, video quality score (vqa_score), speech intelligibility (c50), signal-to-noise ratio (snr), and black border padding sizes (pad_*). Audio sources are from multiple open-licensed speech corpora (e.g., Multilingual LibriSpeech), all allowing commercial use. The dataset is provided as a single training split and can be loaded via the Hugging Face datasets library or by directly downloading the files. Note: All video content is synthetic animation, quality scores are automatically estimated, there is no per-clip lip-sync score, and left/right black borders can be cropped using the pad_* columns. The dataset is licensed under Apache 2.0, but the embedded audio retains its original licenses (CC BY 4.0/3.0/CC0 1.0).
TA2.0 动画数据集概述
基本信息
- 数据集名称:TA2.0 Animation Dataset
- 许可协议:Apache License 2.0
- 语言:英语、韩语、德语、法语、荷兰语、意大利语、西班牙语、葡萄牙语、波兰语(共9种)
- 规模:11,255 个剪辑片段(约 30.3 小时),规模类别为 10K<n<100K
- 标签:视频、会说话的虚拟形象、动画、音频驱动动画、虚拟形象动画、视频生成、动漫、合成、唇形同步
数据内容
- 视频:11,255 个 AI 生成的动漫风格说话虚拟形象视频片段,共计 2,723,833 帧(约 30.26 小时)
- 分辨率与帧率:1280×1280 @ 25 fps,H.264 视频 + AAC 音频,每个片段约 10 秒
- 角色:6,487 个独特的参考角色(以
ref_id标识) - 数据划分:仅包含单一
train分割 - 生成方式:使用 LongCat-Video-Avatar(美团 LongCat 团队)音频驱动虚拟形象视频生成模型,基于参考角色图像和语音音频生成,并经过人脸跟踪、裁剪、质量评分和人工审核
元数据字段
| 字段 | 类型 | 说明 |
|---|---|---|
file_name |
str | 视频文件的相对路径 |
clip_id |
str | 唯一剪辑 ID(clip_00000 起) |
ref_id |
str | 参考角色 ID,相同 ref_id 的剪辑来自同一参考图像,可用于身份不重叠的数据划分 |
motion_mode |
str | 生成动作设置:active(5,641 个)或 static(5,614 个) |
language |
str | 驱动语音语言:英语 4,974 / 韩语 1,510 / 德语 1,439 / 法语 1,139 / 荷兰语 762 / 意大利语 425 / 西班牙语 423 / 葡萄牙语 374 / 波兰语 209 |
frame_num |
int | 帧数(90–249) |
duration_sec |
float | 时长(frame_num / 25) |
vqa_score |
float | DOVER 视频质量评分(0–1 融合尺度) |
c50 |
float | 语音清晰度(C50,dB) |
snr |
float | 语音信噪比(dB) |
pad_top/bottom/left/right |
float | 适配 1280×1280 画布时添加的黑色填充边距(像素)。本版本中上下边距恒为 0,约 96% 的片段存在左右边距(中位数约 253/265 px),可通过裁剪列 [pad_left : 1280 - pad_right] 去除黑边 |
注意:vqa_score、c50 和 snr 为模型估计信号,用于筛选/加权,并非真实标注。
生成与筛选流程
- 使用 LongCat-Video-Avatar 模型生成(模型权重以 MIT 许可证发布)
- 自动过滤运动伪影(光流异常)和屏幕文字/字幕(OCR)
- 对每个剩余片段进行人工审核,移除偏离参考身份的片段
- 每个源视频仅保留一个片段:检测到多张人脸时,仅保留与音频最匹配(AV 同步评分最高)的人脸
音频来源
驱动语音音频来自 9 个公开许可的语音语料库(均为允许商业使用的宽松许可):Multilingual LibriSpeech、The Peoples Speech、VoxPopuli、LibriSpeech、Zeroth-Korean、FLEURS、YODAS、AMI Meeting Corpus 和 MInDS-14。各语料库的详细出处、片段数量、许可详情及删除请求参见 ATTRIBUTION.md 文件。
使用方式
python from datasets import load_dataset # datasets >= 3.0 for video support
ds = load_dataset("neosapience/TA2.0_animation_dataset")
或直接下载文件,并通过 file_name 关联 metadata.csv / metadata.parquet。
局限性
- 所有视频内容均为合成(AI 生成动画),角色外观在片段内可能略有漂移
- 质量评分为自动估计值,应视为相对信号
- 未提供逐片段唇形同步评分(自动 AV 同步估计依赖人脸检测,在风格化动漫脸上不够准确)
- 左右黑色填充属于像素内容的一部分,如需去除可使用
pad_*列进行裁剪
许可证说明
- 数据集以 Apache License 2.0 发布
- 视频内容为使用 LongCat-Video-Avatar 生成的合成内容,模型权重以 MIT 许可证分发,对生成输出不设限制
- 嵌入的语音音频仍受原始许可证约束(CC BY 4.0 / CC BY 3.0 / CC0 1.0,均为允许商业使用的宽松许可),各语料库的详细归属见
ATTRIBUTION.md
致谢
- 该数据集是“첨단 GPU 활용 지원 사업”项目(项目周期 2026-04-01 至 2026-07-15)的成果,由 정보통신산업진흥원 和 한국정보통신진흥협회 支持
- 视频生成模型:美团 LongCat 团队的 LongCat-Video-Avatar
更新记录
- 2026-07-28:移除了
sync_score元数据列(因依赖人脸检测框,在风格化动漫脸上不够准确,逐片段数值不可靠)。其余元数据和所有视频不变 - 2026-07-23:初始公开发布(11,255 个剪辑、元数据、音频归属)





