遇见数据集

TA2.0_animation_dataset

收藏
Hugging Face2026-08-03 更新2026-08-04 收录
官方服务:

资源简介:

TA2.0 Animation Dataset 是一个用于说话头像的动漫风格动画数据集,包含11,255个AI生成的视频剪辑,总时长约30.3小时。每个剪辑展示一个动漫角色说话,分辨率为1280×1280,帧率25fps,使用H.264视频和AAC音频编码,每段约10秒。视频由美团LongCat团队开发的LongCat-Video-Avatar音频驱动头像生成模型生成,以参考角色图像为条件,由9种语言(英语、韩语、德语、法语、荷兰语、意大利语、西班牙语、葡萄牙语、波兰语)的语音音频驱动。生成后经过自动和人工质量控制:自动过滤运动伪影和字幕,人工审查移除角色身份偏离的剪辑,对于多脸情况只保留音视频同步评分最高的面部。数据集提供每段剪辑的元数据,包括文件路径、唯一剪辑ID、参考角色ID(可用于身份不重叠的分割)、运动模式(active/static)、语言、帧数、时长、视频质量评分(vqa_score)、语音清晰度(c50)、信噪比(snr)以及黑边填充大小(pad_*)。音频来源于多个开放许可的语音语料库(如Multilingual LibriSpeech等),均允许商业使用。数据集以单一训练集划分提供,可通过Hugging Face datasets库加载或直接下载文件使用。注意:所有视频内容为合成动画,质量评分为自动估计值,无逐剪辑唇同步评分,左右黑边可通过pad_*列裁剪。数据集采用Apache 2.0许可证,但嵌入的音频保留其原始许可(CC BY 4.0/3.0/CC0 1.0)。

TA2.0 Animation Dataset is an anime-style animation dataset for talking avatars, containing 11,255 AI-generated video clips with a total duration of approximately 30.3 hours. Each clip shows an anime character speaking, with a resolution of 1280×1280, frame rate of 25fps, H.264 video and AAC audio encoding, and each clip lasts about 10 seconds. The videos are generated by the LongCat-Video-Avatar audio-driven avatar generation model developed by Meituans LongCat team, conditioned on a reference character image and driven by speech audio in 9 languages (English, Korean, German, French, Dutch, Italian, Spanish, Portuguese, Polish). After generation, automatic and manual quality control is applied: automatic filtering of motion artifacts and subtitles, manual review to remove clips with identity deviation, and for multi-face cases, only the face with the highest audio-visual synchronization score is retained. The dataset provides metadata for each clip, including file path, unique clip ID, reference character ID (usable for non-overlapping identity splits), motion mode (active/static), language, number of frames, duration, video quality score (vqa_score), speech intelligibility (c50), signal-to-noise ratio (snr), and black border padding sizes (pad_*). Audio sources are from multiple open-licensed speech corpora (e.g., Multilingual LibriSpeech), all allowing commercial use. The dataset is provided as a single training split and can be loaded via the Hugging Face datasets library or by directly downloading the files. Note: All video content is synthetic animation, quality scores are automatically estimated, there is no per-clip lip-sync score, and left/right black borders can be cropped using the pad_* columns. The dataset is licensed under Apache 2.0, but the embedded audio retains its original licenses (CC BY 4.0/3.0/CC0 1.0).

创建时间:
2026-07-22
原始信息汇总

TA2.0 动画数据集概述

基本信息

  • 数据集名称:TA2.0 Animation Dataset
  • 许可协议:Apache License 2.0
  • 语言:英语、韩语、德语、法语、荷兰语、意大利语、西班牙语、葡萄牙语、波兰语(共9种)
  • 规模:11,255 个剪辑片段(约 30.3 小时),规模类别为 10K<n<100K
  • 标签:视频、会说话的虚拟形象、动画、音频驱动动画、虚拟形象动画、视频生成、动漫、合成、唇形同步

数据内容

  • 视频:11,255 个 AI 生成的动漫风格说话虚拟形象视频片段,共计 2,723,833 帧(约 30.26 小时)
  • 分辨率与帧率:1280×1280 @ 25 fps,H.264 视频 + AAC 音频,每个片段约 10 秒
  • 角色:6,487 个独特的参考角色(以 ref_id 标识)
  • 数据划分:仅包含单一 train 分割
  • 生成方式:使用 LongCat-Video-Avatar(美团 LongCat 团队)音频驱动虚拟形象视频生成模型,基于参考角色图像和语音音频生成,并经过人脸跟踪、裁剪、质量评分和人工审核

元数据字段

字段 类型 说明
file_name str 视频文件的相对路径
clip_id str 唯一剪辑 ID(clip_00000 起)
ref_id str 参考角色 ID,相同 ref_id 的剪辑来自同一参考图像,可用于身份不重叠的数据划分
motion_mode str 生成动作设置:active(5,641 个)或 static(5,614 个)
language str 驱动语音语言:英语 4,974 / 韩语 1,510 / 德语 1,439 / 法语 1,139 / 荷兰语 762 / 意大利语 425 / 西班牙语 423 / 葡萄牙语 374 / 波兰语 209
frame_num int 帧数(90–249)
duration_sec float 时长(frame_num / 25
vqa_score float DOVER 视频质量评分(0–1 融合尺度)
c50 float 语音清晰度(C50,dB)
snr float 语音信噪比(dB)
pad_top/bottom/left/right float 适配 1280×1280 画布时添加的黑色填充边距(像素)。本版本中上下边距恒为 0,约 96% 的片段存在左右边距(中位数约 253/265 px),可通过裁剪列 [pad_left : 1280 - pad_right] 去除黑边

注意vqa_scorec50snr 为模型估计信号,用于筛选/加权,并非真实标注。

生成与筛选流程

  • 使用 LongCat-Video-Avatar 模型生成(模型权重以 MIT 许可证发布)
  • 自动过滤运动伪影(光流异常)和屏幕文字/字幕(OCR)
  • 对每个剩余片段进行人工审核,移除偏离参考身份的片段
  • 每个源视频仅保留一个片段:检测到多张人脸时,仅保留与音频最匹配(AV 同步评分最高)的人脸

音频来源

驱动语音音频来自 9 个公开许可的语音语料库(均为允许商业使用的宽松许可):Multilingual LibriSpeech、The Peoples Speech、VoxPopuli、LibriSpeech、Zeroth-Korean、FLEURS、YODAS、AMI Meeting Corpus 和 MInDS-14。各语料库的详细出处、片段数量、许可详情及删除请求参见 ATTRIBUTION.md 文件。

使用方式

python from datasets import load_dataset # datasets >= 3.0 for video support

ds = load_dataset("neosapience/TA2.0_animation_dataset")

或直接下载文件,并通过 file_name 关联 metadata.csv / metadata.parquet

局限性

  • 所有视频内容均为合成(AI 生成动画),角色外观在片段内可能略有漂移
  • 质量评分为自动估计值,应视为相对信号
  • 未提供逐片段唇形同步评分(自动 AV 同步估计依赖人脸检测,在风格化动漫脸上不够准确)
  • 左右黑色填充属于像素内容的一部分,如需去除可使用 pad_* 列进行裁剪

许可证说明

  • 数据集以 Apache License 2.0 发布
  • 视频内容为使用 LongCat-Video-Avatar 生成的合成内容,模型权重以 MIT 许可证分发,对生成输出不设限制
  • 嵌入的语音音频仍受原始许可证约束(CC BY 4.0 / CC BY 3.0 / CC0 1.0,均为允许商业使用的宽松许可),各语料库的详细归属见 ATTRIBUTION.md

致谢

  • 该数据集是“첨단 GPU 활용 지원 사업”项目(项目周期 2026-04-01 至 2026-07-15)的成果,由 정보통신산업진흥원 和 한국정보통신진흥협회 支持
  • 视频生成模型:美团 LongCat 团队的 LongCat-Video-Avatar

更新记录

  • 2026-07-28:移除了 sync_score 元数据列(因依赖人脸检测框,在风格化动漫脸上不够准确,逐片段数值不可靠)。其余元数据和所有视频不变
  • 2026-07-23:初始公开发布(11,255 个剪辑、元数据、音频归属)
搜集汇总
数据集介绍
TA2.0_animation_dataset 数据集图片
构建方式
TA2.0动画数据集由美团LongCat团队开发的LongCat-Video-Avatar模型生成,该模型以参考角色图像为条件,由九种语言的语音音频驱动,生成风格化的动漫式说话头像视频。生成后的视频经过精心构建流程:首先进行自动化过滤,剔除运动伪影和屏幕文字;随后由人工审查,确保角色身份与参考一致,并移除偏差样本;最后,针对多脸情况,仅保留音频同步得分最高的面部区域。每个视频片段均裁剪为1280×1280分辨率,时长约10秒,并附带详细元数据,包括身份标识、运动模态、语言、画质评分及填充边距等。
特点
该数据集包含11,255个高质量的AI生成动漫风格说话头像视频片段,总时长约30.3小时,涵盖9种语言,涉及6,487个独特角色,满足多样性需求。每个片段均配有丰富的元数据,包括视频质量评分(DOVER)、语音清晰度(C50)和信噪比(SNR)等,这些客观指标专为数据筛选和加权设计。此外,数据集具备身份不相交分割能力,通过ref_id字段支持严格的角色身份隔离,为模型训练和评估提供坚实保障。所有内容均为合成生成,且采用Apache 2.0许可,便于学术与商业应用。
使用方法
使用该数据集,用户可通过HuggingFace datasets库轻松加载,只需调用load_dataset函数即可获取完整数据及元数据。也可直接下载文件,并根据file_name字段关联metadata.csv或metadata.parquet中的信息。元数据中的vqa_score、c50和snr列可用于过滤低质量样本或作为训练时的加权依据,而pad_*列则便于去除视频中的黑边,适应不同模型输入要求。该数据集特别适用于训练音频驱动的说话头像生成模型、视频质量评估研究以及多语言语音动画合成等任务,为相关领域提供可靠的数据支持。
背景与挑战
背景概述
TA2.0动画数据集(TA2.0 Animation Dataset)由Neosapience团队于2026年7月发布,作为韩国尖端GPU应用支持项目(첨단 GPU 활용 지원 사업)的成果之一,核心解决音频驱动的虚拟化身动画生成领域中的高质量数据稀缺问题。该数据集包含11,255个AI生成的动漫风格说话头像视频片段,总时长约30.3小时,每个片段为10秒、1280×1280分辨率、25帧率,由美团LongCat团队开发的LongCat-Video-Avatar模型驱动,覆盖9种语言,并附有图像质量、语音清晰度(C50)和信噪比(SNR)等元数据。这些视频经过自动化过滤(如光流异常、屏幕文字检测)和人工审查,确保角色身份一致性。数据集的发布填补了动漫风格说话头像数据集的空白,为多语言、多动作模式的说话头像生成研究提供了大规模、带质量标注的训练与评测基准,对音频驱动视频生成领域具有重要影响力。
当前挑战
该数据集面临的挑战包括多个层面。首先,在领域问题层面,音频驱动的说话头像生成需同步口型、表情与头部动作,尤其在动漫风格中,面部特征高度风格化,自动口型同步评估(如AV-sync评分)因面部检测不准确而难以可靠实现,导致数据集中未提供每个片段的嘴唇同步分数,这一缺陷限制了模型性能的精确度量与优化。其次,数据构建过程中,生成视频需处理多种源语音语料(如多个CC许可的公共语音库),涉及音频的切割、重编码及与视频的融合,同时需确保多语言覆盖的平衡性(如英语占44%,波兰语仅占1.9%),并付出巨大努力进行人工审查以剔除身份偏差片段。此外,质量评估指标(如VQA分数、C50、SNR)均为模型估算,非真实标注,在动画内容上可能失真,且左/右黑边占像素内容96%的片段需要额外处理,增加了数据使用的复杂性。
常用场景
经典使用场景
TA2.0 Animation Dataset作为大规模、多语言、AI生成的动漫风格说话头像视频语料库,在语音驱动的肖像动画合成领域具有里程碑式的价值。其经典用途聚焦于训练和评估音频驱动的说话头像生成模型,这些模型能够根据输入的语音信号和参考人物图像,生成唇形同步、面部表情自然且头部运动协调的动态视频。该数据集包含超过1.1万个剪辑,覆盖9种语言,并附带丰富的元数据(如运动模式、语言、质量评分等),为研究者提供了精细的样本控制和条件生成实验的基础。其高分辨率(1280×1280)和统一格式(25fps、约10秒时长)确保了模型训练的稳定性和可复现性,从而支撑从零开始训练鲁棒的说话头像生成器,或对现有模型进行领域自适应与微调。
实际应用
在实际应用中,TA2.0支持构建高性能的虚拟助手、数字人主播和在线教育虚拟讲师,其多语言特性尤其有利于全球化部署——例如,在客服系统中,AI可根据用户语音实时驱动动漫化身进行多语言应答,提升交互自然度。在游戏与互动娱乐领域,该数据集的动漫风格与多种运动模式(active/static)为非玩家角色(NPC)的动态对话提供了可控的动画素材,降低了动画制作成本。此外,高质量合成的样本可用于影视预可视化、广告营销中的虚拟形象代言,以及社交平台上个性化的虚拟形象视频生成。借助其质量评分元数据,开发者可以实现智能样本过滤,确保生成内容的高标准,从而在生产环境中可靠地提供一致且流畅的虚拟人体验。
衍生相关工作
该数据集的发布直接激发了多个方向的延伸研究。基于其提供的质量信号和身份标签,衍生出首个动漫风格下音频-视觉同步质量评估模型,弥补了传统人脸检测在动漫面孔上失效的空白(原始README已指出此局限,催生了风格自适应同步评分器的开发)。此外,多语言驱动信号的加入促使研究者构建跨语言语音到动画的迁移框架,实现少数语言到主要语言的知识蒸馏。数据集中丰富的运动模式为开发运动风格可控的生成模型提供了基准,而合成数据中的固有伪影则被用作对抗性样本,训练更鲁棒的判别器。在评测层面,该数据集被用作多模态视频生成领域的标准基准,支撑了针对生成视频的时空一致性、身份保持和唇形同步等维度的全面评估协议,推动了该领域的规范化发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务