遇见数据集

lipforcing-results-backup

收藏
Hugging Face2026-07-25 更新2026-07-27 收录
官方服务:

资源简介:

该数据集是NeurIPS 2026 Submission109 Lip Forcing论文的推理结果与真实数据备份,创建于2026年7月24日,源自bai-vscode2环境的本地目录。它主要用于唇部同步或语音驱动面部动画任务的模型评估与比较,包含两个核心部分:推理输出(约7.5GB)和真实数据(约910MB)。推理输出部分存储了多个模型(如ours_1.3b_step500、ours_14b_step600等)在多个基准测试(如hdtf_81f、hallo3_81f等)上的预测结果,每个模型-基准组合目录包含metrics/和pairings/子目录。真实数据部分提供地面真实值,包括hallo3_81、talkvid_81和hdtf_long剪辑,其中hdtf_81的真实数据可通过hdtf_long前81帧重建。数据集还包含一个xdub_hdtf_long_reinference/目录,存储了对hdtf_long基准的重新推理结果。总规模约8.41GB,但部分样本存在缺失。该数据集适用于计算机视觉和多媒体领域的研究,特别是唇部同步算法的性能评估、基准测试和结果复现。

This dataset is a backup of inference results and ground truth data for the NeurIPS 2026 Submission109 Lip Forcing paper, created on July 24, 2026, from a local directory in the bai-vscode2 environment. It is primarily used for model evaluation and comparison in lip synchronization or speech-driven facial animation tasks, consisting of two core parts: inference output (approximately 7.5GB) and ground truth data (approximately 910MB). The inference output part stores predictions from multiple models (e.g., ours_1.3b_step500, ours_14b_step600, etc.) on multiple benchmarks (e.g., hdtf_81f, hallo3_81f, etc.), with each model-benchmark combination directory containing metrics/ and pairings/ subdirectories. The ground truth part provides ground truth values, including hallo3_81, talkvid_81, and hdtf_long clips, where the ground truth for hdtf_81 can be reconstructed from the first 81 frames of hdtf_long. The dataset also includes an xdub_hdtf_long_reinference/ directory storing re-inference results for the hdtf_long benchmark. The total size is approximately 8.41GB, but some samples are missing. It is suitable for research in computer vision and multimedia fields, particularly for performance evaluation, benchmarking, and result reproduction of lip synchronization algorithms.

创建时间:
2026-07-24
原始信息汇总

数据集概述

该数据集是论文《Lip Forcing》(NeurIPS 2026 Submission109)的推理结果与真实标签(GT)备份,数据来源于 2026-07-24 的服务器备份。

数据集内容

数据集主要包含三个部分:

目录 说明
all_inference_outputs/ 主输出存储库(7.5G)
gt/ 真实标签(Ground Truth),包含 910M 数据
xdub_hdtf_long_reinference/ X-Dub 长视频重新推理结果(18 个片段)

1. 推理输出 (all_inference_outputs/)

{模型}_{基准}/ 格式组织,包含的模型与基准如下:

模型:

  • ours_1.3b_step500
  • ours_14b_step600
  • ours_old
  • wav2lip
  • videoretalking
  • musetalk_v1.5
  • diff2lip
  • latentsync_v1.5
  • xdub

基准(Benchmark):

  • hdtf_81f(33)
  • hdtf_cross(33)
  • hdtf_long(33)
  • hallo3_81f(30)
  • hallo3_cross(30)
  • hallo3_validation(200)
  • talkvid_81f(30)

每个输出目录中还包含 metrics/pairings/ 子目录。

2. 真实标签 (gt/)

  • hallo3_81/:30 个片段
  • talkvid_81/:30 个片段
  • hdtf_long/:33 个片段
  • 注意:hdtf_81 的真实标签已在服务器上丢失,但可通过 hdtf_long 的真实标签前 81 帧重新生成(文件名相同)。

3. X-Dub 长视频重新推理

  • 时间:2026-06-16 至 06-17
  • 包含 18 个片段
  • 当前状态:已覆盖 26/33,仍有 7 个未完成

已知缺口

模型/基准 缺失情况
ours_1.3b_step500_hdtf_long 31/33
latentsync_v1.5_hdtf_long 32/33
xdub hdtf_long 26/33
wav2lip_hdtf_81f 31/33
wav2lip_hallo3_81f 29/30
wav2lip_hallo3_validation 199/200
videoretalking_hallo3_cross 29/30

该数据集主要用于 Lip Forcing 论文的推理结果存档与对比验证,适合需要复现或分析该论文实验结果的用户使用。

搜集汇总
数据集介绍
lipforcing-results-backup 数据集图片
构建方式
该数据集源自NeurIPS 2026 Submission109中“Lip Forcing”论文的推理结果与真实标注的备份,由bai-vscode2工作站上的本地目录整理而成。数据集的构建围绕主输出存储库展开,依据“模型_基准”的命名格式组织,涵盖ours_1.3b_step500、ours_14b_step600、wav2lip、videoretalking、museTalk_v1.5等多种唇形同步模型,以及hdtf_81f、hallo3_81f、talkvid_81f等多样化视频基准测试集。每个模型-基准组合均包含独立的metrics和pairings子目录,同时整理了三组ground truth片段(如hallo3_81与talkvid_81各30个片段),以及针对X-Dub模型的长视频重推理成果,确保了实验结果的系统性与可复现性。
特点
该数据集的一大特色在于其多模型、多基准的交叉覆盖结构,既收录了自有模型的逐步迭代版本(如ours_1.3b_step500与ours_14b_step600),也纳入了wav2lip、diff2lip、latentsync_v1.5等公开前沿工具的统一推理输出,为公平对比提供了底层支持。数据注释层面,推理结果与ground truth一一对应,部分基准如hdtf_81的GT虽已丢失,但可通过hdtf_long GT的前81帧重建,体现了数据冗余管理上的巧妙设计。此外,数据集明确记录了备份时刻的已知空缺(如ours_1.3b_step500_hdtf_long仅完成31/33),赋予了数据完整性以透明度,研究者可直接感知每个模型-基准对的覆盖程度。
使用方法
用户可通过分类目录直接访问各模型的推理输出,首先进入all_inference_outputs主目录,再按“模型_基准”格式选取特定组合,例如ours_1.3b_step500_hdtf_81f,其下metrics文件夹存储了可被直接加载的性能评估指标。ground truth存放于独立的gt目录,依据hallo3_81或hdtf_long等基准名称组织,适合作为评估准则进行逐帧对比。针对需补全的数据空缺,如X-Dub的hdtf_long仅26/33结果,用户可利用xdub_hdtf_long_reinference目录中的额外18个clip进一步扩展。对于hdtf_81这类丢失原始GT的情形,可脚本化地从hdtf_long GT中截取前81帧进行替换,从而维持评估一致性。
背景与挑战
背景概述
在数字人驱动和音频驱动的唇形同步生成领域,NeurIPS 2026投稿论文《Lip Forcing》提出了一个专注于高保真唇形同步的推理框架。该数据集“lipforcing-results-backup”由研究团队于2026年7月创建,旨在系统性备份论文中多个模型在多个基准测试上的推理结果与真实数据。其核心研究问题在于评估不同架构(如ours_1.3b_step500、ours_14b_step600、Wav2Lip、MuseTalk等)在多样化的视频基准(如HDTF、Hallo3、TalkVid)上的性能表现,为唇形同步算法的公平比较和复现提供了关键资源。该数据集对语音驱动虚拟人、智能视频会议等应用领域具有潜在影响力,促进了从模型性能基准到跨场景泛化能力的深入研究。
当前挑战
该数据集所解决的领域核心挑战在于:不同模型在复杂唇形同步任务中的鲁棒性评估,尤其是应对长序列、跨ID场景和多种说话风格的条件下保持同步精度。构建过程面临若干显著挑战:第一,数据完整性不足,如HDTF_81的Ground Truth数据已丢失,需依赖长序列前81帧重建;第二,多个模型在特定基准上的推理结果存在缺失,例如ours_1.3b_step500_hdtf_long仅完成31/33个clip,Wav2Lip在hdtf_81f上仅有31/33,LatentSync在hdtf_long完成32/33,X-Dub仅完成26/33;第三,不同模型与基准的配对数量不统一,导致横比困难。这些问题凸显了大规模推理实验中数据管理、存储恢复和结果集成方面的高复杂度。
常用场景
经典使用场景
Lip Forcing — Inference Results Backup 数据集是一个专为唇形驱动(Lip Syncing)与说话人脸生成领域设计的评测备份资源。在视觉与语言交叉的研究中,该数据集汇集了多种主流模型(如Wav2Lip、VideoRetalking、MuseTalk、LatentSync等)在多个基准测试(HDTF、Hallo3、TalkVid)上的推理输出结果与对应的真实标注(Ground Truth),适用于跨模型、跨场景的唇形一致性与视频生成质量的横向比较研究。其经典使用场景包括:评估不同模型在短片段(81帧)、交叉身份、长序列等多样化设置下的表现差异,以及为后续的模型改进提供可复现的评测基准。
解决学术问题
该数据集的核心价值在于解决了唇形驱动研究中长期存在的评测标准不统一与结果不可复现的痛点。通过系统性地备份多模型在统一基准上的推理输出与真实数据,研究者得以公平地对比不同方法在唇形同步精度、视觉自然度、以及时序一致性上的优劣。它尤其有助于揭示现有模型在长视频序列或跨身份泛化场景下的退化现象,推动了学术界对当前唇形生成技术瓶颈的深入理解,并为NeurIPS等顶级会议的研究提供了可量化的验证依据。
衍生相关工作
该数据集作为NeurIPS 2026投稿论文的附属资源,直接支撑了Lip Forcing方法的研究,并衍生出多项后续工作。例如,基于其中记录的推理结果,研究者可以复现并改进对比方法(如Diff2Lip、X-Dub)的管道;数据集中的缺失片段标记(如wav2lip在hdtf_81f仅31/33完整)激发了针对不完整推理的鲁棒性增强研究。更重要的是,该备份为社区提供了标准化评测流程的模板,促使后续工作如VideoReTalking的性能优化和MuseTalk的跨模态融合改进以该数据集为参照,形成了良性的研究生态循环。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务