DiffTrack
收藏资源简介:
DiffTrack是一个用于分析视频生成模型中时间对应关系的框架。它通过构建基于提示生成的视频数据集,并使用伪真实轨迹标注来评估视频扩散模型中3D注意力机制的各个组成部分对建立时间对应关系的贡献。该数据集包括对象和场景两个子集,每个子集包含50个文本提示和相应的50个视频。
DiffTrack is a framework for analyzing temporal correspondence in video generation models. It constructs prompt-generated video datasets and uses pseudo-ground-truth trajectory annotations to evaluate the contributions of each component of the 3D attention mechanism in video diffusion models to establishing temporal correspondence. This dataset includes two subsets: object and scene, with each subset containing 50 text prompts and their corresponding 50 videos.
DiffTrack数据集概述
基本信息
- 标题: Emergent Temporal Correspondences from Video Diffusion Transformers
- 作者: Jisu Nam1, Soowon Son1, Dahyun Chung2, Jiyoung Kim1, Siyoon Jin1, Junhwa Hur†3, Seungryong Kim†1
- 机构: 1KAIST AI, 2Korea University, 3Google DeepMind
- 贡献: * Equal contribution. †Co-corresponding author.
- arXiv: 链接
- 代码: 未提供具体链接
核心内容
- TL;DR: 通过视频扩散变换器(DiT)生成的视频具有涌现的时间对应关系
- DiffTrack概述:
- 揭示视频扩散变换器(DiTs)在视频生成过程中如何建立时间对应关系
- 给定提示和第一帧中的起始点,DiffTrack跟踪单个点在视频DiTs中跨帧的对齐方式
- 以零样本方式从生成视频和真实视频中提取连贯的运动轨迹
- 实际应用包括:
- 零样本点跟踪
- 通过新颖的引导方法实现运动增强的视频生成
分析结果
CogVideoX-5B中的时间匹配分析
- 表示选择: 查询-键匹配比中间特征匹配具有更高的准确性
- 层间分析: 跨层和时间步的查询-键匹配的调和平均值显示时间对应主要由有限的层集控制
- 噪声水平分析:
- 时间匹配随着噪声减少而改善
- 早期时间步更依赖文本嵌入和自帧注意力
- 后期时间步转向跨帧注意力以增强连贯性
应用
零样本点跟踪
- TAP-Vid数据集上的定量比较:
- 结合DiffTrack的视频DiTs在零样本跟踪上优于所有基于单图像训练的视觉基础模型和基于两视图图像或视频训练的自监督模型
- 定性比较:
- DiffTrack在CogVideoX-5B上产生更平滑和准确的轨迹
- DINOv2和VFS在时间动态上表现不佳,轨迹不一致
运动增强视频生成
- 示例提示:
- "He takes a slow, appreciative sip, his eyes closing momentarily as he savors the complex flavors."
- "A determined individual, ascends a thick, rugged rope hanging from a towering rock face."
- "A motorcycle cruising along a coastal highway."
- 效果: 交叉注意力引导(CAG)增强时间匹配并纠正合成视频中的运动不一致
DiffTrack分析框架
评估数据集构建
- 对象数据集: 50个动态对象中心视频的文本提示
- 场景数据集: 50个带有相机运动的静态场景的文本提示
- 生成: 每个提示使用CogVideoX-2B生成50个视频
- 评估方法: 使用CoTracker获取伪地面真实轨迹
时间对应估计
- 匹配成本计算:
- 计算第一帧和第j帧描述符之间的匹配成本
- 使用Softmax和通道维度d
- 对应估计:
- 通过选择每个查询的最高得分位置获得匹配点
- 轨迹重建:
- 通过连接匹配点并插值回RGB空间形成时间运动轨迹
评估指标
- 匹配精度: 测量跨帧点对齐的精确度
- 置信度分数: 测量每个点在注意力图中对其匹配的关注强度
- 注意力分数: 测量跨帧交互在视频生成中的影响强度
- 综合评估: 计算归一化分数的调和平均值
引用
bibtex @misc{nam2025emergenttemporalcorrespondencesvideo, title={Emergent Temporal Correspondences from Video Diffusion Transformers}, author={Jisu Nam and Soowon Son and Dahyun Chung and Jiyoung Kim and Siyoon Jin and Junhwa Hur and Seungryong Kim}, year={2025}, eprint={2506.17220}, archivePrefix={arXiv}, primaryClass={cs.CV}, url={https://arxiv.org/abs/2506.17220}, }

- 1Emergent Temporal Correspondences from Video Diffusion Transformers韩国科学技术院(KAIST), 韩国大学, 谷歌DeepMind · 2025年



