Awesome Long-Term Video Understanding
收藏资源简介:
该合集专注于长视频理解领域,收录了长视频(未经修剪的视频)相关的数据集、研究论文和工具。合集覆盖了表示学习、高效建模、长视频大语言模型、动作定位、密集视频描述、时间视频定位、长视频预测等多个任务主题,旨在为研究人员提供资源索引和整理。
This collection focuses on the field of long video understanding, and collects datasets, research papers and tools related to long videos (i.e., untrimmed videos). It covers multiple task themes including representation learning, efficient modeling, long-video large language models (long-video LLMs), action localization, dense video captioning, temporal video grounding, and long video prediction, aiming to provide researchers with curated resource indices and organized research resources.
数据集详情页面概述
该页面是一个名为 "Awesome Long-Term Video Understanding" 的 GitHub 仓库,专注于整理和收集关于长视频理解领域的学术研究、数据集及相关资源。
核心研究主题
该仓库主要关注如何理解和分析持续时间较长、未经剪辑的真实世界视频,涵盖了从表示学习到具体应用任务的多个前沿研究方向。
主要研究方向
- 表示学习 (Representation Learning):探索如何从未经剪辑的长视频中学习多粒度、层次化的视频-语言表示,为下游任务提供基础。
- 长视频高效建模 (Efficient Modeling in Long-Term Videos):研究在长视频中进行高效处理的方法,如内存增强的视觉变换器、特征库和自适应帧采样等。
- 长视频大语言模型 (Long-Term Video Large Language Models):汇集了针对长视频设计的各种大语言模型,例如用于超长第一人称视频推理的 Ego-R1、零样本长视频理解的 VideoINSTA 等。
- 动作定位 (Action Localization):
- 时序动作定位 (Temporal Action Localization):在未剪辑视频中定位动作发生的时间区域。该部分提供了相关论文集合(如 ActionFormer、TriDet)和资源链接。
- 音视频事件定位 (Audio-Visual Event Localization):在未剪辑视频中对同时发生的音频和视觉事件进行定位。
- 密集视频描述 (Dense Video Captioning):为长视频生成多句、连贯的事件描述。主要工作包括 Video ReCap、Vid2Seq 以及视频段落描述相关研究。
- 时序视频定位 (Temporal Video Grounding):根据自然语言查询在视频中定位相应的时间片段。该部分列出了大量相关论文和综述。
- 长时视频预测 (Long-Term Video Prediction):预测视频未来长时间序列的内容。
- 其他任务 (Other Tasks):涵盖群组动作质量评估、时空定位、目标跟踪、视频问答和视频摘要等。
数据集与工具
该页面整理了一个长视频(未剪辑)数据集表格,部分示例如下:
| 数据集 | 来源 | 数量 | 时长 | 主要任务 |
|---|---|---|---|---|
| EgoLife | 日常生活 | 6 | 44.3h | 理解与推理 |
| ActivityNet 1.3 | YouTube | 20k | - | 动作定位 |
| MovieNet | 电影 | 1.1k | >2h | 电影理解 |
| HowTo100M | - | 1.22M/136M clips | 582h | 预训练 |
此外,还列出了 视频特征提取器 相关资源,并收录了2024年的新数据集,如 Panda-70M(70M视频配文)和 MovieLLM(AI生成的高质量长视频数据)。




