遇见数据集

tgif-recaption

收藏
Hugging Face2026-09-30 更新2026-10-01 收录
官方服务:

资源简介:

该数据集是 TGIF 数据集的重新描述版本,包含 19,137 条机器生成的视频描述。每条数据包含两个字段:source(原始 GIF 存档中的文件名)和 caption(英文描述,包括主体描述、镜头和带时间戳的动作)。描述由本地服务的模型生成,输入为原始 GIF 的 RGB 帧,采样率目标为 8 fps,最多处理 32 帧,最大图像边长 512 像素并保持宽高比。生成过程启用模型推理,推理努力度为 xhigh,最大输出长度 8192 tokens(含推理过程)。描述格式参照 MiniMax 视频提示写作指南,包含稳定的视觉主体标识、镜头描述和有时间标记的动作。数据经过可解析性、主体引用和时间边界验证,但不保证视觉正确性。该数据集仅包含文本,不包含原始 GIF 文件、图像或视频。完整的重新描述目标覆盖 TGIF 的所有 102,066 个 GIF 文件,当前版本为部分发布。适用于视频描述生成、视频到文本等任务。

This dataset is a re-described version of the TGIF dataset, containing 19,137 machine-generated video descriptions. Each entry has two fields: source (filename in the original GIF archive) and caption (English description including subject description, shot, and timestamped actions). Descriptions are generated by a locally served model using RGB frames from the original GIF, with a target sampling rate of 8 fps, processing up to 32 frames, maximum image side length of 512 pixels while maintaining aspect ratio. The generation uses model inference with reasoning effort set to xhigh, maximum output length of 8192 tokens (including reasoning). The description format follows the MiniMax video prompt writing guide, including stable visual subject identification, shot descriptions, and time-stamped actions. Data is validated for parsability, subject reference, and time boundaries, but visual correctness is not guaranteed. The dataset contains only text, no original GIF files, images, or videos. The full re-description target covers all 102,066 GIFs in TGIF, and the current version is a partial release. Suitable for video description generation, video-to-text, etc.

创建时间:
2026-09-28
原始信息汇总

TGIF Recaption v1 数据集概述

基本信息

  • 数据集名称:TGIF Recaption v1
  • 数据集地址:https://huggingface.co/datasets/virtualkevin/tgif-recaption
  • 语言:英语(en)
  • 任务类别:视频-文本到文本(video-text-to-text)
  • 配置名称:v1
  • 数据文件:data/train.jsonl(split: train)

数据集内容

  • 为原始 TGIF GIF 生成的一组实验性机器生成字幕,共 22,145 条。
  • 该仓库仅包含文本。不包含源 GIF、图像、采样帧或视频负载。
  • source 标识原始 tgif.tar.gz 中确切的 GIF 成员路径,并非托管下载 URL。

字段说明

列名 含义
source 原始归档成员文件名,例如 gifs/tumblr_....gif。
caption 英文主体描述,后接镜头与带时间标记的视觉动作。

数据划分说明

  • train 为导出划分名称,并非 TGIF 官方基准划分。
  • 完整归档重述任务目标为全部 102,066 个源 GIF 文件。
  • 中间检查点不完整,按归档位置排序,包含 64 条带种子的随机基准字幕。
  • 失败条目在本地跟踪,并从已发布字幕中排除。

字幕生成方法

  • 本地服务的模型 ID 为 model。
  • RGB 帧覆盖整个原始 GIF,并保留其帧时长。
  • 采样目标为 8 fps,上限为 32 帧,图像最大边长为 512 像素,保持宽高比。
  • 缺失或无效的帧时长在本地使用 100 毫秒。
  • vLLM 输入模式为 video。
  • 原生视频请求使用虚拟毫秒时基来表示 GIF 的可变帧时序。
  • 模型推理为启用状态。
  • 推理强度:xhigh。
  • 最大输出配额:8,192 token(含推理)。
  • 仅发布渲染后的标注,内部推理保留在本地。

格式来源

  • 格式改编自 MiniMax 视频提示词编写指南:稳定的视觉主体标识符、镜头描述、带时间戳的动作。
  • 主体 ID 与动作区间为扩展内容。
  • 不推断任何音频或对话。
  • 精确标注指令见 docs/prompt.txt。

校验说明

  • 字幕针对可解析性、主体引用与时间边界进行校验,然后渲染为文本。
  • 这些检查不证明视觉正确性。
  • 字幕可能误识别物体、动作、外观、镜头运动或文本。
  • 稀疏帧可能遗漏短暂动作与剪辑;文本中的时间戳精度仅为格式,而非毫秒级标注精度。
  • 编码助手的视觉审查仅覆盖样本,并非全部行;未进行人工标注的准确性基准测试。

性能与来源

  • 实测请求时序与输出校验和见 docs/benchmark.json。
  • 其描述本次运行与服务器配置,不保证全数据集吞吐量。
  • 恢复的运行可能在观察窗口内包含空闲间隙。
  • 完全字节重复的内容可复用标注。
  • 解码/推理失败记录在本地,不会作为空字幕发布。

原始数据来源

  • 原始数据集来源:TGIF(https://github.com/raingo/TGIF)。
  • 本字幕数据集不授予底层 GIF 媒体的相关权利。
搜集汇总
数据集介绍
tgif-recaption 数据集图片
构建方式
视频文本生成领域长期受制于高质量时序标注的稀缺,TGIF Recaption v1 为此提供了一套面向 GIF 动图的机器生成字幕资源。其构建以原 TGIF 数据集中的 GIF 归档文件为唯一视觉来源,抽取覆盖完整时间轴的 RGB 帧并保留原始帧时长,按 8 fps 目标采样、至多 32 帧、图像长边不超过 512 像素且维持宽高比,再以 vLLM 的 video 输入模式送入本地模型生成文本。字幕撰写遵循 MiniMax 视频提示词写作指南,引入稳定的视觉主体标识符、镜头描述与带时间戳的动作片段,并对输出进行可解析性、主体引用与时间边界校验,最终以 JSONL 格式发布于 train 划分。
特点
该数据集的核心特征在于其结构化的时序叙事能力与严格的文本化定位。全部 22,145 条英文描述由机器生成,仅包含 source 与 caption 两列,source 指示原 tgif.tar.gz 归档中的 GIF 成员路径而非可下载链接,故本仓库不附带任何 GIF、图像或采样帧载荷。每条字幕由主体描述、镜头划分与带时间戳的动作信息组成,不推断音频或对白;train 为导出划分名称,并非 TGIF 官方基准划分。构建方亦明确声明,解析与时间边界检查并不等同于视觉正确性保障,字幕仍可能误判对象、动作、外观、镜头运动或文字,稀疏帧会遗漏短暂动作与剪辑点。
使用方法
在实际使用中,研究者可将该数据集作为视频文本生成、时序动作描述与多模态字幕评估的文本侧资源,通过读取 train.jsonl 中的 source 字段与原始 TGIF 归档建立对应关系,从而在需要时自行完成视频帧与字幕的配对。由于仓库仅提供文本,任何涉及视觉内容的实验均须另行获取原始 GIF 媒体,并注意本数据集并不授予底层 GIF 媒体的相关权利。使用时应将字幕视为机器生成候选标注,在训练或评测中结合人工抽样复核,并留意其时间戳精度属于格式化表达而非毫秒级标注精度;若复现生成流程,可参考 docs/prompt.txt 与 docs/benchmark.json 了解提示词与运行配置。
背景与挑战
背景概述
视频理解领域长期受困于高质量时序文本标注的稀缺,既有资源如MSR-VTT与ActivityNet Captions多聚焦于短视频片段,难以覆盖循环动图特有的帧间时序与视觉连贯性。TGIF数据集自2016年由莱斯大学研究团队发布以来,凭借十万量级的GIF素材成为动图理解的重要基准,但其原始标注仅提供简短描述,缺乏细粒度时空信息。TGIF Recaption v1于2024年前后由独立研究者构建,针对全部102,066个源GIF生成了22,145条机器标注,采用MiniMax视频提示规范,引入稳定主体标识、镜头描述与时间戳动作,为视频-文本生成任务提供了新的实验性资源。
当前挑战
该数据集所应对的核心领域问题在于循环动图的细粒度时序描述生成,要求模型在可变帧率与稀疏采样条件下准确捕捉主体动作、镜头切换及时间边界。构建过程中的主要挑战包括:局部推理模型在8 fps采样、32帧上限与512像素约束下,易因稀疏帧丢失短暂动作与剪辑;时间戳精度受虚拟毫秒时基与原始帧时长缺失影响,难以达到毫秒级标注准确度;自动校验仅覆盖可解析性、主体引用与时间边界,无法保证视觉正确性,误识别对象、动作与外观的风险持续存在;此外,跨档案顺序恢复的中断检查点与失败条目本地化处理,进一步增加了标注完整性与一致性的保障难度。
常用场景
经典使用场景
在视频-文本跨模态理解领域,TGIF Recaption数据集的经典使用场景聚焦于生成式视频描述任务,即给定一段可变帧率的GIF动图,模型需输出包含主体标识、镜头描述与时间标注动作的英文叙述。该数据集以22,145条机器生成字幕为支撑,适配视频-文本到文本的生成范式,常被用于训练和评测模型在动态视觉内容上的细粒度语言生成能力,尤其关注时序动作与镜头转换的联合建模。
实际应用
在实际应用中,TGIF Recaption可服务于短视频内容理解与检索系统,例如自动为GIF动图生成结构化描述以增强搜索引擎的语义索引能力。同时,它也可用于辅助视障人士的无障碍描述生成,或作为视频编辑工具的自动字幕草稿来源。由于仅发布文本与源文件名映射,该数据集适合在隐私敏感或版权受限场景下进行算法研发与基准测试。
衍生相关工作
围绕TGIF Recaption,衍生工作主要集中于视频描述模型的时序 grounding 能力评测与弱监督字幕生成方法改进。部分研究将其作为预训练语料,探索可变帧率视频的语言建模;另一些工作则利用其源文件映射与原始TGIF数据集联动,开展跨数据集迁移与字幕质量评估。该数据集亦激发了对于机器生成字幕的可靠性校验与偏差分析等后续研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务