遇见数据集

lodestone-horizon/ShareGPT4Video

收藏
Hugging Face2024-06-27 更新2024-06-29 收录
官方服务:

资源简介:

ShareGPT4Video Captions 4.8M是一个由GPT4-Vision驱动的多模态视频字幕数据集,旨在增强大型视频语言模型(LVLMs)和文本到视频模型(T2VMs)的模态对齐和细粒度视觉概念感知能力。该数据集包含由GPT4-Vision生成的视频字幕数据,以及由ShareCaptioner-Video生成的视频字幕对。数据集收集于2024年4月17日,主要用于多模态模型和文本到视频模型的研究。

ShareGPT4Video Captions 4.8M is a set of GPT4-Vision-powered multi-modal captions data of videos, constructed to enhance modality alignment and fine-grained visual concept perception in Large Video-Language Models (LVLMs) and Text-to-Video Models (T2VMs). The dataset includes video captions generated by GPT4-Vision and video-caption pairs generated by ShareCaptioner-Video. It was collected on April 17, 2024, and is primarily intended for research on large multimodal models and text-to-video models.

提供机构:
lodestone-horizon
原始信息汇总

ShareGPT4Video 4.8M Dataset Card

数据集详情

数据集类型: ShareGPT4Video Captions 4.8M 是一个由 GPT4-Vision 驱动的多模态视频字幕数据集。

该数据集旨在增强大型视频-语言模型(LVLMs)和文本到视频模型(T2VMs)的模态对齐和细粒度视觉概念感知能力,使其接近 GPT4V 和 Sora 的能力。

  • sharegpt4video_40k.jsonl 由 GPT4-Vision(ShareGPT4Video)生成。
  • share-captioner-video_mixkit-pexels-pixabay_4814k_0417.json 由我们训练的 ShareCaptioner-Video 生成,基于 GPT4-Vision 生成的视频-字幕对(ShareGPT4Video-Asthetic)。
  • sharegpt4video_mix181k_vqa-153k_share-cap-28k.jsonsharegpt4video_instruct_gpt4-vision_cap40k.json 中筛选,用于 LVLMs 的监督微调阶段。

数据集日期: ShareGPT4Video Captions 4.8M 于 2024 年 4 月 17 日收集。

许可证: Attribution-NonCommercial 4.0 International

预期用途

主要预期用途: ShareGPT4Video Captions 4.8M 主要用于大型多模态模型和文本到视频模型的研究。

主要预期用户: 该数据集的主要用户是计算机视觉、自然语言处理、机器学习、AIGC 和人工智能领域的研究人员和爱好者。

搜集汇总
数据集介绍
lodestone-horizon/ShareGPT4Video 数据集图片
构建方式
ShareGPT4Video数据集由两个核心部分构成:其一是通过GPT4-Vision模型生成的sharegpt4video_40k.jsonl,包含高质量的视频-文本描述对;其二是基于前述数据训练出的ShareCaptioner-Video模型,自动为来自Mixkit、Pexels和Pixabay等平台的约481.4万条视频生成描述,形成share-captioner-video_mixkit-pexels-pixabay_4814k_0417.json。此外,数据集还整合了sharegpt4video_instruct_gpt4-vision_cap40k.json中的指令微调数据,构建出用于监督微调的sharegpt4video_mix181k_vqa-153k_share-cap-28k.json。整体构建流程旨在通过GPT4-Vision的强大视觉理解能力,赋能视频多模态描述的大规模自动化生成。
特点
该数据集规模宏大,总量超过480万条视频-文本配对,涵盖多样化的视频来源与场景。其核心特点在于描述的质量极高,源自GPT4-Vision的精细标注,能够捕捉视频中的细粒度视觉概念与时间动态,显著提升大型视频语言模型与文本到视频模型的模态对齐能力。数据集中包含专门用于指令微调的子集,支持模型在视觉问答等任务上的监督学习。此外,数据集遵循CC-BY-NC-4.0许可协议,适用于非商业研究用途,为学术界探索视频理解与生成提供了坚实的数据基础。
使用方法
研究者可通过HuggingFace平台直接加载该数据集,具体使用方式包括:利用sharegpt4video_40k.jsonl进行视频-文本对齐预训练,借助share-captioner-video_mixkit-pexels-pixabay_4814k_0417.json扩展训练数据规模,或采用sharegpt4video_mix181k_vqa-153k_share-cap-28k.json进行监督微调以提升模型在视觉问答等下游任务上的表现。数据集以JSONL和JSON格式提供,便于与主流的深度学习框架(如PyTorch、TensorFlow)集成。建议用户参考随附的论文与代码仓库,以获取详细的数据预处理与模型训练流程。
背景与挑战
背景概述
在大型视频-语言模型(LVLMs)与文本-视频生成模型(T2VMs)迅猛发展的背景下,如何实现细粒度视觉概念感知与跨模态对齐成为核心瓶颈。ShareGPT4Video数据集由研究团队于2024年4月17日构建,依托GPT4-Vision的强大多模态理解能力,生成约480万条高质量视频-文本描述对,旨在弥合现有模型与GPT4V、Sora等前沿系统之间的能力鸿沟。该数据集不仅为LVLMs的监督微调阶段提供指令遵循样本,还通过自训练框架训练出高效的视频描述生成器,显著推动了多模态大模型与AIGC领域的研究进展。
当前挑战
当前数据集面临的核心挑战包括:1)视频理解领域长期受困于缺乏细粒度、语义丰富的描述数据,现有标注往往流于粗糙或受限于人工成本,难以支撑模型对动态时空关系的精准建模;2)构建过程中,依赖GPT4-Vision生成大规模描述面临API成本高昂与生成质量不稳定的问题,需设计自动化蒸馏策略以平衡数据规模与保真度;3)数据集中存在从图像描述迁移至视频领域时的时序连贯性不足,以及长视频场景下关键事件捕获的完整性挑战,这对下游模型的泛化能力构成隐蔽制约。
常用场景
经典使用场景
在大型视频-语言模型(LVLMs)与文本-视频生成模型(T2VMs)的研究中,ShareGPT4Video数据集被广泛应用于多模态对齐训练与细粒度视觉概念感知的增强。该数据集由GPT4-Vision生成的高质量视频-文本描述构成,尤其适用于监督微调阶段,用以提升模型对视频内容的理解深度与生成精度。研究者通常将其作为训练数据,构建能够媲美GPT4V与Sora能力的下一代视觉-语言系统。
实际应用
在实际应用中,ShareGPT4Video所训练的模型可部署于智能视频编辑、自动化内容生成与视频摘要系统。例如,在影视制作中辅助生成高质量视频描述与脚本;在社交媒体平台中实现精准的视频内容检索与推荐;在教育领域用于自动生成教学视频的详细解说。此外,该数据集对文本-视频生成模型的优化,使得从文字描述到视频内容的直接创作成为可能,降低了视频内容生产的门槛。
衍生相关工作
基于ShareGPT4Video,研究者已衍生出多项经典工作。其中包括训练了高容量视频-语言模型ShareGPT4Video-8B,该模型在多项视频理解基准上取得了领先性能;同时,利用该数据集训练了ShareCaptioner-Video,实现了自动化的视频描述生成流水线。此外,相关工作还探索了将数据用于构建多模态指令微调数据集,如sharegpt4video_instruct_gpt4-vision_cap40k,进一步推动了视频-语言模型在复杂推理任务中的能力提升。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务