遇见数据集

lodestones/ShareGPT4Video

收藏
Hugging Face2024-06-27 更新2024-06-29 收录
官方服务:

资源简介:

ShareGPT4Video Captions 4.8M是一个由GPT4-Vision驱动的多模态视频字幕数据集,旨在增强大型视频语言模型(LVLMs)和文本到视频模型(T2VMs)的模态对齐和细粒度视觉概念感知能力,使其接近GPT4V和Sora的能力。数据集包含由GPT4-Vision生成的视频字幕数据,以及通过ShareCaptioner-Video训练的GPT4-Vision生成的视频-字幕对数据。数据集于2024年4月17日收集,主要用于大型多模态模型和文本到视频模型的研究。

ShareGPT4Video Captions 4.8M is a set of GPT4-Vision-powered multi-modal captions data of videos, constructed to enhance modality alignment and fine-grained visual concept perception in Large Video-Language Models (LVLMs) and Text-to-Video Models (T2VMs). This advancement aims to bring LVLMs and T2VMs towards capabilities of GPT4V and Sora. The dataset includes video caption data generated by GPT4-Vision and video-caption pairs trained by ShareCaptioner-Video on GPT4-Vision-generated data. It was collected on April 17, 2024, and is primarily intended for research on large multimodal models and text-to-video models.

提供机构:
lodestones
原始信息汇总

ShareGPT4Video 4.8M 数据集卡片

数据集详情

数据集类型: ShareGPT4Video Captions 4.8M 是一个由 GPT4-Vision 驱动的多模态视频字幕数据集。

该数据集旨在增强大型视频-语言模型(LVLMs)和文本到视频模型(T2VMs)的模态对齐和细粒度视觉概念感知能力。这一进展旨在使 LVLMs 和 T2VMs 接近 GPT4V 和 Sora 的能力。

  • sharegpt4video_40k.jsonl 由 GPT4-Vision(ShareGPT4Video)生成。
  • share-captioner-video_mixkit-pexels-pixabay_4814k_0417.json 由我们训练的 ShareCaptioner-Video 生成,基于 GPT4-Vision 生成的视频-字幕对(ShareGPT4Video-Asthetic)。
  • sharegpt4video_mix181k_vqa-153k_share-cap-28k.jsonsharegpt4video_instruct_gpt4-vision_cap40k.json 中筛选,用于 LVLMs 的监督微调阶段。

数据集日期: ShareGPT4Video Captions 4.8M 于 2024 年 4 月 17 日收集。

许可证: Attribution-NonCommercial 4.0 International

预期用途

主要预期用途: ShareGPT4Video Captions 4.8M 主要用于研究大型多模态模型和文本到视频模型。

主要预期用户: 该数据集的主要用户是计算机视觉、自然语言处理、机器学习、AIGC 和人工智能领域的研究人员和爱好者。

搜集汇总
数据集介绍
lodestones/ShareGPT4Video 数据集图片
构建方式
ShareGPT4Video数据集构建的核心在于利用GPT4-Vision模型为视频生成高质量的多模态描述。首先,研究人员通过GPT4-Vision直接生成了包含4万条视频-描述对的sharegpt4video_40k.jsonl文件。在此基础上,训练了专用的ShareCaptioner-Video模型,该模型能够自动为大规模视频数据生成描述,从而构建了包含481.4万条描述的share-captioner-video_mixkit-pexels-pixabay_4814k_0417.json文件。此外,还从多个来源整合了包含18.1万条指令微调数据的sharegpt4video_mix181k_vqa-153k_share-cap-28k.json,用于大型视频语言模型的监督微调阶段。整个数据集总计约480万条视频描述,旨在增强视觉与语言模态的对齐以及细粒度视觉概念的感知能力。
特点
该数据集具有显著的多模态对齐与细粒度感知特性。其核心优势在于由GPT4-Vision生成的描述质量极高,能够捕捉视频中的复杂语义与动态细节,超越了传统人工标注的局限性。ShareCaptioner-Video模型的引入使得大规模自动标注成为可能,同时保持了与GPT4-Vision描述风格的一致性。数据集涵盖了多种来源的视频内容,包括Mixkit、Pexels和Pixabay等公开数据集,确保了内容的多样性和覆盖面。此外,数据集中还包含了专门为指令微调设计的子集,能够有效支持大型视频语言模型在问答和视觉推理任务上的性能提升。
使用方法
该数据集主要用于大型视频语言模型和文本到视频模型的研究与开发。研究人员可以直接使用sharegpt4video_40k.jsonl进行模型的多模态预训练,以增强视频与文本的对齐能力。对于需要大规模数据支持的场景,可以利用share-captioner-video_mixkit-pexels-pixabay_4814k_0417.json进行扩展训练。在模型微调阶段,建议使用sharegpt4video_mix181k_vqa-153k_share-cap-28k.json进行监督微调,以提升模型在视觉问答和指令跟随任务上的表现。所有数据均为JSONL格式,便于加载和处理,用户需遵循CC-BY-NC 4.0许可协议以及OpenAI的使用政策。
背景与挑战
背景概述
在大型视频语言模型(LVLMs)与文本到视频模型(T2VMs)迅猛发展的背景下,如何实现模态对齐与细粒度视觉概念感知成为制约其性能提升的核心瓶颈。为此,由研究团队于2024年4月构建的ShareGPT4Video Captions 4.8M数据集应运而生,该项目依托于GPT-4V的视觉理解能力,旨在通过高质量多模态视频描述数据推动模型向GPT-4V与Sora级别的能力迈进。该数据集由清华大学等机构的研究人员主导,其核心研究问题聚焦于如何利用GPT-4V生成的视频-文本对训练专用的视频描述生成器(ShareCaptioner-Video),进而大规模扩展高质量标注数据,最终提升LVLMs与T2VMs在复杂视频场景下的理解与生成能力。该数据集在发布后迅速成为多模态学习领域的重要基准,为视频理解与生成任务提供了关键的数据支撑。
当前挑战
当前,ShareGPT4Video数据集面临多重挑战。首先,在领域问题层面,视频模态的时空复杂性使得细粒度视觉概念捕捉极为困难,现有模型往往难以区分相似动作或理解长时序依赖关系,这直接制约了LVLMs在高阶视觉问答与视频描述任务上的表现。其次,在构建过程中,依赖GPT-4V生成高质量描述虽能保证数据准确性,但受限于OpenAI的使用政策与高昂的API调用成本,数据集的扩展性与可复现性受到制约。此外,从GPT-4V生成的40K样本到利用自训练模型扩展至4.8M样本的流程中,如何确保自动生成描述与人工标注质量的一致性,避免噪声累积影响下游模型性能,仍是亟待解决的技术难题。
常用场景
经典使用场景
ShareGPT4Video数据集的核心经典应用在于为大型视频-语言模型(LVLMs)和文本到视频模型(T2VMs)提供高质量的图文对齐训练数据。该数据集通过GPT-4 Vision生成的4.8M条多模态视频描述,显著增强了模型对细粒度视觉概念的感知能力。在视频理解领域,研究者常利用其40k精细标注子集进行监督微调,以提升模型在复杂视频问答任务中的表现;同时,其4.8M大规模描述数据被广泛用于预训练阶段,帮助模型建立更稳健的跨模态表征,从而弥合视频与文本之间的语义鸿沟。
实际应用
在实际应用层面,ShareGPT4Video为视频内容生成、智能编辑和自动化摘要等领域提供了关键支撑。例如,在短视频平台的内容推荐系统中,基于该数据集训练的模型能够精准理解视频主题并生成个性化描述;在影视后期制作中,其细粒度描述能力可辅助自动生成字幕、场景标签或剪辑脚本。此外,该数据集还赋能了教育领域的视频知识抽取、医疗领域的动态影像分析,以及自动驾驶场景中的视频语义理解,展现了从娱乐到专业行业的广泛渗透力。
衍生相关工作
围绕ShareGPT4Video衍生出了多项具有影响力的工作。其核心贡献之一在于训练了ShareCaptioner-Video模型,该模型能够自主生成高质量视频描述,进一步扩展了数据集的规模与多样性。此外,基于该数据集微调的ShareGPT4Video-8B模型在多项视频理解基准上取得了领先性能,成为LVLMs领域的重要基线。研究者还借鉴其数据构建范式,开发了针对特定领域(如体育赛事、纪录片)的视频描述生成框架,推动了视频-语言研究的范式创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务