遇见数据集

DAMO-NLP-SG/Multi-Source-Video-Captioning

收藏
Hugging Face2024-06-17 更新2024-06-15 收录
官方服务:

资源简介:

MSVC数据集是一个视频字幕生成数据集,旨在全面评估视频-LLMs的视频字幕生成能力。该数据集从MSVD、MSRVTT和VATEX中采样了1500个视频,每个视频都带有多种人类注释的标题,涵盖了视频的不同方面。传统的评估方法依赖于生成字幕与真实字幕之间的精确匹配统计,这在捕捉视频内容的丰富性方面存在局限性。因此,MSVC采用了类似于VideoChatGPT的ChatGPT辅助评估方法,通过GPT-3.5-turbo (0613)对生成的和人类注释的字幕进行信息正确性和详细导向性的评估。

The MSVC dataset is a video captioning dataset designed to comprehensively evaluate the video captioning capabilities of video-LLMs. It samples 1500 videos from MSVD, MSRVTT, and VATEX, with each video paired with multiple human-annotated captions that cover different aspects of the video content. Traditional evaluation methods rely on exact matching statistics between generated captions and reference captions, which has limitations in capturing the richness of video content. Therefore, MSVC adopts a ChatGPT-assisted evaluation approach similar to that used in VideoChatGPT, leveraging GPT-3.5-turbo (0613) to assess the factual correctness and detail orientation of both generated captions and human-annotated reference captions.

提供机构:
DAMO-NLP-SG
原始信息汇总

Multi-source Video Captioning (MSVC) 数据集卡片

数据集详情

数据集类型: MSVC 是一组收集的视频字幕数据集,旨在确保对视频字幕生成能力的全面和彻底评估。

数据集详细信息: MSVC 旨在解决现有视频字幕基准的局限性,从 MSVDMSRVTTVATEX 中抽取了总共 1,500 个带有人工标注字幕的视频,确保了多样化的场景和领域。 传统的评估指标依赖于生成字幕与真实字幕的精确匹配统计,这在捕捉视频内容的丰富性方面存在局限。因此,我们采用了类似于 VideoChatGPT 的 ChatGPT 辅助评估方法。生成字幕和人工标注字幕均由 GPT-3.5-turbo (0613) 进行信息正确性和详细方向的评估。 值得注意的是,MSVC 基准中的每个视频都标注了多个人工编写的字幕,涵盖了视频的不同方面。这种全面的标注确保了对视频字幕生成模型的全面和彻底评估。

数据说明: 请从官方网站下载原始视频,并按以下结构排列: bash VideoLLaMA2 ├── eval │ ├── MSVC | | ├── msvd/ | | | ├── lw7pTwpx0K0_38_48.avi | | | └── ... | | ├── msrvtt/ | | | ├── video9921.mp4 | | | └── ... | | ├── vatex/ | | | ├── 9giWHf6Pf24.mp4 | | | └── ...

GPT3.5 评估提示: python

正确性评估:

{ "role": "system", "content": "您是一个智能聊天机器人,旨在评估基于视频的问题-答案对的生成输出的实际准确性。" "您的任务是比较预测答案与这些正确答案,并确定它们是否事实一致。以下是您可以完成任务的方式:" "------" "## 说明:" "- 关注预测答案与正确答案之间的事实一致性。预测答案不应包含任何误解或错误信息。 " "- 预测答案必须事实准确,并与视频内容一致。 " "- 考虑同义词或释义为有效匹配。 " "- 评估预测与答案之间的事实准确性。" }, { "role": "user", "content": "请评估以下基于视频的问题-答案对:

" f"问题: {question} " f"正确答案: {answer} " f"预测答案: {pred}

" "请仅以事实准确性分数的形式提供您的评估,事实准确性分数是一个介于 0 和 5 之间的整数值,5 表示最高级别的事实一致性。" "请以 Python 字典字符串的形式生成响应,键为 score,其值为事实准确性分数(整数,非字符串)。" "请勿提供任何其他输出文本或解释。仅提供 Python 字典字符串。" "例如,您的响应应如下所示:{score: 4.8}。" }

python

详细性评估:

{ "role": "system", "content": "您是一个智能聊天机器人,旨在评估基于视频的问题-答案对的生成输出的详细方向。" "您的任务是比较预测答案与这些正确答案,并确定其详细程度,考虑完整性和特异性。以下是您可以完成任务的方式:" "------" "## 说明:" "- 检查预测答案是否涵盖了视频的所有主要点。响应不应遗漏任何关键方面。 " "- 评估预测答案是否包含特定细节而非仅是通用点。它应提供与视频特定元素相关的全面信息。 " "- 考虑同义词或释义为有效匹配。 " "- 提供一个单一的评估分数,反映预测的详细方向水平,考虑完整性和特异性。", }, { "role": "user", "content": "请评估以下基于视频的问题-答案对:

" f"问题: {question} " f"正确答案: {answer} " f"预测答案: {pred}

" "请仅以详细方向分数的形式提供您的评估,详细方向分数是一个介于 0 和 5 之间的整数值,5 表示最高级别的详细方向。" "请以 Python 字典字符串的形式生成响应,键为 score,其值为详细方向分数(整数,非字符串)。" "请勿提供任何其他输出文本或解释。仅提供 Python 字典字符串。" "例如,您的响应应如下所示:{score: 4.8}。", }

数据集发布日期: MSVC 于 2024 年 6 月发布。

主要预期用途: MSVC 的主要用途是用于视频字幕生成模型的研究。

主要预期用户: 该数据集的主要用户是计算机视觉、自然语言处理、机器学习和人工智能领域的研究人员和爱好者。

搜集汇总
数据集介绍
DAMO-NLP-SG/Multi-Source-Video-Captioning 数据集图片
构建方式
在视频理解领域,现有视频描述基准因评估指标局限于精确匹配统计而难以捕捉视频内容的丰富语义。为突破这一瓶颈,Multi-Source Video Captioning (MSVC) 数据集应运而生。该数据集从MSVD、MSRVTT和VATEX三个经典视频描述数据集中精心采样了1,500段视频,每段视频均配有多条人工标注的描述文本,覆盖视频的不同方面。这种多源采样策略确保了场景与领域的多样性,为视频大语言模型(Video-LLMs)的鲁棒性评估提供了坚实基础。
特点
MSVC数据集的核心特点在于其创新的评估范式。传统方法依赖生成描述与真实描述之间的精确匹配,而MSVC引入了ChatGPT辅助评估机制,采用GPT-3.5-turbo从信息正确性和细节导向性两个维度进行评分。每个视频配备的多条人工描述不仅涵盖了不同视角,还确保了评估的全面性与深度。这种设计能够更精准地衡量模型对视频内容的理解程度,避免了单一描述可能带来的偏差。
使用方法
使用MSVC数据集时,需先从官方渠道下载原始视频,并按指定目录结构组织,例如将MSVD、MSRVTT和VATEX的视频分别存放于对应文件夹中。评估过程中,研究者可调用GPT-3.5-turbo,依据提供的提示词模板对模型生成的描述进行评分。正确性评估关注事实一致性,细节导向性评估则衡量描述的完整性与具体性,两者均以0至5的整数分值输出。该数据集主要面向视频大语言模型的研究人员,用于推动视频理解技术的进步。
背景与挑战
背景概述
多源视频字幕数据集(Multi-Source Video Captioning, MSVC)由DAMO NLP团队于2024年6月发布,旨在系统评估视频大语言模型(Video-LLMs)在视频字幕生成任务中的综合能力。该数据集从MSVD、MSRVTT和VATEX三个经典基准中精心筛选了1500个视频片段,并配备多条人工标注的字幕,覆盖不同场景与领域,以弥补现有基准在内容丰富性和评估全面性上的不足。MSVC的核心研究问题在于推动Video-LLMs超越传统基于精确匹配的评估范式,转而采用ChatGPT辅助的语义评估框架,对生成字幕的信息正确性与细节丰富度进行多维度度量。该数据集的提出为视频理解领域提供了更具挑战性的评测平台,对推动多模态大模型在视频描述任务中的发展具有重要意义。
当前挑战
MSVC面临的核心挑战在于传统评估指标(如BLEU、ROUGE)难以捕捉视频内容的语义丰富性,亟需更精细的自动化评估方法。在领域问题层面,视频字幕生成需同时处理时空动态建模、多模态对齐与语义抽象,现有模型常因缺乏对视频中关键动作、对象交互及场景转换的深度理解而生成过于泛化或信息缺失的字幕。在构建过程中,挑战体现在多源视频的异构性处理上——不同来源的视频在时长、分辨率、拍摄风格及内容主题上差异显著,需确保采样均衡以覆盖多样化的现实场景。此外,人工标注多条字幕需保持标注者间的一致性,同时兼顾不同视角下的内容侧重,这对标注指南的制定与质量控制提出了极高要求。
常用场景
经典使用场景
在视频理解与多模态学习领域,MSVC(Multi-Source Video Captioning)数据集被广泛用于评估和提升视频大语言模型(Video-LLMs)的视频描述生成能力。该数据集精选自MSVD、MSRVTT和VATEX三大经典视频语料库,涵盖1500个多样化的视频片段,每个视频均配有多个由人工标注的描述文本,从不同角度捕捉视频内容。研究者通常利用MSVC作为基准测试,通过对比模型生成的描述与人工标注的黄金标准,借助GPT-3.5-turbo驱动的评估框架,从信息正确性与细节丰富度两个维度对模型性能进行量化分析,从而推动视频理解技术的精进。
解决学术问题
MSVC数据集的核心学术贡献在于突破了传统视频描述评估指标的局限性。传统方法如BLEU、ROUGE等依赖精确匹配统计,难以捕捉视频内容的语义丰富性与多维度信息,导致评估结果与人类感知存在偏差。MSVC通过引入ChatGPT辅助的评估机制,结合人工多标注策略,解决了如何客观、细致地衡量Video-LLMs生成内容的准确性与完整性这一关键问题。这一创新为视频-语言模型研究提供了更可靠的评价标准,促进了领域内对模型事实一致性与细节表现力的深入探讨,对构建更强大的视频理解系统具有深远意义。
衍生相关工作
MSVC数据集的提出催生了一系列相关经典工作,其中最具代表性的是VideoLLaMA系列模型。VideoLLaMA 2作为该系列的演进版本,在MSVC评估框架的指导下,重点优化了时空建模与音频理解能力,展示了多源视频描述基准对模型架构设计的反馈价值。此外,许多研究借鉴了MSVC的ChatGPT辅助评估范式,将其扩展到视频问答、时序定位等任务中,推动了大语言模型在视频领域的评价体系革新。这些衍生工作共同验证了MSVC作为评估基准的普适性与前瞻性,为多模态智能系统的发展奠定了坚实基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务