遇见数据集

ChinaOpen

收藏
arXiv2023-08-06 更新2024-06-21 收录
官方服务:

资源简介:

ChinaOpen是由中国人民大学信息学院创建的多模态学习数据集,包含50k用于训练的自动标注视频和1k用于评估的手动标注视频。数据集来源于中国流行的视频分享网站Bilibili,旨在支持中文环境下的多模态学习和模型评估。数据集创建过程中,通过自动数据清洗和手动视频标注确保数据质量。ChinaOpen适用于评估模型在开放世界环境下的性能,特别是在中文视频内容上的应用。

ChinaOpen is a multimodal learning dataset developed by the School of Information, Renmin University of China. It comprises 50,000 automatically annotated videos for model training and 1,000 manually annotated videos for model evaluation. Sourced from Bilibili, a leading video-sharing platform in China, this dataset is designed to facilitate multimodal learning and model evaluation within Chinese-language contexts. During its construction, automatic data cleaning and manual video annotation are adopted to guarantee data quality. ChinaOpen is applicable for evaluating model performance in open-world scenarios, especially for applications targeting Chinese video content.

创建时间:
2023-05-10
搜集汇总
数据集介绍
ChinaOpen 数据集图片
构建方式
ChinaOpen数据集源自中国知名视频分享平台Bilibili,旨在支持开放世界的多模态学习。其构建分为三个阶段:首先,通过随机生成视频ID收集了近10万条上传于2010年5月至2021年9月间的视频,并获取了标题、标签等元数据。其次,实施自动化数据清洗,利用HanLP进行句法模式匹配以剔除空标题视频,借助InsightFace检测并移除仅含人脸的视频,采用PaddleOCR识别并过滤文本密集的帧,并综合运用ResNet-P365、SwinB-K400及CLIP模型进行场景、动作与物体识别,以排除缺乏视觉内容的样本,最终得到包含5万条精选视频的ChinaOpen-50k训练集。最后,从ChinaOpen-50k中通过邻居投票算法和人工预筛选,选取了1092条视频进行精细化人工标注,构建了ChinaOpen-1k测试集,每条视频均附有经人工核查的用户标题、人工撰写的描述性字幕、以及描述物体、动作和场景的标签。
特点
ChinaOpen数据集的独特之处在于其双重结构:ChinaOpen-50k作为大规模网络标注训练集,ChinaOpen-1k作为多维度人工标注测试集。ChinaOpen-1k的标注体系尤为丰富,每条视频不仅包含用户生成的标题和标签,还拥有基于内容的人工描述和细粒度标签,涵盖物体、动作与场景三大类别。与现有数据集相比,ChinaOpen-1k引入了大量新颖标签,例如在物体维度新增了537个独特标签,动作维度新增457个,场景维度新增52个。此外,所有中文文本均已翻译为英文,使其能够直接评估基于英文数据训练的模型。这种双语特性与多任务标注设计,使得数据集能够支持开放集视频标签、文本到视频检索以及视频描述生成等多种评估任务。
使用方法
ChinaOpen数据集为多模态学习研究提供了灵活的基准平台。对于开放集视频标签任务,研究者可利用ChinaOpen-1k中物体、动作、场景及用户标签的四维标注,评估模型在零样本或微调场景下的泛化能力,例如使用CLIP或CN-CLIP等模型进行提示式标签预测。在文本到视频检索任务中,数据集设计了内容基线与超越内容两条评估路线,分别以人工描述和用户标题作为查询,考察模型对视觉内容与用户意图的匹配能力。视频描述生成任务同样沿袭此双轨评估框架,支持生成式模型的性能对比。ChinaOpen-50k可作为训练数据,用于微调现有模型或训练如GVT等新型架构,而ChinaOpen-1k则作为标准测试集,确保评估的公平性与可重复性。
背景与挑战
背景概述
ChinaOpen数据集由中国人民大学信息学院的研究团队与腾讯合作,于2023年正式发布,旨在填补开放世界多模态学习在中文视频领域的空白。当前,先进的多模态学习网络在自动视频标注和跨模态检索任务上表现卓越,但其训练与评估主要依赖英文YouTube视频,模型在中文数据上的泛化能力尚未得到验证。为此,研究团队从中国主流视频分享平台Bilibili采集近10万条视频,经过自动化清洗与人工标注,构建了包含5万条训练集(ChinaOpen-50k)和1千条测试集(ChinaOpen-1k)的基准数据集。该数据集创新性地提供了用户生成标题、人工撰写描述以及对象、动作、场景的多维标签,并支持中英双语评估,为视频标注、文本-视频检索和视频描述生成等任务提供了全新评测平台,显著推动了中文多模态学习的发展。
当前挑战
ChinaOpen数据集面临的挑战主要体现在两方面。首先,在领域问题层面,开放世界多模态学习需要模型应对无约束的视频内容,包括海量主题、低质量用户注释(如空标题、纯面部、文字密集或无视觉内容的视频)以及主观性强的用户标签,这导致自动化标注和检索任务难度显著增加,特别是超越内容层面的用户标题检索与描述生成任务,其性能远低于基于内容的任务。其次,在构建过程中,研究团队面临数据清洗与标注的艰巨挑战:需设计多模态方法逐步剔除空标题、纯面部、文字密集和无内容视频;人工标注阶段需进行视频预选、集体标注与双重审核,确保标签的丰富性与准确性,同时完成中英文翻译以支持双语评估,整个过程耗时且成本高昂。
常用场景
经典使用场景
在开放世界多模态学习领域,ChinaOpen数据集为研究者提供了一个源自中国主流视频分享平台Bilibili的独特资源。其经典使用场景聚焦于视频内容理解的多任务评估,包括开放集视频标签预测、跨模态文本-视频检索以及视频描述生成。通过构建包含5万条网络标注训练视频(ChinaOpen-50k)和1千条人工精细标注测试视频(ChinaOpen-1k)的双层结构,该数据集支持对模型在物体、动作、场景识别及用户标签辅助等维度上的全面能力检验,尤其适合评估模型在中文语境下的泛化性能。
解决学术问题
ChinaOpen数据集有效填补了现有公开视频数据集在中文多模态学习领域的空白,解决了两个核心学术问题:其一,现有主流模型多基于YouTube英文视频训练,其在中文数据上的有效性未经验证,ChinaOpen提供了首个系统性的中英文双语评估基准;其二,传统数据集或仅含类别标签、或仅含描述文本,缺乏对视频内容多粒度(物体、动作、场景)与多来源(用户生成标题与人工撰写描述)的联合标注,ChinaOpen-1k通过精细化的标注体系弥补了这一缺陷,推动了开放集视频理解与跨模态检索研究的深入发展。
衍生相关工作
围绕ChinaOpen数据集,研究者已开展了一系列衍生工作:在模型创新方面,论文提出了基于视觉令牌缩减(VTR)的生成式视频到文本变换器(GVT),通过有效增加输入帧数显著提升了中文视频描述生成质量;在评估基准方面,该数据集被用于对15个前沿模型(包括CLIP、BLIP-2、Flamingo等)进行多任务横向对比,揭示了中文与英文模型在标签预测、检索与描述任务上的性能差异;此外,基于ChinaOpen-50k的微调实验证明,即便采用自动构建的训练集,也能在视频描述生成任务上超越依赖人工标注的VaTeX-CN数据集,为低资源场景下的多模态学习提供了新思路。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务