遇见数据集

HowToStep多语句时序定位数据集

收藏
官方服务:

资源简介:

HowToStep 数据集主要面向长视频理解与多句子视觉定位(Multi-Sentence Grounding)研究需求建设。针对现有大规模教学视频数据中,语音识别(ASR)文本存在的噪音多、口语冗余、代词指代不清以及音画时间严重不对齐等问题,该数据集基于大规模开源教学视频库 HowTo100M 产生。在产生方法上,该数据集构建了一条自动化的数据清洗流水线:首先利用 WhisperX 提取高精度的语音转录文本;随后通过大语言模型(Llama2-7B)将杂乱的语音对话总结为连贯、精炼的程序性动作步骤;最后,提出一种基于 Transformer 的 NaSVA 模型结合自训练策略,实现文本步骤与视频画面的精确时间对齐。本数据集主要记录了教学视频的唯一标识ID、提炼后的描述性程序步骤文本,以及各动作步骤在视频中对应的高精度起始和结束时间戳等核心数据值。在体量方面,该数据集规模庞大,共涵盖约 34 万个教学视频,包含了约 700 万条带有精确时间边界的描述性步骤标注。该数据集的发布,为细粒度视频表示学习和视频-文本多模态对齐研究提供了高质量、大规模的数据支撑。

提供机构:
上海交通大学
二维码
社区交流群
二维码
科研交流群
商业服务