OpenDriveLab/OpenDV-YouTube-Language
收藏资源简介:
`OpenDV-YouTube`数据集是一个包含`context`和`command`语言注释的数据集,主要用于自动驾驶领域的研究。数据集中的注释包括视频剪辑的命令(cmd)和上下文(blip),其中上下文是对视频剪辑中心帧的描述,由`BLIP2`生成。用户可以通过提供的代码加载这些注释,并按照指定的结构进行处理。数据集的使用建议在`Linux`环境下进行,以避免`Windows`系统中的文件路径问题。
`OpenDV-YouTube`数据集是一个包含`context`和`command`语言注释的数据集,主要用于自动驾驶领域的研究。数据集中的注释包括视频剪辑的命令(cmd)和上下文(blip),其中上下文是对视频剪辑中心帧的描述,由`BLIP2`生成。用户可以通过提供的代码加载这些注释,并按照指定的结构进行处理。数据集的使用建议在`Linux`环境下进行,以避免`Windows`系统中的文件路径问题。
数据集概述:OpenDV-YouTube
数据集内容
- 语言标注:包含
context和command两部分。 - 详细信息:更多详情请参考GenAD项目和OpenDV-YouTube。
使用方法
-
数据准备:需按照OpenDV-YouTube的指导下载并准备数据。
-
环境建议:推荐在
Linux环境下处理数据,因Windows可能存在文件路径问题。 -
代码示例: python import json
训练数据
full_annos = [] for split_id in range(10): split = json.load(open("10hz_YouTube_train_split{}.json".format(str(split_id)), "r")) full_annos.extend(split)
验证数据
val_annos = json.load(open("10hz_YouTube_val.json", "r"))
数据结构
-
每个视频剪辑的标注: python { "cmd": <int> -- 命令,即视频剪辑中自我车辆的命令。 "blip": <str> -- 上下文,即视频剪辑中心帧的BLIP描述。 "folder": <str> -- 从处理后的OpenDV-YouTube数据集根目录到视频剪辑图像文件夹的相对路径。 "first_frame": <str> -- 剪辑中第一帧的文件名。 "last_frame": <str> -- 剪辑中最后一帧的文件名。 }
-
命令转换:使用
map_category_to_caption函数将cmd字段转换为自然语言,详见cmd2caption.py。 -
上下文描述:
blip字段描述视频剪辑中心帧,由BLIP2生成。
许可证
- 许可证类型:CC-BY-NC-SA-4.0




