vcr-org/VCR-wiki-en-easy-test
收藏资源简介:
VCR-Wiki数据集是一个用于视觉字幕恢复(VCR)任务的数据集,旨在评估视觉语言模型在图像中恢复部分遮挡文本的能力。该数据集包含图像、堆叠图像、仅文本图像、字幕和交叉文本等特征。数据集构建过程包括数据收集、初始过滤、N-gram选择、文本嵌入图像创建、图像拼接和第二轮过滤。数据集提供了详细的字段描述和评估方法,并附有免责声明和引用信息。
VCR-Wiki数据集是一个用于视觉字幕恢复(VCR)任务的数据集,旨在评估视觉语言模型在图像中恢复部分遮挡文本的能力。该数据集包含图像、堆叠图像、仅文本图像、字幕和交叉文本等特征。数据集构建过程包括数据收集、初始过滤、N-gram选择、文本嵌入图像创建、图像拼接和第二轮过滤。数据集提供了详细的字段描述和评估方法,并附有免责声明和引用信息。
VCR-Wiki 数据集概述
数据集描述
VCR-Wiki 数据集用于视觉字幕恢复(Visual Caption Restoration, VCR)任务,旨在评估视觉语言模型在图像中恢复部分遮挡文本的能力。
数据集特征
- question_id:
int64,当前分区的实例ID。 - image:
image,原始视觉图像(VI)。 - caption:
string,TEI图像中未遮挡的原始文本。 - stacked_image:
image,包含原始视觉图像和遮挡文本嵌入图像的堆叠图像。 - only_it_image:
image,遮挡的TEI图像。 - only_it_image_small:
image,小尺寸的遮挡TEI图像。 - crossed_text:
List[string],当前实例中遮挡的n-gram。
数据集分割
- test: 包含5000个样本,数据大小为900383144字节。
数据集大小
- download_size: 899250889字节
- dataset_size: 900383144字节
配置
- default: 包含测试数据文件路径
data/test-*。
许可证
数据集使用 CC BY-SA 4.0 许可证。
来源数据集
- wikimedia/wit_base
任务类别
- visual-question-answering
语言
- en
数据集别名
- VCR
相关论文
- arXiv: 2406.06462
数据集构建
数据集通过以下步骤构建:
- 数据收集和初步过滤:从 wikimedia/wit_base 收集数据,过滤掉敏感内容。
- N-gram选择:截断描述并使用 spaCy 进行分词,随机遮挡5-gram。
- 创建嵌入文本的图像:将描述嵌入图像,调整宽度并遮挡选定的5-gram。
- 拼接图像:将TEI与VI拼接成堆叠图像。
- 第二轮过滤:过滤掉没有遮挡n-gram或高度超过900像素的条目。
免责声明
VCR-Wiki 数据集及其子集仅供视觉字幕恢复及相关视觉语言任务的研究和教育目的使用。用户需确保其使用符合道德准则,并遵守CC BY-SA 4.0许可证的条款。
引用
如需引用该数据集,请使用以下BibTeX: bibtex @article{zhang2024vcr, title = {VCR: Visual Caption Restoration}, author = {Tianyu Zhang and Suyuchen Wang and Lu Li and Ge Zhang and Perouz Taslakian and Sai Rajeswar and Jie Fu and Bang Liu and Yoshua Bengio}, year = {2024}, journal = {arXiv preprint arXiv: 2406.06462} }




