PoVisLE
收藏资源简介:
PoVisLE(波兰语视觉语言评估)是一个用于评估文化背景下的多模态理解的波兰语视觉语言基准。完整基准包含 1,117 张图像和 2,366 个手动标注的 VQA 对。本次公开发布仅包含验证集,共 406 个 VQA 对。数据集分为三个任务配置:mcq(多项选择题,212 对)、yn(是否题,154 对)和 open(开放式问题,40 对)。所有问题均为波兰语,并按照七个主要类别组织:艺术与娱乐、文化与传统、地理与自然、历史与社会、语言、图像理解、视觉推理。每个样本包含 id、image_id、question_index、图像、图像来源、图像 URL、类别、子类别、分类路径、问题、答案等字段。对于 mcq 配置,还包含 A-H 选项字段。数据集通过手动、无模板的注释创建,并经过质量保证流程。旨在用于研究评估视觉语言模型在波兰文化和语言背景下的视觉问答能力。文本注释以 CC BY-SA 4.0 许可发布,图像来源多样,各自保留其许可。
PoVisLE (Polish Vision-Language Evaluation) is a Polish vision-language benchmark for evaluating multimodal understanding in a cultural context. The full benchmark contains 1,117 images and 2,366 manually annotated VQA pairs. This public release only includes the validation set, totaling 406 VQA pairs. The dataset is divided into three task configurations: mcq (multiple-choice questions, 212 pairs), yn (yes/no questions, 154 pairs), and open (open-ended questions, 40 pairs). All questions are in Polish and organized into seven main categories: Art & Entertainment, Culture & Tradition, Geography & Nature, History & Society, Language, Image Understanding, and Visual Reasoning. Each sample includes fields such as id, image_id, question_index, image, image_source, image_url, category, subcategory, classification_path, question, and answer. For the mcq configuration, additional fields A-H options are included. The dataset was created through manual, template-free annotation and underwent a quality assurance process. It is intended for research evaluating the visual question answering capabilities of vision-language models within the Polish cultural and linguistic context. Text annotations are released under CC BY-SA 4.0 license, while images come from diverse sources and retain their respective licenses.
PoVisLE 数据集概述
PoVisLE (Polish Vision-Language Evaluation) 是一个用于评估文化背景多模态理解的波兰语视觉-语言基准数据集。
基本信息
- 数据集名称:PoVisLE
- 许可协议:CC-BY-SA-4.0
- 任务类别:视觉问答(visual-question-answering)
- 语言:波兰语(pl)
- 数据集规模:n<1K(少于1000个样本)
- 完整规模:完整基准包含1,117张图片和2,366个手工标注的VQA问答对;本次公开版本仅包含验证集(validation split),包含406个VQA问答对
数据集结构
数据集分为三个任务配置:
| 配置名称 | 划分 | VQA数量 | 任务类型 |
|---|---|---|---|
mcq |
validation | 212 | 多项选择 |
yn |
validation | 154 | 是/否 |
open |
validation | 40 | 开放式回答 |
| 总计 | 406 |
类别划分
数据集中的问题按以下七个主要类别组织:
- Art and Entertainment(艺术与娱乐):与波兰及波兰相关的艺术、媒体和文化参考,包括建筑、电影、文学、音乐、绘画、雕塑、体育和媒体。
- Culture and Tradition(文化与传统):共享的习俗、实践、符号、美食、宗教、传统、流行文化以及区域或民族的文化差异。
- Geography and Nature(地理与自然):波兰的自然、城市、基础设施和社会政治空间,包括景观、地标、地区和行政实体。
- History and Society(历史与社会):历史及当代波兰社会背景,涵盖从中世纪到二战、战后历史及当前事务。
- Language(语言):视觉基础下的波兰语语言现象,如口语、俚语、方言、地域特色、语法、拼写、措辞、修辞手法和语义。
- Image Understanding(图像理解):对波兰或波兰相关语境中视觉内容的直接识别和解释。
- Visual Reasoning(视觉推理):对图像中关系、上下文或推断信息的推理。
数据字段
所有配置共有的字段
id:唯一样本标识符image_id:图像标识符question_index:给定图像中的问题索引image:输入图像image_source:图像来源标签,取值为wiki、own或otherimage_url:外部来源图像的源URL(如有)category:顶级分类类别subcategory:细粒度分类类别taxonomy_path:完整分类路径,格式为类别 > 子类别question:波兰语问题answer:标准答案
mcq 配置的额外字段
A-H:答案选项(并非每个示例都使用所有选项字段)answer:正确选项标签
对于 yn 配置,答案为波兰语的是/否标签;对于 open 配置,答案为简短的自由格式标准回答。
数据集创建过程
- 通过手工、无模板的标注方式创建,标注者从Wikimedia Commons、其他许可开放的公共来源以及为研究用途贡献的个人收藏中选择或审核图像。
- 每张图像配对一个或多个波兰语视觉问答提示,并标注任务类型、类别和子类别。
- 包含基于Wikimedia的图像增强阶段,以提升视觉多样性并减少选择偏差。
- 质量保证措施包括第二位标注者的交叉验证、元数据和许可证检查、定期团队讨论以及专家标注者的监督。
- 标注指南要求问题必须具有视觉基础性、无歧义、语言自然且适合确定性评估。
预期用途
PoVisLE 旨在用于对视觉-语言模型在波兰文化和语言背景下的视觉问答能力进行研究评估。可用于比较不同模型、分析跨文化和跨语言类别的表现,以及测试模型答案是否同时依赖于图像和波兰语问题。
伦理考量
该基准专注于具有文化情境的波兰语内容,可能反映标注者的视角和覆盖选择。部分问题可能偏向文化原型答案而非其他同样有效的解释,因此应在数据集范围框架内解读结果。
许可说明
- 文本标注以 CC BY-SA 许可发布。
- 来自Wikipedia及其他外部来源的图像保留各自提供方指定的许可;为该数据集专门创建的图像以 CC BY-SA 许可发布。
- 用户除遵守数据集标注的许可条款外,还需遵守每个单独图像适用的许可条款。
引用信息
bibtex @article{kolos2026povisle, title = {Jako Tako or Fluent? Presenting PoVisLE: A Polish Vision-Language Evaluation}, author = {Ko{l}os, Anna and Statkiewicz, Grzegorz and Seweryn, Karolina and Kowol, Katarzyna and Piosek, Karolina and Kusa, Wojciech}, journal = {arXiv preprint}, year = {2026} }





