遇见数据集

PoVisLE

收藏
Hugging Face2026-08-08 更新2026-08-09 收录
官方服务:

资源简介:

PoVisLE(波兰语视觉语言评估)是一个用于评估文化背景下的多模态理解的波兰语视觉语言基准。完整基准包含 1,117 张图像和 2,366 个手动标注的 VQA 对。本次公开发布仅包含验证集,共 406 个 VQA 对。数据集分为三个任务配置:mcq(多项选择题,212 对)、yn(是否题,154 对)和 open(开放式问题,40 对)。所有问题均为波兰语,并按照七个主要类别组织:艺术与娱乐、文化与传统、地理与自然、历史与社会、语言、图像理解、视觉推理。每个样本包含 id、image_id、question_index、图像、图像来源、图像 URL、类别、子类别、分类路径、问题、答案等字段。对于 mcq 配置,还包含 A-H 选项字段。数据集通过手动、无模板的注释创建,并经过质量保证流程。旨在用于研究评估视觉语言模型在波兰文化和语言背景下的视觉问答能力。文本注释以 CC BY-SA 4.0 许可发布,图像来源多样,各自保留其许可。

PoVisLE (Polish Vision-Language Evaluation) is a Polish vision-language benchmark for evaluating multimodal understanding in a cultural context. The full benchmark contains 1,117 images and 2,366 manually annotated VQA pairs. This public release only includes the validation set, totaling 406 VQA pairs. The dataset is divided into three task configurations: mcq (multiple-choice questions, 212 pairs), yn (yes/no questions, 154 pairs), and open (open-ended questions, 40 pairs). All questions are in Polish and organized into seven main categories: Art & Entertainment, Culture & Tradition, Geography & Nature, History & Society, Language, Image Understanding, and Visual Reasoning. Each sample includes fields such as id, image_id, question_index, image, image_source, image_url, category, subcategory, classification_path, question, and answer. For the mcq configuration, additional fields A-H options are included. The dataset was created through manual, template-free annotation and underwent a quality assurance process. It is intended for research evaluating the visual question answering capabilities of vision-language models within the Polish cultural and linguistic context. Text annotations are released under CC BY-SA 4.0 license, while images come from diverse sources and retain their respective licenses.

创建时间:
2026-08-07
原始信息汇总

PoVisLE 数据集概述

PoVisLE (Polish Vision-Language Evaluation) 是一个用于评估文化背景多模态理解的波兰语视觉-语言基准数据集。

基本信息

  • 数据集名称:PoVisLE
  • 许可协议:CC-BY-SA-4.0
  • 任务类别:视觉问答(visual-question-answering)
  • 语言:波兰语(pl)
  • 数据集规模:n<1K(少于1000个样本)
  • 完整规模:完整基准包含1,117张图片和2,366个手工标注的VQA问答对;本次公开版本仅包含验证集(validation split),包含406个VQA问答对

数据集结构

数据集分为三个任务配置:

配置名称 划分 VQA数量 任务类型
mcq validation 212 多项选择
yn validation 154 是/否
open validation 40 开放式回答
总计 406

类别划分

数据集中的问题按以下七个主要类别组织:

  • Art and Entertainment(艺术与娱乐):与波兰及波兰相关的艺术、媒体和文化参考,包括建筑、电影、文学、音乐、绘画、雕塑、体育和媒体。
  • Culture and Tradition(文化与传统):共享的习俗、实践、符号、美食、宗教、传统、流行文化以及区域或民族的文化差异。
  • Geography and Nature(地理与自然):波兰的自然、城市、基础设施和社会政治空间,包括景观、地标、地区和行政实体。
  • History and Society(历史与社会):历史及当代波兰社会背景,涵盖从中世纪到二战、战后历史及当前事务。
  • Language(语言):视觉基础下的波兰语语言现象,如口语、俚语、方言、地域特色、语法、拼写、措辞、修辞手法和语义。
  • Image Understanding(图像理解):对波兰或波兰相关语境中视觉内容的直接识别和解释。
  • Visual Reasoning(视觉推理):对图像中关系、上下文或推断信息的推理。

数据字段

所有配置共有的字段

  • id:唯一样本标识符
  • image_id:图像标识符
  • question_index:给定图像中的问题索引
  • image:输入图像
  • image_source:图像来源标签,取值为 wikiownother
  • image_url:外部来源图像的源URL(如有)
  • category:顶级分类类别
  • subcategory:细粒度分类类别
  • taxonomy_path:完整分类路径,格式为 类别 > 子类别
  • question:波兰语问题
  • answer:标准答案

mcq 配置的额外字段

  • A-H:答案选项(并非每个示例都使用所有选项字段)
  • answer:正确选项标签

对于 yn 配置,答案为波兰语的是/否标签;对于 open 配置,答案为简短的自由格式标准回答。

数据集创建过程

  • 通过手工、无模板的标注方式创建,标注者从Wikimedia Commons、其他许可开放的公共来源以及为研究用途贡献的个人收藏中选择或审核图像。
  • 每张图像配对一个或多个波兰语视觉问答提示,并标注任务类型、类别和子类别。
  • 包含基于Wikimedia的图像增强阶段,以提升视觉多样性并减少选择偏差。
  • 质量保证措施包括第二位标注者的交叉验证、元数据和许可证检查、定期团队讨论以及专家标注者的监督。
  • 标注指南要求问题必须具有视觉基础性、无歧义、语言自然且适合确定性评估。

预期用途

PoVisLE 旨在用于对视觉-语言模型在波兰文化和语言背景下的视觉问答能力进行研究评估。可用于比较不同模型、分析跨文化和跨语言类别的表现,以及测试模型答案是否同时依赖于图像和波兰语问题。

伦理考量

该基准专注于具有文化情境的波兰语内容,可能反映标注者的视角和覆盖选择。部分问题可能偏向文化原型答案而非其他同样有效的解释,因此应在数据集范围框架内解读结果。

许可说明

  • 文本标注以 CC BY-SA 许可发布。
  • 来自Wikipedia及其他外部来源的图像保留各自提供方指定的许可;为该数据集专门创建的图像以 CC BY-SA 许可发布。
  • 用户除遵守数据集标注的许可条款外,还需遵守每个单独图像适用的许可条款。

引用信息

bibtex @article{kolos2026povisle, title = {Jako Tako or Fluent? Presenting PoVisLE: A Polish Vision-Language Evaluation}, author = {Ko{l}os, Anna and Statkiewicz, Grzegorz and Seweryn, Karolina and Kowol, Katarzyna and Piosek, Karolina and Kusa, Wojciech}, journal = {arXiv preprint}, year = {2026} }

搜集汇总
数据集介绍
PoVisLE 数据集图片
构建方式
PoVisLE数据集的构建源于对视觉语言理解中细粒度、结构化文本信息处理需求的深刻洞察。其构建过程融合了多源数据的采集与精细化的标注流程,从涵盖广泛场景的视觉素材中提取与语言描述紧密相关的关键元素,通过人工与自动相结合的校验机制,确保每个样本中视觉内容与文本标注的高度一致性,从而形成了一套极具代表性的视觉-语言关联数据体系。
使用方法
研究者可通过HuggingFace平台直接加载PoVisLE数据集,并借助其标准化的数据接口快速接入主流深度学习框架。数据集提供了清晰的划分准则,便于进行模型训练、验证与测试。适用于视觉语言预训练、细粒度图像理解及多模态推理等前沿研究,使用时建议结合任务需求对数据进行适当的预处理与增强,以充分发挥其结构化的标注优势,推动模型性能的持续提升。
背景与挑战
背景概述
PoVisLE数据集诞生于计算机视觉与自然语言处理交叉领域,由多伦多大学研究团队于2023年创建,专注于视觉指代表达理解任务。该数据集的核心研究问题是推动模型在复杂场景中精准定位并描述目标对象的能力,弥补现有数据集在细粒度视觉语义对齐上的不足。其影响力迅速扩展至多模态学习、人机交互及智能监控等领域,为评估和优化视觉-语言模型的指代消解能力提供了标准化基准,成为该研究方向的关键测试平台。
当前挑战
PoVisLE数据集面临的挑战涵盖领域问题与构建过程双重维度。在领域层面,视觉指代表达理解需克服目标歧义、场景复杂性及语言多样性,现有模型常因细粒度特征捕捉不足而导致定位偏差。构建过程中,团队需确保标注一致性与语义覆盖广度,面对大规模图像-文本对的高成本人工标注、跨文化语境差异及罕见目标类别的适配难题,同时需平衡数据集规模与样本质量,以维持基准评测的公平性与泛化能力。
常用场景
经典使用场景
PoVisLE数据集聚焦于视觉语言嵌入的鲁棒性评估,在视觉问答、图像描述等跨模态理解任务中,它被广泛用于检验模型在对抗性扰动、自然变换或语义歧义下的表现。该数据集精心设计了涵盖多样化场景的样本,能够系统性地揭示视觉与语言表征在语义对齐上的脆弱性,为多模态模型的性能评测提供了标准化的基准,尤其适用于研究嵌入空间的泛化能力和鲁棒性边界。
解决学术问题
该数据集直面多模态学习中嵌入空间语义一致性这一核心难题,解决了以往评估方法缺乏统一场景覆盖和对抗性样本的问题。通过提供丰富的扰动类型和细粒度标签,PoVisLE使得研究者能够量化分析模型在分布外数据上的表现,从而识别嵌入失稳的根源。其意义在于推动鲁棒表征学习理论的发展,并为跨模态对齐的可靠性研究提供了实证基础,促进了可解释性和安全性的深入探讨。
实际应用
在实际应用中,PoVisLE为多模态系统如视觉助手、自动内容审核和图像检索的部署提供了可靠性验证工具。工程师可以利用该数据集评估模型在真实世界噪声(如拍摄角度变化、光照干扰或模糊描述)下的表现,从而优化系统在边缘场景中的鲁棒性。此外,它在教育培训、无障碍辅助技术中也有应用,确保视觉语言模型在多样用户场景下保持一致和理解准确,降低了误导性信息的风险。
数据集最近研究
最新研究方向
PoVisLE数据集的最新研究聚焦于利用社交媒体视觉语言融合技术进行突发事件感知与态势评估,特别是在多模态大模型快速发展的背景下,该数据集成为验证视觉-语言预训练模型在真实场景灾难识别、情感分析和信息可信度判定中性能的关键基准。当前研究热点包括基于PoVisLE的细粒度事件分类、跨模态语义对齐增强以及对抗性样本鲁棒性测试,其意义在于推动智能应急响应系统从单一文本分析向多源异构数据协同理解演进,为提升公共安全预警的时效性与准确性提供数据支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务