遇见数据集

Humanibench_Greek

收藏
Hugging Face2026-07-10 更新2026-07-11 收录
官方服务:

资源简介:

Humanibench_Greek 是 HumaniBench 数据集的希腊语翻译版本,旨在为希腊语视觉语言模型提供一个以人为本的多模态评估基准。该数据集保留了原始数据集的任务结构,并将所有文本字段翻译成希腊语。它包含八个不同的子任务配置,覆盖了广泛的多模态理解和生成任务:场景理解、实例识别、多项选择视觉问答、多语言开放式问答、多语言封闭式问答、视觉定位、共情图像描述以及图像鲁棒性测试。每个配置包含图像和相应的文本标注(如问题、答案、属性、选项、推理过程、边界框等),数据规模从数百到上万个样本不等。该数据集专门用于评估模型在希腊语环境下理解图像内容、回答视觉相关问题、进行多模态推理以及在多种以人为本的评估场景中的稳健性。

Humanibench_Greek is the Greek translation version of the HumaniBench dataset, designed to provide a human-centric multimodal evaluation benchmark for Greek visual language models. It preserves the task structure of the original dataset and translates all text fields into Greek. It includes eight distinct subtask configurations, covering a wide range of multimodal understanding and generation tasks: scene understanding, instance recognition, multiple-choice visual question answering, multilingual open-ended question answering, multilingual closed-ended question answering, visual grounding, empathetic image description, and image robustness testing. Each configuration contains images and corresponding textual annotations (e.g., questions, answers, attributes, options, reasoning processes, bounding boxes, etc.), with data scales ranging from hundreds to tens of thousands of samples. The dataset is specifically used to evaluate models ability to understand image content, answer visual-related questions, perform multimodal reasoning, and demonstrate robustness in various human-centric evaluation scenarios in a Greek language context.

创建时间:
2026-07-08
原始信息汇总

数据集概述:Humanibench_Greek

数据集地址: https://huggingface.co/datasets/ilsp/Humanibench_Greek

Humanibench_Greek 是 HumaniBench 数据集的希腊语翻译版本,旨在用于评估支持希腊语的视觉-语言模型。该数据集保持了原始 HumaniBench 的任务结构,并将所有文本字段翻译为希腊语。

任务组成

数据集包含以下 8 个子任务(configs),每个任务均为独立的配置:

任务名称 描述 训练集样本数 训练集大小
Scene_Understanding 场景理解任务,涉及视觉问答。 13,668 ~122.3 MB
Instance_Identity 实例识别任务,包含基于图像的问答。 1,343 ~12.1 MB
Multiple_Choice_VQA 多项选择视觉问答,包含问题、选项、答案和推理过程。 1,844 ~128.8 MB
Multilingual_OpenEnded 多语言开放式视觉问答。 625 ~5.5 MB
Multilingual_CloseEnded 多语言封闭式视觉问答,包含问题、选项、答案和推理过程。 625 ~51.2 MB
Visual_Grounding 视觉定位任务,包含图像、问题和边界框(bbox)。 285 ~33.3 MB
Empathetic_Captioning 共情描述任务,包含图像、社会属性、简单提示和共情提示。 204 ~5.1 MB
Image_Resilience 图像鲁棒性任务,包含攻击类型、图像、属性和问答。 1,500 ~14.0 MB

数据特征

各任务共享通用的数据特征,主要包括:

  • ID(字符串):样本唯一标识。
  • image(图像):样本对应的图像数据。
  • Attribute(字符串):样本相关属性(多数任务包含)。
  • Question(字符串):针对图像的问题。
  • Answer(字符串):问题对应的答案。
  • 部分任务还包含:
    • Options(字符串):多项选择任务的可选项。
    • Reasoning(字符串):答案的推理过程(如 Multiple_Choice_VQA 和 Multilingual_CloseEnded)。
    • social_attribute(字符串):共情描述任务中的社会属性。
    • simple_prompt / empathic_prompt(字符串):共情描述任务中的不同类型提示。
    • attack_type(字符串):图像鲁棒性任务中的攻击类型。
    • version_type(字符串):场景理解任务中的版本类型。
    • bbox(浮点数列表):视觉定位任务中的边界框坐标。
    • question(字符串):视觉定位任务中的问题(字段名小写)。

数据划分与大小

所有任务仅包含 train 划分,无验证或测试集。整个数据集的总下载大小约为 461.1 MB,解压后数据集总大小约为 509.7 MB

预期用途

该数据集专为评估视觉-语言模型在希腊语环境下的人类中心多模态任务表现而设计。可用于测试模型在图像理解、视觉问答、内容推理、多项选择提示处理以及跨不同人类中心评估场景的鲁棒性。

引用

使用该数据集时,请引用原始 HumaniBench 论文:

@article{raza2025humanibench, title={HumaniBench: A Human-Centric Framework for Large Multimodal Models Evaluation}, author={Raza, Shaina and Narayanan, Aravind and Khazaie, Vahid Reza and Vayani, Ashmal and Chettiar, Mukund S. and Singh, Amandeep and Shah, Mubarak and Pandya, Deval}, journal={arXiv preprint arXiv:2505.11454}, year={2025} }

搜集汇总
数据集介绍
Humanibench_Greek 数据集图片
构建方式
Humanibench_Greek数据集是基于原始HumaniBench数据集的希腊语翻译版本,旨在为具备希腊语能力的视觉-语言模型提供一个以人为中心的多模态评估基准。该数据集保留了原始HumaniBench的任务结构,将所有文本字段翻译为希腊语。数据集的构建通过分任务子集的方式实现,涵盖了场景理解、实例识别、多项选择视觉问答、多语言问答(包括开放式与封闭式)、视觉定位、共情描述以及图像韧性等八大子集。每个子集均以JSON格式存储,包含图像路径、问题、答案、属性等结构化字段,便于模型的加载与评估。
特点
该数据集的核心特点在于其多任务、多模态的评估框架,能够全面衡量模型在希腊语语境下对视觉内容的理解与推理能力。数据集包含超过2万个样本,覆盖了从简单场景理解到复杂共情描述、从封闭式选择到开放式生成、从视觉定位到图像鲁棒性测试等多个维度。每个子集都设计了明确的属性标签与问题类型,确保评估的标准化与可重复性。此外,数据集的图像来源多样,贴近真实人类交互场景,增强了评估的生态效度。
使用方法
用户可通过HuggingFace Datasets库直接加载各子集,例如使用`load_dataset('Humanibench_Greek', 'Scene_Understanding', split='train')`获取场景理解任务的训练数据。每个样本均包含图像(image)、问题(Question)与答案(Answer)字段,部分子集还提供选项(Options)与推理(Reasoning)字段。适用于零样本评估、微调或跨语言迁移学习场景。建议将模型生成的输出与标准答案进行精确匹配或语义相似度计算,以衡量模型在希腊语多模态任务上的表现。
背景与挑战
背景概述
Humanibench_Greek数据集是基于2025年由Vector Institute主导创建的HumaniBench基准测试的希腊语翻译版本,旨在服务于以人为中心的大规模多模态模型评估。该数据集由Shaina Raza、Aravind Narayanan等研究人员开发,其核心研究问题聚焦于多模态视觉-语言模型在希腊语环境下的跨语言与跨文化鲁棒性评估。覆盖场景理解、实例识别、多项选择视觉问答、多语言问答、视觉定位、共情描述及图像韧性等八大任务,为多模态模型的希腊语能力评测提供了系统化框架,在推动非英语多模态模型演进方面具有重要学术与应用价值。
当前挑战
该数据集面临的领域挑战在于多模态模型在跨语言环境下的泛化能力不足,特别是在希腊语这一低资源语言上,模型需同时处理视觉语义与语言结构的双重对齐。构建过程中面临的核心挑战包括:原始HumaniBench中文本内容的准确翻译与语境保真,避免文化特定概念流失;需确保希腊语翻译后的问答与视觉锚点保持高度一致性,防止语义偏差;此外,多任务数据统一标注格式的维护与跨子集一致性校对亦构成显著工程挑战。
常用场景
经典使用场景
Humanibench_Greek数据集的核心价值在于为希腊语视觉-语言模型提供一个多维度、以人为中心的评估基准。该数据集整合了场景理解、实例识别、多选问答、开放与封闭式多语言问答、视觉定位以及共情描述等多种任务范式,能够全面考察模型在图像理解、视觉推理、细粒度语义对齐和跨语言泛化等关键能力上的表现。研究人员常利用该数据集的标准化任务配置,对模型进行系统性诊断,从而揭示其在处理希腊语视觉语言任务时的优势与局限。
实际应用
在实际应用中,Humanibench_Greek数据集为开发面向希腊语用户的智能视觉助手、无障碍辅助工具及内容审核系统提供了关键测试环境。例如,在旅游业中,评估模型能否准确理解希腊地标图像并回答相关文化背景问题;在医疗或教育领域,测试其能否基于图像进行精确的视觉描述或解答专业疑问。此外,对模型视觉鲁棒性的考察,直接关系到产品在真实、嘈杂图像输入下的稳定性,为多模态应用的产品化落地提供了可靠性验证。
衍生相关工作
该数据集的发布催生了一系列旨在提升希腊语视觉语言模型性能的衍生工作。研究者基于其任务构成,开发了针对希腊语的视觉指令微调数据集和跨语言视觉特征对齐方法。同时,该基准启发了对以人为中心的共情视觉描述模型的评估研究,推动了在多模态系统中融入社会属性感知的学术浪潮。此外,其多语言任务配置也为研究视觉与希腊语文本之间的语义鸿沟填补提供了可复现的测试平台,促进了多语言多模态评测体系的完善。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务