amalia-llm/SEED-Bench-PT
收藏官方服务:
资源简介:
SEED-Bench-PT是SEED-Bench的欧洲葡萄牙语(pt-PT)机器翻译版本。SEED-Bench是一个多项选择题基准,涵盖多模态理解(如视觉、语言等)的多个维度。该翻译使用gemini-3.1-pro从原始英语的test分割生成,是AMALIA项目的一部分,包含在amalia-vl-eval中,这是一个用于评估欧洲葡萄牙语大型视觉语言模型的综合基准套件。数据集包含17990个测试示例,特征包括问题、答案、选项、图像等。
European Portuguese (pt-PT) machine translation of SEED-Bench, a multiple-choice benchmark spanning multiple dimensions of multimodal comprehension.
提供机构:
amalia-llm搜集汇总
数据集介绍

构建方式
SEED-Bench-PT是面向欧洲葡萄牙语(pt-PT)的多模态理解基准数据集,源自英文原版SEED-Bench的测试集。原数据集涵盖图像与文本交互下的多项选择问答,涵盖多个维度的多模态理解能力。为适配葡语评估需求,研究者采用Gemini 3.1 Pro大语言模型将全部文本内容(包括问题、选项及答案)进行机器翻译,从而构建出本数据集。值得注意的是,图像内容及未翻译列保留原数据集许可,所有翻译文本则遵循CC BY-NC 4.0许可协议,因此使用本数据集时需同时遵守双重许可约束。翻译过程中可能存在的误差或伪影已予以明确标注,以确保学术严谨性。
特点
SEED-Bench-PT的核心特点在于其作为欧洲葡萄牙语首个大规模多模态理解评测基准的稀缺价值。该数据集保留了原SEED-Bench的结构化设计,包含17,990个测试样本,每个样本由图像、问题、四个选项及正确答案组成,覆盖从视觉感知到高层次推理的多样化能力维度。其机器翻译方式虽引入一定质量风险,但借助先进的Gemini模型,译文流畅度与准确性在葡语领域具有前瞻性探索意义。此外,数据集与AMALIA项目深度集成,共同构成AMALIA-VL评测套件,为评估视觉-语言模型在葡语背景下的表现提供了标准化、可复现的平台。
使用方法
使用SEED-Bench-PT时,研究者可通过HuggingFace datasets库按默认配置直接加载测试集,数据以JSON结构存储,包含data_id、question、choice_a至choice_d、answer及image等字段。适用于评估视觉-语言模型在葡语环境下的多项选择视觉问答能力。建议在评测时,将模型输出与标准答案进行严格精确匹配,计算准确率。由于数据集仅包含单一测试切分,无训练或验证集,因此主要用于模型性能的最终评估。使用时需注意遵守双许可证要求,仅限非商业用途,并注明数据来源及翻译方法。推荐结合AMALIA-VL评测仓库中提供的自动化脚本,以规范评测流程。
背景与挑战
背景概述
SEED-Bench-PT数据集由AMALIA项目团队于2026年构建,研究人员来自葡萄牙多家机构,旨在填补欧洲葡萄牙语多模态评估资源的空白。该数据集通过机器翻译将广泛使用的英文多模态理解基准SEED-Bench转化为葡萄牙语版本,核心研究问题聚焦于评估大规模视觉语言模型在欧葡语场景下的多维度理解能力。作为AMALIA-VL模型及其评估套件amalia-vl-eval的重要组成部分,SEED-Bench-PT推动了多语种视觉语言模型的研究进展,尤其为资源较少语言的公平性评估提供了关键基准,对促进非英语多模态人工智能发展具有重要影响力。
当前挑战
该数据集面临的核心挑战首先在于解决多模态理解评测中语种覆盖不足的领域问题,即现有基准高度偏向英语,难以衡量模型在欧葡语等低资源语言上的真实表现。构建过程中,主要挑战包括:利用机器翻译语言模型gemini-3.1-pro进行欧葡语转化时,需处理多义词、文化特定表达及图像-文本对齐的语义偏差,避免因翻译误差引入评估噪声;同时需严格遵循原始SEED-Bench的许可协议,确保翻译内容(CC-BY-NC-4.0)与原始数据(图像等)的版权兼容性,在非商业用途下实现数据合规发布。
常用场景
经典使用场景
SEED-Bench-PT作为葡萄牙语版本的视觉语言多模态理解基准测试,经典使用场景在于系统评估多模态大模型在欧式葡萄牙语环境下的综合理解能力。该数据集涵盖图像与文本交互的多个维度,包括场景识别、常识推理、视觉叙事等核心能力单元。研究者通过模型在此测试集上的表现,可以全面诊断其跨模态语义对齐的质量,尤其在非英语语境下是否保持了稳定且精准的图像-语言映射关系。领域内通常将SEED-Bench-PT作为低资源语言多模态测评的标杆,用以验证模型在跨语言迁移学习中的鲁棒性与有效性。
实际应用
在实际应用中,SEED-Bench-PT可直接服务于葡萄牙语国家(如葡萄牙、巴西)的AI产业落地,尤其在教育科技、智能客服、社交媒体内容理解等场景中发挥关键作用。例如,在面向葡萄牙语用户的视觉问答系统中,开发者可利用该数据集测试模型对本地化场景、文化背景和语言表达的理解能力。此外,零售、安防、医疗影像等领域的多模态质检与推理系统,也需依赖此类高信度基准来保障其在葡萄牙语环境下的准确性与稳定性。该数据集因此成为产品化部署前的重要验证工具。
衍生相关工作
围绕SEED-Bench-PT衍生的一系列经典工作包括:基于各类多模态大模型(如LLaVA、Qwen-VL、InternVL)的葡萄牙语零样本评估研究,系统对比了不同模型在低资源语言下的表现差异;针对翻译噪声与文化适配性的分析工作,探讨了机器翻译本身的不确定性对评测结果的影响;以及在此基准上进一步微调的葡萄牙语专用多模态模型AMALIA-VL的研发。这些工作共同推动了葡语多模态理解的理论进步,也为其他低资源语言的多模态基准构建提供了可复现的方法论范式。
以上内容由遇见数据集搜集并总结生成



