遇见数据集

amalia-llm/RealWorldQA-PT

收藏
Hugging Face2026-07-06 更新2026-07-22 收录
官方服务:

资源简介:

RealWorldQA-PT是RealWorldQA数据集的欧洲葡萄牙语(pt-PT)机器翻译版本,是一个用于评估视觉语言模型的基准测试。该数据集包含从物理环境拍摄的图像中提取的真实世界空间理解问题,涉及图像、问题(欧洲葡萄牙语)和答案(欧洲葡萄牙语)。原始数据集的英语test分割通过gemini-3.1-pro翻译成欧洲葡萄牙语,可能包含翻译错误或伪影。数据集由AMALIA项目提供,是amalia-vl-eval基准套件的一部分,专门用于评估欧洲葡萄牙语的大型视觉语言模型。

RealWorldQA-PT is the European Portuguese (pt-PT) machine-translated variant of the RealWorldQA dataset, a benchmark for evaluating vision-language models. This dataset includes real-world spatial comprehension questions extracted from images captured in physical environments, with corresponding images, questions (European Portuguese), and answers (European Portuguese). The English test split of the original dataset was translated into European Portuguese using Gemini 3.1 Pro, which may contain translation errors or artifacts. The dataset is provided by the AMALIA Project and is part of the amalia-vl-eval benchmark suite specifically designed for evaluating large vision-language models in European Portuguese.

提供机构:
amalia-llm
搜集汇总
数据集介绍
amalia-llm/RealWorldQA-PT 数据集图片
构建方式
在视觉-语言模型评测领域,空间理解能力是衡量模型对物理世界认知水平的关键维度。RealWorldQA-PT数据集源自英文原版RealWorldQA评测基准,后者包含从真实物理环境中捕获的图像及相关空间理解问题。该数据集基于原版的测试集(test split),利用先进的gemini-3.1-pro大语言模型,通过机器翻译技术将英文的问答内容精准转换为欧洲葡萄牙语(pt-PT)。翻译过程保留了原始图像及其路径信息,确保视觉内容与语言描述的一致性,构建出一个专用于评估葡语环境下视觉-语言模型空间理解能力的评测资源。
特点
该数据集的核心特点在于其双语迁移性与领域专精性。相较于原始英文数据集,RealWorldQA-PT聚焦于葡萄牙语这一低资源语言场景,填补了葡语视觉-语言评测领域的空白。数据集包含650个测试样本,每项由真实世界图像、相应的问题及参考答案组成,覆盖多样化的物理环境与空间关系。作为AMALIA项目的一部分,该数据集与amalia-vl-eval评测套件深度集成,为欧洲葡萄牙语的大规模视觉-语言模型提供标准化、可复现的评估基准,尤其适用于评测模型在空间推理任务上的跨语言泛化能力。
使用方法
使用RealWorldQA-PT数据集时,研究人员需遵循双许可证条款:翻译的文本内容采用CC-BY-NC 4.0非商业许可,图像及未翻译列则保留原始RealWorldQA的许可证。数据集以HuggingFace标准格式发布,特征包含图像(image)、图像路径(image_path)、问题(question)及答案(answer),可直接通过datasets库加载。用户需注意机器翻译可能存在的误差或伪影,建议在评测时结合人工校验。该数据集集成于amalia-vl-eval评测框架中,支持直接调用以评估模型在葡萄牙语空间理解任务上的表现,或作为微调数据增强葡语视觉-语言模型的问答能力。
背景与挑战
背景概述
多模态大语言模型在空间理解与视觉推理任务上的表现日益受到关注,然而现有基准测试多以英语为唯一媒介语言,限制了其对非英语语言社区模型能力的评估效度。为填补这一空白,RealWorldQA-PT数据集于2026年由AMALIA项目团队创建,该项目隶属于葡萄牙的AMALIA-LLM研究机构。该数据集聚焦于从真实物理环境拍摄的图片中提取的空间理解问题,基于英文版RealWorldQA基准,利用Gemini 3.1 Pro模型自动翻译为欧洲葡萄牙语(pt-PT),旨在评估葡萄牙语环境下视觉语言模型的空间推理能力。作为AMALIA-VL评估套件的重要组成部分,该数据集为低资源语言的多模态模型发展提供了关键评估工具,对推动葡萄牙语自然语言处理与计算机视觉交叉研究具有深远影响。
当前挑战
该数据集所解决的领域问题主要在于现有视觉语言模型基准大多以英语为中心,缺乏对葡萄牙语等非主流语言模型空间理解能力的系统化评估。构建过程中面临的首要挑战在于如何保证机器翻译的语义保真度,空间关系类问答对翻译要求极高精度,以避免因语法或词汇歧义导致答案失真。其次,从图像、问答对到元数据的多模态结构需维护语言版本的完整性,翻译后仍须严格对齐原图与问答案例,防止数据错位。此外,数据集采用双重许可机制,须同时兼容Creative Commons NonCommercial条款与原始RealWorldQA的许可限制,增加了合法使用的复杂性。最终,650条测试用例虽规模有限,但作为高质量葡萄牙语多模态评估资源,其稀缺性与领域专业性构成显著的构建与维护挑战。
常用场景
经典使用场景
RealWorldQA-PT数据集专为评估多模态大语言模型在真实物理环境中的空间理解能力而设计。其经典使用场景聚焦于葡萄牙语(欧洲)环境下,模型对图像中物体空间关系、位置推断与场景解析的跨模态推理任务。研究者通过向模型提出诸如‘哪个物体离相机最近’或‘门把手在什么位置’等问题,检验模型在自然场景中处理空间语义的准确性。该数据集包含650张真实世界图像及其对应的葡萄牙语问答对,覆盖了从室内到室外的多样化场景,成为衡量视觉语言模型在非英语语种下空间理解能力的标杆。
实际应用
在实际应用层面,RealWorldQA-PT为葡萄牙语地区的智能视觉系统部署提供了测试基准。例如,在葡萄牙语为主要语言的交互式机器人导航任务中,模型需要理解用户用母语提出的空间指令,如‘把书放在桌子的左边’;在智能监控与自动驾驶场景里,系统必须准确解析葡萄牙语环境中的实时空间描述。该数据集帮助开发者筛选和优化视觉语言模型,确保其在真实葡萄牙语应用场景中具备可靠的空间理解能力,从而加速了多语言AI助手、住房辅助设备及智慧城市系统在葡语国家的商业化落地。
衍生相关工作
基于RealWorldQA-PT,衍生出了一系列推动多语言视觉语言模型发展的重要工作。AMALIA项目率先将其纳入amalia-vl-eval综合评估套件,用于系统评测葡萄牙语大视觉语言模型的空间理解性能。后续研究者以此数据集为基础,探索了机器翻译质量对下游任务的影响,以及如何通过跨语言数据增强提升模型的空间推理鲁棒性。此外,该数据集还启发了其他语种(如西班牙语、法语)版本的RealWorldQA翻译工作,形成了多语言空间理解评估的生态体系,催生了关于语言偏好对模型行为影响的理论探讨。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务