遇见数据集

amalia-llm/CARAVELA

收藏
Hugging Face2026-07-07 更新2026-07-22 收录
官方服务:

资源简介:

CARAVELA是一个多模态基准数据集,专门用于评估大型视觉语言模型在葡萄牙文化知识方面的表现。该数据集以欧洲葡萄牙语(pt-PT)为官方语言,包含12,983个图像-问题对,基于3,354个独特的葡萄牙文化实体(如历史古迹、美食、人物、艺术和地点)。每个数据项围绕一个文化实体及其图像构建,涵盖五个文化类别(美食、古迹、人物、艺术、地点)、三个知识维度(时间维度:历史时间线和日期;文化维度:象征意义、社会影响和传统;空间维度:地理背景和物理特征)和三个任务格式(多项选择、视觉问答、推理)。数据集结构包括图像、问题、选项(对于多项选择任务)、答案(正确选项字母或自由文本)、实体名称、类别标签、知识维度区域和支持文本(来自葡萄牙维基百科)。注释部分使用Apache-2.0许可,图像部分源自Wikimedia Commons并保留原始许可。该数据集旨在量化模型在葡萄牙文化元素上的对齐和视觉理解能力,提供细粒度的诊断评估。

CARAVELA is a multimodal benchmark for evaluating the Portuguese cultural knowledge of large vision-language models (LVLMs). The official benchmark language is exclusively European Portuguese (pt-PT). It contains 12,983 image–question pairs derived from 3,354 unique Portuguese cultural entities. Each item is anchored to a culturally relevant Portuguese entity and its image, organized along three axes: five cultural categories (Gastronomy, Monuments, Personalities, Art, Locations), three knowledge dimensions (Temporal: historical timelines and dates; Cultural: symbolic meaning, societal impact, and traditions; Spatial: geographical context and physical features), and three task formats (Multiple-Choice, Visual Question Answering, and Reasoning). The dataset structure includes fields such as image, question, options (for MCQ), answer (correct option letter or free-text), entity, category, area, and supporting text (from Portuguese Wikipedia). Annotations are licensed under Apache-2.0, while images are sourced from Wikimedia Commons and retain their original licenses. It provides a rigorous framework to quantify cultural alignment and visual understanding across Portugals cultural elements.

提供机构:
amalia-llm
搜集汇总
数据集介绍
amalia-llm/CARAVELA 数据集图片
构建方式
CARAVELA数据集以葡萄牙丰富多元的文化遗产为基石,系统性构建了涵盖历史遗迹、美食、人物、艺术与地标五大类别的多模态评估框架。数据采集环节严格筛选自维基共享资源的图像资料,并依托葡萄牙语维基百科的权威文本,通过开放式权重模型自动生成问答对与推理链条。每一条目均包含图像、问题、候选选项及正确答案,并辅以支持性文本与逻辑推理路径,确保问题解答无法脱离视觉信息而独立完成。最终汇集了涵盖3,354个独有文化实体的12,983个图像-问题样本,为跨文化视觉语言理解提供了精细化的诊断工具。
特点
该数据集在结构设计上独具匠心,从文化类别、知识维度与任务格式三个层面构建了立体化评估体系。文化类别涵盖美食、文物、艺术等五大领域,知识维度则细分为时间、文化与空间三类认知深度,任务格式上兼容多项选择、视觉问答与推理挑战,从而能够精准定位模型在特定文化领域与认知层面的薄弱环节。尤为重要的是,所有数据均以欧洲葡语呈现,聚焦于全球训练语料中常被忽视的葡萄牙本土文化表征,有效弥补了现有文化基准测试的系统性偏差。
使用方法
使用者可直接从HuggingFace数据集仓库加载默认配置,其数据按训练集单一划分,包含图像字段与结构化文本字段。在评估流程中,对于多项选择模式,模型需从四个选项中选择正确字母标识;对于开放型视觉问答与推理任务,则需生成自由文本答案。建议研究者参考官方代码仓库中提供的标准化评估脚本,将预测答案与 answer 字段进行对比。同时需注意,数据集采用双重许可协议,除标注部分的Apache-2.0许可外,使用图像时须严格遵照维基共享资源各自的原始许可条款,确保合规引用与归属说明。
背景与挑战
背景概述
CARAVELA数据集由AMALIA-LLM项目团队于2026年创建,旨在评估大型视觉语言模型(LVLMs)对葡萄牙文化的理解能力。当前,通用型多模态模型在处理全球化语境下的任务时表现卓越,但其在本地化、文化特异性内容上的性能急剧下降,这源于训练数据中非主流文化表征的稀缺。葡萄牙拥有丰富的文化遗产——历史古迹、美食、杰出人物与独特艺术——而现有文化基准对此类内容覆盖不足,导致模型在西方语境主导的训练后产生系统性偏差。CARAVELA的提出正是为了填补这一空白,通过12,983个图像-问题对,涵盖美食、古迹、人物、艺术与地点五大文化类别,并沿时间、文化与空间三个知识维度设计多选题、视觉问答与推理任务,以精细诊断模型在葡萄牙文化场景下的视觉理解与文本对齐能力,为多模态文化评测树立了新的标杆。
当前挑战
该数据集面临的挑战主要源于两方面。在领域问题上,通用视觉语言模型在处理葡萄牙特有文化场景时表现欠佳,如无法区分“葡式蛋挞”与“贝尔姆蛋挞”的视觉差异,或混淆阿连特茹地区的建筑风格与里斯本地标,这暴露出模型在细粒度文化知识上的盲区。在构建过程中,挑战来自数据获取的局限性:图像仅从维基共享资源中提取,可能无法覆盖葡萄牙全境的区域多样性;同时,问题与答案经由开放权重模型生成,虽经人工核实,但自动标注的质量控制仍存在难度,尤其涉及文化隐喻与历史事实的精确性;此外,欧洲葡萄牙语的细微语法变化与方言差异也增加了文本标注的一致性挑战。
常用场景
经典使用场景
在视觉与语言模型评估领域,CARAVELA数据集被广泛用于检验大模型对葡萄牙文化知识的掌握程度。该基准由12,983个图像-问题对构成,涵盖美食、名胜、名人、艺术与地域五大文化类别,并围绕时间、文化、空间三个知识维度设计多选题、视觉问答及推理任务。研究者通常以此评估模型是否具备跨模态的文化理解能力——每道题目均要求模型在理解葡萄牙语文本的同时解析对应图像,从而精准衡量其文化对齐程度与视觉语义融合水平。
实际应用
在实际产业中,CARAVELA可助力葡萄牙本土的旅游导览、文化遗产数字化及教育科技应用。例如,搭载该基准评估的智能导览系统能够更准确地识别用户上传的修道院、蛋挞或国粹法多表演图像,并提供符合葡萄牙文化背景的回答。新闻媒体与出版社亦可利用其检验自动问答系统在区域性内容上的文化敏感度,避免因训练数据不足引发的错误或误解,从而提升面向葡语受众的智能服务体验。
衍生相关工作
CARAVELA的发布催生了多项相关研究工作,最直接的是其所属的AMALIA-VL项目——一个原生欧洲葡萄牙语的开源视觉与语言模型,该模型将CARAVELA作为核心评测基准进行迭代优化。此外,研究者借鉴其三轴标注框架(时间、文化、空间)构建了面向其他拉丁语系国家的文化多模态基准,如针对巴西或安哥拉文化的改编版本。在方法层面,基于CARAVELA推理链数据(reasoning_chain)的思维链微调工作,也显著提升了模型在文化推理任务中的表现。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务