Multi-PixMo-Cap; Multi-PixMo-AskModelAnything; Multi-PixMo-CoSyn-400k
收藏资源简介:
Multi-PixMo是由维拉诺瓦大学和Aithlas联合开发的多语言视觉-语言数据集,包含Caption生成(Cap)、开放式视觉问答(AskModelAnything)和文本密集图像推理(CoSyn-400k)三大子集,总计280万条数据,覆盖5种欧洲语言。数据集采用再生-翻译技术,基于PixMo原有数据通过许可模型重新生成多语言标注,确保语义一致性和法律合规性。数据生成过程结合人工审核与模型迭代优化,重点提升跨语言视觉 grounding 质量。该资源旨在解决多模态模型训练中非英语数据稀缺和评估基准单一的问题,支持图像描述、视觉推理等任务的多语言研究。
Multi-PixMo is a multilingual vision-language dataset co-developed by Villanova University and Aithlas. It includes three subsets: Caption generation (Cap), Open-ended Visual Question Answering (AskModelAnything), and Text-dense Image Reasoning (CoSyn-400k), with a total of 2.8 million data instances covering 5 European languages. The dataset adopts the Regeneration-Translation technique, where multilingual annotations are regenerated based on the original PixMo dataset via licensed models to ensure semantic consistency and legal compliance. The data generation process combines human review and model iterative optimization, focusing on improving the quality of cross-lingual visual grounding. This resource aims to address the issues of scarce non-English data and single evaluation benchmarks in multimodal model training, supporting multilingual research on tasks such as image captioning and visual reasoning.

- 1Multilingual Training and Evaluation Resources for Vision-Language Models维拉诺瓦大学; Aithlas · 2026年



