justatom/uniai-vision-benchmark
收藏资源简介:
uniai-vision-benchmark是一个平衡的俄语/英语/阿拉伯语视觉基准测试子集,源自MTSAIR/MWS-Vision-Bench数据集。该数据集保留了原始文档图像和俄语/英语任务,并添加了由GPT-5.5生成的阿拉伯语任务标签。它旨在用于多语言视觉语言模型评估,以及围绕文档视觉问答、OCR、文档解析和关键信息提取的轻量级微调。数据集包含476个样本,任务分布均匀:推理视觉问答、全页OCR、文档解析和关键信息提取各119个样本。列信息包括图像、样本ID、问题(俄语、英语、阿拉伯语)、答案等字段。
The uniai-vision-benchmark is a balanced visual benchmark subset encompassing Russian, English, and Arabic, derived from the MTSAIR/MWS-Vision-Bench dataset. This dataset preserves the original document images and Russian/English task sets, while adding Arabic task labels generated via GPT-5.5. It is intended for the evaluation of multilingual vision-language models, as well as lightweight fine-tuning for tasks centered on document visual question answering, optical character recognition (OCR), document parsing, and key information extraction. The dataset comprises 476 samples with uniformly distributed task categories: 119 samples each for reasoning visual question answering, full-page OCR, document parsing, and key information extraction. Its data columns include fields such as image, sample ID, questions in Russian, English and Arabic, answers, and other relevant fields.




