遇见数据集

mncai/fm-model-experiments-data

收藏
Hugging Face2026-07-13 更新2026-07-22 收录
官方服务:

资源简介:

FM模型实验—合成视觉语言模型训练数据(韩语+英语)是一个用于视觉语言模型训练的合成数据集,特别针对韩语和英语。数据集包含84,212行注释数据,分为三个主要部分:1) 细粒度感知数据(fgp_perception/):包含需要视觉的问答(属性/空间/计数/OCR等),每个问题都有逐步推理过程和短答案,重点覆盖冻结LLM视觉语言模型最弱的技能;2) GUI代理数据(agentic_gui/):包含GUI思考→动作轨迹,使用5个动词动作空间(点击/输入/滚动/按键/完成),坐标归一化到[0,1000];3) 多教师蒸馏数据(synth_distill/):包含由强大开放教师模型(如Gemma-4-26B、Qwen3.5-397B等)生成的VQA/链式思考/OCR-markdown答案。数据集支持韩语和英语,重点是韩语覆盖和细粒度感知+GUI基础,旨在解决韩语开放数据不足的问题。数据集仅包含注释(.jsonl文件),不包含图像,图像需要从原始来源(如LLaVA-Pretrain、The Cauldron、OmniACT等)获取。

FM Model Experiment — Synthetic Vision-Language Model Training Data (Korean + English) is a synthetic dataset intended for vision-language model training, with a particular focus on Korean and English. The dataset contains 84,212 lines of annotated data, divided into three main sections: 1. Fine-grained Perception Data (fgp_perception/): This section includes vision-required question answering (QA) tasks covering attributes, spatial relationships, counting, OCR and other scenarios. Each question is paired with a step-by-step reasoning process and a short answer, focusing on the weakest skill sets of frozen large language model (LLM)-based vision-language models. 2. GUI Agent Data (agentic_gui/): This section contains GUI thinking → action trajectories, utilizing a 5-type verb action space including click, input, scroll, press key and complete, with all coordinates normalized to the range [0, 1000]. 3. Multi-Teacher Distillation Data (synth_distill/): This section includes VQA, chain-of-thought and OCR-markdown answers generated by powerful open-source teacher models such as Gemma-4-26B, Qwen3.5-397B and other similar models. The dataset supports both Korean and English, with an emphasis on Korean language coverage, fine-grained perception and GUI fundamentals, aiming to address the shortage of open Korean-language training data. The dataset only includes annotation files in .jsonl format and does not contain any images. Images need to be acquired from original sources such as LLaVA-Pretrain, The Cauldron, OmniACT and other relevant datasets.

提供机构:
mncai
搜集汇总
数据集介绍
mncai/fm-model-experiments-data 数据集图片
构建方式
该数据集专为构建原生分辨率韩英双语视觉语言模型而设计,融合了多种数据来源与精密的合成流程。其核心构成涵盖三大支柱:首先是细粒度感知数据,借助强视觉语言模型生成问答对,并设置两道独立验证模型的共识机制以确保去幻觉效果,同时通过纯文本模型无法回答的基准测试确保视觉依赖性,形成高质量的反事实过滤。其次是智能体图形用户界面轨迹数据,包含自采的Playwright截图与基于OmniACT转换的五动词动作空间,所有坐标均归一化,且对于自采数据采用文档对象模型真实边界框,确保无幻觉。最后是多教师知识蒸馏数据,融合了Gemma、Qwen等高性能开放模型生成的韩英双语视觉问答、思维链与深度思维链及光学字符识别答案。
特点
本数据集最显著的特质在于其对韩语覆盖的强化以及对细粒度感知与图形用户界面定位的深度侧重,弥补了当前开放数据中韩语资源的匮乏。其总量超过八万四千条,但仅提供注释而不含图像,用户需依据相对路径从原始来源获取图像,此举既尊重了各源头数据的各自许可协议,又确保了数据使用与分发的合规性。自采的图形用户界面数据集以Apache-2.0许可证发布,而其他合成回答则源自第三方教师模型,使用前需核查相关条件,体现了对知识产权审慎尊重的态度。
使用方法
使用本数据集进行指令微调或强化学习时,首要步骤是基于代码仓库中的辅助脚本,从LLaVA-Pretrain、The Cauldron、OmniACT及自采图形用户界面截图等源获取图像,并按照注释中的相对路径布局存放,形成本地的'data/'目录结构。数据以JSONL格式呈现,每条记录均包含图像相对路径、来源、技能领域、语言及多轮对话。自采图形用户界面数据与OmniACT转换数据在对话格式与图像标记上存在细微差异,使用时需留意。该数据集特别适用于韩语环境的视觉语言模型训练、可验证奖励的强化学习,以及结合技术报告中的训练方案,进行从感知到行动的端到端能力提升。
背景与挑战
背景概述
该数据集由Genon AI团队于2025年创建,聚焦于构建支持韩语与英语的双语视觉语言模型(VLM)。针对多模态大语言模型在细粒度感知与GUI智能体任务中表现薄弱的现状,团队通过合成数据生成与多教师蒸馏策略,产出84,212条高质量标注样本。数据集整合了LLaVA-Pretrain、The Cauldron等公开资源,并创新性地引入双重验证机制与DOM级精准标注,显著填补了韩语VLM训练数据的空白。该工作为低资源语言的多模态推理与界面交互提供了重要基准,推动了开源VLM在区域化应用中的发展。
当前挑战
数据集面临多维挑战:领域层面,现有VLM在韩语场景下的细粒度属性识别、空间推理及GUI动作规划能力严重不足,且缺乏可验证的韩语多模态训练数据;构建过程中,需解决合成数据的幻觉问题,采用双验证器与文本模型排除策略确保视觉依赖性,同时协调多来源图像版权(如AI-Hub禁止衍生数据分发),仅发布标注信息以规避法律风险。此外,跨语言任务的一致性对齐、DOM级坐标的精确标注以及异构数据格式的统一转换(如OmniACT的5动词动作空间重构)构成了技术实现上的核心难题。
常用场景
经典使用场景
FM Model Experiments 数据集是专为视觉语言模型(VLM)的指令微调与强化学习设计的综合性多模态资源,尤其侧重于韩语与英语双语环境下的精细感知与GUI交互能力。其经典应用在于通过结构化问答(VQA)、思维链推理及GUI智能体动作序列,对VLM进行面向特定弱点的针对性训练。该数据集涵盖84,212条高质量样本,每条样本均包含图像相对路径、人工或合成生成的对话(含<think>推理步骤及答案),以及可验证的GUI动作标签。研究者可将其用于SFT(监督微调)阶段,以提升模型在属性识别、空间定位、计数、OCR等精细感知任务中的表现,同时强化其在图形用户界面中执行点击、滚动等基础操作的能力,为构建具备多模态理解与交互能力的智能体奠定基础。
衍生相关工作
围绕该数据集已衍生出多项重要的相关研究工作。首先,其核心技术报告详细描述了将GLM-4.6V视觉塔移植到GLM-5.2 743B MoE解码器的训练策略,包括分阶段课程学习与强化学习,为大规模多模态模型的低成本训练提供了实证基础。其次,数据集中对OmniACT的5动词动作空间转换方法,催生了后续针对GUI智能体动作归一化与效率评估的系列研究。再者,其提出的“双验证过滤+文本模型失败”的数据质量控制方案,已被后续多个多模态数据集构建项目所采纳与改进。最后,针对韩语环境的合成数据蒸馏管道(涉及Gemma-4、Qwen3.5等大型教师模型)推动了跨语言多模态课程蒸馏的进展,相关论文在跨语言视觉问答与思维链无监督翻译等方向具有显著影响力。
数据集最近研究
最新研究方向
当前,多模态大语言模型(VLM)的前沿研究正聚焦于提升其在细粒度感知(Fine-Grained Perception)与图形用户界面(GUI)智能体任务中的能力,尤其在低资源语言(如韩语)场景下。FM Model Experiments 数据集通过合成数据管线,创新性地整合了视觉依赖验证(双验证器共识)、多教师蒸馏(Gemma/Qwen系列)及基于DOM的GUI轨迹数据,为训练具备思考链(CoT)推理的稳定VLM提供了高质量指令微调样本。该工作呼应了VLM领域从“感知对齐”迈向“可控推理”的浪潮,通过构建抗幻觉、强推理的韩英双语视觉问答与智能体动作基准,显著推动了多语言、多模态智能体系统的实用化进展,为后续可验证奖励强化学习(RLVR)研究奠定了重要数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务