遇见数据集

fm-model-experiments-data

收藏
Hugging Face2026-07-08 更新2026-07-09 收录
官方服务:

资源简介:

FM Model Experiments — KO+EN VLM Synthetic Data 是一个用于视觉语言模型(VLM)训练的综合合成数据集,特别强调韩语(KO)覆盖以及细粒度视觉感知和图形用户界面(GUI)基础能力。该数据集仅包含注释文件(.jsonl 格式),总计 84,212 行,分为三个主要组别:细粒度感知、GUI思维→动作和多教师蒸馏。图像需用户从指定的原始数据集(如 LLaVA-Pretrain、The Cauldron、OmniACT 等)自行获取并按照相对路径放置。数据集旨在支持 VLM 的指令调优(SFT)和基于可验证奖励的强化学习(RL),尤其关注现有开源数据中缺乏的韩语视觉理解和 GUI 交互任务。数据内容包括:1. 细粒度感知:涉及属性、空间关系、计数和OCR等视觉能力问题,包含逐步思维链推理和简短可验证答案,数据通过强VLM生成并经过双重验证,提供韩英混合及单独语言版本。2. GUI思维→动作:基于真实(主要是韩语)网站的GUI交互轨迹,使用5个基础动作(点击、输入、滚动、按键、完成),坐标归一化,每个动作前有思维链推理,包括自渲染截图和从OmniACT数据集转换的数据。3. 多教师蒸馏:由强大的开源教师模型(如 Gemma-4-26B、Qwen3.5-397B)生成的视觉问答(VQA)、思维链推理和OCR标记答案,分为韩语和英语版本,涵盖VQA、CoT、深度CoT和结构化OCR提取等任务。数据集适用于视觉问答(VQA)、图像文本到文本生成、细粒度视觉感知和GUI代理等任务场景。注释数据采用 Apache-2.0 许可证发布,但引用的第三方图像受其原始许可证约束,需单独获取并遵守相应条款。

FM Model Experiments — KO+EN VLM Synthetic Data is a comprehensive synthetic dataset for vision-language model (VLM) training, with a particular emphasis on Korean (KO) coverage and fine-grained visual perception and graphical user interface (GUI) foundational capabilities. The dataset contains only annotation files (.jsonl format), totaling 84,212 lines, divided into three main groups. Images need to be obtained by the user from specified original datasets (such as LLaVA-Pretrain, The Cauldron, OmniACT, etc.) and placed according to relative paths. The dataset aims to support VLM instruction tuning (SFT) and verifiable reward-based reinforcement learning (RL), especially focusing on Korean visual understanding and GUI interaction tasks lacking in existing open-source data. The data content includes three core parts: 1. Fine-grained perception (fgp_perception/): Contains questions requiring visual abilities, involving skills such as attributes, spatial relationships, counting, and OCR. Each sample includes step-by-step chain-of-thought (CoT) reasoning and short verifiable answers. The data is generated by strong VLMs and undergoes dual verification to ensure visual dependency and anti-hallucination. Korean-English mixed and separate language versions are provided. 2. GUI thought→action (agentic_gui/): Contains GUI interaction trajectories based on real (mainly Korean) websites, using five basic actions (click, input, scroll, key press, complete). Coordinates are normalized, with chain-of-thought reasoning before each action. Includes self-rendered screenshots (already included) and data converted from the OmniACT dataset. 3. Multi-teacher distillation (synth_distill/): Contains visual question answering (VQA), chain-of-thought reasoning, and OCR-tagged answers generated by powerful open-source teacher models (such as Gemma-4-26B, Qwen3.5-397B). Divided into Korean and English versions, covering tasks such as VQA, CoT, deep CoT, and structured OCR extraction. The dataset is suitable for task scenarios such as visual question answering (VQA), image-text-to-text generation, fine-grained visual perception, and GUI agents. The annotation data is released under the Apache-2.0 license, but referenced third-party images are subject to their original licenses and must be obtained separately and comply with the corresponding terms.

提供机构:
MindsAndCompany
创建时间:
2026-07-08
原始信息汇总

数据集概述

数据集名称: FM Model Experiments — Synthetic VLM Training Data (KO + EN)
许可证: Apache-2.0
语言: 韩语 (ko), 英语 (en)
任务类别: 视觉问答 (visual-question-answering), 图像到文本 (image-text-to-text)
规模: 10,000 < n < 100,000 (总计 84,212 条数据)
页面地址: https://huggingface.co/datasets/mncai/fm-model-experiments-data

备注: 该仓库仅包含标注文件 (.jsonl),不包含图像。图像需从原始来源获取并放置在 data/ 目录下。


数据分组与内容

该数据集共有 84,212 条数据,分为 3 个主要部分:

1. fgp_perception/ — 细粒度感知

  • 描述: 合成生成的视觉问答数据,涵盖属性、空间、计数、OCR 等任务。每条数据包含逐步思考过程 (<think>) 和简短可验证答案。
  • 生成方法: 使用强 VLM 生成问答,两个独立验证模型必须同意,且纯文本模型无法回答(确保视觉依赖性)。韩语条目使用韩语验证。
  • 图像来源: LLaVA-Pretrain
  • 数据量: 2,489 条(合并 EN+KO)
    • fgp_v2_en_sft.jsonl: 1,479 条
    • fgp_v2_ko_sft.jsonl: 1,010 条
  • 数据格式: {"image", "source", "skill", "lang", "conversations":[{"from":"human","value":"<|image|> ..."},{"from":"gpt","value":"<think>...</think> <answer>"}]}

2. agentic_gui/ — GUI 思维到动作

  • 描述: 基于真实网页的 GUI 操作轨迹,使用 5 种动作空间 (click / type / scroll / key / done),坐标归一化至 [0, 1000]。每个动作前有思考过程 (<think>)。
  • 图像来源:
    • 自有的 Playwright 渲染截图 (431 张, 已打包在仓库中: images/gui_screenshots.tar.gz)
    • OmniACT 数据集
  • 数据量:
    • agentic_gui_sft.jsonl: 433 条(自有截图,无幻觉 DOM 框)
    • omniact_5verb_train.jsonl: 3,406 条
    • omniact_5verb_test.jsonl: 948 条
  • 数据格式:
    • agentic_gui_sft 使用 {"from":"human"/"gpt"}<|image|>
    • OmniACT 使用 {"from":"user"/"assistant"}<image> 标记,动作为 JSON 格式,如 {"action":"click","point":[x,y]}

3. synth_distill/ — 多教师知识蒸馏

  • 描述: 由多个强教师模型(如 Gemma-4-26B, Qwen3.5-397B)生成的 VQA、思维链 (CoT)、深度思维链 (DeepCoT) 以及 OCR 回答。每条数据记录教师模型 (teacher 字段)。
  • 图像来源: LLaVA-Pretrain 和 The Cauldron(子集如 docvqa, ai2d 等)
  • 数据量:
    • 韩语:
      • synth_ko_vqa.jsonl: 19,990 条
      • synth_ko_cot.jsonl: 9,980 条
      • synth_ko_deepcot.jsonl: 11,030 条
    • 英语:
      • synth_en_vqa.jsonl: 13,055 条
      • synth_en_cot.jsonl: 9,993 条
      • synth_en_deepcot.jsonl: 5,974 条
    • OCR:
      • synth_ocr.jsonl: 4,425 条(结构化工整提取,韩语提示)

图像获取

该数据集仅包含标注,训练前需从原始来源获取图像。可使用代码仓库中的 download_images.py 脚本自动下载:

bash python download_images.py --which all # 下载所有图像

或按来源下载: --which gui | llava | omniact | cauldron

各来源获取方式:

来源 数据量 获取地址 放置路径
LLaVA-Pretrain 57,002 条 liuhaotian/LLaVA-Pretrain data/llava_pretrain/
The Cauldron 22,409 条 HuggingFaceM4/the_cauldron 运行 prep_stage2_cauldron.py 后放置
OmniACT 4,354 条 Writer/omniact data/omniact/
自有 GUI 截图 431 条 已打包在仓库 images/gui_screenshots.tar.gz data/gui_traj_v2/, data/gui_traj_v3/
RefCOCO 14 条 COCO train2014 data/refcoco_imgs/

许可证与使用说明

  • 本仓库标注: Apache-2.0
  • 第三方图像: 不包含,需遵守各自原始数据集的许可证(LLaVA-Pretrain, The Cauldron, OmniACT, RefCOCO)
  • 自有 GUI 截图: 已打包在仓库中,适用于 Apache-2.0(公开网页的 Playwright 渲染)
  • 教师模型: 来自第三方,商业使用前需检查各教师模型的条款
  • 预期用途: 用于 VLM 的指令微调 (SFT) 和强化学习 (RL),特别侧重韩语覆盖、细粒度感知和 GUI 接地任务。详细训练方案见技术报告: https://github.com/genonai/fm-model-experiments/blob/main/docs/TECH_REPORT.md

数据格式示例

  • fgp_perception: {"image": "data/llava_pretrain/images/xxx.jpg", "source": "llava_pretrain", "skill": "spatial", "lang": "en", "conversations": [{"from": "human", "value": "<|image|> What is to the left of the cup?"}, {"from": "gpt", "value": "<think>The cup is on the right side of the table, so the object to its left is a book.</think> <answer>book</answer>"}]}
  • agentic_gui: {"from": "human", "value": "<|image|> Navigate to the login page."}, {"from": "gpt", "value": "<think>I need to find and click the login button.</think> {"action": "click", "point": [450, 200]}"}
搜集汇总
数据集介绍
构建方式
该数据集是为构建原生分辨率韩英双语视觉语言模型而产出的标注数据,共包含84,212条样本,分为细粒度感知、GUI智能体与多教师蒸馏三大类。细粒度感知数据通过强视觉语言模型生成问答对,并由两个独立验证模型共同确认以消除幻觉,同时确保纯文本模型无法回答,以验证视觉依赖性。GUI智能体数据基于真实网页截图与DOM真实框标注,将动作空间抽象为点击、键入、滚动、按键和完成五种操作,坐标归一化至0到1000,并在每一步动作前附加思考过程。多教师蒸馏数据则整合了Gemma-4-26B、Qwen3.5-397B等强大开放教师模型的输出,覆盖韩英双语视觉问答、链式推理、深度链式推理及OCR结构化提取等任务。所有标注以JSONL格式存储,图像文件需从原始来源获取并放置于对应路径。
使用方法
该数据集主要用于视觉语言模型的指令微调与可验证奖励的强化学习,特别强调韩语覆盖、细粒度感知与GUI智能体推理能力的提升。用户需从HuggingFace或原始来源下载对应图像文件(如LLaVA-Pretrain、The Cauldron、OmniACT等),并运行项目提供的download_images.py辅助脚本自动将图像组织到本地data目录下,使JSONL中的相对路径得以正确解析。训练时可依据任务需求选择使用细粒度感知部分提升视觉专有技能,或采用GUI部分构建智能体决策链,亦可利用多教师蒸馏部分增强复杂推理与双语能力。每行样本包含图像路径、来源、技能标签、语言及标准对话结构,支持灵活适配不同模型架构与训练框架,具体使用方法与数据配比可参考附带的技术报告。
背景与挑战
背景概述
该数据集由Genon AI研究团队于2024年构建,旨在解决多模态大语言模型在细粒度感知、GUI智能体任务及低资源语言(如韩语)覆盖方面的数据稀缺问题。核心研究问题在于如何通过合成数据与严格的验证机制,构建一个高质量、多语言的视觉语言模型训练集。数据集共包含84,212条样本,融合了LLaVA-Pretrain、The Cauldron等公开数据集及自主采集的GUI截图,并通过双验证器协同过滤与文本模型盲测确保任务的视觉依赖性,其在视觉定位、OCR及GUI动作推理等领域的标注设计,为VLM在复杂场景下的泛化能力提供了重要支撑,尤其对韩语多模态研究领域产生了积极影响。
当前挑战
该数据集主要应对的领域挑战包括:1)多模态模型在细粒度视觉任务(如空间关系、计数、OCR)中依赖文本先验而忽视视觉线索的倾向,需通过‘视觉强制依赖’机制设计对抗性任务;2)GUI智能体领域缺乏统一动作空间与抗幻觉的接地标注,需将原始脚本转换为标准化5动词格式并结合DOM真实边界框。构建中的挑战则体现为:数据源的版权与许可异构性要求分离发布标注与图像,同时需设计可复现的图片获取流程;合成数据存在教师模型偏见与跨语言质量不一致的风险,需通过韩语专属验证流程与多教师蒸馏策略予以缓解。
常用场景
经典使用场景
该数据集专为视觉语言模型(VLM)的指令微调与监督微调(SFT)而设计,尤其聚焦于韩语与英语的双语场景。其核心使用方式是将精细粒度感知、GUI智能体轨迹与多教师蒸馏问答三类数据混合,构建出覆盖属性识别、空间关系、计数、OCR等视觉依赖性任务的训练集。每条样本均包含显式的思维链推理(<think>)与可验证的简短答案,并通过双重验证机制确保视觉依赖性与抗幻觉能力,适用于提升模型在弱项感知技能上的表现。
解决学术问题
该数据集系统性地应对了多模态大模型中两大长期挑战:精细粒度感知能力的缺失与低资源语言(韩语)的数据匮乏。通过合成数据与多教师蒸馏策略,解决了冻结大语言模型在视觉问答中易产生幻觉、缺乏空间与属性推理的问题。同时,针对韩语领域,验证流程全程以韩文进行,弥补了公开数据集中韩语标注不足的空白,为构建真正双语通用的视觉语言模型提供了可复现的学术基准。
实际应用
在实际应用中,该数据集最直接的价值在于赋能智能GUI智能体与跨语言视觉助手。其GUI轨迹数据将网页操作抽象为点击、键入、滚动等原子动作,并配有DOM级别的真值框,可用于训练能够在真实浏览器环境中执行任务的数字助手。此外,精细感知与蒸馏数据适合部署到移动端或云端多模态服务中,支持韩英双语的图像描述、文档解析及结构化问答,显著降低了对高成本人工标注的依赖。
数据集最近研究
最新研究方向
该数据集聚焦于韩英双语视觉语言模型(VLM)的前沿训练数据合成,特别针对细粒度感知(如属性、空间、计数与OCR)以及图形用户界面(GUI)代理任务,代表了多模态领域中数据质量与任务多样性的重要进展。其创新之处在于采用双重验证机制——强VLM生成问答对后,需两个独立验证模型一致通过且纯文本模型失败,从而确保视觉依赖性并抑制幻觉。此外,数据集通过多教师蒸馏策略(如Gemma-4-26B、Qwen3.5-397B)生成带有思维链(CoT)的问答,并结合DOM标注的GUI轨迹数据,推动了面向可验证奖励的指令微调与强化学习。此工作在韩语VLM资源稀缺的背景下,为跨语言、高精度视觉理解任务(如自动化GUI操作)提供了高质量基准,与当前多模态智能体与合成数据研究热点紧密呼应。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务