Monet-SFT-125K
收藏资源简介:
Monet-SFT-125K是由北京大学与Kling团队联合构建的高质量多模态推理数据集,包含12.5万条图文交织的思维链样本。该数据集涵盖真实场景、图表分析、文字识别和几何推理四大领域,数据来源整合了ReFocus、CogCoM等权威基准,通过视觉裁剪、边界框标注和辅助线绘制等操作增强视觉表征。数据集采用三阶段精炼流程构建,首先筛选原始图像无法解决的难题,继而验证辅助图像的有效性,最后通过大模型标注关键视觉观察词元。该数据集专为训练潜在视觉推理模型而设计,旨在解决复杂视觉场景下的抽象推理和跨领域泛化问题。
Monet-SFT-125K is a high-quality multimodal reasoning dataset jointly constructed by Peking University and the Kling team, consisting of 125,000 chain-of-thought samples interleaved with text and images. This dataset covers four core domains: real-world scenarios, chart analysis, text recognition, and geometric reasoning. Its data sources integrate authoritative benchmarks including ReFocus and CogCoM, and visual representations are enhanced through operations such as visual cropping, bounding box annotation, and auxiliary line drawing. The dataset is built via a three-stage refinement pipeline: first, screening out challenging problems that cannot be resolved with raw images; second, verifying the effectiveness of auxiliary images; and finally, annotating key visual observation tokens using large language models. This dataset is specifically designed for training visual reasoning models, aiming to address the challenges of abstract reasoning and cross-domain generalization in complex visual scenarios.
Monet数据集概述
数据集基本信息
- 数据集名称: Monet
- 核心功能: 支持多模态大语言模型在潜在视觉空间中进行推理的训练框架
- 技术特点: 通过生成连续嵌入作为中间视觉思维,实现潜在空间直接推理
数据集构成
训练数据
- SFT数据: Monet-SFT-125K (https://huggingface.co/datasets/NOVAglow646/Monet-SFT-125K/tree/main)
- RL数据: Thyme-RL (https://huggingface.co/datasets/Kwai-Keye/Thyme-RL)
模型资源
- 预训练模型: Monet-7B (https://huggingface.co/NOVAglow646/Monet-7B)
技术实现
模型架构
- 基于Qwen2.5-VL-7B模型的定制化修改
- 支持潜在推理的Transformers和vLLM代码修改
训练方法
SFT训练
- 修改前向传播过程以支持潜在嵌入
- 主要实现在
modeling_qwen2_5_vl_monet.py文件中
RL训练
- 基于EasyR1框架实现
- 支持潜在推理和文本推理两种采样策略
- 动态采样困难样本进行训练
- 使用外部LLM API进行规则判断
推理功能
关键特性
- 支持潜在-文本交错推理
- 通过
<abs_vis_token>切换潜在思维模式 - 可控制潜在嵌入生成数量
推理设置
- 使用修改后的vLLM代码进行推理
- 支持潜在令牌后处理
- 可设置潜在嵌入大小
评估方法
- 基于VLMEvalKit进行评估
- 使用API判断替代精确匹配评估
- 确保评估准确性
引用文献
bibtex @misc{wang2025monetreasoninglatentvisual, title={Monet: Reasoning in Latent Visual Space Beyond Images and Language}, author={Qixun Wang and Yang Shi and Yifei Wang and Yuanxing Zhang and Pengfei Wan and Kun Gai and Xianghua Ying and Yisen Wang}, year={2025}, eprint={2511.21395}, archivePrefix={arXiv}, primaryClass={cs.CV}, url={https://arxiv.org/abs/2511.21395}, }




