R1-Onevision
收藏资源简介:
R1-Onevision数据集是一个精心设计的资源,旨在赋予模型先进的多模态推理能力。该数据集旨在弥合视觉和文本理解之间的差距,提供跨多个领域的丰富、上下文感知的推理任务,包括自然场景、科学、数学问题、基于OCR的内容和复杂图表。它结合了LLaVA-OneVision的高质量数据和特定领域的数据集,每个数据集都经过精心选择和过滤,为复杂的视觉推理任务提供了坚实的基础。通过专注于深度推理和准确的模型预测,R1-Onevision使模型能够处理各种视觉和文本输入,精确地解决复杂的推理挑战。
R1-Onevision is a multimodal inference large-scale model designed to address complex visual reasoning tasks. It seamlessly integrates visual and textual data, offering precise interpretation of multimodal information and excelling in fields such as mathematics, science, deep image understanding, and logical reasoning.
R1-Onevision 数据集概述
数据集简介
R1-Onevision 是一个开源的多模态大型语言模型,具备深度推理能力,能够处理复杂的视觉推理任务。该模型能够将视觉和文本数据无缝集成,对多模态信息提供精确解释,擅长数学、科学、深度图像理解和逻辑推理等领域。
数据集链接
数据集版本
- 第二版数据集、模型和代码即将在几天后发布。
- 第一版数据集、模型和推理基准已发布。
数据集特点
R1-Onevision 结合了 Qwen-VL 的多模态能力和 DeepSeek-R1 的深度推理能力,超越了 GPT-4o 的功能,是一个处于领先地位的多模态推理模型。
作者团队
- Yi Yang*, Xiaoxuan He*, Hongkun Pan*, Xiyan Jiang, Yan Deng, Xingtao Yang, Haoyu Lu, Minfeng Zhu†, Bo Zhang†, Wei Chen†




