遇见数据集

P2R-10k

收藏
Hugging Face2026-07-06 更新2026-07-07 收录
官方服务:

资源简介:

P2R-10k 是一个用于细粒度视觉推理任务的数据集,包含10,000个样本。该数据集专为训练基于PRA-GRPO的P2R(Perceive-to-Reason)模型而构建。每个样本由一张高分辨率图像和一个需要结合细粒度视觉感知与逻辑推理才能回答的问题组成。数据集通过从三个现有数据集中随机采样组合而成,具体来源及样本数量为:DeepEyes_train_4K (3k样本)、VisualProbe_train (3k样本) 以及 ZwZ-RL-VQA-mini (4k样本)。该数据集支持问答任务,适用于训练和评估在复杂视觉场景下进行精细推理的模型。

P2R-10k is a dataset for fine-grained visual reasoning tasks, containing 10,000 samples. It is specifically constructed for training P2R (Perceive-to-Reason) models based on PRA-GRPO. Each sample consists of a high-resolution image and a question that requires combining fine-grained visual perception with logical reasoning to answer. The dataset is composed by randomly sampling from three existing datasets, with specific sources and sample counts as follows: DeepEyes_train_4K (3k samples), VisualProbe_train (3k samples), and ZwZ-RL-VQA-mini (4k samples). It supports question-answering tasks and is suitable for training and evaluating models that perform fine-grained reasoning in complex visual scenes.

创建时间:
2026-06-30
原始信息汇总

数据集概述:P2R-10k

  • 名称:P2R-10k
  • 许可协议:Apache-2.0
  • 任务类别:问答(question-answering)
  • 规模:1,000 < 样本数 < 10,000(实际为10k样本)
  • 用途:用于训练论文《Perceive-to-Reason: Decoupling Perception and Reasoning for Fine-Grained Visual Reasoning》中提出的P2R模型,采用PRA-GRPO方法。

数据构成

  • 样本结构:每个样本包含一张高分辨率图像和一个需要精细感知与推理才能回答的问题。
  • 数据来源:从以下三个数据集中随机采样构建:
    • DeepEyes_train_4K:3,000 个样本
    • VisualProbe_train:3,000 个样本
    • ZwZ-RL-VQA-mini:4,000 个样本

相关资源

  • 论文:Perceive-to-Reason: Decoupling Perception and Reasoning for Fine-Grained Visual Reasoning (arXiv:2607.01191)
  • 代码仓库:GitHub - ZJU-REAL/Perceive-to-Reason
  • 模型:P2R-4B
  • 演示:Hugging Face Space - perceive-to-reason

引用

如使用该数据集,请引用以下论文: bibtex @misc{li2026perceivetoreasondecouplingperceptionreasoning, title={Perceive-to-Reason: Decoupling Perception and Reasoning for Fine-Grained Visual Reasoning}, author={Hongxing Li and Xiufeng Huang and Dingming Li and Wenjing Jiang and Zixuan Wang and Haolei Xu and Hanrong Zhang and Haiwen Hong and Longtao Huang and Hui Xue and Weiming Lu and Jun Xiao and Yueting Zhuang and Yongliang Shen}, year={2026}, eprint={2607.01191}, archivePrefix={arXiv}, primaryClass={cs.CV}, url={https://arxiv.org/abs/2607.01191}, }

搜集汇总
数据集介绍
P2R-10k 数据集图片
构建方式
在视觉推理领域,模型通常需同时执行感知与推理任务,但二者交织往往导致性能瓶颈。为解耦这一过程,P2R-10k应运而生,作为Perceive-to-Reason框架的专用训练集。该数据集精心筛选自三个高质量子集:从DeepEyes_train_4K中抽取3,000个样本,从VisualProbe_train中抽取3,000个样本,并从ZwZ-RL-VQA-mini中抽取4,000个样本,最终汇集而成约10,000个样本。每个数据点均包含高分辨率图像与需结合精细感知与逻辑推理才能解答的问题,确保训练素材兼具复杂度与多样性。
特点
P2R-10k数据集融合了多源数据的优势,形成了独具特色的知识结构。其核心特点在于对“感知”与“推理”的明确剥离:样本问题设计精巧,可能涉及细微物体识别、空间关系推断或因果逻辑分析,迫使模型在视觉定位与高层次思考间建立清晰边界。这种设计有效克服了传统视觉问答数据集中感知与推理混为一谈的局限,同时10k量级的规模简化了训练流程,专为强化学习范式PRA-GRPO优化,从而提升细粒度视觉推理的精准度。
使用方法
P2R-10k专用于训练P2R模型,并依托PRA-GRPO强化学习方法进行优化。使用者可直接从HuggingFace仓库获取数据集,并将其整合至模型训练管道中。搭配Perceive-to-Reason开源代码库,用户可加载高分辨率图像与相应问题,通过对比模型输出与真实答案来迭代参数。该数据集设计简练,无需额外预处理,其JSON格式示例便于批量加载。建议结合官方提供的P2R-4B预训练模型进行微调,以在细粒度视觉推理任务中取得最佳效果,同时可复用配套的在线Demo进行快速验证。
背景与挑战
背景概述
在细粒度视觉推理领域,模型常需同时执行感知与推理任务,但二者相互耦合常导致性能瓶颈。P2R-10k数据集由浙江大学REAL研究团队于2026年创建,聚焦于解耦感知与推理的范式创新。该数据集包含一万个样本,每项样本由高分辨率图像与需精细感知推理的问题构成,旨在为P2R模型配合PRA-GRPO训练提供支撑。研究团队通过分别选取DeepEyes_train_4K、VisualProbe_train及ZwZ-RL-VQA-mini三个子集中的样本,构建了兼具多样性与挑战性的训练集,为细粒度视觉推理研究奠定了数据基础,推动了感知与推理解耦方向的发展。
当前挑战
该数据集所应对的领域挑战在于:现有视觉推理模型将感知与推理过程紧密交织,难以独立优化,在细粒度场景下易产生错误累积。具体而言,模型在处理需精确辨识微小对象、细微纹理或空间关系的问题时,感知错误会直接误导推理环节,导致整体性能下降。数据集构建过程中面临的挑战包括:从多个源数据集中筛选兼具感知难度与推理深度的样本,确保图像分辨率足以支撑精细分析,以及平衡不同来源数据以覆盖广泛视觉场景,避免偏差影响模型泛化能力。
常用场景
经典使用场景
P2R-10k数据集专为细粒度视觉推理任务而设计,其经典使用场景在于训练和评估多模态大模型在感知与推理解耦框架下的表现。该数据集包含10,000个高分辨率图像与精细问题对,每个样本要求模型先精准感知图像中的局部细节(如物体属性、空间关系),再基于感知信息进行逻辑推理以回答复杂问题。这一设计有效模拟了人类视觉认知中“先看后思”的过程,为研究如何提升视觉语言模型在精细任务上的准确性与可解释性提供了关键基准。
实际应用
在实际应用中,P2R-10k所代表的细粒度视觉推理能力可广泛赋能工业质检、自动驾驶、医学影像分析等需要高精度视觉理解的领域。例如,在显微镜下检测细胞异常时,模型需先感知细胞核的形态特征,再推理其病变等级;在自动驾驶场景中,车辆需精准感知路况标志的微小变化并推理安全决策。此外,该数据集还可用于智能教育领域的自动错题分析、电商平台的商品细节问答等,帮助机器在处理复杂视觉信息时达到人类级精细度。
衍生相关工作
基于P2R-10k数据集的提出,研究者已衍生出多项经典工作,其中包括PRA-GRPO训练框架,该框架利用强化学习中的策略优化来解耦感知与推理过程,并首次在细粒度视觉问答中实现两者的独立优化。后续工作进一步探索了感知-推理分离的注意力机制和多阶段推理网络,以及将数据集扩展至跨模态场景(如视频与文本的联合推理)。这些研究共同构建了一个以“解耦”为核心的技术体系,推动了视觉语言模型在细粒度理解领域的前沿进展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务