ProJudgeBench, ProJudge-173k
收藏资源简介:
ProJudgeBench是第一个专门设计用于评估基于多模态大语言模型的过程判断能力的综合基准测试。它包含2,400个测试案例和50,118个步骤级标签,涵盖四个科学学科,具有不同的难度级别和多模态内容。每个步骤都由人类专家精心注释,以评估判断者检测、分类和诊断错误的能力。ProJudge-173k是一个大规模指令调优数据集,旨在通过动态双阶段微调策略增强开源模型的过程评估能力。
ProJudgeBench is the first comprehensive benchmark specifically designed to evaluate the procedural judgment capabilities of multimodal large language models. It comprises 2,400 test cases and 50,118 step-level labels, spanning four scientific disciplines with varying difficulty levels and multimodal content. Each step is meticulously annotated by human experts to assess the ability of judges to detect, classify and diagnose errors. ProJudge-173k is a large-scale instruction tuning dataset developed to enhance the procedural evaluation capabilities of open-source models via a dynamic two-stage fine-tuning strategy.
ProJudge数据集概述
数据集简介
ProJudge是一个为多模态大型语言模型(MLLM)设计的多模态、多学科、多难度级别的基准测试和指令微调数据集,用于评估MLLM-based过程评判员的性能。
关键特征
- 多模态、多学科、多难度:包含2400个测试案例和50,118个步骤级别的标签,涵盖数学、物理、化学和生物学等四个学科,具有不同的难度级别和模态内容。
- 细粒度错误分析:定义了七种错误类型,涵盖模型在长推理链中可能犯的常见错误。每个步骤都由人类专家精心标注正确性、错误类型和解释,以系统地评估过程评判员检测、分类和诊断错误的性能。
- 真实和多样化的错误模式:收集了10种不同大小、架构和设计目标的MLLM的解决方案,反映了现实世界中推理行为和错误模式的广泛谱系。
相关资源
- 论文:ProJudge: A Multi-Modal Multi-Discipline Benchmark and Instruction-Tuning Dataset for MLLM-based Process Judges
- 项目主页:ProJudge Homepage
- ProJudgeBench数据集:Hugging Face - ProJudgeBench
- ProJudge-173k数据集:Hugging Face - ProJudge-173k
许可
- 代码许可:Apache 2.0
- 数据许可:Creative Commons Attribution-NonCommercial 4.0 International
使用和许可通知:数据和代码仅用于研究目的。许可:知识共享署名-非商业性使用 4.0 国际许可。需遵守OpenAI的政策:OpenAI使用条款
引用
@article{ai2025projudge, title={ProJudge: A Multi-Modal Multi-Discipline Benchmark and Instruction-Tuning Dataset for MLLM-based Process Judges}, author={Jiaxin Ai and Pengfei Zhou and Zhaopan Xu and Ming Li and Fanrui Zhang and Zizhen Li and Jianwen Sun and Yukang Feng and Baojin Huang and Zhongyuan Wang and Kaipeng Zhang}, journal={arXiv preprint arXiv:2503.06553}, year={2025} }




