遇见数据集

nvidia/ProfBench

收藏
Hugging Face2025-10-23 更新2025-10-25 收录
官方服务:

资源简介:

ProfBench数据集包含超过3000个评分标准,跨越40个人类注释的任务,这些任务涉及STEM领域(化学、物理学)的专业任务报告以及专业服务领域(金融服务、管理咨询)。该数据集适用于商业和非商业用途。

The ProfBench dataset contains more than 3000 rubric criteria across 40 human-annotated tasks presenting reports addressing professional tasks in the PhD STEM (Chemistry, Physics) and Professional Services (Financial Services, Management Consulting) domains. This dataset is ready for commercial/non-commercial use.

提供机构:
nvidia
搜集汇总
数据集介绍
构建方式
在大型语言模型评估领域,传统基准测试往往聚焦于常识问答或简单推理,难以衡量模型在真实专业场景中的表现。ProfBench数据集应运而生,由NVIDIA Corporation于2025年9月创建,旨在填补这一空白。该数据集采用混合数据收集方法,融合了人工标注、合成数据与自动化流程。其构建核心在于收集来自化学与物理学博士级STEM领域、以及金融与管理咨询专业服务领域的40项人工标注任务,每项任务均包含15至59条独特的评估标准(rubrics),并收集了OpenAI o3、xAI Grok4和DeepSeek R1-0528三个模型的响应,最终形成超过3000条rubric-响应对,以文本格式存储,总容量约1 MB。
特点
ProfBench数据集最为突出的特点在于其高度专业化的多领域覆盖与精细化的评估体系。它横跨化学、物理学等硬科学博士层级,以及金融服务、管理咨询等专业服务领域,确保评估任务贴近真实职业场景。每项任务配备的数十条人工编写评估标准,从多个维度细致刻画了专业回答的质量要求,使模型评估不再局限于单一指标。此外,数据集同时包含多个顶尖模型的对比响应,为横向比较提供了便利。其规模虽小(40条记录),但每一条都经过精心设计,体现了深度与精度并重的设计理念,并已获得NVIDIA评估数据集许可证,适用于商业与非商业用途。
使用方法
研究人员与开发者可便捷地利用ProfBench评估大型语言模型在专业任务上的表现。推荐的使用方式是通过Nemo Evaluator SDK(https://github.com/NVIDIA-NeMo/Evaluator)集成该数据集,该SDK提供了统一的评估接口,支持跨数十个基准测试的标准化评估流程。使用者可直接从HuggingFace数据集页面(https://huggingface.co/datasets/nvidia/ProfBench)下载数据,每条记录包含唯一标识符、领域标签、提示指令、评估标准以及三个模型的响应。通过对比模型输出与人工编写的评估标准,用户可以量化分析模型在特定专业领域的推理能力、知识准确性和回答质量,从而指导模型优化与选型。
背景与挑战
背景概述
ProfBench是由NVIDIA Corporation于2025年9月创建的多领域专业评估基准数据集,旨在衡量大型语言模型在高级专业任务上的表现。其核心研究问题在于,现有基准多聚焦于通用知识或简单推理,而缺乏对需要深厚领域知识的专业报告生成能力的系统评估。该数据集由Zhilin Wang、Jaehun Jung等研究人员主导,覆盖化学、物理学博士级STEM领域以及金融服务、管理咨询等专业服务领域,包含超过3000条人工标注的评分标准-回答对。ProfBench的发布填补了专业领域评估的空白,推动了LLM在高端应用场景中可靠性的研究,已成为衡量模型专业能力的重要标杆,对学术界与工业界均产生了深远影响。
当前挑战
ProfBench所解决的领域挑战在于,现有LLM评估体系难以准确衡量模型在专业报告生成中的深度知识与逻辑严谨性,例如在化学合成方案或财务分析中,模型需同时具备领域专长与结构化表达能力。构建过程中,团队面临多重困难:首先,需跨学科设计40项专业任务并确保其真实反映从业者需求;其次,人工标注超过3000条评分标准需耗费大量专家时间,且标准需覆盖15至59个精细维度以保证评估的客观性;此外,混合人类与合成数据的采集方式需平衡数据规模与质量,避免引入噪声。这些挑战使ProfBench成为一项兼具理论与实践难度的开创性工作。
常用场景
经典使用场景
ProfBench数据集专为评估大型语言模型在专业领域任务中的表现而设计,其经典使用场景集中于对模型在化学、物理等博士级STEM领域以及金融服务、管理咨询等专业服务领域的能力进行系统性评测。通过提供超过3000条基于人工标注的评分标准-回答对,该数据集能够精细衡量模型在回答高度专业化问题时的准确性、逻辑性和领域知识深度,成为研究者检验LLM专业素养的核心基准。
解决学术问题
该数据集有效填补了现有评估基准在专业任务领域的空白,解决了学术研究中长期存在的难题:如何客观、可重复地衡量LLM在需要深厚专业知识的场景下的表现。它引入多维度评分标准,使研究者能够深入分析模型在化学、物理、金融和咨询等不同领域的薄弱环节,推动了对LLM推理能力、知识迁移和领域适应性的系统研究,为理解模型能力边界提供了关键工具。
衍生相关工作
ProfBench的发布催生了一系列相关研究,包括基于其评分标准改进的LLM训练策略,如针对专业领域的强化学习微调方法;以及围绕数据集构建的自动化评估工具链,例如Nemo Evaluator SDK中的集成评测接口。此外,后续工作还探索了将评分标准用于模型输出的可解释性分析,并衍生出跨领域知识迁移的基准测试,进一步拓展了专业任务评估的边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务