遇见数据集

open-llm-leaderboard/details_openbmb__Eurus-RM-7b

收藏
Hugging Face2024-04-09 更新2024-06-11 收录
官方服务:

资源简介:

该数据集是在Open LLM Leaderboard上对openbmb/Eurus-RM-7b模型进行评估时自动创建的。数据集包含63个配置,每个配置对应一个评估任务。数据集由1次运行生成,每次运行的结果存储为特定配置中的一个分割,分割名称使用运行的时间戳。train分割始终指向最新的结果。此外,还有一个名为results的配置存储了所有运行的聚合结果,用于计算和显示Open LLM Leaderboard上的聚合指标。

该数据集是在Open LLM Leaderboard上对openbmb/Eurus-RM-7b模型进行评估时自动创建的。数据集包含63个配置,每个配置对应一个评估任务。数据集由1次运行生成,每次运行的结果存储为特定配置中的一个分割,分割名称使用运行的时间戳。train分割始终指向最新的结果。此外,还有一个名为results的配置存储了所有运行的聚合结果,用于计算和显示Open LLM Leaderboard上的聚合指标。

提供机构:
open-llm-leaderboard
原始信息汇总

数据集概述

该数据集是在对模型 openbmb/Eurus-RM-7b 进行评估运行期间自动创建的,用于 Open LLM Leaderboard。数据集包含 63 个配置,每个配置对应一个评估任务。数据集从 1 次运行中创建,每个运行的详细信息可以在每个配置中找到,使用运行的时间戳作为分割名称。"train" 分割始终指向最新的结果。

数据集结构

数据集包含以下配置:

  • harness_arc_challenge_25
  • harness_gsm8k_5
  • harness_hellaswag_10
  • harness_hendrycksTest_5

每个配置包含多个分割,例如:

  • 2024_04_09T06_50_00.788799
  • latest

每个分割包含多个数据文件路径,例如:

  • **/details_harness|arc:challenge|25_2024-04-09T06-50-00.788799.parquet

最新结果

以下是 2024-04-09T06:50:00.788799 运行的最新结果

python { "all": { "acc": 0.2539903952511765, "acc_stderr": 0.03098008602736365, "acc_norm": 0.25551266190257, "acc_norm_stderr": 0.03181160531793125, "mc1": 0.2350061199510404, "mc1_stderr": 0.014843061507731611, "mc2": NaN, "mc2_stderr": NaN }, "harness|arc:challenge|25": { "acc": 0.22098976109215018, "acc_stderr": 0.012124929206818258, "acc_norm": 0.27474402730375425, "acc_norm_stderr": 0.013044617212771227 }, "harness|hellaswag|10": { "acc": 0.27066321449910374, "acc_stderr": 0.004433943894764252, "acc_norm": 0.3196574387572197, "acc_norm_stderr": 0.004653907471785631 }, "harness|hendrycksTest-abstract_algebra|5": { "acc": 0.25, "acc_stderr": 0.04351941398892446, "acc_norm": 0.25, "acc_norm_stderr": 0.04351941398892446 }, # 其他任务的结果... }

数据加载示例

以下是加载数据集的示例代码:

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_openbmb__Eurus-RM-7b", "harness_winogrande_5", split="train")

搜集汇总
数据集介绍
open-llm-leaderboard/details_openbmb__Eurus-RM-7b 数据集图片
构建方式
在大型语言模型评估体系持续发展的当下,该数据集是专为Open LLM Leaderboard上对openbmb/Eurus-RM-7b模型进行自动化评测而生成的。其构建过程基于单一评测运行,涵盖63个配置项,每个配置对应一个被评估的任务。数据集以评测时间戳命名分割,其中'train'分割始终指向最新结果,而额外的'results'配置则存储了所有运行的聚合指标,用于在排行榜上计算和展示综合性能。
特点
该数据集呈现出显著的层次化与结构化特征。它细粒度地记录了模型在ARC Challenge、HellaSwag、MMLU(涵盖57个学科)、TruthfulQA、Winogrande及GSM8K等多样基准上的表现,每个任务均包含准确率及其标准误差等关键指标。数据以Parquet格式存储,支持通过Hugging Face Datasets库便捷加载,为深入分析模型在不同维度的能力提供了坚实的数据基础。
使用方法
研究人员可通过Hugging Face Datasets库直接调用该数据集。例如,使用`load_dataset("open-llm-leaderboard/details_openbmb__Eurus-RM-7b", "harness_winogrande_5", split="train")`即可加载特定任务的评测细节。数据集中的'latest'分割便于获取最新结果,而'results'配置则用于访问所有任务的聚合统计,从而支持对模型性能的全面复现与对比分析。
背景与挑战
背景概述
随着大语言模型(LLM)技术的迅猛发展,如何系统且公正地评估模型的多维能力成为学术界与工业界共同关注的焦点。在此背景下,Hugging Face社区于2023年发起了Open LLM Leaderboard项目,旨在通过标准化基准测试为开源模型提供透明、可复现的性能排行。该数据集由Hugging Face团队(主要联系人Clémentine Fourrier)于2024年4月创建,核心研究问题聚焦于评估OpenBMB团队开发的Eurus-RM-7b奖励模型在常识推理、数学求解、知识问答等63项任务上的表现。作为Open LLM Leaderboard的评估运行产物,该数据集不仅记录了模型在ARC、HellaSwag、GSM8K等经典基准上的详细得分,更通过结构化存储为后续模型对比与性能追踪提供了关键支撑,对推动开源大模型的公平评测生态具有重要影响力。
当前挑战
该数据集所应对的核心领域挑战在于大语言模型评估的标准化与可重复性困境。传统上,模型评测常因任务设置、数据集版本或评估脚本的差异而难以横向比较,Open LLM Leaderboard通过统一评估框架(如LM Evaluation Harness)解决了这一痛点,但Eurus-RM-7b在GSM8K数学推理任务上准确率为0.0%,暴露出奖励模型在复杂推理场景中的泛化瓶颈。构建过程中,挑战体现为多任务异构数据的整合与版本管理:63个配置对应不同任务,需确保每个评估结果的时间戳、分片路径与元数据一致,同时处理如truthfulqa任务中mc2指标因计算限制返回NaN等异常值,这对数据集的质量控制与可追溯性提出了严苛要求。
常用场景
经典使用场景
在大规模语言模型评估领域,open-llm-leaderboard/details_openbmb__Eurus-RM-7b数据集被广泛用于基准测试场景。该数据集通过整合ARC-Challenge、HellaSwag、MMLU、TruthfulQA、Winogrande和GSM8K等63项多样化任务,为Eurus-RM-7b模型提供了全面的性能评估框架。研究者利用其分任务配置和聚合结果,能够细致剖析模型在常识推理、知识理解、数学求解及对抗性生成等方面的能力,从而系统性地衡量模型在复杂语言理解与生成任务上的表现。
解决学术问题
该数据集解决了语言模型评估中缺乏标准化、可复现度量标准的核心学术难题。通过提供统一的任务配置和结果聚合机制,它消除了不同研究间因评估协议差异导致的比较障碍,使得研究者能够客观衡量模型在广泛学术基准上的泛化能力。其细粒度的分任务指标(如acc、acc_norm)和统计误差分析,为深入理解模型在不同知识领域的优势与局限提供了可靠依据,推动了评估方法论的科学化进程。
衍生相关工作
该数据集衍生了一系列重要的学术工作,包括对评估基准自身偏差的分析、多任务学习策略的优化以及模型鲁棒性增强方法的探索。基于其提供的细粒度结果,研究者开发了任务级性能预测模型,用于预估新模型在未测试任务上的表现。同时,该数据集也催生了关于评估指标标准化和跨模型比较方法论的研究,为Open LLM Leaderboard等社区评估平台奠定了数据基础,促进了开放科学框架下的协作与进步。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务