遇见数据集

open-llm-leaderboard-old/details_decruz07__kellemar-DPO-7B-c

收藏
Hugging Face2024-01-11 更新2024-06-22 收录
官方服务:

资源简介:

该数据集是在评估模型decruz07/kellemar-DPO-7B-c时自动创建的,包含63个配置,每个配置对应一个评估任务。数据集由1次运行生成,每次运行的结果作为特定的分割存储在配置中,分割名称使用运行的时间戳。train分割始终指向最新结果。此外,results配置存储了所有运行的聚合结果,用于计算和显示在Open LLM Leaderboard上的聚合指标。

该数据集是在评估模型decruz07/kellemar-DPO-7B-c时自动创建的,包含63个配置,每个配置对应一个评估任务。数据集由1次运行生成,每次运行的结果作为特定的分割存储在配置中,分割名称使用运行的时间戳。train分割始终指向最新结果。此外,results配置存储了所有运行的聚合结果,用于计算和显示在Open LLM Leaderboard上的聚合指标。

原始信息汇总

数据集概述

该数据集是在评估模型 decruz07/kellemar-DPO-7B-cOpen LLM Leaderboard 上的运行过程中自动创建的。数据集包含 63 个配置,每个配置对应一个评估任务。

数据集结构

数据集由 1 次运行创建,每个运行可以在每个配置中找到特定的分割,分割名称使用运行的时间戳。"train" 分割始终指向最新的结果。

额外配置

一个额外的配置 "results" 存储了所有运行的聚合结果,用于计算和显示在 Open LLM Leaderboard 上的聚合指标。

加载数据示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_decruz07__kellemar-DPO-7B-c", "harness_winogrande_5", split="train")

最新结果

以下是 2024-01-11T11:35:01.176663 运行的最新结果

python { "all": { "acc": 0.6384818948169925, "acc_stderr": 0.032244773650019175, "acc_norm": 0.6408980660124164, "acc_norm_stderr": 0.03288578301996733, "mc1": 0.3733170134638923, "mc1_stderr": 0.016932370557570634, "mc2": 0.5407842160887599, "mc2_stderr": 0.015285349287061248 }, "harness|arc:challenge|25": { "acc": 0.6168941979522184, "acc_stderr": 0.014206472661672876, "acc_norm": 0.6569965870307167, "acc_norm_stderr": 0.013872423223718164 }, "harness|hellaswag|10": { "acc": 0.6591316470822546, "acc_stderr": 0.00473032455662413, "acc_norm": 0.8498307110137423, "acc_norm_stderr": 0.0035650718701954478 }, "harness|hendrycksTest-abstract_algebra|5": { "acc": 0.32, "acc_stderr": 0.046882617226215034, "acc_norm": 0.32, "acc_norm_stderr": 0.046882617226215034 }, "harness|hendrycksTest-anatomy|5": { "acc": 0.6074074074074074, "acc_stderr": 0.0421850621536888, "acc_norm": 0.6074074074074074, "acc_norm_stderr": 0.0421850621536888 }, "harness|hendrycksTest-astronomy|5": { "acc": 0.6973684210526315, "acc_stderr": 0.037385206761196686, "acc_norm": 0.6973684210526315, "acc_norm_stderr": 0.037385206761196686 }, "harness|hendrycksTest-business_ethics|5": { "acc": 0.58, "acc_stderr": 0.049604496374885836, "acc_norm": 0.58, "acc_norm_stderr": 0.049604496374885836 }, "harness|hendrycksTest-clinical_knowledge|5": { "acc": 0.6943396226415094, "acc_stderr": 0.028353298073322666, "acc_norm": 0.6943396226415094, "acc_norm_stderr": 0.028353298073322666 }, "harness|hendrycksTest-college_biology|5": { "acc": 0.7638888888888888, "acc_stderr": 0.03551446610810826, "acc_norm": 0.7638888888888888, "acc_norm_stderr": 0.03551446610810826 }, "harness|hendrycksTest-college_chemistry|5": { "acc": 0.48, "acc_stderr": 0.050211673156867795, "acc_norm": 0.48, "acc_norm_stderr": 0.050211673156867795 }, "harness|hendrycksTest-college_computer_science|5": { "acc": 0.45, "acc_stderr": 0.05, "acc_norm": 0.45, "acc_norm_stderr": 0.05 }, "harness|hendrycksTest-college_mathematics|5": { "acc": 0.27, "acc_stderr": 0.044619604333847394, "acc_norm": 0.27, "acc_norm_stderr": 0.044619604333847394 }, "harness|hendrycksTest-college_medicine|5": { "acc": 0.6184971098265896, "acc_stderr": 0.03703851193099521, "acc_norm": 0.6184971098265896, "acc_norm_stderr": 0.03703851193099521 }, "harness|hendrycksTest-college_physics|5": { "acc": 0.3627450980392157, "acc_stderr": 0.04784060704105653, "acc_norm": 0.3627450980392157, "acc_norm_stderr": 0.04784060704105653 }, "harness|hendrycksTest-computer_security|5": { "acc": 0.77, "acc_stderr": 0.042295258468165065, "acc_norm": 0.77, "acc_norm_stderr": 0.042295258468165065 }, "harness|hendrycksTest-conceptual_physics|5": { "acc": 0.5702127659574469, "acc_stderr": 0.03236214467715564, "acc_norm": 0.5702127659574469, "acc_norm_stderr": 0.03236214467715564 }, "harness|hendrycksTest-econometrics|5": { "acc": 0.4824561403508772, "acc_stderr": 0.04700708033551038, "acc_norm": 0.4824561403508772, "acc_norm_stderr": 0.04700708033551038 }, "harness|hendrycksTest-electrical_engineering|5": { "acc": 0.5310344827586206, "acc_stderr": 0.04158632762097828, "acc_norm": 0.5310344827586206, "acc_norm_stderr": 0.04158632762097828 }, "harness|hendrycksTest-elementary_mathematics|5": { "acc": 0.42328042328042326, "acc_stderr": 0.02544636563440678, "acc_norm": 0.42328042328042326, "acc_norm_stderr": 0.02544636563440678 }, "harness|hendrycksTest-formal_logic|5": { "acc": 0.46825396825396826, "acc_stderr": 0.04463112720677172, "acc_norm": 0.46825396825396826, "acc_norm_stderr": 0.04463112720677172 }, "harness|hendrycksTest-global_facts|5": { "acc": 0.39, "acc_stderr": 0.04902071300001975, "acc_norm": 0.39, "acc_norm_stderr": 0.04902071300001975 }, "harness|hendrycksTest-high_school_biology|5": { "acc": 0.7870967741935484, "acc_stderr": 0.023287665127268552, "acc_norm": 0.7870967741935484, "acc_norm_stderr": 0.023287665127268552 }, "harness|hendrycksTest-high_school_chemistry|5": { "acc": 0.5172413793103449, "acc_stderr": 0.035158955511656986, "acc_norm": 0.5172413793103449, "acc_norm_stderr": 0.035158955511656986 }, "harness|hendrycksTest-high_school_computer_science|5": { "acc": 0.68, "acc_stderr": 0.04688261722621505, "acc_norm": 0.68, "acc_norm_stderr": 0.04688261722621505 }, "harness|hendrycksTest-high_school_european_history|5": { "acc": 0.7878787878787878, "acc_stderr": 0.03192271569548302, "acc_norm": 0.7878787878787878, "acc_norm_stderr": 0.03192271569548302 }, "harness|hendrycksTest-high_school_geography|5": { "acc": 0.797979797979798, "acc_stderr": 0.028606204289229862, "acc_norm": 0.797979797979798, "acc_norm_stderr": 0.028606204289229862 }, "harness|hendrycksTest-high_school_government_and_politics|5": { "acc": 0.8911917098445595, "acc_stderr": 0.02247325333276877, "acc_norm": 0.8911917098445595, "acc_norm_stderr": 0.02247325333276877 }, "harness|hendrycksTest-high_school_macroeconomics|5": { "acc": 0.617948717948718, "acc_stderr": 0.024635549163908237, "acc_norm": 0.617948717948718, "acc_norm_stderr": 0.024635549163908237 }, "harness|hendrycksTest-high_school_mathematics|5": { "acc": 0.3111111111111111, "acc_stderr": 0.02822644674968352, "acc_norm": 0.3111111111111111, "acc_norm_stderr": 0.02822644674968352

搜集汇总
数据集介绍
open-llm-leaderboard-old/details_decruz07__kellemar-DPO-7B-c 数据集图片
构建方式
在大型语言模型的系统性评估中,Open LLM Leaderboard 为模型性能的量化分析提供了标准化平台。该数据集源自对 decruz07/kellemar-DPO-7B-c 模型的一次自动化评估运行,通过 Hugging Face 的评估框架自动生成。数据集由63个配置组成,每个配置对应一个独立的评估任务,涵盖 ARC-Challenge、HellaSwag、GSM8K、Winogrande、TruthfulQA 以及涵盖57个学科的 MMLU 基准测试。每次评估运行的结果以时间戳命名作为独立分割存储,而 "train" 分割始终指向最新运行的结果,同时存在一个名为 "results" 的附加配置用于聚合所有运行的指标。
特点
该数据集的核心特点在于其结构化的多任务评估体系,能够全面反映模型在常识推理、数学求解、语言理解及多领域知识掌握等方面的能力。每个任务的详细结果以 Parquet 格式存储,包含准确率、标准化准确率及其标准误差等精细指标,为研究者提供了粒度化的性能分析依据。数据集支持多运行追踪,通过时间戳分割保留历史评估记录,便于进行模型能力的纵向对比与趋势分析。此外,聚合配置 "results" 汇总了所有任务的总体指标,可直接用于 Leaderboard 排名的计算与展示。
使用方法
研究者可通过 Hugging Face 的 datasets 库便捷地加载该数据集。例如,使用 `load_dataset("open-llm-leaderboard/details_decruz07__kellemar-DPO-7B-c", "harness_winogrande_5", split="train")` 即可获取 Winogrande 任务的最新评估详情。每个配置下的数据分割对应特定评估运行的时间戳,用户可根据需要选择历史或最新结果。对于需要批量分析所有任务的情况,可遍历所有配置名称加载相应数据。聚合结果则可通过 "results" 配置获取,便于整体性能的统计与可视化。
背景与挑战
背景概述
随着大语言模型(LLM)的快速发展,如何系统性地评估模型在多样化任务上的泛化能力成为核心议题。Open LLM Leaderboard由Hugging Face团队于2023年发起,旨在为开源社区提供标准化、透明的模型评测基准。该数据集为decruz07等人于2024年1月提交的kellemar-DPO-7B-c模型在Leaderboard上的评估记录,涵盖ARC-Challenge、HellaSwag、GSM8K、TruthfulQA及WinoGrande等63项任务配置。其核心研究问题在于通过DPO(直接偏好优化)微调的7B参数模型在多领域推理、常识理解与数学求解中的表现,并借助细粒度指标(如acc_norm、mc2)揭示模型能力边界。该数据集记录了评估全过程的原始结果,为后续研究DPO对齐策略的有效性提供了可复现的实证基础,推动了开源LLM公平比较的规范化进程。
当前挑战
该数据集面临的挑战主要体现在两个层面。在领域任务层面,模型在MMLU子集上表现失衡,例如在高中计算机科学(acc=0.68)与大学数学(acc=0.27)之间出现显著落差,揭示了当前LLM在跨学科深度推理中的脆弱性,尤其数学与形式逻辑任务仍是瓶颈。在构建过程中,数据集需处理来自63个异构任务配置的评测结果,各任务采用不同的采样策略(如few-shot数量差异)与指标计算方式(如acc与mc2),导致数据聚合时需严格对齐格式与统计标准;同时,每次评估运行生成独立时间戳分割,需维护多版本结果的可追溯性,这对数据存储与版本管理提出了较高要求。
常用场景
经典使用场景
在大型语言模型的评估生态中,Open LLM Leaderboard 的评测运行数据集扮演着基石角色。该数据集专门用于记录和存储对模型 decruz07/kellemar-DPO-7B-c 的标准化评估结果,涵盖了从常识推理、数学求解到多学科知识问答等数十项经典任务。研究者可通过加载如 'harness_winogrande_5' 等配置,直接获取模型在特定基准上的细粒度表现,从而实现对模型能力的横向对比与纵向追踪。这种结构化的评测数据为后续的模型优化与迭代提供了可复现的量化依据。
解决学术问题
该数据集的核心价值在于解决了大语言模型评测中普遍存在的标准化与可复现性难题。通过统一的任务配置、评分脚本和结果记录格式,它有效消除了因评测环境差异或指标计算方式不同而导致的结论偏差。学术研究者可以基于这些公开的评测结果,系统性地分析模型在推理、知识记忆与指令遵循等维度的优劣,进而探索模型架构、训练策略与评测表现之间的深层关联。这一机制极大地促进了开放科学精神,使得模型能力的可信对比成为可能。
衍生相关工作
该数据集衍生出了一系列围绕大模型评估标准与工具链的经典工作。其中,Open LLM Leaderboard 本身已成为社区公认的模型能力竞技场,催生了诸如 'lm-evaluation-harness' 等标准化评测框架的广泛采用。此外,基于该数据集记录的详细运行日志,研究者开发了多种可视化分析工具,用于揭示模型在不同类型任务上的能力分布与偏差。这些衍生工作共同推动了从单一指标对比到多维度能力剖析的评估范式演进,为构建更可靠、更全面的模型评测体系奠定了坚实基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务