遇见数据集

open-llm-leaderboard/details_h2oai__h2ogpt-research-oasst1-llama-65b

收藏
Hugging Face2023-08-27 更新2024-03-04 收录
官方服务:

资源简介:

该数据集是在模型[h2oai/h2ogpt-research-oasst1-llama-65b](https://huggingface.co/h2oai/h2ogpt-research-oasst1-llama-65b)在[Open LLM Leaderboard](https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard)上的评估运行期间自动创建的。数据集由61个配置组成,每个配置对应一个评估任务。数据集是从2次运行中创建的,每次运行都可以在每个配置中找到特定的拆分,拆分名称使用运行的时间戳。"train"拆分始终指向最新的结果。此外,还有一个名为"results"的配置,存储了所有运行的聚合结果,并用于计算和显示[Open LLM Leaderboard](https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard)上的聚合指标。

This dataset was automatically created during the evaluation run of the model [h2oai/h2ogpt-research-oasst1-llama-65b](https://huggingface.co/h2oai/h2ogpt-research-oasst1-llama-65b) on the [Open LLM Leaderboard](https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard). The dataset consists of 61 configurations, each corresponding to one evaluation task. The dataset is compiled from 2 separate runs, where each run contains specific splits for every configuration, with the split names using the timestamp of the corresponding run. The "train" split always points to the most recent results. In addition, there is a configuration named "results" that stores the aggregated results across all runs, and is used to calculate and display the aggregate metrics on the [Open LLM Leaderboard](https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard).

提供机构:
open-llm-leaderboard
原始信息汇总

数据集概述

数据集简介

该数据集是在模型 h2oai/h2ogpt-research-oasst1-llama-65bOpen LLM Leaderboard 上的评估运行期间自动创建的。

数据集组成

  • 数据集包含 61 个配置,每个配置对应一个评估任务。
  • 数据集从 2 次运行中创建,每次运行可以在每个配置中找到特定的分割,分割名称使用运行的时间戳。
  • "train" 分割始终指向最新的结果。
  • 一个额外的配置 "results" 存储所有运行的聚合结果,用于计算和显示 Open LLM Leaderboard 上的聚合指标。

数据加载示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_h2oai__h2ogpt-research-oasst1-llama-65b", "harness_truthfulqa_mc_0", split="train")

最新结果

以下是 2023-08-17T22:10:29.981773 运行 的最新结果:

python { "all": { "acc": 0.6359037673839993, "acc_stderr": 0.0329346816196445, "acc_norm": 0.6396809356138717, "acc_norm_stderr": 0.03290965482744071, "mc1": 0.34394124847001223, "mc1_stderr": 0.01662908751427678, "mc2": 0.48845185520886875, "mc2_stderr": 0.014057830912491135 }, "harness|arc:challenge|25": { "acc": 0.6177474402730375, "acc_stderr": 0.014200454049979275, "acc_norm": 0.6476109215017065, "acc_norm_stderr": 0.01396014260059868 }, "harness|hellaswag|10": { "acc": 0.6664011153156741, "acc_stderr": 0.004705347137699622, "acc_norm": 0.8593905596494722, "acc_norm_stderr": 0.0034690778470563765 }, "harness|hendrycksTest-abstract_algebra|5": { "acc": 0.32, "acc_stderr": 0.046882617226215034, "acc_norm": 0.32, "acc_norm_stderr": 0.046882617226215034 }, "harness|hendrycksTest-anatomy|5": { "acc": 0.562962962962963, "acc_stderr": 0.042849586397534015, "acc_norm": 0.562962962962963, "acc_norm_stderr": 0.042849586397534015 }, "harness|hendrycksTest-astronomy|5": { "acc": 0.75, "acc_stderr": 0.03523807393012047, "acc_norm": 0.75, "acc_norm_stderr": 0.03523807393012047 }, "harness|hendrycksTest-business_ethics|5": { "acc": 0.57, "acc_stderr": 0.049756985195624284, "acc_norm": 0.57, "acc_norm_stderr": 0.049756985195624284 }, "harness|hendrycksTest-clinical_knowledge|5": { "acc": 0.6339622641509434, "acc_stderr": 0.029647813539365245, "acc_norm": 0.6339622641509434, "acc_norm_stderr": 0.029647813539365245 }, "harness|hendrycksTest-college_biology|5": { "acc": 0.7083333333333334, "acc_stderr": 0.03800968060554858, "acc_norm": 0.7083333333333334, "acc_norm_stderr": 0.03800968060554858 }, "harness|hendrycksTest-college_chemistry|5": { "acc": 0.51, "acc_stderr": 0.05024183937956911, "acc_norm": 0.51, "acc_norm_stderr": 0.05024183937956911 }, "harness|hendrycksTest-college_computer_science|5": { "acc": 0.52, "acc_stderr": 0.050211673156867795, "acc_norm": 0.52, "acc_norm_stderr": 0.050211673156867795 }, "harness|hendrycksTest-college_mathematics|5": { "acc": 0.33, "acc_stderr": 0.04725815626252604, "acc_norm": 0.33, "acc_norm_stderr": 0.04725815626252604 }, "harness|hendrycksTest-college_medicine|5": { "acc": 0.5549132947976878, "acc_stderr": 0.03789401760283648, "acc_norm": 0.5549132947976878, "acc_norm_stderr": 0.03789401760283648 }, "harness|hendrycksTest-college_physics|5": { "acc": 0.3333333333333333, "acc_stderr": 0.04690650298201942, "acc_norm": 0.3333333333333333, "acc_norm_stderr": 0.04690650298201942 }, "harness|hendrycksTest-computer_security|5": { "acc": 0.75, "acc_stderr": 0.04351941398892446, "acc_norm": 0.75, "acc_norm_stderr": 0.04351941398892446 }, "harness|hendrycksTest-conceptual_physics|5": { "acc": 0.6, "acc_stderr": 0.03202563076101737, "acc_norm": 0.6, "acc_norm_stderr": 0.03202563076101737 }, "harness|hendrycksTest-econometrics|5": { "acc": 0.38596491228070173, "acc_stderr": 0.04579639422070434, "acc_norm": 0.38596491228070173, "acc_norm_stderr": 0.04579639422070434 }, "harness|hendrycksTest-electrical_engineering|5": { "acc": 0.5310344827586206, "acc_stderr": 0.04158632762097828, "acc_norm": 0.5310344827586206, "acc_norm_stderr": 0.04158632762097828 }, "harness|hendrycksTest-elementary_mathematics|5": { "acc": 0.3783068783068783, "acc_stderr": 0.024976954053155254, "acc_norm": 0.3783068783068783, "acc_norm_stderr": 0.024976954053155254 }, "harness|hendrycksTest-formal_logic|5": { "acc": 0.42063492063492064, "acc_stderr": 0.04415438226743744, "acc_norm": 0.42063492063492064, "acc_norm_stderr": 0.04415438226743744 }, "harness|hendrycksTest-global_facts|5": { "acc": 0.4, "acc_stderr": 0.04923659639173309, "acc_norm": 0.4, "acc_norm_stderr": 0.04923659639173309 }, "harness|hendrycksTest-high_school_biology|5": { "acc": 0.7483870967741936, "acc_stderr": 0.024685979286239963, "acc_norm": 0.7483870967741936, "acc_norm_stderr": 0.024685979286239963 }, "harness|hendrycksTest-high_school_chemistry|5": { "acc": 0.4039408866995074, "acc_stderr": 0.0345245390382204, "acc_norm": 0.4039408866995074, "acc_norm_stderr": 0.0345245390382204 }, "harness|hendrycksTest-high_school_computer_science|5": { "acc": 0.67, "acc_stderr": 0.047258156262526066, "acc_norm": 0.67, "acc_norm_stderr": 0.047258156262526066 }, "harness|hendrycksTest-high_school_european_history|5": { "acc": 0.8, "acc_stderr": 0.031234752377721164, "acc_norm": 0.8, "acc_norm_stderr": 0.031234752377721164 }, "harness|hendrycksTest-high_school_geography|5": { "acc": 0.803030303030303, "acc_stderr": 0.028335609732463355, "acc_norm": 0.803030303030303, "acc_norm_stderr": 0.028335609732463355 }, "harness|hendrycksTest-high_school_government_and_politics|5": { "acc": 0.8756476683937824, "acc_stderr": 0.023814477086593542, "acc_norm": 0.8756476683937824, "acc_norm_stderr": 0.023814477086593542 }, "harness|hendrycksTest-high_school_macroeconomics|5": { "acc": 0.6256410256410256, "acc_stderr": 0.024537591572830513, "acc_norm": 0.6256410256410256, "acc_norm_stderr": 0.024537591572830513 }, "harness|hendrycksTest-high_school_mathematics|5": { "acc": 0.31851851851851853, "acc_stderr": 0.02840653309060846, "acc_norm": 0.31851851851851853, "acc_norm_stderr": 0.02840653309060846 }, "harness|hendrycksTest-high_school_micro

搜集汇总
数据集介绍
open-llm-leaderboard/details_h2oai__h2ogpt-research-oasst1-llama-65b 数据集图片
构建方式
该数据集是Open LLM Leaderboard对模型h2oai/h2ogpt-research-oasst1-llama-65b进行自动化评估过程中生成的副产品。数据集由61个配置组成,每个配置对应一项被评估的任务,例如ARC挑战赛、HellaSwag以及涵盖多学科知识的Hendrycks测试等。数据来源于两次独立的评估运行,每次运行的结果被存储为特定分割,分割名称采用运行时间戳命名,其中'train'分割始终指向最新一次运行的结果。此外,一个名为'results'的额外配置汇总了所有运行的聚合指标,用于在排行榜上计算和展示模型的综合性能。
特点
该数据集的核心特点在于其结构化的评估记录体系。它通过61个独立配置精细划分了不同评估任务,使得用户能够针对性地分析模型在某一特定领域的表现。每个任务配置下包含多个时间戳分割,这为追踪模型性能随时间或迭代版本的变化提供了可能。'results'配置则提供了一个全局视角,汇集了如准确率(acc)及其标准误(acc_stderr)等关键指标,便于快速把握模型的整体水平。数据以Parquet格式存储,兼顾了高效读写与良好的兼容性。
使用方法
用户可通过Hugging Face的datasets库便捷地加载数据。例如,使用`load_dataset`函数并指定数据集名称、任务配置名称(如'harness_truthfulqa_mc_0')以及所需的分割(如'train')即可获取特定评估任务的详细结果。对于需要分析模型在某一领域表现的场景,用户可选择对应的Hendrycks测试配置。若需查看全局汇总指标,则可加载'results'配置。加载后的数据可直接用于后续的统计分析、可视化展示或模型性能对比研究。
背景与挑战
背景概述
随着大型语言模型(LLMs)规模的持续膨胀,如何系统、公正地评估其多维能力成为自然语言处理领域的核心议题。在此背景下,Hugging Face团队于2023年发起了Open LLM Leaderboard项目,旨在通过标准化基准测试框架,对开源大模型进行透明化评测。该数据集记录了h2o.ai团队基于LLaMA-65B架构微调的h2ogpt-research-oasst1-llama-65b模型在Leaderboard上的完整评估过程,由Clémentine Fourrier(clementine@hf.co)主导构建,数据采集于2023年8月17日。研究团队利用61个涵盖常识推理、学科知识、伦理判断等维度的评测任务,系统揭示了该65B参数模型在复杂知识推理与事实一致性方面的能力边界,为后续模型优化提供了关键参照。
当前挑战
该数据集所应对的领域挑战在于,现有大模型评估体系常因任务单一、指标片面而难以反映模型真实能力。本数据集通过集成ARC-Challenge、HellaSwag、MMLU等多样化基准,试图解决模型在开放域推理与细粒度知识掌握上的泛化评估难题。在构建过程中,挑战尤为突出:首先,需要确保61个异构任务的数据格式统一与评分标准对齐,避免因任务间的度量差异导致比较结果失真;其次,面对模型输出的高随机性,必须通过多次运行(如本数据集包含两次独立评估)来捕获性能波动,并设计合理的聚合策略以消除单次评估的偶然误差;最后,如何高效存储、索引并动态更新海量评估结果(如parquet格式数据的分片管理),对数据工程架构提出了严苛要求。
常用场景
经典使用场景
在大规模语言模型迅猛发展的浪潮中,对模型性能进行系统化、标准化的评估成为推动技术进步的关键环节。该数据集专为Open LLM Leaderboard上的评估任务而生,记录了h2oai/h2ogpt-research-oasst1-llama-65b模型在61个多样化配置下的详细评测结果。其经典使用场景在于为研究者提供一套可复现的基准测试框架,涵盖ARC-Challenge、HellaSwag、TruthfulQA以及涵盖57个学科领域的MMLU(HendrycksTest)等核心任务。通过加载该数据集中的特定配置与分割,学者们能够精准剖析模型在常识推理、知识理解与事实准确性维度的表现,从而进行横向对比与纵向追踪。
实际应用
在实际应用层面,该数据集为工业界与学术界提供了一个高效的模型选型与质量监控工具。模型开发者可以利用其中的细粒度评测结果,快速识别特定领域(如医学、法律、物理学)的性能短板,从而指导后续的微调策略或数据增强方向。例如,若模型在“大学数学”或“形式逻辑”子任务上表现欠佳,开发者可针对性地补充相关训练数据。此外,该数据集支持按时间戳划分的多次运行结果,使得团队能够持续追踪模型迭代过程中的性能演变,确保部署前的模型经过严格、多维度的能力验证,降低应用风险。
衍生相关工作
该数据集衍生了一系列围绕模型评估与能力剖析的经典工作。其中,Open LLM Leaderboard本身已成为社区内最具影响力的模型排名平台之一,直接催生了大量关于模型性能预测、评估效率优化以及任务难度分析的后续研究。基于该数据集提供的标准化评估结果,研究者们进一步开发了诸如模型能力图谱可视化工具、任务间相关性分析以及针对特定失败案例的鲁棒性增强方法。此外,该数据集也启发了对评估基准本身偏差的探讨,推动了更公平、更全面的下一代评测体系的设计,例如引入多语言、多模态或对抗性样本的评估任务。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务