遇见数据集

open-llm-leaderboard/details_yihan6324__llama2-13b-instructmining-40k-sharegpt

收藏
Hugging Face2023-08-27 更新2024-03-04 收录
官方服务:

资源简介:

该数据集是在Open LLM Leaderboard上对模型yihan6324/llama2-13b-instructmining-40k-sharegpt进行评估时自动生成的。数据集由61个配置组成,每个配置对应一个评估任务。它包含一次运行的数据,每次运行在每个配置中表示为特定的分割,分割名称由运行的时间戳命名。train分割始终指向最新的结果。此外,还有一个results配置,存储了所有运行的聚合结果,用于计算和显示Open LLM Leaderboard上的聚合指标。README还提供了如何使用Hugging Face datasets库加载数据集的示例。

This dataset was automatically generated during the evaluation of the model yihan6324/llama2-13b-instructmining-40k-sharegpt on the Open LLM Leaderboard. It consists of 61 configurations, each corresponding to one evaluation task. It contains data from runs, where each run is represented as a dedicated split under each configuration, with the split name designated by the timestamp of the run. The 'train' split always points to the most recent results. Additionally, there is a 'results' configuration that stores aggregated results across all runs, which is used to calculate and display the aggregated metrics on the Open LLM Leaderboard. The README also provides examples of how to load the dataset using the Hugging Face Datasets library.

提供机构:
open-llm-leaderboard
原始信息汇总

数据集概述

数据集来源

该数据集是在对模型yihan6324/llama2-13b-instructmining-40k-sharegpt进行评估运行期间自动创建的。

数据集组成

数据集由61个配置组成,每个配置对应一个评估任务。数据集从1次运行中创建,每次运行的详细结果可以在每个配置的特定分割中找到,分割名称使用运行的时间戳。"train"分割始终指向最新的结果。

额外配置

一个额外的配置"results"存储了所有运行的聚合结果,用于计算并在Open LLM Leaderboard上显示聚合指标。

数据加载示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_yihan6324__llama2-13b-instructmining-40k-sharegpt", "harness_truthfulqa_mc_0", split="train")

最新结果

以下是2023-08-17T15:06:33.773565运行的最新结果:

python { "all": { "acc": 0.5659221179678169, "acc_stderr": 0.03435610194042996, "acc_norm": 0.5698526105353496, "acc_norm_stderr": 0.03433517528186645, "mc1": 0.35862913096695226, "mc1_stderr": 0.016789289499502022, "mc2": 0.5244082340441981, "mc2_stderr": 0.015623466277080963 }, "harness|arc:challenge|25": { "acc": 0.5656996587030717, "acc_stderr": 0.01448470304885736, "acc_norm": 0.5998293515358362, "acc_norm_stderr": 0.014317197787809169 }, "harness|hellaswag|10": { "acc": 0.6328420633339972, "acc_stderr": 0.004810449343572395, "acc_norm": 0.8306114319856602, "acc_norm_stderr": 0.003743281749373634 }, "harness|hendrycksTest-abstract_algebra|5": { "acc": 0.35, "acc_stderr": 0.0479372485441102, "acc_norm": 0.35, "acc_norm_stderr": 0.0479372485441102 }, "harness|hendrycksTest-anatomy|5": { "acc": 0.48148148148148145, "acc_stderr": 0.043163785995113245, "acc_norm": 0.48148148148148145, "acc_norm_stderr": 0.043163785995113245 }, "harness|hendrycksTest-astronomy|5": { "acc": 0.625, "acc_stderr": 0.039397364351956274, "acc_norm": 0.625, "acc_norm_stderr": 0.039397364351956274 }, "harness|hendrycksTest-business_ethics|5": { "acc": 0.59, "acc_stderr": 0.049431107042371025, "acc_norm": 0.59, "acc_norm_stderr": 0.049431107042371025 }, "harness|hendrycksTest-clinical_knowledge|5": { "acc": 0.6150943396226415, "acc_stderr": 0.02994649856769995, "acc_norm": 0.6150943396226415, "acc_norm_stderr": 0.02994649856769995 }, "harness|hendrycksTest-college_biology|5": { "acc": 0.6111111111111112, "acc_stderr": 0.04076663253918567, "acc_norm": 0.6111111111111112, "acc_norm_stderr": 0.04076663253918567 }, "harness|hendrycksTest-college_chemistry|5": { "acc": 0.41, "acc_stderr": 0.04943110704237102, "acc_norm": 0.41, "acc_norm_stderr": 0.04943110704237102 }, "harness|hendrycksTest-college_computer_science|5": { "acc": 0.47, "acc_stderr": 0.05016135580465919, "acc_norm": 0.47, "acc_norm_stderr": 0.05016135580465919 }, "harness|hendrycksTest-college_mathematics|5": { "acc": 0.37, "acc_stderr": 0.048523658709391, "acc_norm": 0.37, "acc_norm_stderr": 0.048523658709391 }, "harness|hendrycksTest-college_medicine|5": { "acc": 0.5895953757225434, "acc_stderr": 0.03750757044895537, "acc_norm": 0.5895953757225434, "acc_norm_stderr": 0.03750757044895537 }, "harness|hendrycksTest-college_physics|5": { "acc": 0.3431372549019608, "acc_stderr": 0.04724007352383887, "acc_norm": 0.3431372549019608, "acc_norm_stderr": 0.04724007352383887 }, "harness|hendrycksTest-computer_security|5": { "acc": 0.71, "acc_stderr": 0.045604802157206845, "acc_norm": 0.71, "acc_norm_stderr": 0.045604802157206845 }, "harness|hendrycksTest-conceptual_physics|5": { "acc": 0.4595744680851064, "acc_stderr": 0.03257901482099835, "acc_norm": 0.4595744680851064, "acc_norm_stderr": 0.03257901482099835 }, "harness|hendrycksTest-econometrics|5": { "acc": 0.23684210526315788, "acc_stderr": 0.039994238792813344, "acc_norm": 0.23684210526315788, "acc_norm_stderr": 0.039994238792813344 }, "harness|hendrycksTest-electrical_engineering|5": { "acc": 0.503448275862069, "acc_stderr": 0.04166567577101579, "acc_norm": 0.503448275862069, "acc_norm_stderr": 0.04166567577101579 }, "harness|hendrycksTest-elementary_mathematics|5": { "acc": 0.29365079365079366, "acc_stderr": 0.023456037383982026, "acc_norm": 0.29365079365079366, "acc_norm_stderr": 0.023456037383982026 }, "harness|hendrycksTest-formal_logic|5": { "acc": 0.36507936507936506, "acc_stderr": 0.04306241259127153, "acc_norm": 0.36507936507936506, "acc_norm_stderr": 0.04306241259127153 }, "harness|hendrycksTest-global_facts|5": { "acc": 0.35, "acc_stderr": 0.047937248544110196, "acc_norm": 0.35, "acc_norm_stderr": 0.047937248544110196 }, "harness|hendrycksTest-high_school_biology|5": { "acc": 0.6709677419354839, "acc_stderr": 0.026729499068349958, "acc_norm": 0.6709677419354839, "acc_norm_stderr": 0.026729499068349958 }, "harness|hendrycksTest-high_school_chemistry|5": { "acc": 0.45320197044334976, "acc_stderr": 0.03502544650845872, "acc_norm": 0.45320197044334976, "acc_norm_stderr": 0.03502544650845872 }, "harness|hendrycksTest-high_school_computer_science|5": { "acc": 0.56, "acc_stderr": 0.049888765156985884, "acc_norm": 0.56, "acc_norm_stderr": 0.049888765156985884 }, "harness|hendrycksTest-high_school_european_history|5": { "acc": 0.6787878787878788, "acc_stderr": 0.0364620496325381, "acc_norm": 0.6787878787878788, "acc_norm_stderr": 0.0364620496325381 }, "harness|hendrycksTest-high_school_geography|5": { "acc": 0.7171717171717171, "acc_stderr": 0.03208779558786753, "acc_norm": 0.7171717171717171, "acc_norm_stderr": 0.03208779558786753 }, "harness|hendrycksTest-high_school_government_and_politics|5": { "acc": 0.8134715025906736, "acc_stderr": 0.02811209121011748, "acc_norm": 0.8134715025906736, "acc_norm_stderr": 0.02811209121011748 }, "harness|hendrycksTest-high_school_macroeconomics|5": { "acc": 0.5333333333333333, "acc_stderr": 0.025294608023986472, "acc_norm": 0.5333333333333333, "acc_norm_stderr": 0.025294608023986472 }, "harness|hendrycksTest-high_school_mathematics|5": { "acc": 0.26666666666666666, "acc_stderr": 0.026962424325073838, "acc_norm": 0.26666666666666666, "acc_norm_stderr": 0.026962424

搜集汇总
数据集介绍
构建方式
在大规模语言模型评估领域,Open LLM Leaderboard 作为一个权威的基准平台,其评估过程会自动化生成配套的数据集。本数据集正是源于对 yihan6324/llama2-13b-instructmining-40k-sharegpt 模型的一次完整评估流程。该数据集由 61 个配置组成,每个配置精确对应一项被评估的任务,例如 ARC-Challenge、HellaSwag 以及涵盖 57 个学科的 MMLU 测试。整个数据集基于单一的评估运行(Run)构建,运行的时间戳被用作每个配置下的数据分割(Split)名称,而“train”分割则始终指向最新一次的评估结果。此外,一个名为“results”的独立配置被设立,用于存储该次运行的所有聚合指标,这些指标正是排行榜上最终得分的计算基础。
特点
该数据集最显著的特点在于其结构化的组织方式与版本追溯能力。通过将每次评估运行的结果独立存储为带时间戳的分割,它完整保留了模型在特定时间点下的性能快照,为研究模型的迭代改进提供了可回溯的实证依据。数据内容不仅包含各任务的标准准确率(acc)与归一化准确率(acc_norm),还涵盖了如 TruthfulQA 任务中的 mc1 和 mc2 等多选指标,全面反映了模型在事实性与安全性方面的表现。这种精细化的指标记录方式,使得研究人员能够深入剖析模型在常识推理、学术知识掌握及诚实性等多个维度的能力边界。
使用方法
用户可通过 Hugging Face 的 datasets 库便捷地加载本数据集。具体而言,调用 load_dataset 函数时需指定数据集名称及目标任务的配置名称,例如“harness_truthfulqa_mc_0”,并通过 split 参数选择“train”以获取最新评估结果。若需回溯历史性能,只需将 split 参数替换为对应运行的时间戳字符串即可。加载后的数据将以 Parquet 格式呈现,便于高效处理。此外,数据集中的“results”配置提供了所有任务的聚合结果,用户可直接访问该配置下的数据,从而快速获取模型在整体评估中的综合评分,无需逐一处理各任务子集。
背景与挑战
背景概述
该数据集源自HuggingFace Open LLM Leaderboard平台,专为评估yihan6324/llama2-13b-instructmining-40k-sharegpt模型而自动生成。创建于2023年8月,由HuggingFace团队主导,旨在系统化衡量大语言模型在多维度任务上的表现。核心研究问题聚焦于如何通过标准化评测框架,客观反映模型在常识推理、学科知识及事实一致性等方面的能力。该数据集涵盖61个配置,对应ARC、HellaSwag、TruthfulQA及MMLU等广泛认可的基准,其评测结果直接影响了社区对指令微调模型效能的认知,并为后续模型优化提供了可复现的量化依据。
当前挑战
该数据集面临的核心挑战在于:1)领域问题层面,需解决大语言模型评测标准不统一与任务多样性不足的困境,例如TruthfulQA中模型在事实准确性(mc1仅35.86%)与知识深度(如高等数学准确率26.67%)间存在显著失衡,暴露出模型在逻辑推理与专业领域认知上的系统性短板。2)构建过程中,自动生成机制导致数据依赖单一运行时间戳,缺乏跨时间与跨配置的动态校准,且61个配置的细粒度结果存储于Parquet文件中,增加了多任务联合分析的复杂度与可复现性门槛。
常用场景
经典使用场景
在大型语言模型(LLM)迅猛发展的浪潮中,如何系统性地评估模型的多维能力已成为学界与工业界的核心议题。Open LLM Leaderboard上的评估数据集,如针对yihan6324/llama2-13b-instructmining-40k-sharegpt模型的评测记录,为研究者提供了标准化的性能度量工具。该数据集汇总了模型在61项任务上的表现,涵盖常识推理(如ARC-Challenge、HellaSwag)、知识问答(如MMLU的57个学科子集)以及事实一致性(如TruthfulQA)等经典场景,使得研究者能够通过统一的指标体系横向比较不同模型的优劣,从而揭示模型在推理、知识储备与真实性方面的能力边界。
实际应用
在实际产业应用中,该数据集的评估结果直接指导着模型选型与优化策略的制定。例如,企业在部署客服机器人或教育辅导系统时,可依据模型在MMLU医学、法学等专业领域的得分,筛选出知识覆盖面更广的基座模型;开发团队亦可通过分析模型在TruthfulQA上的mc1/mc2指标,评估其生成内容的可靠性,从而规避事实性错误带来的业务风险。此外,该数据集记录的每项任务耗时与资源消耗,为云服务商提供了模型推理效率的参考基线,助力实现成本与性能的平衡。
衍生相关工作
该数据集作为Open LLM Leaderboard的组成部分,催生了一系列具有影响力的衍生工作。一方面,研究者基于其开放的评估结果,开发了可视化分析工具(如雷达图对比模型能力),并提出了针对特定短板任务的微调策略(如针对抽象代数或形式逻辑的定向数据增强)。另一方面,该数据集启发了更全面的评测体系构建,例如融合多轮对话评估的MT-Bench、侧重长文本理解的L-Eval等基准,均借鉴了其标准化任务划分与指标聚合的设计思想。此外,部分团队利用该数据集的细粒度结果,训练了元模型以预测未知任务的性能,推动了LLM能力预测这一前沿方向的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务