遇见数据集

open-llm-leaderboard-old/details_xxyyy123__mc_data_30k_from_platpus_orca_7b_10k_v1_lora_qk_rank14_v2

收藏
Hugging Face2023-09-03 更新2024-06-22 收录
官方服务:

资源简介:

该数据集是在Open LLM Leaderboard上对模型xxyyy123/mc_data_30k_from_platpus_orca_7b_10k_v1_lora_qk_rank14_v2进行评估时自动创建的。数据集包含61个配置,每个配置对应一个评估任务。数据集由1次运行生成,每次运行的结果作为特定配置中的一个分割,分割名称使用运行的时间戳。train分割始终指向最新的结果。此外,还有一个名为results的配置,存储了所有运行的聚合结果,用于在Open LLM Leaderboard上计算和显示聚合指标。

该数据集是在Open LLM Leaderboard上对模型xxyyy123/mc_data_30k_from_platpus_orca_7b_10k_v1_lora_qk_rank14_v2进行评估时自动创建的。数据集包含61个配置,每个配置对应一个评估任务。数据集由1次运行生成,每次运行的结果作为特定配置中的一个分割,分割名称使用运行的时间戳。train分割始终指向最新的结果。此外,还有一个名为results的配置,存储了所有运行的聚合结果,用于在Open LLM Leaderboard上计算和显示聚合指标。

原始信息汇总

数据集概述

数据集名称

  • 名称: Evaluation run of xxyyy123/mc_data_30k_from_platpus_orca_7b_10k_v1_lora_qk_rank14_v2

数据集描述

数据集组成

  • 组成: 数据集包含 61 个配置,每个配置对应一个评估任务。
  • 创建方式: 数据集从 1 次运行中创建。每个运行可以在每个配置中作为一个特定的分片找到,分片名称使用运行的时间戳。"train" 分片始终指向最新的结果。
  • 额外配置: 一个额外的配置 "results" 存储所有运行的聚合结果,用于计算和显示 Open LLM Leaderboard 上的聚合指标。

数据加载示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_xxyyy123__mc_data_30k_from_platpus_orca_7b_10k_v1_lora_qk_rank14_v2", "harness_truthfulqa_mc_0", split="train")

最新结果

配置详情

  • 配置名称: harness_arc_challenge_25

    • 数据文件:
      • 分片: 2023_09_03T18_41_04.280567
        • 路径: **/details_harness|arc:challenge|25_2023-09-03T18:41:04.280567.parquet
      • 分片: latest
        • 路径: **/details_harness|arc:challenge|25_2023-09-03T18:41:04.280567.parquet
  • 配置名称: harness_hellaswag_10

    • 数据文件:
      • 分片: 2023_09_03T18_41_04.280567
        • 路径: **/details_harness|hellaswag|10_2023-09-03T18:41:04.280567.parquet
      • 分片: latest
        • 路径: **/details_harness|hellaswag|10_2023-09-03T18:41:04.280567.parquet
  • 配置名称: harness_hendrycksTest_5

    • 数据文件:
      • 分片: 2023_09_03T18_41_04.280567
        • 路径:
          • **/details_harness|hendrycksTest-abstract_algebra|5_2023-09-03T18:41:04.280567.parquet
          • **/details_harness|hendrycksTest-anatomy|5_2023-09-03T18:41:04.280567.parquet
          • **/details_harness|hendrycksTest-astronomy|5_2023-09-03T18:41:04.280567.parquet
          • **/details_harness|hendrycksTest-business_ethics|5_2023-09-03T18:41:04.280567.parquet
          • **/details_harness|hendrycksTest-clinical_knowledge|5_2023-09-03T18:41:04.280567.parquet
          • **/details_harness|hendrycksTest-college_biology|5_2023-09-03T18:41:04.280567.parquet
          • **/details_harness|hendrycksTest-college_chemistry|5_2023-09-03T18:41:04.280567.parquet
          • **/details_harness|hendrycksTest-college_computer_science|5_2023-09-03T18:41:04.280567.parquet
          • **/details_harness|hendrycksTest-college_mathematics|5_2023-09-03T18:41:04.280567.parquet
          • **/details_harness|hendrycksTest-college_medicine|5_2023-09-03T18:41:04.280567.parquet
          • **/details_harness|hendrycksTest-college_physics|5_2023-09-03T18:41:04.280567.parquet
          • **/details_harness|hendrycksTest-computer_security|5_2023-09-03T18:41:04.280567.parquet
          • **/details_harness|hendrycksTest-conceptual_physics|5_2023-09-03T18:41:04.280567.parquet
          • **/details_harness|hendrycksTest-econometrics|5_2023-09-03T18:41:04.280567.parquet
          • **/details_harness|hendrycksTest-electrical_engineering|5_2023-09-03T18:41:04.280567.parquet
          • **/details_harness|hendrycksTest-elementary_mathematics|5_2023-09-03T18:41:04.280567.parquet
          • **/details_harness|hendrycksTest-formal_logic|5_2023-09-03T18:41:04.280567.parquet
          • **/details_harness|hendrycksTest-global_facts|5_2023-09-03T18:41:04.280567.parquet
          • **/details_harness|hendrycksTest-high_school_biology|5_2023-09-03T18:41:04.280567.parquet
          • **/details_harness|hendrycksTest-high_school_chemistry|5_2023-09-03T18:41:04.280567.parquet
          • **/details_harness|hendrycksTest-high_school_computer_science|5_2023-09-03T18:41:04.280567.parquet
          • **/details_harness|hendrycksTest-high_school_european_history|5_2023-09-03T18:41:04.280567.parquet
          • **/details_harness|hendrycksTest-high_school_geography|5_2023-09-03T18:41:04.280567.parquet
搜集汇总
数据集介绍
open-llm-leaderboard-old/details_xxyyy123__mc_data_30k_from_platpus_orca_7b_10k_v1_lora_qk_rank14_v2 数据集图片
构建方式
在大型语言模型评估领域,该数据集作为Open LLM Leaderboard评测流程的副产品自动生成,专门记录模型xxyyy123/mc_data_30k_from_platpus_orca_7b_10k_v1_lora_qk_rank14_v2在61个评测任务上的详细表现。数据集通过单次运行构建,每次运行的结果被存储为独立的split,并以时间戳命名,而'train' split则始终指向最新一次运行的评测结果。此外,一个名为'results'的额外配置汇集了所有聚合指标,用于在排行榜上计算和展示综合性能。
特点
该数据集具备高度的结构化和可追溯性,其显著特点在于包含61个配置,每个配置对应一个具体的评测任务,覆盖从常识推理(如ARC、HellaSwag)到多学科知识(如HendrycksTest系列涵盖抽象代数、解剖学、天文学等57个学科)以及真实性评估(TruthfulQA)等广泛领域。每个任务的结果均以精确的准确率(acc)、标准化准确率(acc_norm)及其标准误差(acc_stderr、acc_norm_stderr)等指标呈现,为模型性能的细粒度分析提供了丰富的数据支撑。
使用方法
研究人员可通过Hugging Face的datasets库便捷地加载该数据集。具体而言,使用load_dataset函数指定数据集名称及目标配置(如'harness_truthfulqa_mc_0'),并选择split参数为'train'即可获取最新评测结果。若需回溯历史运行数据,则可通过对应时间戳的split名称访问。此外,'results'配置提供了整体聚合指标,便于快速评估模型在全部任务上的综合表现,为模型对比与迭代优化提供了标准化接口。
背景与挑战
背景概述
在大型语言模型(LLM)蓬勃发展的浪潮中,如何系统性地评估其多维能力成为学界与工业界共同关注的焦点。Open LLM Leaderboard作为HuggingFace社区发起的一项标杆性评测平台,旨在通过标准化任务集衡量开源模型的推理、知识与安全性表现。该数据集诞生于2023年9月,由HuggingFace团队(联系人clementine@hf.co)主导创建,核心研究问题在于为特定模型xxyyy123/mc_data_30k_from_platpus_orca_7b_10k_v1_lora_qk_rank14_v2提供细粒度的评测记录。数据集包含61个任务配置,覆盖ARC挑战赛、HellaSwag常识推理、TruthfulQA真实性测试及涵盖57个学科的HendrycksTest知识基准,其自动生成的运行日志与聚合结果不仅服务于该模型的性能追踪,更通过公开评测范式推动了LLM评估的可重复性与透明度,成为社区理解模型优劣的重要参考。
当前挑战
该数据集所应对的领域挑战在于LLM评测的碎片化与标准缺失——不同模型在推理、知识、真实性等维度表现参差,亟需统一基准以揭示其真实能力边界。具体而言,TruthfulQA任务中模型mc1得分仅0.357,反映生成内容易含虚构信息的痼疾;而HendrycksTest内数学、物理等学科准确率不足30%,暴露出模型在符号推理与领域深度知识上的局限。构建过程中,挑战则集中于多任务异构数据的整合:需将61个来自不同来源的评测配置(如ARC的25题、HellaSwag的10样本)统一为可追溯的parquet格式,并确保每次运行的时间戳分割与最新结果同步,同时维护跨任务聚合指标(如acc_norm)的计算一致性,技术实现上对数据流水线的鲁棒性与版本控制提出了严苛要求。
常用场景
经典使用场景
该数据集作为Open LLM Leaderboard评估流程的产物,其经典使用场景在于为研究者提供微调模型在61个多样化任务上的细粒度性能指标。涵盖ARC-Challenge、HellaSwag等常识推理基准,以及涵盖57个学科的MMLU测试集,并包含TruthfulQA的诚实性评估,使得该数据集成为比较不同微调策略(如LoRA秩值选择)对模型多维度能力影响的标准化工具。通过加载特定配置(如'harness_truthfulqa_mc_0')并解析各任务准确率与标准误,研究人员能够系统性地剖析模型在知识推理、事实一致性等方面的优劣表现。
实际应用
在实际应用中,该数据集为模型选型与部署决策提供了数据驱动的支撑。企业或研究机构可通过分析该数据集记录的HellaSwag任务上acc_norm高达0.8008的表现,判断模型在常识推理场景下的可靠性。结合MMLU各学科成绩(如marketing领域0.7778的准确率),开发者能够为特定垂直领域(如教育、法律咨询)选择最适配的模型。此外,TruthfulQA的mc1与mc2指标直接反映了模型生成内容的真实性,这对构建可信赖的对话系统至关重要。
衍生相关工作
该数据集衍生了一系列关于评估方法论与模型优化策略的经典工作。基于其多任务评估框架,研究者开发了自动化分析工具以识别模型在不同知识领域的短板(如formal_logic任务仅0.2778的准确率)。其结构化存储方式启发了后续的模型性能追踪系统,使得对比不同微调配置(如rank14与更高秩值)的效果成为可能。此外,该数据集推动了关于评估基准覆盖度与模型能力层级映射关系的理论探讨,为构建更全面的评估体系奠定了基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务