遇见数据集

OALL/details_jondurbin__airoboros-70b-3.3

收藏
Hugging Face2024-06-18 更新2024-06-29 收录
官方服务:

资源简介:

数据集 Evaluation run of jondurbin/airoboros-70b-3.3 是在模型 jondurbin/airoboros-70b-3.3 的评估运行中自动生成的。它包含136个配置,每个配置对应一个评估任务。数据集由1次运行生成,每次运行的结果作为特定的分割存储在配置中,分割名称使用运行的时间戳。train 分割始终指向最新的结果。此外,还有一个名为 results 的配置存储了所有运行的聚合结果。README还提供了加载数据集的具体代码示例,并展示了最新运行的结果。

数据集 Evaluation run of jondurbin/airoboros-70b-3.3 是在模型 jondurbin/airoboros-70b-3.3 的评估运行中自动生成的。它包含136个配置,每个配置对应一个评估任务。数据集由1次运行生成,每次运行的结果作为特定的分割存储在配置中,分割名称使用运行的时间戳。train 分割始终指向最新的结果。此外,还有一个名为 results 的配置存储了所有运行的聚合结果。README还提供了加载数据集的具体代码示例,并展示了最新运行的结果。

提供机构:
OALL
原始信息汇总

数据集概述

数据集基本信息

  • 名称: Evaluation run of jondurbin/airoboros-70b-3.3
  • 来源: 自动创建于模型 jondurbin/airoboros-70b-3.3 的评估运行过程中。
  • 组成: 包含 136 个配置,每个配置对应一个评估任务。
  • 创建方式: 数据集由 1 次运行创建,每次运行结果存储在特定的分割中,分割名称使用运行的时间戳。
  • 最新结果: "train" 分割始终指向最新的结果。
  • 额外配置: 包含一个名为 "results" 的配置,存储所有运行的聚合结果。

数据加载示例

python from datasets import load_dataset data = load_dataset("OALL/details_jondurbin__airoboros-70b-3.3", "lighteval_xstory_cloze_ar_0", split="train")

最新结果

  • 时间戳: 2024-06-18T23:19:01.367803
  • 结果: 包含多个任务的准确率和标准误差。

任务结果示例

  • 任务: community|acva:Algeria|0
    • acc_norm: 0.5487179487179488
    • acc_norm_stderr: 0.03572709860318392
  • 任务: community|acva:Ancient_Egypt|0
    • acc_norm: 0.07936507936507936
    • acc_norm_stderr: 0.015254347145096072
  • 任务: community|acva:Arab_Empire|0
    • acc_norm: 0.3132075471698113
    • acc_norm_stderr: 0.02854479331905533
  • 任务: community|acva:Arabic_Architecture|0
    • acc_norm: 0.5076923076923077
    • acc_norm_stderr: 0.03589365940635213
  • 任务: community|acva:Arabic_Art|0
    • acc_norm: 0.358974358974359
    • acc_norm_stderr: 0.034440428815213774
  • 任务: community|acva:Arabic_Astronomy|0
    • acc_norm: 0.4666666666666667
    • acc_norm_stderr: 0.03581804596782233
  • 任务: community|acva:Arabic_Calligraphy|0
    • acc_norm: 0.6980392156862745
    • acc_norm_stderr: 0.028807019393543996
  • 任务: community|acva:Arabic_Ceremony|0
    • acc_norm: 0.5459459459459459
    • acc_norm_stderr: 0.036704531918025717
  • 任务: community|acva:Arabic_Clothing|0
    • acc_norm: 0.5487179487179488
    • acc_norm_stderr: 0.03572709860318391
  • 任务: community|acva:Arabic_Culture|0
    • acc_norm: 0.29743589743589743
    • acc_norm_stderr: 0.03282001717838809
  • 任务: community|acva:Arabic_Food|0
    • acc_norm: 0.49743589743589745
    • acc_norm_stderr: 0.03589743589743589
  • 任务: community|acva:Arabic_Funeral|0
    • acc_norm: 0.43157894736842106
    • acc_norm_stderr: 0.05108592673308946
  • 任务: community|acva:Arabic_Geography|0
    • acc_norm: 0.6206896551724138
    • acc_norm_stderr: 0.04043461861916747
  • 任务: community|acva:Arabic_History|0
    • acc_norm: 0.31794871794871793
    • acc_norm_stderr: 0.03343383454355787
  • 任务: community|acva:Arabic_Language_Origin|0
    • acc_norm: 0.5789473684210527
    • acc_norm_stderr: 0.050924152299673286
  • 任务: community|acva:Arabic_Literature|0
    • acc_norm: 0.47586206896551725
    • acc_norm_stderr: 0.041618085035015295
  • 任务: community|acva:Arabic_Math|0
    • acc_norm: 0.30256410256410254
    • acc_norm_stderr: 0.03298070870085618
  • 任务: community|acva:Arabic_Medicine|0
    • acc_norm: 0.5241379310344828
    • acc_norm_stderr: 0.0416180850350153
  • 任务: community|acva:Arabic_Music|0
    • acc_norm: 0.23741007194244604
    • acc_norm_stderr: 0.036220593237998276
  • 任务: community|acva:Arabic_Ornament|0
    • acc_norm: 0.5230769230769231
    • acc_norm_stderr: 0.0358596530894741
  • 任务: community|acva:Arabic_Philosophy|0
    • acc_norm: 0.5793103448275863
    • acc_norm_stderr: 0.0411391498118926
  • 任务: community|acva:Arabic_Physics_and_Chemistry|0
    • acc_norm: 0.6871794871794872
    • acc_norm_stderr: 0.033287550657248546
  • 任务: community|acva:Arabic_Wedding|0
    • acc_norm: 0.49230769230769234
    • acc_norm_stderr: 0.03589365940635213
  • 任务: community|acva:Bahrain|0
    • acc_norm: 0.3111111111111111
    • acc_norm_stderr: 0.06979205927323111
  • 任务: community|acva:Comoros|0
    • acc_norm: 0.4
    • acc_norm_stderr: 0.07385489458759965
  • 任务: community|acva:Egypt_modern|0
    • acc_norm: 0.3894736842105263
    • acc_norm_stderr: 0.05029529117145395
  • 任务: community|acva:InfluenceFromAncientEgypt|0
    • acc_norm: 0.6051282051282051
    • acc_norm_stderr: 0.03509545602262038
  • 任务: community|acva:InfluenceFromByzantium|0
    • acc_norm: 0.7172413793103448
    • acc_norm_stderr: 0.03752833958003337
  • 任务: community|acva:InfluenceFromChina|0
    • acc_norm: 0.2717948717948718
    • acc_norm_stderr: 0.031940861870257235
  • 任务: community|acva:InfluenceFromGreece|0
    • acc_norm: 0.6307692307692307
    • acc_norm_stderr: 0.034648411418637566
  • 任务: community|acva:InfluenceFromIslam|0
    • acc_norm: 0.4482758620689655
    • acc_norm_stderr: 0.04144311810878151
  • 任务: community|acva:InfluenceFromPersia|0
    • acc_norm: 0.6971428571428572
    • acc_norm_stderr: 0.03483414676585986
  • 任务: community|acva:InfluenceFromRome|0
    • acc_norm: 0.5641025641025641
    • acc_norm_stderr: 0.035601666623466345
  • 任务: community|acva:Iraq|0
    • acc_norm: 0.5529411764705883
    • acc_norm_stderr: 0.054247803536170265
  • 任务: community|acva:Islam_Education|0
    • acc_norm: 0.558974358974359
    • acc_norm_stderr: 0.0356473293185358
  • 任务: community|acva:Islam_branches_and_schools|0
    • acc_norm: 0.46285714285714286
    • acc_norm_stderr: 0.03780017090541436
  • 任务: community|acva:Islamic_law_system|0
    • acc_norm: 0.6
    • acc_norm_stderr: 0.03517262290563289
  • 任务: community|acva:Jordan|0
    • acc_norm: 0.35555555555555557
    • acc_norm_stderr: 0.07216392363431012
  • 任务: community|acva:Kuwait|0
    • acc_norm: 0.4
    • acc_norm_stderr: 0.07385489458759965
  • 任务: community|acva:Lebanon|0
    • acc_norm: 0.28888888888888886
    • acc_norm_stderr: 0.06832943242540508
  • 任务: community|acva:Libya|0
    • acc_norm: 0.4666666666666667
    • acc_norm_stderr: 0.0752101433090355
  • 任务: community|acva:Mauritania|0
    • acc_norm: 0.4222222222222222
    • acc_norm_stderr: 0.07446027270295805
  • 任务: community|acva:Mesopotamia_civilization|0
    • acc_norm: 0.5290322580645161
    • acc_norm_stderr: 0.040223170294214426
  • 任务: community|acva:Morocco|0
    • acc_norm: 0.2222222222222222
    • acc_norm_stderr: 0.06267511942419628
  • 任务: community|acva:Oman|0
    • acc_norm: 0.2
    • acc_norm_stderr: 0.06030226891555273
  • 任务: community|acva:Palestine|0
    • acc_norm: 0.25882352941176473
    • acc_norm_stderr: 0.047788461203740945
  • 任务: community|acva:Qatar|0
    • acc_norm: 0.4666666666666667
    • acc_norm_stderr: 0.0752101433090355
  • 任务: community|acva:Saudi_Arabia|0
    • acc_norm: 0.3487179487179487
    • acc_norm_stderr: 0.03421533846670541
  • 任务: community|acva:Somalia|0
    • acc_norm: 0.35555555555555557
    • acc_norm_stderr: 0.07216392363431012
  • 任务: community|acva:Sudan|0
    • acc_norm: 0.37777777777777777
    • acc_norm_stderr: 0.07309112127323451
  • 任务: community|acva:Syria|0
    • acc_norm: 0.35555555555555557
    • acc_norm_stderr: 0.07216392363431012
  • 任务: community|acva:Tunisia|0
    • acc_norm: 0.3111111111111111
    • acc_norm_stderr: 0.06979205927323111
  • 任务: community|acva
搜集汇总
数据集介绍
OALL/details_jondurbin__airoboros-70b-3.3 数据集图片
构建方式
在大规模语言模型评估领域,对模型性能进行系统化、精细化的量化分析是推动技术进步的关键环节。该数据集正是在对jondurbin/airoboros-70b-3.3模型进行自动化评估的过程中被构建而成。其构建方式基于一次完整的评估运行,将模型在136个不同的任务配置上的表现结果进行结构化存储。每个任务配置对应一项特定的评估任务,而每一次运行的结果都被记录为该配置下的一个独立数据分割,分割的命名直接采用运行的时间戳,从而确保了评估过程的可追溯性与版本清晰度。最新的一次运行结果则被统一指向名为“train”的数据分割,便于用户直接获取当前最新的性能数据。此外,数据集还特别设置了一个名为“results”的附加配置,用于集中存储该次运行的所有聚合评估结果。
特点
该数据集的核心特点在于其高度结构化的组织方式与详尽的评估粒度。它并非单一维度的性能记录,而是将模型在136个迥异的任务上的表现分解为独立的配置,每个配置都包含了该任务下的详细评估指标,如准确率及其标准误差。这种设计使得研究者能够深入洞察模型在不同领域、不同难度层级上的能力差异,例如从阿拉伯文化知识到具体学科(如医学、物理学)的掌握程度。数据分割以时间戳命名,不仅支持历史结果的回溯,还通过“train”分割指向最新数据,兼顾了历史存档与实时更新的需求。同时,“results”配置的存在为快速获取全局性能概览提供了便利,使得该数据集成为评估模型综合能力与专项能力的宝贵资源。
使用方法
研究者可借助Hugging Face的datasets库便捷地调用该数据集。通过load_dataset函数并指定数据集名称“OALL/details_jondurbin__airoboros-70b-3.3”,用户能够灵活地加载任一任务配置下的评估结果。例如,加载名为“lighteval_xstory_cloze_ar_0”的任务配置时,只需在函数中传入该配置名称,并通过split参数选择“train”以获取最新运行数据。若需访问历史运行结果,则可根据特定时间戳对应的分割名称进行加载。此外,通过加载“results”配置,用户可以直接获取涵盖所有任务的聚合性能指标,从而快速评估模型的整体表现。这种灵活的加载机制为深入分析模型在各任务上的表现提供了极大的便利。
背景与挑战
背景概述
该数据集诞生于2024年6月,由Open Assistant LLM Leaderboard(OALL)团队在评估开源大语言模型jondurbin/airoboros-70b-3.3的过程中自动创建。核心研究问题聚焦于衡量该模型在136项涵盖多语言、多领域任务上的综合表现,尤其侧重阿拉伯语文化背景下的知识推理与理解能力。通过系统性地记录模型在诸如阿拉伯语方言识别、历史地理、伊斯兰法律等细分任务上的准确率与标准误差,该数据集为评估大型语言模型在低资源语言与特定文化语境中的泛化能力提供了关键基准。其影响力在于推动了多语言评估体系的标准化,并为后续模型在阿拉伯世界知识问答、跨文化理解等领域的研究奠定了数据基础。
当前挑战
当前数据集面临的首要挑战在于领域问题的复杂性:阿拉伯语因其丰富的方言变体、复杂的形态学结构以及深厚的文化负载,使得模型在诸如阿拉伯古代文明、伊斯兰律法体系等特定主题上难以达到高准确率,部分任务如“古代埃及”的准确率仅约7.9%,凸显了文化知识缺失的严峻性。构建过程中亦遭遇显著困难,包括需从不同社区(如acva、alghafa)整合异构评估任务,并确保各配置间的评分标准一致;同时,自动化生成的评估日志需处理时间戳与分片管理,以避免数据冗余与结果冲突,这对数据管道的鲁棒性提出了极高要求。
常用场景
经典使用场景
该数据集专为评估大规模语言模型在阿拉伯语及相关文化背景下的多任务性能而设计,其经典使用场景涵盖广泛的自然语言理解与推理任务。通过包含136个配置项,每个对应一个独立的评估任务,研究者可系统性地测试模型在阿拉伯语故事完形填空、方言识别、标准阿拉伯语理解、多选题推理以及情感分析等维度上的表现。数据集的构建遵循标准化流程,每次评估运行均可作为独立分割存储,便于纵向对比模型迭代效果。这种精细化的任务划分与透明的结果记录机制,使其成为衡量阿拉伯语大模型综合能力的标杆性基准。
实际应用
在实际应用中,该数据集为阿拉伯语智能系统的开发与部署提供了坚实的质量保障。技术团队可利用其详尽的任务配置与评估结果,对面向阿拉伯用户的对话机器人、智能教育辅导系统及跨语言信息检索工具进行针对性调优。例如,通过分析模型在阿拉伯方言与标准阿拉伯语上的表现差异,可优化语音助手在区域化场景中的交互流畅度;借助文化常识任务的评测结果,能够提升内容推荐系统对阿拉伯文化语境的理解准确率,从而减少文化误读,增强用户体验的本土化适配。
衍生相关工作
基于该数据集,学术界已衍生出多项具有影响力的研究工作。其精细化的评估架构启发了后续针对特定语言族群的评测基准构建,例如面向北非方言或海湾阿拉伯语变体的专业化测试集。此外,数据集内嵌的社区贡献任务(如ACVA与alghafa系列)被广泛引用于探究大语言模型在低资源语言上的知识迁移能力,催生了诸如跨语言提示优化与多任务联合训练等新颖方法论。这些衍生工作不仅验证了该数据集在促进多语言AI评估标准化中的枢纽作用,也为构建更具文化包容性的下一代语言模型奠定了实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务