OALL/details_HeshamHaroon__llama-3-instruct-slerp-arabic
收藏数据链接:
官方服务:
资源简介:
数据集 Evaluation run of HeshamHaroon/llama-3-instruct-slerp-arabic 是在模型评估过程中自动生成的,包含136个配置,每个配置对应一个评估任务。数据集由1次运行生成,每次运行的结果作为一个特定的分割存储在配置中,分割名称使用运行的时间戳。train 分割始终指向最新的结果。此外,还有一个名为 results 的配置存储了所有运行的聚合结果。
数据集 Evaluation run of HeshamHaroon/llama-3-instruct-slerp-arabic 是在模型评估过程中自动生成的,包含136个配置,每个配置对应一个评估任务。数据集由1次运行生成,每次运行的结果作为一个特定的分割存储在配置中,分割名称使用运行的时间戳。train 分割始终指向最新的结果。此外,还有一个名为 results 的配置存储了所有运行的聚合结果。
提供机构:
OALL原始信息汇总
数据集概述
数据集来源
- 数据集自动创建于模型HeshamHaroon/llama-3-instruct-slerp-arabic的评估运行期间。
数据集结构
- 数据集包含136个配置,每个配置对应一个评估任务。
- 数据集从1次运行中创建,每次运行可以在每个配置中找到特定的分割,分割名称使用运行的时间戳。
- "train"分割始终指向最新的结果。
- 额外配置"results"存储所有运行的聚合结果。
数据加载示例
python from datasets import load_dataset data = load_dataset("OALL/details_HeshamHaroon__llama-3-instruct-slerp-arabic", "lighteval_xstory_cloze_ar_0", split="train")
最新结果
- 最新结果来自2024-06-11T16:13:58.470213的运行。
- 结果包括多个任务的准确率(acc_norm)和标准误差(acc_norm_stderr)。 python { "all": { "acc_norm": 0.41605439835036606, "acc_norm_stderr": 0.037750704302305184, "acc": 0.614824619457313, "acc_stderr": 0.012523231571141186 }, "community|acva:Algeria|0": { "acc_norm": 0.5230769230769231, "acc_norm_stderr": 0.0358596530894741 }, "community|acva:Ancient_Egypt|0": { "acc_norm": 0.05396825396825397, "acc_norm_stderr": 0.012751380783465837 }, "community|acva:Arab_Empire|0": { "acc_norm": 0.3132075471698113, "acc_norm_stderr": 0.02854479331905533 }, "community|acva:Arabic_Architecture|0": { "acc_norm": 0.4564102564102564, "acc_norm_stderr": 0.035761230969912135 }, "community|acva:Arabic_Art|0": { "acc_norm": 0.38974358974358975, "acc_norm_stderr": 0.03501424776256372 }, "community|acva:Arabic_Astronomy|0": { "acc_norm": 0.4666666666666667, "acc_norm_stderr": 0.03581804596782233 }, "community|acva:Arabic_Calligraphy|0": { "acc_norm": 0.5058823529411764, "acc_norm_stderr": 0.03137061905442377 }, "community|acva:Arabic_Ceremony|0": { "acc_norm": 0.518918918918919, "acc_norm_stderr": 0.036834092970087065 }, "community|acva:Arabic_Clothing|0": { "acc_norm": 0.5128205128205128, "acc_norm_stderr": 0.03588610523192215 }, "community|acva:Arabic_Culture|0": { "acc_norm": 0.2358974358974359, "acc_norm_stderr": 0.030481516761721537 }, "community|acva:Arabic_Food|0": { "acc_norm": 0.441025641025641, "acc_norm_stderr": 0.0356473293185358 }, "community|acva:Arabic_Funeral|0": { "acc_norm": 0.4, "acc_norm_stderr": 0.050529115263991134 }, "community|acva:Arabic_Geography|0": { "acc_norm": 0.6068965517241379, "acc_norm_stderr": 0.040703290137070705 }, "community|acva:Arabic_History|0": { "acc_norm": 0.30256410256410254, "acc_norm_stderr": 0.03298070870085619 }, "community|acva:Arabic_Language_Origin|0": { "acc_norm": 0.5473684210526316, "acc_norm_stderr": 0.051339113773544845 }, "community|acva:Arabic_Literature|0": { "acc_norm": 0.4689655172413793, "acc_norm_stderr": 0.04158632762097828 }, "community|acva:Arabic_Math|0": { "acc_norm": 0.30256410256410254, "acc_norm_stderr": 0.03298070870085618 }, "community|acva:Arabic_Medicine|0": { "acc_norm": 0.46206896551724136, "acc_norm_stderr": 0.041546596717075474 }, "community|acva:Arabic_Music|0": { "acc_norm": 0.23741007194244604, "acc_norm_stderr": 0.036220593237998276 }, "community|acva:Arabic_Ornament|0": { "acc_norm": 0.5282051282051282, "acc_norm_stderr": 0.03584074674920833 }, "community|acva:Arabic_Philosophy|0": { "acc_norm": 0.5793103448275863, "acc_norm_stderr": 0.0411391498118926 }, "community|acva:Arabic_Physics_and_Chemistry|0": { "acc_norm": 0.5333333333333333, "acc_norm_stderr": 0.03581804596782232 }, "community|acva:Arabic_Wedding|0": { "acc_norm": 0.4256410256410256, "acc_norm_stderr": 0.03549871080367708 }, "community|acva:Bahrain|0": { "acc_norm": 0.3111111111111111, "acc_norm_stderr": 0.06979205927323111 }, "community|acva:Comoros|0": { "acc_norm": 0.37777777777777777, "acc_norm_stderr": 0.07309112127323451 }, "community|acva:Egypt_modern|0": { "acc_norm": 0.3157894736842105, "acc_norm_stderr": 0.04794350420740798 }, "community|acva:InfluenceFromAncientEgypt|0": { "acc_norm": 0.6, "acc_norm_stderr": 0.035172622905632896 }, "community|acva:InfluenceFromByzantium|0": { "acc_norm": 0.7172413793103448, "acc_norm_stderr": 0.03752833958003337 }, "community|acva:InfluenceFromChina|0": { "acc_norm": 0.26666666666666666, "acc_norm_stderr": 0.0317493043641267 }, "community|acva:InfluenceFromGreece|0": { "acc_norm": 0.6307692307692307, "acc_norm_stderr": 0.034648411418637566 }, "community|acva:InfluenceFromIslam|0": { "acc_norm": 0.296551724137931, "acc_norm_stderr": 0.03806142687309993 }, "community|acva:InfluenceFromPersia|0": { "acc_norm": 0.6971428571428572, "acc_norm_stderr": 0.03483414676585986 }, "community|acva:InfluenceFromRome|0": { "acc_norm": 0.5743589743589743, "acc_norm_stderr": 0.03549871080367708 }, "community|acva:Iraq|0": { "acc_norm": 0.5058823529411764, "acc_norm_stderr": 0.05455069703232772 }, "community|acva:Islam_Education|0": { "acc_norm": 0.46153846153846156, "acc_norm_stderr": 0.03579154352544572 }, "community|acva:Islam_branches_and_schools|0": { "acc_norm": 0.4342857142857143, "acc_norm_stderr": 0.037576101528126626 }, "community|acva:Islamic_law_system|0": { "acc_norm": 0.4256410256410256, "acc_norm_stderr": 0.035498710803677086 }, "community|acva:Jordan|0": { "acc_norm": 0.3333333333333333, "acc_norm_stderr": 0.07106690545187012 }, "community|acva:Kuwait|0": { "acc_norm": 0.26666666666666666, "acc_norm_stderr": 0.06666666666666667 }, "community|acva:Lebanon|0": { "acc_norm": 0.17777777777777778, "acc_norm_stderr": 0.05763774795025094 }, "community|acva:Libya|0": { "acc_norm": 0.4444444444444444, "acc_norm_stderr": 0.07491109582924914 }, "community|acva:Mauritania|0": { "acc_norm": 0.4222222222222222, "acc_norm_stderr": 0.07446027270295805 }, "community|acva:Mesopotamia_civilization|0": { "acc_norm": 0.5225806451612903, "acc_norm_stderr": 0.0402500394824441 }, "community|acva:Morocco|0": { "acc_norm": 0.2222222222222222, "acc_norm_stderr": 0.06267511942419628 }, "community|acva:Oman|0": { "acc_norm": 0.17777777777777778, "acc_norm_stderr": 0.05763774795025094 }, "community|acva:Palestine|0": { "acc_norm": 0.24705882352941178, "acc_norm_stderr": 0.047058823529411785 }, "community|acva:Qatar|0": { "acc_norm": 0.4, "acc_norm_stderr": 0.07385489458759964 }, "community|acva:Saudi_Arabia|0": { "acc_norm": 0.3282051282051282, "acc_norm_stderr": 0.03371243782413707 }, "community|acva:Somalia|0": { "acc_norm": 0.37777777777777777, "acc_norm_stderr": 0.07309112127323451 }, "community|acva:Sudan|0": { "
搜集汇总
数据集介绍
构建方式
该数据集是在对阿拉伯语大语言模型HeshamHaroon/llama-3-instruct-slerp-arabic进行自动化评估的过程中生成的,涵盖了136个不同的配置,每个配置对应一项被评估的任务。数据集来源于单次运行,每次运行的结果被存储为特定分割,分割名称以运行时间戳命名,而'train'分割始终指向最新结果。此外,还设有一个名为'results'的配置,用于汇总所有运行的聚合评估结果。
特点
数据集结构精巧,以任务为导向,每个配置独立对应一项评估任务,便于研究者按需访问。其时间戳分割机制确保了历史结果的可追溯性,而'train'分割自动指向最新数据,简化了版本管理。'results'配置提供了宏观的聚合指标,如准确率及其标准误差,覆盖了从阿拉伯文化、历史、医学到数学、物理学等多领域的细粒度评估,展现了模型在多元主题上的表现差异。
使用方法
用户可通过HuggingFace的datasets库便捷加载数据,例如使用`load_dataset`函数指定配置名称(如'lighteval_xstory_cloze_ar_0')和分割(如'train')来获取特定任务的评估细节。对于需要批量分析的研究,可遍历所有配置或直接访问'results'配置获取整体性能统计。加载的数据可直接用于模型性能分析、任务难度比较或后续的模型优化研究。
背景与挑战
背景概述
该数据集诞生于2024年6月,由HeshamHaroon团队创建,旨在系统评估其开发的阿拉伯语大语言模型llama-3-instruct-slerp-arabic的性能。核心研究问题聚焦于模型在涵盖阿拉伯文化、历史、科学、方言及多项选择题等136个多样化任务上的表现,以验证其对阿拉伯语语境的理解与推理能力。作为首个针对该模型的全面评测数据集,它提供了细粒度的准确率与标准误差指标,为阿拉伯语自然语言处理领域树立了可复现的基准,对推动低资源语言模型评估标准化具有重要影响力。
当前挑战
当前面临的核心挑战在于模型在跨领域任务上的表现极不均衡:在阿拉伯文化类任务中,如‘拜占庭影响’任务准确率达71.7%,而‘阿拉伯文化’任务仅23.6%,暴露出模型对特定主题知识覆盖的严重偏差。构建过程中,由于需同时整合acva、alghafa、arabic_mmlu等多个社区数据集,且每个配置对应独立任务,导致数据格式、评估指标与标注体系难以统一,增加了跨任务结果对比的复杂性。此外,部分任务样本量较小(如也门任务仅15条),统计显著性不足,限制了评估结论的稳健性。
常用场景
经典使用场景
该数据集专为评估阿拉伯语大语言模型在多样化任务上的表现而设计,其经典使用场景集中于对模型进行系统性的多维度评测。数据集涵盖了136个配置,每个配置对应一项特定任务,包括阿拉伯语知识推理、文化常识、方言理解、情感分析、多选问答以及学术科目测试等。研究者可通过加载特定任务的配置,如“lighteval_xstory_cloze_ar_0”或“community|alghafa:meta_ar_dialects”,来精确衡量模型在某一细分领域的性能,从而全面剖析模型在阿拉伯语语境下的理解与生成能力。
衍生相关工作
该数据集衍生了一系列关于阿拉伯语模型能力剖析与改进的经典工作。基于其提供的细粒度评测结果,研究者们得以开展针对性的分析,例如探究模型在阿拉伯古代文明知识(如“Ancient_Egypt”与“Mesopotamia_civilization”)上的表现差异,从而催生了专门用于增强模型历史文化理解的微调策略。此外,该数据集还激励了跨语言迁移学习的研究,通过对比模型在阿拉伯语MMLU任务与英语MMLU上的得分,相关工作深入探讨了知识迁移的效率与瓶颈,进而推动了多语言模型在阿拉伯语领域的适配与优化方法论的发展。
数据集最近研究
最新研究方向
随着阿拉伯语大语言模型的蓬勃发展,针对该语种的系统性评估基准构建成为前沿热点。OALL/details_HeshamHaroon__llama-3-instruct-slerp-arabic数据集应运而生,它通过对Llama-3指令微调模型进行多维度自动化评测,汇聚了涵盖历史、文化、医学、数学等136项任务的精细化结果。该数据集不仅揭示了模型在阿拉伯方言、现代标准阿拉伯语及跨领域知识上的表现差异,更映射出当前低资源语言模型在文化特定知识(如阿拉伯书法、伊斯兰法学)与通用推理能力间的显著鸿沟。其影响力在于为阿拉伯语NLP研究提供了可复现的标准化评估框架,推动了多语言模型在区域文化语境下的可信度与实用性验证。
以上内容由遇见数据集搜集并总结生成



