遇见数据集

HebArabNlpProject/AlephBench

收藏
Hugging Face2026-06-10 更新2026-06-14 收录
官方服务:

资源简介:

AlephBench是一个可复现的希伯来语大语言模型(LLM)基准测试,涵盖了11个任务,包括语言推理、分类、问答、数学、翻译和以色列上下文琐事。数据集包含多项选择推理、文本分类、自然语言推理、抽取式问答、数学问题、翻译和以色列琐事等任务,总计11,432个提示。它提供了固定的提示、每行模型输出和排行榜,以确保结果的可复现性。数据集由HebArabNlpProject维护,使用CC-BY-4.0许可证,并基于公共希伯来语NLP来源构建。

AlephBench is a reproducible Hebrew LLM benchmark: 11 tasks, frozen prompts, per-row model outputs, and the leaderboard — all in one repo. It covers multiple-choice reasoning, classification, NLI, extractive QA, math, translation, and Israeli-context trivia, with a total of 11,432 prompts. The dataset ensures reproducibility and is maintained by HebArabNlpProject under the CC-BY-4.0 license, derived from public Hebrew NLP sources.

提供机构:
HebArabNlpProject
搜集汇总
数据集介绍
HebArabNlpProject/AlephBench 数据集图片
构建方式
AlephBench 是一个专门为评估希伯来语大语言模型(LLM)性能而设计的可复现基准测试集。该数据集整合了来自公开希伯来语自然语言处理资源的11项任务,涵盖了从常识推理、自然语言理解到数学运算与机器翻译的多元评估维度。每一项任务的数据均以 JSONL 格式组织于独立的配置子集中,并附有冻结的提示词模板和详尽的结果记录。构建者不仅保留了原始数据的许可信息,还将统一评分代码与模型输出文件一并发布,确保整个评估流程的透明性与可复现性。
使用方法
用户可以通过 HuggingFace Datasets 库便捷地加载 AlephBench 的任一任务,例如使用 `load_dataset("HebArabNlpProject/AlephBench", "arc_heb", split="test")` 获取 ARC 测试集。对于希望提交新模型的团队,需克隆官方评测仓库,在 `models/` 目录下添加适配器,然后运行基准脚本生成结果文件,最后通过 Pull Request 提交包含模型输出与排行榜更新的文件。结果文件内含每个测试样本的原始提示、模型响应、得分及评分方法,便于深入分析。所有提示词模板均存储在 YAML 文件中并受版本控制,任何改动都会通过版本号进行标记,以保持历史结果的可追溯性。
背景与挑战
背景概述
AlephBench是由HebArabNlpProject于2026年创建的希伯来语大语言模型基准测试数据集。该研究团队聚焦于低资源语言的自然语言处理评估,核心问题在于构建一套涵盖多任务、可复现的希伯来语模型评测体系。数据集包含11项任务,涉及逻辑推理、文本分类、问答、数学计算、翻译及以色列文化常识等维度,总计11,432个测试样本。AlephBench的出现填补了希伯来语LLM标准化评估的空白,其固定提示模板、逐行模型输出与公开排行榜的设计,为希伯来语NLP领域提供了权威的模型性能比较基准,推动了低资源语言大模型研究的规范化发展。
当前挑战
AlephBench所解决的领域挑战在于希伯来语大语言模型的客观评测长期缺乏统一基准,现有跨语言基准多集中于英文,难以捕捉希伯来语的形态句法特征和文化特异性。构建过程中面临的挑战包括:1)需从多个独立来源整合并标准化希伯来语任务数据,确保各子集测试项的许可兼容性与语义等效性;2)设计适用于希伯来语的评分策略,如数学问题中从模型输出提取最终答案、问答任务中采用宽松F1阈值并引入大语言模型仲裁机制;3)维护冻结提示模板版本控制,确保不同时期模型评估结果的可比性;4)处理翻译任务仅评估希伯来语输出方向的单侧评分局限性。
常用场景
经典使用场景
AlephBench作为首个专门针对希伯来语的大语言模型标准化评测基准,其经典使用场景在于系统性地评估模型在多维度语言理解与生成任务上的表现。该数据集精心设计了涵盖常识推理、因果判断、文本蕴含、情感分类、抽取式问答、数学推理、机器翻译及本土文化知识问答在内的11项子任务,采用统一冻结的提示模板和严格的解码参数,为研究者提供了一个可完全复现的评测平台。通过加载诸如"arc_heb"或"copa_heb"等特定子集,用户能够精准衡量模型在科学常识与因果逻辑等细分维度的能力,进而实现跨模型的公平比较与性能追踪。
解决学术问题
在AlephBench问世之前,希伯来语自然语言处理领域长期缺乏一个覆盖广泛、标准统一的评测体系,导致不同研究工作中模型性能的对比缺乏可靠基准。该数据集解决了这一关键学术困境,将原本散落于不同来源的评估任务整合于同一框架之下,并提供了从提示设计到解码参数到评分逻辑的全流程标准化规范。其意义在于,通过建立可复现的评测机制,使得研究者能够客观诊断模型在科学知识、逻辑推理、文化理解等方面的真实水平与局限,从而为后续模型架构改进、训练策略优化以及跨语言迁移学习研究提供了坚实可靠的实证基础。
实际应用
在实际产业应用层面,AlephBench所涵盖的多样化任务直接映射了希伯来语AI产品的核心功能需求。情感分类与自然语言推理评测可用于优化社交媒体舆情监控系统或客户服务情绪分析工具;面向以色列本土语境的常识推理与文化知识问答有助于提升虚拟助手在希伯来语社区中的用户交互体验;而机器翻译评测则为跨语言信息检索和本地化内容生成服务提供了质量把控的依据。此外,该数据集支撑的模型排名机制能够帮助企业和开发者高效筛选适用于希伯来语场景的商业化语言模型,降低部署成本与试错风险。
数据集最近研究
最新研究方向
AlephBench作为首个覆盖多任务、可复现的希伯来语大模型评估基准,引领了低资源语言中LLM系统性评测的前沿探索。该数据集整合了11项涵盖科学知识、常识推理、数学计算、情感分类及以色列本地常识题的任务,并冻结提示模板与解码参数,保障评测结果的可比性。其公布的榜单已初步展现Gemini-2.5-Flash等模型在多任务上的表现,揭示了跨语言泛化能力与领域适配性的关键平衡。随着DictaLM等希伯来语定向优化模型的加入,AlephBench正成为评价与推动非英语大模型研究的热点平台,为多语言AI公平性研究奠定了坚实度量基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务