SAHM
收藏数据链接:
官方服务:
资源简介:
SAHM是首个阿拉伯语金融和伊斯兰教法合规推理基准,包含14,380个专家验证的示例,涵盖多项选择和生成任务,涉及会计、商业、金融情感、事件原因推理、教法裁决、伊斯兰金融问答和提取式摘要等领域。
SAHM is the first Arabic financial and Sharia-compliant reasoning benchmark, comprising 14,380 expert-validated examples covering multiple-choice and generative tasks spanning accounting, business, financial sentiment analysis, event causal reasoning, Sharia rulings, Islamic finance Q&A, and extractive summarization, among other relevant domains.
创建时间:
2026-06-04
原始信息汇总
SAHM 数据集概述
基本信息
- 数据集名称:SAHM(Arabic Financial and Shariah-Compliant Reasoning Benchmark)
- 发布机构:MBZUAI(穆罕默德·本·扎耶德人工智能大学)
- 论文链接:https://arxiv.org/abs/2604.19098
- 数据集存储:Hugging Face 平台,组织名为
SahmBenchmark - 许可证:Apache License 2.0
数据集规模
- 总样本数:14,380 条专家验证的样本
- 任务类型:多项选择题(MCQ)和生成式任务
任务构成
多项选择题(MCQ)
| 任务 | 键名 | 指标 |
|---|---|---|
| 会计 MCQ | accounting |
准确率(%) |
| 商业 MCQ | business |
准确率(%) |
| 伊斯兰教法裁决 MCQ | fatwa_mcq |
准确率(%) |
| 金融情感 MCQ | sentiment |
准确率(%) |
生成式任务
| 任务 | 键名 | 评分方式 | 评分范围 |
|---|---|---|---|
| 金融问答 | financial_qa |
LLM 评判(基于参考) | 0–10 |
| 教法裁决问答 | fatwa_qa |
LLM 评判(基于参考) | 0–10 |
| 伊斯兰金融问答 | islamic_qa |
LLM 评判(基于参考) | 0–10 |
| 金融摘要 | summarization |
仅生成,不自动评分 | — |
领域覆盖
- 会计
- 商业
- 金融情感分析
- 事件因果推理
- 教法裁决(Fatwa)
- 伊斯兰金融问答
- 抽取式摘要
评估方法
- MCQ 评分:基于第一 token 对数概率(log-probability)排序,使用正则表达式回退,不依赖 LLM 提取,完全确定性和可复现
- 生成式评分:使用参考答案和项目原始评分标准(rubrics),由 LLM 作为评判者(支持 GPT 和 Gemini 切换),考量正确性、条件/例外、忠实性、关键检查等维度
主要发现
- 阿拉伯语流利度不代表金融推理能力
- 在 20 个 LLM 的测试中,模型在识别任务上得分约 91%,但在生成任务上表现急剧下降
- 事件因果推理任务表现出最广泛的性能差异
工具链
- 官方评估工具:
sahm-eval命令行工具 - 支持本地 vLLM 推理和托管 API 模型(兼容 OpenAI 接口)
- 通过 YAML 配置文件声明模型和任务
- 支持多种子运行,输出
mean ± std排行榜
搜集汇总
数据集介绍

构建方式
在伊斯兰金融与阿拉伯语自然语言处理交叉领域,SAHM数据集应运而生,旨在填补阿拉伯语金融与教法合规推理基准的空白。该数据集由MBZUAI研究团队精心构建,包含14,380条经领域专家严格验证的样本,覆盖多项选择题与生成式任务两大类型。具体涵盖会计、商业、金融情感、事件因果推理、教法判令、伊斯兰金融问答以及抽取式摘要等多元化任务。所有数据均托管于Hugging Face平台,通过设置HF_TOKEN即可自动加载,确保数据可复现性与便捷获取。
特点
SAHM数据集的核心特色在于其双重评分机制的严谨设计。对于多项选择题,采用基于首词对数概率排序的确定性评分方法(类似lm-evaluation-harness),彻底规避了第二语言模型介入带来的歧义与额外成本。对于生成式任务,则采用基于参考标准的语言模型裁判机制,严格复用原始论文中发布的任务特定评分细则,确保评判过程忠实于原论文设定。此外,该基准提供YAML配置驱动的命令行接口,任务与模型声明在配置文件中,密钥仅从环境变量读取,保障了评估流程的安全性与可复现性。
使用方法
使用SAHM评估模型极为简便,通过一条命令即可完成所有任务的多种子评估并生成均值±标准差排行榜。首先需要克隆仓库并安装环境,支持核心数据加载与API模型推理,以及基于vLLM的本地GPU推理。配置好HF_TOKEN和OPENAI_API_KEY等环境变量后,可使用sahm-eval run命令指定模型与任务进行快速测试或全面评估。对于托管API模型,可指定--backend api无需GPU即可运行。生成式任务的裁判模型可通过--judge-model参数灵活切换,支持GPT-4o与Gemini等多种选择。评估结果自动保存于results目录,生成包含MCQ准确率与生成式评分在内的详细排行榜表格。
背景与挑战
背景概述
SAHM基准数据集由穆罕默德·本·扎耶德人工智能大学(MBZUAI)的Rania Elbadry、Sarfraz Ahmad、Ahmed Heakl等研究者于2026年构建,旨在填补阿拉伯语金融与伊斯兰教法合规推理领域的空白。该数据集包含14,380个经专家验证的样本,覆盖会计、商业、金融情感分析、事件因果推理、教法裁决、伊斯兰金融问答及抽取式摘要等多选题与生成式任务。作为首个面向阿拉伯语金融与伊斯兰教法的系统性评测基准,SAHM的发布为低资源语言中专业领域推理能力的评估提供了标准化框架,推动了多语言自然语言处理在金融与宗教法律交叉领域的发展,对学术研究与工业应用具有重要影响。
当前挑战
SAHM数据集主要面临两大挑战:其一,在领域问题层面,阿拉伯语金融与伊斯兰教法推理需要模型同时掌握专业金融知识、伊斯兰法律条文及阿拉伯语语境理解能力,而现有大型语言模型在生成式任务(如事件因果推理)上的表现显著弱于识别任务,揭示了流畅阿拉伯语能力与深层金融推理之间的鸿沟。其二,在构建过程中,数据集的专家验证与标注成本极高,需确保教法问答的宗教准确性、金融案例的真实性及多任务间的一致标准;此外,生成式任务的评分依赖参考标准的LLM评判机制,不同评判模型(如GPT-4o与Gemini)可能引入评分偏差,增加了评测复现与跨模型比较的复杂性。
常用场景
经典使用场景
在阿拉伯语金融与伊斯兰教法合规推理的研究领域,SAHM数据集被广泛用作评估和训练大型语言模型的核心基准。该数据集包含14,380个经专家验证的样本,涵盖会计、商业、金融情感分析、事件因果推理、教法问答及金融摘录性摘要等多项任务,以多项选择和生成式两种形式呈现。研究者通过统一的评估框架,利用确定性多项选择评分和基于参考的LLM评判机制,可对模型的金融推理能力进行标准化评估。该数据集尤其适合衡量模型在阿拉伯语背景下的金融文本理解与伊斯兰金融逻辑推理水平。
解决学术问题
SAHM数据集系统性地解决了阿拉伯语金融领域大型语言模型评估缺乏专业化、多维度基准的学术困境。此前,阿拉伯语金融推理研究长期受限于通用评估集,难以区分语言流畅性与领域推理能力的边界。该数据集通过细化会计、商业、教法问答等具体任务,揭示了模型在识别与生成任务间的显著性能鸿沟——部分模型在识别任务中达到91%,生成任务却急剧下降。这一发现为领域内研究者构建更精准的金融语言模型提供了关键实验证据,推动了低资源语言下专业领域NLP评估体系的完善。
衍生相关工作
围绕SAHM数据集已涌现出一系列具有影响力的衍生工作。在模型层面,研究者基于该基准优化了Qwen2.5-7B等开源模型的阿拉伯语金融指令微调策略,针对其生成任务短板开发了专门的增强训练管线。在评估方法上,项目开创的确定性多项选择评分机制避免了第二语言评判模型中常见的解析歧义,这一范式被后续多个非英语专业基准所借鉴。此外,SAHM团队开源的全套评估套件与可复现实验协议,已成为阿拉伯语NLP社区进行金融推理研究的标准参考实现,推动了该领域实验成果的可比性与可复用性。
以上内容由遇见数据集搜集并总结生成



