Macedonian LLM eval
收藏资源简介:
该数据集是从塞尔维亚语翻译成马其顿语的,使用了Google Translate API进行翻译。选择塞尔维亚语作为源语言是因为塞尔维亚语和马其顿语在语言学上更接近,这使得塞尔维亚语成为更好的翻译起点。此外,塞尔维亚语数据集还使用了GPT-4进行了优化,显著提高了翻译质量。翻译后的马其顿语数据集经过了质量检查,被认为质量良好。
This dataset was translated from Serbian to Macedonian using the Google Translate API. Serbian was selected as the source language due to its close linguistic proximity to Macedonian, which makes it a more favorable starting point for translation. Additionally, the Serbian-language dataset was optimized with GPT-4, which significantly improved the translation quality. The translated Macedonian dataset underwent quality inspection and was deemed to be of good quality.
数据集概述
数据集名称
Macedonian LLM eval
数据集来源
该数据集是基于Aleksa Gordić的原始工作Serbian LLM eval进行改编的。数据集从塞尔维亚语翻译为马其顿语,使用了Google Translate API,并通过GPT-4进行了质量改进。
数据集内容
- 常识推理:包括
Hellaswag、Winogrande、PIQA、OpenbookQA、ARC-Easy、ARC-Challenge。 - 世界知识:包括
NaturalQuestions。 - 阅读理解:包括
BoolQ。
数据集质量
翻译后的马其顿语数据集经过了质量检查,翻译质量良好。
数据集地址
该数据集可以在HuggingFace上找到。
最新评估结果(2025年1月8日)
以下是不同模型在马其顿语数据集上的评估结果:
| 模型 | 版本 | 多语言支持 | 马其顿语显式支持 | ARC Easy | ARC Challenge | Bool Q | HellaSwag | Openbook QA | PIQA | NQ Open | WinoGrande | 备注 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| MKLLM-7B-Instruct | 7B | 是 | 是 | 0.5034 ± 0.0103 | 0.3003 ± 0.0134 | 0.7878 ± 0.0072 | 0.4328 ± 0.0049 | 0.2940 ± 0.0204 | 0.6420 ± 0.0112 | 0.0432 ± 0.0034 | 0.6148 ± 0.0137 | |
| BLOOM | 7B | 是 | 是 | 0.2774 ± 0.0092 | 0.1800 ± 0.0112 | 0.5028 ± 0.0087 | 0.2664 ± 0.0044 | 0.1580 ± 0.0163 | 0.5316 ± 0.0116 | 0 | 0.4964 ± 0.0141 | NQ是精确匹配,因此得分较低。 |
| Phi-3.5-mini | 3.8B | 是 | 否 | 0.2887 ± 0.0093 | 0.1877 ± 0.0114 | 0.6028 ± 0.0086 | 0.2634 ± 0.0044 | 0.1640 ± 0.0166 | 0.5256 ± 0.0117 | 0.0025 ± 0.0008 | 0.5193 ± 0.0140 | |
| Mistral | 7B | 是 | 否 | 0.4625 ± 0.0102 | 0.2867 ± 0.0132 | 0.7593 ± 0.0075 | 0.3722 ± 0.0048 | 0.2180 ± 0.0185 | 0.5783 ± 0.0115 | 0.0241 ± 0.0026 | 0.5612 ± 0.0139 | |
| Mistral-Nemo | 12B | 是 | 否 | 0.4718 ± 0.0102 | 0.3191 ± 0.0134 | 0.8086 ± 0.0072 | 0.3997 ± 0.0049 | 0.2420 ± 0.0185 | 0.6066 ± 0.0112 | 0.0291 ± 0.0034 | 0.6062 ± 0.0137 | |
| Qwen2.5 | 7B | 是 | 否 | 0.3906 ± 0.0100 | 0.2534 ± 0.0127 | 0.7789 ± 0.0073 | 0.3390 ± 0.0047 | 0.2160 ± 0.0184 | 0.5598 ± 0.0116 | 0.0042 ± 0.0011 | 0.5351 ± 0.0140 | |
| LLaMA 3.1 | 8B | 是 | 否 | 0.4453 ± 0.0102 | 0.2824 ± 0.0132 | 0.7639 ± 0.0074 | 0.3740 ± 0.0048 | 0.2520 ± 0.0194 | 0.5865 ± 0.0115 | 0.0335 ± 0.0030 | 0.5683 ± 0.0139 | |
| LLaMA 3.2 | 3B | 是 | 否 | 0.3224 ± 0.0096 | 0.2329 ± 0.0124 | 0.6624 ± 0.0083 | 0.2976 ± 0.0046 | 0.2060 ± 0.0181 | 0.5462 ± 0.0116 | 0.0044 ± 0.0011 | 0.5059 ± 0.0141 | |
| LLaMA 3.3 - 8bit | 70B | 是 | 否 | 0.5808 ± 0.0101 | 0.3686 ± 0.0141 | 0.8511 ± 0.0062 | 0.4656 ± 0.0050 | 0.2820 ± 0.0201 | 0.6600 ± 0.0111 | 0.0878 ± 0.0047 | 0.6093 ± 0.0137 |
评估方法
要运行评估,请按照以下步骤操作:
-
创建并激活Python环境: bash conda create -n mk_eval python==3.10 conda activate mk_eval
-
安装依赖: bash pip install -e .
-
运行评估: bash python3 main.py --language "Macedonian" --model hf-causal-experimental --model_args "pretrained=microsoft/Phi-3.5-mini-instruct" --tasks arc_challenge,arc_easy,boolq,hellaswag,openbookqa,piqa,winogrande --batch_size 8 --output_path "results_eval"
贡献指南
欢迎贡献马其顿语LLM评估数据集!可以通过以下方式参与:
- 翻译流行的基准数据集。
- Fork并修改仓库。
- 更新和修改脚本。
- 提交PR。
待办事项
- 添加COPA-MK到评估中。




