odia-eval-benchmark
收藏资源简介:
Odia Eval Benchmark 是一个面向奥里亚语(Odia)语言模型评估的统一基准数据集,旨在解决现有评估数据分散、格式混乱、加载困难等问题。该数据集整合了 33 个不同来源的数据集,总计 125,243 个评估样本,覆盖 9 种任务类型:多选题(63,266 个样本)、问答(29,392 个样本)、生成(23,738 个样本)、数学推理(2,638 个样本)、分类(4,050 个样本)、翻译(1,012 个样本)和命名实体识别(1,147 个样本)。数据按质量分为三个层级:专业翻译(Sarvam AI 提供,47,951 条)、原生奥里亚语(AI4Bharat、L3Cube、Sambhashana、MTEB、OpenLanguageData 提供,60,403 条)和 NLLB 翻译(TripathySagar 提供,15,895 条)。数据集采用统一模式,包含 15 个字段(如 id、task、language、prompt、prompt_odia、reference、reference_odia、choices、choices_odia、answer、domain、source、subset、split、dataset_name),以 Parquet 格式存储(约 80MB),许可证为 MIT。数据集适用于评估奥里亚语语言模型在多项 NLP 任务上的表现,包括知识推理、阅读理解、数学推理、翻译、分类、生成、NER 等。
Odia Eval Benchmark is a unified benchmark dataset for evaluating Odia language models, designed to address issues such as scattered evaluation data, inconsistent formats, and loading difficulties. It integrates 33 datasets from different sources, totaling 125,243 evaluation samples, covering 9 task types: multiple-choice (63,266 samples), question answering (29,392 samples), generation (23,738 samples), mathematical reasoning (2,638 samples), classification (4,050 samples), translation (1,012 samples), and named entity recognition (1,147 samples). The data is divided into three quality tiers: professional translation (provided by Sarvam AI, 47,951 entries), native Odia (provided by AI4Bharat, L3Cube, Sambhashana, MTEB, OpenLanguageData, 60,403 entries), and NLLB translation (provided by TripathySagar, 15,895 entries). The dataset adopts a unified schema with 15 fields (e.g., id, task, language, prompt, prompt_odia, reference, reference_odia, choices, choices_odia, answer, domain, source, subset, split, dataset_name), stored in Parquet format (approximately 80MB), licensed under MIT. This dataset is suitable for evaluating Odia language models on various NLP tasks, including knowledge reasoning, reading comprehension, mathematical reasoning, translation, classification, generation, NER, etc.
数据集概述
Odia Eval Benchmark 是一个统一的奥里亚语(Odia)评估基准数据集,旨在解决奥里亚语模型评估中数据集分散、格式不一、加载器损坏等问题。该数据集由 saidutta69 发布,采用 MIT 许可证,可免费商用。
核心数据指标
| 指标 | 数值 |
|---|---|
| 总样本数 | 125,243 |
| 唯一数据集 | 33 |
| 评估任务类型 | 9 |
| 语言 | 奥里亚语(ory)+ 英文提示(如有) |
| 文件格式 | Parquet(单分割,80MB) |
| 访问权限 | 无限制,公开可用 |
任务分布
| 任务类型 | 样本数 | 覆盖内容 |
|---|---|---|
| 多项选择 | 63,266 | MILU、MMLU、ARC、TriviaQA、HellaSwag、Winogrande、TruthfulQA-MC、BHRAM-IL、IndicCOPA、IndicGLUE-WSTP |
| 问答 | 29,392 | BoolQ、IndicQA、IndicSQuAD、IndicQuest |
| 生成 | 23,738 | 摘要、标题生成、问题生成 |
| 数学 | 2,638 | 算术链式推理 |
| 分类 | 4,050 | 新闻分类、释义检测 |
| 翻译 | 1,012 | 奥里亚语-英语翻译 |
| 命名实体识别 | 1,147 | 词级命名实体识别 |
质量分层
| 层级 | 样本数 | 提供方 |
|---|---|---|
| 专业翻译 | 47,951 | Sarvam AI(MMLU、GSM8K、ARC、TriviaQA、BoolQ、IndiVibe) |
| 母语奥里亚语 | 60,403 | AI4Bharat、L3Cube、Sambhashana、MTEB、OpenLanguageData |
| NLLB 翻译 | 15,895 | TripathySagar(ARC、GSM8K、HellaSwag、Winogrande、TruthfulQA) |
数据集字段
| 字段 | 类型 | 描述 |
|---|---|---|
id |
string | 唯一样本标识 |
task |
string | 任务类型(multiple_choice、qa、math、translation、classification、generation、ner) |
language |
string | 语言代码(ory) |
prompt |
string | 原始英文提示(如有) |
prompt_odia |
string | 奥里亚语提示/问题/上下文 |
reference |
string | 英文参考/答案(如有) |
reference_odia |
string | 奥里亚语参考/答案 |
choices |
list[string] | 英文选项(多项选择题) |
choices_odia |
list[string] | 奥里亚语选项(多项选择题) |
answer |
string | 正确答案 |
domain |
string | 领域或类别标签 |
source |
string | 原始数据集名称 |
subset |
string | 学科或子类别 |
split |
string | 数据集分割 |
dataset_name |
string | 用于筛选的内部名称 |
快速使用
加载数据
python from datasets import load_dataset
ds = load_dataset(saidutta69/odia-eval-benchmark, split=odia) print(f{len(ds):,} samples loaded)
按数据集筛选
mmlu = ds.filter(lambda x: x[dataset_name] == sarvam_mmlu_indic)
按任务类型筛选
mcq = ds.filter(lambda x: x[task] == multiple_choice)
评估模型
附带评估工具 scripts/eval_harness.py,支持随机基线、HuggingFace 模型评估,可指定任务类型或具体数据集。
数据来源归属
| 来源 | 数据集 |
|---|---|
| Sarvam AI | MMLU-Indic、GSM8K-Indic、ARC-Challenge-Indic、TriviaQA-Indic-MCQ、BoolQ-Indic、IndiVibe |
| AI4Bharat | MILU、IndicQA、IndicCOPA、IndicHeadlineGeneration、IndicSentenceSummarization、IndicQuestionGeneration、IndicXParaphrase、IndicGLUE(CSQA、WSTP、WikiNER)、Naamapadam |
| L3Cube | IndicSQuAD Odia、IndicQuest Odia |
| TripathySagar | Odia-translated ARC、GSM8K、HellaSwag、Winogrande、TruthfulQA |
| Sambhashana | BHRAM-IL |
| OpenLanguageData | FLORES+ |
| MTEB | OdiaNewsClassification |
独特优势
- 首个统一奥里亚语评估基准:整合 33 个数据集到单一仓库,解决分散痛点。
- 统一模式:15 个字段的统一架构,无需为每个数据集单独编写解析逻辑。
- 内置评估工具:附带可直接使用的评估脚本。
- 多级质量:包含专业翻译、母语、NLLB 翻译三个质量层级,便于对比分析。
- 完全公开:无门控、无等待,下载即用。




