遇见数据集

odia-eval-benchmark

收藏
Hugging Face2026-08-01 更新2026-08-02 收录
官方服务:

资源简介:

Odia Eval Benchmark 是一个面向奥里亚语(Odia)语言模型评估的统一基准数据集,旨在解决现有评估数据分散、格式混乱、加载困难等问题。该数据集整合了 33 个不同来源的数据集,总计 125,243 个评估样本,覆盖 9 种任务类型:多选题(63,266 个样本)、问答(29,392 个样本)、生成(23,738 个样本)、数学推理(2,638 个样本)、分类(4,050 个样本)、翻译(1,012 个样本)和命名实体识别(1,147 个样本)。数据按质量分为三个层级:专业翻译(Sarvam AI 提供,47,951 条)、原生奥里亚语(AI4Bharat、L3Cube、Sambhashana、MTEB、OpenLanguageData 提供,60,403 条)和 NLLB 翻译(TripathySagar 提供,15,895 条)。数据集采用统一模式,包含 15 个字段(如 id、task、language、prompt、prompt_odia、reference、reference_odia、choices、choices_odia、answer、domain、source、subset、split、dataset_name),以 Parquet 格式存储(约 80MB),许可证为 MIT。数据集适用于评估奥里亚语语言模型在多项 NLP 任务上的表现,包括知识推理、阅读理解、数学推理、翻译、分类、生成、NER 等。

Odia Eval Benchmark is a unified benchmark dataset for evaluating Odia language models, designed to address issues such as scattered evaluation data, inconsistent formats, and loading difficulties. It integrates 33 datasets from different sources, totaling 125,243 evaluation samples, covering 9 task types: multiple-choice (63,266 samples), question answering (29,392 samples), generation (23,738 samples), mathematical reasoning (2,638 samples), classification (4,050 samples), translation (1,012 samples), and named entity recognition (1,147 samples). The data is divided into three quality tiers: professional translation (provided by Sarvam AI, 47,951 entries), native Odia (provided by AI4Bharat, L3Cube, Sambhashana, MTEB, OpenLanguageData, 60,403 entries), and NLLB translation (provided by TripathySagar, 15,895 entries). The dataset adopts a unified schema with 15 fields (e.g., id, task, language, prompt, prompt_odia, reference, reference_odia, choices, choices_odia, answer, domain, source, subset, split, dataset_name), stored in Parquet format (approximately 80MB), licensed under MIT. This dataset is suitable for evaluating Odia language models on various NLP tasks, including knowledge reasoning, reading comprehension, mathematical reasoning, translation, classification, generation, NER, etc.

创建时间:
2026-07-30
原始信息汇总

数据集概述

Odia Eval Benchmark 是一个统一的奥里亚语(Odia)评估基准数据集,旨在解决奥里亚语模型评估中数据集分散、格式不一、加载器损坏等问题。该数据集由 saidutta69 发布,采用 MIT 许可证,可免费商用。


核心数据指标

指标 数值
总样本数 125,243
唯一数据集 33
评估任务类型 9
语言 奥里亚语(ory)+ 英文提示(如有)
文件格式 Parquet(单分割,80MB)
访问权限 无限制,公开可用

任务分布

任务类型 样本数 覆盖内容
多项选择 63,266 MILU、MMLU、ARC、TriviaQA、HellaSwag、Winogrande、TruthfulQA-MC、BHRAM-IL、IndicCOPA、IndicGLUE-WSTP
问答 29,392 BoolQ、IndicQA、IndicSQuAD、IndicQuest
生成 23,738 摘要、标题生成、问题生成
数学 2,638 算术链式推理
分类 4,050 新闻分类、释义检测
翻译 1,012 奥里亚语-英语翻译
命名实体识别 1,147 词级命名实体识别

质量分层

层级 样本数 提供方
专业翻译 47,951 Sarvam AI(MMLU、GSM8K、ARC、TriviaQA、BoolQ、IndiVibe)
母语奥里亚语 60,403 AI4Bharat、L3Cube、Sambhashana、MTEB、OpenLanguageData
NLLB 翻译 15,895 TripathySagar(ARC、GSM8K、HellaSwag、Winogrande、TruthfulQA)

数据集字段

字段 类型 描述
id string 唯一样本标识
task string 任务类型(multiple_choiceqamathtranslationclassificationgenerationner
language string 语言代码(ory
prompt string 原始英文提示(如有)
prompt_odia string 奥里亚语提示/问题/上下文
reference string 英文参考/答案(如有)
reference_odia string 奥里亚语参考/答案
choices list[string] 英文选项(多项选择题)
choices_odia list[string] 奥里亚语选项(多项选择题)
answer string 正确答案
domain string 领域或类别标签
source string 原始数据集名称
subset string 学科或子类别
split string 数据集分割
dataset_name string 用于筛选的内部名称

快速使用

加载数据

python from datasets import load_dataset

ds = load_dataset(saidutta69/odia-eval-benchmark, split=odia) print(f{len(ds):,} samples loaded)

按数据集筛选

mmlu = ds.filter(lambda x: x[dataset_name] == sarvam_mmlu_indic)

按任务类型筛选

mcq = ds.filter(lambda x: x[task] == multiple_choice)

评估模型

附带评估工具 scripts/eval_harness.py,支持随机基线、HuggingFace 模型评估,可指定任务类型或具体数据集。


数据来源归属

来源 数据集
Sarvam AI MMLU-Indic、GSM8K-Indic、ARC-Challenge-Indic、TriviaQA-Indic-MCQ、BoolQ-Indic、IndiVibe
AI4Bharat MILU、IndicQA、IndicCOPA、IndicHeadlineGeneration、IndicSentenceSummarization、IndicQuestionGeneration、IndicXParaphrase、IndicGLUE(CSQA、WSTP、WikiNER)、Naamapadam
L3Cube IndicSQuAD Odia、IndicQuest Odia
TripathySagar Odia-translated ARC、GSM8K、HellaSwag、Winogrande、TruthfulQA
Sambhashana BHRAM-IL
OpenLanguageData FLORES+
MTEB OdiaNewsClassification

独特优势

  • 首个统一奥里亚语评估基准:整合 33 个数据集到单一仓库,解决分散痛点。
  • 统一模式:15 个字段的统一架构,无需为每个数据集单独编写解析逻辑。
  • 内置评估工具:附带可直接使用的评估脚本。
  • 多级质量:包含专业翻译、母语、NLLB 翻译三个质量层级,便于对比分析。
  • 完全公开:无门控、无等待,下载即用。
搜集汇总
数据集介绍
odia-eval-benchmark 数据集图片
构建方式
该基准数据集整合了33个源自多源机构的高质量奥里亚语评估数据集,共计125,243个样本,覆盖9种任务类型。构建过程系统性地汇聚了Sarvam AI的专业翻译数据、AI4Bharat及L3Cube等机构的本土奥里亚语数据,以及NLLB机器翻译数据,形成三个质量层级。所有样本均被统一至包含15个字段的标准化模式,确保跨数据集的兼容性与可操作性,并打包为单个Parquet文件以便直接加载。
特点
该基准的显著特点在于其全面的任务覆盖与质量分层设计。它不仅囊括了从多项选择、问答到数学推理、命名实体识别等9类任务,还依据翻译质量将数据划分为专业翻译、本土奥里亚语及NLLB翻译三个层级,便于评估模型在不同语言质量下的表现。此外,统一的数据结构与捆绑的评估脚本简化了评估流程,消除了访问门槛,实现了即下即用的便捷性。
使用方法
用户可通过Hugging Face的datasets库一键加载全部数据,并使用提供的eval_harness.py脚本进行模型评估。该脚本支持随机基线与Hugging Face模型接入,允许按任务类型或具体数据集灵活筛选,并提供编程接口以实现自定义评估流程。借助统一的15字段结构,研究者能够便捷地针对特定任务(如多项选择)或特定来源数据进行细粒度分析,从而有效衡量模型在奥里亚语上的综合能力。
背景与挑战
背景概述
该数据集由Sarvam AI、AI4Bharat等机构于近期创建,旨在解决奥里亚语(Odia)这一低资源语言在自然语言处理评估中的碎片化问题。核心研究问题是为奥里亚语提供一个统一、全面且易于使用的评估基准,涵盖多种任务类型(如问答、推理、翻译等),并整合不同质量层级的数据(专业翻译、母语数据、机器翻译)。该基准包含125,243个样本,覆盖33个数据集和9种任务,显著提升了奥里亚语模型评估的效率和一致性。其影响力在于填补了奥里亚语评估资源的空白,为低资源语言的多任务评估树立了新范式,有望推动奥里亚语NLP研究的快速发展。
当前挑战
奥里亚语作为低资源语言,面临标注数据稀缺、评估标准缺失的严峻挑战。构建过程中,需整合来自不同机构、格式各异的数据源,统一schema并确保加载兼容性,同时解决部分原始数据集访问受限或损坏的问题。质量分层设计需平衡专业翻译的准确性与母语数据的自然性,并处理NLLB机器翻译可能引入的噪声。此外,基准需覆盖多任务类型以反映真实语言理解能力,但数学、代码等特定领域样本数量有限,难以全面评估模型能力。这些挑战共同考验了数据集构建的工程复杂性与资源统筹能力。
常用场景
经典使用场景
odia-eval-benchmark数据集是奥里亚语自然语言处理研究领域的一项开创性资源,它首次将分散于30余个独立仓库的评估数据集统一整合为包含125,243个样本的单一基准。该数据集涵盖9种任务类型,包括多选题、问答、数学推理、翻译、文本分类、生成、命名实体识别、释义和摘要,为研究者提供了一个标准化、可直接加载的评估框架。其统一的15字段结构和配套的评估脚本极大简化了模型性能对比流程,使得跨任务、跨模型的能力评估变得高效且可复现,尤其适用于低资源语言场景下的模型基准测试与迭代优化。
解决学术问题
该数据集直面奥里亚语NLP研究中长期存在的评估碎片化与不可复现性难题。以往研究者需分别处理各数据集的格式差异、加载故障和许可限制,导致模型比较缺乏一致性和公平性。通过提供三层质量体系(专业翻译、原生奥里亚语、NLLB翻译)和涵盖知识推理、阅读理解、数学逻辑等多维度的任务设计,该基准使得低资源语言模型的能力评估有了可靠依据,显著推动了多语言模型在奥里亚语上的发展。其公开、无门禁的访问机制也促进了研究社区的开放合作,为后续研究奠定了可验证的评估基石。
衍生相关工作
该基准的构建直接催生了多项后续研究方向。基于其分层质量设计,研究者开始探索专业翻译数据与原生数据在模型训练中的加权策略,以提升低资源语言模型的鲁棒性。其统一的评估框架也启发了类似低资源语言基准项目的建设,如其他印度语言的评估集合。此外,该数据集中的IndiVibe和BHRAM-IL子集被用于多语言模型的文化与情境对齐研究,而数学和推理子集则促进了奥里亚语链式思维提示方法的发展。其公开可复现的特性,已成为许多奥里亚语NLP论文的标准评估基线。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务