遇见数据集

EusExams-v2

收藏
Hugging Face2026-06-25 更新2026-06-26 收录
官方服务:

资源简介:

EusExams-v2 是一个用于评估和训练巴斯克语(eu)和西班牙语(es)语言模型的问答数据集,专门针对巴斯克地区公共部门的考试场景。该数据集收集了来自多个巴斯克公共机构(包括公共卫生系统 Osakidetza、巴斯克政府、毕尔巴鄂和加斯泰斯市议会以及巴斯克大学 UPV/EHU)的公共服务考试题目,旨在为相关职位(如行政和助理)的备考提供资源。数据集内容为多项选择题,每个问题包含2到4个选项和一个正确答案。V2 版本相较于原始数据集进行了重要改进:进行了去重处理以消除同一类别内不同考试中的重复问题;移除了无效答案的问题以确保评估的鲁棒性;将众多细粒度测试文件重组为四个高级领域(议会、政府、健康、大学);为每个问题添加了 `ids` 和 `links` 字段以追踪其原始考试来源;并新增了2026年的西班牙语健康考试题目。数据集总规模为 27,442 个唯一问题,按语言和领域分布如下:西班牙语部分共 16,304 题(议会 928,政府 2,530,健康 11,387,大学 1,459),巴斯克语部分共 11,138 题(议会 895,政府 2,531,健康 6,351,大学 1,361)。数据格式为 JSONL,每个样本包含问题文本(question)、候选答案列表(candidates)、正确答案索引(answer,从0开始)、原始问题ID列表(ids)和来源链接列表(links)。该数据集适用于问答、多项选择等自然语言处理任务,尤其侧重于法律和公共管理领域的语言理解评估。

EusExams-v2 is a question answering dataset designed for evaluating and training language models in Basque (eu) and Spanish (es), specifically targeted at public sector exam scenarios in the Basque Country. This dataset collects public service exam questions from multiple Basque public institutions, including the public health system Osakidetza, the Basque Government, the city councils of Bilbao and Gasteiz, and the University of the Basque Country UPV/EHU, aiming to provide resources for exam preparation of relevant positions such as administrative and assistant roles. The dataset comprises multiple-choice questions, each with 2 to 4 options and a correct answer. Compared with the original dataset, Version 2 has undergone substantial improvements: duplicate questions across different exams within the same category are removed via deduplication; questions with invalid answers are eliminated to ensure robust evaluation; numerous fine-grained test files are reorganized into four high-level domains, namely Parliament, Government, Health, and University; `ids` and `links` fields are added to each question to trace its original exam source; and 2026 Spanish health exam questions are additionally included. The total scale of the dataset is 27,442 unique questions, distributed by language and domain as follows: the Spanish subset contains 16,304 questions (Parliament: 928, Government: 2,530, Health: 11,387, University: 1,459), while the Basque subset includes 11,138 questions (Parliament: 895, Government: 2,531, Health: 6,351, University: 1,361). The data is stored in JSONL format, with each sample containing the question text (`question`), list of candidate answers (`candidates`), correct answer index (`answer`, 0-indexed), list of original question IDs (`ids`), and list of source links (`links`). This dataset is applicable to natural language processing tasks such as question answering and multiple choice, with a particular focus on language understanding evaluation in the legal and public administration domains.

提供机构:
HiTZ zentroa
创建时间:
2026-06-25
原始信息汇总

数据集概述:EusExams-v2

EusExams-v2 是一个用于巴斯克公共部门考试准备的问答题数据集,包含多项选择题,每个问题有2到4个选项和一个正确答案。该数据集由HiTZ研究中心和IXA研究组(巴斯克大学UPV/EHU)整理。

主要特性

  • 语言:巴斯克语 (eu) 和西班牙语 (es)
  • 任务:问答 (question-answering) 和多项选择 (multiple-choice)
  • 领域:法律 (legal)
  • 许可协议:cc-by-sa-4.0
  • 数据规模:10,000 < n < 100,000

V2版本改进

  • 去重:移除了同一类别内考试中相同的题目。
  • 空值过滤:删除了缺少有效答案的问题。
  • 分组:将众多考试文件重组为4个高级领域:council(市政厅)、government(政府)、health(健康)和 university(大学)。
  • 来源追踪:为每个问题添加了 idslinks 字段,以追溯原始考试。
  • 新增数据:新增了西班牙语的2026年健康考试数据。

数据集统计

总共有 27,442 个不重复的问题,按语言和域分布如下:

域 (Domain) 西班牙语 (es) 巴斯克语 (eu)
Council (市政厅) 928 895
Government (政府) 2,530 2,531
Health (健康) 11,387 6,351
University (大学) 1,459 1,361
总计 16,304 11,138

数据配置

数据集包含8个子配置,每个配置仅包含 test 拆分,对应语言与域的组合:

  • es_council
  • es_government
  • es_health
  • es_university
  • eu_council
  • eu_government
  • eu_health
  • eu_university

数据示例

每个问题以JSON格式呈现,包含问题文本、候选答案列表、正确答案索引、原始考试的ID列表以及相关链接。例如,一个巴斯克语问题会有一个对应的英语翻译。

相关资源

搜集汇总
数据集介绍
EusExams-v2 数据集图片
构建方式
EusExams-v2是一个专为巴斯克地区公共服务考试设计的多选题数据集,涵盖Osakidetza卫生系统、巴斯克政府、毕尔巴鄂与加斯泰斯市议会及巴斯克大学等机构。其构建基于对原始EusExams数据集的系统性改进,包括:去除同一类别中跨考试的重复问题以防止数据泄露;过滤掉缺失有效答案的问题以增强数据鲁棒性;将细粒度的测试文件重组为议会、政府、卫生与大学四个高层域;为每个问题添加标识符与原始链接以溯源;并新增了2026年西班牙语卫生考试数据。最终得到27,442道独特问题,每个问题含2至4个选项及一个正确答案。
特点
该数据集最显著的特点在于双语与多域覆盖,同时提供西班牙语与巴斯克语版本,并细分为四个权威领域,其中卫生域规模最大(西班牙语11,387题,巴斯克语6,351题)。通过去重、空值过滤与来源追踪,数据集确保了高质量与可复现性。题目均源自真实公共职位考试,涵盖行政与助理等岗位,每个问题均附带原始链接与出现过的考试标识,为多语言问答任务提供了专业且可靠的评估基准。
使用方法
EusExams-v2以配置化方式组织,用户可通过HuggingFace Datasets库按语言与域加载特定子集,例如'es_council'或'eu_health'。每个子集包含JSONL格式的测试数据,每条记录包含问题文本、候选选项列表、正确选项索引及来源标识。数据集可直接用于多选问答与阅读理解评估,尤其适用于巴斯克语与西班牙语混合场景。建议在加载时指定配置名称以获取所需子集,并利用'ids'与'links'字段进行细粒度分析或验证。
背景与挑战
背景概述
EusExams-v2数据集由西班牙巴斯克大学的HiTZ研究中心与IXA研究组于2024年创建,旨在为低资源语言巴斯克语的公共行政领域提供高质量的多选题评测资源。该数据集整合了来自Osakidetza公共卫生系统、巴斯克政府、毕尔巴鄂与维多利亚市政议会以及巴斯克大学等机构的公务员考试试题,涵盖理事会、政府、健康与大学四个核心领域。作为Latxa开放语言模型与评测套件的关键组成部分,EusExams-v2通过去重、空值过滤与溯源标注等精细优化,显著提升了数据集在少语言自然语言处理基准测试中的可靠性与代表性,推动了低资源语言在专业行政领域的智能化研究进程。
当前挑战
EusExams-v2所面临的挑战首先体现在领域问题的复杂性上:公共行政考试涉及高度专业化的法律术语与巴斯克语特有的语法结构,对模型的语义理解与多选项推理能力提出严苛要求,现有通用预训练语言模型在此类低资源、知识密集型场景下表现不佳。在数据集构建过程中,挑战主要源于跨机构试题的异构性与冗余性——不同年份与部门的考题存在大量重复或近似题目,需依赖人工与自动化结合的去重策略确保评测有效性;同时,部分试题缺失正确答案或因OCR错误导致噪声,必须通过系统性空值过滤与质量校验来维护数据纯净度。此外,西班牙语与巴斯克语子集在健康领域规模差异悬殊,平衡双语代表性亦是构建中的棘手难题。
常用场景
经典使用场景
EusExams-v2数据集的核心应用场景在于对巴斯克语及西班牙语双语环境下大规模单选题问答系统的性能进行系统性评估。该数据集精心汇集了来自巴斯克地区多个公共机构(如奥萨基德萨公共卫生系统、巴斯克政府、毕尔巴鄂与加斯泰斯市议会及巴斯克大学)的公务员考试真题,总计超过2.7万道独立题目,涵盖行政、助理等各类公职岗位的选拔测试。每一道选择题均包含2至4个候选答案并标注唯一正确答案,为自然语言处理领域中的多项选择问答任务提供了高质量、真实且领域细分的评测基准,尤其适用于检验低资源语言语言模型在专业法律与行政领域知识的掌握程度。
衍生相关工作
基于EusExams-v2数据集,研究社区已衍生出多项标志性学术工作,其中最具代表性的是由HiTZ研究中心与IXA研究组联合发布的Latxa开放语言模型及评估套件。该工作以EusExams-v2作为关键评测基准之一,系统性地验证了大语言模型在巴斯克语复杂行政选择题上的表现,并围绕领域特定微调、少样本学习策略及跨语言迁移能力展开深入分析。此外,该数据集还催生了针对法律领域低资源语言问答的对比研究,以及基于去重策略的评测集鲁棒性改进方法的探讨,成为推动巴斯克语自然语言处理技术迭代的重要基石。
数据集最近研究
最新研究方向
EusExams-v2数据集聚焦于巴斯克语与西班牙语双语境下的公共服务领域专业考试问答任务,其最新研究动向紧密围绕低资源语言的开放语言模型评估与知识图谱构建。鉴于巴斯克语作为孤立语言的稀缺性,该数据集通过去重、空值过滤及来源追溯等精细处理,为Latxa等开源模型的基准测试提供了高信度支撑。研究前沿尤其关注2026年健康领域新增西班牙语试题所引发的跨语言迁移学习挑战,以及如何利用多领域(政务、医疗、教育)的多选题设计来验证模型在专业术语理解与逻辑推理上的鲁棒性。该数据集不仅推动了巴斯克语NLP在公共行政场景下的实用化突破,亦为评估多语言模型在法治与社会服务等热点议题中的表现树立了范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务