遇见数据集

gpqa-ptpt

收藏
Hugging Face2026-06-23 更新2026-06-24 收录
官方服务:

资源简介:

GPQA-PT数据集是Graduate-Level Google-Proof Q&A Benchmark(GPQA)的葡萄牙语机器翻译版本。GPQA是一个具有挑战性的专家级问答基准数据集,包含需要深入领域知识才能回答的高难度问题。该翻译版本使用经过微调的GemmaX2-9B模型将原始英文数据集翻译为欧洲葡萄牙语,但仅翻译了问题、正确答案、错误答案和解释这几个核心字段。数据集包含四个配置:gpqa_extended、gpqa_main、gpqa_diamond和gpqa_experts,每个配置都提供训练集分割。作为AMALIA项目的一部分,该数据集被纳入AMALIA-Bench基准套件,专门用于评估大型语言模型在欧洲葡萄牙语上的能力。由于是机器翻译生成,数据集可能包含翻译错误或语言伪影。数据集适用于问答和文本生成任务,特别适合作为专家级知识基准测试,用于衡量模型在复杂领域问题上的理解和推理能力。

The GPQA-PT dataset is the European Portuguese machine translation variant of the Graduate-Level Google-Proof Q&A Benchmark (GPQA). GPQA is a challenging expert-level question answering benchmark dataset comprising high-difficulty questions that demand in-depth domain expertise to answer. This translated iteration uses the fine-tuned GemmaX2-9B model to render the original English dataset into European Portuguese, with only core fields including questions, correct answers, distractors, and explanations translated. The dataset includes four configurations: gpqa_extended, gpqa_main, gpqa_diamond, and gpqa_experts, each of which provides a training set split. As a component of the AMALIA project, this dataset is integrated into the AMALIA-Bench benchmark suite, which is dedicated to evaluating the capabilities of large language models on European Portuguese tasks. Given that it is generated via machine translation, the dataset may contain translation errors or linguistic artifacts. The dataset is applicable to question answering and text generation tasks, and is particularly suitable as an expert-level knowledge benchmark for measuring models' understanding and reasoning abilities on complex domain-specific questions.

创建时间:
2026-06-22
原始信息汇总

数据集概述

  • 数据集名称: GPQA-PT
  • 数据集描述: 这是一个研究生级别的、谷歌难以解答的问答基准的葡萄牙语机器翻译版本,包含专家级问题。
  • 语言: 葡萄牙语 (pt)
  • 任务类别: 问答、文本生成
  • 标签: 基准、专家级、amalia-bench

数据集配置

该数据集包含四个子集,每个子集均为训练集:

  • gpqa_extended: 数据文件位于 gpqa_extended/train-*
  • gpqa_main: 数据文件位于 gpqa_main/train-*
  • gpqa_diamond: 数据文件位于 gpqa_diamond/train-*
  • gpqa_experts: 数据文件位于 gpqa_experts/train-*

翻译说明

  • 仅有以下列被翻译:问题、正确答案、错误答案和解释。
  • 翻译模型为针对欧洲葡萄牙语微调的 GemmaX2-9B。
  • 警告: 该数据集由机器翻译生成,可能包含翻译错误或人工产物。

原始数据集

原始数据集为 Idavidrein/gpqa

归属项目

该数据集是 AMALIA 项目 的一部分,并收录于 AMALIA-Bench,这是一个用于评估欧洲葡萄牙语大语言模型的综合基准套件。

搜集汇总
数据集介绍
gpqa-ptpt 数据集图片
构建方式
GPQA-PT数据集是基于Graduate-Level Google-Proof Q&A Benchmark(GPQA)的葡萄牙语机器翻译版本,由AMALIA项目构建。该基准原本包含一系列专家级别的高难度问答题目,旨在挑战顶尖语言模型的推理能力。在翻译过程中,研究团队采用Fine-tuned GemmaX2-9B模型进行葡萄牙语(pt-PT)的转换,仅对题目、正确答案、错误答案及解释四个核心列进行翻译,以确保数据结构的完整性。数据集保留了GPQA原有的四个子集配置:gpqa_extended、gpqa_main、gpqa_diamond和gpqa_experts,每个子集均以训练集形式提供,文件格式为Parquet。
特点
该数据集的核心特色在于其专家级别的难度与跨语言迁移的稀缺性。所有问题均源自研究生层次的科学领域,涵盖物理、化学、生物学等硬核学科,要求模型具备深厚的专业知识与逻辑推理能力。作为葡萄牙语版本的专家级问答基准,GPQA-PT填补了低资源语言在高难度评测领域的空白,成为AMALIA-Bench综合评测套件的重要组成部分。此外,数据集明确标注了机器翻译可能存在的误差或伪影,为后续研究提供了透明性参考,同时也为评估葡萄牙语大模型在复杂推理任务上的表现提供了权威标尺。
使用方法
使用GPQA-PT数据集时,用户可通过HuggingFace Datasets库加载指定配置的子集,例如调用load_dataset('gpqa-ptpt', 'gpqa_main')获取主测试集。每个样本包含翻译后的葡萄牙语问题、四个选项(含一个正确答案)、正确答案索引以及解释文本。该数据集适用于文本生成与问答任务的模型评估,尤其适合对比不同葡萄牙语大模型在专家级知识推理上的能力差异。建议在使用前检查机器翻译质量,并注意数据仅包含训练集,可直接作为验证或测试集使用。用户亦可参考AMALIA项目提供的评测框架,以标准化流程进行模型性能的横向比较。
背景与挑战
背景概述
在自然语言处理领域,大规模语言模型在复杂推理任务中的表现日益受到关注,然而绝大多数高端评测基准仅集中于英语,制约了非英语语言模型的发展。GPQA-PT数据集应运而生,由葡萄牙语研究团队在AMALIA项目框架下于2025年创建,核心研究人员包括Afonso Simplício、Gonçalo Vinagre等来自多所葡萄牙机构的学者。该数据集基于原始Graduate-Level Google-Proof Q&A Benchmark(GPQA),通过微调的GemmaX2-9B模型自动翻译为欧洲葡萄牙语,旨在构建面向研究生级、专家级问答的葡萄牙语基准,弥补了高端葡萄牙语评估资源的空白。作为AMALIA-Bench的重要组成部分,GPQA-PT为评估和推动葡萄牙语大模型在深度推理与专业领域知识上的表现提供了关键工具,对促进低资源语言的自然语言处理研究具有深远影响。
当前挑战
GPQA-PT面临多重挑战。首先,从领域问题来看,该数据集旨在解决葡萄牙语中缺乏高端、专家级问答评测基准的困境,原始GPQA涵盖物理、化学、生物等专业领域,问题需深度知识才能作答,对模型推理能力提出极高要求。其次,在构建过程中,团队依赖机器翻译将英文题目及选项转化为葡萄牙语,但翻译可能引入语义偏差或错误,尤其是专业术语的准确性难以保证,且仅翻译了问题、正确答案、错误答案和解释四个字段,原始数据的隐式上下文可能受损。此外,数据集规模有限且仅提供训练集,未划分验证或测试子集,可能影响评估的标准化与可重复性,而机器翻译本身也需人工审核以确保质量,但当前版本未标注翻译错误类型,给使用带来不确定性。
常用场景
经典使用场景
GPQA-PT数据集作为面向葡萄牙语的专家级问答基准,其经典使用场景在于评估大语言模型在高度专业化、研究生级别的知识问答中的表现。该数据集收录了涵盖物理、化学、生物等硬科学领域的复杂问题,要求模型不仅具备语言理解能力,更需掌握深层次的学科推理与事实判断。研究者通常利用该数据集的四个子集(如gpqa_diamond和gpqa_experts)来检验模型在跨领域、高难度知识检索与逻辑推演上的极限,从而衡量模型在接近人类专家水平上的认知能力。
衍生相关工作
GPQA-PT衍生了多项经典工作,其中最显著的是作为AMALIA-Bench评估套件的核心组成部分,促进了面向欧洲葡萄牙语的全面模型评估体系构建。研究者基于该数据集开发了针对葡萄牙语的大语言模型能力诊断工具,并探索了跨语言知识迁移的技术路径。此外,它与原始GPQA数据集的对比分析工作催生了一系列关于机器翻译质量对高难度问答影响的研究,推动了多语言环境下专家级评测数据的构建方法论与质量保证框架的完善。
数据集最近研究
最新研究方向
当前,GPQA-PT数据集的研究前沿聚焦于高阶人工智能推理能力的跨语言迁移与评估,尤其是在低资源语言葡萄牙语上的专业性基准构建。随着AMALIA项目的推进,该数据集已成为衡量大语言模型在葡萄牙语中处理研究生级推理问题的关键工具,紧密关联欧洲多语言AI能力评测的热点事件。其意义在于填补了专家级知识问答在葡萄牙语领域的空白,促进多语言模型在科学、医学等复杂场景下的公平性比较与鲁棒性提升,为构建更包容的全球AI生态提供实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务