遇见数据集

AIML-TUDA/QA-base

收藏
Hugging Face2026-07-16 更新2026-07-22 收录
官方服务:

资源简介:

QA Base Data是一个用于基础模型预训练的数据集,包含21个标准NLP基准测试的归一化和复述版本,支持英语、德语、法语、西班牙语和意大利语五种语言。数据通过Qwen3.5-27B-FP8模型生成,其中英语版本为复述处理,其他语言版本为翻译和精炼处理。数据集以JSONL格式存储,每个文件包含单个“text”字段,文本格式为自包含的段落,结合了问题、选项(如适用)和答案。目录结构按语言组织,每种语言文件夹下包含相同的21个基准测试集合和48个JSONL文件,涵盖多种任务类型,如多项选择科学问答、常识推理、自然语言理解套件、大规模多任务语言理解、医学问答、Python编程问题、伦理推理、物理直觉问答等。免责声明指出,已移除因测试集泄漏而损坏的评估数据。

Normalized and paraphrased splits of 21 standard NLP benchmarks in English, German, French, Spanish, and Italian, intended for base model pretraining.

提供机构:
AIML-TUDA
搜集汇总
数据集介绍
AIML-TUDA/QA-base 数据集图片
构建方式
QA-base数据集融合了21项标准自然语言处理基准测试,涵盖英语、德语、法语、西班牙语和意大利语五种语言。其构建过程采用先进的Qwen3.5-27B-FP8模型进行多阶段生成:英语部分通过该模型于2026年4月完成释义(paraphrasing),生成语义等价但表达多样的文本变体;德语、法语、西班牙语和意大利语部分则分别在2026年4月至5月期间,通过翻译与精细化处理(translated and refined)获得。所有数据均以JSONL格式存储,每条记录包含单一字段“text”,该字段将问题、选项(如适用)及答案整合为自包含的段落,确保了数据的结构化与易用性。
特点
该数据集的显著特点在于其多语言覆盖与任务多样性,不仅支持问答(question-answering)任务,还涵盖文本分类(text-classification)与多项选择(multiple-choice)等场景,如ARC、OpenBookQA、SuperGLUE、MMLU等21个基准。每种语言独立存放于对应的文件夹(en/、de/、fr/、es/、it/),共包含48个JSONL文件,结构高度一致,便于跨语言比较与迁移学习。此外,数据集专为基础模型预训练设计,通过释义与翻译技术增强了文本的泛化能力,同时剔除了过往版本中存在的测试集泄露问题,确保了数据的纯净性与可靠性。
使用方法
用户可通过HuggingFace Datasets库加载QA-base数据集,每个子配置(如original、en、de等)对应特定的语言或原始版本。使用时,推荐直接读取JSONL文件并以字典形式解析文本字段,适用于预训练语言模型的掩码语言建模(masked language modeling)或因果语言建模(causal language modeling)任务。由于“text”字段已包含完整的问答对,用户无需额外拼接提示,可直接将其作为输入序列。对于多项选择任务,可进一步解析文本中的选项标记;对于序列分类任务,则可根据基准定义提取标签。建议在使用前检查数据分片,避免因版本更新导致的数据泄漏。
背景与挑战
背景概述
在自然语言处理领域,多语言与多任务预训练数据集的构建对于提升基础模型的泛化能力至关重要。QA-base数据集由研究团队于2026年创建,利用Qwen3.5-27B-FP8模型对21个标准NLP基准测试进行了改写与翻译,覆盖英语、德语、法语、西班牙语和意大利语五种语言。该数据集聚焦于问答、文本分类与多项选择等核心任务,旨在为基础模型预训练提供标准化、去噪且无泄露的训练语料。通过整合ARC、OpenBookQA、SuperGLUE、MMLU等广泛使用的基准,QA-base显著降低了多语言数据获取的门槛,促进了推理、常识理解与伦理判断等能力的跨语言迁移,对推动多语言预训练模型的发展具有重要影响。
当前挑战
构建QA-base数据集面临多重挑战。在领域问题层面,现有预训练语料常存在任务碎片化、语言覆盖不均及测试集泄露等缺陷,导致模型评估失真与泛化能力受限。QA-base需统一处理21个基准的异构格式(如多项选择、开放式问答),并确保多语言改写的语义保真度与风格一致性。在构建过程中,挑战尤为突出:首先,利用大型语言模型进行改写与翻译时,需精细控制以避免引入虚假相关性或文化偏见;其次,版本迭代中曾发现测试集泄露(如Inverse Scaling、TruthfulQA等),被迫移除数据并重构,这对数据清洗与安全审计提出了极高要求;最后,跨语言质量对齐与多任务平衡也增加了构建的复杂度。
常用场景
经典使用场景
QA-base 数据集整合了21项经典的自然语言处理基准测试,涵盖英语、德语、法语、西班牙语和意大利语五种语言,通过改写和翻译生成标准化、自包含的问答文本。其最经典的使用场景在于为基础模型(base model)的预训练提供大规模、多语言、高质量的训练数据。每个样本将问题、选项(若适用)与答案融合成连贯的段落,便于模型直接学习理解与生成任务。该数据集尤其适合用于多语言问答系统的初阶训练、跨语言迁移学习的研究,以及检测模型在科学推理、常识理解、伦理推理等多元化任务上的基础能力。Research社区常将其作为预训练语料,以增强模型的泛化性能和语言适应性。
解决学术问题
QA-base 数据集有效解决了学术研究中预训练数据来源单一、语言覆盖不足以及标准基准测试泄露导致评估失真的问题。通过去除被污染的数据,它还原了干净、可靠的训练集,为模型预训练提供了公平的基础。研究学者可以借此探究多语言环境下模型对常识推理(如SocialIQa、CommonsenseQA)、科学问答(如ARC、OpenBookQA)、自然语言理解(如GLUE、SuperGLUE)以及伦理推理(如Hendrycks Ethics)等多样任务的掌握程度。它的出现推动了多语言预训练技术的进步,使跨语言理解模型在规模化训练中能够更均衡地吸收来自不同语言的知识,从而提升模型的零样本迁移能力和世界知识表征的鲁棒性。
衍生相关工作
基于QA-base 数据集,学术界衍生了多项具有影响力的经典工作。研究者利用其多语言且经过标准化的特性,探索了在预训练阶段引入改写数据对模型泛化能力的影响,催生了关于数据增强策略和蒸馏的深入研究。部分工作聚焦于多语言迁移学习,借助QA-base 的五种语言版本分析了跨语言问答任务中语言间知识共享的机制。此外,由于该数据集剔除了存在泄露问题的子集,后续工作开始重视预训练数据清洁度对下游任务评估的污染效应,推动了关于数据审计和基准测试可信度的方法学创新。这些衍生研究共同提升了自然语言处理领域对数据质量与模型真实能力的关注。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务