遇见数据集

HiTZ/magpie-en-eu-reasoning-instructions-qwen3

收藏
Hugging Face2026-06-26 更新2026-07-22 收录
官方服务:

资源简介:

magpie-en-eu-reasoning-instructions-qwen3数据集是一个由HiTZ中心开发的大规模、高质量双语指令和偏好数据集,专门用于训练、对齐和评估英语和巴斯克语(Euskera)的推理型大语言模型。该数据集采用自合成的Magpie方法构建,包含总计100万条指令(英语和巴斯克语各50万条),每条指令对应两个响应(一个被接受为高质量,一个被拒绝为低质量),总计200万个响应。独特之处在于,所有响应都包含逐步推理轨迹,以支持模型的推理能力提升。数据集覆盖14个类别,如翻译、科学、安全、创意写作等,并通过自动化质量评估确保指令质量。响应由不同规模的模型生成:被接受响应来自Qwen3-235B-A22B模型,被拒绝响应来自Qwen3-32B模型。巴斯克语部分通过专门调整的模型进行本地化处理,并经过人工评估以确保语言准确性。该数据集适用于偏好对齐(如DPO、ORPO)、推理能力训练和双语模型增强。

The magpie-en-eu-reasoning-instructions-qwen3 dataset is a large-scale, high-quality, bilingual instruction and preference dataset developed by the HiTZ Center. It is specifically tailored for training, aligning, and evaluating reasoning-focused Large Language Models (LLMs) in both English and Basque (Euskera). Built using the self-synthesizing Magpie methodology, the dataset contains a total of 1,000,000 instructions (500,000 in English and 500,000 in Basque). For preference alignment, every instruction is paired with two responses (one chosen, one rejected), totaling 2,000,000 responses. Uniquely, as this dataset targets reasoning models, both responses include explicit step-by-step reasoning traces. Instructions are curated across 14 distinct categories, such as translation, science, safety, and creative writing, with rigorous automated quality control. Responses are generated by models of different capacities: chosen responses from Qwen3-235B-A22B and rejected responses from Qwen3-32B. Basque content is localized using a specialized adapted model and manually evaluated for accuracy. The dataset is designed for preference alignment (e.g., DPO, ORPO), reasoning capability training, and bilingual model enhancement.

提供机构:
HiTZ
搜集汇总
数据集介绍
HiTZ/magpie-en-eu-reasoning-instructions-qwen3 数据集图片
构建方式
该数据集由HiTZ研究中心基于自合成的Magpie方法构建,旨在为推理型大语言模型提供双语指令与偏好数据。指令生成阶段,研究团队利用Qwen3-32B模型从特定系统提示中自主采样,无需人工种子提示,生成的指令涵盖翻译、科学、数学等14个主题类别。每条指令均经过自动化多维质量评估,从清晰度、完整性、特异性、复杂度、可操作性和连贯性六个维度进行筛选,未达阈值的指令被剔除。在此基础上,针对每一条通过过滤的指令,分别由Qwen3-235B-A22B和Qwen3-32B两个不同规模的模型生成回应,前者标记为优选(chosen),后者标记为劣选(rejected),并同时记录两个模型的显式逐步推理过程,从而形成完整的偏好对。为构建巴斯克语版本,研究团队采用经微调的巴斯克适配版Qwen-32B模型,将高质量的英文指令、推理过程和回应翻译至巴斯克语,并通过人工抽样评估确保翻译质量。
使用方法
该数据集特别适用于偏好对齐与推理能力增强两大核心场景。在偏好对齐方面,研究者可直接利用其中天然构造的优选与劣选回应对,结合DPO、IPO、KTO或ORPO等优化算法对模型进行偏好训练,无需额外的人工偏好标注。在推理能力增强方面,数据集中包含的显式推理轨迹可作为监督信号,通过监督微调或强化学习的方式,教会模型在生成最终答案前进行系统化的逐步思考。同时,双语版本的设置使其能够用于增强巴斯克语等低资源语言的指令跟随与复杂问题解决能力。使用时,使用者可根据需要选择英文或巴斯克语子集,也可分别加载accepted与rejected两个偏好方向的数据,灵活适配不同的训练目标。
背景与挑战
背景概述
大型语言模型的推理能力与人类偏好对齐是当前自然语言处理研究的前沿方向,尤其在高价值技术应用场景中,模型不仅需要生成符合指令的回答,更需展现清晰、可解释的思维链。为攻克这一核心问题,HiTZ中心于2025年构建了magpie-en-eu-reasoning-instructions-qwen3数据集,该双语指令集覆盖英语与巴斯克语,总计包含100万条指令及200万组偏好配对回答。研究团队基于自合成Magpie方法论,依托Qwen3系列模型(32B与235B-A22B)自动生成指令与推理痕迹,并通过多维度质量评估筛选高质样本。该数据集专为偏好优化算法(如DPO、ORPO)与推理增强训练设计,其独特之处在于同时收录了回答链的详细推理过程,为低资源语言(巴斯克语)的模型对齐与推理能力提升提供了关键资源,显著推动了多语言评估范式的演进。
当前挑战
该数据集旨在解决双重领域挑战。首先,针对大型语言模型在低资源语言环境下推理能力薄弱的问题,现有偏好数据集多聚焦英语等高资源语言,缺乏对巴斯克语等语系的支持,导致模型在跨语言推理任务中表现欠佳。其次,多数指令集仅包含最终回答,未显式记录思维链,阻碍了推理过程的监督与优化。在构建过程中,团队面临两大技术瓶颈:一是如何利用自合成方法生成既涵盖14个领域(如数学、编程、翻译)又具备高质量推理痕迹的指令,需通过六维指标(清晰度、完整性等)自动过滤不合格样本;二是将英语指令精准本地化为巴斯克语,由于巴斯克语独特的形态句法结构,通用翻译模型常产生语义失真,团队不得不微调专门的巴斯克语版Qwen-32B模型,并经人工验证确保翻译的流畅性与准确性。
常用场景
经典使用场景
在推理增强型大语言模型的学术探索中,magpie-en-eu-reasoning-instructions-qwen3数据集凭借其百万级双语指令与完整的思维链标注,成为训练模型掌握复杂逻辑推演的关键资源。研究者可基于该数据集中清晰标注的‘被采纳’与‘被拒绝’响应及其对应的逐步推理过程,直接运用直接偏好优化(DPO)或胜率比偏好优化(ORPO)等算法,引导模型在数学证明、编程调试、多步推理等任务中形成更优的思考路径。该数据集尤以下游任务建模的灵活性见长:其14个领域类别涵盖从科学论证到创意写作的多元场景,使得在不同知识类型上训练模型的分层推理能力成为可能。
解决学术问题
该数据集的核心学术贡献在于为低资源语言(巴斯克语)的复杂推理模型对齐提供了高质量的基准资源,同时破解了传统偏好数据集中缺乏显式推理链的局限。此前,对巴斯克语等形态丰富的小众语言进行大模型精细调校时,常受限于平行语料匮乏与推理行为不可观察的问题。该数据集通过双语配对设计与思维链显性化,一方面让研究者能够在同一指令下比较两种语言的推理质量差异,以评估模型跨语言泛化能力;另一方面,其基于模型规模差异构建的偏好对(235B vs. 32B)为探究推理链长度、逻辑一致性等指标与响应质量之间的关系提供了实验基础。
实际应用
在实际部署场景中,该数据集直接赋能了巴斯克语智能助手与多语言推理系统的构建。企业或机构可借助其双语指令对,训练能够同时支持英语与巴斯克语的客服机器人、教育辅导软件或代码调试工具。例如,在教育领域,利用该数据集的数学与科学类别指令,可以培养大模型在巴斯克语环境下进行逐步解题演示的能力;在软件开发中,编程与调试类数据可用于训练能够分析错误日志并给出推理过程的代码协助引擎。此外,该数据集的双语属性使其成为构建跨语言知识问答系统的理想种子语料,尤其在需要精准理解巴斯克语语法结构和文化背景的低资源场景中优势显著。
数据集最近研究
最新研究方向
在当前大语言模型推理能力与偏好对齐研究交织演进的前沿领域,magpie-en-eu-reasoning-instructions-qwen3数据集应运而生,其核心理念在于利用自合成Magpie方法论大规模生成指令,并借助异构能力模型(Qwen3-235B-A22B与Qwen3-32B)产出的成对推理轨迹与响应,为直接偏好优化(DPO)等算法提供高保真训练素材。尤为引人注目的是,该数据集不仅囊括英语与巴斯克语双语语料,还对推理过程进行显式编码,使得模型能够在学习偏好对齐的同时,内化逐步推演的思维模式。这一设计直指当前多模态推理、低资源语言增强以及可解释AI等热点议题的需求痛点,尤其为低资源语言(如巴斯克语)在复杂推理场景下的模型能力跃迁提供了稀缺的高质量对齐数据。其开源许可和系统化的14大类指令分布,进一步推动了跨语言推理模型评测基准的公平性与多样性,对于构建更具包容性的下一代智能系统具有深远的现实意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务