遇见数据集

OpenLLM-France/Luciole-PostTraining-Dataset-1.1

收藏
Hugging Face2026-07-21 更新2026-07-22 收录
官方服务:

资源简介:

Luciole-PostTraining-Dataset-1.1是一个经过精心策划的开放指令式文本数据集合,专为语言模型后训练设计。该数据集包含混合的合成与非合成指令,用于监督微调(SFT)以及为偏好对齐(如DPO)设计的响应对。除安全对齐数据外,对齐对均通过增量学习方法合成生成:所有对均使用Qwen3-32B和Qwen3-0.6B生成,其中前者被标记为接受响应。安全数据通过混合使用Qwen3-14B、Ministral-3-14B-Instruct以及Luciole-8B-Instruct的中间检查点(在SFT后)生成。这些响应对经过Ministral-14B-Reasoning和Qwen3-14B双重判断,仅当两个模型在标签上一致时才被纳入。尽管包含一些多语言数据,但数据集主要使用英语。该数据集由OpenLLM France联盟在法国BPI资助的France 2030项目下创建,旨在促进符合开源要求和欧洲AI开发及知识产权法律的大型语言模型训练。数据集分为四个子集:sft_instruct(无思维痕迹的指令数据)、sft_thinking(带思维痕迹的指令数据)、dpo_instruct(无思维痕迹的接受与拒绝响应对)和dpo_thinking(带思维痕迹的响应对,即将推出)。

The Luciole-PostTraining-Dataset-1.1 is a curated collection of open, instruction-style text data designed for language model post training. It includes a mixture of synthetic and non-synthetic instructions for supervised fine-tuning (SFT) as well as pairs of responses designed for preference alignment (e.g., DPO). With the exception of data for safety alignment, the alignment pairs were generated synthetically with a delta learning approach: all pairs were generated with Qwen3-32B and Qwen3-0.6B and the former were labeled as the accepted responses. Safety data were generated with a mixture of Qwen3-14B, Ministral-3-14B-Instruct, and an interim checkpoint of Luciole-8B-Instruct, after SFT. Pairs were judged with both Ministral-14B-Reasoning and Qwen3-14B. A pair was included only if both models agreed on their labels. While it contains some multilingual data, it is primarily English. The dataset was created by the consortium of the OpenLLM France project funded by BPI France as part of the France 2030 program, aiming to facilitate training of large language models in conformance with open-source requirements and European laws on AI development and intellectual property. It is divided into four subsets: sft_instruct (instruction-style data without thinking traces), sft_thinking (instruction-style data with thinking traces), dpo_instruct (instructions with pairs of accepted and rejected responses without thinking traces), and dpo_thinking (instructions with pairs of accepted and rejected responses with thinking traces, coming soon).

提供机构:
OpenLLM-France
搜集汇总
数据集介绍
OpenLLM-France/Luciole-PostTraining-Dataset-1.1 数据集图片
构建方式
Luciole-PostTraining-Dataset-1.1 是一个专为语言模型后期训练设计的开放指令式文本数据集,包含监督微调(SFT)和偏好对齐(如 DPO)两类数据。其构建方式独具匠心:对于除安全对齐外的偏好对,采用增量学习(delta learning)方法,由 Qwen3-32B 生成优质响应作为接受样本,Qwen3-0.6B 生成低质响应作为拒绝样本。安全数据则融合 Qwen3-14B、Ministral-3-14B-Instruct 及 Luciole-8B-Instruct 中间检查点的输出,并经由 Ministral-14B-Reasoning 与 Qwen3-14B 双重评判,仅保留两者标签一致的样本。数据来源均为先前以开放许可发布的语料库或由开源模型生成的新数据,并经过严格预处理,移除含有特定 LLM 名称、公司名及中俄字符的样本。
特点
该数据集呈现出多元异构与层次分明的显著特征。其包容三大配置:`sft_instruct` 包含无思考痕迹的指令数据,`sft_thinking` 集成了带推理链的指令样本,而 `dpo_instruct` 则提供了用于偏好优化的成对响应,每条样本均包含精心挑选的 `chosen` 与 `rejected` 字段,结构化遵循 HuggingFace 对话格式。数据内容丰富多样,涵盖对话指令遵循、数学推理、代码生成、STEM 科学问答及检索增强生成等十余个领域,下属数十个具体数据子集。尽管以英文为主导,但已初步融入法文等多语元素,旨在服务于欧洲语言模型的合规化发展。此外,数据集遵循 CC-BY-4.0 许可协议,完全开放且可溯源。
使用方法
使用该数据集时,研究者可通过 HuggingFace Datasets 库便捷加载。首先利用 `get_dataset_config_names` 获取可用配置名称列表,随后依据训练阶段选择相应配置。例如,若需加载 `dpo_instruct` 配置下的全部样本,可直接调用 `load_dataset` 指定配置名;若需访问特定子集如 `smolrewrite`,则通过 `split` 参数精准定位。数据加载可采用流式模式以应对大规模处理需求,避免本地完全下载。对于 `SFT` 子集,每条样本包含 `messages` 字段,以对话形式呈现;对于 `DPO` 子集,则从 `chosen` 和 `rejected` 字段中提取偏好对,仅最后助手的回答不同,便于直接用于各类偏好优化算法。
背景与挑战
背景概述
Luciole-PostTraining-Dataset-1.1是由OpenLLM France项目联盟创建的大规模语言模型后训练数据集,项目受BPI France资助,隶属于法国2030计划。该数据集发布于2024年,主要研究机构包括IDRIS和GENCI,依托Jean Zay超级计算机完成数据处理与存储。其核心研究问题在于构建符合开放源代码要求和欧洲AI法规的、高质量的多语言语言模型后训练数据。通过整合来自Nemotron、Dolci、Smoltalk等多个开源数据源,数据集涵盖了监督微调(SFT)、思维链训练(SFT Thinking)以及偏好对齐(DPO)等关键后训练阶段,对推动欧洲多语言大语言模型的发展具有重要影响力。
当前挑战
该数据集面临的核心挑战在于解决语言模型后训练中的多重难题。在领域问题层面,需要构建同时支持指令遵循、数学推理、代码生成、安全对齐和检索增强生成等多样化能力的高质量训练数据,并实现思维链与非思维链数据的合理配置。在构建过程中,面临的主要挑战包括:1)多语言数据平衡——当前版本以英语为主,后续需要大幅提升法语等多语种数据比例;2)数据偏见消除——大量数据由第三方开源模型生成,易引入语言和文化偏见,需迭代清洗多语言语料;3)安全对齐困难——构建DPO偏好对时需确保标签一致性,该数据集采用Qwen3-32B与Qwen3-0.6B的增量学习方法生成响应对,并设置双重裁判模型达成共识,但安全数据本身可能含有毒性内容;4)区域语言变体区分不足,未来需关注更细致的语言地域多样性。
常用场景
经典使用场景
Luciole-PostTraining-Dataset-1.1 是一个专为大型语言模型(LLM)后训练阶段设计的高质量指令式文本数据集,其经典使用场景涵盖监督微调(SFT)与偏好对齐(如 DPO)两大核心环节。该数据集精心整合了来自多个开放来源的指令数据,并创新性地采用增量学习策略生成偏好对,即以 Qwen3-32B 的回复作为接受样本,以 Qwen3-0.6B 的回复作为拒绝样本,从而为模型提供清晰的优劣对比信号。其在训练中的典型用法是,研究者可分别加载 sft_instruct 配置用于基础指令遵循能力的培养,或加载 dpo_instruct 配置进行偏好优化,以提升模型生成回答的质量与安全性。这种双阶段训练范式使得该数据集成为构建高性能、对齐良好的语言模型的理想基石。
解决学术问题
该数据集旨在解决大语言模型后训练阶段中数据稀缺、来源单一以及跨语言与跨领域适应性不足等核心学术问题。在以往研究中,后训练数据的构建常依赖于昂贵的人工标注或闭源模型生成,既限制了数据规模,也带来了版权与可复现性隐患。Luciole-PostTraining-Dataset-1.1 通过全部采用开放许可的语料与开源模型生成的数据,严格遵循欧盟人工智能法案与开源要求,为学术界提供了一个完全透明、可审计的研究平台。其意义在于打破了后训练数据对大型科技公司的依赖,使独立研究团体能够基于同等质量的资源进行模型微调与偏好对齐实验,从而推动语言模型在多语言、多领域(如数学、代码、科学问答)场景下的泛化能力研究。此外,该数据集对安全对齐数据的精心筛选——通过多模型一致性判别——为探究模型安全性与行为偏好提供了可靠的数据基础。
衍生相关工作
Luciole-PostTraining-Dataset-1.1 的发布催生了多条重要的研究线索与衍生工作。其一,该数据集推动了“开放语言模型后训练”范式的标准化,其 delta 学习策略——利用大小模型间的差距生成偏好对——被后续工作广泛借鉴,成为合成偏好数据的经典方法。其二,该数据集为模型安全对齐领域提供了基准资源,数据中通过 Ministral-14B-Reasoning 与 Qwen3-14B 双模型一致性判别来确保 DPO 对的质量,这种多裁判协商机制被多篇安全微调论文采纳并改进。其三,该数据集中的 sft_thinking 配置(包含思考链痕迹的指令数据)引发了对“思维链蒸馏”的研究热潮,研究者利用此类数据训练小模型具备推理链生成能力,显著提升了零样本推理表现。此外,该数据集的开源性质促使 HuggingFace 社区涌现出大量基于该数据集的模型微调教程与竞赛,进一步加速了人工智能民主化的进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务