遇见数据集

Luciole-PostTraining-Dataset-1.1

收藏
Hugging Face2026-07-21 更新2026-07-22 收录
官方服务:

资源简介:

Luciole-PostTraining-Dataset-1.1 是一个精心策划的开源指令式文本数据集,专为语言模型的后训练阶段设计,旨在促进符合开源要求和欧洲人工智能开发及知识产权法律的大型语言模型训练。数据集包含混合的合成与非合成指令数据,主要用于监督微调(SFT)以及为偏好对齐(例如DPO)设计的响应对。数据以英语为主,包含少量多语言内容,并计划在未来版本中增加多语言(尤其是法语)数据的比例。数据集由四个主要子集构成:sft_instruct(不含思维痕迹的指令数据)、sft_thinking(包含思维痕迹的指令数据)、dpo_instruct(不含思维痕迹的接受与拒绝响应对)以及即将推出的dpo_thinking(包含思维痕迹的接受与拒绝响应对)。每个子集进一步细分为多个具体的数据源(或称为“拆分”),例如来自dolci_flan、nemotron_code、nemotron_instruction_following_chat_v1、pleias_rag、smolrewrite等来源的数据。数据规模庞大,例如sft_instruct子集中的nemotron_instruction_following_chat_v1拆分包含218,343个样本,sft_thinking子集中的nemotron_posttrain_v3_math拆分包含1,251,769个样本。在数据生成方面,DPO对齐对是使用Qwen3-32B和Qwen3-0.6B模型通过delta学习方法合成生成的,其中Qwen3-32B的响应被标记为“接受”的响应。安全对齐数据则混合使用了Qwen3-14B、Ministral-3-14B-Instruct以及一个Luciole-8B-Instruct的中间检查点模型生成,并且每个响应对都经过Ministral-14B-Reasoning和Qwen3-14B双重模型的判断,仅在两模型标注一致时才被纳入数据集。数据格式遵循标准结构:SFT子集中的每个样本包含一个messages字段,该字段是一个列表,其中每个元素包含content(字符串)和role(字符串)键,遵循HuggingFace聊天格式。DPO子集中的每个样本则包含chosen和rejected两个字段,每个字段同样是上述格式的对话列表,其内容除最后的assistant回合外完全相同。该数据集由OpenLLM France联盟在法国BPI France资助的France 2030项目下创建,数据在GENCI的Jean Zay超级计算机上处理存储。数据集采用CC BY-SA 4.0许可证发布。需要注意的是,由于数据主要使用第三方开源权重模型生成,可能引入不必要的语言和文化偏见;安全对齐数据因其教学性质可能包含有害内容;且当前版本未区分同一语言的不同变体(如美式英语和英式英语)。

Luciole-PostTraining-Dataset-1.1 is a meticulously curated open-source instructional text dataset designed for the post-training phase of language models. It aims to facilitate the training of large language models that comply with open-source requirements and European AI development and intellectual property laws. The dataset contains a mix of synthetic and non-synthetic instructional data, primarily used for supervised fine-tuning (SFT) and response pairs designed for preference alignment (e.g., DPO). The data is predominantly in English, with a small amount of multilingual content, and plans to increase the proportion of multilingual data (especially French) in future versions. The dataset consists of four main subsets: sft_instruct (instructional data without thinking traces), sft_thinking (instructional data with thinking traces), dpo_instruct (accepted and rejected response pairs without thinking traces), and the upcoming dpo_thinking (accepted and rejected response pairs with thinking traces). Each subset is further divided into multiple specific data sources (or splits), such as data from dolci_flan, nemotron_code, nemotron_instruction_following_chat_v1, pleias_rag, smolrewrite, etc. The dataset is large in scale; for example, the nemotron_instruction_following_chat_v1 split in the sft_instruct subset contains 218,343 samples, and the nemotron_posttrain_v3_math split in the sft_thinking subset contains 1,251,769 samples. In terms of data generation, DPO alignment pairs are synthetically generated using the Qwen3-32B and Qwen3-0.6B models via delta learning methods, with responses from Qwen3-32B labeled as accepted responses. Safety alignment data is generated using a mix of Qwen3-14B, Ministral-3-14B-Instruct, and an intermediate checkpoint of the Luciole-8B-Instruct model, and each response pair is judged by both Ministral-14B-Reasoning and Qwen3-14B models, only being included in the dataset if both models agree. The data format follows a standard structure: each sample in the SFT subsets contains a messages field, which is a list where each element has content (string) and role (string) keys, adhering to the HuggingFace chat format. Each sample in the DPO subsets contains chosen and rejected fields, each being a dialogue list in the same format, with identical content except for the final assistant turn. The dataset was created by the OpenLLM France consortium under the France 2030 project funded by BPI France, with data processed and stored on the GENCI Jean Zay supercomputer. It is released under the CC BY-SA 4.0 license. Note that since the data is primarily generated using third-party open-source weight models, it may introduce unnecessary linguistic and cultural biases; safety alignment data may contain harmful content due to its instructional nature; and the current version does not distinguish between variants of the same language (e.g., American and British English).

创建时间:
2026-07-08
原始信息汇总

数据集概述

Luciole-PostTraining-Dataset-1.1 是一个专用于语言模型后训练的指令式文本数据集,涵盖了监督微调(SFT)和偏好对齐(如DPO)所需的数据。

基本信息

  • 许可证:CC BY-SA 4.0
  • 创建者:OpenLLM France 项目联盟,由 BPI France 资助,作为 France 2030 计划的一部分。
  • 数据存储与处理:在 GENCI 的 Jean Zay 超算上完成,由 IDRIS 管理。
  • 代码仓库:Luciole-Training (https://github.com/OpenLLM-France/Luciole-Training/tree/main/data)

数据特点与用途

  • 内容:混合了合成与非合成的指令数据,以及用于偏好对齐的响应配对。
  • 语言:以英语为主,包含少量多语言数据,未来版本将增加多语言(特别是法语)数据。
  • 对齐对生成:除安全对齐数据外,均使用 Qwen3-32B 和 Qwen3-0.6B 以 delta 学习方法合成,前者作为接受回答。安全数据使用 Qwen3-14B、Ministral-3-14B-Instruct 和 Luciole-8B-Instruct(SFT后中间检查点)生成,并由 Ministral-14B-Reasoning 和 Qwen3-14B 共同判定标签,仅当两者一致时样本被收录。
  • 数据预处理:移除了包含特定模型名、公司名、中文和俄文的样本。预处理脚本见代码仓库中的 processing/posttraining 文件夹。

偏见、风险与局限性

  • 大部分数据由第三方开放权重模型生成,可能引入非预期的语言和文化偏见。
  • 安全对齐配对可能包含有毒或危险内容。
  • 数据未区分同一语言的不同变体(如美式英语和英式英语)。

数据集结构

数据集包含四个子集,当前版本提供其中三个。

子集名称 描述 状态
sft_instruct 无思考轨迹的指令数据 已提供
sft_thinking 带有思考轨迹的指令数据 已提供
dpo_instruct 无思考轨迹的接受/拒绝响应配对 已提供
dpo_thinking 带有思考轨迹的接受/拒绝响应配对 即将推出

数据特征

  • SFT 子集 (sft_instruct, sft_thinking):包含 messages 字段,采用 HuggingFace 聊天格式。
  • DPO 子集 (dpo_instruct):包含 chosenrejected 字段,每个字段均为对话格式,仅最后一条 assistant 回复不同。

数据划分与规模

数据按配置(config)和拆分(split)组织,每个拆分有独立的样本量和字节数。

dpo_instruct 配置的拆分

拆分名称 样本数 字节数
dolci_flan 30,009 93,470,441
dolci_instruct_dpo_persona_precise_if 4,102 11,675,333
dolci_instruct_dpo_precise_if 14,224 56,594,779
dolci_python_algorithms 184,361 787,968,960
dolci_sciriff 4,247 43,425,434
nemotron_code 30,054 244,686,471
nemotron_instruction_following_chat_v1 70,032 1,601,478,867
nemotron_math 21,098 108,803,362
nemotron_safety 24,085 100,125,061
nemotron_stem 65,738 341,469,602
pleias_rag 7,891 201,478,603
smol_instruct_rewrite 1,787 2,208,387
smolrewrite 3,016 10,017,564
smolsummarize 5,949 26,356,924
when2call 9,000 36,565,517
xlam 51,632 224,893,643

sft_instruct 配置的拆分

拆分名称 样本数 字节数
dolci_flan 3,472 107,784,210
dolci_logic_puzzles 83,472 107,784,210
dolci_instruct_precise_if 126,271 263,950,453
dolci_python_algorithms 186,038 296,864,669
dolci_sciriff 4,460 22,228,226
nemotron_code 173,047 950,381,906
nemotron_instruction_following_chat_v1 218,343 2,922,631,310
nemotron_math_v2 239,362 484,546,923
nemotron_posttraining_v2_math_french 1,000 15,678,092
nemotron_stem 348,608 761,734,450
pleias_rag 796,582 12,851,037,010
paradocs 70,000 63,732,438
smol_instruct_rewrite 13,000 5,381,064
smolrewrite 15,000 24,776,697
smolsummarize 35,000 80,854,929
when2call 7,437 15,722,853
xlam 60,000 116,359,989
context_qa_hotpot 74,393 474,609,683
context_qa_tat 7,195 26,401,532
croissant_aligned_instruct 12,129 4,144,675
hardcoded_en 1,108 200,770
hardcoded_fr 962 215,218
hermes 1,893 16,907,558
linagora_personas_math 16,448 44,022,031

sft_thinking 配置的拆分

拆分名称 样本数 字节数
dolci_think_sft_persona_precise_if 216,083 1,274,545,838
dolci_think_sft_precise_if 118,644 1,387,191,105
nemotron_agentic_toolcalling 293,291 6,598,244,005
nemotron_instruction_following_chat_v1 216,083 1,274,545,838
nemotron_posttrain_v3_math 1,251,769 4,886,080,343
nemotron_posttraining_v2_math_french 80,000 1,262,603,542
nemotron_science_v1_mcq 173,276 1,724,960,038
nemotron_code 110,796 5,413,208,846
pleias_rag 796,582 12,812,113,147
opencodereasoning 477,868 16,683,924,673
smoltalk_smolagents_toolcalling 9,079 207,000,591
synthetic_2_SFT_verified 103,254 2,593,211,389

数据来源

数据来源于多个开放数据集,按类别划分。部分数据集在训练中仅使用了随机子样本,权重(以青色显示)表示使用比例。所有数据集默认使用英语,特殊情况以紫色标注。

  • 聊天/指令跟随(Chat/IF):包含 Nemotron-Instruction-Following-Chat-v1、Dolci-Think-SFT(多个变体)、Dolci-Instruct-SFT、Dolci-Instruct-DPO、smoltalk 系列(smol-instruct-rewrite、smolrewrite、smolsummarize)等。
  • 数学(Math):包含 Nemotron-Post-training-v3 low no tools、SYNTHETIC-2-SFT-Verified、Nemotron-Post-Training-Dataset-v2 及其多语言版本等。
搜集汇总
数据集介绍
Luciole-PostTraining-Dataset-1.1 数据集图片
构建方式
该数据集通过汇集多种来源的开放指令数据构建而成,涵盖监督微调与偏好对齐两种训练阶段。对于偏好对齐数据,采用了一种新颖的增量学习方法:所有响应对均由Qwen3-32B和Qwen3-0.6B模型生成,前者作为优选回答,后者作为拒绝回答。安全对齐数据则混合了Qwen3-14B、Ministral-3-14B-Instruct以及Luciole-8B-Instruct的中间检查点,并由Ministral-14B-Reasoning与Qwen3-14B共同评判,仅保留两者标签一致的样本。数据集以JSONL格式存储,分为sft_instruct、sft_thinking与dpo_instruct三个配置,每个配置下包含多个数据子集,如nemotron_code、pleias_rag等,覆盖了对话、数学、代码、科学、重写与摘要等多种任务类型。
特点
该数据集最显著的特点在于其多阶段、多任务的精心设计。它同时提供了适合监督微调的指令数据与用于偏好对齐的DPO数据,且后者在大部分子集中采用了增量对比的合成方式,保证了优选与拒绝回答之间的语义差异性。数据集规模庞大,sft_thinking配置中的opencodereasoning子集包含近48万样本,而pleias_rag子集更达80万样本,为模型提供了丰富的思维链训练材料。此外,数据集虽以英文为主,但已包含一定量的多语言数据(如法语数学题),并计划在后续版本中增加更多语种。每个样本均遵循HuggingFace对话格式,便于与主流训练框架无缝对接。
使用方法
用户可通过HuggingFace Datasets库便捷加载该数据集。使用load_dataset函数时,需指定数据集名称与配置名,例如加载dpo_instruct配置下的smolrewrite子集可写为:dataset = load_dataset('OpenLLM-France/Luciole-PostTraining-Dataset-1.1', 'dpo_instruct', split='smolrewrite')。SFT配置下的每个样本包含一个'messages'字段,格式为多轮对话列表;而DPO配置则包含'chosen'与'rejected'字段,两者仅在最后一轮助手的回答上存在差异。这种统一的结构化设计,使得该数据集能够直接被用于Transformer库中的SFTTrainer或DPOTrainer等训练器,无需额外转换。
背景与挑战
背景概述
Luciole-PostTraining-Dataset-1.1是由法国OpenLLM France联盟在BPI France资助的法国2030计划框架下创建的一个面向大语言模型后训练阶段的开源指令数据集,其数据处理与存储依托于GENCI的Jean Zay超级计算机。该数据集的核心研究问题在于构建一个严格遵循开源许可与欧洲AI法规的多语言后训练语料库,尤其侧重于法语语境的覆盖。通过融合合成与非合成指令、偏好对齐对等多种数据形式,该数据集旨在推动多语言大模型在监督微调与偏好优化方面的研究,为欧洲本土语言模型的发展提供基础资源。作为更大规模开放多语言后训练项目的第一步,该数据集的发布填补了高质量、合规多语言后训练语料稀缺的空白,对提升模型在多语言场景下的指令跟随能力与安全性具有重要的学术与应用价值。
当前挑战
该数据集所面临的挑战首先体现在领域问题层面:大语言模型后训练阶段亟需覆盖广泛语言和文化的指令数据,以克服当前模型偏重英语及其他主流语言的局限性,然而构建包含法语及其他欧洲语言的高质量多语种后训练语料库难度极大。在构建过程中,数据集制备团队遭遇了多重技术挑战:大量数据源自第三方向量模型(如Qwen与DeepSeek),这些模型易引入不期望的语言与文化偏差,尤其是中文和俄语文本的混入,团队必须通过预处理脚本进行严格的语种过滤与清洗;安全对齐数据的生成需依赖多个模型联合判断标签一致性以确保数据可靠性,但此类数据本身可能含有毒性内容,给后续模型安全训练带来隐患;此外,数据集中未对同一语言的不同地区变体加以区分,限制了其在区域语言多样性研究中的应用潜力。
常用场景
经典使用场景
Luciole-PostTraining-Dataset-1.1的核心价值在于为语言模型的后训练阶段提供系统化的训练数据支撑。该数据集精心整合了监督微调(SFT)所需的指令数据与偏好对齐所需的成对响应数据,覆盖从基础指令遵循到复杂推理链条的多元场景。其经典使用方式包括:利用sft_instruct子集进行模型的基础能力调优,使模型习得高质量的指令响应能力;依托sft_thinking子集引导模型生成带有明确推演链条的回答,增强其在数学推理、逻辑解谜等领域的表现力;借助dpo_instruct子集实施直接偏好优化,通过对比优选与拒斥响应,提升模型对齐人类偏好的精准度。这种分阶段、分功能的配置设计,令研究者能够灵活开展从行为塑造到价值校准的全链条训练实验。
实际应用
在实际应用维度,Luciole-PostTraining-Dataset-1.1的构筑目标直指工业级开源模型的落地部署。该数据集已被用于Luciole-8B-Instruct系列模型的训练调优,验证了其在代码生成、数学解题、指令遵循等关键场景下的效能。基于其丰富的DPO偏好对,应用开发者能够迭代优化对话助手的交互质量,缓解模型输出中的偏见与有害性。数据集对RAG检索增强生成、工具调用、文稿改写与文本摘要等实用任务的专项覆盖,使其特别适合金融客服、教育辅导、内容创作等需要高精度回复与可控输出的行业场景,推动了大模型从实验室原型向生产环境应用的平顺迁移。
衍生相关工作
该数据集的发布催生了一系列衍生研究与实践成果。作为OpenLLM France项目的核心组件,其与Luciole-Training代码仓库形成了紧密的协同生态,产出了从数据预处理脚本到模型训练管线的完整工具链。数据集中采用的delta偏好数据合成策略,启发了后续工作在低资源场景下利用弱标签模型增强对齐效率的探索。安全对齐子集的构建流程,为欧洲AI法规合规性评估提供了可量化的评测基准。此外,数据集对法语等非英语语种的侧重,推动了独立于英语中心的指令微调研究,催生了针对法语大模型的专项优化方法,并成为BLOOM等开源多语言模型家族后续能力增强的重要数据来源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务