遇见数据集

2026-08-19-less-top10-difficult-advice-220-train

收藏
Hugging Face2026-08-25 更新2026-08-26 收录
官方服务:

资源简介:

该数据集是LESS(arXiv:2402.04333)数据选择实验的组成部分,具体为LESS ARM中基于score_max从difficult-advice池选出的前10%(220行)最高影响力样本。数据集用于训练基础模型Qwen3.6-27B,不包含其他数据,并与随机选择220行的控制数据集(LASR-Callum/2026-08-19-random-220-difficult-advice-control-train)配对,旨在隔离数据选择策略对训练效果的影响。数据格式为mixture.jsonl,每条记录包含messages字段(角色、内容、可选的推理内容)和source字段,其中助手回复包含真实的推理轨迹。数据集基于宪法claude_distilled_12_principles_mid生成,每条记录关联到其中一个特征,通过selection_ids.json可恢复特征ID。此外,提供了特征组成统计(trait_composition)和argmax子任务分布(stayed_ai、honest_declined、codebase_resisted)。生成配置包括种子0、最大序列长度8192、预算分词器为Qwen3.6-27B,选择方式为top-220 by score_max。数据集中有25行来自LESS热身分裂,其影响力部分为自我影响,已记录但未校正。该数据集仅包含互换消息,不包含原始池中的完整标签。

This dataset is part of the LESS (arXiv:2402.04333) data selection experiment, specifically the top 10% (220 rows) highest influence samples selected from the difficult-advice pool based on score_max in the LESS ARM setting. It is used to train the base model Qwen3.6-27B without additional data, paired with a control dataset (LASR-Callum/2026-08-19-random-220-difficult-advice-control-train) of 220 randomly selected rows to isolate the effect of the data selection strategy. The data format is mixture.jsonl, each record contains a messages field (role, content, optional reasoning content) and a source field, where assistant responses include real reasoning traces. The dataset is generated based on the constitution claude_distilled_12_principles_mid, with each record associated with one trait, and trait IDs can be recovered via selection_ids.json. It also provides trait composition statistics (trait_composition) and argmax subtask distributions (stayed_ai, honest_declined, codebase_resisted). Generation configuration includes seed 0, max sequence length 8192, budget tokenizer Qwen3.6-27B, and selection method top-220 by score_max. 25 rows come from the LESS warm-up split, where their influence is partially self-influence, recorded but not corrected. This dataset only contains interchanged messages, not the full labels from the original pool.

创建时间:
2026-08-19
原始信息汇总

数据集概述:LESS top-10% difficult-advice selection

基本信息

  • 数据集名称:LESS top-10% difficult-advice selection
  • 行数:220 行(取自 difficult-advice 池的 top 10%,按 score_max 排序)
  • 生成日期:2026-08-19
  • 配置:默认配置,数据文件为 mixture.jsonl

实验背景

该数据集是 LESS 数据选择实验(arXiv:2402.04333)的一部分,属于配对实验的“LESS 手臂”:

  • 实验目的:从 2,203 行的 difficult-advice 池中选出 220 行最高影响力数据(top 10%),用于 SFT 训练。
  • 配对设计:与 LASR-Callum/2026-08-19-random-220-difficult-advice-control-train(随机选择对照组)配对,两臂仅在选择的行上不同(tokenizer、预算、种子、打乱方式和训练配方完全相同),因此训练结果差异可归因于选择方法。
  • 训练方式:直接在基础模型 Qwen3.6-27B 上训练,不混入其他数据。
  • 区分说明:这是按原始 LESS 论文方式运行(对池排名、保留 top 分数段、仅用保留行训练),并非 2026-08-17 的 less-swap 版本(后者替换了 10,000 行混合数据中的 151 行)。

数据来源与生成

说明
宪法(constitution) claude_distilled_12_principles_mid/constitution.md,每行数据通过 metadata.trait_id 关联到对应特质
源仓库 teaching_claude_why_replication(GitHub),提交哈希 4078304ba62de85cca9e4c1d9347c4d88c95d52b
基础模型 Qwen/Qwen3.6-27B(本构建仅使用其 tokenizer 进行 token 预算和长度限制,未调用模型生成行)
影响力排名来源 来自 Qwen3.6-27B r64 alpha128 warmup LoRA(bf16,4 epochs,可训练参数 P=318,767,104),完整配置见排名仓库
排名数据 仓库 LASR-Callum/2026-08-14-less-selection-difficult-advice 中的 scores/scores.jsonl(修订版 f9c65d5921b43e00bdfdccf09829eb2d042ae2d6
数据池 matboz/synthdoc-v2-difficult-advice 中的 stage_7_sft.jsonl,共 2,203 行,按位置连接(less_id = <scenario_id>#<行索引>
与对照组的意外重叠 22 行

生成配置

json { "seed": 0, "max_seq_len": 8192, "budget_tokenizer": "Qwen/Qwen3.6-27B", "k": 220, "frac": 0.1, "selection": "top-220 by score_max", "ranking": { "repo": "LASR-Callum/2026-08-14-less-selection-difficult-advice", "file": "scores/scores.jsonl", "revision": "f9c65d5921b43e00bdfdccf09829eb2d042ae2d6" }, "pool": { "repo": "matboz/synthdoc-v2-difficult-advice", "file": "stage_7_sft.jsonl", "rows": 2203, "join": "positional: less_id = <scenario_id>#<row index>" }, "paired_with": "LASR-Callum/2026-08-19-random-220-difficult-advice-control-train", "incidental_overlap_with_the_other_arm": 22 }

数据模式(Schema)

  • mixture.jsonl:每行 JSON 包含 {messages: [{role, content, reasoning_content?}], source},模型无关的交换格式,训练时按训练家族对话模板渲染。每条 assistant 消息携带真实推理轨迹,因此训练配置可声明 thinking: true
  • mixture_stats.json:按来源统计的示例/token 数量。
  • selection_ids.json:被选中的 less_id 及其排名和影响力信息,包括 {less_id, rank, score_max, score_mean, per_subtask, trait_id, in_warmup}。注意 mixture.jsonl 已按 seed 0 打乱,不按 id 顺序排列

特质与子任务构成

  • 特质分布trait_composition):t3(74 行)、t6(79 行)占比最高,t9(32 行)次之,其余 t1/t2/t4/t5/t7/t8 各 2–9 行。
  • 子任务分布argmax_subtask):stayed_ai 199 行、honest_declined 19 行、codebase_resisted 2 行。

其他说明

  • Warmup 行包含:220 行中有 25 行属于 LESS warmup 拆分(随机期望约为 22 行)。这些行在评分前已被训练过,因此其影响力部分为自影响力,该情况已记录但未做修正。
  • 数据流出处:使用 select_topk.py --frac 0.10 --order score_max --seed 1 选择数据,随后通过 mix --config configs/data/mixture/qwen36_less_top10.yaml 混合,最后以 publish_selection.py 发布。
搜集汇总
数据集介绍
2026-08-19-less-top10-difficult-advice-220-train 数据集图片
构建方式
该数据集源自一项严谨的对照实验,旨在探究数据选择策略对模型训练效果的影响。其构建过程遵循LESS方法(arXiv:2402.04333)的核心思想,从包含2,203条困难建议的候选池中,依据影响力评分(score_max)筛选出排名前10%的220条样本。这些样本经由Qwen3.6-27B模型的LoRA warmup训练获得影响力排序,并最终以jsonl格式存储,包含对话消息、推理轨迹及来源信息。数据集的构建严格保证了除数据选择方式外,所有训练参数与另一随机对照组完全一致,从而确保后续比较的归因有效性。
使用方法
该数据集作为SFT训练文件,可直接用于基础模型的监督微调。使用时需注意,数据文件mixture.jsonl为随机打乱顺序(seed=0),并非按ID排列,而selection_ids.json文件则提供了每条数据的选择依据(包括排名、影响力分数及对应特质)。在训练配置中,需调用模型家族的聊天模板渲染对话,并建议开启thinking模式以充分利用推理轨迹。此外,该数据集应与其配对的随机对照组结合使用,通过对比训练结果的差异来评估LESS数据选择策略的实际效果。
背景与挑战
背景概述
该数据集由LASR-Callum团队于2026年8月19日创建,用于探究数据选择策略对指令微调模型性能的影响。作为LESS(低秩近似子空间选择)方法的一个实验臂,它从2,203条困难建议样本中选取得分最高的220条(前10%),构成精简且高影响力的训练集。其核心研究问题在于验证基于影响力排序的数据筛选能否在保持数据预算的前提下,有效提升模型对齐质量。该数据集与随机对照组(random-220)形成严格对照,仅数据选择方式不同,从而为归因分析提供可靠基础。此研究遵循LESS论文(arXiv:2402.04333)的经典框架,为数据高效训练领域提供了实证依据,对后续数据选择策略的优化具有重要参考价值。
当前挑战
该数据集所解决的领域问题在于,大规模指令微调往往依赖海量数据,导致计算资源消耗巨大且数据冗余,而如何精准识别高价值样本成为提升训练效率的关键。构建过程中面临的挑战包括:第一,进行影响力排序时需训练LoRA暖启动模型,涉及数亿参数的优化,计算开销高昂;第二,数据来源依赖合成数据生成(synthdoc-v2-difficult-advice),需确保生成样本多样性与难度分级的一致性;第三,与随机对照组的意外重叠(22行)可能引入混杂因素,需在分析中予以记录和调整;第四,暖启动行(25/220)的自身影响力干扰,需在后续模型中考虑其偏差效应。这些挑战共同考验了数据选择方法的鲁棒性和实验设计的严谨性。
常用场景
经典使用场景
该数据集是LESS数据选择范式的经典产物,聚焦于从大规模合成对话池中筛选高影响力样本。其典型使用场景为训练数据裁剪:研究者基于模型在预热阶段的学习轨迹,利用梯度匹配计算每个样本对验证集性能的影响分数(score_max),随后按分数降序选取前10%的样本构成精简训练集。此流程严格遵循LESS论文(arXiv:2402.04333)的标准操作,即独立使用所选子集训练模型,以评估数据质量对下游任务表现的影响。该数据集本身即为一个完整的实验单元,可直接用于复现LESS方法在困难建议生成任务上的效果,亦作为对比基线,与随机采样的对照组配对,以验证选择性训练数据的优势。
解决学术问题
该数据集直面大语言模型微调中的数据冗余与噪声问题。在合成数据规模爆发式增长的背景下,如何从海量样本中识别出对目标能力提升最具价值的子集,成为高效训练的瓶颈。LESS方法通过影响函数近似,将数据选择转化为可计算的优化目标,从而解决了传统随机采样导致的训练效率低下和性能不稳定问题。该数据集作为该方法的实证载体,其构建过程严格对齐学术规范,包括固定随机种子、预算分配和训练配方,确保实验的可归因性。其意义在于为数据选择研究提供了一个标准化、可复现的评测基准,推动了从“数据数量”向“数据质量”转变的研究范式。
实际应用
在实际应用中,该数据集的核心价值在于降低大模型领域适配的成本。通过仅使用220条精心挑选的样本进行指令微调,即可达到甚至超越使用全部2203条样本的效果,显著减少了计算资源与时间消耗。这种高效的数据利用模式特别适用于资源受限的研发团队或需要快速迭代的场景,如垂直领域对话系统的定制。此外,该数据集所体现的数据选择策略可无缝集成至商业化的数据流水线中,用于自动清洗低质量样本,优化云端训练任务。其配对对照设计也便于工程团队在生产环境中验证数据策略的边际收益,从而做出更明智的数据采购与处理决策。
数据集最近研究
最新研究方向
该数据集聚焦于大语言模型监督微调中的高效数据选择策略,其核心在于通过LESS(低冗余子集选择)方法,从高质量但冗余的合成数据池中筛选出最具影响力的训练样本,以优化模型对齐效果。数据集严格遵循LESS论文(arXiv:2402.04333)的实验范式,通过控制变量法设计配对实验,仅改变所选220条数据,确保性能差异可归因于数据选择本身。当前前沿方向包括:利用影响函数对数据影响力进行量化排序,结合宪法式AI原则(如Claude蒸馏的12条原则)生成合成数据,并探索不同采样策略(如按score_max或score_mean)对模型行为的影响。此外,该数据集涉及长思维链(CoT)训练,包含真实推理轨迹,支持thinking模式,对于提升模型在困难咨询场景下的推理能力和诚实拒绝行为具有潜在意义。通过公开数据集与配套代码库,该研究促进了可复现的、基于数据驱动的大模型对齐研究,并为后续在数据高效微调、可解释性分析以及多任务泛化等领域提供了基准数据资源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务