遇见数据集

2026-08-19-random-220-difficult-advice-control-train

收藏
Hugging Face2026-08-25 更新2026-08-26 收录
官方服务:

资源简介:

该数据集是LESS数据选择实验中的控制臂,用于与基于LESS打分选择的top10%实验臂进行对比。数据集包含220行样本,从包含2203行的困难建议池(synthdoc-v2-difficult-advice)中随机均匀抽取(种子1)。这些样本作为SFT训练数据,用于训练基础模型Qwen3.6-27B,不包含其他数据。数据集格式为mixture.jsonl,每条记录包含messages字段(包括角色、内容和可选的推理内容)以及source字段。所有样本的助手回复均包含真实的推理轨迹,因此训练配置可启用thinking模式。数据集还提供了选择ID、特征组成(trait_composition)和argmax子任务分布等元数据。该数据集生成于2026-08-19,使用Qwen3.6-27B分词器,但行本身由另一仓库生成。该数据集的适用任务为SFT训练,特别是用于评估数据选择策略对模型性能的影响。

This dataset is the control arm in the LESS data selection experiment, used to compare with the top 10% experimental arm selected based on LESS scores. The dataset contains 220 rows of samples, randomly uniformly sampled (seed 1) from a difficult advice pool (synthdoc-v2-difficult-advice) containing 2203 rows. These samples serve as SFT training data to train the base model Qwen3.6-27B, without including other data. The dataset format is mixture.jsonl, with each record containing a messages field (including role, content, and optional reasoning content) and a source field. All samples assistant responses contain real reasoning trajectories, so the training configuration can enable thinking mode. The dataset also provides metadata such as selection ID, trait composition, and argmax subtask distribution. The dataset was generated on 2026-08-19, using the Qwen3.6-27B tokenizer, but the rows themselves were generated by another repository. The applicable task of this dataset is SFT training, especially for evaluating the impact of data selection strategies on model performance.

创建时间:
2026-08-19
原始信息汇总

数据集概述

该数据集是 LASR-Callum/2026-08-19-random-220-difficult-advice-control-train,属于一个配对LESS数据选择实验中的 对照组,用于与LESS top-10% 选择臂进行对比。

数据集用途与实验设计

  • 该数据集是THE CONTROL ARM(对照组),与 LASR-Callum/2026-08-19-less-top10-difficult-advice-220-train 配对。
  • 从同一个包含2,203行的困难建议池中,以均匀随机方式(种子1)抽取220行。
  • 两臂仅在选取的220行上存在差异,tokenizer、预算、种子、洗牌方式和训练配方完全一致,因此训练结果差异可归因于数据选择方法。
  • 实验遵循LESS方法(arXiv:2402.04333)的标准流程:对池排序、保留top分数部分、仅用保留行训练。

核心字段信息

字段 内容
生成日期 2026-08-19
宪法文件 constitutions/claude_distilled_12_principles_mid/constitution.md,评分池由该宪法生成,每行通过 metadata.trait_id 追踪到对应特征
来源仓库 https://github.com/Matthew-Bozoukov/teaching_claude_why_replication.git @ commit 4078304ba62de85cca9e4c1d9347c4d88c95d52b
使用模型 Qwen/Qwen3.6-27B,本构建中仅使用其tokenizer(用于token预算和长度上限),未调用模型生成行
影响排序模型 Qwen3.6-27B r64 alpha128 warmup LoRA(bf16,4 epochs,可训练参数318,767,104)

生成配置

  • 种子:0
  • 最大序列长度:8192
  • 预算tokenizer:Qwen/Qwen3.6-27B
  • 选择数量:k=220
  • 选择比例:frac=0.1
  • 选择方式:均匀随机,种子1
  • 评分文件:LASR-Callum/2026-08-14-less-selection-difficult-advice 仓库中的 scores/scores.jsonl(revision f9c65d...
  • 数据池:matboz/synthdoc-v2-difficult-advicestage_7_sft.jsonl,共2,203行
  • 配对数据集:LASR-Callum/2026-08-19-less-top10-difficult-advice-220-train
  • 与另一臂的偶然重叠:22行

数据模式与文件

  • 主文件为 mixture.jsonl,每行格式为 {messages: [{role, content, reasoning_content?}], source}
  • 助手轮次包含真实推理轨迹,因此训练时可声明 thinking: true
  • 附带文件:
    • mixture_stats.json:按来源统计的示例数/token数
    • selection_ids.json:被选中的 less_id,含排名和影响分数(rank、score_max、score_mean、per_subtask、trait_id、in_warmup)
  • less_id 格式为 <scenario_id>#<池文件行索引>,可通过索引恢复池中原始行。
  • 注意:mixture.jsonl 已用种子0洗牌,不按id顺序排列

来源与流程

uv run python scratch/less/select_topk.py --frac 0.10 --order score_max --seed 1 && uv run mix --config configs/data/mixture/qwen36_less_random220.yaml && uv run python scratch/less/publish_selection.py

特征构成与子任务分布

特征ID 行数
t1 30
t2 19
t3 19
t4 30
t5 21
t6 22
t7 23
t8 24
t9 32
子任务 行数
stayed_ai 137
honest_declined 59
codebase_resisted 24

关于warmup行的说明

  • 220行中有23行属于LESS warmup分割(随机预期约22行)。
  • Warmup行在评分前已被训练过,因此其影响分数部分为自影响,已记录但未修正。
搜集汇总
数据集介绍
2026-08-19-random-220-difficult-advice-control-train 数据集图片
构建方式
该数据集作为LESS数据选择实验的对照臂,从包含2203条困难建议的语料池中,以固定随机种子1均匀抽取220条样本构建而成。实验设计遵循arXiv:2402.04333中的LESS方法,配对实验臂仅在选择的行集上存在差异,其余训练配置(分词器、预算、随机种子、洗牌及训练方案)完全一致,从而确保任何训练效果的差异均可归因于数据选择策略。构建过程未调用模型生成新内容,仅依赖已有合成数据及基于Qwen3.6-27B warmup LoRA的影响力排名,最终以mixture.jsonl格式存储,并附带选择ID、特征组成及统计信息。
特点
该数据集的核心特征在于其严格的对照设计,与LESS top-10%臂形成配对,支持因果归因。数据行包含完整的推理轨迹,保存于assistant轮次,并支持思考模式训练。此外,数据集通过selection_ids.json保留了每行对应的LESS排名、影响力分数及trait_id,便于追溯原始池中的特征来源。其组成覆盖9种特质,且在argmax子任务中分布各异,其中137条属于stayed_ai,59条属于honest_declined,24条属于codebase_resisted,体现了多样化的困难场景。随机抽样臂还包含23条warmup数据行(略高于期望的22条),其影响已记录但未校正。
使用方法
使用该数据集时,应直接加载mixture.jsonl文件,其中每条记录为符合模型无关的interchange格式,包含messages字段及可选的reasoning_content。训练时需通过模型配置文件指定的聊天模板渲染数据,并启用思考模式以利用推理痕迹。建议与配对的LESS top-10%臂进行对比实验,以评估随机选择与基于影响力选择的差异。用户可通过selection_ids.json中的less_id(格式为<scenario_id>#<row index>)定位原始池中的对应行,进而分析数据特性。此外,数据集已按seed 0洗牌,使用时无需再次打乱,但应注意warmup数据的影响记录。
背景与挑战
背景概述
本数据集诞生于2026年8月,由LASR-Callum团队为探究LESS数据选择方法在困难建议生成任务中的有效性而构建,作为配对实验中的随机对照臂。其核心研究问题在于,当训练数据从同一2203行困难建议池中均匀随机抽取220行时,与基于LESS得分选取的优选集相比,模型行为差异是否可归因于选择策略。该数据集针对Qwen3.6-27B基座模型,采用统一的标记器与训练配置,仅变更数据选取方式,确保了实验的对照严谨性。其影响力体现在为数据选择策略提供了高保真的因果检验基准,推动了训练数据优化研究的方法论进步。
当前挑战
该数据集面临的挑战涵盖领域与构建两方面。领域层面,困难建议生成需模型权衡真实性与安全性,尤其在‘诚实拒绝’与‘坚持AI立场’等子任务上,随机选择的220行可能难以覆盖足够的边界案例,导致模型在应对复杂伦理困境时鲁棒性不足。构建层面,行文虽仅含交换消息,但需藉由selection_ids.json回溯构成特质,且随机臂与LESSTOP10臂存在22行意外重叠,可能削弱对比效度;同时,23行暖启动数据混入,引入部分自影响偏差,这些细节要求下游用户谨慎解读实验结果,严密控制混淆变量。
常用场景
经典使用场景
该数据集作为LESS数据选择框架中的随机对照臂,与基于影响力排序的顶10%选择臂形成严格配对,用于在SFT训练中量化数据选择策略的因果效应。其经典使用场景是作为基准对照组,在相同预算、种子、分词器和训练流程下,仅改变所选数据行,通过对比训练后模型在下游任务上的表现差异,验证LESS方法的数据筛选优越性。研究者常利用其220行的随机抽样特性,评估在有限数据预算下,随机选择与影响力导向选择的性能鸿沟,从而揭示数据质量对模型对齐效果的关键作用。
实际应用
在实际应用中,此数据集适用于低资源场景下的模型微调,如特定领域对话系统的快速定制、小型团队在有限算力下的大模型适配。其随机采样特性使它能作为数据管线中的安全默认选项,尤其在缺乏明确数据质量评估手段时,提供一个稳健的基线。此外,该数据集的详细元数据(如trait_id、子任务分布)支持对模型行为进行细粒度分析,可用于调试模型在对抗性提示、诚实拒绝等场景下的响应,从而优化生产环境中的模型安全策略。
衍生相关工作
基于该数据集,衍生工作主要围绕LESS方法论的扩展与对比研究展开。一方面,后续研究将其与不同的数据选择算法(如多样性采样、基于难度的筛选)结合,构建多臂比较实验,深化对数据影响力计算的理解。另一方面,该数据的配对设计被借鉴于更广泛的SFT数据治理工作,如自动构建定制化训练集、评估数据构成对模型泛化的影响。此外,其开放的选取ID与影响分数促进了可复现性研究,推动了开源社区中关于数据选择标准与训练动态的实证分析。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务