遇见数据集

2026-08-17-table2-9284-synthdoc-716-less-swap-bests-for-traits

收藏
Hugging Face2026-08-25 更新2026-08-26 收录
官方服务:

资源简介:

本数据集是LASR-Callum/2026-08-06-table2-9284-synthdoc-716-train混合数据集的改良版本。原始混合数据集包含9,284条Table-2行和716条困难建议行(均匀分布在9个特征上)。通过LESS方法,识别出对目标行为影响最大的三个特征(t6, t3, t9),并将这三个特征中原本随机采样的困难建议行替换为各自特征下影响力最高的行。替换规则:t6依据stayed_ai(51/79替换,提升1.36倍),t3依据honest_declined(47/80替换,提升1.38倍),t9依据score_mean(53/79替换,提升1.49倍)。共151行(总10,000行)被替换,其余部分与源数据集字节一致。数据集的模式和字段与源混合数据集相同:包含text(使用Qwen3.6聊天模板渲染)和source(数据集名称)字段。生成配置为确定性选择(无采样),基于LESS影响力分数。该数据集用于训练语言模型,特别是针对困难建议场景下的行为优化。

This dataset is an improved version of the LASR-Callum/2026-08-06-table2-9284-synthdoc-716-train mixed dataset. The original mixed dataset contains 9,284 Table-2 rows and 716 hard-advice rows (evenly distributed across 9 features). Using the LESS method, three features (t6, t3, t9) that most influence the target behavior are identified, and the originally randomly sampled hard-advice rows in these three features are replaced with the most influential rows under each feature. Replacement rules: t6 based on stayed_ai (51/79 replaced, 1.36x improvement), t3 based on honest_declined (47/80 replaced, 1.38x improvement), t9 based on score_mean (53/79 replaced, 1.49x improvement). A total of 151 rows (out of 10,000 total) are replaced, while the rest are byte-identical to the source dataset. The schema and fields of the dataset are the same as the source mixed dataset: contains text (rendered using Qwen3.6 chat template) and source (dataset name) fields. The generation configuration is deterministic selection (no sampling) based on LESS influence scores. This dataset is used for training language models, particularly for behavior optimization in hard-advice scenarios.

创建时间:
2026-08-17
原始信息汇总

数据集概述

该数据集名为 2026-08-17-table2-9284-synthdoc-716-less-swap-bests-for-traits,是一个用于训练目的的混合数据集,生成于2026年8月17日,属于最终阶段(final)的训练数据。

核心变更与目的

该数据集源自 LASR-Callum/2026-08-06-table2-9284-synthdoc-716-train 混合数据集,但针对LESS(一种数据选择方法)影响力排名最高的三个特质进行了定向修改:将原本在三个特质中随机采样的困难建议(difficult-advice)数据行,替换为同一候选池中对应特质影响力最高的数据行。总计10,000行中,有151行与此不同,其余9,284行Table-2数据和另外六个特质的478行困难建议数据与源数据集完全一致(字节级相同)。

具体修改规则

特质 排名规则 总行数 保留行数 替换行数 选中影响力均值 特质均值 提升倍数
t6 stayed_ai 79 28 51 1.494e-05 1.095e-05 1.36x
t3 honest_declined 80 33 47 1.143e-05 8.256e-06 1.38x
t9 score_mean 79 26 53 9.473e-06 6.368e-06 1.49x

特质选择规则的理由

  • 每个LESS验证子任务与特定特质强相关:stayed_ai对应t6,honest_declined对应t3,codebase_resisted对应t7。因此t6和t3按其对应的子任务进行排名。
  • t9没有专属子任务,因此按三个子任务的影响力均值进行排名。
  • t3是特殊情况:其自身最高评分的子任务是stayed_ai,但这是评分尺度造成的伪影(stayed_ai对所有特质都有较大数值)。排名时使用honest_declined,因为它是t3在控制尺度后独有的子任务。

关键设计保证

  • 每行只属于一个特质,候选集互不重叠,构建时已断言确保任何行不会被选中两次。
  • 各特质行数(79/80/79)与源混合数据集完全一致,确保结果仍严格为10,000行,且各来源和特质组成不变。

数据生成配置

  • 采样方式:无随机采样,行通过LESS影响力评分确定性选择,并使用Qwen3.6对话模板重新渲染,已验证与源混合物中已有行字节级一致。
  • 模型:困难建议生成使用anthropic/claude-haiku-4.5anthropic/claude-sonnet-5;规范过滤使用openai/gpt-5.6-terra;影响力排名使用Qwen3.6-27B r64 warmup LoRA,详细排名见排名数据集。
  • 生成规则:基于constitutions/claude_distilled_12_principles_mid/constitution.md中的9项原则,与源混合物困难建议部分的生成原则一致。

数据格式与内容

  • 模式mixture_think.jsonl,包含text(Qwen3.6对话模板渲染文本)和source(数据集名称)两个字段,与源混合物模式完全一致。mixture_stats.json额外添加了swap块,记录每个特质的替换规则、计数和提升倍数。
  • 来源仓库:https://github.com/Matthew-Bozoukov/teaching_claude_why_replication.git(提交哈希:55c1e81efc568c82980488e8614e9047a982bd2a)
  • 处理脚本uv run python scratch/less/swap_mixture.py,排名数据源自LASR-Callum/2026-08-14-less-selection-difficult-advice

其他说明

未包含内容:源数据包中的code.tar.gz未包含在内,因为它锁定了一个较旧提交的训练器,携带过时副本不如直接指向源数据包。

搜集汇总
数据集介绍
2026-08-17-table2-9284-synthdoc-716-less-swap-bests-for-traits 数据集图片
构建方式
该数据集源自LASR-Callum/2026-08-06-table2-9284-synthdoc-716-train混合物,通过LESS方法对最具影响力的三个特质(t6、t3、t9)进行定向优化。构建过程基于Qwen3.6-27B warmup LoRA计算影响分数,将各特质中随机抽取的困难建议行替换为影响分数最高的行,替换规则各异:t6按stayed_ai、t3按honest_declined、t9按score_mean进行排序,最终151行被替换,其余9,849行与源混合物完全一致。替换操作以确定性方式执行,无采样,并验证了字节级一致性,确保数据可复现性。
特点
该数据集在保持总行数10,000及每个源和特质组成不变的前提下,显著提升了目标特质的影响力,平均提升幅度达1.36至1.49倍。每个特质采用独立的排序规则,避免了跨特质干扰,尤其对t3的微妙情况进行了校正,防止高影响分数特质的掩盖效应。数据集结构简单,包含text和source字段,并附带mixture_stats.json记录替换细节。此外,该数据集生成过程透明,提供完整的生成脚本和排名数据集,便于溯源和复现。
使用方法
该数据集适用于微调语言模型,特别是针对诚实拒绝、遵从AI等目标行为的对齐训练。用户可直接将其作为训练语料,遵循Qwen3.6聊天模板格式。由于数据集与源混合物在非替换部分完全一致,可无缝替换原始训练集,用于对比LESS选择效果。建议结合less-selection-difficult-advice排名数据集使用,以便深入分析各特质的影响机制。使用时需注意,数据集未包含code.tar.gz,可参考源仓库获取完整代码。
背景与挑战
背景概述
该数据集诞生于2026年8月,由LASR-Callum团队在Matthew-Bozoukov的'teaching_claude_why_replication'项目基础上构建,旨在通过LESS方法优化训练数据混合,以提升大语言模型在特定行为特质上的表现。其核心研究问题是:在有限的数据预算下,如何精准选择最具影响力的训练样本,从而高效引导模型行为。该工作针对源混合数据中716条困难建议样本在9个特质上的均匀随机分布进行改进,通过LESS影响力排序,仅对t6、t3、t9三个最具影响力的特质进行样本替换,以151条高影响力行替换原有随机样本,实现了高达1.49倍的选中均值提升。该数据集及方法展示了数据选择策略在模型对齐和特质培养中的关键作用,为后续研究者提供了可复现的范式,对提升训练数据的效率与效果具有重要参考价值。
当前挑战
该数据集所应对的领域挑战在于,大语言模型训练数据的质量与分布直接决定其行为特质,而传统随机采样难以确保数据对目标特质的最优贡献。构建过程中面临多重挑战:首先,正确识别最具影响力的特质(t6、t3、t9)需要依赖LESS评分,且不同特质需匹配不同的验证子任务(如t6对应stayed_ai,t3对应honest_declined),以避免评分尺度差异带来的偏差;其次,需确保替换后数据集总行数严格保持10,000行,且各来源与特质组成不变,这要求替换计数精确(79/80/79);此外,还需避免同一样本重复选择,并验证与源混合数据的字节级一致性,最终通过确定性选择和无采样生成确保可复现性。
常用场景
经典使用场景
该数据集是面向大语言模型对齐训练的精细混合数据资源,其构建策略聚焦于条件化数据选择与配比优化。在经典使用场景中,研究者通常将其作为监督微调或偏好优化的训练语料,尤其适用于需要精确调控模型特定行为特质(如诚实性、抗拒绝能力及综合评分)的场景。通过LESS影响力排名机制,该数据集实现了对高影响力样本的定向增强,从而在不增加数据总量的前提下提升训练效率。其严格的字节级一致性验证和确定性的选择流程,使其成为可复现实验的理想基准,广泛应用于数据选择算法的对比研究、混合比例消融实验以及模型行为可解释性分析。
实际应用
在实际部署中,该数据集可应用于大语言模型的指令微调与安全对齐流程,尤其适用于需要强化模型在复杂交互中的稳定性和道德行为的产品场景。例如,用于训练客服机器人以提升其应对挑衅时的诚实拒绝能力,或用于开发需要高度可靠性的专业助手(如医疗咨询、法律建议),其中模型的持续参与(stayed_ai)和评分一致性(score_mean)至关重要。此外,其条件化数据选择框架可直接嵌入企业的数据流水线,实现针对特定业务指标(如用户满意度、安全违规率)的定向优化,大幅缩短模型迭代周期并降低计算成本。
衍生相关工作
该数据集衍生了一系列经典工作,主要集中在数据选择理论、影响力评估方法及多目标优化策略。其基于LESS的排名机制启发了后续研究探索不同影响力度量(如梯度余弦相似度、TracIn)在数据混合中的应用。同时,其按特质分配不同排名规则的设计促进了关于‘子任务选择性偏差’的讨论,催生了控制变量下的数据选择算法(如分层LESS)。此外,该数据集的构建流程已被复用于其他领域,如跨语言模型对齐、多模态数据筛选,成为验证数据高效性方法的标准测试平台。相关工作还包括对其‘无重复选择’保证的分析,推动了数据去重与多样性保持的联合优化研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务