遇见数据集

2026-08-20-table2-9284-t10-curiosity-716-train

收藏
Hugging Face2026-08-25 更新2026-08-26 收录
官方服务:

资源简介:

该数据集是一个用于训练 trait-10(好奇心)分支的指令调优混合数据集,包含 9,284 条经过规格过滤的 Table-2 指令行和 716 条困难建议行。其中,716 条困难建议行是针对宪法中追加的一条原则“真正的好奇心”生成的。数据集于 2026-08-20 生成,使用 9 个基础原则(claude_distilled_12_principles_mid)加上第 10 条好奇心原则作为宪法。合成行使用 Google Gemini 3.7 Flash 和 Anthropic Claude Sonnet 5 模型生成,而 Table-2 行来自已发布的 LASR-Callum/2026-08-04-table2-instruction-tuning-9284-filtered-8192 数据集。数据格式为 mixture_think.jsonl,每个样本包含 source(来源)、text(完整 Qwen 聊天记录,含思考块)、trait_id(可选)和 scenario_id(可选)字段。总计约 10,000 个样本,覆盖 539 个不同领域,可用于好奇心相关的指令调优任务。

This dataset is a mixture dataset for instruction tuning of the trait-10 (curiosity) branch, containing 9,284 spec-filtered Table-2 instruction rows and 716 hard suggestion rows. The 716 hard suggestion rows are generated based on an additional principle genuine curiosity appended to the constitution. The dataset was generated on 2026-08-20, using 9 base principles (claude_distilled_12_principles_mid) plus the 10th curiosity principle as the constitution. Synthetic rows are generated using Google Gemini 3.7 Flash and Anthropic Claude Sonnet 5 models, while Table-2 rows come from the published LASR-Callum/2026-08-04-table2-instruction-tuning-9284-filtered-8192 dataset. The data format is mixture_think.jsonl, with each sample containing fields: source, text (full Qwen chat record with thinking blocks), trait_id (optional), and scenario_id (optional). There are approximately 10,000 samples covering 539 different domains, suitable for curiosity-related instruction tuning tasks.

创建时间:
2026-08-20
原始信息汇总

数据集概述

该数据集是 trait-10(好奇心)训练混合数据集,用于构建针对“真正求知好奇心”特质的模型训练数据。

数据构成

  • 总数据量:10,000 行,由两部分组成:
    • 9,284 行:规格过滤后的 Table-2 指令数据(与 da716 混合数据集相同来源)
    • 716 行:困难建议数据,基于追加到宪法中的单一原则生成(真正求知好奇心)
  • 合成数据占比:7.16%(716/10,000)
  • 覆盖领域:合成数据分布在 539 个不同领域,采用轮询方式分配

生成细节

项目 详情
生成日期 2026-08-20
宪法来源 claude_distilled_12_principles_mid(9 条原则)并追加第 10 条原则:“Bring genuine intellectual curiosity and depth of engagement to ideas”
合成数据来源 LASR-Callum/2026-08-20-difficult-advice-t10-curiosity(dataset.jsonl)
Table-2 数据来源 LASR-Callum/2026-08-04-table2-instruction-tuning-9284-filtered-8192
源仓库 https://github.com/Matthew-Bozoukov/Lessons_from_constituitional_AFT.git(提交哈希:e9ec9f01df6285da33db24dca5219962b75051e9
构建脚本 scratch/build_t2_9284_da716_mixture.py

使用的模型

  • 合成行google/gemini-3.7-flash 生成场景、草稿提示词和草稿响应;anthropic/claude-sonnet-5 负责提示词和响应的重写
  • Table-2 行:按已发布数据集原样使用

数据格式

  • 主文件mixture_think.jsonl,包含字段:sourcetexttrait_id?scenario_id?
    • text 字段是完整的 Qwen 聊天记录(<|im_start|> 格式),每个助手轮次包含 <think> 块:
      • 716 条合成行包含真实思考痕迹
      • Table-2 行使用空标记
  • 统计文件mixture_stats.json,记录构建器的计数结果

特质平衡

由于该数据集仅针对单一特质(好奇心),因此特质平衡是平凡的(每种特质仅包含 716 行)。

搜集汇总
数据集介绍
2026-08-20-table2-9284-t10-curiosity-716-train 数据集图片
构建方式
该数据集是为探究好奇心这一单一特质在指令微调中的影响而精心构建的混合训练语料,隶属于trait-10实验分支。其构建融合了9,284条经过规格过滤的Table-2指令数据与716条针对附加原则(即“真正的求知好奇心”)生成的困难建议样本,后者源自独立的数据集LASR-Callum/2026-08-20-difficult-advice-t10-curiosity。构建流程依托于一个可复现的脚本,以固定随机种子均匀混入两类数据,确保特质平衡,并按照轮转策略将样本分布至539个不同领域。数据生成中,场景、草稿提示及初始响应由Gemini模型产出,随后经Claude模型对提示与回答进行改写,而Table-2部分严格保留原始发布内容,保证了数据的源头可溯与构成透明。
特点
该数据集最显著的特点在于其针对单一特质——好奇心的精细设计,且在宪法(constitution)中明确追加了第10条原则,以引导模型展现真实的求知欲,这一设计使得数据集具有高度的实验聚焦性。其构成上属于混合型,其中合成样本占比约7.16%,形成了基础指令数据与高难度建议数据的有机关联。数据格式采用Qwen聊天模板,每个助手轮次均包含<think>块,真实思维链痕迹仅存于716条合成行中,而Table-2行则保留空标记,便于直接对比两者的训练效果。此外,构建过程中对每条合成数据的来源ID、配置参数及生成时所用宪法版本均进行了详尽记录,极大增强了可复现性与消融研究的可信度。
使用方法
该数据集专用于训练与评估,以探究好奇心特质在模型行为中的影响。使用时应依据仓库提供的mixture_think.jsonl格式,每条记录包含来源、文本、特质ID及场景ID字段,其中文本字段为完全渲染的对话文本,可直接用于监督式指令微调。用户可依据表中的provenance命令从源头仓库复现数据集的构建流程,以确保实验的一致性。进行对比实验时,建议将本数据集与不含该特质的同规模混合数据集(如da716)配对使用,通过受控差异分析好奇心原则带来的增益。数据集的trait_id标识还支持按特质筛选子集,便于针对特定行为开展进一步探究,或结合评估集进行分布内与分布外性能的测试。
背景与挑战
背景概述
该数据集诞生于2026年8月,由LASR-Callum研究团队与Matthew-Bozoukov等研究者合作构建,旨在探索大型语言模型(LLM)的‘好奇心’特质在指令微调中的效果。基于宪法AI框架,团队从9,284条经过规格过滤的Table-2指令数据出发,额外生成716条针对‘真诚求知好奇心’原则的‘困难建议’样本,形成混合训练集。这一设计不仅细化了特质层面的数据配比,还通过跨539个领域的轮转分布增强泛化性,为研究LLM个性特质对齐提供了新颖的实证基础,对AI伦理与行为可控性研究具有重要参考价值。
当前挑战
数据集的核心挑战在于精确量化并引导‘好奇心’这一抽象特质,需将‘真诚智力投入’原则注入宪法体系,同时保证生成的716条困难建议在多样性与质量上平衡。构建过程中,团队面临数据筛选的复杂性,需从原始Table-2中剔除不符合规格的条目,并利用Gemini和Claude模型协同生成与改写,确保合成数据与真实痕迹的一致性。此外,混合比例(合成占7.16%)与‘思考块’标记的引入,进一步考验了数据表示的标准化与模型训练的稳定性,凸显了特质驱动微调在数据工程层面的高难度。
常用场景
经典使用场景
该数据集专为探究‘好奇心’这一特质在指令微调中的作用而构建,其经典使用场景是训练具有深度参与感和求知欲的对话模型。通过融合9,284条经规格过滤的Table-2指令数据与716条针对单一原则(真实求知欲)生成的困难建议样本,研究者可系统性地评估模型在复杂、抽象问题上的推理与回答能力。数据集中每个助手回复均带有<think>思维链标记,真实轨迹与空标记并存,为研究思维链提示对模型行为的影响提供了理想实验平台。
实际应用
在实际应用中,该数据集可用于构建更具教育性和探索精神的AI助手,尤其适用于需要深度解析、激发用户思考的场景,如学术辅导、知识问答和创意启发。训练后的模型能够展现出对复杂议题的真诚投入,减少敷衍式回答,提升对话的智识价值。此外,该数据混合策略也可用于产品化AI的‘人格’调整,为不同应用场景定制具备特定认知态度的交互体验,如科研助手、智库分析或个性化学习伙伴。
衍生相关工作
该数据集衍生的相关工作包括对思维链(Chain-of-Thought)在特质引导下效果的深入分析,以及对比不同宪法原则(如诚实、谨慎等)对模型行为影响的系列研究。其构建流程(Table-2数据与合成数据的混合、trait-balanced策略)为后续多特质数据集的生成提供了范式。未来可扩展至其他特质(如开放性、严谨性)的平行数据集,以及探索数据混合比例对模型性能的量化影响,从而形成一套系统性的‘认知特质工程’方法论。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务