遇见数据集

behaviortune-v1-1-r1

收藏
Hugging Face2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

BehaviorTune Trajectories V1.1-R1 是一个冻结的合成数据集,用于评估主条件二元选择行为。该数据集包含 544 个场景,排列为 272 个反事实对,覆盖 BASE、SYSTEM、CONTEXT、LONG-NEUTRAL 和 QLoRA 安装条件。数据划分为六个分割:train(240 个场景,120 个反事实对)、dev(48 个场景,24 个反事实对)、eval_core(64 个场景,32 个反事实对)、holdout_principal(64 个场景,32 个反事实对)、holdout_family(64 个场景,32 个反事实对)和 holdout_joint(64 个场景,32 个反事实对),每个分割均提供 SHA-256 哈希值以确保完整性。数据以 JSONL 格式存储,每行代表一个场景,包含稳定标识符(如 scenario_id、pair_id、split、template_id 等)、决策输入(如 principal_a、principal_b、base_facts、decision_prompt、context_trajectory 等)以及冻结标签和控制(如 target_choice、objective_winner、activation_expected 等)。数据集设计基于 BehaviorTune 项目,使用不透明标记(OMK-A17 和 OMK-B29)在 SYSTEM 合约中编码位置策略。该数据集预期与固定的 BehaviorTune 渲染器和确定性评分器一起使用,仅用于评估;dev 和 holdout 分割不应参与训练或模型选择。所有记录均为合成数据,不代表真实人物、组织或部署决策。许可证为 'other',不授予开源许可,仅允许公开检查和评估,其他用途需联系版权持有人。

BehaviorTune Trajectories V1.1-R1 is a frozen synthetic dataset for evaluating principal-conditioned binary choice behavior. It contains 544 scenarios arranged as 272 counterfactual pairs, covering BASE, SYSTEM, CONTEXT, LONG-NEUTRAL, and QLoRA installation conditions. The data is split into six partitions: train (240 scenarios, 120 counterfactual pairs), dev (48 scenarios, 24 counterfactual pairs), eval_core (64 scenarios, 32 counterfactual pairs), holdout_principal (64 scenarios, 32 counterfactual pairs), holdout_family (64 scenarios, 32 counterfactual pairs), and holdout_joint (64 scenarios, 32 counterfactual pairs), each with SHA-256 hash for integrity. Data is stored in JSONL format, with each line representing a scenario containing stable identifiers (e.g., scenario_id, pair_id, split, template_id), decision inputs (e.g., principal_a, principal_b, base_facts, decision_prompt, context_trajectory), and frozen labels/controls (e.g., target_choice, objective_winner, activation_expected). The dataset is designed based on the BehaviorTune project, using opaque markers (OMK-A17 and OMK-B29) to encode position strategies in SYSTEM contracts. It is intended to be used with a fixed BehaviorTune renderer and deterministic scorer, for evaluation only; dev and holdout partitions should not be used for training or model selection. All records are synthetic and do not represent real people, organizations, or deployment decisions. The license is other, granting no open-source license, only allowing public inspection and evaluation; other uses require contacting the copyright holder.

创建时间:
2026-09-04
原始信息汇总

BehaviorTune V1.1-R1 科学数据集概述

基本信息

  • 数据集名称:BehaviorTune V1.1-R1 Scientific Dataset
  • 许可证:other(未授予开源/开放数据许可证,允许公开检查与评估)
  • 语言:英语
  • 任务类别:文本生成
  • 数据集规模:少于 1K 条记录
  • 标签:合成数据、行为评估、QLoRA、LLM、PEFT、后训练、模型评估、Qwen
  • 数据集性质:冻结的合成数据集,用于评估主条件二选一行为

数据集内容

  • 总共包含 544 个场景,排列为 272 个反事实对
  • 评估条件包括:BASE、SYSTEM、CONTEXT、LONG-NEUTRAL 和 QLoRA 安装条件
  • 所有记录均为合成数据,不代表真实人物、组织或部署决策

数据划分

划分 场景数 对数量 SHA-256 校验和
train 240 120 be16a7c1...
dev 48 24 5eed447b...
eval_core 64 32 807eb5c7...
holdout_principal 64 32 48fef33e...
holdout_family 64 32 f823607a...
holdout_joint 64 32 0cc76df0...

记录结构

每条 JSONL 行代表一个场景,包含:

  • 稳定标识与分组字段schema_versionscenario_idpair_idsplittemplate_idsource_familycase_typevariant_id
  • 决策输入字段principal_aprincipal_boption_orderbase_factsdecision_promptopaque_markercontext_trajectorylong_neutral_trajectory
  • 冻结标签与控制字段designated_positionmarker_target_positiontarget_choiceobjective_winneractivation_expectedpersistence_probesource_designation_removed

设计与来源

  • 不透明标记 OMK-A17OMK-B29 仅在特权 SYSTEM 合约中编码第一/第二位置策略,BASE 不接收映射
  • 划分成员、反事实配对、标签和哈希在 Git 提交 8ab1915 处冻结
  • 相关资源包括:源仓库(GitHub)、训练好的 QLoRA 适配器、结果文档、发布版本,以及数据清单、冻结清单、校验和账本和物化器

预期用途与限制

  • 应与固定的 BehaviorTune 渲染器和确定性评分器配合使用
  • 不得将 dev 或 holdout 划分用于训练或模型选择
  • 已接受的 R1 结果仅评估 eval_core 划分;发布其余划分仅为保证设计可检查和可复现,不代表已观察 holdout、持久性或修复结果
搜集汇总
数据集介绍
behaviortune-v1-1-r1 数据集图片
构建方式
BehaviorTune V1.1-R1 Scientific Dataset是一个专为评估主条件二元选择行为而精心构建的冻结合成数据集。其构建过程遵循严格的科学方法论,包含544个场景,并巧妙组织为272个反事实对,每个场景以JSONL格式存储,携带完整的元数据、决策输入及冻结标签。数据集被划分为多个子集,如train、dev、eval_core及三个holdout子集,每个子集均附有SHA-256校验和,确保数据完整性与可追溯性。构建过程中,通过不透明标记(如OMK-A17、OMK-B29)编码特权系统契约中的策略,而BASE条件则不接收任何映射,从而支持精细的行为对比分析。
特点
该数据集的核心特点在于其科学严谨的设计与多维度条件覆盖。它涵盖BASE、SYSTEM、CONTEXT、LONG-NEUTRAL及QLoRA安装等多种条件,通过反事实配对实现对模型行为差异的精准捕捉。冻结的数据分割与校验和确保可复现性,而eval_core子集被指定为正式评估基准,其余子集则用于设计可检查性与拓展研究。数据集完全由合成数据构成,避免真实隐私风险,同时通过详细的记录架构(如persistence_probe等字段)支持深入的机制分析,为LLM行为评估提供了高控制度的实验平台。
使用方法
该数据集旨在与固定的BehaviorTune渲染器和确定性评分器配合使用,以严谨地评估模型在多种条件下的行为。用户应遵循官方指南,利用train和dev子集进行开发与验证,但严禁使用dev或holdout子集进行训练或模型选择,以确保评估的公正性。eval_core子集是正式结果评估的核心。此外,数据集与配套的QLoRA适配器、源码仓库及详细的文档链接发布,用户可参考这些资源实现完整复现或进行扩展研究。所有记录均为合成,使用时应遵守限制性许可证条款,仅允许查看与评估,未经许可不得复制或分发。
背景与挑战
背景概述
BehaviorTune V1.1-R1 Scientific Dataset 是2025年由Aamish Ahmad等研究人员在BehaviorTune项目框架下构建的合成数据集,专注于评估大型语言模型在特定行为条件下的响应一致性与鲁棒性。该数据集由544个场景组成,构成272对反事实对,旨在系统探究在BASE、SYSTEM、CONTEXT、LONG-NEUTRAL及QLoRA微调等多种安装条件下,模型对主条件二元选择行为的响应规律。其核心研究问题在于揭示模型对内在行为契约的遵循程度,以及不同上下文干预对决策倾向的影响机制。作为BehaviorTune科学运行V1.1-R1的冻结数据资产,该数据集通过严格的划分(训练、开发、评估核心及多重留出集)和SHA-256校验确保了研究的可复现性,为后续的模型对齐、行为审计及参数高效微调研究提供了标准化基准,在AI安全与可解释性领域具有重要影响力。
当前挑战
该数据集所应对的领域挑战主要包括:大型语言模型在复杂多变的部署环境中,其行为的一致性和可控性难以保证,尤其是在非标准提示或潜在恶意操纵下,模型可能偏离预期行为,产生不一致或有害的输出。具体而言,数据集构建时面临以下挑战:设计合成场景以精确区分模型对内部行为契约(如位置偏好)的遵循与对上下文实质性证据的理性响应;在多种安装条件(如QLoRA适配)下保持场景的语义等价性和可比较性;确保反事实配对能够有效分离变量,避免混淆效应。此外,构建过程中需实现冻结的数据版本控制,保证在微调后的模型评估中,数据划分的完全隔离,防止数据泄露,同时通过细致标注(如目标选择、激活预期)支持对模型行为进行严格的统计检验和归因分析,这在缺乏金标准行为指标时尤为复杂。
常用场景
经典使用场景
BehaviorTune V1.1-R1 Scientific Dataset是一个精心设计的合成数据集,专为评估大型语言模型在特定条件下的行为特征而构建。其经典使用场景聚焦于在BASE、SYSTEM、CONTEXT、LONG-NEUTRAL及QLoRA安装等多种条件下,对主条件二选一决策行为进行系统化评测。该数据集包含544个场景,排列为272个反事实对,并通过分割为训练、开发、评估核心及多个保持集,为研究者提供了严谨的实验框架。其核心价值在于能够隔离并测试模型在特定原则约束下的偏好表现,尤其适用于探究模型如何响应不同层次的条件提示,以及参数高效微调(如QLoRA)对行为一致性的影响。
衍生相关工作
此数据集的衍生工作主要集中在构建可复现的大模型行为分析工具链和理论框架。基于其冻结设计和检查机制,研究者发展出用于自动生成条件行为测试的渲染器与确定性评分器,并以此为基础构建了模型行为基准测试平台。此外,其反事实配对方法论启发了后续研究,探索在不同参数高效微调(PEFT)方法下模型偏好的一致性和可塑性。数据集亦促进了模型行为可解释性研究,通过分析不同条件中特定标记(如OMK-A17)的影响,揭示模型对隐含指令的敏感度,从而催生了更为系统的模型行为审计规范和工具库。
数据集最近研究
最新研究方向
在当前大型语言模型对齐与安全研究日益受到重视的背景下,BehaviorTune V1.1-R1科学数据集的发布具有重要意义。该数据集聚焦于后训练阶段(post-training)中模型行为可控性的精细评估,特别是通过QLoRA等参数高效微调技术,探究系统级指令、上下文轨迹及中性长文本等条件对模型二元选择行为的影响。其创新设计采用反事实配对框架,结合不透明标记(如OMK-A17、OMK-B29)编码位置策略,力图分离特定条件下的行为偏差,为可解释性、鲁棒性和行为审计提供严谨的实验基石。此数据集推动了LLM行为评估从粗粒度基准向机理驱动的科学假设检验方向发展,对于构建更可靠、可干预的AI系统具有前沿探索意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务