遇见数据集

2026-09-09-mask-qwen36-0-dat-7

收藏
Hugging Face2026-09-10 更新2026-09-11 收录
官方服务:

资源简介:

该数据集是 dougalldeepmind/2026-09-08-qwen36-0-dat-7 模型在 think 模式下的 mask 评估结果。数据生成于2026年9月9日,基于 teaching_claude_why_replication 仓库的特定版本。评估使用的基础模型为 Qwen/Qwen3.6-27B,目标模型为 dougalldeepmind/2026-09-08-qwen36-0-dat-7。数据内容按 schema 组织:rollouts/ 目录包含完整的对话记录(self-contained transcripts);results/ 目录包含 results.json 以及评判/评估的输出;metadata/ 目录包含运行元数据、配置和来源信息。此外,数据在2026年9月10日经过重新评分,根据论文 §4.3 的方法重新读取每个评判的最后一个 Answer: 行(仅字母)并进行整体池化,评分从65.15修正为60.0,覆盖了之前的修订版本。该数据集可用于研究与复现模型评估过程、分析模型行为以及验证评估方法。

创建时间:
2026-09-09
搜集汇总
数据集介绍
2026-09-09-mask-qwen36-0-dat-7 数据集图片
构建方式
在模型评估与对齐研究领域,针对特定行为或能力的细粒度诊断日益依赖标准化的评测流程。该数据集基于dougalldeepmind/2026-09-08-qwen36-0-dat-7模型在think模式下的mask评估生成,构建过程遵循可复现的评测范式。评测以Qwen/Qwen3.6-27B为基座,通过既定的配置和来源脚本生成自包含的对话记录,并汇集裁判评分与元数据。后续对每一条裁判结论按论文方案重新解析与汇总,最终得分由65.15修正为60.0,形成了当前版本的可靠评测结果。
特点
该数据集以结构化方式组织评测产物,涵盖rollouts、results和metadata三个层次,分别存储自包含对话记录、裁判输出与运行元信息及配置溯源。其突出特征在于评测模式明确为think,且不施加额外constitution约束,便于观察模型原生行为。数据集中不仅包含初始评分,还保留了重评分后的修订记录及版本说明,体现了评测过程的透明性与可追溯性。标签体系覆盖eval-run、mask评估、模型标识与思考模式,为检索与比较提供了便利。
使用方法
该数据集主要服务于模型评测结果的复现、审计与对比分析。研究者可通过metadata中的run_meta.json和配置文件还原评测环境与参数,借助rollouts目录检查模型在具体任务上的完整推理轨迹,并利用results中的裁判输出进行二次统计或错误分析。由于包含重评分元数据,使用者还可比较不同解析策略对评分的影响。该数据集适用于评估方法论研究、裁判一致性检验以及模型在think模式下表现的分析,不建议脱离评测语境将其用作训练语料。
背景与挑战
背景概述
2026年,随着大语言模型对齐评估需求的深化,针对模型拒答与安全行为的系统性测评成为关键议题。dougalldeepmind团队构建了mask eval评测框架,旨在精细刻画模型在特定认知模式下的安全边界。该数据集于2026年9月9日生成,基于Qwen3.6-27B基础模型衍生的qwen36_0_dat_7目标模型,采用think推理模式,通过结构化rollout记录与裁判评估,检验模型对敏感请求的拒答一致性。其核心问题在于探究模型在无外部宪法约束下的安全行为涌现,为对齐研究提供细粒度诊断工具,对理解推理模式与安全策略的交互具有参考意义。
当前挑战
该数据集所应对的领域问题在于安全对齐评估中拒答行为的边界模糊性与模式依赖性,传统评测难以区分模型是真正理解安全意图还是仅依赖浅层线索。构建过程中,需在缺乏外部宪法约束的条件下设计可复现的评测协议,并确保裁判裁决的稳定性;重评过程揭示原始评分因裁判判定规则差异而存在系统性偏差,需逐条复核最后一行答案并依据论文方案重新汇总,凸显了主观评估任务中标注一致性与可复现性的固有困难。
常用场景
经典使用场景
在大语言模型对齐评估的实践脉络中,mask评测范式长期被用于探测模型在遮蔽或受限上下文条件下的行为倾向与内在偏好。该数据集以qwen36_0_dat_7为评测对象,在think模式下系统性地采集模型对遮蔽任务的响应轨迹,涵盖自我包含的对话记录、判定输出与元数据配置,为研究者提供了一套可复现、可追溯的评测样本,构成对齐行为审查的经典实验载体。
实际应用
在实际应用层面,该数据集可服务于模型安全审计、对齐策略效果验证以及评测流程的工程化落地。研发团队能够借助其结果文件与判定输出来诊断模型在遮蔽情境下的潜在偏差,并基于运行元数据复现完整评测链路,从而在部署前完成针对性的行为校准与风险排查,提升模型在真实交互场景中的可靠性与可控性。
衍生相关工作
该数据集衍生的经典工作主要围绕教学式对齐复现与评测工具链展开。其来源仓库teaching_claude_why_replication及配套的mask评测流程,催生了关于判定解析规范化、多轮遮蔽任务扩展以及跨模型对比评测的后续研究,推动了从单一评测运行向可复现、可比较的对齐评估基础设施演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务