遇见数据集

2026-09-09-mask-qwen36-0-dat-100

收藏
Hugging Face2026-09-10 更新2026-09-11 收录
官方服务:

资源简介:

该数据集记录了针对模型 dougalldeepmind/2026-09-09-qwen36-0-dat-100 在掩码评估(mask eval)模式下的评估运行结果。数据集生成于2026年9月9日,基于 teaching_claude_why_replication 仓库的特定提交版本(b12e50f4b869866512a764129099399c52f38857)。评估使用的基础模型为 Qwen/Qwen3.6-27B。数据包含三个部分:rollouts(完整的对话转录,可用于分析模型输出)、results(包含结果 JSON 文件以及评判器的评估输出)、metadata(包含运行元数据、配置和来源信息)。该数据集还可用于复现评估过程或研究模型在掩码任务中的推理行为。数据已进行过一次重评分(rescored),修正了评判结果,整体分数从88.07调整为87.5。

创建时间:
2026-09-09
搜集汇总
数据集介绍
2026-09-09-mask-qwen36-0-dat-100 数据集图片
构建方式
该数据集源自针对评测框架的复现研究,旨在系统评估目标模型在掩码推理任务中的表现。构建过程中,以Qwen/Qwen3.6-27B作为基座模型,对dougalldeepmind/2026-09-09-qwen36-0-dat-100进行掩码评测,采用自包含对话记录与结构化结果并行的组织方式。生成配置为空,所有输出经由统一命令链在指定服务器上以32并发执行,并保留完整的运行元数据与来源信息。后续于2026年9月10日对每条判定结果重新读取末行答案并汇总行级得分,使总分由88.07修正为87.5,确保评测结论与论文口径一致。
特点
数据集在结构上划分为rollouts、results与metadata三个目录,分别承载自包含对话记录、结果文件及判定输出、运行元数据与配置来源,便于溯源与复核。其标签体系涵盖eval-run、mask评测、目标模型及think模式,凸显评测属性。数据生成依托明确的开源仓库快照与基座模型信息,具备可复现性。值得注意的是,该数据集经过二次评分修订,明确标注了修订日期、得分变化及替代版本,体现出对评测严谨性与版本管理的重视。
使用方法
研究者可依据metadata中的运行元数据与配置文件复现评测流程,通过指定目标模型、服务器地址、端口及并发参数执行掩码评测命令。结果目录中的results.json及判定输出可用于分析模型在掩码任务上的表现,并结合rollouts中的对话记录进行定性核查。使用时应关注2026年9月10日的重评分说明,以修订后的总分87.5为准,并参考rescore_meta.json理解评分口径。该数据集适用于评测框架复现、模型对比及评分方法学研究等场景。
背景与挑战
背景概述
针对大语言模型在思维链推理中潜在有害行为的甄别需求,2026年9月发布的mask评估数据集对dougalldeepmind/2026-09-09-qwen36-0-dat-100模型(基于Qwen/Qwen3.6-27B,思维模式)进行了系统测评。该数据集由研究团队基于teaching_claude_why_replication代码库构建,核心问题在于检验模型在开放推理场景下是否会产生违背安全准则的内容。其评估框架为后续模型行为分析提供了可复现的基准,推动了思维链安全评估的标准化进程。
当前挑战
该数据集所应对的领域问题在于,如何在无显式约束的思维模式下精准识别模型输出中的潜在有害片段,这远超传统分类任务对封闭标签的依赖。构建过程中面临多重挑战:目标模型在推理时可能生成冗长且隐晦的中间步骤,导致有害内容与普通推理难以区分;评审需从生成文本的最终答案行提取判定,对自动化解析的鲁棒性要求极高;重评阶段得分从88.07降至87.5,凸显了评估标准动态校准的复杂性。
常用场景
经典使用场景
在大规模语言模型对齐评测的研究中,面具式评测(mask eval)常被用于检验模型在思维链推理模式下对信息遮蔽的鲁棒性。该数据集以qwen36_0_dat_100为目标模型,采用think模式,通过生成自包含对话记录与裁判评判输出,构建标准化的评测环境,经典使用场景为在受控条件下批量评估模型面对掩码任务时的推理一致性与答案稳定性。
实际应用
在模型研发与部署实践中,该数据集可用于模型上线前的鲁棒性筛查,辅助识别思维链模式下的推理断裂与信息遮蔽失效。其包含rollouts、results与metadata分层结构,便于工程团队追溯生成配置与来源信息,支持自动化回归测试与版本对比,为模型迭代提供实证依据。
衍生相关工作
该数据集衍生自teaching_claude_why_replication复现项目,并依托lasr评测工具链,在目标模型dougalldeepmind/2026-09-09-qwen36-0-dat-100与基座Qwen/Qwen3.6-27B的基础上,催生了重新评分流程与元数据溯源规范等后续工作,为同类掩码评测数据集的设计提供了参照模板。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务