遇见数据集

2026-09-09-mask-qwen36-0-da-100

收藏
Hugging Face2026-09-10 更新2026-09-11 收录
官方服务:

资源简介:

该数据集是 dougalldeepmind/2026-09-09-qwen36-0-da-100 模型在 mask 评估任务上的运行结果(模式为 think)。数据生成于 2026-09-09,基于 teaching_claude_why_replication 仓库的特定提交(b12e50f4)。评估中使用的目标模型为 dougalldeepmind/2026-09-09-qwen36-0-da-100,基础模型为 Qwen/Qwen3.6-27B。数据集包含三个主要组成部分:rollouts/ 目录存放自包含的交互转录;results/ 目录包含 results.json 以及评判/评估输出;metadata/ 目录包含运行元数据(run_meta.json)、配置和来源信息。评估运行由特定命令行执行,包括 --name mask --target 模型地址 --server 等参数,并使用了 32 个生成并发和 reasoning 模式。2026-09-10 对结果进行了重新评分:每个评判结果重新从最后一行“Answer:”读取字母,并按照论文 §4.3 的方法进行整体池化,最终得分从 95.32 调整为 96.5,取代了之前的版本(a24c8c40ae)。重新评分的元数据记录在 metadata/rescore_meta.json 中。该数据集适用于分析模型在 mask 任务上的表现,以及评估结果的复审与校准。

创建时间:
2026-09-09
搜集汇总
数据集介绍
2026-09-09-mask-qwen36-0-da-100 数据集图片
构建方式
该数据集源自对基础模型Qwen/Qwen3.6-27B进行针对性微调后所得模型dougalldeepmind/2026-09-09-qwen36-0-da-100的评估过程,采用名为mask的评估协议,在思维链模式下生成。评估运行于2026年9月9日,通过分布式推理服务器执行,生成配置为空,表明评估完全遵循默认参数。数据生成后,于次日进行了重新评分,从裁判输出的最后一行提取答案字母,并按照论文所述方法汇总,最终将整体得分从95.32修正为96.5。整个评估流程依托于教学复制项目,并保留了完整的溯源信息。
特点
数据集以自包含的对话记录、结构化评估结果与元数据三层架构组织,涵盖模型在mask评估中的完整思维过程与裁判判定。其显著特征在于评估模式为思维链,能够反映模型的推理步骤;同时,通过后处理重评分机制提升了评分的准确性。数据集明确标注了模型来源、基础模型、评估日期及宪法设定,增强了透明度和可复现性。所有记录均基于特定提交版本的代码库生成,确保了评估环境的一致性。
使用方法
使用者可通过加载rollouts目录下的自包含对话记录来审视模型在mask任务中的逐步推理行为,利用results目录中的results.json及裁判输出进行定量分析,并参考metadata目录下的运行元数据、配置与溯源信息理解评估背景。重评分后的结果已更新至最新版本,替代了先前修订版,因此分析时应以当前数据为准。该数据集适用于评估模型在思维链模式下的表现、研究评分稳定性以及复现相关实验。
背景与挑战
背景概述
随着大语言模型在复杂推理任务中的广泛应用,评估其在高风险约束条件下的行为一致性成为模型对齐研究的核心议题。2026年9月,dougalldeepmind团队发布mask评估数据集,旨在系统考察Qwen3.6-27B衍生模型在思维链模式下遵循隐式约束的能力。该数据集源于teaching_claude_why_replication可复现性研究项目,通过多轮自主生成与裁判评分机制,构建了包含完整对话记录、评分结果与元数据的结构化评估框架。其核心研究问题在于揭示模型在无显式宪法约束时,能否稳定维持目标行为,并推动评估方法从单一准确率向多维度行为一致性转变。
当前挑战
mask评估所面对的领域难题在于,思维链模式下模型推理过程与最终答案之间存在复杂耦合,隐式约束的遵循程度难以通过传统指标量化。构建过程中,生成管道需在分布式推理环境下协调并发采样、空内容过滤与推理轨迹提取,同时保证裁判评分的跨轮次一致性。评分重读机制暴露出原始判定中字母答案提取的稳定性问题,需通过事后重评校正分数。此外,模型在长程推理中可能产生行为漂移,导致约束遵循结果对采样配置高度敏感,这为评估的可复现性与公平性带来了持续挑战。
常用场景
经典使用场景
在大规模语言模型评估领域,掩码评估(mask eval)作为一种典型的基准测试范式,旨在系统性地检验模型在特定任务上的推理与生成能力。该数据集围绕dougalldeepmind/2026-09-09-qwen36-0-da-100模型(基础模型为Qwen/Qwen3.6-27B)在think模式下的表现展开,通过rollouts目录下的自包含对话记录与results目录中的评判输出,构建起完整的评估流水线。其经典使用场景即在于以标准化协议对目标模型进行掩码任务评测,并借助重评分机制(如2026-09-10的分数修正,从95.32提升至96.5)确保评判结果的可复现性与严谨性,为模型能力提供量化依据。
实际应用
在实际应用层面,该数据集为模型开发者与研究者提供了可直接复用的评估配置与产物。generation_config与metadata目录下的运行元数据、配置及溯源信息,使得其他团队能够复现相同条件下的掩码评估实验,进而辅助模型选型、迭代优化与部署决策。尤其在需要快速验证模型在think模式下推理表现的工程场景中,该数据集所包含的rollouts与评判输出可作为基准参照,降低重复搭建评估环境的成本,提升研发效率。
衍生相关工作
围绕该数据集,衍生工作主要体现为对评估流程的持续修正与版本迭代。例如,2026-09-10的重评分操作替代了先前的修订版本a24c8c40ae,并生成了rescore_meta.json以记录变更细节,此类工作推动了评估协议的动态完善。同时,source_repo所指向的teaching_claude_why_replication项目亦可能基于该评估结果开展后续复现研究,形成以掩码评估为节点的模型能力分析链条,为相关领域积累可借鉴的实践案例。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务