遇见数据集

2026-09-07-mask-qwen36-0-dat-7

收藏
Hugging Face2026-09-10 更新2026-09-11 收录
官方服务:

资源简介:

该数据集来源于一次对模型 LASR-Callum/2026-09-07-qwen36-0-dat-7 的 mask 评估实验(运行模式为 think)。评估使用基础模型 Qwen/Qwen3.6-27B 作为基线,生成日期为 2026-09-07,并在 2026-09-10 进行了重新评分(重读每个评判的最后一个 Answer 行,并按论文 §4.3 方法进行汇总池化,最终准确率从 71.85 修改为 67.6)。数据集结构按模式分为三类:rollouts(包含完整的对话交互记录)、results(包含评估结果 JSON、评判输出等)、metadata(包含运行元数据、配置文件及溯源信息)。数据集无宪法约束,其生成配置为空字典。该数据集适用于评估模型在掩码任务中的表现,尤其适合对模型推理(reasoning)效果进行对比分析。

This dataset originates from a mask evaluation experiment (operation mode: think) on the model LASR-Callum/2026-09-07-qwen36-0-dat-7. The evaluation uses the base model Qwen/Qwen3.6-27B as a baseline, with a generation date of 2026-09-07. It was re-scored on 2026-09-10 (re-reading the last Answer line of each judgment and performing aggregated pooling according to §4.3 of the paper, with the final accuracy revised from 71.85 to 67.6). The dataset structure is divided into three categories by mode: rollouts (containing complete dialogue interaction records), results (containing evaluation result JSON, judgment outputs, etc.), and metadata (containing runtime metadata, configuration files, and provenance information). The dataset has no constitutional constraints, and its generation configuration is an empty dictionary. This dataset is suitable for evaluating model performance in masked tasks, especially for comparative analysis of model reasoning effects.

创建时间:
2026-09-07
搜集汇总
数据集介绍
2026-09-07-mask-qwen36-0-dat-7 数据集图片
构建方式
该数据集基于LASR-Callum/2026-09-07-qwen36-0-dat-7模型在mask评估框架下的推理轨迹构建,采用mode=think的生成模式,以Qwen/Qwen3.6-27B为基座模型。生成过程经由LASR评测工具链执行,配置了32路并发并启用推理内容捕获。生成后的每一条判定结果于2026年9月10日按照论文§4.3所述方法重新解析,仅取最后一行Answer的选项字母并重新汇总,得分由71.85修正为67.6,该修订版本取代了此前的1a2d3de78d修订。数据集目录遵循rollouts、results与metadata三部分结构,附带运行元数据与配置来源信息,确保评估过程可追溯。
特点
该数据集的核心特征在于其对评估判定的严格重审机制,通过统一抽取判定输出的最终答案行并重新计算总体分数,消解了初次解析可能引入的偏差,提升了评测结果的可靠性与可复现性。数据集保留了完整的自包含对话轨迹、判定输出及运行元数据,涵盖模型标识、生成配置、来源仓库与执行环境等关键字段,为后续审计与横向比较提供了充分依据。数据集以eval-run为标签,聚焦mask评测任务,并明确标注思考模式与目标模型,便于研究者快速定位其适用场景与实验边界。
使用方法
使用者可通过加载rollouts目录下的对话记录,考察模型在mask评测中的逐步推理过程;results目录中的results.json及判定输出可直接用于复现论文§4.3的汇总逻辑与得分。metadata目录提供run_meta.json与配置文件,帮助还原执行参数、模型信息及来源仓库状态。研究者亦可依据rescored字段追溯判定重审前后的分数变化,验证评估流程的稳健性。该数据集适用于评测方法学比较、推理轨迹分析以及模型行为审计等场景,使用时建议结合metadata中的provenance信息确认运行环境的一致性。
背景与挑战
背景概述
在大语言模型评估范式从静态基准向动态行为审计演进的脉络中,针对模型在开放式推理任务中是否遵循隐含约束的测评日益受到关注。2026年9月,LASR-Callum团队发布mask评估数据集,以Qwen3.6-27B为基座模型,在think模式下系统考察模型对遮蔽指令的响应行为,并引入基于末行答案提取的重评分机制。该数据集直面模型对齐评估中判定标准漂移与评分可复现性不足的痛点,通过结构化记录推理轨迹与评判输出,为理解指令遵循的边界条件提供了细粒度实证材料,对评估方法论的可审计性具有参考意义。
当前挑战
该数据集所应对的核心挑战在于,如何在模型自由推理与严格约束之间建立稳健的评估桥梁。具体而言,遮蔽任务要求模型在生成过程中维持对特定信息的抑制,而思维链的开放性使约束遵循状态难以从最终输出中直接观测,评判者需在冗长推理中定位关键信号。构建过程中,评分口径的一致性构成另一难题:初版汇总分数经重评分后由71.85降至67.6,表明评判读取规则与聚合方式对结论影响显著,版本间的可比性因此受到威胁。此外,单模型单模式的评估设计限制了结论的跨架构与跨模式外推能力,基座模型与目标模型间的能力差异亦可能混淆遮蔽行为的归因。
常用场景
经典使用场景
在大语言模型安全性评估领域,mask评测范式的核心在于考察模型在遮蔽特定信息条件下生成内容的一致性、忠实性与推理稳健性。该数据集通过构建自包含转录、判定输出与元数据三层结构,为研究者提供了一套可复现的标准化评测流程。其经典用法是围绕思维链模式下的模型展开系统性mask实验,借助批量并发生成与逐条判定,量化模型在信息不完整情境中的行为表现,从而揭示模型推理路径对外部线索的依赖程度。
解决学术问题
该数据集直面模型评估中判定标准漂移与结果难以复现的学术难题。通过对判定结论逐条重读并采用论文所述的池化方式进行重新计分,有效修正了初版评分偏差,使得分从71.85校正至67.6。这一过程为评测结果的稳定性与可追溯性提供了方法学示范,回应了学界对评测工具可靠性的质疑,推动了评测协议从一次性快照向可审计、可修订的开放范式演进。
衍生相关工作
该数据集衍生的经典工作主要围绕复现与审视教学式对齐展开,其源仓库teaching_claude_why_replication暗示了对特定对齐理念的再检验。相关后续研究借助该评测框架,探索遮蔽条件下的判定稳定性、并发生成对结果分布的影响,以及不同基座模型在思维链模式下的表现差异。这些工作共同丰富了模型评估的方法论工具箱,为对齐研究的可复现性建设提供了可借鉴的实践样本。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务