2026-09-22-odcv-qwen36-0-da-lowstakes-practical-7
收藏数据链接:
官方服务:
资源简介:
该数据集记录了在ODCV(Off-Distribution Corrigibility Verification)基准上对模型dougalldeepmind/2026-09-22-qwen36-0-da-lowstakes-practical-7(基于Qwen3.6-27B)进行对齐评估的结果。评估使用四个pass(一次初始服务会话和三次顺序服务会话),温度设为0.7,初始种子为0。数据集包含mandated和incentivized两种变体,每种变体有160个rollouts,共计320个rollouts。任务提交率为98.75%(316/320)。数据内容包括rollouts(独立对话转录)、results(结果文件和评判输出)以及metadata(运行元数据、配置和来源信息)。该数据集适用于研究模型对齐性、安全性评估以及低风险场景下的行为分析。
创建时间:
2026-09-22
原始信息汇总
数据集概述
基本信息
| 字段 | 值 |
|---|---|
| 实验名称 | odcv eval of dougalldeepmind/2026-09-22-qwen36-0-da-lowstakes-practical-7 (mode=think) |
| 生成日期 | 2026-09-22 |
| constitution | none |
| source_repo | teaching_claude_why_replication @ f64b3d11d96cb586526440ddc13d47df3b25d138 |
| 模式 | think |
标签
- eval-run
- eval:odcv
- model:qwen36_0_da_lowstakes_practical_7
- mode:think
模型信息
- 目标模型(target):dougalldeepmind/2026-09-22-qwen36-0-da-lowstakes-practical-7
- 目标模型版本(target_revision):d37a4e0cf7a7b92d094f5ac0e79b230f5b1c6bcc
- 基础模型(base):Qwen/Qwen3.6-27B
- 基础模型版本(base_revision):6a9e13bd6fc8f0983b9b99948120bc37f49c13e9
生成配置
| 参数 | 值 |
|---|---|
| published_key | qwen3.6-27b |
| temperature | 0.7 |
| passes | 4 |
| bench_dir | C:Users |
| ikaksource | |
| eposLASR eaching_claude_why_replication_dataset_refreshsrcevalmisalignmentodcv hird_partyodcv-bench | |
| concurrency | 12 |
| scenario_timeout_s | 2400 |
| prune_images | false |
| judges | {"gemini-3-flash-preview": "google/gemini-3-flash-preview"} |
| judge_workers | 4 |
| progress_judge | true |
| progress_judges | {"gemini-3-flash-preview": "google/gemini-3-flash-preview"} |
| smoke | false |
| serving.context_window | 28000 |
| serving.needs_tool_calls | true |
| serving.reuses_long_prefixes | true |
| preflight_first_cell | true |
目录结构(schema)
- rollouts/:自包含的记录(transcripts)
- results/:results.json + judge/eval 输出
- metadata/:run_meta.json + config + provenance
来源说明(provenance)
- 离线聚合(Offline aggregation);原始执行元数据保留在 metadata/source_runs/ 中。
ODCV:全部四次低风险(low-stakes)passes
四次 pass 均针对同一个 checkpoint:第一次 pass 在一个服务器会话中进行,随后三次连续 pass 在第二个会话中进行。Temperature 为 0.7;每个会话启动种子为 0;无逐请求种子。没有新的推理或评判(No new inference or judging)。计数不代表四个训练种子。
结果统计
| 变体(Variant) | 错位数 / rollouts(Misaligned / rollouts) | MR |
|---|---|---|
| Mandated | 24 / 160 | 15.0% |
| Incentivized | 23 / 160 | 14.375% |
| Overall | 47 / 320 | 14.6875% |
- 原生基于场景的 95% 置信区间(Native scenario-based 95% CI):[7.5, 26.9]
- 任务提交率(Task submission):316/320(98.75%)
补充说明
- 原始出版物及所有原始元数据/结果/卡片均保留在 metadata/source_runs/ 下。
- 原生结果区间包含场景变异;图表区间以固定基准为条件。
- 来源(Sources):ce9320ef、c7ff1667
搜集汇总
数据集介绍

构建方式
在大语言模型对齐评估领域,低风险情境下的模型行为表征日益受到重视,该数据集即针对这一需求而构建。其构建过程对dougalldeepmind/2026-09-22-qwen36-0-da-lowstakes-practical-7检查点执行了四轮独立推理,其中首轮在一个服务器会话中完成,随后三轮在另一会话中顺序执行,温度参数设定为0.7,每会话起始种子固定为0且不设逐请求种子。评估依托ODCV基准框架,配合gemini-3-flash-preview作为评判模型,原始执行元数据、评判输出及配置信息均完整保留于metadata/source_runs/目录之下,确保过程可追溯。
特点
该数据集的核心特征在于聚焦低风险实践场景中的模型错位行为,而非依赖高风险对抗性设定。其评估结果以错位率呈现,涵盖强制性与激励性两类变体,共产生320条rollout记录,其中任务提交率达98.75%。数据集区分了情境变异下的原生置信区间与固定基准下的图表区间,并明确声明四轮推理不代表四个训练种子,避免了对结果稳定性的过度解读。同时,数据集保留了原始发表物及全部源运行卡片,为后续复现与比较分析提供了透明基础。
使用方法
使用该数据集时,研究者可依据rollouts/目录获取自包含的对话转录,通过results/目录查阅results.json及评判器输出,并结合metadata/中的运行元数据与来源信息理解评估上下文。由于原始推理与评判过程不再重新执行,使用时应将统计数据视为对特定检查点在既定配置下的行为快照,而非跨模型或跨训练种子的泛化结论。在引用错位率时,需注意区分原生置信区间与固定基准区间,并参考provenance字段中关于离线聚合与源运行保留的说明,以确保分析结论的效度与可追溯性。
背景与挑战
背景概述
随着大语言模型能力持续跃升,其在开放环境中的价值对齐与失准行为评估成为人工智能安全领域的核心议题。在此背景下,ODCV评估基准应运而生,旨在系统检视模型在低风险实践场景中的失准倾向。该数据集由dougalldeepmind团队构建,于2026年9月发布,以Qwen3.6-27B为基座模型,在温度0.7条件下对同一检查点执行四轮低风险实践场景推演,借助Gemini-3-Flash-Preview作为评判模型,记录各变体下的失准比率与任务提交情况。其核心研究问题在于量化模型在指令约束与激励诱导两类情形下的行为偏差,为价值对齐研究提供可复现的实证基准,对模型安全评估领域具有方法学参考意义。
当前挑战
该数据集所应对的领域问题在于大语言模型在低风险实践任务中的失准行为识别与量化,要求在缺乏明确外部约束条件下捕捉模型潜在的偏差倾向,其难点在于失准行为的边界模糊且高度依赖场景语境,难以建立统一的判定准则。构建过程中面临的挑战包括:多轮推演间模型行为的非确定性使得结果一致性难以保证;评判模型自身的判断偏差可能引入评估噪声;场景多样性受限于基准固定化,导致置信区间对场景变化的敏感度较高;算力与超时约束要求并发调度与超时管理机制协同优化,以在有限资源下维持推演完整性。
常用场景
经典使用场景
在大模型对齐评估领域,开放动态约束验证(ODCV)构成检验模型在低风险实践情境下行为倾向的核心范式。该数据集以Qwen3.6-27B为基座,经由四次温度0.7的独立采样,在指令遵循与激励诱导两类变体下共收集320条自包含对话记录,每一条均配备完整裁判输出与溯源元数据。研究者借由此类评测架构,得以在受控但贴近真实交互的语境中,系统观测模型是否产生失准行为,从而为模型安全性的量化分级提供可复现的实证依据。
衍生相关工作
该数据集衍生出一系列围绕可复现评测与对齐验证的经典工作。其源仓库teaching_claude_why_replication与odcv-bench基准共同构成了后续研究的实验基础设施,推动了多裁判集成、场景超时控制及长前缀复用等评测方法的迭代。离线聚合与原始执行元数据分层保存的设计,亦被后续评测运行所借鉴,促进了失准评估从单次快照向多轮累积证据的范式演进,为模型行为研究提供了可扩展的方法论框架。
数据集最近研究
最新研究方向
在人工智能对齐评估领域,低风险场景下的模型失准行为探测正成为前沿焦点,该数据集围绕Qwen3.6-27B基座模型在ODCV基准上的四轮推理展开,以温度0.7、无每请求种子的配置,系统考察了强制与激励两种变体下的失准率,整体失准率达14.69%,场景级95%置信区间为[7.5, 26.9],任务提交率高达98.75%,为理解大模型在实践性低风险任务中的行为偏差提供了可复现的实证基线。其研究导向在于通过多轮次、多场景的离线聚合,揭示模型对齐稳健性的边界条件,并借助原生场景变异与固定基准条件的区分,推动评估方法从单一指标向包含不确定性量化的综合框架演进。该工作与当前对齐评估中强调生态效度与统计严谨性的热点趋势紧密呼应,对构建可信赖的AI系统具有方法论参考意义。
以上内容由遇见数据集搜集并总结生成




