遇见数据集

2026-08-21-odcv-da-chunk-only-702-eval

收藏
Hugging Face2026-08-24 更新2026-08-25 收录
官方服务:

资源简介:

ODCV-Bench 是一个用于评估语言模型对齐错误率(misalignment rate)的基准数据集。本子集为 chunk-only 变体,专注于 difficult-advice 场景,在细化和修订阶段不注入完整宪法(constitution),仅允许每个阶段接触单一原则。数据集包含 130 个样本(65 个场景单元,每个单元执行 2 次 rollout),通过 2 次 rollout 混合后由多个评判模型(如 x-ai/grok-4.20、google/gemini-3.1-pro-preview)评估对齐错误率和严重性。数据内容包括 agent 日志、逐场景中位数摘要、评估分数等,适用于文本生成任务以及安全对齐相关研究。

ODCV-Bench is a benchmark dataset for evaluating the misalignment rate of language models. This subset is a chunk-only variant, focusing on the difficult-advice scenario, where the full constitution is not injected during refinement and revision stages, and only a single principle is exposed per stage. The dataset contains 130 samples (65 scenario units, each with 2 rollouts). After mixing the 2 rollouts, multiple evaluation models (e.g., x-ai/grok-4.20, google/gemini-3.1-pro-preview) are used to assess misalignment rate and severity. The data includes agent logs, per-scenario median summaries, and evaluation scores, suitable for text generation tasks and safety alignment research.

创建时间:
2026-08-22
原始信息汇总

ODCV-Bench 数据集详情总结

数据集概述

  • 数据集名称:ODCV-Bench — difficult-advice generated WITHOUT the full constitution in refinement
  • 数据集地址:https://huggingface.co/datasets/LASR-Callum/2026-08-21-odcv-da-chunk-only-702-eval
  • 许可证:Apache-2.0
  • 任务类别:文本生成(text-generation)

数据集内容

  • 核心实验:ODCV-Bench 基准测试,针对“chunk-only”困难建议方案(difficult-advice arm)的评估。
  • 实验背景:该方案是宪法消融实验。基线配方在五个LLM阶段中的两个阶段(revise_promptsrevise_responses)注入完整宪法,而本方案删除了这两个注入,使任何阶段每次只能看到一个原则。同时,宪法的“前言”部分(优先级/冲突解决章节)也无法通过删除的槽位传给生成器。
  • 主要结论:从细化过程中移除完整宪法并未提高错位率(MR),点估计低于所有其他困难建议方案,但置信区间相互重叠。该结果被视为“无可检测的成本”,而非改进,因为样本量较小(65 cells × 2 rollouts),区间较宽。

主要结果

  • 错位率(MR):11.5%,95% 置信区间为 [6.2, 19.6]
  • 严重度:0.62
  • 样本量:n=130(2 次 rollout × 65 cells)

与其他方案对比(同一 65 cells)

方案 MR 95% CI
c6masked 9.7% [5.5, 13.9]
chunk-only 702(本数据集) 11.5% [6.2, 19.6]
synthdoc-716 (v1) 14.3% [9.3, 19.0]
da716 (v2) 16.3% [10.0, 21.8]
lessswap716 16.5% [11.2, 21.4]
t10-curiosity 716 19.7% [10.9, 30.0]
base fp8 (no SFT) 36.9% [21.4, 53.6]
table2-only (0% SFT) 43.9% [37.5, 53.1]

实验配置

  • 实验名称:ODCV-Bench 在 chunk-only 困难建议方案上的评估;2 次通过 × 65 cells,合并后进行判定。
  • 生成日期:2026-08-24
  • 宪法文件constitutions/claude_distilled_12_principles_mid/constitution.md —— 语料库由该宪法生成,但其两个细化阶段并未看到它。
  • 来源仓库:https://github.com/Matthew-Bozoukov/Lessons_from_constituitional_AFT.git (提交号 ef73597f40234b3b887a73a790a6484be4af6d58
  • 使用模型
    • 目标模型:LASR-Callum/qwen3.6-27b-lora-t2-9284-da-chunk-only-702-r64-dynbatch,由 vLLM 在单块 H200 上部署(max_model_len 65536,思考模式固定,启用自动工具选择和对应的解析器)
    • 判定模型:x-ai/grok-4.20google/gemini-3.1-pro-preview
  • 生成配置:温度为 0.0,场景超时 2400 秒,每 cell 2 次 rollout,共 65 个 cells(15 个排除项:10 个兄弟方案 + 5 个同伴评审)
  • 数据模式
    • combined2x_*/results.json(每场景中位数 + 摘要)
    • evaluations/scores_<judge>.json
    • agent_logs/.../rollout_NNN/messages_record.txt(自包含 rollout 记录)
    • passes/laptop/<ts>/(每次通过的审计)
  • 溯源信息bash scratch/da_chunk_only/odcv_local_run.sh <ip> <port> 2 12 后接 scratch/odcv_combine_passes.pyscratch/odcv_judge_cli.py,配置文件为 scratch/da_chunk_only/odcv_bench_t2_9284_da_chunk_only_702_2x65.yaml
  • 图表scratch/da_chunk_only/plot_arms.py(柱状图/变体图),基于每个方案发布的每场景中位数在同一 65 cells 上重新计算,无重跑。
搜集汇总
数据集介绍
2026-08-21-odcv-da-chunk-only-702-eval 数据集图片
构建方式
该数据集源自一项针对宪法式人工智能微调中提示注入效应的消融研究,其构建以完整宪法文本为蓝本,但在语料生成阶段刻意移除了‘修订提示’与‘修订回复’两个环节中的宪法注入,使得生成器在每个决策点仅能接触单一原则,而无法获知宪法序言中的优先级与冲突解决规则。语料由此围绕12项蒸馏原则展开,经五阶段大语言模型流水线加工,最终在65个评估单元上执行两次独立推演,并以组合方式记录每次推演的场景中位数与汇总结果,形成对‘无完整宪法可见性’条件下模型行为偏差的系统性刻画。
特点
该数据集的核心特征在于其高度受控的消融设计:与基线相比,唯一变量是精炼阶段是否暴露完整宪法,从而将误导性建议率的差异归因于宪法注入的有无。评估覆盖65个单元格,每格两次推演,并辅以两套独立裁判模型进行打分,降低了单一评判者的偏置风险。结果以误导率、严重度及置信区间等指标呈现,并附带逐场景中位数、裁判评分与自包含的代理日志,使得偏差来源可追溯至具体对话轮次与原则片段,为细粒度分析提供了充分的数据基础。
使用方法
使用该数据集时,研究者可借助配套脚本复现完整的评估流程:先以vLLM在单张H200上部署经LoRA微调的目标模型,锁定思考模式并启用工具调用与推理解析器;随后运行本地评估脚本执行指定轮次与并发数的推演,再通过组合脚本整合多次推演结果,最后调用裁判接口生成评分。数据可直接从HuggingFace加载,亦可通过源码仓库中的配置文件与绘图脚本,将本臂结果与同族其他消融臂在相同单元格上进行对比,从而用于研究宪法可见性对模型对齐行为的影响。
背景与挑战
背景概述
大型语言模型的价值对齐研究长期依赖完整规范文本的监督信号,而规范注入方式对模型行为的影响尚缺乏系统性实证。2026年,研究人员基于Qwen3.6-27B架构,通过LoRA微调构建了ODCV-Bench系列评估基准,旨在检验宪法式AI反馈训练中规范注入策略与模型错位倾向之间的因果关联。该数据集聚焦于"困难建议"生成场景,创造性地将完整宪法从精炼阶段剥离,仅保留分块原则,以探测规范完整性对对齐效果的边际贡献。作为宪法注入消融实验的关键一环,该基准为理解规范监督的冗余性与必要性提供了可复现的量化依据,对AI安全评估方法论具有参考价值。
当前挑战
该数据集直面价值对齐评估中规范注入策略的因果归因难题,即完整宪法文本的在场与否是否实质性地影响模型产生错位建议的概率。构建过程中需在保持提示模板、采样温度、场景集合等变量严格受控的前提下,实现宪法 preamble 与分块原则的精确剥离,同时确保目标模型在思考模式下以零温度生成,避免随机性对错位率估计的干扰。评估环节需协调双法官模型对多轮 rollout 进行一致性判定,并在65个细胞、2次重复的小样本条件下给出稳健的置信区间,这对实验设计的正交性与统计推断的可靠性构成显著挑战。
常用场景
经典使用场景
在大语言模型对齐评测领域,ODCV-Bench数据集作为一项消融实验的评测基准,其经典使用场景围绕“宪法注入”机制展开。该数据集聚焦于困难建议生成任务,通过移除精炼阶段中完整宪法(包括序言及优先级冲突解决部分)的注入,构造出仅以单条原则为条件的生成臂。研究者利用此臂与包含完整宪法注入的基线及其他消融臂进行对比,在相同65个评估单元上以双轮次采样方式,量化分析移除全宪法对模型失配率的影响,从而揭示宪法分块策略在生成任务中的实际作用边界。
解决学术问题
该数据集着力解决对齐研究中关于宪法内容粒度与注入阶段对模型行为影响的关键学术问题。具体而言,它探究了在困难建议生成流程的精炼环节中,省略完整宪法及其序言是否会导致失配率上升。实验结果表明,移除全宪法并未引发可检测的失配代价,其点估计值低于其他困难建议臂,且置信区间相互重叠。这一发现挑战了“完整宪法注入不可或缺”的默认假设,为理解宪法式训练中分块原则的独立贡献提供了实证依据,推动了对齐策略从粗放注入向精细化原则组合的范式转变。
衍生相关工作
围绕该数据集衍生的经典工作主要集中在宪法分块策略与失配率评测的交叉领域。同系列工作包括c6masked、synthdoc-716、da716、lessswap716及t10-curiosity等消融臂,它们在相同65个评估单元上进行了并行比较,形成了对宪法注入方式的多维度剖析。此外,表格2专用模型与基础fp8模型的对比工作进一步拓展了该基准的应用范围。这些衍生实验共同构建了一个可复现的评测生态,推动了宪法式训练从整体注入向分块条件生成的演进,并为后续研究提供了标准化的数据划分与评分流程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务