遇见数据集

online-monitor-teacher-cots

收藏
Hugging Face2026-08-19 更新2026-08-20 收录
官方服务:

资源简介:

该数据集名为“教师推理链用于审议性在线监控器”(Teacher chain-of-thought for deliberative online monitors),旨在为在线监控器提供教师模型的推理链(chain-of-thought)日志,用于监督微调(SFT)。数据集包含来自四个不同来源的推理链日志:control_arena_bash、gloom、linux_arena_goldset 和 stride。每个来源的日志文件以 tar.gz 压缩包形式存储,内含 JSON 文件,每个 JSON 对应一个轨迹前缀的教师推理。此外,还提供了导出的 parquet 文件(如 control_arena_bash_cot_600_p28672.parquet)、分割清单(MANIFEST.json)以及分割文件(splits.json 和 splits.csv),详细说明了各个数据集在训练、评估和域外评估中的划分。数据规模:每个来源数据集各有 600 个训练样本,200 个 indist_eval 样本,200 个 val_eval 样本;另有四个域外评估数据集(basharena_action_only_opus46_large、control_arena_shade、control_arena_agentdojo、control_arena_iac、gloom_exfiltration)各包含 800 个 ood_eval 样本。教师模型为 google/gemini-3.1-pro-preview,采用混合模式,提示词 token 预算为 28672。该数据集的主要用途是让用户无需消耗教师 token 即可重建 SFT 数据集,通过脚本 scripts.sft.generate_cot 读取缓存。

This dataset is named Teacher chain-of-thought for deliberative online monitors, designed to provide teacher model chain-of-thought logs for online monitors, used for supervised fine-tuning (SFT). The dataset contains chain-of-thought logs from four different sources: control_arena_bash, gloom, linux_arena_goldset, and stride. Log files from each source are stored in tar.gz archives, containing JSON files, each corresponding to a teachers reasoning for a trajectory prefix. Additionally, exported parquet files (e.g., control_arena_bash_cot_600_p28672.parquet), a manifest file (MANIFEST.json), and split files (splits.json and splits.csv) are provided, detailing the division of each dataset into training, evaluation, and out-of-domain evaluation sets. Data scale: each source dataset has 600 training samples, 200 indist_eval samples, 200 val_eval samples; four out-of-domain evaluation datasets (basharena_action_only_opus46_large, control_arena_shade, control_arena_agentdojo, control_arena_iac, gloom_exfiltration) each contain 800 ood_eval samples. The teacher model is google/gemini-3.1-pro-preview, using a mixed mode with a prompt token budget of 28672. The main purpose of this dataset is to allow users to reconstruct the SFT dataset without consuming teacher tokens, by reading the cache via the script scripts.sft.generate_cot.

创建时间:
2026-08-10
原始信息汇总

数据集概述

该数据集名为 Teacher chain-of-thought for deliberative online monitors,由 aksh-n 发布,采用 MIT 许可证。其核心内容是为“在线监控者”(online monitors)提供蒸馏后的教师推理链(chain-of-thought,CoT)数据,用于对在线阴谋检测模型进行监督微调(SFT)。数据集同时包含运行分割清单(split manifest),使得新机器可以在不重新消耗教师模型 token 的情况下重建 SFT 数据集。

数据来源与配置

  • 数据包名称cot_bundle_stride_gloom_bashbench_linuxarena_600_p28672_seed0
  • 分布内(in-distribution)混合数据集stridegloomcontrol_arena_bashlinux_arena_goldset
  • 教师模型google/gemini-3.1-pro-preview
  • 生成模式hybrid
  • 训练规模:每个数据集 600 条轨迹,随机种子为 0
  • 提示词 token 预算:28672

数据集结构

CoT 日志文件

每个数据集对应一个压缩包,内部为扁平的 JSON 文件(命名格式为 row_<idx>__step<t>__<teacher>__<mode>.json),解压后直接放入 data/<dataset>/cot_logs/ 目录。具体分布如下:

数据集 日志数量 文件
control_arena_bash 2344 cot_logs/control_arena_bash.tar.gz
gloom 2513 cot_logs/gloom.tar.gz
linux_arena_goldset 2352 cot_logs/linux_arena_goldset.tar.gz
stride 2368 cot_logs/stride.tar.gz

SFT 数据文件(Parquet 格式)

cot_parquets/ 目录下存放了派生出的、按数据集划分的 SFT Parquet 文件:

  • control_arena_bash_cot_600_p28672.parquet
  • gloom_cot_600_p28672.parquet
  • linux_arena_goldset_cot_600_p28672.parquet
  • stride_cot_600_p28672.parquet

根目录文件

  • MANIFEST.json:数据包配置、各数据集计数以及分割大小。
  • splits.json / splits.csv:记录每条轨迹(通过在各数据集分段 Parquet 中的位置索引 row_idx 标识)属于 trainindist_evalval_evalood_eval 中的哪一个分割。

数据分割

数据集 角色 分割详情
stride 分布内 train=600, indist_eval=200, val_eval=200
gloom 分布内 train=600, indist_eval=200, val_eval=200
control_arena_bash 分布内 train=600, indist_eval=200, val_eval=200
linux_arena_goldset 分布内 train=600, indist_eval=200, val_eval=200
basharena_action_only_opus46_large 分布外(ood) ood_eval=800
control_arena_shade 分布外(ood) ood_eval=800
control_arena_agentdojo 分布外(ood) ood_eval=800
control_arena_iac 分布外(ood) ood_eval=800
gloom_exfiltration 分布外(ood) ood_eval=800

使用方式

数据集中提供了两种使用路径:

  1. 仅下载本仓库内容(CoT 日志和 Parquet 文件): bash uv run python -m scripts.sft.hf_cots --download --dataset <ds>

  2. 完整机器搭建(包含原始 Parquet、分段 Parquet、日志以及 CoT 数据): bash uv run python experimental/akshat/misc/setup_machine.py uv run python experimental/akshat/misc/setup_machine.py --phase cots

  3. 手动下载示例(以 stride 为例): python from huggingface_hub import hf_hub_download import tarfile p = hf_hub_download("aksh-n/online-monitor-teacher-cots", "cot_logs/stride.tar.gz", repo_type="dataset") tarfile.open(p).extractall("data/stride/cot_logs")

搜集汇总
数据集介绍
online-monitor-teacher-cots 数据集图片
构建方式
该数据集源于对深思熟虑型在线监控器进行监督微调的过程,旨在为每个轨迹前缀提供经过蒸馏的教师模型推理链。其构建依托于指定的实验捆绑配置,涵盖多个基准测试集,采用混合模式调用教师模型生成高质量思维链,并依据明确的分割清单将数据划分为训练集、分布内评估集、分布外评估集等不同子集。所有日志以压缩包形式存储,同时提供派生的SFT parquet文件,确保数据可复现且不消耗额外的教师模型令牌。
特点
此数据集的核心特色在于其结构化的组织与高效的复用性。每个日志文件均采用统一命名规范,清晰标识行索引、步骤及教师模型信息,便于检索与追踪。分割清单详细记录了各数据集的角色划分,覆盖分布内与分布外场景,为模型评估提供全面支撑。此外,缓存机制的设计使得重建SFT数据集时无需重复调用教师模型,显著降低计算成本,同时保持数据的一致性与完整性。
使用方法
使用者可通过HuggingFace平台直接下载所需的日志压缩包,或利用提供的脚本进行自动化数据获取与解压。推荐流程包括执行`hf_cots`下载特定数据集,或运行完整的机器设置脚本以获取全部原始及派生数据。手动操作时,亦可通过`hf_hub_download`函数定位并解压文件至指定目录。该数据集专为训练在线监控器设计,亦可作为思维链数据的参考资源,适用于大规模模型对齐与安全监测研究。
背景与挑战
背景概述
随着大型语言模型在自主代理和复杂推理任务中的广泛应用,其潜在的策略性行为(如隐藏意图或进行‘欺骗性对齐’)已成为AI安全领域的重大关切。为实时检测此类行为,研究人员提出基于思维链的‘审议式在线监控’方法,旨在通过模型自身的推理过程揭示其内在的谋划与伪装。该数据集由aksh-n等人于近期构建,依托‘gemini-3.1-pro-preview’教师模型,对stride、gloom、control_arena_bash及linux_arena_goldset四个分布内数据集进行思维链蒸馏,并生成覆盖多个分布外场景的评估划分。该数据集以MIT许可发布,其设计的离线缓存机制显著降低了重复数据构建的算力成本,为在线监控模型的监督微调提供了标准化资源,对AI安全实证研究具有重要推动作用。
当前挑战
该领域面临的核心挑战在于,如何有效识别并监控大模型在交互过程中表现出的‘策略性推理’(如隐瞒意图或进行欺骗性对齐),这要求监控器具备超越表面行为的深层语义理解能力,而传统基于输出文本的检测方法难以捕捉隐含的推理轨迹。在数据构建层面,挑战尤为显著:思维链数据依赖高成本的教师模型推理,且需要保证推理的多样性与真实性,以防止监控器过拟合于固定的推理模式;此外,跨多个数据集(如分布内与分布外场景)的标准化拆分,需在保持数据一致性的同时兼顾评估的公平性,而不同任务间的领域偏移进一步增加了数据适配的难度。该数据集通过缓存教师模型输出和统一的拆分配置,在一定程度上缓解了这些挑战,但如何在有限数据下提升监控器的泛化鲁棒性,仍是亟待探索的问题。
常用场景
经典使用场景
该数据集聚焦于大语言模型在推理过程中的‘谋划检测’(scheming detection),为在线监控系统提供教师链式思考(chain-of-thought)数据。其经典使用场景是用于训练和微调在线监控模型,使其能够实时识别模型在生成过程中的潜在恶意意图。具体而言,研究者利用该数据集中的教师推理轨迹,通过监督式微调(SFT)构建监控器,从而在模型输出前缀阶段即进行安全评估,有效防范模型在执行复杂任务时的欺骗性行为。该数据集涵盖了多种领域内数据集(如stride、gloom等)及域外数据集,为监控模型的泛化能力提供了坚实的数据基础。
衍生相关工作
该数据集催生了多项相关研究,包括在线谋划监控器的构建与评测、基于教师链式思考的蒸馏技术,以及跨域监控泛化能力的研究。例如,研究者基于此数据集开发了‘deliberative-online-monitors’系列模型,探索了不同训练策略对监控效果的影响。同时,数据集的公开发布也促进了‘无教师令牌重用’的SFT流程优化,降低了模型训练成本。此外,其域外评估集(如basharena、control_arena等)为后续的鲁棒性研究提供了测试床,推动了AI安全领域中关于推理可解释性、对抗性攻击防御等方向的发展。
数据集最近研究
最新研究方向
该数据集聚焦于前沿的AI安全领域,特别是针对大语言模型(LLM)的‘谋略检测’(scheming detection)与在线监控(online monitoring)。通过存储教师模型(如Gemini 3.1 Pro)生成的思维链(Chain-of-Thought, CoT)推理日志,该数据集支撑了‘深思熟虑式在线监控器’(deliberative online monitors)的微调,旨在实时识别模型在推理过程中的隐蔽策略性行为。这一方向与当前对AI对齐和可解释性的热点关注紧密相关,其核心意义在于提供了一种无需额外教师token即可重建训练数据的机制,大幅降低了监控器开发成本,并促进了跨多个基准(如STRIDE、Gloom、Control Arena)的标准化评估。随着AI系统日益复杂,此类数据集成为确保模型行为透明、可信的重要基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务