v6
收藏资源简介:
该数据集涉及两个数学问题集:MATH100用作源材料,由Qwen3-30B-A3B-Thinking模型处理生成150个思维链(CoTs),输出保存为raw_cots.jsonl文件;AIME 2025包含15个问题,用作评估推理时激活控制技术的测试集。README未提供数据集的背景、具体内容、规模或字段结构描述,仅作为项目工作流程的输入和输出文件。
This dataset involves two math problem sets: MATH100 is used as source material, processed by the Qwen3-30B-A3B-Thinking model to generate 150 chains of thought (CoTs), with outputs saved as raw_cots.jsonl file; AIME 2025 contains 15 problems, used as a test set for evaluating reasoning-time activation control techniques. The README does not provide any description of the datasets background, specific content, scale, or field structure, positioning them only as input and output files in the project workflow.
数据集概述:v10 — Monitoring + Planning Activation Steering
基本信息
- 数据集名称: v10 — Monitoring + Planning Activation Steering
- 页面地址: https://huggingface.co/datasets/JulianHJR/v6
- 核心模型: Qwen3-30B-A3B-Thinking
v10 相对于 v9 的主要更新
| 组件 | v9 | v10 |
|---|---|---|
| CoT 来源 | 预先存在的 raw_cots.jsonl |
阶段00:模型从 MATH100 生成150条 CoT |
| 维度 | 仅监控(monitoring) | 监控 + 规划(monitoring + planning) |
| 推理测试集 | 6个硬编码问题 | 15个 AIME 2025 问题 |
| 推理逻辑 | mono + think + plain 变体 | 仅 allmono(最清晰) |
| 恢复机制 | 部分恢复 | 每个阶段完整恢复(原子写入,逐层 JSON 缓存) |
| Slurm 支持 | 2个 sbatch 文件 | 3个 sbatch 文件(完整/仅推理/双维度) |
流水线(Pipeline)
| 阶段 | 说明 | 预计耗时 |
|---|---|---|
| Stage 00 | 生成 CoT(150个问题 × Qwen3-30B 贪婪解码) | 约 2-4 小时 |
| Stage 01 | 标记 + 捕获(每个维度) | 约 1.5 小时 |
| Stage 02 | 构建方向(CREST PCA 去噪均值差分,每个维度) | 约 10 分钟 |
| Stage 03 | 校准(20个问题 × 层数 × 3个 alpha,每个维度) | 约 10-14 小时 |
| Stage 03b | 选择层(贪婪选择,仅 CPU) | 约 1 分钟 |
| Stage 04 | 推理 AIME25(15个问题 × 4个 alpha,allmono,每个维度) | 约 1-2 小时 |
使用方法
单个维度(默认:监控)
bash bash runall.sh
规划维度
bash DIMENSION=planning bash runall.sh
双维度
bash DIMENSION=all bash runall.sh
跳过 CoT 生成(已存在时)
bash STAGES=01,02,03,03b,04 bash runall.sh
仅重新运行推理
bash STAGES=04 bash runall.sh
Slurm 调度
| 命令 | 说明 |
|---|---|
sbatch slurm/run-v10.sbatch |
完整流水线(监控维度) |
sbatch --export=DIMENSION=planning slurm/run-v10.sbatch |
完整流水线(规划维度) |
sbatch slurm/run-v10-all.sbatch |
双维度 |
sbatch slurm/run-v10-04.sbatch |
仅重新运行推理 |
断点恢复
- 每个阶段在执行前检查其输出文件是否存在
- 传递
--force参数可强制重新计算 - 校准恢复:逐层进行,若
data/{dim}/checkpoints/calib_per_layer/layer_XXX.json存在则跳过该层 - 推理恢复:逐记录进行,已完成的(问题, alpha)对缓存于
data/{dim}/results/infer_cache.jsonl - 阶段00恢复:逐问题进行
环境变量
| 变量名 | 默认值 | 说明 |
|---|---|---|
MODEL_PATH |
/data/.../Qwen3-30B-A3B-Thinking-2507 |
模型本地路径 |
MATH100_PATH |
data/math100.jsonl |
MATH100 数据集 |
AIME25_PATH |
data/aime25.jsonl |
15个 AIME 2025 问题(已打包) |
RAW_COTS_PATH |
data/cots/raw_cots.jsonl |
生成的 CoT(由阶段00写入) |
DIMENSION |
monitoring |
运行的维度(monitoring/planning/all) |
STAGES |
00,01,02,03,03b,04 |
逗号分隔的待执行阶段 |
输出结构
data/ cots/raw_cots.jsonl # 150条生成的 CoT(阶段00) monitoring/ labeled_cots_monitoring.jsonl activations/activations_monitoring.pt checkpoints/ directions_monitoring.pt calibration_monitoring.json selected_layers_monitoring.json calib_per_layer/layer_XXX.json # 逐层恢复缓存 results/ alpha_comparison_monitoring.json # 最终交付物 infer_cache.jsonl planning/ ...(相同结构)




