CalibForge
收藏资源简介:
CalibForge是一个对抗性求解器校准数据集,用于扩展可学习的终端任务,包含5,431个校准的终端任务,涵盖16个领域。
CalibForge is an adversarial solver calibration dataset for expanding learnable terminal tasks, which comprises 5,431 calibrated terminal tasks across 16 domains.
CalibForge 数据集详情
数据集简介
CalibForge 是一个用于扩展可学习终端任务的对抗性求解器校准数据集,由 AweAI-Team 团队发布,RUC AI Box 学生主要开发维护。该数据集的核心思想是将任务构建转化为受约束的对抗性作者-求解器循环:求解器代理尝试每个候选任务,验证结果确定任务是否处于目标能力区间,完整轨迹指导对指令、环境和验证器的修订。
核心亮点
- 5,431 个校准终端任务,覆盖 16 个领域
- 对抗性求解器校准:将任务修订至求解器相对可学习区间,而非保留所有可执行任务
- 两种互补校准策略:多求解器校准针对异构求解器间的分歧,对比校准针对指定的强通过/弱失败关系
- 强大且可迁移的性能:CalibForge-30B-A3B 和 CalibForge-35B-A3B 在 Terminal-Bench 2.0 上分别达到 32.58% 和 47.57%,增益扩展至 SWE-bench Pro 和 Doc2Repo
数据规模与划分
| 划分 | 任务数 | 校准标准 |
|---|---|---|
| Multi-solver | 1,263 | 至少一个求解器通过且至少一个求解器失败 |
| Contrastive | 4,168 | 强求解器通过且弱求解器失败 |
| 总计 | 5,431 | 求解器相对可学习区间 |
发布内容还包括在共享 CalibForge-Eval 协议下蒸馏的成功轨迹。
任务格式
CalibForge 任务采用 Harbor 任务格式,每个任务打包为自包含的终端环境:
task_id/ ├── instruction.md ├── task.toml ├── environment/ │ ├── Dockerfile │ └── files/ └── tests/ ├── test.sh └── test_outputs.py
| 组件 | 描述 |
|---|---|
instruction.md |
呈现给代理的自然语言任务规范 |
task.toml |
任务元数据和运行时配置 |
environment/ |
Docker 定义和初始工件 |
tests/ |
用于确定任务成功与否的可执行验证器 |
相关资源
模型
| 模型 | 骨干网络 | Terminal-Bench 2.0 |
|---|---|---|
| CalibForge-30B-A3B | Qwen3-30B-A3B-Instruct | 32.58% |
| CalibForge-35B-A3B | Qwen3.5-35B-A3B | 47.57% |
CalibForge-Eval
以 AweAgent 中 Terminal-Bench 2.0 配方形式发布,提供用于轨迹蒸馏和 Terminal-Bench 2.0 评估的最小化 bash、文件编辑和完成工具脚手架。
实验结果
在 CalibForge 轨迹上训练持续提升两个骨干网络在终端和分布外软件工程基准上的表现:
| 模型 | TB2 Acc. (%) ↑ | SWE-Pro Resolved (%) ↑ | Doc2Repo Pass Rate (%) ↑ |
|---|---|---|---|
| Qwen3-30B-A3B-Instruct → CalibForge-30B-A3B | 7.87 → 32.58 (+24.71) | 3.26 → 30.94 (+27.68) | 5.94 → 35.98 (+30.04) |
| Qwen3.5-35B-A3B → CalibForge-35B-A3B | 39.10 → 47.57 (+8.47) | 41.29 → 44.32 (+3.03) | 44.92 → 48.77 (+3.85) |
求解器校准效果
在匹配的 1,300 任务设置下,对抗性求解器校准比普通单求解器反馈带来更大增益:
| 构建模式 | SFT轨迹数 | TB2 Acc. (%) ↑ | Δ vs. 无求解器 |
|---|---|---|---|
| 无求解器 | 2,466 | 22.47 | – |
| 单求解器 | 2,493 | 24.34 | +1.87 |
| 多求解器校准 | 2,425 | 29.21 | +6.74 |
| 对比求解器校准 | 2,561 | 31.09 | +8.62 |
发布与下载
- 完整数据发布在 Hugging Face(数据集地址:https://huggingface.co/datasets/AweAI-Team/CalibForge)
- 可通过 Hugging Face CLI 下载:
hf download AweAI-Team/CalibForge --repo-type dataset --local-dir CalibForge-data - 相关代码与评估配方可在 GitHub 仓库中获取(https://github.com/AweAI-Team/CalibForge 和 https://github.com/AweAI-Team/AweAgent/tree/main/recipes/terminal_bench_v2)





