遇见数据集

CalibForge

收藏
github2026-08-07 更新2026-08-08 收录
官方服务:

资源简介:

CalibForge是一个对抗性求解器校准数据集,用于扩展可学习的终端任务,包含5,431个校准的终端任务,涵盖16个领域。

CalibForge is an adversarial solver calibration dataset for expanding learnable terminal tasks, which comprises 5,431 calibrated terminal tasks across 16 domains.

创建时间:
2026-08-06
原始信息汇总

CalibForge 数据集详情

数据集简介

CalibForge 是一个用于扩展可学习终端任务的对抗性求解器校准数据集,由 AweAI-Team 团队发布,RUC AI Box 学生主要开发维护。该数据集的核心思想是将任务构建转化为受约束的对抗性作者-求解器循环:求解器代理尝试每个候选任务,验证结果确定任务是否处于目标能力区间,完整轨迹指导对指令、环境和验证器的修订。

核心亮点

  • 5,431 个校准终端任务,覆盖 16 个领域
  • 对抗性求解器校准:将任务修订至求解器相对可学习区间,而非保留所有可执行任务
  • 两种互补校准策略:多求解器校准针对异构求解器间的分歧,对比校准针对指定的强通过/弱失败关系
  • 强大且可迁移的性能:CalibForge-30B-A3B 和 CalibForge-35B-A3B 在 Terminal-Bench 2.0 上分别达到 32.58%47.57%,增益扩展至 SWE-bench Pro 和 Doc2Repo

数据规模与划分

划分 任务数 校准标准
Multi-solver 1,263 至少一个求解器通过且至少一个求解器失败
Contrastive 4,168 强求解器通过且弱求解器失败
总计 5,431 求解器相对可学习区间

发布内容还包括在共享 CalibForge-Eval 协议下蒸馏的成功轨迹。

任务格式

CalibForge 任务采用 Harbor 任务格式,每个任务打包为自包含的终端环境:

task_id/ ├── instruction.md ├── task.toml ├── environment/ │ ├── Dockerfile │ └── files/ └── tests/ ├── test.sh └── test_outputs.py

组件 描述
instruction.md 呈现给代理的自然语言任务规范
task.toml 任务元数据和运行时配置
environment/ Docker 定义和初始工件
tests/ 用于确定任务成功与否的可执行验证器

相关资源

模型

模型 骨干网络 Terminal-Bench 2.0
CalibForge-30B-A3B Qwen3-30B-A3B-Instruct 32.58%
CalibForge-35B-A3B Qwen3.5-35B-A3B 47.57%

CalibForge-Eval

以 AweAgent 中 Terminal-Bench 2.0 配方形式发布,提供用于轨迹蒸馏和 Terminal-Bench 2.0 评估的最小化 bash、文件编辑和完成工具脚手架。

实验结果

在 CalibForge 轨迹上训练持续提升两个骨干网络在终端和分布外软件工程基准上的表现:

模型 TB2 Acc. (%) ↑ SWE-Pro Resolved (%) ↑ Doc2Repo Pass Rate (%) ↑
Qwen3-30B-A3B-Instruct → CalibForge-30B-A3B 7.87 → 32.58 (+24.71) 3.26 → 30.94 (+27.68) 5.94 → 35.98 (+30.04)
Qwen3.5-35B-A3B → CalibForge-35B-A3B 39.10 → 47.57 (+8.47) 41.29 → 44.32 (+3.03) 44.92 → 48.77 (+3.85)

求解器校准效果

在匹配的 1,300 任务设置下,对抗性求解器校准比普通单求解器反馈带来更大增益:

构建模式 SFT轨迹数 TB2 Acc. (%) ↑ Δ vs. 无求解器
无求解器 2,466 22.47
单求解器 2,493 24.34 +1.87
多求解器校准 2,425 29.21 +6.74
对比求解器校准 2,561 31.09 +8.62

发布与下载

  • 完整数据发布在 Hugging Face(数据集地址:https://huggingface.co/datasets/AweAI-Team/CalibForge)
  • 可通过 Hugging Face CLI 下载:hf download AweAI-Team/CalibForge --repo-type dataset --local-dir CalibForge-data
  • 相关代码与评估配方可在 GitHub 仓库中获取(https://github.com/AweAI-Team/CalibForge 和 https://github.com/AweAI-Team/AweAgent/tree/main/recipes/terminal_bench_v2)
搜集汇总
数据集介绍
CalibForge 数据集图片
构建方式
CalibForge数据集构建了一套创新的对抗式作者-求解器循环机制,将任务构建转化为受限的对抗过程。具体而言,求解器代理对每个候选任务进行尝试,验证结果判定任务是否落入目标能力区间,完整轨迹则用于指导指令、环境及验证器的修订。该过程支持两种互补的校准策略:多求解器校准保留至少一个求解器成功且另一个失败的任务,对比校准则保留指定强求解器成功而弱求解器失败的任务。通过这种方式,数据集最终汇聚了覆盖16个领域的5,431个校准终端任务,每个任务均以Harbor格式封装,包含指令、元数据、Docker环境及可执行验证器。
特点
CalibForge的核心特点在于其对抗性求解器校准策略,它并非保留所有可执行任务,而是将任务调整至求解器相对的“可学习区域”,确保任务具有适度的挑战性。多求解器校准关注异构求解器间的分歧,而对比校准则针对指定的强-弱关系,两者均以可验证的求解能力为锚点,避免了任务被统一解决的平凡性。此外,数据集附带成功轨迹,这些轨迹在统一的CalibForge-Eval协议下蒸馏,增强了训练的迁移性。实验表明,基于该数据集训练的模型在Terminal-Bench 2.0上取得了显著提升,并展现出跨基准的泛化能力。
使用方法
用户可通过Hugging Face CLI便捷下载数据集,命令为`hf download AweAI-Team/CalibForge --repo-type dataset --local-dir CalibForge-data`,随后参考数据集卡片获取文件与加载指引。任务以Harbor格式组织,每个任务目录包含instruction.md、task.toml、environment/及tests/,便于直接用于训练或评估。此外,团队发布了CalibForge-Eval评估配方,集成于AweAgent框架,用户可通过运行`python recipes/terminal_bench_v2/run.py --task-data-dir /path/to/tasks --data-file /path/to/instance_ids.json`来执行终端任务评估,配方文档详细说明了模型配置与并发执行选项。
背景与挑战
背景概述
CalibForge数据集由中国人民大学AI Box学生团队于2026年构建,旨在解决终端智能体训练中任务可执行性与可学习性之间的核心矛盾。传统任务构建仅关注可执行与可验证性,却忽视了任务难度与智能体能力的匹配,导致训练数据效率低下。CalibForge创新性地提出对抗性求解器校准机制,通过多求解器与对比式两种策略,将任务修订至求解器相关的可学习区间,构建了涵盖16个领域、总计5,431个校准任务的基准。该数据集在Terminal-Bench 2.0上显著提升了模型性能,并展现出对SWE-bench Pro等外分布基准的强泛化能力,为可学习终端任务规模化提供了新范式。
当前挑战
CalibForge面临的核心挑战在于构建过程中需同时满足任务的可执行性、可验证性与可学习性三重约束。具体而言,对抗性作者-求解器循环要求迭代修订指令、环境与验证器,计算开销巨大且需精细设计约束条件。多求解器校准需协调异构求解器间的能力差异,而对比式校准则需精准界定强弱求解器的能力区间,避免任务难度失衡。此外,确保任务在跨域分布下保持难度一致性,并避免过度拟合特定求解器,是提升数据集泛化能力的关键难题。这些挑战共同制约着终端任务规模化与智能体训练效率的进一步提升。
常用场景
经典使用场景
CalibForge数据集是终端智能代理(terminal agent)训练领域的里程碑式资源,其核心经典使用场景在于为可学习的终端任务提供精细化校准的规模化工具体系。该数据集通过对抗性求解器校准机制,将任务构建转化为受限的对抗性作者-求解器循环,其中求解器代理对每个候选任务进行尝试,已验证的结果决定任务是否落在目标能力区间内,完整轨迹则指导指令、环境和验证器的修订。这一设计使得CalibForge不仅提供了5,431个跨越16个领域的终端任务,还确保了任务难度与求解器能力相匹配,有效避开了统一可解或完全不可解的极端情形,为终端智能体的监督微调(SFT)和强化学习提供了高质量、难度分布合理的训练数据。
解决学术问题
该数据集解决了终端任务构建中长期存在的关键学术难题:任务可执行性和可验证性并不直接等同于其学习价值。传统数据集的构建仅关注任务的有效性,却忽略了任务对学习过程的难度适配,导致模型训练面临低效益或过拟合风险。CalibForge通过多求解器校准和对比校准两种互补策略,分别捕捉不同求解器间的分歧以及指定强-弱求解器的相对性能,从而将任务锚定在具备示范可解性且避免均匀可解的“可学习区域”内。这一方法论上的创新,从实证角度验证了求解器校准对终端任务学习的显著增益(如相较单求解器反馈可提升约8.6%的准确率),为任务难度量化、智能体能力评估及泛化性研究提供了新的理论视角和实践工具。
衍生相关工作
CalibForge的提出催生了多项相关研究和技术工作。其核心思想——“求解器校准”已被后续研究广泛借鉴,衍生出基于多代理分歧或强-弱对比的动态任务难度调整策略,推动了课程学习与自博弈在终端任务生成中的融合。CalibForge-Eval作为开源评估协议,成为多个终端智能体项目复现和比较的基准,促进了Terminal-Bench系列基准的生态扩展。此外,该数据集释放的成功轨迹和模型权重,为后续的偏好优化(如DPO)和多任务学习提供了数据基础,相关论文探讨了轨迹质量对模型泛化的影响,并延伸出面向更复杂终端环境的任务生成框架,形成了以“校准—训练—评测”为闭环的研究脉络,在智能体学习领域产生了持续的影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务