cyber-task-horizons
收藏资源简介:
该数据集用于重现论文中的图表、表格和统计数据,包含原始评估日志、模型运行数据、任务难度数据等。数据集可用于再现论文结果、进行自定义IRT分析、分析模型在网络安全任务上的行为、研究专家如何解决安全任务、探索令牌预算扩展以及比较人类和模型难度估计等。
This dataset is intended to reproduce the figures, tables, and statistical data presented in the corresponding paper, and includes original evaluation logs, model runtime data, task difficulty data, and other relevant resources. It can be used to reproduce paper results, perform custom Item Response Theory (IRT) analyses, examine model behaviors on cybersecurity tasks, study how experts solve security-related tasks, explore token budget scaling, and compare human and model difficulty estimates, among other use cases.
数据集概述
数据集基本信息
- 数据集名称:Offensive Cyber Task Horizons: Data and Analysis
- 存储库地址:https://github.com/lyptus-research/cyber-task-horizons-data
- HuggingFace地址:https://huggingface.co/datasets/lyptus-research/cyber-task-horizons
- 关联论文:Offensive Cyber Task Horizons: Measuring the Rate of Growth in AI Offensive Cybersecurity Capability (Lyptus Research, 2026)
- 许可证:
- 数据 (
data/目录下内容):CC-BY-4.0 - 代码 (
analysis/目录下内容):MIT
- 数据 (
研究背景与目的
- 本研究将METR的时间范围方法应用于进攻性网络安全领域。
- 任务由人类专家标注完成时间,模型在每个任务上进行评估。
- 对成功率与难度数据拟合2参数IRT逻辑曲线,并读取每个曲线的时间范围(模型以给定成功率完成任务所需的任务时长)。
- 绘制时间范围与模型发布日期关系图,以计算能力翻倍时间。
数据集内容与结构
评估基准
研究涵盖七个网络安全基准,范围从终端命令到多小时的漏洞利用开发:
| 基准名称 | 评估任务数 | JSONL中任务数 | 难度范围 | 类型 |
|---|---|---|---|---|
| CyBashBench | 200 | 200 | 1秒 - 30秒 | 命令生成 |
| NL2Bash | 136 | 136 | 4秒 - 4分钟 | 命令生成 |
| InterCode-CTF | 99 | 99 | 10秒 - 10分钟 | 初学者CTF |
| NYUCTF | 50 | 50 | 2分钟 - 6小时 | 大学CTF |
| CyBench | 40 | 40 | 2分钟 - 25小时 | 专业CTF |
| CVEBench | 40 | 40 | 15分钟 - 8小时 | 真实CVE复现 |
| CyberGym | 122 | 322 | 30分钟 - 8小时 | 内存安全PoC生成 |
评估模型
评估的模型涵盖2019年至2026年初,包括:
- GPT-4
- Claude 3.5 Sonnet
- o1, o3
- Gemini 2.5 Pro
- Claude Opus 4/4.6
- GPT-5.x Codex
- 开源模型(GLM-5, DeepSeek V3.1)
所有评估均使用固定的200万token预算,并采用Inspect AI的ReAct智能体框架。
数据目录结构
data/ eval_logs/ 原始Inspect AI .eval文件(Git LFS,约18 GB) human/ 匿名化的专家完成与估计数据 tasks/ 每个基准的任务定义和计时元数据 <benchmark>/ 每个基准的任务JSONL、人类运行记录、模型估计 cvebench/ solutions/ CVEBench解决方案文档(CC-BY-4.0) models/ 模型发布日期、别名和提供商配置 methodology/ 评估配置和智能体框架源代码 research_agent.py 智能体框架:继续提示、工具配置 README.md 系统提示、提示软化、智能体参数 june_2025/ 2025年6月遗留研究数据(METR格式)
数据文件描述
模型评估日志
- 位置:
data/eval_logs/ - 内容:所有模型评估活动的原始
.eval文件(约18 GB,通过Git LFS存储)。 - 格式:每个子目录以评估集ID命名,包含一个或多个
.eval文件。每个文件记录一个模型尝试一个任务的完整过程,包括智能体轨迹(系统提示、工具调用、输出、token使用情况和得分)。 - 映射关系:评估集ID与模型和基准的映射关系位于
analysis/lib/eval_sets.py。
人类研究数据
- 位置:
data/human/ - 核心文件:
completions.csv:174次专家任务尝试,包含计时、得分、基准信息。estimations.csv:310条可见解决方案的时间估计,包含置信度。expert_survey.csv:研究后调查(经验水平、定性反馈)。eval_logs/:90个终端转录记录,为匿名化的.eval文件。DATA_DICTIONARY.md:列定义和快速入门代码。human_snapshot.json:原始API快照(相同数据,嵌套JSON格式)。
- 匿名化:专家标识符已匿名化(expert_01至expert_10)。CSV文件中的答案文本已编辑。
.eval文件中的终端转录显示了专家的完整工作过程。
任务元数据
- 位置:
data/tasks/<benchmark>/ - 内容:
- 每个基准的任务定义(完整的JSONL,包含描述、标志和元数据)。
- 前沿模型时间估计(
*_model_estimates.jsonl)。 - 人类完成数据(
*_human_runs.jsonl,适用于CyBench、CVEBench、InterCode-CTF、NL2Bash和NYUCTF)。
- 注意:CyBashBench和CyberGym没有单独的human_runs文件。
data/tasks/cvebench/solutions/包含原始的CVEBench解决方案文档。 - 任务选择元数据:
data/tasks/task_metadata.csv是任务选择过程的审查产物,涵盖除CyBashBench外的所有基准。CyberGym有1507个条目(完整的上游集合,而非评估的122个)。
评估方法
- 位置:
data/methodology/ - 内容:
research_agent.py:智能体框架源代码,包括论文中描述的继续提示和空级联终止逻辑。README.md:评估参数、提取的研究系统提示(仅应用于GPT-5.x Codex模型)和提示软化文本替换。
分析管道与可复现性
- 工具:使用DVC进行可复现的图形生成。
- 依赖:依赖于METR的eval-analysis-public(固定提交
52cb829)进行IRT逻辑回归和趋势线计算。 - 冻结阶段:
snapshot_human_data(阶段0):原始数据从研究API实时拉取。预构建的快照已随附在analysis/figures/data/中。prepare_runs(阶段1):加载原始.eval文件并构建管道表。预构建的parquet文件已随附。
- 运行测试:
cd analysis然后uv run pytest tests/ - 生成图表:运行
dvc repro将在analysis/figures/out/中生成PNG图形和JSON数据文件。JSON文件包含每个图形背后的结构化数据,是论文网页版中site.data.*模板变量和交互式Plotly图表的来源。
数据用途
- 复现论文:
dvc repro可从原始数据重新生成每个图形、表格和统计量。 - 拟合自定义IRT曲线:预构建的
model_runs.parquet和task_difficulties.parquet包含自定义IRT分析所需的一切。 - 分析模型在网络安全任务上的行为:原始
.eval文件包含完整的智能体轨迹,可用于研究不同模型如何处理同一任务。 - 研究专家如何解决安全任务:人类
.eval文件包含专家会话的完整终端转录。 - 探索token预算缩放:每次运行的token计数位于
.eval文件中,1000万token的重新运行数据显示了成功率如何随计算量扩展。 - 比较人类和模型难度估计:
estimations.csv包含专家时间估计。data/tasks/<benchmark>/*_model_estimates.jsonl包含相同任务的前沿模型估计。 - 添加新模型:IRT管道与模型无关。如果使用Inspect AI在相同基准上运行新模型,可以添加
.eval文件并重新运行管道以查看其在趋势线上的位置。




