遇见数据集

cyber-defense-agent-trajectories-sample

收藏
Hugging Face2026-08-31 更新2026-09-01 收录
官方服务:

资源简介:

该数据集是一个公开的合成网络防御智能体轨迹样本,包含40行数据,来自10个源家族(cd-001至cd-010)。每个家族贡献4行,其中3行标记为训练集,1行标记为验证集。数据行包括智能体可见的任务、工具契约、确定性参考工具轨迹以及最终报告。该样本是从`cyber-defense-public-v1.zip`(SHA-256校验值已给出)中确定性投影得到的,对于每个源家族,选取字典序前三个标记为训练的行和第一个标记为验证的行,且源行保持不变。所有场景均为合成数据,不包含任何真实事件、凭证、恶意软件样本或个人数据,轨迹仅针对声明的合成状态/工具/预言机契约建立行为,不反映隐藏的推理质量或通用网络防御能力。

This dataset is a publicly available sample of synthetic cyber defense agent trajectories, containing 40 rows of data from 10 source families (cd-001 to cd-010). Each family contributes 4 rows, with 3 labeled as training and 1 as validation. The data rows include agent-visible tasks, tool contracts, deterministic reference tool trajectories, and final reports. The sample is deterministically projected from `cyber-defense-public-v1.zip` (SHA-256 checksum provided), selecting the first three lexicographically ordered training rows and the first validation row for each source family, with source rows unchanged. All scenarios are synthetic data, containing no real events, credentials, malware samples, or personal data. The trajectories only establish behavior for the declared synthetic state/tool/oracle contracts and do not reflect hidden reasoning quality or general cyber defense capabilities.

创建时间:
2026-08-28
原始信息汇总

数据集概述

该数据集是 GTDataworks Cyber Defense Rooms 提供的合成网络防御智能体轨迹的公开样本,包含40行数据。

数据规模与划分

  • 总共40行,覆盖10个源家族(cd-001cd-010
  • 其中30行保留源 train 划分标签,10行保留源 validation 划分标签
  • 每个家族贡献4行:3行训练数据,1行验证数据

数据内容

  • 每行包含智能体可见的任务、工具合约、确定性参考工具轨迹以及最终报告
  • 公开的验证行仅用于开发便利,不代表行为验证集;私有评估集不包含在此样本中

数据来源与选择方法

  • 样本从 cyber-defense-public-v1.zip 确定性投影生成(SHA-256:9c70b42714ec96c20667d5c4368fb941acb85e6e569145afaa5c07c50f21569a
  • 对每个源家族,选取按字典序排列的前三行已标记为 train 的行,以及第一行已标记为 validation 的行
  • 源行保持不变
  • 提供 manifest.jsonSHA256SUMS 文件作为选择收据和文件哈希

安全性声明

  • 所有场景均为合成数据
  • 源固定声明不包含任何复制的安全事件、凭据、恶意软件样本或个人数据
  • 轨迹仅针对声明的合成状态/工具/预言机合约建立行为,不反映隐藏推理质量或通用网络防御能力

许可信息

  • 许可证类型:gtdataworks-commercial-non-exclusive-license-v1(其他/商业非独家许可)
搜集汇总
数据集介绍
cyber-defense-agent-trajectories-sample 数据集图片
构建方式
该数据集源自GTDataworks Cyber Defense Rooms,是合成且具备状态性的网络防御代理轨迹的公开样本,包含40行数据,涵盖十个源家族(cd-001至cd-010),每个家族贡献四行,其中三行源自训练集标签,一行源自验证集标签。样本通过确定性的投影方式从cyber-defense-public-v1.zip中选取,具体为每个家族取词汇排序前三的训练行和第一的验证行,确保原始数据未做任何改动。数据行包含代理可见的任务、工具契约、确定性参考工具轨迹及最终报告,并通过manifest.json和SHA256SUMS文件提供选择凭证与哈希校验。
特点
该数据集具有鲜明的特点:首先,所有场景均为合成,声明不含任何复制的事件、凭据、恶意软件样本或个人数据,确保了安全边界。其次,数据构建方式兼顾多样性与代表性,十个源家族各贡献等量样本,且训练与验证比例固定(3:1),便于分布验证。重要的是,公开的验证行仅为开发便利,并非行为隔离,独立的私有评估集未包含在内,这提示使用者在评估模型泛化能力时需注意数据集的局限性。
使用方法
该数据集适用于研发与测试网络防御代理系统,其结构化轨迹(包括任务、工具契约、参考轨迹与报告)为代理的行为学习与评估提供了基准。使用时,用户可基于manifest.json和SHA256SUMS文件校验数据完整性,并依据引用轨迹构建监督式训练或模拟环境交互。需注意,数据仅反映在声明合成状态、工具及预言机契约下的行为,不涉及潜在推理质量或一般网络防御能力的评价,建议结合私有评估集进行更全面的模型验证。
背景与挑战
背景概述
在网络防御领域,随着攻击手段的日益复杂,自动化智能体的应用成为研究热点。GTDataworks 推出的 Cyber Defense Agent Trajectories Sample 数据集(创建于2023年),由专业安全研究团队构建,旨在为智能体决策过程提供结构化的行为轨迹样本。该数据集包含40条合成有状态轨迹,覆盖十个源家族,每条轨迹详细记录了智能体可见的任务、工具契约、确定性参考轨迹及最终报告,为网络防御智能体的训练与评估提供了标准化基准。其发布对推动该领域的研究具有奠基性意义,尤其为轨迹建模、策略优化和鲁棒性测试等方向提供了宝贵资源。
当前挑战
该领域面临的首要挑战是网络防御任务的动态性与复杂性,要求智能体能够在高度不确定的环境中做出合理决策;同时,由于真实攻击数据的敏感性和隐私限制,构建公开数据集极为困难。为应对此问题,GTDataworks 采用完全合成的方式生成数据,确保不含任何真实事件凭证或恶意软件样本,规避了安全风险。构建过程中,团队还需确保轨迹的代表性和一致性,通过确定性投影从大规模仿真数据中精选样本,同时保留源数据的完整性,并进行严格校验(如SHA-256哈希),以保证数据质量和可复现性。此外,数据集的规模有限(40条),且公开验证集并非行为留出集,这要求研究者在使用时需谨慎评估其泛化能力。
常用场景
经典使用场景
该数据集为网络防御智能体的轨迹数据提供了标准化的评估与训练基准,其经典使用场景集中于强化学习与模仿学习算法的验证。研究者可依据其包含的确定性参考轨迹,对智能体在模拟网络攻防环境中的决策序列进行监督式微调,或利用其状态-动作对构建离线强化学习的奖励模型。此外,数据集刻意划分的训练与验证样本,便于进行交叉验证,以评估模型在未见任务上的泛化能力,从而推动自主网络防御系统从理论走向实践。
衍生相关工作
基于该数据集,衍生研究可聚焦于多智能体协同防御架构的探索,例如利用其轨迹数据训练通信协议与任务分配策略。亦可能催生面向网络防御领域的预训练语言模型微调工作,使模型掌握安全工具调用与报告生成的规范。更进一步,该数据可启发构建模拟器与真实环境之间的领域自适应方法,推动从仿真到现实的迁移学习研究,从而不断丰富自主网络防御的学术生态和应用深度。
数据集最近研究
最新研究方向
该数据集聚焦于合成网络防御智能体轨迹的公开样本,为多智能体强化学习与安全自动化领域的前沿研究提供基准。其40行精炼样本覆盖十个源家族,明确区隔训练与验证划分,并公开了确定性参考轨迹以促进可复现性研究。当前热点方向包括基于状态化工具交互的智能体策略学习、防御响应的可解释轨迹分析,以及合成环境下的鲁棒性评估。该数据集的安全边界声明推动了无真实敏感数据的可信研究环境构建,对网络防御智能体的标准化评测与跨场景泛化研究具有重要奠基意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务