遇见数据集

TheBiggerInterview

收藏
github2026-08-27 更新2026-08-29 收录
官方服务:

资源简介:

TheBiggerInterview是一个调查场景数据集,包含约2.2百万个事件,覆盖47小时,来自AWS CloudTrail、AWS EKS审计、CrowdStrike Falcon EDR和GitHub审计日志,用于安全运营中心(SOC)的模拟调查。

TheBiggerInterview is an investigation scenario dataset containing approximately 2.2 million events spanning 47 hours. It is sourced from AWS CloudTrail, AWS EKS audit logs, CrowdStrike Falcon EDR, and GitHub audit logs, and is designed for simulated investigations in Security Operations Centers (SOCs).

创建时间:
2026-08-25
原始信息汇总

数据集概述

TheBiggerInterview 是一个网络安全调查场景数据集,包含约220万条安全事件日志,时间跨度约47小时。数据压缩后约203 MB,索引后约3.4 GB。

数据内容

数据集包含四种来源的日志,全部存放在单一索引 investigation 中:

来源类型 内容说明 主机标识
aws:cloudtrail AWS CloudTrail 记录(43,027条) sim-cloudtrail
aws:eks:audit Kubernetes API 服务器审计日志(1,999,440条) sim-eks-apiserver
crowdstrike:falcon:edr CrowdStrike 端点检测与响应事件(194,125条) sim-edr-sensor
github:cloud:audit GitHub 组织审计日志(393条) sim-github-audit

所有事件均为原始 JSON 格式,可由 Splunk 在搜索时自动提取字段,无需额外安装插件。

使用方式

该仓库提供了完整的 Docker 配置,可快速在本地 Splunk 实例中导入数据集。运行环境要求约15 GB可用磁盘空间,完整数据导入约需十分钟。

许可协议

本仓库包含三种不同许可:

  • 代码部分(Dockerfile、entrypoint.sh、conf/):MIT 许可
  • 数据部分(logs/):CC BY-NC-SA 4.0,要求署名、禁止商业用途、相同方式共享
  • Splunk Enterprise:需自行接受 Splunk General Terms,不包含在本仓库中
搜集汇总
数据集介绍
TheBiggerInterview 数据集图片
构建方式
该数据集源自一次模拟的网络安全调查场景,旨在复现真实环境中的安全事件日志。数据集中包含了超过220万条事件记录,时间跨度约为47小时,涵盖多种云原生平台和安全工具的数据源。具体来说,数据集整合了AWS CloudTrail、AWS EKS审计日志、CrowdStrike Falcon端点检测响应(EDR)事件以及GitHub组织审计日志,每个源均以原始JSON格式存储,并通过各自的sourcetype进行区分。数据被统一索引到一个名为“investigation”的索引中,便于后续分析。为了便于使用,项目还提供了Dockerfile和相关配置文件,使得用户能够在本地Splunk实例中快速构建并加载该数据集。
使用方法
用户可以通过Docker构建并运行一个包含数据集的Splunk环境,具体步骤为:构建Docker镜像并启动容器,设置强密码(至少8个字符),随后通过浏览器访问本地端口8000进行登录。登录后,用户可以选择“全部时间”范围,使用Splunk搜索语言(SPL)对数据集进行查询和分析。例如,可以查询特定类型的CloudTrail事件、Kubernetes审计日志或CrowdStrike EDR事件,并通过表格或统计功能进行结果展示。此外,用户还可以通过docker exec命令监控数据摄取进度,确保所有事件均已正确索引。该数据集也支持导入其他SIEM平台,只需将logs目录下的JSON文件按照相应格式进行接入即可。
背景与挑战
背景概述
TheBiggerInterview数据集由安全研究人员于2026年创建,旨在模拟一个复杂的企业安全调查场景,以应对现代攻击面日益扩大的挑战。该数据集整合了AWS CloudTrail、Kubernetes API审计日志、CrowdStrike EDR事件及GitHub组织审计日志,共计逾220万条事件,覆盖约47小时的安全操作窗口。其主要研究问题在于评估和提升安全运营中心(SOC)分析师及自动化系统在异构日志源中识别、追踪和响应威胁的能力。通过提供高保真、多源关联的数据,该数据集为安全编排、自动化与响应(SOAR)技术及威胁狩猎策略的研究提供了宝贵的基准,对推动安全数据分析领域的发展具有重要意义。
当前挑战
该数据集所面临的挑战多维且深刻。在领域层面,它精准地复现了现代安全运营中的核心难题:数据来源异构性强,涵盖云基础设施、容器编排、终端检测及代码托管平台,要求分析者具备跨域关联能力;事件时间跨度长且数量巨大,对实时检测与回溯分析提出性能要求;攻击路径隐蔽,需从海量正常行为中甄别异常,考验异常检测与威胁狩猎算法的灵敏度。在构建过程中,研究团队需克服数据采集的复杂性,确保各源日志时间戳的一致性与完整性,同时处理数据压缩与存储的权衡,以及在不泄露真实用户隐私的前提下生成逼真的样本。此外,数据集的使用还受限于非商业许可及Splunk试用版索引限制,这为长期研究与复现实验设置了障碍。
常用场景
经典使用场景
该数据集作为企业级安全运营中心(SOC)仿真场景的核心组成部分,广泛应用于威胁狩猎、事件响应和攻击链重建等经典研究领域。凭借其横跨AWS CloudTrail、Kubernetes API审计、CrowdStrike EDR及GitHub审计日志的多源异构数据,研究者能够模拟真实的云原生环境中的复杂攻击,利用Splunk等SIEM平台进行日志检索与分析,验证检测规则的有效性,并训练安全分析人员的调查技能。其2.2百万条事件覆盖47小时的丰富维度,为构建高仿真度的安全演练提供了扎实的数据基础。
解决学术问题
该数据集解决了安全研究中难以获得真实、大规模、多源异构且标注清晰的入侵检测数据这一核心难题。以往研究常因数据规模有限或来源单一,导致检测模型的泛化能力不足。TheBiggerInterview通过整合云审计、容器编排审计、端点检测及开发平台日志,支持了跨数据源关联分析的研究,推动了统一日志分析框架和事件溯源方法的发展。其非商业共享的许可模式也促进了学术界的知识复用与对比实验,提升了安全分析研究的可重复性和科学性。
实际应用
在实际应用中,该数据集常用于企业SOC团队的技能培训与评估,帮助分析师在接近真实的威胁情境中练习日志筛选、异常识别和响应决策。同时,它可被用于测试和调优SIEM平台(如Splunk)的搜索性能与检测内容,验证告警规则的有效性,减少误报。此外,该数据集还适合作为红蓝对抗演练的靶场数据,通过重放攻击行为评估安全产品和流程的防护能力,从而在安全运营实践中提升整体的威胁检测与响应效率。
数据集最近研究
最新研究方向
TheBiggerInterview数据集聚焦于安全运营中心(SOC)的威胁检测与响应场景,提供了一套涵盖AWS CloudTrail、EKS审计日志、CrowdStrike EDR及GitHub审计记录的多源异构日志数据。该数据集模拟了约47小时内的220万条安全事件,旨在支持安全分析师和研究人员开发、测试及评估基于机器学习的入侵检测、异常行为分析及自动化响应策略。其前沿研究方向包括利用大语言模型(LLM)进行日志语义理解、构建可解释的AI安全决策系统,以及实现跨数据源的事件关联分析。结合当前AI驱动的安全运营趋势,该数据集为验证‘AI+SIEM’集成方案提供了高逼真度的实时基准,有助于推动智能安全运维的发展与落地。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务