遇见数据集

Adversarial Threat IOCs

收藏
github2026-09-12 更新2026-09-13 收录
官方服务:

资源简介:

一个由社区维护的、机器可读的集合,包含来自科技公司和安全调查报告的威胁指标和战术信息。每个报告都被标准化为一个扁平的CSV模式,以便搜索、对比和导入到SIEM、TIP或电子表格中。当前来源包括Meta、OpenAI、Anthropic、Google、TikTok和X。

A community-maintained, machine-readable collection encompassing threat indicators and tactical information sourced from technology companies and cybersecurity investigation reports. Each report is standardized into a flat CSV schema to facilitate searching, comparison, and importation into SIEM, TIP, or spreadsheet tools. Currently contributing sources include Meta, OpenAI, Anthropic, Google, TikTok, and X.

创建时间:
2026-09-12
原始信息汇总

Adversarial Threat IOCs 数据集概述

数据集定位

  • 社区维护的机器可读数据集,汇集科技公司与安全调查机构发布的对抗性威胁报告中披露的指标与战术手法。
  • 每份报告被规范化为统一的扁平 CSV schema,便于搜索、比对,以及导入 SIEM、TIP 或电子表格。
  • 当前数据规模:11,600+ 行

数据来源

  • 当前来源: Meta、OpenAI、Anthropic、Google (GTIG)、TikTok、X。
  • 路线图: Mandiant 经典 APT IOC 目录以及经过审查的 OSINT / 安全厂商调查。
  • 来源为可扩展词表(schema/providers.csv),新增来源仅需一行改动,然后在 data/<provider>/ 下放置 CSV。

范围说明

  • 这些来源并不像经典 CTI 厂商那样发布指标。
  • Meta 旧文件以及 Anthropic、Google 近期报告包含真实技术型 IOC(域名、IP、哈希、邮箱、恶意软件家族)。
  • 大量发布内容是行为型的——账号归因、协同不真实行为模式、模型滥用 TTP;OpenAI 明确表示其硬技术指标是通过私下渠道与行业伙伴共享,而非在报告中发布。
  • 因此本语料库捕获的是指标与 TTP,而不仅是 IOC,并通过 indicator_type 如实标注每行的类别。

各来源覆盖情况

提供方 发布内容 本数据集覆盖
Meta facebook/threat-research GitHub 仓库——经典 IOC 表(2020–2023)+ 用于 CIB 下架的 Online Operations Kill Chain 文件(2023–至今) 完整历史,来自全部 68 个源 CSV 的规范化数据
Anthropic 各报告 PDF 内的逐案例指标表;近期版本 IOC 丰富 2025 年 3 月、2025 年 8 月、2026 年 9 月
OpenAI 报告 PDF 中的行动记录;按设计硬 IOC 极少 2025 年 6 月、2025 年 10 月(更早版本标记为待处理)
Google (GTIG) 逐行为体的 AI 滥用报告;AI Threat Tracker 增加恶意软件家族 Adversarial Misuse of Generative AI(2025 年 1 月)、AI Threat Tracker(2026 年 2 月)
TikTok 隐蔽影响行动透明度披露;行为型,硬 IOC 少 2024 年 1–4 月汇总 + 示例(部分——逐网络细节在 JS 透明度中心之后)
X (Twitter) 历史国家关联 IO 存档(2018–2021),2022 年后停止 仅账号级归因(无推文内容):25 个已披露网络及国家 + 账号数量
  • X 行使用 indicator_type = asset_count(例如 "4,779 accounts"),因为 X 发布的是账号数据集而非原子 IOC;按语料库范围,这些捕获的是网络级归因,而非单条推文。

目录结构

data/ anthropic/ one CSV per report (YYYY-MM-DD_slug.csv) openai/ meta/ google/ tiktok/ x/ dist/ indicators.csv generated master (all rows, sorted) — the file to query schema/ fields.md the 16-field schema, documented indicator_types.csv controlled vocabulary for indicator_type actor_types.csv controlled vocabulary for actor_type ttp_frameworks.csv controlled vocabulary for ttp_framework scripts/ normalize_meta.py regenerate data/meta from a repo clone backfill_anthropic_openai.py regenerate data/anthropic + data/openai backfill_google_tiktok_x.py regenerate data/google + data/tiktok + data/x build_master.py concat data/**/*.csv -> dist/indicators.csv validate.py schema + vocabulary check (CI gate) check_new_reports.py monthly: find un-ingested reports sources.json manifest of every known report + ingest status

Schema 说明

  • 每行是一个指标(或一个 TTP 摘要),归属于某份报告中的一个行为体。
  • 列顺序为:actor, actor_type, source_provider, source_report, report_date, source_url, indicator_type, indicator_value, country, target_country, target_sector, ttp, ttp_framework, confidence, description, date_added
  • 完整字段定义与受控词表见 schema/fields.md
  • 指标值保持已失效化(defanged)[.]),与多数来源发布形式一致。

使用方式

  • 重建主文件:python3 scripts/build_master.py
  • 提取硬网络 IOC(剔除行为型/TTP 行)用于阻止列表,示例代码保留 domain,url,ipv4,ipv6,sha256,sha1,md5,email,onion_domain 类型。
  • 因是扁平 CSV,grepcsvkitpandas、Excel 及多数 TIP 可直接读取。
  • 每行携带 source_url,任一指标距其来源报告仅一次点击。

数据质量与溯源

  • Meta 行由源 CSV 程序化规范化——高保真。
  • Anthropic / OpenAI 行从报告 PDF 提取,操作阻止前应对照 source_url 抽查。PDF 表提取可能转置哈希或 IP 中的字符。将其视为线索,执行前先验证。
  • 本数据集不替代用户自身验证,属于研究与分诊语料库。

保持更新

  • 回填为一次性工作;之后语料库按月维护。
  • 运行 python3 scripts/check_new_reports.py:将 Meta 实时 GitHub 树与 data/meta/ 比对,列出 sources.json 中仍标记为 pending 的内容,并在 Anthropic/OpenAI 列表页浮现候选新报告链接以供审查。
  • 摄取新内容后,在 sources.json 翻转状态、重建并提交 PR。详见 CONTRIBUTING.md

许可与署名

  • MIT(见 LICENSE)——选择与 Meta 上游 threat-research 仓库一致,该仓库以 MIT 发布数据。
  • 底层指标归各自发布方(Anthropic、OpenAI、Meta)所有;本项目通过 source_url 署名,为防御性研究再分发,NOTICE 文件保留 Meta 版权并致谢全部三个来源。
  • 若发布方希望变更,可开 issue。
搜集汇总
数据集介绍
Adversarial Threat IOCs 数据集图片
构建方式
该数据集采用社区协作与自动化归一化相结合的构建策略,将来自Meta、OpenAI、Anthropic、Google、TikTok及X等科技企业与安全调查机构公开的对抗威胁报告中披露的威胁指标与战术技艺,统一抽取并映射至单一扁平化CSV模式。Meta数据通过程序化解析其GitHub仓库中的全部68个源CSV文件实现高保真还原,Anthropic与OpenAI的指标则从报告PDF的表格中提取,而Google、TikTok及X的数据分别依据其AI滥用报告、透明度披露及历史国家关联信息操作档案进行回填。所有来源均以可扩展词汇表形式登记于providers.csv,新增提供方仅需一行变更并在对应目录下投放规范化CSV,随后由build_master.py脚本串联生成主指标文件。
特点
该数据集以逾11,600行、16字段的统一模式,系统化汇聚了跨平台对抗威胁的指标与战术技艺,并通过indicator_type字段明确区分域名、IP、哈希等硬指标与账户归属、协同虚假行为模式、模型滥用TTP等行为性条目,体现出对数据本质的诚实标注。指标值依循多数来源的惯例保持防御性转义(如[.]),每行均携带source_url以实现一键溯源。X平台数据以asset_count类型记录网络级账户数量而非原子指标,Meta数据经过程序化归一化具备高保真度,而Anthropic与OpenAI的条目因源自PDF提取需经人工抽查验证,整体定位为研究与分类语料库而非可直接执行封锁的清单。
使用方法
使用者可通过执行build_master.py脚本从各报告CSV重建主文件,并借助标准命令行工具、csvkit、pandas、Excel或多数威胁情报平台直接读取扁平化CSV。为生成网络硬指标封锁清单,可筛选indicator_type属于domain、url、ipv4、ipv6、sha256、sha1、md5、email及onion_domain等类型的行,剔除行为性与TTP记录。每行的source_url字段支持从指标到原始报告的快速跳转,便于核验与深入研判。在操作化封锁前,建议对源自PDF提取的条目对照来源进行抽查,并运行check_new_reports.py脚本按月比对Meta实时仓库与本地数据,识别待入库的新报告以维持语料时效性。
背景与挑战
背景概述
随着生成式人工智能的迅速演进,针对AI系统的对抗性滥用与协同虚假行为日益成为网络安全与平台治理的核心议题。各大科技企业虽定期发布威胁报告,却以PDF等非结构化形式散落于各自渠道,导致防御方难以横向检索与自动化消费。Adversarial Threat IOCs数据集由社区维护,将Meta、OpenAI、Anthropic、Google、TikTok及X等机构披露的指标与技战术统一归一化为单一CSV模式,当前规模逾一万一千行,显著降低了跨厂商威胁情报的整合门槛,为SIEM、TIP及学术研究提供了可复用的结构化基础。
当前挑战
该数据集所应对的领域问题在于,跨平台对抗性威胁情报长期缺乏统一、机器可读的指标表示,阻碍了自动化防御与比较分析。构建过程中的挑战同样突出:各发布方披露粒度迥异,部分仅提供行为描述与账户归属而非硬技术指标,迫使模式须以indicator_type区分指标与技战术;Anthropic与OpenAI的数据需从PDF报告中抽取,存在字符转置等提取误差风险,须经源URL复核方可运营使用;TikTok的逐网络细节受限于动态透明度中心,X仅保留账户级归属而无推文内容,导致覆盖呈现非均衡性,需在数据质量与完整性之间持续权衡。
常用场景
经典使用场景
在威胁情报与网络防御领域,对抗性威胁指标(IOCs)的规范化聚合长期依赖人工从多源报告中抽取,效率低下且易遗漏。Adversarial Threat IOCs数据集以社区维护的机器可读CSV模式,将Meta、OpenAI、Anthropic、谷歌、TikTok及X等科技企业披露的对抗性威胁报告中提取的指标与战术、技术与过程(TTPs)归一化至统一平面结构,使安全分析师得以直接检索、差分比对并导入安全信息与事件管理(SIEM)或威胁情报平台(TIP),无需反复阅读PDF报告。其经典使用场景即在于为防御方提供一站式、可编程的指标语料,支撑从硬性网络指标过滤到行为模式分析的全谱系威胁狩猎与情报消费流程。
实际应用
实战环境中,防御团队可直接将该数据集导出的硬性网络指标(如域名、IP、哈希、邮箱)并入边界封禁规则或TIP告警策略,快速响应Meta、Anthropic等报告所披露的恶意基础设施;同时,行为类TTPs可映射至MITRE ATT&CK框架,用于红蓝对抗演练与检测规则优化。舆情与信任安全团队亦可借助协调性不真实行为(CIB)相关条目,监测跨平台影响力操作。由于每行均携带source_url与置信度字段,分析师能在运营阻断前便捷回溯原始报告,平衡响应速度与验证严谨性。
衍生相关工作
该数据集催生了一系列以跨厂商威胁情报融合为方向的衍生工作。基于其统一模式,研究者构建了自动化指标提取与规范化管道,用于扩展更多安全厂商与OSINT来源;部分工作利用其行为类指标,开发面向生成式AI滥用的检测分类器与归因模型。此外,该语料库为威胁情报质量评估、指标衰减分析及跨平台协调性不真实行为检测提供了基准,推动了防御性研究从孤立报告消费向可编程、可验证的集体免疫范式演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务