Adversarial Threat IOCs
收藏资源简介:
一个由社区维护的、机器可读的集合,包含来自科技公司和安全调查报告的威胁指标和战术信息。每个报告都被标准化为一个扁平的CSV模式,以便搜索、对比和导入到SIEM、TIP或电子表格中。当前来源包括Meta、OpenAI、Anthropic、Google、TikTok和X。
A community-maintained, machine-readable collection encompassing threat indicators and tactical information sourced from technology companies and cybersecurity investigation reports. Each report is standardized into a flat CSV schema to facilitate searching, comparison, and importation into SIEM, TIP, or spreadsheet tools. Currently contributing sources include Meta, OpenAI, Anthropic, Google, TikTok, and X.
Adversarial Threat IOCs 数据集概述
数据集定位
- 社区维护的机器可读数据集,汇集科技公司与安全调查机构发布的对抗性威胁报告中披露的指标与战术手法。
- 每份报告被规范化为统一的扁平 CSV schema,便于搜索、比对,以及导入 SIEM、TIP 或电子表格。
- 当前数据规模:11,600+ 行。
数据来源
- 当前来源: Meta、OpenAI、Anthropic、Google (GTIG)、TikTok、X。
- 路线图: Mandiant 经典 APT IOC 目录以及经过审查的 OSINT / 安全厂商调查。
- 来源为可扩展词表(
schema/providers.csv),新增来源仅需一行改动,然后在data/<provider>/下放置 CSV。
范围说明
- 这些来源并不像经典 CTI 厂商那样发布指标。
- Meta 旧文件以及 Anthropic、Google 近期报告包含真实技术型 IOC(域名、IP、哈希、邮箱、恶意软件家族)。
- 大量发布内容是行为型的——账号归因、协同不真实行为模式、模型滥用 TTP;OpenAI 明确表示其硬技术指标是通过私下渠道与行业伙伴共享,而非在报告中发布。
- 因此本语料库捕获的是指标与 TTP,而不仅是 IOC,并通过
indicator_type如实标注每行的类别。
各来源覆盖情况
| 提供方 | 发布内容 | 本数据集覆盖 |
|---|---|---|
| Meta | facebook/threat-research GitHub 仓库——经典 IOC 表(2020–2023)+ 用于 CIB 下架的 Online Operations Kill Chain 文件(2023–至今) |
完整历史,来自全部 68 个源 CSV 的规范化数据 |
| Anthropic | 各报告 PDF 内的逐案例指标表;近期版本 IOC 丰富 | 2025 年 3 月、2025 年 8 月、2026 年 9 月 |
| OpenAI | 报告 PDF 中的行动记录;按设计硬 IOC 极少 | 2025 年 6 月、2025 年 10 月(更早版本标记为待处理) |
| Google (GTIG) | 逐行为体的 AI 滥用报告;AI Threat Tracker 增加恶意软件家族 | Adversarial Misuse of Generative AI(2025 年 1 月)、AI Threat Tracker(2026 年 2 月) |
| TikTok | 隐蔽影响行动透明度披露;行为型,硬 IOC 少 | 2024 年 1–4 月汇总 + 示例(部分——逐网络细节在 JS 透明度中心之后) |
| X (Twitter) | 历史国家关联 IO 存档(2018–2021),2022 年后停止 | 仅账号级归因(无推文内容):25 个已披露网络及国家 + 账号数量 |
- X 行使用
indicator_type = asset_count(例如 "4,779 accounts"),因为 X 发布的是账号数据集而非原子 IOC;按语料库范围,这些捕获的是网络级归因,而非单条推文。
目录结构
data/ anthropic/ one CSV per report (YYYY-MM-DD_slug.csv) openai/ meta/ google/ tiktok/ x/ dist/ indicators.csv generated master (all rows, sorted) — the file to query schema/ fields.md the 16-field schema, documented indicator_types.csv controlled vocabulary for indicator_type actor_types.csv controlled vocabulary for actor_type ttp_frameworks.csv controlled vocabulary for ttp_framework scripts/ normalize_meta.py regenerate data/meta from a repo clone backfill_anthropic_openai.py regenerate data/anthropic + data/openai backfill_google_tiktok_x.py regenerate data/google + data/tiktok + data/x build_master.py concat data/**/*.csv -> dist/indicators.csv validate.py schema + vocabulary check (CI gate) check_new_reports.py monthly: find un-ingested reports sources.json manifest of every known report + ingest status
Schema 说明
- 每行是一个指标(或一个 TTP 摘要),归属于某份报告中的一个行为体。
- 列顺序为:
actor, actor_type, source_provider, source_report, report_date, source_url, indicator_type, indicator_value, country, target_country, target_sector, ttp, ttp_framework, confidence, description, date_added。 - 完整字段定义与受控词表见
schema/fields.md。 - 指标值保持已失效化(defanged)(
[.]),与多数来源发布形式一致。
使用方式
- 重建主文件:
python3 scripts/build_master.py - 提取硬网络 IOC(剔除行为型/TTP 行)用于阻止列表,示例代码保留
domain,url,ipv4,ipv6,sha256,sha1,md5,email,onion_domain类型。 - 因是扁平 CSV,
grep、csvkit、pandas、Excel 及多数 TIP 可直接读取。 - 每行携带
source_url,任一指标距其来源报告仅一次点击。
数据质量与溯源
- Meta 行由源 CSV 程序化规范化——高保真。
- Anthropic / OpenAI 行从报告 PDF 提取,操作阻止前应对照
source_url抽查。PDF 表提取可能转置哈希或 IP 中的字符。将其视为线索,执行前先验证。 - 本数据集不替代用户自身验证,属于研究与分诊语料库。
保持更新
- 回填为一次性工作;之后语料库按月维护。
- 运行
python3 scripts/check_new_reports.py:将 Meta 实时 GitHub 树与data/meta/比对,列出sources.json中仍标记为pending的内容,并在 Anthropic/OpenAI 列表页浮现候选新报告链接以供审查。 - 摄取新内容后,在
sources.json翻转状态、重建并提交 PR。详见CONTRIBUTING.md。
许可与署名
- MIT(见
LICENSE)——选择与 Meta 上游threat-research仓库一致,该仓库以 MIT 发布数据。 - 底层指标归各自发布方(Anthropic、OpenAI、Meta)所有;本项目通过
source_url署名,为防御性研究再分发,NOTICE文件保留 Meta 版权并致谢全部三个来源。 - 若发布方希望变更,可开 issue。




