遇见数据集

STINER

收藏
arXiv2026-08-14 更新2026-08-18 收录
官方服务:

资源简介:

STINER是一个面向战略网络威胁情报的命名实体识别数据集,由穆罕默德六世理工大学和德勤咨询联合构建,专注于从社交媒体(X平台)中提取高层次威胁信息。该数据集包含2100条专家标注的推特,总计85066个token,涵盖目标、威胁行为者、行业、地点、数据量等8种战略实体类型,平均每条推特标注8.23个实体。创建过程首先从约66,500条推特中筛选出相关情报,再由两位网络安全专家使用Label Studio进行标注,标注一致性达Cohen's κ=0.84。数据集旨在解决传统NER模型在社交媒体非正式语言上识别战略情报的盲区,可辅助安全分析师自动识别受攻击行业、威胁组织及影响规模,为组织风险决策提供实时支持。

STINER is a named entity recognition (NER) dataset for strategic cyber threat intelligence, co-developed by Mohammed VI Polytechnic University and Deloitte Consulting. It focuses on extracting high-level threat information from social media (X platform). This dataset contains 2,100 expert-annotated Twitter posts, totaling 85,066 tokens, and covers 8 strategic entity types including targets, threat actors, industries, locations, data volumes and others. On average, each Twitter post is annotated with 8.23 entities. During the creation process, relevant intelligence was first screened from approximately 66,500 Twitter posts, then annotated by two cybersecurity experts using Label Studio, with an annotation consistency of Cohen's κ=0.84. This dataset aims to address the blind spots of traditional NER models in identifying strategic intelligence from informal social media language, and can assist security analysts in automatically identifying attacked industries, threat organizations and impact scales, providing real-time support for organizational risk decision-making.

创建时间:
2026-08-14
原始信息汇总

STINER 数据集详情

数据集概述

STINER(Structured Threat Intelligence Named Entity Recognition)是一个用于网络威胁情报(CTI)领域命名实体识别(NER)任务的数据集,专注于从 Twitter/X 社交媒体帖子中提取结构化信息。

实体类型

数据集包含 9 种实体类型:

  • ACTOR:威胁行为者/组织
  • TARGET:被针对的组织/个人
  • LOCATION:地理位置
  • SECTOR:行业领域
  • DATE:时间引用
  • CAMPAIGN:行动/活动名称
  • TOOL:攻击工具/恶意软件
  • DATA_TYPE:被盗/受影响的数据类型
  • PRICE:赎金金额

数据构成

  • 数据文件:已标注的训练集、验证集和测试集划分(train.json、val.json、test.json)
  • 原始数据:包含推特 ID 列表(tweet_ids.txt),可用于推文重新水合(rehydration)
  • 数据规模:数据集详情中未明确标注样本总量

模型评估框架

  • 编码器模型:BERT、RoBERTa、SecBERT、CySecBERT、DarkBERT(可选 CRF 增强)
  • 大语言模型:Llama-3.1、Gemma-2、Qwen2.5(零样本与微调)
  • GLiNER:零样本评估

基准结果

结果存储于 results/tables/ 目录,包含:

  • encoder_benchmark_summary.csv:编码器模型结果
  • benchmark_results_encoders_crf.csv:编码器+CRF 结果
  • llm_benchmark_results.csv:大语言模型结果

许可证

MIT License

搜集汇总
数据集介绍
STINER 数据集图片
构建方式
STINER数据集的构建始于对战略网络威胁情报(CTI)的深刻理解,它聚焦于从社交媒体平台X(原Twitter)上提取高层次洞察,如受害者行业、攻击组织归属及数据泄露规模。研究团队首先利用Apify平台采集了约66,500条推文,并借助轻量级BERT分类器筛选出与CTI相关的内容,最终精选出2,100条真实警报进行专家标注。在标注过程中,团队设计了包含八种实体类型的细粒度分类体系,涵盖目标(TARGET)、行为者(ACTOR)、行业(SECTOR)、位置(LOCATION)等核心战略要素,以及数据规模(SIZE)、数据类型(DATA_TYPE)、价格(PRICE)和日期(DATE)等影响维度。整个标注流程由两位网络安全专家借助Label Studio界面完成,为确保一致性,对10%的样本进行了双重标注,并达到了Cohen's κ系数为0.84的高一致性水平。
使用方法
STINER数据集为研究人员提供了一个开箱即用的训练与评估平台,通过公开的GitHub仓库获取语料、标注指南及实验配置。使用者可基于该数据集训练定制化的命名实体识别(NER)模型,尤其是针对社交媒体文本的语法不规则性进行优化。基准测试结果显示,领域适配的编码器如DarkBERT在严格F1分数上达到89.33%,并在毫秒级延迟内完成推断,这使其成为实时监控管道的理想选择。相反,生成式大语言模型(LLMs)即使经过微调,也面临显著的性能与延迟权衡,因此更适合离线分析或低吞吐量任务。此外,STINER还支持下游应用,如构建时间知识图谱、进行区域威胁态势分析(如欧洲2025年上半年威胁概况)以及量化勒索软件组织的行为模式(如Medusa的赎金分布)。通过提取的实体关系,用户能够识别高危行业、追踪攻击者活动趋势,并实现早期预警,从而在机构报告发布前捕捉到新兴威胁信号,如SafePay勒索软件活动的飙升。
背景与挑战
背景概述
战略网络威胁情报(Strategic Cyber Threat Intelligence, CTI)聚焦于高层次洞察,如识别受攻击行业、将攻击归因于特定勒索软件组织及评估数据丢失规模。随着社交媒体(尤其是X平台)成为此类情报的最快来源,如何从非正式、高度不规则的社交文本中高效提取结构化战略信息成为自动化防御系统的关键瓶颈。为此,穆罕默德六世理工大学与德勤合作团队于2026年推出STINER数据集,由专家标注2100条真实警报,定义八种战略实体类型(如威胁行为者、行业、地点),旨在弥合现有资源在社交媒介语法与网络安全语义上的双重缺口。该数据集不仅提供了首个面向战略层的社交CTI语料库,还通过系统基准测试验证了领域自适应编码器(如DarkBERT)在精度与延迟上的优越性,为实时威胁监测与早期预警系统奠定了数据基础,并成功应用于2025年上半年欧洲威胁态势分析,展现了其在揭示新兴攻击活动(如SafePay勒索软件)方面的前瞻价值。
当前挑战
STINER数据集面临的挑战多维且严苛。领域层面,社交媒体的非正式语言(如缩写、标签、表情符号)与隐含归因(如#LockBit)令传统命名实体识别模型难以解析,而现有CTI数据集多源自正式报告,存在显著的领域不匹配;同时,战略实体(如受害者行业、数据泄露规模)的语义歧义性(如某词既可能是组织名又可能是行业描述)进一步加剧了抽取难度。构建过程中,团队需从约66,500条推文中筛选出2,100条高质量样本,通过专家标注确保一致性(Cohen's κ=0.84),并解决组织名称中地理描述符归属的歧义问题;此外,数据时效性要求严格的时间分割协议以评估模型对未见威胁活动的泛化能力。基准测试还揭示,生成式大语言模型虽具高精度但召回率低且推理延迟过高,而CRF解码虽在部分模型上有效却对强编码器性能产生负向影响,凸显了在精度、效率与领域适应性间寻求平衡的核心挑战。
常用场景
经典使用场景
STINER作为首个聚焦于社交媒体战略级网络威胁情报的专家标注语料库,其核心应用场景在于从X(原Twitter)等社交平台的海量非结构化文本中,自动抽取具有战略意义的威胁实体。该数据集定义了包含威胁行为体、目标组织、行业部门、地理位置、数据规模、数据类型、赎金价格及披露日期在内的八类细粒度实体类型,为构建实时、高精度的命名实体识别系统提供了标准化训练与评测基准。研究者和工程师可基于STINER微调领域自适应编码器(如DarkBERT)或评估生成式大语言模型,以实现对社交网络安全警报的高效结构化解析,进而支撑后续的威胁态势感知与风险量化分析。
解决学术问题
该数据集有效填补了现有网络威胁情报资源在社交媒体非正式语境下战略实体抽取领域的空白。传统CTI语料库多源自长篇漏洞报告或APT白皮书,模型在解析X平台上缩写、标签及表情符号驱动的非规范语言时性能骤降。STINER通过专家注释的2100条真实警报及严格的时间划分评估协议,解决了跨时间泛化、实体边界模糊及隐含归属推断等学术难题,为比较域适应编码器与生成式模型在噪声文本上的抽取效能提供了可靠基准,推动了战略级CTI自动化的理论发展。
实际应用
在实际应用中,STINER赋能了面向社交媒体的网络安全监控与早期预警系统。利用训练得到的STINER-DarkBERT提取器,安全团队能够近乎实时地监控全球威胁事件,自动识别受害行业、攻击团伙及数据泄露规模,从而为组织提供战略级风险决策支持。例如,在欧洲H1 2025威胁态势分析中,STINER成功预警了SafePay勒索软件运动的早期升级信号,较官方报告提前6-7周,佐证了其在主动防御、资源调配及行业定向告警方面的实战价值。此外,该数据集还可用于定制化威胁情报产品,如按行业或地区聚合的威胁播报服务。
数据集最近研究
最新研究方向
STINER数据集的构建标志着战略层网络威胁情报(CTI)自动化提取领域迈出了关键性一步。在社交媒体日益成为最早披露勒索软件攻击、初始访问拍卖等战略风险信号的背景下,该研究聚焦于从X平台非正式、高度不规则的语言中智能抽取威胁行为者、目标行业等高层洞察。通过构建包含2,100条专家标注推文的语料库及八类战略实体细粒度分类体系,研究系统评估了领域适配编码器与生成式大语言模型的性能差异,发现DarkBERT等专用模型在精确度和推理延迟上均显著优于通用LLM。利用该数据集对2025年上半年欧洲威胁态势的剖析,不仅验证了其与官方报告的吻合性,更成功提前捕捉到SafePay勒索软件活动的升级先兆,凸显了社交媒体驱动的CTI提取在实现主动防御、弥补传统报告周期滞后方面的前瞻价值。
相关研究论文
  • 1
    STINER: Automated Extraction of Strategic Cyber Threat Intelligence from X穆罕默德六世理工大学; 德勤咨询 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务