遇见数据集

Bkd-FedGNN

收藏
arXiv2023-06-17 更新2024-07-30 收录
官方服务:

资源简介:

Bkd-FedGNN是一个用于评估联邦图神经网络中后门攻击的基准数据集,它将图后门攻击分解为触发器生成和注入步骤,并扩展到节点级联邦设置,形成一个统一的框架,涵盖节点级和图级分类任务。

Bkd-FedGNN is a benchmark dataset for evaluating backdoor attacks in federated graph neural networks. It decomposes graph backdoor attacks into trigger generation and injection steps, extends the attack setup to the federated node-level scenario, and forms a unified framework covering both node-level and graph-level classification tasks.

创建时间:
2023-06-17
原始信息汇总

数据集概述

数据集内容

  • 节点级别数据集Cora, Citeseer, CS, Physics, Photo, Computers
  • 图级别数据集AIDS, NCI1, PROTEINS_full, DD, ENZYMES, COLORS-3

模型

  • GCN
  • GAT
  • GraphSAGE

实验设置

  • 优化器:Adam,使用默认超参数
  • 总周期:200(节点分类),1000(图分类)
  • 学习率:0.01(节点分类),7e-4(图分类)
  • 批量大小:128(图分类)

威胁模型

  • 攻击目标:恶意攻击者试图通过后门攻击操纵模型,使其在特定中毒数据样本上错误分类预定义标签,同时保持模型在干净数据上的准确性。
  • 攻击知识:恶意攻击者完全了解自己的训练数据,并能生成触发器。
  • 攻击能力:恶意客户端可以在训练数据集中注入触发器,但受限于触发器大小和中毒数据率。

后门攻击参数

  • 服务器级别参数

    • IID & Non-IID:数据分布类型,控制参数为--is_iid,默认值为iid,可选值为iid, non-iid-louvain, non-iid-Metis(节点分类),iid, p-degree-non-iid, num-non-iid(图分类)
    • Number of Workers:正常工作者的数量,控制参数为--num_workers,默认值为5
    • Number of Malicious:恶意攻击者的数量,控制参数为--num_mali,默认值为1,可选值为1,2,3,4,5
    • Attack Time:攻击开始的时间,控制参数为--epoch_backdoor,默认值为0,可选值为0,0.1,0.2,0.3,0.4,0.5(节点分类),int[(0.1,0.2,0.3,0.4,0.5) * 1000](图分类)
    • Overlapping Rate:数据重叠率,控制参数为--overlapping_rate,默认值为0,可选值为0,0.1,0.2,0.3,0.4,0.5
  • 客户端级别参数

    • Trigger Size:触发器大小,控制参数为--trigger_size(节点分类),--frac_of_avg(图分类),默认值为3(节点分类),0.1(图分类),可选值为3,4,5,6,7,8,9,10(节点分类),0.1,0.2,0.3,0.4,0.5(图分类)
    • Trigger Type:触发器类型,控制参数为--trigger_type,默认值为renyi,可选值为renyi,ws, ba,gta,ugba(节点分类),renyi,ws, ba, rr, gta(图分类)
    • Trigger Position:触发器位置,控制参数为--trigger_position,默认值为random,可选值为random ,cluster,cluster_degree(节点分类),random,degree,cluster(图分类)
    • Poisoning Rate:中毒率,控制参数为--poisoning_intensity,默认值为0.1,可选值为0.1, 0.2, 0.3, 0.4,0.5

实验命令示例

  • 节点分类后门攻击: python python run_node_exps.py --model GCN --dataset Cora --is_iid iid --num_workers 5 --num_mali 1 --epoch_backdoor 0 --trigger_size 3 --trigger_type renyi --trigger_position random --poisoning_intensity 0.1 --overlapping_rate 0.0

  • 图分类后门攻击: python python run_graph_exps.py --dataset NCI1 --config ./Graph_level_Models/configs/TUS/TUs_graph_classification_GCN_NCI1_100k.json --is_iid iid --num_workers 5 --num_mali 1 --epoch_backdoor 0 --frac_of_avg 0.1 --trigger_type renyi --trigger_position random --poisoning_intensity 0.1 --filename ./checkpoints/Graph --device_id 0

实验重复性

  • 每个实验重复5次,每次使用不同的种子。
搜集汇总
数据集介绍
Bkd-FedGNN 数据集图片
构建方式
联邦图神经网络(FedGNN)在隐私保护与分布式学习方面展现出独特优势,但其分布式特性也引入了后门攻击的潜在威胁。为系统性地评估此类攻击,Bkd-FedGNN基准数据集应运而生。其构建方式独具匠心:首先,将图后门攻击解构为触发器生成与注入两个独立步骤,并扩展至节点级联邦场景,形成覆盖节点级与图级分类任务的统一框架。其次,研究团队从全局与局部两个层面系统梳理了影响攻击效果的多个关键因素,包括数据分布、恶意攻击者数量、攻击时机、重叠率、触发器尺寸、类型、位置及投毒率等。最后,基于13个涵盖社会网络、引文网络、分子图等六个领域的基准数据集,结合GCN、GAT、GraphSage三种主流图神经网络,设计了1725种实验配置,累计完成超过8000次独立测试,构建了迄今为止最为全面的FedGNN后门攻击评估基准。
特点
该数据集最显著的特征在于其系统性与全面性。它首次将图后门攻击在FedGNN上的研究从零散探索提升为结构化基准,统一了节点级与图级分类任务下的攻击评估范式。数据集精心设计了全局与局部两个维度的关键因素分析框架:全局层面涵盖数据分布(IID与非IID)、恶意客户端数量、攻击起始时间及节点重叠率;局部层面则细致考察触发器尺寸、类型(通用型如Renyi、WS、BA与自适应型如GTA、UGBA)、注入位置(随机、基于度或聚类的重要性指标)以及投毒率。这种多维度的因素解耦使得研究者能够精确剖析每个变量对攻击成功率与迁移性的影响。此外,数据集还提供了干净准确率(ACC)、恶意客户端攻击成功率(ASR)以及正常客户端迁移攻击成功率(TASR)三重评价指标,为公平比较不同攻击方法提供了坚实依据。
使用方法
使用Bkd-FedGNN基准数据集时,研究者可灵活开展两类实验:基准测试实验与关键因素分析实验。对于基准测试,用户需从提供的13个数据集中选取特定任务(节点级或图级),搭配GCN、GAT或GraphSage模型,并组合不同的触发器类型与注入位置,系统评估攻击效果。例如,可对比Renyi-Random与WS-Cluster等攻击策略的性能差异。对于关键因素分析,研究者可选择某一因素(如投毒率或攻击者数量)作为变量,保持其他因素为默认值,观察其对ASR和TASR的影响趋势。数据集已预设默认参数(如客户端数量为5、训练轮次为200或1000),并提供了基于PyTorch的完整实现框架。所有代码与配置均在GitHub上开源,用户可直接复现实验或在其基础上扩展新的攻击与防御方法,极大便利了FedGNN安全领域的研究。
背景与挑战
背景概述
联邦图神经网络(FedGNN)是近年来快速发展的研究方向,它将图神经网络与联邦学习的优势相结合,使得在不直接访问敏感数据的前提下实现高级机器学习应用成为可能。然而,这种分布式架构在带来便利的同时,也引入了额外的安全脆弱性,尤其是来自恶意参与者的后门攻击。为系统性地探究这一威胁,来自香港科技大学(广州)和香港科技大学的研究团队于2023年提出了Bkd-FedGNN基准数据集。该工作由Fan Liu、Siqi Lai、Yansong Ning和Hao Liu等人完成,核心研究问题在于构建一个统一的框架,以覆盖节点级和图级分类任务中的后门攻击,并对影响攻击效果的多项关键因素进行深入分析。Bkd-FedGNN的提出填补了该领域缺乏全面基准的空白,为后续研究提供了重要的评估平台和实验基础,对联邦图神经网络的安全领域产生了深远影响。
当前挑战
Bkd-FedGNN所应对的核心挑战源于图后门攻击在联邦学习场景下的复合复杂性。首先,在领域问题层面,现有研究缺乏对FedGNN中后门攻击的广泛基准覆盖,难以在不同设置下进行公平且全面的比较,这些设置涵盖图后门攻击的触发生成与注入步骤,以及节点级和图级分类任务。其次,构建过程中面临的关键挑战在于对多重影响因素的探索不足。GNN与FL的结合引入了众多影响攻击效果的变量,如触发类型、触发大小、数据分布、恶意攻击者数量、攻击时间等。这些因素可划分为全局层面(如数据分布、攻击者数量)和局部层面(如触发大小、投毒率),其复杂的交互作用使得理解攻击行为变得尤为困难,亟需系统性的实验分析与深入洞察。
常用场景
经典使用场景
在联邦图神经网络(FedGNN)的研究领域中,Bkd-FedGNN基准数据集为评估图后门攻击提供了统一的平台。该数据集覆盖了节点级与图级两类分类任务,整合了多种触发器生成与注入策略,并基于六类领域中的13个标准数据集构建。其经典使用场景是在分布式图学习环境下,系统性地衡量恶意客户端通过注入图后门触发器对全局模型产生的攻击效果,包括攻击成功率、对正常客户端的迁移攻击能力等关键指标。
解决学术问题
Bkd-FedGNN解决了当前FedGNN后门攻击研究中缺乏广泛基准覆盖与关键因素深入分析的突出问题。它将图后门攻击分解为触发器生成与注入两个阶段,并将攻击扩展至节点级联邦设置,形成了统一框架。通过系统考察全局层面(如数据分布、攻击者数量、攻击时机、重叠率)与局部层面(如触发器大小、类型、位置、投毒率)的13种关键因素,该基准揭示了不同因素对攻击效果的复杂影响,为理解FedGNN的脆弱性提供了重要见解。
衍生相关工作
Bkd-FedGNN的提出催生了一系列相关研究工作,包括对迁移攻击成功率的提升策略探索、针对后门攻击的防御机制评估,以及协作式恶意攻击者的协同攻击方法研究。此外,该基准中关于自适应触发器与通用触发器在不同任务下表现差异的发现,也启发了后续关于图后门攻击隐蔽性与可迁移性的深入探讨,推动了联邦图神经网络安全领域从攻击到防御的全面研究发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务