遇见数据集

llm-social-network-attacks

收藏
Hugging Face2026-07-29 更新2026-07-30 收录
官方服务:

资源简介:

该数据集名为“LLM生成社交网络的生成时投毒”,是一个用于图机器学习研究的合成数据集。它包含由大型语言模型(LLM)生成的合成人物资料及其对应的社交网络图,旨在研究生成时攻击对图数据的影响。数据集提供了两种规模变体:p50(50个节点,使用Qwen3-Max生成器,每种条件10个图种子)和p200(200个节点,分别使用DeepSeek-V4-Flash和MiMo-v2.5-Pro生成器,每种条件3个图种子)。每种变体都包含干净生成(c)以及三种攻击家族条件下的数据:特征投毒(f_rXX,在人物生成阶段注入)、结构投毒(s_rXX,在链接生成阶段注入)和后门生成(b_rXX,结合人物触发器和链接偏置)。攻击率设置为10%、20%、30%、40%和50%,代表全局节点预算。数据集以Parquet格式提供处理后的节点表、边表和图表,并包含缓存的文本嵌入和评估指标,用于分析结构统计、特征可分离性、图卷积网络/简单图卷积的节点分类性能、目标后门攻击成功率与干净准确率以及链接预测的AUROC。所有人物姓名和资料均为合成,不代表真实个体,旨在支持图生成、鲁棒性测试和审计方法的研究,不得用于人物分析或决策。数据集遵循CC BY 4.0许可证发布。

The dataset named Generation-time Poisoning of LLM-Generated Social Networks is a synthetic dataset for graph machine learning research. It contains synthetic person profiles generated by large language models (LLMs) and their corresponding social network graphs, aiming to study the impact of generation-time attacks on graph data. Two scale variants are provided: p50 (50 nodes, using Qwen3-Max generator, 10 graph seeds per condition) and p200 (200 nodes, using DeepSeek-V4-Flash and MiMo-v2.5-Pro generators, 3 graph seeds per condition). Each variant includes clean generation (c) and data under three attack families: feature poisoning (f_rXX, injected during person generation), structure poisoning (s_rXX, injected during link generation), and backdoor generation (b_rXX, combining person triggers and link bias). Attack rates are set at 10%, 20%, 30%, 40%, and 50%, representing global node budgets. The dataset provides processed node tables, edge tables, and graph tables in Parquet format, along with cached text embeddings and evaluation metrics for analyzing structural statistics, feature separability, node classification performance of GCN/SGC, target backdoor attack success rate vs. clean accuracy, and link prediction AUROC. All person names and profiles are synthetic and do not represent real individuals. It is intended to support research on graph generation, robustness testing, and auditing methods, and must not be used for person analysis or decision-making. The dataset is released under CC BY 4.0 license.

创建时间:
2026-07-28
原始信息汇总

数据集概览

该数据集名为 Generation-Time Poisoning of LLM-Generated Social Networks,由 Kevynf 提供,采用 CC BY 4.0 许可协议。数据集语言为英文,主要面向图机器学习、社交网络、合成数据、大语言模型、图投毒、后门攻击、节点分类、链接预测等研究领域。

数据集内容

数据集包含合成的人物画像、大语言模型生成的社交图谱、缓存的文本嵌入向量,以及针对干净生成和三种生成时攻击家族的评估指标。所有名称和画像均为合成数据,不代表真实人物。

数据集变体

变体 节点数 生成器 每条件图种子数 攻击率
p50 50 Qwen3-Max 10 10%, 20%, 30%, 40%, 50%
p200 200 DeepSeek-V4-Flash 3 10%, 20%, 30%, 40%, 50%
p200 200 MiMo-v2.5-Pro 3 10%, 20%, 50%

条件标识符:

  • c:干净生成
  • f_rXX:人物画像生成中的特征投毒
  • s_rXX:链接生成中的结构投毒
  • b_rXX:使用人物画像触发器和链接偏置的后门生成

攻击率定义了全局节点预算(floor(N * rate)),由合格候选集的大小限制,不是实际改变的图节点或边的比例。

数据文件与仓库结构

数据集包含以下配置(configs):

  • p50_nodes, p50_edges, p50_graphs
  • p200_nodes, p200_edges, p200_graphs

仓库布局如下:

  • raw/:包含 p50 和 p200 的原始生成内容(人物画像、节点ID、数组、图)
  • processed/:包含 p50 和 p200 的节点、边、图的 Parquet 文件
  • metrics/:包含 p50 和 p200 的评估指标 CSV 文件
  • metadata/:包含 manifest.csv(记录每个工件的来源路径、数据集变体、条件、攻击家族、攻击率、生成器、图种子、字节大小、SHA-256 摘要)、generation_config.json(生成配置)、checksums.sha256(校验和)

归一化的节点表每条件每人物画像一行,边表包含每个图种子的有向邻接列表条目,图表提供条件、生成器、种子、节点数和边数元数据。

评估指标

metrics/ 目录包含最终评估表格,涵盖:结构统计、特征可分离性、GCN/SGC 节点分类、定向后门攻击成功率与干净准确率、链接预测 AUROC。API 成本日志因属于操作记录而非科学观察,被排除在外。

完整性与可复现性

LLM 支持的生成服务可能随时间变化,因此原始工件是复现报告指标的唯一权威输入。使用相同提示和种子的更新服务版本可能无法生成相同的图。

局限性与负责任使用

人物画像和政治倾向是基于人口统计分布和模型生成文本模拟的,不应被解释为对真实个体的测量或人口群体的证据。生成的名字可能偶然与真实姓名相似。该数据集仅用于图生成、鲁棒性和审计研究,不应用于人物画像或对人的决策。

数据集大小

数据集规模为 n<1K。

搜集汇总
数据集介绍
llm-social-network-attacks 数据集图片
构建方式
该数据集旨在研究大语言模型生成社交网络时的投毒攻击问题,通过构建合成人物画像与图结构,模拟了三种生成时攻击范式:特征投毒(攻击人物画像生成)、结构投毒(攻击边生成)以及后门攻击(利用画像触发与边偏差)。数据集包含50节点和200节点两种规模变体,分别采用Qwen3-Max和DeepSeek-V4-Flash等生成器,每个条件下生成多个图种子,攻击率从10%至50%不等。原始生成内容完整保留于raw/目录,处理后的节点、边和图数据以Parquet格式存储。
使用方法
该数据集适用于图神经网络的对抗鲁棒性分析与后门检测研究。用户可通过HuggingFace加载各配置子集,如使用`datasets.load_dataset('llm-social-network-attacks', 'p50_nodes')`获取50节点变体的节点表。边表采用有向邻接表格式,可用于图分类或链路预测任务。指标CSV文件可直接用于横纵向对比实验。由于生成服务可能随时间变化,官方推荐以raw/目录下的原始文件作为权威输入,结合metadata中的种子与配置复现实验结果。
背景与挑战
背景概述
该数据集名为llm-social-network-attacks,由研究团队于近期创建,聚焦于大型语言模型(LLM)生成社交网络的投毒攻击问题。随着LLM在文本生成领域的广泛应用,利用其生成逼真的社交网络图数据成为可能,然而,这种生成过程面临着恶意攻击的威胁。本数据集的核心研究问题在于探索生成阶段的投毒攻击如何影响LLM生成的社交网络,包括特征投毒、结构投毒后门攻击等不同攻击家族。通过提供包含50至200个节点的合成人物画像及相应社交图,为图机器学习领域中的节点分类、链接预测等任务提供基准评估,对理解生成式社交网络的鲁棒性与安全性具有重要推动意义。
当前挑战
本数据集面临的挑战主要来自两大方面。在领域问题层面,LLM生成的社交网络可能被恶意注入后门或污染数据,导致节点分类和链接预测等下游任务性能显著下降,现有防御机制难以有效检测此类生成阶段的隐蔽攻击。在构建过程中,数据集生成需依赖多种LLM服务(如Qwen3-Max、DeepSeek-V4-Flash等),而LLM服务随时间可能发生变化,导致相同提示与随机种子无法再现完全一致的图结构,增加了可复现性难度。此外,攻击率的定义与实现需精确控制全局节点预算,避免影响图结构的自然性,确保评估结果的可靠性与可比性。
常用场景
经典使用场景
在人工智能与图机器学习交叉领域,大语言模型生成的社交网络为模拟人类交互行为提供了新的范式。该数据集的核心用途在于探索大语言模型在生成社会图结构时的脆弱性,特别是在生成阶段植入后门或毒化攻击。研究者借助该数据集可系统性地评估特征污染、结构污染及后门攻击等三代攻击家族对社交网络节点分类、链接预测等下游任务的影响,为构建鲁棒性的生成式社交网络模型奠定实验基础。
解决学术问题
该数据集精准回应了大语言模型生成内容的可信度评估这一学术难题。它首次系统性地量化了在社交网络生成过程中,恶意攻击者如何通过操控人物角色特征或社交链接结构,导致后续图神经网络模型产生系统性偏差。其学术意义在于揭示了生成式模型在安全漏洞层面的新维度和影响范式,推动了图机器学习领域对生成阶段对抗性威胁的深入理解,为安全审计与防御机制的设计提供了可复现的基准实验平台。
实际应用
在实际应用中,该数据集为社交平台安全审计、虚假信息传播防御以及算法公平性校验提供了关键支撑。通过模拟不同类型的生成时攻击,平台运营方可以检验其推荐系统、社区发现算法和用户画像模型在遭受恶意操控时的鲁棒性边界。此外,该数据集的合成性质确保了隐私合规性,可用于训练更安全的社交网络生成模型,防范深度伪造和自动化社交工程攻击在真实环境中的扩散风险。
数据集最近研究
最新研究方向
该数据集聚焦于大型语言模型生成的社交网络在生成阶段面临的后门投毒与对抗性攻击风险,涵盖了特征投毒、结构投毒及后门攻击三类前沿威胁范式。通过构建包含50至200个节点的合成社交图,结合Qwen3-Max、DeepSeek-V4-Flash等先进生成模型,系统评估了不同攻击率(10%-50%)下节点分类、链接预测等图学习任务的安全退化程度。这一研究紧密关联当前对LLM生成内容可信性与鲁棒性的热点关注,为理解生成式模型在社交网络模拟中的脆弱性提供了标准化基准,推动了图机器学习领域对抗防御与鲁棒训练方法的演进,对保障合成数据在社会科学模拟及推荐系统等实际应用中的安全性具有重要启示。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务