llm-social-network-attacks
收藏资源简介:
该数据集名为“LLM生成社交网络的生成时投毒”,是一个用于图机器学习研究的合成数据集。它包含由大型语言模型(LLM)生成的合成人物资料及其对应的社交网络图,旨在研究生成时攻击对图数据的影响。数据集提供了两种规模变体:p50(50个节点,使用Qwen3-Max生成器,每种条件10个图种子)和p200(200个节点,分别使用DeepSeek-V4-Flash和MiMo-v2.5-Pro生成器,每种条件3个图种子)。每种变体都包含干净生成(c)以及三种攻击家族条件下的数据:特征投毒(f_rXX,在人物生成阶段注入)、结构投毒(s_rXX,在链接生成阶段注入)和后门生成(b_rXX,结合人物触发器和链接偏置)。攻击率设置为10%、20%、30%、40%和50%,代表全局节点预算。数据集以Parquet格式提供处理后的节点表、边表和图表,并包含缓存的文本嵌入和评估指标,用于分析结构统计、特征可分离性、图卷积网络/简单图卷积的节点分类性能、目标后门攻击成功率与干净准确率以及链接预测的AUROC。所有人物姓名和资料均为合成,不代表真实个体,旨在支持图生成、鲁棒性测试和审计方法的研究,不得用于人物分析或决策。数据集遵循CC BY 4.0许可证发布。
The dataset named Generation-time Poisoning of LLM-Generated Social Networks is a synthetic dataset for graph machine learning research. It contains synthetic person profiles generated by large language models (LLMs) and their corresponding social network graphs, aiming to study the impact of generation-time attacks on graph data. Two scale variants are provided: p50 (50 nodes, using Qwen3-Max generator, 10 graph seeds per condition) and p200 (200 nodes, using DeepSeek-V4-Flash and MiMo-v2.5-Pro generators, 3 graph seeds per condition). Each variant includes clean generation (c) and data under three attack families: feature poisoning (f_rXX, injected during person generation), structure poisoning (s_rXX, injected during link generation), and backdoor generation (b_rXX, combining person triggers and link bias). Attack rates are set at 10%, 20%, 30%, 40%, and 50%, representing global node budgets. The dataset provides processed node tables, edge tables, and graph tables in Parquet format, along with cached text embeddings and evaluation metrics for analyzing structural statistics, feature separability, node classification performance of GCN/SGC, target backdoor attack success rate vs. clean accuracy, and link prediction AUROC. All person names and profiles are synthetic and do not represent real individuals. It is intended to support research on graph generation, robustness testing, and auditing methods, and must not be used for person analysis or decision-making. The dataset is released under CC BY 4.0 license.
数据集概览
该数据集名为 Generation-Time Poisoning of LLM-Generated Social Networks,由 Kevynf 提供,采用 CC BY 4.0 许可协议。数据集语言为英文,主要面向图机器学习、社交网络、合成数据、大语言模型、图投毒、后门攻击、节点分类、链接预测等研究领域。
数据集内容
数据集包含合成的人物画像、大语言模型生成的社交图谱、缓存的文本嵌入向量,以及针对干净生成和三种生成时攻击家族的评估指标。所有名称和画像均为合成数据,不代表真实人物。
数据集变体
| 变体 | 节点数 | 生成器 | 每条件图种子数 | 攻击率 |
|---|---|---|---|---|
| p50 | 50 | Qwen3-Max | 10 | 10%, 20%, 30%, 40%, 50% |
| p200 | 200 | DeepSeek-V4-Flash | 3 | 10%, 20%, 30%, 40%, 50% |
| p200 | 200 | MiMo-v2.5-Pro | 3 | 10%, 20%, 50% |
条件标识符:
c:干净生成f_rXX:人物画像生成中的特征投毒s_rXX:链接生成中的结构投毒b_rXX:使用人物画像触发器和链接偏置的后门生成
攻击率定义了全局节点预算(floor(N * rate)),由合格候选集的大小限制,不是实际改变的图节点或边的比例。
数据文件与仓库结构
数据集包含以下配置(configs):
- p50_nodes, p50_edges, p50_graphs
- p200_nodes, p200_edges, p200_graphs
仓库布局如下:
raw/:包含 p50 和 p200 的原始生成内容(人物画像、节点ID、数组、图)processed/:包含 p50 和 p200 的节点、边、图的 Parquet 文件metrics/:包含 p50 和 p200 的评估指标 CSV 文件metadata/:包含 manifest.csv(记录每个工件的来源路径、数据集变体、条件、攻击家族、攻击率、生成器、图种子、字节大小、SHA-256 摘要)、generation_config.json(生成配置)、checksums.sha256(校验和)
归一化的节点表每条件每人物画像一行,边表包含每个图种子的有向邻接列表条目,图表提供条件、生成器、种子、节点数和边数元数据。
评估指标
metrics/ 目录包含最终评估表格,涵盖:结构统计、特征可分离性、GCN/SGC 节点分类、定向后门攻击成功率与干净准确率、链接预测 AUROC。API 成本日志因属于操作记录而非科学观察,被排除在外。
完整性与可复现性
LLM 支持的生成服务可能随时间变化,因此原始工件是复现报告指标的唯一权威输入。使用相同提示和种子的更新服务版本可能无法生成相同的图。
局限性与负责任使用
人物画像和政治倾向是基于人口统计分布和模型生成文本模拟的,不应被解释为对真实个体的测量或人口群体的证据。生成的名字可能偶然与真实姓名相似。该数据集仅用于图生成、鲁棒性和审计研究,不应用于人物画像或对人的决策。
数据集大小
数据集规模为 n<1K。




