遇见数据集

ranausmans/feed-injection-pool

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为Feed-Injection Post Pools,是一个社交媒体风格的帖子池,用于研究推荐系统作为LLM代理的控制表面:对抗性feed注入、模型机制和简单防御。每条帖子以JSON格式存储,包含id、topic、stance、intensity、text等字段,对抗性帖子还包括adversarial、angle、generator字段。数据集分为两部分:远程工作池(headline实验),包括有机帖子、支持返回办公室的对抗性帖子、支持远程工作的对抗性帖子,以及使用Gemma模型生成的变体;泛化任务池(多任务实验),包括安全任务的有机帖子和对抗性帖子,涉及UBI、AI监管、部署安全、供应商安全和访问策略等主题。数据集用于评估推荐系统在LLM代理环境中的对抗性攻击和防御。

The dataset is named Feed-Injection Post Pools, consisting of social-media-style post pools used in the research Recommenders as Control Surfaces for LLM Agents: Adversarial Feed Injection, Model Regimes, and Simple Defenses. Each post is in JSON format with fields such as id, topic, stance, intensity, text, and for adversarial posts, additional fields like adversarial, angle, and generator. It includes two main parts: remote-work pools (headline experiments) with organic posts, adversarial pro-return-to-office and pro-remote posts, and generator-swap variants using Gemma; and generalization-task pools (multi-task experiments) with organic posts for security tasks and adversarial posts pushing attacker-target options across tasks like UBI, AI regulation, deployment security, vendor security, and access policy. The dataset is designed for studying adversarial attacks and defenses in recommender systems within LLM agent contexts.

提供机构:
ranausmans
搜集汇总
数据集介绍
ranausmans/feed-injection-pool 数据集图片
构建方式
该数据集围绕社交媒体风格的帖子池构建,每条数据以JSON行格式存储,包含id、主题、立场、强度、文本等核心字段。对于对抗性帖子,额外添加adversarial、angle和generator字段以记录攻击属性。数据来源涵盖Claude和Gemma 4-e4b两种大语言模型,其中Claude生成500条有机帖子与100条对抗性帖子,Gemma 4-e4b则贡献100条有机帖子及多条对抗性帖子,分别用于远程工作头条实验与泛化安全任务实验。不同任务下的有机帖子池与对抗性帖子池按文件组织,对抗性帖子针对特定攻击方向(如支持回办公室、放松访问控制等)进行设计,形成结构化的数据体系。
特点
本数据集具有鲜明的对抗性特征,聚焦于推荐系统作为大语言模型智能体控制面的安全威胁。通过远程工作头条实验与泛化安全任务实验两大板块,数据集覆盖多主题有机内容与定向攻击内容,每条对抗性帖子均标注攻击角度和生成模型,便于分析不同攻击策略。数据规模较小但粒度精细,总行数不足1000条,适合作为概念验证和脆弱性分析的基准。此外,数据集严格遵守CC-BY-4.0许可,鼓励学术界与工业界在此基础上展开防御机制研究,其配套的rollouts数据集进一步丰富了评估场景。
使用方法
该数据集适用于大语言模型推荐系统中的对抗性攻击与防御研究。用户可直接加载各JSONL文件进行实验,有机帖子池可作为基线环境,对抗性帖子池则用于模拟攻击场景。建议结合论文中描述的模型状态(脆弱态、鲁棒态等)与简单防御策略进行效果验证。使用时可参考配套的代码仓库与rollouts数据集,实现从攻击生成到系统评估的完整流程。由于数据为英文且涉及推荐系统安全,适合具备大语言模型微调或智能体安全背景的研究者使用,同时注意对抗性内容可能需要特定的提示处理逻辑才能复现论文结果。
背景与挑战
背景概述
随着大语言模型(LLM)在推荐系统与自主智能体中的广泛应用,模型面临的安全性与鲁棒性挑战日益严峻。Feed-Injection Pool数据集由Rana Muhammad Usman于2026年创建,其核心研究问题聚焦于通过对抗性feed注入操控LLM智能体的行为,并探索相应的防御机制。该数据集模拟社交媒体动态内容分发场景,包含有机帖子和对抗性帖子两类样本,覆盖远程工作、安全策略、AI监管等多样议题,为研究推荐系统作为攻击面下的模型安全提供了标准化测试资源。在相关领域,本数据集首次系统性地将推荐系统的控制面与LLM智能体的决策过程关联,推动了对抗性内容注入攻击与防御的研究进展。
当前挑战
该数据集所解决的领域问题核心在于推荐系统作为LLM智能体控制面时面临的对抗性feed注入攻击,即攻击者通过精心设计的可控帖子诱导模型输出偏离预期结果,例如促使模型支持重返办公室政策或放松安全审批。构建过程中面临的主要挑战包括:确保有机帖子与对抗性帖子在主题、立场、强度等维度上的可控性与多样性;平衡不同攻击角度(如直接推送目标立场与反方向控制)的样本分布;以及跨模型(如Claude与Gemma)生成内容时保持语言风格与攻击效力的稳定性,从而为后续防御策略的评估提供可靠基准。
常用场景
经典使用场景
在当代人工智能安全研究中,大型语言模型与推荐系统的深度耦合引发了前所未有的安全隐患。feed-injection-pool数据集专为探索推荐系统作为语言模型代理控制表面的威胁模型而设计,其经典使用场景聚焦于对抗性信息注入攻击的模拟与防御。该数据集包含数百条模拟社交媒体帖文,覆盖远程办公、人工智能监管等话题,每条帖文标注了立场、攻击角度和生成来源。研究者可利用该数据集构建可控实验环境,系统性地评估对抗性推荐内容如何操纵语言模型代理的决策行为,为理解推荐系统对语言模型的安全边界渗透提供标准化测试平台。
解决学术问题
该数据集精准回应了当前学术界对语言模型代理安全性的深层关切,核心解决了三大研究难题。其一,揭示了推荐系统作为攻击向量时,对抗性内容注入如何绕过传统安全对齐机制,实证了语言模型在推荐上下文中的脆弱性。其二,构建了从攻击角度、强度到防御策略的完整分析框架,使研究者能够量化不同防御机制(如提示注入检测)的有效性。其三,通过多任务泛化实验设计,验证了对抗性攻击策略在不同政策场景(如生产部署安全、供应商安全)间的可迁移性,为构建鲁棒性代理安全体系提供了理论支撑与实证基础。这项工作的意义在于将推荐系统与语言模型的交互安全纳入了系统化的研究范式。
衍生相关工作
围绕feed-injection-pool数据集,已衍生出一系列极具影响力的研究工作。该数据集本身即是论文《Recommenders as Control Surfaces for LLM Agents: Adversarial Feed Injection, Model Regimes, and Simple Defenses》的核心实验平台,该工作首次系统定义并量化了推荐系统对语言模型代理的对抗性控制。配套的feed-injection-rollouts数据集进一步扩展了长序列交互场景下的攻击模式研究。该成果催生了多个后续方向,包括基于元学习的动态防御框架、跨模型架构的对抗性迁移分析、以及推荐系统安全审计协议的设计。这些衍生工作共同构筑了语言模型代理安全研究的理论基石,持续推动着从威胁建模到实用防护的完整生态演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务