遇见数据集

ranausmans/feed-injection-rollouts

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为Feed-Injection Decision Rollouts,包含多轮代理决策滚动数据,源自论文Recommenders as Control Surfaces for LLM Agents: Adversarial Feed Injection, Model Regimes, and Simple Defenses.。每条记录代表一次滚动:一个LLM代理滚动一个信息流10轮,然后被问一个强制选择的A/B/C决策。数据集包含2,785个决策滚动,覆盖四个开源指令LLM(如Llama 3.2-3B、Gemma 4-e4b、Qwen 3.5-2B/9B)以及一个小规模前沿模型探针。字段包括模型、主题、条件/策略、种子、轮数、选择、原始数据等,并带有实验标签。文件分为多个JSONL文件,用于不同目的,如对抗性现代LLM测试、后续分析、跨任务泛化等。

This dataset, named **Feed-Injection Decision Rollouts**, encompasses multi-round agent decision rollout data derived from the paper *Recommenders as Control Surfaces for LLM Agents: Adversarial Feed Injection, Model Regimes, and Simple Defenses*. Each record corresponds to a single rollout: an LLM agent runs an information stream for 10 rounds, followed by a forced-choice A/B/C decision query. The dataset contains 2,785 decision rollouts, covering four open-source instruction-tuned large language models (e.g., Llama 3.2-3B, Gemma 4-e4b, Qwen 3.5-2B/9B) and a small-scale state-of-the-art model probe. Its fields include model, topic, condition/strategy, seed, round count, selected choice, raw data, and experimental labels. The dataset is split into multiple JSONL files for various use cases, such as adversarial state-of-the-art LLM testing, follow-up analysis, cross-task generalization, and more.

提供机构:
ranausmans
搜集汇总
数据集介绍
ranausmans/feed-injection-rollouts 数据集图片
构建方式
该数据集源自一项针对大型语言模型智能体在推荐系统驱动下进行多轮决策的研究。其构建过程模拟了智能体在十轮信息流滚动后,被迫做出三选一决策的场景。每条数据实例代表一次完整的决策轨迹,记录了模型类型、主题、实验条件或策略、随机种子、交互轮次、最终选择及原始输出。数据集通过系统化的实验设计生成,涵盖多种对抗性注入条件和控制变量,共计2,785条决策轨迹,数据以JSONL格式存储,便于高效处理与分析。
特点
本数据集的核心特色在于其多维度的实验覆盖与精细化的条件设计。它跨越了Llama 3.2-3B、Gemma 4-e4b、Qwen 3.5-2B/9B等四种主流开源指令微调模型,并包含前沿模型探针测试。数据被组织为九个文件,分别针对对抗性注入、反方向策略、生成器交换、剂量响应、跨任务泛化及锁定实验等不同研究目的。这种结构化设计使得研究者能够深入探究模型在不同攻击强度与策略下的脆弱性模式,为安全评估提供了坚实的数据基础。
使用方法
用户可通过克隆GitHub代码仓库便捷地复现原文中的统计分析与图表生成。具体而言,执行'pip install -r requirements.txt'安装依赖后,运行'10_rigorous_stats.py'脚本可获取严格的统计检验结果,运行'11_paper_figures.py'可再现论文核心图表。对于跨任务泛化相关分析,则通过'12_task_generalization.py'与'13_task_figure.py'脚本完成。所有数据文件均位于HuggingFace数据集页面,可直接下载并加载至机器学习工作流程中进行定制化分析与模型评估。
背景与挑战
背景概述
在大语言模型与推荐系统深度融合的背景下,如何确保智能体在交互决策中的鲁棒性与安全性成为关键议题。由Rana Muhammad Usman等人于2026年创建的Feed-Injection Decision Rollouts数据集,围绕“推荐系统作为控制面”这一核心理念,系统研究了对抗性信息注入对LLM智能体决策轨迹的影响。该数据集涵盖8个细分实验文件,共计2785条决策轨迹,涉及Llama 3.2-3B、Gemma 4-e4b、Qwen 3.5-2B/9B等四类主流开源指令模型及前沿模型Claude的探测实验。通过多轮交互滚动与强制A/B/C选择机制,该工作首次量化了推荐内容操纵下智能体的决策偏移现象,为理解人机协同系统中的安全边界提供了实证基础,对语言模型与推荐系统交叉领域的研究具有显著的范式推动作用。
当前挑战
该数据集所应对的核心挑战在于揭示并防范推荐系统作为攻击面所引发的智能体行为失稳。一方面,领域面临推荐内容注入诱导智能体偏离预设偏好的基线问题,即对抗性feed injection造成的决策偏移,这威胁了人机交互的可信度与可靠性;另一方面,数据构建过程中需应对多因素交织的复杂性,包括跨模型泛化差异、多轮对话中攻击累积效应、以及不同决策任务下的剂量反应关系。研究者在实验中同步引入了抗方向、生成器交换等防御策略的评估,以及lock实验网格、前沿模型探测等验证手段,使得解耦模型、条件与种子间的非线性交互成为方法论上的严峻挑战。
常用场景
经典使用场景
在信息检索与推荐系统的交叉领域,该数据集主要用于评估和剖析大型语言模型(LLM)在多轮交互推荐场景中遭遇对抗性馈送注入攻击时的脆弱性。经典的使用方式是将数据集中的每条决策轨迹视为一个独立的测试样本,通过测量LLM智能体在浏览10轮推荐内容后,其最终三选一决策(A/B/C)相较于原始偏好的偏移程度,来量化攻击的有效性。该数据集覆盖了Llama、Gemma、Qwen等多个开源指令微调模型,并包含不同攻击策略(如反方向注入、生成器替换)和剂量响应设置,为研究攻击的通用性与边界提供了标准化的评估基准。
衍生相关工作
该数据集衍生了一系列关于LLM智能体安全性的重要工作,包括对决策偏移的统计检验方法、面向跨任务泛化攻击的评估框架,以及基于剂量响应的细粒度脆弱性分析。在此基础上,研究者提出了包括反方向注入、生成器交换等攻击变体,并探索了如采用显式防御指令或强制动态遗忘等简单但有效的防御策略。这些工作共同构建了一个从攻击发现、机制解释到防御设计的研究闭环,不仅深化了对抗性机器学习在推荐场景中的理论基础,也为后续开发更可靠的智能体对齐技术指明了方向,催生了诸如“推荐系统作为控制表面”这一新范式的研究浪潮。
数据集最近研究
最新研究方向
该数据集聚焦于大语言模型智能体在推荐系统场景下的对抗性反馈注入攻击与防御前沿。通过模拟多轮决策回滚实验,系统揭示了LLM在面对精心设计的对抗性推荐内容时产生的决策偏移现象,覆盖Llama 3.2-3B、Gemma 4-e4b等主流开源模型及前沿模型探针。数据集的跨任务泛化设计与剂量-响应分析为理解模型鲁棒性边界提供了量化基准,相关研究直接关联当前AI安全领域对推荐系统作为攻击界面的热点关切,对构建可信赖的自主智能体系统具有里程碑式的意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务