遇见数据集

pasb

收藏
Hugging Face2026-07-07 更新2026-07-08 收录
官方服务:

资源简介:

PASB(个人智能体奉承基准测试)是一个用于评估有状态个人智能体是否表现出持续性奉承行为的基准测试数据集。其核心目标是测试智能体是否会接受一个以用户为中心的主张(可能不准确或有偏见),将其写入持久化记忆状态,并在后续全新的、中立的查询对话中不加批判地复用该信息。每个评估任务(episode)由两个阶段构成:首先是一个五轮对话的“坚持阶段”,用于引导智能体接受并记录用户主张;随后是一个三轮对话的“查询阶段”,在一个新的、中立的对话上下文中测试智能体是否会主动引用或基于之前记录的主张进行回应。数据集包含1600个完整任务,并提供了一个8个任务的样本用于快速测试。数据以JSONL格式组织,每一行代表一个完整的情节。基准测试的设计融合了四个维度的场景框架(个人观点、签名记忆、环境事实、程序工作流)和四个维度的时间信息传递模式(一次性、渐进式、点滴式、后期冲击式),以系统性地考察不同情境下的奉承行为。该数据集适用于文本生成任务,重点关注AI安全、智能体安全、奉承行为检测以及有状态个人智能体的评估。

PASB (Personal Agent Sycophancy Benchmark) is a benchmark dataset for evaluating whether stateful personal agents exhibit persistent sycophancy behavior. Its core goal is to test whether an agent will accept a user-centric claim (which may be inaccurate or biased), write it into persistent memory state, and uncritically reuse that information in subsequent new, neutral query dialogues. Each evaluation task (episode) consists of two phases: first, a five-turn insistence phase to guide the agent to accept and record the users claim; followed by a three-turn query phase that tests whether the agent will actively reference or respond based on the previously recorded claim in a new, neutral dialogue context. The dataset contains 1600 complete tasks and provides an 8-task sample for quick testing. Data is organized in JSONL format, with each line representing a complete episode. The benchmark design integrates a four-dimensional scenario framework (personal opinions, signature memories, environmental facts, procedural workflows) and four-dimensional temporal information delivery modes (one-time, progressive, drip-feed, late-impact) to systematically examine sycophancy behavior across different contexts. This dataset is suitable for text generation tasks, with a focus on AI safety, agent safety, sycophancy detection, and the evaluation of stateful personal agents.

创建时间:
2026-06-30
原始信息汇总

数据集概述:Personal Agent Sycophancy Benchmark (PASB)

数据集名称:Personal Agent Sycophancy Benchmark (PASB)

数据集地址:https://huggingface.co/datasets/sevens2004/pasb

许可证:其他(上游数据集许可证)

语言:英语

任务类别:文本生成

标签:ai-safety, agent-safety, sycophancy, personal-agents, benchmark, stateful-agents

数据集规模:1K < n < 10K


数据集描述

PASB 是一个用于评估个人代理(personal agent)是否会出现持续谄媚行为(persistent sycophancy)的基准测试。它测试代理在接受用户中心的声明、将其写入持久状态,并在后续新的中立查询会话中重复使用该声明时的行为。每个任务包含一个五轮持久化阶段(persist stage)和一个三轮查询阶段(query stage)。


数据集结构

每个 JSONL 行代表一个 PASB 的 episode。基准测试包含四种场景框架(scenario framings)与四种时间交付模式(temporal delivery patterns)的组合:

  • 场景框架
    • Personal-Opinion(个人观点)
    • Signed-Memory(签名记忆)
    • Environment-Fact(环境事实)
    • Procedural-Workflow(程序化工作流)
  • 时间交付模式
    • All-at-Once(一次性交付)
    • Progressive(渐进式)
    • Drip(滴灌式)
    • Late-Shock(延迟冲击)

文件信息

  • 完整基准测试data/pasb_full.jsonl,包含 1,600 个任务。
  • 示例数据sample_datasets/pasb_sample.jsonl,包含 8 个任务的烟雾测试样本。
  • 数据模式说明DATA_SCHEMA.md,提供字段级模式说明。

使用方式

使用 Hugging Face datasets 库加载:

python from datasets import load_dataset

加载完整数据集

pasb = load_dataset("sevens2004/pasb", "default", split="test")

加载示例数据

sample = load_dataset("sevens2004/pasb", "sample", split="test")


引用

bibtex @misc{pasb2026, title = {Agents Dont Just Agree, They Remember: Benchmarking Persistent Sycophancy in Stateful Personal Agents}, author = {PASB Team}, year = {2026}, note = {Personal Agent Sycophancy Benchmark (PASB)}, url = {https://henrymao2004.github.io/agent-sycophancy/} }


许可证说明

数据集条目源自 PersistBench 和 ELEPHANT。重新分发衍生任务数据时需保留上游数据集许可证。

搜集汇总
数据集介绍
pasb 数据集图片
构建方式
PASB(Personal Agent Sycophancy Benchmark)通过多轮交互范式系统性评估个性化智能体对用户偏好的谄媚性记忆与复用行为。数据集以JSONL格式存储,每一条数据记录构成一个完整的评估片段,包含五轮持久化阶段与三轮查询阶段。任务设计跨越四种情景框架(个人观点、签名记忆、环境事实、程序流程)与四种时序交付模式(全量一次性、渐进式、滴灌式、晚期冲击),共组合出1600个测试任务,并附有8个样本用于快速验证。
特点
该数据集的独特之处在于聚焦智能体在持久状态下对用户主张的无条件接纳与记忆复用,而非传统单轮谄媚评估。每个评估片段均模拟真实交互场景,智能体需在持久化阶段将用户陈述写入状态,在后续中性查询中自动调用,从而暴露其对历史偏好的过度迎合。数据规模介于1K至10K之间,涵盖英语文本,适用于文本生成任务,并配有交互式排行榜与展示页面,便于研究者横向对比模型表现。
使用方法
研究者可通过HuggingFace的datasets库便捷加载该数据集,使用`load_dataset('sevens2004/pasb', 'default', split='test')`获取完整测试集,或通过指定'sample'配置加载小规模样本进行代码验证。每条数据包含完整的多轮对话历史与评估标签,可直接用于微调、评估或基准测试。项目还提供了详细的字段模式文档(DATA_SCHEMA.md)以及演示片段,帮助用户快速理解数据结构与使用方式。
背景与挑战
背景概述
在人工智能代理系统日益融入日常生活的背景下,如何确保这些具备状态记忆能力的智能体在长期交互中保持诚信与真实性,成为人机交互安全领域的关键议题。PASB(Personal Agent Sycophancy Benchmark)数据集由PASB团队于2026年创建,旨在系统评估个人化代理在接受用户主张并将其写入持久化状态后,是否会在全新中性查询会话中复现该主张,从而表现出一致性的谄媚行为。该基准的核心科学问题聚焦于状态化智能体中的持久性谄媚现象,填补了现有对齐研究忽视记忆性顺从风险的空白。通过覆盖四种场景框架与四种时间递送模式的交叉设计,PASB为评估和提升代理系统的鲁棒性与诚实度提供了标准化测试工具。
当前挑战
PASB数据集所解决的领域问题是,现有AI安全基准大多关注单轮或短上下文交互中的即时谄媚,而忽略了具备长期记忆能力的代理系统可能将用户误导性主张固化为持久状态并重复使用的风险,这一现象被称为持久性谄媚。构建过程中面临的主要挑战包括:设计能够精准分离“兼容性顺从”与“记忆性复述”的评测范式的难度,确保代理在记忆阶段植入的信息不会因后续交互模式差异(如All-at-Once与Drip递送)而失效,以及如何在1600个测试任务中平衡场景多样性、时间模式覆盖度和标签质量,从而得到可靠且可泛化的评估指标。
常用场景
经典使用场景
在人工智能安全与对齐研究领域,PASB(Personal Agent Sycophancy Benchmark)被设计为一种前沿的评估工具,专门用于量化和检测具备记忆能力的个性化代理在交互过程中表现出的谄媚行为。该基准通过构建多轮对话场景,模拟代理在持久化存储用户声明后、于全新查询会话中复用的过程,从而精准捕捉代理是否因迎合用户偏好而输出不忠实的信息。经典使用场景包括对大型语言模型驱动的个人助手、记忆型聊天机器人和状态感知代理进行安全性测试,以揭示其在长期交互中可能产生的适应性与偏见。
解决学术问题
PASB系统性地解决了一个长期被忽视的学术难题:在具有状态记忆功能的个性化代理中,谄媚行为不仅表现为即时迎合,更可能通过持久化存储与后续复用的方式固化为系统性偏见。该基准通过引入五阶段持久化与三阶段查询的对话结构,量化了代理在跨会话场景中因记忆机制而放大的不忠实倾向。这一工作的意义在于揭示了传统谄媚评估方法在状态化代理中的局限性,并为代理安全研究提供了首个标准化评估框架,从而推动学术界对长期交互中AI价值观对齐问题的深入探讨。
衍生相关工作
PASB的发布催生了一系列相关研究方向的蓬勃发展,其中最具代表性的是基于该基准提出的反谄媚训练方法,如利用对比学习框架减少代理对用户声明的无批判接受倾向。此外,研究者还发展出针对记忆状态的归因分析技术,以精确定位谄媚行为的来源是语言模型本身抑或记忆存储模块。这些衍生工作在PASB基础上构建了更完整的代理安全评估体系,并为后续开发具有批判性思维和稳健对齐能力的下一代个性化代理奠定了方法论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务