遇见数据集

ServiceNow/PrivacyAlign

收藏
Hugging Face2026-06-17 更新2026-07-22 收录
官方服务:

资源简介:

PrivacyAlign是一个人类标注的偏好数据集,用于训练和评估隐私对齐的工具使用代理。每个数据行包含同一代理场景下两个不同模型生成的候选最终动作,以及人类偏好标签和每个响应的隐私标注(如泄露和遗漏)。场景是合成的,包括用户名、电子邮件、记忆和工具轨迹都是生成的,不包含真实用户数据。数据集分为训练集(1,150行)和测试集(200行),适用于训练奖励模型和大型语言模型代理,以使其更符合人类隐私规范,并评估代理性大型语言模型在最终工具调用中是否泄露敏感上下文或遗漏有用的非敏感细节。

PrivacyAlign is a human-annotated preference dataset for training and evaluating privacy-aligned tool-use agents. Each row pairs two candidate final actions from different models for the same agentic scenario, along with human preference labels and per-response privacy annotations (leaks and omissions). The scenarios are synthetic, with generated user names, emails, memories, and tool trajectories, and no real user data is included. The dataset is split into train (1,150 rows) and test (200 rows) sets, intended for training reward models and LLM agents to align with human privacy norms, and evaluating agentic LLMs on privacy leakage and omission in tool calls.

提供机构:
ServiceNow
搜集汇总
数据集介绍
ServiceNow/PrivacyAlign 数据集图片
构建方式
PrivacyAlign数据集由ServiceNow团队构建,旨在为隐私对齐的工具使用代理提供训练与评估支持。其核心构建方式基于合成场景:通过生成虚构的用户姓名、电子邮件、记忆信息及工具调用轨迹,模拟真实的代理交互环境。每一数据行包含同一代理场景下两个候选最终动作(来自不同模型),并由人类标注员提供偏好标签及逐响应的隐私注释(如隐私泄露与遗漏)。数据集分为训练集(1150条)和测试集(200条),测试集保留用于评估。标注过程依托Prolific平台招募众包工作者完成,同时由内部标注员提供少量金标准注释,确保数据质量与多样性。
特点
该数据集的核心特征在于其精细的隐私导向设计。每个样本不仅包含场景上下文(用户指令、记忆、工具轨迹等),还提供了结构化的候选动作对及其对应模型来源。人类注释涵盖多维度偏好投票(六档偏好)与自由文本解释,同时针对每条响应标记隐私泄露与遗漏的具体细节。数据集支持聚合信号(如多数投票与胜出比例)和众包标注不确定性,强调标签为指导而非绝对真理。合成数据特性避免了真实用户隐私风险,同时保留了复杂代理交互中隐私决策的多样性,为研究模型隐私对齐行为提供了丰富素材。
使用方法
PrivacyAlign数据集的主要使用途径包括训练奖励模型和提升LLM代理的隐私对齐能力,以及评估代理模型在工具调用过程中是否泄露敏感上下文或遗漏有用非敏感信息。用户可通过HuggingFace的datasets库轻松加载数据,使用`load_dataset('ServiceNow/PrivacyAlign')`即可获取训练与测试集。每个样本的结构化字段便于提取场景信息、候选动作及注释结果,研究者可依据`preference_counts`和`majority_bucket`字段获取聚合偏好信号,或深入单条注释分析隐私标签。数据集接口标准化,适配偏好学习(如RLHF)和隐私评估管线,适用于对代理行为进行隐私合规性评测的各类实验设计。
背景与挑战
背景概述
PrivacyAlign数据集由ServiceNow研究团队于近期创建,旨在解决智能体工具调用过程中的隐私对齐问题。随着大语言模型驱动的自主智能体在医疗、社会服务等敏感领域广泛应用,模型在调用工具时可能无意泄露用户隐私信息或遗漏必要细节,这构成了严峻的安全隐患。该数据集通过构建合成用户场景、记忆与工具轨迹,收集人类标注者对不同模型输出的偏好判断,为训练隐私合规的奖励模型与智能体提供了标准化评估基准。其核心研究问题在于如何使智能体的工具调用行为更符合人类隐私规范,对推动负责任的自主智能体发展具有重要价值。
当前挑战
PrivacyAlign所解决的领域挑战在于大语言模型智能体在执行工具调用时,缺乏对敏感上下文泄露(如不当暴露用户姓名、邮箱等)与必要信息遗漏(如未包含关键医疗数据)的自主判别能力,而现有训练数据多忽略此类隐私维度。构建过程中,研究团队面临合成场景的生态效度难题——模拟用户数据难以完全反映真实交互的隐私复杂性;同时,众包标注者之间对隐私泄漏与遗漏的标准存在显著分歧,需要设计多轮投票机制和黄金标注子集来缓解标签噪声,确保偏好信号的有效性。
常用场景
经典使用场景
PrivacyAlign数据集专为训练与评估注重隐私保护的工具调用智能体而设计,其核心应用场景在于偏好对齐。通过成对呈现不同模型在相同智能体情境下的候选最终动作,并辅以人工标注的偏好标签及逐响应隐私注释(包括信息泄露与遗漏),研究者可据此构建奖励模型或直接优化大型语言模型,使其在调用外部工具时更贴合人类的隐私规范。该数据集包含1150条训练样本与200条测试样本,涵盖了医疗健康、社会工作等多个涉及敏感信息的领域,为探索模型在复杂工具交互中平衡效用与隐私提供了标准化的实验平台。
解决学术问题
PrivacyAlign直面当前智能体系统在隐私保护方面的关键挑战,解决了如何量化与对齐模型工具调用行为中隐私维度的学术难题。传统研究多聚焦于模型输出的准确性与流畅性,却忽视了工具交互场景下敏感信息的泄露风险与非敏感细节的遗漏问题。该数据集通过系统化的偏好标注与细粒度的隐私错误定位,为评估和优化模型的隐私敏感度提供了可操作的参照标准。其意义在于将隐私保护从定性讨论推进到定量可测的实证研究,推动了人机交互中隐私规范的系统性建模,并为更安全可信的自主智能体设计奠定了数据基础。
衍生相关工作
PrivacyAlign的发布催生了若干重要衍生研究方向。其一,基于该数据集训练了专门的隐私偏好奖励模型,如通过对比学习从偏好标签中提炼隐私评分函数,进而对智能体进行强化学习微调。其二,研究者提出了隐私导向的评估基准,将传统工具使用准确率与泄露、遗漏指标结合,形成多维度的隐私对齐衡量体系。此外,该数据集还被用于探索模型解释性分析,通过关联人工标注的泄露细节与模型内部表示,理解隐私错误的归因模式。这些工作共同构成了隐私对齐智能体领域的实证研究基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务