遇见数据集

AntiSkillBench

收藏
arXiv2026-08-04 更新2026-08-06 收录
官方服务:

资源简介:

AntiSkillBench是一个端到端基准测试,旨在评估人物技能管道中的隐私泄露与冒充风险。该数据集包含由50个行为丰富的人物档案构建的7500段人物对话记录,每个档案涵盖人口统计、背景、大五人格及沟通风格等多维属性。数据集创建过程基于OpenCharacter档案,通过生成覆盖通用协助、数学计算和工具设计三大场景的50个问题,并经过三轮对话扩展得到。其应用领域聚焦于技能级隐私泄露与智能体级属性披露及行为模仿的风险评估,为开发隐私保护和真实性感知的人物技能提供了严谨的基准。

AntiSkillBench is an end-to-end benchmark designed to evaluate privacy leakage and impersonation risks in persona skill pipelines. This dataset contains 7500 persona conversation records constructed from 50 behaviorally rich persona profiles, each covering multidimensional attributes including demographics, background, Big Five personality traits, and communication styles. The dataset was developed based on OpenCharacter profiles: 50 questions covering three core scenarios—general assistance, mathematical computation, and tool design—were generated, followed by three rounds of conversation expansion. Its application focuses on risk assessment of skill-level privacy leakage, agent-level attribute disclosure and behavior imitation, providing a rigorous benchmark for developing privacy-preserving and authenticity-aware persona skills.

创建时间:
2026-08-04
原始信息汇总

数据集概述

AntiSkillBench 是一个端到端的基准测试数据集,用于评估人物画像技能(Persona Skills)在个性化代理(Agent)应用中的安全风险与防御措施。该数据集由悉尼大学、昆士兰大学、东南大学及穆罕默德·本·扎耶德人工智能大学的研究团队联合构建。

数据集构成

  • 规模:包含 7,500 条基于人物画像的对话轨迹(dialogue traces)。
  • 画像来源:基于 50 个行为特征丰富的用户画像(profiles),覆盖多样的任务场景。
  • 构建目的:将分散的个人交互历史提炼为可移植、可执行的技能(persona skills),用于下游代理的个性化服务。

评估内容

该基准提供了全面的评估套件,涵盖三个层面:

  1. 技能级隐私泄露:衡量从提炼出的技能中直接暴露的隐私信息程度。
  2. 代理级属性披露:评估代理在交互中是否披露用户敏感属性(如身份、行为特征)。
  3. 行为模仿风险:测试代理是否会模仿用户的行为风格或人格特质,造成身份冒用风险。

评估过程覆盖 三种技能蒸馏策略,并在 三个前沿代理模型 上进行了实验验证。

防御机制评估

数据集还包含对 四种防御配置 的评估,涵盖在线干预与事后干预两类方法:

  • 主动风险抑制:在技能生成或使用过程中主动抑制风险信息。
  • 被动来源保护:通过溯源机制保护原始数据,防止隐私外泄。

主要发现

  • 人物画像技能的风险在多个代理骨干网络和蒸馏协议中普遍存在,泄露范围从显性属性(如姓名、联系方式)扩展到沟通风格和人格特质。
  • 现有防御方法效果有限,且依赖具体的蒸馏策略,无法在不同风险类型和蒸馏方法之间通用。
  • 该基准旨在推动开发更具隐私保护能力和真实性保障的人物画像技能。

资源信息

  • 数据集页面:https://yonglixiang.github.io/AntiSkillBench
  • 论文、数据集及代码均已发布或即将发布(代码即将发布)。
  • 页面最后更新时间:2026 年 8 月。
搜集汇总
数据集介绍
AntiSkillBench 数据集图片
构建方式
AntiSkillBench的构建始于对OpenCharacter数据集中50个行为丰富用户轮廓的深度剖析,在吸纳人口统计学与背景信息之余,创新性地融入大五人格特质与精细沟通风格两大维度,以此捕捉用户‘是谁’与‘如何交流’的复合画像。基于此,为每个轮廓定制50个涵盖通用协助、数学计算与工具设计场景的个性化问题,并模拟三轮多轮对话,最终形成包含2500条对话痕迹、共计7500个用户轮次的庞大数据集。构建过程巧妙融合了任务合理性与个体揭示性,确保了痕迹既贴近真实应用又富含个人信息。
特点
该数据集的核心特征在于其系统性地覆盖了人物技能流水线的两端风险:技能层面通过Skill Coverage量化敏感信息在蒸馏工件中的留存率,而智能体层面则运用Field QA Accuracy与VocabGain双重指标,分别评估直接属性泄露与目标化语言风格复现的程度。尤其值得注意的是,VocabGain超越了传统固定任务的风格评估,通过用户与类别特定的场景与词汇标记,精准衡量了智能体在未见情境下的模仿能力。数据集横跨三种蒸馏协议与四个防御配置,揭示了隐私与冒充风险的结构性渗透,以及现有防御措施的局限性与蒸馏依赖性。
使用方法
AntiSkillBench旨在为研究者提供一个端到端的评估框架,用以系统考察人物技能从痕迹蒸馏到下游部署的完整链路。使用者可基于该数据集,采用Direct Distill、Three-stage Distill或Colleague Distill三种协议蒸馏出技能工件,进而部署至GPT-5.4、Claude Haiku 4.5等前沿智能体,评估其隐私泄露与冒充风险。数据集同时集成了在线实时干预与事后追踪注入两类防御方案,涵盖主动风险抑制与被动溯源保护。研究者可据此复现实验,调整对话数量、消毒强度或后门注入覆盖率等变量,深入探究风险与防御的动态关系,推动隐私保护与真实性感知的人物技能发展。
背景与挑战
背景概述
AntiSkillBench是2026年由悉尼大学、昆士兰大学等机构联合推出的首个针对人格技能(Persona Skills)安全性的端到端基准,旨在系统评估从个人交互轨迹蒸馏为可复用技能工件过程中产生的隐私泄露与身份模仿风险。随着大语言模型智能体日益依赖可移植的技能工件实现个性化服务,人格技能虽提升了交互效率,却也集中放大了个人信息暴露面,并削弱了传统基于记录级匿名化的防御手段。该基准构建了包含50个行为丰富画像、7,500条人格对话轨迹的数据集,并提出了技能级隐私泄露与智能体级身份模仿的双层风险评价体系,覆盖三种蒸馏协议与四类防御配置,为个性化智能体系统的隐私与真实性研究提供了关键测评平台。
当前挑战
AntiSkillBench所面临的挑战分为两个层面。在领域问题层面,人格技能通过跨轨迹蒸馏将分散的个人信号集中为紧凑、可迁移的工件,导致隐私信息暴露面扩大且影响被放大,同时此类蒸馏削弱了传统记录级匿名化与检索过滤等防御的有效性,使得潜在个人信息可从间接信号中推断。在构建过程中,挑战在于生成兼具任务合理性与个体揭示性的多轮对话轨迹,需在控制条件下模拟真实交互的多样性,并设计能够捕捉显性属性与隐性行为风格泄露的测评指标,如技能覆盖率与词汇增益,同时构建涵盖在线/事后、主动/被动干预的防御评估套件,以应对跨模型与跨蒸馏协议下风险持续存在且现有防御效果有限的问题。
常用场景
经典使用场景
AntiSkillBench作为一项端到端基准测试,其核心用途在于系统性地评估个性技能(Persona Skills)流水线中固有的隐私泄露与身份冒充风险。该数据集精心构建了7500条基于人物设定的对话轨迹,覆盖50个行为丰富的用户画像,并跨越通用协助、数学计算与工具设计等多种任务场景,为研究界提供了一个可复现、可比较的标准化测试平台。研究者可借助该基准,对不同技能蒸馏策略下生成的可执行技能制品进行静态层面的隐私覆盖度分析,亦可在动态层面考察装备技能后的智能体在直接询问与情境生成中暴露用户属性及模仿其行为模式的程度,从而深入理解从对话轨迹到技能制品再到智能体行为的风险传播链条。
衍生相关工作
AntiSkillBench的提出催生了一系列后续研究,推动了个性技能安全领域的蓬勃发展。其问题界定与评估框架启发了针对技能蒸馏过程的隐私保护新方法,例如开发更精细的隐私净化算法或设计可泛化的去个性化技术。同时,该基准对防御策略效能的分析促成了对语义级后门注入机制在人格中心化蒸馏下失效原因的深入探讨,进而激发了关于鲁棒水印技术与可追溯技能制品的研究。此外,其关于行为模仿风险的量化手段也为数字孪生、社会模拟及个性化内容生成等领域提供了评估工具,促使研究者重新审视智能体个性化与身份真实性之间的平衡,相关衍生工作已开始探索跨模型、跨协议的防御泛化策略。
数据集最近研究
最新研究方向
随着大语言模型驱动的智能体日益普及,人格技能(Persona Skills)作为一种将用户交互历史蒸馏为可复用、可移植、可执行构件的新兴范式,正深刻改变个性化智能体的部署方式。然而,这一过程将分散的个人信号集中化、复用化并放大其影响,催生了技能级隐私泄露与智能体级身份冒充的新型安全风险。AntiSkillBench基准的提出,系统性地构建了涵盖7500条人格对话痕迹、三种蒸馏策略与四类防御配置的端到端评估框架,揭示了前沿模型在属性暴露、沟通风格与人格特质层面的持久性泄露,并指出现有防御手段在跨蒸馏协议下的有效性与泛化能力均存在显著局限。该基准不仅为隐私保护与真实性感知的人格技能研发提供了严苛的测试平台,也凸显了在个性化智能体快速演进之际,构建贯穿痕迹—技能—智能体全链路的系统性安全防护机制的紧迫性与深远意义。
相关研究论文
  • 1
    When Agents Learn to Be You: Benchmarking Privacy Leakage, Impersonation Risk, and Defenses in Persona Skills悉尼大学; 昆士兰大学; 东南大学; 穆罕默德·本·扎耶德人工智能大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务