遇见数据集

SopriBench

收藏
Hugging Face2026-06-12 更新2026-06-13 收录
官方服务:

资源简介:

SopriBench是首个专注于评估社交媒体平台隐私推断风险的大规模多模态基准数据集。该数据集旨在为隐私保护人工智能、对抗性隐私攻击以及多模态表示学习的研究提供支持。数据集包含50个合成生成的用户档案以及与之关联的1,569张图像,所有数据均不包含任何真实用户信息,确保了使用的安全性。数据提供了细粒度的个人属性标注,涵盖总计28个属性,这些属性被系统地组织在四个维度下:基本信息、社会经济地位、生活方式以及敏感信息。数据集的结构包含用户ID、隐藏的个人资料(内含姓名和性别)、帖子标题、图像以及泄露的属性序列等字段。当前公开的版本为一个包含3个用户预览子集,用于展示数据结构和标注质量,完整数据集将在相关学术论文正式发表后发布。

SopriBench is the first large-scale multimodal benchmark dataset focused on evaluating privacy inference risks on social media platforms. It aims to support research in privacy-preserving artificial intelligence, adversarial privacy attacks, and multimodal representation learning. The dataset includes 50 synthetically generated user profiles and 1,569 associated images, all of which contain no real user information, ensuring safety in use. It provides fine-grained personal attribute annotations covering a total of 28 attributes, systematically organized into four dimensions: basic information, socioeconomic status, lifestyle, and sensitive information. The dataset structure includes fields such as user ID, hidden profiles (containing name and gender), post titles, images, and sequences of leaked attributes. The currently released version is a preview subset containing 3 users, intended to demonstrate the data structure and annotation quality, with the full dataset to be released after the publication of the relevant academic paper.

创建时间:
2026-06-12
原始信息汇总

数据集概述:SopriBench

基本信息

  • 名称:SopriBench
  • 语言:英文
  • 标签:社交媒体隐私、用户级隐私推断、多模态基准测试、大语言模型智能体
  • 大小:1,000到10,000条数据之间
  • 论文地址:https://arxiv.org/abs/2606.06784

数据集描述

SopriBench 是首个大规模多模态基准测试数据集,专门用于评估社交媒体平台上的隐私推断风险。数据集包含 50 个用户画像和 1,569 张图片,并对 28 个个人属性进行了细粒度标注,这些属性覆盖四个维度:基本信息、社会经济状况、生活方式和敏感信息。


设计目的

该数据集旨在促进以下研究方向:

  • 隐私保护型人工智能
  • 对抗性隐私攻击
  • 多模态表示学习

所有数据均为合成生成,不包含任何真实用户信息。


数据集结构

数据集包含以下字段:

字段名 类型 说明
user_id 字符串 用户唯一标识
hidden_profile 结构体(包含 name 和 gender 字段,均为字符串) 隐藏的用户画像(姓名、性别)
post_title 字符串 帖子标题
image 图片 帖子中的图片
leaked_attributes 字符串序列 泄露的属性列表

版本与获取

搜集汇总
数据集介绍
SopriBench 数据集图片
构建方式
SopriBench作为首个面向社交媒体平台隐私推断风险评估的大规模多模态基准数据集,其构建过程严格遵循合成数据生成范式。研究团队通过模拟真实社交网络环境,精心设计了50个虚拟用户画像,并为每个用户配置了标题文本与关联图像。在此基础上,数据集对28项个人隐私属性进行了细粒度标注,涵盖基础信息、社会经济地位、生活方式及敏感信息四大维度,所有数据均通过自动化流程合成,确保不含任何真实用户信息。
使用方法
数据集的使用需依托HuggingFace平台进行加载与处理。研究人员可通过`datasets`库直接调用预发布的3用户预览子集,利用内置的`user_id`、`hidden_profile`、`post_title`及`image`等字段构建隐私推断任务。完整的50用户版本需待论文正式发表后获取,用户可通过指定仓库地址下载全量数据,结合`leaked_attributes`序列标签开展多任务学习或对抗性攻击实验,所有操作均需遵循数据集的学术使用规范。
背景与挑战
背景概述
SopriBench是由研究者Nina-Huang等人创建的首个大规模多模态基准数据集,旨在系统评估社交平台上的隐私推断风险。该数据集于2025年提出,核心研究问题聚焦于用户级隐私泄露的检测与量化,涵盖50个用户画像及1569张图像,并精细标注了包括基本信息、社会经济地位、生活方式和敏感信息在内的28项个人属性。作为隐私保护人工智能、对抗性隐私攻击及多模态表示学习领域的重要工具,SopriBench通过合成数据规避了真实用户信息的伦理风险,为隐私安全研究提供了标准化评估平台,对推动社交网络隐私保护技术的发展具有深远影响。
当前挑战
该数据集所解决的领域挑战在于:社交平台中用户隐私信息常通过多模态内容(如文本和图像)被无意识泄露,现有研究缺乏系统评测基准,难以量化隐私推断风险并设计有效防御策略。构建过程中,研究者需平衡数据的真实性与隐私伦理,采用合成生成技术确保无真实用户信息;同时,需确保多模态数据(如帖子标题与图像)间的语义一致性,并实现28项细粒度属性的精准标注,涵盖从显性信息到敏感维度的复杂关联,这对数据规模与标注质量提出了双重挑战。
常用场景
经典使用场景
SopriBench作为首个大规模多模态社交隐私推断基准数据集,其经典使用场景聚焦于评估人工智能系统对社交媒体用户隐私特征的推断能力。该数据集精心构建了50个用户画像与1569张图像,涵盖身份信息、社会经济地位、生活方式及敏感信息四大隐私维度,共28项细粒度属性标注。研究者可借此系统性地量化多模态模型在用户层面进行隐私推断的风险,例如从公开帖文与图像中提取性别、职业或健康状况等敏感特征,从而揭示当前AI系统对用户隐私的潜在威胁。
解决学术问题
SopriBench有效填补了隐私推断研究领域缺乏标准化多模态基准的空白,解决了隐私泄露风险评估中可重复性与可比性不足的学术难题。通过提供合成数据标注集,该数据集使学者能够公正比较不同隐私攻击方法(如对抗性推断与表示学习)的效果,并深入探究多模态信息融合如何加剧隐私泄密风险。其系统化的属性维度划分,推动了从单一属性推断向多维度用户画像重建的进阶性研究,为隐私保护AI的设计提供了关键性指标与实验框架。
实际应用
在实际应用中,SopriBench为社交平台、广告系统及隐私合规工具的开发提供了不可或缺的评估资源。平台运营商可利用该数据集检测现有AI服务无意中推断用户敏感信息的程度,进而优化数据发布策略与匿名化机制。此外,隐私保护技术开发者能基于该基准验证去标识化算法、差分隐私或联合学习等方案的有效性,从而在保障用户体验的同时降低隐私泄露风险。该数据集还直接服务于监管测试,辅助政策制定者量化AI系统的隐私侵入性。
数据集最近研究
最新研究方向
SopriBench作为首个大规模多模态社交隐私推理基准,正引领隐私保护AI的前沿探索。在隐私泄露事件频发、AI代理广泛应用的时代背景下,该数据集聚焦用户级隐私推理风险,通过模拟合成用户画像与多模态内容,系统评估模型对28项个人属性的推断能力。其多维度标注覆盖基础信息、社会经济地位、生活方式及敏感信息,为对抗性隐私攻击与多模态表示学习提供了标准化测试平台。此项研究不仅推动了差分隐私、联邦学习等防御机制在社交媒体场景下的实证验证,更警示着大型语言模型在无意识间挖掘隐性隐私的潜在威胁,对制定AI伦理规范与数据保护法规具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务