FairPrivacySignal
收藏资源简介:
FairPrivacySignal是一个公开的、非机密的合成数据基准,用于研究在信号丢失情况下的隐私保护和公平性AI排名与匹配系统。它模拟公共服务推广场景,使用合成数据生成、隐私驱动的信号丢失模拟、基于策略和同意的特征抑制、差分隐私风格噪声等技术,提供可重复的基准测试,以评估隐私、效用和公平性之间的权衡。
FairPrivacySignal is an open, non-confidential synthetic data benchmark for researching privacy-preserving and fairness-aware AI ranking and matching systems under signal loss scenarios. It simulates public service promotion scenarios, and adopts technologies including synthetic data generation, privacy-driven signal loss simulation, policy and consent-based feature suppression, and differential privacy-style noise injection, to provide reproducible benchmarking for evaluating the trade-offs among privacy, utility, and fairness.
数据集概述:FairPrivacySignal
一、基本信息
- 数据集名称:FairPrivacySignal
- 数据集地址:https://github.com/AnthonyXu109/FairPrivacySignal
- 数据集性质:公开、非机密的合成数据基准(Synthetic-data benchmark)
- 研究目标:用于研究在信号丢失(signal loss)情况下,兼顾隐私保护与公平性的人工智能排序与匹配系统
- DOI 标识:10.5281/zenodo.20130952(v0.1.1 已存档于 Zenodo)
二、应用场景
本项目模拟一个可复现的公共服务推广场景:将社区或家庭与相关公共服务(如预防性健康推广、食品援助、住房支持、职业培训、教育资源)进行匹配。该模式可适用于:
- 公共机构
- 医疗保健推广
- 非营利服务交付
- 教育项目
- 本地市场
- 小型企业发现系统
三、数据来源与保密性
- 数据类型:仅使用合成数据(Synthetic data)和公开的聚合参考数据
- 保密性:不使用任何真实个人数据、私有数据集、专有系统、内部业务指标或任何组织的机密实施细节
- 用途声明:本仓库为教育和研究导向的合成基准测试
四、项目演示的关键功能
- 合成公共服务排序与匹配数据生成
- 隐私驱动的信号丢失模拟
- 意识感知与政策感知的特征抑制
- 群体聚合与 k-阈值处理
- 针对聚合特征的差分隐私风格噪声
- 上下文与地理层级信号
- 效用指标:AUC 和 NDCG@K
- 针对低信号或服务不足参与者的公平性指标
- 隐私暴露评分
- 可复现的笔记本与可视化
五、系统架构
FairPrivacySignal 组织为一个可复现的基准测试流程:
- 合成公共服务数据生成
- 隐私驱动的信号丢失模拟
- 基于策略和同意的特征抑制
- 隐私安全的聚合恢复
- 排序评估
- 公平性诊断
(架构图位于:https://github.com/AnthonyXu109/FairPrivacySignal/raw/main/docs/assets/architecture_diagram.png)
六、基准测试结果
6.1 主要发现
- 低信号家庭集中在服务不足的社区
- 隐私安全的聚合特征可部分恢复排序效用
- 不同信号丢失场景下的隐私-效用权衡
6.2 多种子基准测试结果(五组合成数据种子)
| 场景 | 隐私暴露 | NDCG@3 | 低信号 NDCG@3 | 低信号差距 |
|---|---|---|---|---|
| 全信号原始基线 | 0.925 ± 0.002 | 0.555 ± 0.011 | 0.490 ± 0.014 | 0.095 ± 0.009 |
| 严重信号丢失 | 0.475 ± 0.002 | 0.504 ± 0.007 | 0.430 ± 0.014 | 0.108 ± 0.018 |
| 严重丢失 + 隐私安全聚合 | 0.475 ± 0.002 | 0.520 ± 0.007 | 0.448 ± 0.015 | 0.106 ± 0.018 |
| 政策限制 | 0.728 ± 0.007 | 0.526 ± 0.007 | 0.451 ± 0.008 | 0.109 ± 0.010 |
| 政策限制 + 隐私安全聚合 | 0.728 ± 0.007 | 0.539 ± 0.006 | 0.460 ± 0.007 | 0.115 ± 0.005 |
结论:严重信号丢失会持续降低排序效用,而隐私安全的聚合和上下文特征可部分恢复 NDCG@3 指标。公平性差距作为诊断指标被明确报告。
七、公平性诊断
项目额外追踪低信号排序差距,确保效用恢复不会掩盖对低信号或服务不足人群的不平等影响。该诊断与效用恢复声明分开报告。
(相关图:https://github.com/AnthonyXu109/FairPrivacySignal/raw/main/docs/assets/privacy_recovery_fairness_gap.png)
八、重要说明
- 所有结果基于合成数据
- 该基准旨在展示评估隐私、效用和公平性权衡的工程模式
- 不适用于模拟任何真实社区
- 不提供生产级别的隐私保证




