CONFIDE-Bench
收藏资源简介:
CONFIDE-Bench是一个双语(俄语和英语)心理治疗转录去识别化基准,采用分层检测器消融评分方法(以召回优先/实体级别/直接与准标识符),并包含隐私-效用轴。据我们所知,这是第一个专门针对治疗对话去识别化的基准——相邻的公共资源涵盖临床笔记、法律或通用个人身份信息,或没有PII标签的咨询对话。
CONFIDE-Bench is a bilingual (Russian and English) de-identification benchmark for psychotherapy transcripts. It employs a hierarchical detector ablation scoring framework with recall prioritization, entity-level granularity, and differentiation between direct and quasi-identifiers, while incorporating the privacy-utility axis. To the best of our knowledge, this is the first benchmark specifically dedicated to de-identifying therapy conversations. Adjacent publicly available resources, by contrast, cover clinical notes, legal or general personally identifiable information (PII), or counseling conversations without PII annotations.
项目概述
CONFIDE(Confidential Filtering of Identifying Details)是一个以本地优先、隐私优先为核心理念的工具集和基准测试,专门用于心理治疗与教练对话记录的去标识化,并评估去标识后抵御重识别的能力。所有处理均在本地机器上完成,原始客户数据不会离开设备。
核心组成部分
该项目由三个主要部分组成:
| 组成部分 | 功能描述 | 路径位置 |
|---|---|---|
| CONFIDE | 分层本地去标识化堆栈:确定性正则表达式(邮箱/电话/ID/日期)→ 俄语NER(Natasha)→ 可选OpenAI隐私过滤器 → 本地LLM(通过Ollama/llama.cpp的Qwen)处理药物、年龄、职业、上下文ID。 | skills/session-anonymizer/ |
| CONFIDE-Bench | 双语(俄语 + 英语)心理治疗对话去标识化基准测试:采用分层探测器消融实验,以召回率优先/实体级别/直接标识符vs准标识符为评分标准,并包含隐私-效用轴。据作者所知,这是首个专门针对治疗对话的去标识化基准。 | docs/BENCHMARK.md |
| CONFIDE-Red | 红队攻击组件:基于LLM的重识别/去匿名化攻击,针对去标识后的输出进行单次会话推断、跨会话纵向关联、准标识符孤立攻击。攻击分类对齐GDPR第29条工作组(孤立性/关联性/推断性)以及Staab等人/RAT-Bench的推断攻击文献。 | src/confide_eval/redteam/*_attack.py, src/confide_eval/redteam/privacy_utility_eval.py |
主要发现
- 部分准PII仍依赖LLM:年龄、职业、药物、上下文/拼写出的日期在正则表达式+NER下覆盖率接近零;本地LLM提升了覆盖率,但仍存在可测量的差距。
- 移除直接标识符必要但不充分:准标识符会留存,LLM攻击者仍可推断属性,尤其是在同一人的多次会话中。
- 更大并不自动更好:确定性规则在处理数字日期和结构化ID时更快、更具可重复性;OPF(OpenAI Privacy Filter)仅作为对比层保留,而非俄语默认方案。
- 危害 ≠ 标识符强度:邮箱是强关联器但治疗危害低,而药物暗示诊断。CONFIDE因此同时报告危害加权召回率与普通召回率;二者之间的差距本身即是一个发现。
数据隔离与存储(真实数据)
- 对于真实会话数据,提供三层安全指导:
docs/THREE-LOCKS.md(设备 + 加密存储 + 每文件隔离)和**docs/ISOLATION.md**(红/绿数据流、无网络容器、macOS虚拟机、sops/age加密)。 - 可通过命令行扩展基准测试:
python3 confide.py datasets list(详见docs/DATASETS.md)。
伦理与负责任使用
项目明确定义了伦理承诺,关键原则包括:
- AI是显微镜,不是外科医生:仅用于去标识化和分析支持,绝不用于自杀/危机风险评估、诊断或护理自动化决策。
- 真实数据绝不公开:仓库中所有治疗对话记录均为合成数据(虚构客户);真实或经同意的会话仅本地处理,仅输出聚合统计数据。
- 明确同意与范围:使用真实数据需获得明确同意,且仅限于自己的或经同意的会话。
- 双重用途的公开处理:红队攻击组件(CONFIDE-Red)可被滥用,通过强调召回率、报告残余风险为合成人设上的比率、且不发布针对真实人物的重识别方法来应对。
- 诚实的局限性:基准数字基于小型合成语料库,不是HIPAA/GDPR/152-ФЗ匿名化认证,也不等同于临床验证。
数据来源与构成
- 仓库中的所有治疗/教练对话记录(RU和EN-synth会话)均为完全合成,虚构客户与标识符。
- 唯一的例外是EN-real,取自公开基准
ai4privacy/pii-masking-300k,为通用、非治疗、非临床PII文本,仅用作英语检测器的外部锚点。该数据集不在此仓库中重新分发,需用户自行构建。
许可证与引用
- 代码:MIT许可证。
- 数据与文档(合成语料库、金标准、文档):Creative Commons Attribution 4.0 (CC-BY-4.0)。
- EN-real外部数据:遵循
ai4privacy/pii-masking-300k自身的许可证,其金标准、缓存和结果不在此仓库中重新分发。 - 引用建议:在学术论文发表前,建议引用仓库地址:Gleb Kalinin and CONFIDE contributors, "CONFIDE: a therapy-transcript de-identification benchmark and red team," 2026, https://github.com/glebis/confide。
文档索引
项目提供详尽的文档体系,覆盖方法、结果、数据、隐私、可复现性、工具、术语和通俗解释等各个方面,入口包括但不限于:
docs/BENCHMARK.md— 完整的分层探测器消融结果与评分方法docs/RESEARCH-FINDINGS.md— 与现有去标识基准的深度研究定位docs/HARM-TAXONOMY.md— 危害加权召回率的计算逻辑docs/REPORTING.md— 基准报告的选择与取舍docs/GLOSSARY.md— 英俄双语术语表与通俗解释docs/EXPLAINER.md— 面向非专业人员的通俗化说明





