遇见数据集

CONFIDE-Bench

收藏
github2026-06-04 更新2026-06-06 收录
数据链接:
官方服务:

资源简介:

CONFIDE-Bench是一个双语(俄语和英语)心理治疗转录去识别化基准,采用分层检测器消融评分方法(以召回优先/实体级别/直接与准标识符),并包含隐私-效用轴。据我们所知,这是第一个专门针对治疗对话去识别化的基准——相邻的公共资源涵盖临床笔记、法律或通用个人身份信息,或没有PII标签的咨询对话。

CONFIDE-Bench is a bilingual (Russian and English) de-identification benchmark for psychotherapy transcripts. It employs a hierarchical detector ablation scoring framework with recall prioritization, entity-level granularity, and differentiation between direct and quasi-identifiers, while incorporating the privacy-utility axis. To the best of our knowledge, this is the first benchmark specifically dedicated to de-identifying therapy conversations. Adjacent publicly available resources, by contrast, cover clinical notes, legal or general personally identifiable information (PII), or counseling conversations without PII annotations.

创建时间:
2026-06-02
原始信息汇总

项目概述

CONFIDE(Confidential Filtering of Identifying Details)是一个以本地优先、隐私优先为核心理念的工具集和基准测试,专门用于心理治疗与教练对话记录的去标识化,并评估去标识后抵御重识别的能力。所有处理均在本地机器上完成,原始客户数据不会离开设备。

核心组成部分

该项目由三个主要部分组成:

组成部分 功能描述 路径位置
CONFIDE 分层本地去标识化堆栈:确定性正则表达式(邮箱/电话/ID/日期)→ 俄语NER(Natasha)→ 可选OpenAI隐私过滤器 → 本地LLM(通过Ollama/llama.cpp的Qwen)处理药物、年龄、职业、上下文ID。 skills/session-anonymizer/
CONFIDE-Bench 双语(俄语 + 英语)心理治疗对话去标识化基准测试:采用分层探测器消融实验,以召回率优先/实体级别/直接标识符vs准标识符为评分标准,并包含隐私-效用轴。据作者所知,这是首个专门针对治疗对话的去标识化基准。 docs/BENCHMARK.md
CONFIDE-Red 红队攻击组件:基于LLM的重识别/去匿名化攻击,针对去标识后的输出进行单次会话推断、跨会话纵向关联、准标识符孤立攻击。攻击分类对齐GDPR第29条工作组(孤立性/关联性/推断性)以及Staab等人/RAT-Bench的推断攻击文献。 src/confide_eval/redteam/*_attack.py, src/confide_eval/redteam/privacy_utility_eval.py

主要发现

  • 部分准PII仍依赖LLM:年龄、职业、药物、上下文/拼写出的日期在正则表达式+NER下覆盖率接近零;本地LLM提升了覆盖率,但仍存在可测量的差距。
  • 移除直接标识符必要但不充分:准标识符会留存,LLM攻击者仍可推断属性,尤其是在同一人的多次会话中。
  • 更大并不自动更好:确定性规则在处理数字日期和结构化ID时更快、更具可重复性;OPF(OpenAI Privacy Filter)仅作为对比层保留,而非俄语默认方案。
  • 危害 ≠ 标识符强度:邮箱是强关联器但治疗危害低,而药物暗示诊断。CONFIDE因此同时报告危害加权召回率与普通召回率;二者之间的差距本身即是一个发现。

数据隔离与存储(真实数据)

  • 对于真实会话数据,提供三层安全指导:docs/THREE-LOCKS.md(设备 + 加密存储 + 每文件隔离)和**docs/ISOLATION.md**(红/绿数据流、无网络容器、macOS虚拟机、sops/age加密)。
  • 可通过命令行扩展基准测试:python3 confide.py datasets list(详见docs/DATASETS.md)。

伦理与负责任使用

项目明确定义了伦理承诺,关键原则包括:

  • AI是显微镜,不是外科医生:仅用于去标识化和分析支持,绝不用于自杀/危机风险评估、诊断或护理自动化决策。
  • 真实数据绝不公开:仓库中所有治疗对话记录均为合成数据(虚构客户);真实或经同意的会话仅本地处理,仅输出聚合统计数据。
  • 明确同意与范围:使用真实数据需获得明确同意,且仅限于自己的或经同意的会话。
  • 双重用途的公开处理:红队攻击组件(CONFIDE-Red)可被滥用,通过强调召回率、报告残余风险为合成人设上的比率、且不发布针对真实人物的重识别方法来应对。
  • 诚实的局限性:基准数字基于小型合成语料库,不是HIPAA/GDPR/152-ФЗ匿名化认证,也不等同于临床验证。

数据来源与构成

  • 仓库中的所有治疗/教练对话记录(RU和EN-synth会话)均为完全合成,虚构客户与标识符。
  • 唯一的例外是EN-real,取自公开基准ai4privacy/pii-masking-300k,为通用、非治疗、非临床PII文本,仅用作英语检测器的外部锚点。该数据集不在此仓库中重新分发,需用户自行构建。

许可证与引用

  • 代码:MIT许可证。
  • 数据与文档(合成语料库、金标准、文档):Creative Commons Attribution 4.0 (CC-BY-4.0)。
  • EN-real外部数据:遵循ai4privacy/pii-masking-300k自身的许可证,其金标准、缓存和结果不在此仓库中重新分发。
  • 引用建议:在学术论文发表前,建议引用仓库地址:Gleb Kalinin and CONFIDE contributors, "CONFIDE: a therapy-transcript de-identification benchmark and red team," 2026, https://github.com/glebis/confide。

文档索引

项目提供详尽的文档体系,覆盖方法、结果、数据、隐私、可复现性、工具、术语和通俗解释等各个方面,入口包括但不限于:

  • docs/BENCHMARK.md — 完整的分层探测器消融结果与评分方法
  • docs/RESEARCH-FINDINGS.md — 与现有去标识基准的深度研究定位
  • docs/HARM-TAXONOMY.md — 危害加权召回率的计算逻辑
  • docs/REPORTING.md — 基准报告的选择与取舍
  • docs/GLOSSARY.md — 英俄双语术语表与通俗解释
  • docs/EXPLAINER.md — 面向非专业人员的通俗化说明
搜集汇总
数据集介绍
CONFIDE-Bench 数据集图片
构建方式
在心理治疗与辅导领域,会话记录是最为敏感的个人数据之一,然而现有去标识化基准多局限于临床笔记或通用PII,缺乏针对治疗性对话的专门评测。CONFIDE-Bench正是在此背景下诞生的首个双语(俄语与英语)心理治疗会话去标识化基准。其构建依托于一个层级化的检测器消融框架:从确定性正则表达式(电子邮件、电话号码、身份证件、日期)出发,经俄罗斯NER系统Natasha处理,再接入可选OpenAI隐私过滤器,最终由本地大语言模型(通过Ollama/llama.cpp运行的Qwen)捕捉药物名称、年龄、职业及上下文标识符。所有处理完全在本地完成,原始数据永不离开用户设备,严格遵循隐私优先原则。
特点
CONFIDE-Bench的核心特点在于其独有的双重测评维度:一方面引入伤害加权召回率(harm-weighted recall),突破传统召回率仅关注标识符强度的局限,将心理治疗情境下药物名称暗示诊断、职业暴露隐私等特殊风险纳入计量,揭示漏检标识符的实际伤害等级;另一方面构建隐私-效用评估轴,通过在去标识化输出上模拟GDPR第29条攻击分类法下的单次会话推理、纵向跨会话链接和准标识符孤立攻击,客观量化残余重识别风险。此外,其层级化评估架构允许研究者精细比较不同检测层(规则、NER、LLM)的独立贡献,结果表明确定性规则在处理结构化数据时效率与可复现性优于重型Transformer。
使用方法
使用者可通过容器化的一键命令运行完整基准测试。项目提供Docker镜像及锁定依赖环境以确保结果可复现。基准支持通过命令行扩展公共数据集:执行`python3 confide.py datasets list`可拉取外部评测数据,其中EN-real子集需自行从ai4privacy/pii-masking-300k下载构建(严格受其许可证约束)。对于真实会话数据,必须遵循三层加密存储指南(设备层、加密存储层、逐文件隔离层)并采用红/绿数据流隔离方案。评测结果以追加式运行日志形式记录于`caches/runs/`目录,每次基准运行的模型栈、参数及环境快照均被固化存档。
背景与挑战
背景概述
CONFIDE-Bench诞生于心理治疗与人工智能交叉领域的前沿探索中,由Gleb Kalinin及众多志愿者于2026年共同构建。在心理治疗与教练会话场景中,转录文本承载着诊断、用药、性取向等极为敏感的个人信息,传统匿名化手段仅移除姓名远不足以保证隐私安全,准标识符的存在仍可能导致再识别风险。然而,此前缺乏专门针对治疗对话语境的去标识化基准数据集。CONFIDE-Bench作为首个专为治疗对话设计的双语(俄语与英语)去标识化基准,通过分层探测器消融实验精准评估去标识化效果,推动了隐私保护技术在心理健康领域的实证研究,为理解何处存在真实泄漏风险提供了可复现的测量框架。
当前挑战
该数据集面临多层面挑战。领域层面,治疗对话中蕴含的准标识符(如年龄、职业、药物名称)与直接标识符交织,使去标识化任务远复杂于通用个人信息脱敏,现有方法难以兼顾隐私保护与文本可用性。构建过程中,需确保合成语料的临床真实性以支撑有效评估,同时严格避免任何真实患者数据泄露,这要求在虚构患者档案时精确模拟真实治疗对话的语言模式与隐私泄漏路径。此外,跨会话纵向关联分析揭示,即使单次会话移除直接标识符,多次会话的准标识符组合仍可能实现再识别,评测体系需同时覆盖单次与跨次攻击场景,对基准设计提出了极高要求。
常用场景
经典使用场景
CONFIDE-Bench作为首个专为心理治疗与咨询对话转录文本设计的去标识化基准数据集,其经典使用场景在于系统评估分层去标识化流水线在保护高度敏感对话数据方面的效能。该基准以双语(俄语与英语)合成治疗会话为测试载体,通过模拟真实治疗场景中纷繁复杂的个人信息泄露风险——包括姓名、联系方式等直接标识符,以及年龄、职业、药物名称、诊断暗示等准标识符——来衡量正则表达式、命名实体识别(NER)、本地大语言模型(LLM)等多层级检测器对敏感信息的召回能力。研究者和工程师可借助该基准,在本地环境中精确量化不同去标识化策略的隐私保护强度,从而为治疗对话数据的安全共享提供可重复、可比较的评估框架。
实际应用
在实际应用中,CONFIDE-Bench成为心理咨询平台、心理健康AI工具及临床研究机构部署去标识化系统的核心验收标准。治疗师和教练若期望借助大语言模型进行会话回顾、模式识别或干预准备,必须先确保转录文本在共享前达到可量化的安全阈值——该基准恰好提供了这一量化护栏。通过运行CONFIDE的去标识化流水线并在Bench上验证,用户能够明确知晓“仅移除姓名”远非安全承诺,并依据召回率报告决定是否需要人工复核。其本地优先架构确保原始客户端数据永不离开本地设备,从根本上规避了云模型的数据泄露风险,这对于需遵守俄罗斯152-ФЗ、欧盟GDPR等严格数据保护法规的组织而言尤为重要。
衍生相关工作
CONFIDE-Bench的诞生催生了多个方向的相关研究。其一是在其启发下,出现了面向其他高敏感对话领域(如法律咨询、危机干预热线)的专用去标识化基准,采用相似的危害加权评估框架。其二是基于其公开的分层检测器消融实验方法论,研究者开始系统地比较不同规模LLM(从7B到70B参数)在准标识符识别上的边际收益与计算成本,推动了轻量级隐私保护模型的设计。其三,CONFIDE-Red的攻击策略——尤其是跨会话纵向关联和基于年龄-职业-地理位置组合的“孤立化”推理——已被整合进更广泛的隐私保护基准RAT-Bench的比较分析中。此外,该数据集的合成数据生成方法与开放式社区标注工具链,亦为后续心理学语料库的隐私安全构建提供了标准范例。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务