遇见数据集

CompanionHarm

收藏
github2026-08-26 更新2026-08-29 收录
官方服务:

资源简介:

一个基于多维有害AI行为分类标注的真实世界、多轮AI伴侣交互的基准数据集。包含2,111个人类-AI对话,其中有7,016个标注的AI话语和7,035个未标注的人类话语。

A benchmark dataset of real-world, multi-turn AI companion interactions annotated with multi-dimensional harmful AI behavior classification labels. It contains 2,111 human-AI conversations, including 7,016 annotated AI utterances and 7,035 unannotated human utterances.

创建时间:
2026-08-26
原始信息汇总

CompanionHarm 数据集概述

核心定位

CompanionHarm 是一个用于检测真实世界 AI 伴侣对话中危害的多轮基准数据集,支持 14 类危害分类任务。该数据集仅包含 AI/Replika 撰写的对话话语(utterance),并已按对话 ID 进行分组,确保同一对话不会出现在多个数据划分中。

数据规模

数据划分 话语数量 对话数量
训练集(Train) 4,222 1,268
开发集(Development) 1,403 423
测试集(Test) 1,391 420
总计 7,016 2,111

任务设计

  • 标签体系:每个当前 AI 伴侣话语被赋予 14 个标签之一,涵盖性内容、自残、虐待、暴力、药物使用和歧视性语言等危害类别。
  • 上下文机制:对话上下文作为标注证据提供,但分类目标始终是当前 AI/Replika 生成的话语。
  • 划分原则:按 conversation_id 分组,确保无对话跨划分泄漏。

评测体系

  • 覆盖模型与提示条件:8 个模型 × 3 种提示模板(zero_shotone_shotfull_codebook),共 24 种报告条件。
  • 主要指标:准确率(accuracy)、宏平均精确率/召回率/F1、加权指标以及 Cohens kappa。宏平均包含全部 14 个标签,即使某标签零预测实例也计入。
  • 一致性分析:比较人类标注完全一致(3-0)与多数一致(2-1)的样本,置信区间基于对话而非单条话语重采样;少数派对齐的预测在多数投票金标准下仍计为错误,并单独分析以揭示标注歧义。

文件结构

  • data/splits/:训练、开发、测试划分数据(共 7,016 条话语)。
  • prompts/:零样本、单样本和完整代码簿提示模板。
  • scripts/:基准运行器、评分器、统计分析与验证脚本,以及可选的 Qwen3-8B QLoRA 微调配方。
  • results/predictions/:隐私最小化的 8 模型 × 3 提示预测结果。
  • results/reference/:基于已发布预测生成的预期输出表格。

快速使用

  • 支持 Python 3.12,可通过虚拟环境安装依赖后运行完整性验证和单元测试。
  • 快捷分析使用 100 次 bootstrap/置换复制作为冒烟测试;完整复现需运行 scripts/reproduce_all.py,主要指标数秒内完成,全量 2,000 次聚类 bootstrap 和 5,000 次置换检验需数分钟,且不调用外部服务。
  • 推理预览可通过 --dry-run 参数离线进行;如需真实 API 复现,环境变量仅存储凭据,不写入配置文件。由于模型托管方可变,精确表格复现应以存档预测为准。

微调配方(可选)

提供 Qwen3-8B QLoRA 的代码级配方,可通过 --dry-run 在无 GPU 环境下验证数据与提示格式。该配方仅基于发布的 AI/Replika 划分,不保证复现论文中的精确检查点或辅助角色行为目标。

提示模板说明

prompts/ 下的模板中,输入部分标记为 [context][sentence];运行时将 <context> 替换为行的 context 字段,<current_utterance> 替换为 current_line 字段。尖括号标记仅为模板变量,并非发送给模型的字面文本。

内容警告

数据与示例提示包含性内容、自残、虐待、暴力、药物使用和歧视性语言,使用需谨慎。


注:该数据集为匿名评审准备,不含作者信息、参与者标识、原始标注及 API 凭据。

搜集汇总
数据集介绍
CompanionHarm 数据集图片
构建方式
CompanionHarm数据集是一项针对AI伴侣对话中危害检测的多轮基准测试,其构建过程严谨而系统。该数据集源于对真实世界AI伴侣(如Replika)对话的采集与标注,共包含7,016条话语,覆盖2,111段对话,并按对话ID严格划分为训练集(4,222条)、开发集(1,403条)和测试集(1,391条),确保对话级别的不重叠。每条当前话语均由AI生成,并由三位标注者依据14类危害标签进行独立标注,标签涵盖性内容、自残、虐待、暴力、药物使用及歧视性语言等敏感领域。构建过程中,特别注重隐私保护,剥离了所有身份信息与原始记录,仅保留必要的上下文与话语,以支持多轮危害分类任务。
特点
CompanionHarm数据集的显著特点在于其精细的多标签分类体系与严格的评估框架。任务要求为每条当前AI话语分配唯一的危害类别,而上下文作为证据支持,确保了分类的上下文敏感性。数据集采用对话级分组,杜绝了数据泄漏,并支持跨8种模型与3种提示条件(零样本、单样本、全代码簿)的系统评测,主要指标涵盖准确率、宏平均精确率、召回率、F1值及Cohen's kappa系数。特别地,其一致性分层分析通过对话级bootstrap重采样,区分了全票一致与多数一致的人类标注,并针对少数对齐预测进行排列检验,揭示了标注中的固有歧义,为危害检测的可靠性提供了深刻洞见。
使用方法
使用CompanionHarm数据集时,用户可通过其配套的完整工具链快速开展评估与分析。首先,运行`verify_artifact.py`确认数据完整性与匿名性,接着使用`run_benchmark.py`执行模型推理,该脚本支持OpenAI兼容接口与OpenRouter,并允许通过`--dry-run`预览请求,或以`--max-samples`进行小规模冒烟测试。评分与统计分析由`score_predictions.py`和`summarize_predictions.py`完成,可复现论文中的全部表格;`analyze_agreement.py`则实现一致性分层分析。此外,为便于复现,数据集已包含隐私最小化的参考预测结果,无需API密钥即可直接评估。对于迭代微调,提供了Qwen3-8B的QLoRA训练配方,并通过`--dry-run`验证数据与格式。所有脚本均经过Python 3.12环境测试,且不依赖外部服务,确保可离线运行。
背景与挑战
背景概述
CompanionHarm数据集诞生于人工智能伴侣系统安全评估的迫切需求之下,由匿名研究团队于2024年构建。该基准聚焦于AI伴侣对话中潜在危害的细粒度识别,旨在通过14类危害标签对Replika等平台的AI生成话语进行标注与分类。其核心研究问题在于,如何准确且可靠地检测真实交互中的不适宜内容,以弥补现有安全基准在复杂、多轮对话情境下的不足。该数据集包含7,016条话语、2,111段对话,并创新性地引入了基于标注者一致性的分层统计分析,揭示了模型在模糊情境下的性能差异。自发布以来,它已成为AI对齐与内容安全领域的重要评估工具,推动了人机交互中伦理边界的研究。
当前挑战
该数据集面临的挑战多维且深刻。领域层面,AI伴侣对话中的危害类别高度多样且相互交叠,包括性内容、自残、虐待等,且常以隐晦或上下文依赖的形式出现,远超传统内容过滤的范畴;同时,对话的动态性和多轮性要求模型具备深层的语境理解能力。构建过程中,数据注释面临主观性与歧义的严峻考验,不同标注者对同一话语的评判常不一致,迫使团队采用多数投票并专门分析少数派标注,以揭示标签的不确定性与模型对齐的复杂性。此外,隐私保护与内容引发的伦理风险贯穿始终,数据发布需严格匿名化,而基准评估在模型版本漂移和API不稳定性下亦需谨慎诠释,部分应对策略为依赖归档预测而非实时推理。
常用场景
经典使用场景
CompanionHarm数据集专为多轮对话场景中的有害内容识别而设计,其核心用途是评估AI伴侣系统在真实交互中产生或传播的十四类危害。该基准采用对话级拆分,确保训练、开发与测试集互不重叠,从而在严格条件下检验模型对性内容、自残、辱骂、暴力等敏感话题的检测能力。研究者可基于其提供的零样本、单样本及全代码本提示模板,在统一的评估协议下对比不同模型的性能,涵盖准确率、宏平均精确率、召回率及F1等指标,并利用一致性分层统计深入分析标注分歧对模型评估的影响。
解决学术问题
该数据集解决了AI安全领域长期缺乏针对伴侣类对话系统真实危害标注基准的学术困境。传统毒性检测数据集多聚焦于单轮或短文本,而CompanionHarm则补足了多轮上下文下的细粒度分类需求,其十四类标签体系覆盖了法律与伦理关注的核心危害类型。通过引入人标注一致性分层和少数派对齐分析,该基准揭示了多数投票黄金标准下被掩盖的标注歧义问题,为评估指标的选择和模型鲁棒性研究提供了方法论参考。其研究意义在于推动AI伴侣系统从功能优化转向负责任设计,为制定安全评估标准奠定数据基础。
衍生相关工作
CompanionHarm的发布催生了多个相关研究方向。其数据与代码框架常被用作构建多语言或跨文化危害检测数据集的模板,研究者沿用其标注流程和统计推断方法(如对话聚类自助法、Fisher精确检验)来扩展新的危害类别。其F1指标的精细分解(按一致性分层)启发了后续关于标注不确定性的评估方法研究。此外,该数据集刺激了针对AI伴侣特有风险(如情感操纵、成瘾诱导)的专项检测器开发,以及人机对话安全性的纵向分析。其公开的预测文件也便于后续工作复现基准结果,推动该领域的可重复性进步。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务