遇见数据集

SonderMind AI Mental Health Companion Safety Guardrail Datasets v1.0.0

收藏
github2026-07-01 更新2026-07-04 收录
官方服务:

资源简介:

用于构建和评估SonderMind基于LLM的聊天式护理伴侣Sonder安全层的护栏校准数据集。这些数据集包含200个输入护栏场景和100个输出护栏场景,用于测试AI在心理健康和敏感领域中检测问题用户消息和有害AI响应的能力,每个场景都带有预期结果和类别标签。

This guardrail calibration dataset is designed to build and evaluate the safety layer of SonderMind's LLM-powered chat-based care companion, Sonder. It contains 200 input guardrail scenarios and 100 output guardrail scenarios, which are used to test the AI's ability to detect problematic user messages and harmful AI responses in the fields of mental health and sensitive domains. Each scenario is accompanied by expected outcomes and category labels.

创建时间:
2026-06-23
原始信息汇总

数据集概述:SonderMind AI Mental Health Companion Safety Guardrail Datasets v1.0.0

这是一个用于构建和评估AI心理健康伴侣安全层的护栏校准数据集,由SonderMind开源发布,旨在为心理健康及邻近敏感领域的AI团队提供共享的安全测试基础设施。

数据集内容

  • 输入护栏场景集 (input_guardrails_scenarios.yaml): 包含200个场景,用于测试输入护栏是否能检测到有问题的用户消息,如自残、危机、虐待披露等。每个场景编码了护栏应归属的三个层级之一:"No Issue"(无问题)、"Show Resources & Continue"(显示资源并继续,例如创伤披露)、"Static Block"(静态阻止,例如主动危机、安全威胁)。
  • 输出护栏场景集 (output_guardrails_scenarios.yaml): 包含100个场景,用于测试输出护栏能否捕捉到有害的AI回复,如临床越界、不当建议、幻觉、偏见/污名以及安全问题。

每个场景均为单轮或多轮对话,附带布尔预期结果和类别标签。输出场景还包含描述修正后回复的reason(原因)和feedback(反馈)字段。具体模式见文件头。

使用方式

这些数据集用于校准基准测试、每次模型/提示变更时的回归测试,以及按类别的覆盖率分析。YAML格式简单且与框架无关。

注意事项

  • 敏感内容: 这些场景包含危机、创伤、自残和虐待的真实描述,每个文件头均有内容警告。
  • 范围限制: 仅覆盖自动化护栏校准层,并非全面的安全套件。这些数据集由持证临床医生密切合作开发,但完整的项目还包括生产数据标注、临床审查和红队测试。
  • 免责声明: 按“原样”提供,不提供任何形式的保证。它们是安全校准的起点,不能替代独立安全测试、临床审查或专业判断。

相关资源

引用格式

bibtex @dataset{sondermind_guardrails_2026, title = {SonderMind AI Coach Safety Guardrail Datasets}, author = {SonderMind}, year = {2026}, version = {1.0.0}, url = {https://github.com/sondermind/sonder-guardrail-evals} }

搜集汇总
数据集介绍
SonderMind AI Mental Health Companion Safety Guardrail Datasets v1.0.0 数据集图片
构建方式
在心理健康这一高度敏感且伦理要求严苛的领域,构建可靠的AI安全护栏至关重要。该数据集由SonderMind团队与执业临床医师紧密协作开发,旨在为基于大语言模型的聊天式护理伴侣Sonder提供安全层校准。数据集分为输入护栏与输出护栏两大核心部分:输入护栏场景集包含200个场景,用于检测用户消息中是否存在自伤、危机、虐待披露等敏感内容,每个场景映射至“无问题”、“展示资源并继续”或“静态阻止”三个风险等级之一;输出护栏场景集包含100个场景,专门用于识别AI回复中可能出现的越界临床建议、不当建议、幻觉、偏见或安全漏洞。所有场景均以单轮或多轮对话形式呈现,附有布尔型预期结果、类别标签,输出场景还额外包含修正回复的理由说明与反馈建议,确保数据集兼具实际情境真实性与标注精确性。
使用方法
用户可轻松将本数据集整合至模型安全的持续验证流程中。推荐做法是将其作为校准基准,对每次模型或提示词变更执行回归测试,并基于类别标签进行细粒度的覆盖度分析。YAML格式简洁通用,支持直接解析为测试用例,无需依赖特定框架。使用时需注意数据集内包含敏感内容,文件头部已嵌入内容警告。团队建议将其与生产数据标注、临床评审及红队测试相结合,构建多层安全防护体系。引用时请使用提供的BibTeX条目,并可参考MindEval、HealthBench等关联基准进行横向对比评估。
背景与挑战
背景概述
在人工智能与心理健康交叉领域,大型语言模型(LLM)驱动的对话式陪伴系统正逐渐崭露头角,但其在敏感场景下的安全性与伦理合规性成为核心挑战。SonderMind于2026年发布AI心理健康伴侣安全护栏数据集v1.0.0,由SonderMind研究团队与执业临床医生紧密协作开发,旨在构建和评估其基于LLM的聊天式护理伴侣Sonder的安全层。该数据集聚焦于自动化护栏校准层的输入与输出检测,包含200个输入护栏场景及100个输出护栏场景,覆盖自残、危机、创伤披露、临床越权、偏见与污名化等高风险情境。通过开源这一基础设施,SonderMind推动了心理健康领域AI安全测试的共享基础,为同类系统的鲁棒性评估树立了重要基准。
当前挑战
该数据集面临的挑战首先体现在领域问题的复杂性上:心理健康对话中的敏感内容(如危机、自残、虐待披露)需精准分级响应,护栏系统必须区分“无问题”、“仅展示资源并继续对话”与“静态阻止”三类阈值,以避免误判导致伤害或不当干预。构建过程中,数据集需模拟真实多轮对话的动态情境,同时确保标签的临床准确性,这要求对创伤与危机信号进行精细化语义建模。此外,由于AI输出可能产生幻觉、偏见或不当建议,输出护栏需同时检测多种安全风险类别,而跨场景的覆盖分析及与临床实践的持续对齐仍是维护其有效性的长期挑战。
常用场景
经典使用场景
在构建和评估心理健康领域大型语言模型的安全层时,SonderMind AI Mental Health Companion Safety Guardrail Datasets v1.0.0 作为护栏校准基准被广泛使用。该数据集包含200个输入护栏场景和100个输出护栏场景,覆盖自我伤害、危机干预、虐待披露、临床越界、幻觉、偏见与污名化等敏感议题。每个场景以单轮或多轮对话形式呈现,并附有预期的布尔结果和类别标签,为检测有害用户消息与不当AI输出提供了标准化的测试框架。其简洁的YAML格式与框架无关性,使其易于集成到任何模型或提示变更的回归测试流程中,成为保障对话式心理健康AI安全性的关键工具。
解决学术问题
该数据集直面心理健康AI领域中对敏感内容安全过滤的迫切需求,解决了现有模型在检测用户危机信号、防止AI临床越界及消除生成内容中的偏见等核心学术难题。通过三级分类体系(无问题、显示资源并继续、静态阻断),研究者得以系统评估护栏的灵敏度和特异性,避免因过度拦截影响用户体验或因漏判引发安全风险。其发布的深远意义在于,将原本封闭的安全测试基础设施开放为共享资源,促进了心理健康AI安全评估的标准化,为跨机构比较与复现研究奠定了基础,推动了该领域从经验性工程实践向可量化、可验证的学术体系演进。
实际应用
在实际部署中,该数据集被直接用于SonderMind旗下AI伴侣Sonder的护栏校准层,作为每次模型和提示变更后的回归测试基准。通过覆盖不同严重程度的危机场景(如主动自杀意念与一般创伤陈述),系统能够精准触发差异化响应策略:对紧急情况执行静态阻断并转介专业援助,对非紧急披露则提供同理心回应与资源链接。此外,该数据集还支持按类别进行覆盖率分析,指导安全团队优先补全薄弱环节,降低生产环境中的误判风险。其对于其他心理健康科技公司同样具有参考价值,可作为构建自动化安全测试管线的起点。
数据集最近研究
最新研究方向
在人工智能与心理健康深度融合的前沿领域,SonderMind发布的Sonder AI心理健康伴侣安全护栏数据集v1.0.0,标志着对话式AI安全评估从封闭式竞赛迈向开放协作的关键转折。该数据集聚焦于构建与评测面向心理健康场景的LLM防护层,涵盖200个用户输入护栏场景与100个输出护栏场景,细致区分了自伤、危机、虐待披露等高风险情境,并定义了“无问题”、“展示资源并继续”与“静态阻断”三级响应策略。此举紧密呼应了业界对AI在敏感领域部署安全性的迫切关注,尤其随着Sonder等AI陪伴工具进入临床实践,如何量化并校准模型对危机信号的敏感度与响应边界成为核心难题。通过开源这套与临床专家联合开发的基准测试,SonderMind不仅推动了护栏评估的标准化与可复现性,更促进了MindEval、HealthBench等同类评测框架的协同演进,正在塑造心理健康AI从实验室走向真实世界的安全理性基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务