SonderMind AI Mental Health Companion Safety Guardrail Datasets v1.0.0
收藏资源简介:
用于构建和评估SonderMind基于LLM的聊天式护理伴侣Sonder安全层的护栏校准数据集。这些数据集包含200个输入护栏场景和100个输出护栏场景,用于测试AI在心理健康和敏感领域中检测问题用户消息和有害AI响应的能力,每个场景都带有预期结果和类别标签。
This guardrail calibration dataset is designed to build and evaluate the safety layer of SonderMind's LLM-powered chat-based care companion, Sonder. It contains 200 input guardrail scenarios and 100 output guardrail scenarios, which are used to test the AI's ability to detect problematic user messages and harmful AI responses in the fields of mental health and sensitive domains. Each scenario is accompanied by expected outcomes and category labels.
数据集概述:SonderMind AI Mental Health Companion Safety Guardrail Datasets v1.0.0
这是一个用于构建和评估AI心理健康伴侣安全层的护栏校准数据集,由SonderMind开源发布,旨在为心理健康及邻近敏感领域的AI团队提供共享的安全测试基础设施。
数据集内容
- 输入护栏场景集 (
input_guardrails_scenarios.yaml): 包含200个场景,用于测试输入护栏是否能检测到有问题的用户消息,如自残、危机、虐待披露等。每个场景编码了护栏应归属的三个层级之一:"No Issue"(无问题)、"Show Resources & Continue"(显示资源并继续,例如创伤披露)、"Static Block"(静态阻止,例如主动危机、安全威胁)。 - 输出护栏场景集 (
output_guardrails_scenarios.yaml): 包含100个场景,用于测试输出护栏能否捕捉到有害的AI回复,如临床越界、不当建议、幻觉、偏见/污名以及安全问题。
每个场景均为单轮或多轮对话,附带布尔预期结果和类别标签。输出场景还包含描述修正后回复的reason(原因)和feedback(反馈)字段。具体模式见文件头。
使用方式
这些数据集用于校准基准测试、每次模型/提示变更时的回归测试,以及按类别的覆盖率分析。YAML格式简单且与框架无关。
注意事项
- 敏感内容: 这些场景包含危机、创伤、自残和虐待的真实描述,每个文件头均有内容警告。
- 范围限制: 仅覆盖自动化护栏校准层,并非全面的安全套件。这些数据集由持证临床医生密切合作开发,但完整的项目还包括生产数据标注、临床审查和红队测试。
- 免责声明: 按“原样”提供,不提供任何形式的保证。它们是安全校准的起点,不能替代独立安全测试、临床审查或专业判断。
相关资源
- 技术博客文章:Open-sourcing SonderMinds guardrail calibration datasets
- 相关项目:MindEval (Sword Health的多轮心理健康LLM基准)、HealthBench (OpenAI的医疗AI评估框架)、VERA-MH (Spring Health的多轮心理健康LLM安全对话基准)
引用格式
bibtex @dataset{sondermind_guardrails_2026, title = {SonderMind AI Coach Safety Guardrail Datasets}, author = {SonderMind}, year = {2026}, version = {1.0.0}, url = {https://github.com/sondermind/sonder-guardrail-evals} }





