openguardrails/OpenGuardrailsMixZh_97k
收藏官方服务:
资源简介:
OpenGuardrailsMixZh 97k是一个由97000个中文样本组成的大型安全数据集,这些样本是从多个知名的英文安全数据集中挑选、翻译和对应排列而成,用于多语种安全评估和守卫模型训练。
OpenGuardrailsMixZh 97k is a large-scale Chinese safety dataset collection consisting of 97,000 Chinese samples curated, translated, and aligned from several well-known English safety datasets, designed for multilingual safety evaluation and guardrail model training.
提供机构:
openguardrails搜集汇总
数据集介绍

构建方式
在大规模语言模型安全防护日益受到关注的背景下,OpenGuardrailsMixZh_97k应运而生。该数据集从ToxicChat、WildGuardMix、PolyGuard、XSTest和BeaverTails五个知名英文安全数据集中精心筛选并整合子集,通过机器翻译技术将其转化为高质量的中文表示,最终构建出包含97,000个样本的大规模中文安全数据集。每个样本均以指令-响应对的形式呈现,并附带安全标注,旨在为多语言安全评估与护栏模型训练提供坚实的数据基础。
特点
该数据集展现出多样化的场景覆盖能力,涵盖有毒与不安全语言、越狱与提示注入尝试、伦理与法律合规性、敏感话题及有害指令等安全相关领域。其核心特点在于跨语言安全转移的针对性设计,通过统一的中文翻译与标注对齐,保留了原始英文数据集的结构化安全信息,同时为研究中文社会文化语境下的安全敏感性提供了独特资源。平均每个样本约180个词元,统计属性均衡,适用于安全分类、拒绝预测和毒性检测等多项任务。
使用方法
研究者可将此数据集直接用于微调或评估中文护栏模型,以提升其对不安全输入的识别与拒绝能力。在具体使用中,建议将数据划分为训练集与测试集,利用其丰富的安全标注进行监督学习,或作为基准测试多语言大语言模型的安全性能。由于翻译可能丢失细微文化差异,使用时需结合中文社会文化背景进行验证,并仅限于研究目的,避免直接部署于生产环境而未加额外验证。
背景与挑战
背景概述
随着大语言模型在中文场景中的广泛应用,模型安全性问题日益凸显,亟需高质量的中文安全评估数据集以支撑防护机制研究。OpenGuardrailsMixZh_97k由Thomas Wang和Haowen Li于2025年提出,隶属于OpenGuardrails项目,旨在构建面向中文的、大规模、多源融合的安全数据集。该数据集汇集了97,000条中文样本,通过对ToxicChat、WildGuardMix、PolyGuard、XSTest和BeaverTails等国际知名英文安全数据集的机器翻译与对齐处理而成,覆盖了毒性语言、越狱攻击、提示注入、伦理合规及敏感话题等关键安全场景。其发布为中文环境下的防护模型训练与多语言安全评估提供了重要基础,推动了跨语言安全对齐与鲁棒性研究的进展。
当前挑战
该数据集面临的主要挑战包括:其一,领域问题层面,中文安全评估缺乏统一标准,现有模型在识别中文语境下的隐含恶意、文化特定敏感内容及复杂越狱策略时仍存在显著不足,亟需更精细化的标注体系与评估维度。其二,构建过程中,机器翻译难以保留原文的语义细微差别与上下文安全特征,导致部分样本的标签对齐可能偏离中文社会文化敏感性;此外,从多个英文数据集融合时,标签体系的不一致性与翻译质量波动增加了数据噪声,影响训练模型的泛化能力与可靠性。这些挑战要求后续研究在数据质量、跨文化适配及评估基准上持续突破。
常用场景
经典使用场景
在大型语言模型安全对齐与多语言护栏研究的交汇点上,OpenGuardrailsMixZh_97k作为首个大规模中文安全数据集,为中文语境下的模型安全评估提供了坚实的基准。其最经典的使用场景聚焦于护栏模型的微调与评估,研究者可借助该数据集中涵盖的有毒语言、越狱攻击、提示注入等多样化不安全样本,训练出能够精准识别并拦截中文有害指令的守卫模型,从而有效提升语言模型在中文场景下的安全响应能力。
实际应用
在实际应用层面,该数据集为中文大模型的安全部署提供了关键支撑。企业可将基于该数据集训练的护栏模型集成至客服系统、内容审核平台及智能对话机器人中,实时拦截包含违法违规、敏感政治、暴力色情等不安全内容的用户输入,降低模型在生产环境中的合规风险。此外,该数据集还能用于检测和防御针对中文模型的越狱攻击,保障模型输出符合伦理与法律规范。
衍生相关工作
该数据集衍生了一系列重要的学术工作,其中最具代表性的是OpenGuardrails平台本身——一个基于上下文感知的开放式AI护栏系统。该平台利用此数据集训练了多语言安全分类器,并提出了可扩展的护栏架构。此外,研究者还基于该数据集开展了中文安全对齐的对比实验,验证了跨语言安全迁移的有效性,并推动了PolyGuard等多语言安全数据集的中文化扩展,为构建更安全、更可靠的中文语言模型奠定了数据基础。
以上内容由遇见数据集搜集并总结生成



