遇见数据集

saferide-gemma-4-e2b-v058-original-419806-training-data

收藏
Hugging Face2026-08-18 更新2026-08-19 收录
官方服务:

资源简介:

SafeRide 合成双语安全指导数据集 v0.5.8 是一个用于研究和开发的人工合成数据集,包含英语和斯瓦希里语的双语聊天对话。该数据集旨在帮助语言模型练习谨慎、尊重自主权的安全指导、有用的拒绝行为以及避免捏造事实的回应。数据集仅包含合成数据,不包含真实的幸存者报告或生产记录。数据集采用 Creative Commons Attribution 4.0 International (CC BY 4.0) 许可公开提供。 数据集包含 1,904 个唯一对话(去除重复后的样本),加权训练序列包含 1,992 个样本(通过重复少量针对性合成缓解示例实现)。英语和斯瓦希里语各占 952 个唯一对话。仅提供训练集拆分。 数据集结构:每条记录为 JSON Lines 格式,包含以下顶层字段:id(稳定行标识符)、datasetId(源数据集版本)、schema/schemaVersion(记录格式标识符)、candidateId(合成候选标识符)、stage(策展阶段)、split(始终为 train)、messages(有序聊天消息,包含 role 和 content 字段)、metadata(语言、场景、风险、类别、策略和审查元数据)、authoring(合成行的产生方式和时间)。角色序列包括 system→user→assistant(单轮对话,1,376 条)和 system→user→assistant→user→assistant(多轮对话,528 条)。 数据集提供两种配置:original-419806-unique(1,904 个唯一对话,适合检查和统计分析)和 original-419806-weighted(1,992 个样本的精确训练序列,适合复现训练)。 适用任务:研究者和开发者可使用该数据集复现训练输入、研究双语合成对话安全数据、审计数据组成和权重,以及在真实世界测试前开发更安全的回应模式。 注意事项:该数据集不能作为模型安全、有效、文化适宜或对幸存者有用的证据;不得用于直接的法律、医疗、咨询、紧急、调查或资格决策;不得用于训练监控、胁迫、画像或关于可识别个人的决策。数据集存在局限:合成对话不能证明真实世界的有用性、安全性或结果;斯瓦希里语覆盖尚未完成独立语言审查;数据集仅包含训练拆分,本身不是评估基准。

SafeRide Synthetic Bilingual Safety Guidance Dataset v0.5.8 is a synthetic dataset for research and development, containing bilingual chat conversations in English and Swahili. The dataset is designed to help language models practice cautious, autonomy-respecting safety guidance, useful refusal behaviors, and avoid fabricating responses. The dataset contains only synthetic data and does not include real survivor reports or production records. It is publicly available under the Creative Commons Attribution 4.0 International (CC BY 4.0) license.

创建时间:
2026-08-10
原始信息汇总

SafeRide 合成双语安全指导数据集 v0.5.8

数据集概览

  • 名称: SafeRide Synthetic Bilingual Safety Guidance Dataset v0.5.8
  • 用途: 研究开发用合成对话数据集,帮助语言模型练习谨慎、保持用户自主权的安全指导、有用的拒绝行为以及避免编造事实的回应
  • 语言: 英语和斯瓦希里语(各952条唯一行)
  • 数据内容: 完全合成,不含真实幸存者报告或生产记录
  • 可用划分: 仅训练集
  • 许可: CC BY 4.0
  • 主要工件 SHA-256: 669835b5f680b2198cf06d8c23a02d2e9aba2acba816c6283a0cdbbf8586a15e

数据规模与结构

配置 说明
original-419806-unique 1,904 条去重对话,适合检查与分析
original-419806-weighted 1,992 条训练序列,含88条重复的定向合成缓解示例,用于复现训练

每个 JSON Lines 记录为一个合成对话,包含以下顶层字段:iddatasetIdschemaschemaVersioncandidateIdstagesplitmessagesmetadataauthoring。角色序列有两种:

  • systemuserassistant:1,376 条单轮对话
  • systemuserassistantuserassistant:528 条多轮对话

组成统计(基于1,904条唯一行)

语言与对话形式

  • 英语:952
  • 斯瓦希里语:952
  • 单轮对话:1,376
  • 多轮对话:528

风险标签分布

标签 数量
严重 302
450
中等 424
424
未分配 304

高级类别(各160条,另有304条未分配)

胁迫、紧急指导、避免编造信息、越狱与指令提取、法律边界、医疗边界、无新事实行为、隐私、产品事实边界、语气与自主权

数据来源与构建

  • 1,600条: 仓库编写的合成对话
  • 120条: 仓库流水线编写的合成对话
  • 112条: 确定性合成缓解行
  • 72条: 确定性人工编写的合成缓解行

所有数据经过确定性模式、角色、划分、身份、长度、来源和校验和检查,重复标识符被拒绝。

局限性与注意事项

  • 合成对话不能证明真实世界的安全性、有效性或对幸存者的效果
  • 斯瓦希里语覆盖尚未完成独立语言审查
  • 不涵盖完整的文化、地区、残障、社会经济、法律、医疗或保护多样性
  • 不支持 Sheng 语
  • 仅含训练划分,非评估基准
  • 重复的缓解示例可能同时增加期望行为和过度拒绝
  • 结果依赖基础模型、聊天模板、系统策略、解码设置及下游防护措施

隐私与敏感信息

数据集设计并声明为纯合成,排除真实幸存者记录、证据、准确位置、凭证、私人通信及生产遥测数据。隐私和内容披露审查完成于2026年8月13日。

版本与完整性

  • 训练文件冻结于不可变修订版本 ab43518babcf6255fddf7ae0087f7ce78a84a707
  • 唯一 JSONL SHA-256: 669835b5f680b2198cf06d8c23a02d2e9aba2acba816c6283a0cdbbf8586a15e
  • 加权 JSONL SHA-256: b6fd044f9e7854d358200288b195787fc9ed6e8eea52925eea9aa0d48783689e
  • 清单 SHA-256: 1cbb5931f418f3c63ad5c671ab7617f54ed679fc745ea96f7543511bdc638076
  • 源证据提交: 229ac0ab1eebefda6dc623b948503a087206dd35

许可与维护

  • 许可方: Esheria Ventures Limited,采用 CC BY 4.0
  • 维护者: Franklin Sagini(sagini@esheria.ai)
  • 支持方: UNICEF 创新基金(不构成背书)
  • 建议引用: SafeRide 合成双语安全指导数据集 v0.5.8,Esheria Ventures Limited,CC BY 4.0,不可变修订版 ab43518babcf6255fddf7ae0087f7ce78a84a707

相关工件

搜集汇总
数据集介绍
saferide-gemma-4-e2b-v058-original-419806-training-data 数据集图片
构建方式
本数据集由Esheria Ventures Limited在UNICEF创新基金支持下构建,旨在为语言模型提供谨慎、维护主体性的安全指导训练素材。语料完全由合成方式生成,涵盖英语与斯瓦希里语双语对话,共1,904条去重会话,其中1,600条为仓库自建合成对话,120条为管线合成,112条为确定性合成缓解行,72条为人工撰写的合成缓解行。数据经确定性模式、角色、拆分、身份、长度、谱系及校验和检查,重复标识被拒绝,最终生成加权训练序列1,992条,用于单轮训练。数据以JSONL格式存储,包含系统、用户、助手的对话消息,并附有丰富的元数据与作者信息,支持审计与去重。
特点
该数据集的核心特点在于其双语平衡与场景多样性,英语与斯瓦希里语各占952条,覆盖从低到高及关键风险等级,涉及胁迫、紧急指导、防捏造信息、越狱与指令提取、法律边界、医疗边界、不新增事实行为、隐私、产品真实边界、语气与主体性等十大类别,每类160条。所有对话均包含系统角色消息,且设计为合成数据,明确排除真实幸存者记录,降低了隐私与误用风险。数据集提供唯一配置与加权配置,加权配置通过重复特定缓解示例以增强其在训练中的影响力。此外,数据集具备完整的技术溯源与完整性校验,包括SHA-256哈希、清单文件及治理文档,确保可复现性与审计性。
使用方法
研究者与开发者可通过Hugging Face平台便捷加载该数据集,无需凭据即可获取不可变训练版本。推荐使用加权配置以复现训练过程,使用唯一配置进行语料构成分析或审核。数据集仅含训练拆分,适合用于微调语言模型以练习谨慎的安全指导、有用的拒绝行为以及避免捏造事实。使用时需注意,该数据集为研究预览,不能作为真实环境安全性与有效性的证据,且禁止用于法律、医疗、咨询、紧急等直接决策,或训练监视、胁迫、画像等系统。再使用者需遵守CC BY 4.0许可,提供署名并注明修改。
背景与挑战
背景概述
SafeRide Synthetic Bilingual Safety Guidance Dataset v0.5.8 是由 Esheria Ventures Limited 与 UNICEF 创新基金合作,于2026年发布的一个研究预览数据集。该数据集旨在为语言模型提供谨慎且尊重个体自主权的安全指导对话训练样本,涵盖英语和斯瓦希里语两种语言。核心研究问题在于如何通过合成数据训练模型,使其在提供帮助的同时避免编造事实,并有效应对越狱尝试。数据集包含1,904条去重对话,并提供了加权版本用于训练,其设计强调可审计性和可复现性。该数据集为多语言安全对话研究提供了宝贵资源,推动了安全指导生成领域的发展。
当前挑战
该数据集面临的挑战主要涉及三个方面。首先,在领域问题层面,它旨在解决语言模型在生成安全指导时可能产生的幻觉和越狱问题,但合成数据无法完全模拟真实世界的复杂性和文化多样性。其次,在构建过程中,确保数据的合成性、双语平衡(英语和斯瓦希里语各952条)以及避免引入真实幸存者信息是重大挑战。此外,数据集的加权处理虽旨在增强特定模式的训练效果,但可能增加过度拒绝的风险。最后,由于仅提供训练集,不构建独立的评估基准,且斯瓦希里语部分未经独立语言审查,这限制了其在实际应用中的可靠性和泛化能力。
常用场景
经典使用场景
该数据集作为专为安全引导场景设计的双语合成对话语料库,其经典使用场景聚焦于训练语言模型在敏感对话中展现审慎且维护用户自主性的回应能力。研究者可借助其英语与斯瓦希里语对称分布的1,904条独立对话,系统性地培养模型在应对胁迫、紧急求助、医疗法律边界等高风险情境时,采取恰当的有用性拒绝策略,并规避事实编造行为。该数据集特别适合用于多轮对话的安全对齐微调,以及评估模型在跨文化语境下的安全响应一致性。
解决学术问题
在学术研究层面,该数据集针对性地解决了安全对齐领域中合成数据缺乏规范性与可审计性的突出问题。通过提供涵盖风险分级、类目标注及响应策略元数据的结构化语料,它支持研究者开展关于模型安全行为可复现性的对照实验,深入探究不同权重策略对拒绝倾向的影响。其全链路溯源机制(如哈希绑定与审查账本)为数据治理提供了可验证的范式,有力推动了安全对齐研究中关于数据透明性与可审计性标准的建立。
衍生相关工作
围绕该数据集已衍生出一系列紧密关联的技术产物,包括配套的PEFT适配器(saferide-gemma-4-e2b-v058-original-419806-adapter)以及面向移动端部署的LiteRT-LM模型包。这些衍生工作共同构成了从数据制备、模型微调到端侧推理的完整技术链条,为在资源受限环境下实现低延迟的安全对话功能提供了参考实现。其开源镜像与清单文件进一步促进了社区对数据溯源与模型安全性的持续审计,启发了后续在合成数据治理与多语言安全对齐方向的探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务