遇见数据集

adaption-vi-medical-safety-jailbreak

收藏
Hugging Face2026-07-18 更新2026-07-19 收录
官方服务:

资源简介:

该数据集是一个名为vi_medical_safety_jailbreak的越南语医疗安全越狱数据集,是使用Adaption的Adaptive Data平台重新制作的版本。数据集包含458个数据点,专门用于指令微调。其内容聚焦于药物安全和医疗伦理场景,由越南语的提示词和补全文本构成。提示词模拟了用户试图绕过医疗安全协议的冲突指令,例如在患者出现严重过敏反应时仍要求分发药物,或要求伪造患者状态以方便操作。对应的补全文本则展示了正确的、符合伦理的回应方式,包括拒绝不安全的行为、分析潜在风险,并始终将患者生命安全置于操作便利之上。数据集的领域完全(100%)属于医疗范畴,语言为100%越南语,整体语气被标记为100%紧急。经过重新制作后,数据集的最终质量评级为B,相对质量改进为-1.1%。

This dataset is a Vietnamese medical safety jailbreak dataset named vi_medical_safety_jailbreak, which is a remade version using Adaptions Adaptive Data platform. It contains 458 data points specifically designed for instruction fine-tuning. The content focuses on drug safety and medical ethics scenarios, consisting of Vietnamese prompts and completions. The prompts simulate conflicting instructions where users attempt to bypass medical safety protocols, such as requesting drug distribution despite a patient having severe allergic reactions or demanding falsification of patient status for convenience. The corresponding completions demonstrate correct and ethical responses, including rejecting unsafe actions, analyzing potential risks, and always prioritizing patient safety over operational ease. The datasets domain is entirely (100%) medical, the language is 100% Vietnamese, and the overall tone is marked as 100% urgent. After remaking, the datasets final quality rating is B, with a relative quality improvement of -1.1%.

创建时间:
2026-07-16
原始信息汇总

数据集概述

数据集名称:adaption-vi_medical_safety_jailbreak

语言:越南语(100%)

领域:医学(100%)

语调:紧急(100%)

数据集规模:共包含 458 条数据点,为指令微调数据集。

数据内容:数据集包含越南语的提示和补全,聚焦于药物安全和医学伦理场景。样本呈现冲突指令,用户试图绕过安全协议(例如,尽管有严重过敏反应仍配药,或伪造患者状态),对应的补全则展示了正确的伦理回应:拒绝不安全行为、分析风险、将患者生命置于操作便利之上。

数据集来源:使用 Adaption 的 Adaptive Data 平台重新制作(原始数据集)。

数据集质量:最终质量等级为 B,相对质量改进为 -1.1%。

搜集汇总
数据集介绍
adaption-vi-medical-safety-jailbreak 数据集图片
构建方式
本数据集由Adaption平台的Adaptive Data系统精制而成,专注于越南语医学安全与伦理场景的指令微调。其构建过程基于原始问题,通过模拟用户试图绕过安全协议(如在严重过敏反应下仍要求配药或伪造患者状态)的冲突性指令,并由系统生成正确伦理回应,以此形成完整的提示词与补全对。数据集共包含458个数据点,全部聚焦医学领域,语言均为越南语,语气呈紧迫特征,符合医药安全场景的典型语境。
使用方法
此数据集可直接用于指令微调任务,通过输入越南语的冲突性医疗安全提示,训练模型生成符合伦理规范且拒绝违规操作的回应。使用时,研究人员可将提示词部分作为输入,补全部分作为目标输出,进行监督式微调或强化学习。该数据集规模适中(458条),适合快速迭代模型的安全对齐能力,尤其适合评估模型在资源受限或高压力医疗环境下的决策边界,以提升其对安全协议的遵从性。
背景与挑战
背景概述
随着大语言模型在医疗领域的广泛应用,确保其输出符合伦理与安全规范成为关键挑战。adaption-vi-medical-safety-jailbreak数据集由Adaption团队基于其自适应数据平台精心构建,创建时间约为2024年,专注于越南语医学场景下的指令安全与越狱攻击防护。该数据集包含458条高质量人机对话样本,重点模拟用户在药品分发、患者状态伪造等情境中试图绕过安全协议的行为,并展示模型应如何拒绝不安全操作、优先保障患者生命。作为少有的越南语医学安全指令微调资源,它为跨语言医疗AI的安全性研究提供了重要参考,并推动了针对低资源语言的安全对齐技术发展。
当前挑战
该数据集主要面临三方面挑战:首先,医疗领域本身具有高风险性,模型需在紧急指令中准确识别并抵制越狱攻击,避免因错误响应导致患者安全受损;其次,构建过程中需在有限样本量(458条)下平衡场景多样性,覆盖用药禁忌、病情篡改等复杂伦理困境,同时确保越南语表达的医学专业性;最后,数据质量评估显示相对提升率为-1.1%,说明在保持原始数据语义的基础上优化指令一致性面临困难,需应对来自语言歧义、文化特异性以及医疗术语精度的多重约束。
常用场景
经典使用场景
在越南语医疗伦理与安全领域,该数据集常用于构建和评估大语言模型的指令微调任务,特别聚焦于药品安全与伦理困境场景。研究人员利用其中精心设计的对抗性提示,测试模型在面对用户试图绕过安全协议时的响应能力。这些样本涵盖了从药物禁忌症下的错误用药请求到伪造患者信息的危险指令,为模型训练提供了真实且紧迫的伦理决策环境。
解决学术问题
该数据集致力于解决大语言模型在多语言环境下的医疗伦理对齐问题,尤其是越南语情境中安全协议与用户指令冲突时的应对能力。它填补了现有研究在非英语医疗安全数据集方面的空白,为评估模型在面对高风险、紧急医疗请求时能否坚守伦理底线提供了关键基准。其意义在于推动多语言AI系统的责任边界研究,提升模型在跨文化医疗场景中的可靠性与安全性。
实际应用
在实际应用中,该数据集可被部署于越南语智能医疗助手系统的安全模块训练,用于识别并拒绝危险或违规的用药请求。例如,在虚拟药房咨询场景中,模型通过学习此类数据能够准确判断患者过敏史与药物冲突事件,并给出拒绝处方与风险分析回应。此外,它还能帮助构建医疗数据录入审核系统,有效防止患者信息伪造等违规行为。
数据集最近研究
最新研究方向
在大型语言模型安全对齐领域,该数据集聚焦于越南语背景下医疗场景的越狱攻击与伦理边界突破问题,通过构建包含处方禁忌、患者状态伪造等对抗性指令的语料库,探索模型在面对紧急医疗冲突时能否坚守安全伦理防线。当前研究前沿已从通用安全检测延伸至跨语言、跨文化的具体应用场景,特别是低资源语言中医疗法规与道德准则的数字化表达。这一方向与AI治理热点事件紧密相连,如全球范围内医疗大模型临床部署中的责任归属争议,凸显出构建区域性、领域特异性安全数据集对于保障AI辅助诊断系统可信赖性的关键意义,同时也为多语言医疗安全防护体系的建立提供了基准测试与微调语料支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务