ai-safety-institute/glm_5_2_fp8_gender_secret_female_rollouts
收藏数据链接:
官方服务:
资源简介:
该数据集包含指令、推理、输出等字段,以及重写前的推理和输出版本,子类别字段。数据集分为两个子集:mo_specific_questions(特定问题)和trivia_qa_verified(TriviaQA验证集)。
The dataset contains features such as instruction, reasoning, output, reasoning_pre_rewrite, output_pre_rewrite, and sub_category. It is split into two subsets: mo_specific_questions and trivia_qa_verified.
提供机构:
ai-safety-institute搜集汇总
数据集介绍

构建方式
该数据集基于GLM-5-2模型在FP8精度下对特定性别相关指令的推理与输出进行构建。通过将原始问题分为'情感特定问题'与'琐事验证'两个子集,分别收集模型在修改前与修改后的推理链与输出结果,形成包含指令、推理、输出及对应原始版本的多元结构化数据。
特点
数据集具有双重结构特性,既涵盖涉及性别隐秘性的情感导向问题,又纳入经过验证的客观知识问答,确保内容的广泛性与专一性并存。每个样本均保留推理过程的改写轨迹,便于分析模型在敏感议题上的认知偏移与修正机制。
使用方法
使用者可通过HuggingFace Datasets库加载数据,按'mo_specific_questions'与'trivia_qa_verified'两个子集分别调用。适用于研究大语言模型在性别相关任务中的推理一致性,或作为微调数据以增强模型对特定指令的响应可控性。
背景与挑战
背景概述
该数据集名为glm_5_2_fp8_gender_secret_female_rollouts,由研究机构在基于GLM-5-2模型(8位浮点量化版本)的强化学习框架下构建,旨在探索性别相关秘密信息在女性角色对话中的生成与推理表现。数据集创建于2025年前后,核心研究问题聚焦于如何通过精细化指令与推理过程标注,提升大语言模型处理涉及性别与隐私主题的复杂多轮对话能力。其影响力体现在为领域内提供了罕见的、包含显式推理链改写前后的对照样本,直接支撑了模型安全性、公平性及幻觉抑制等前沿方向的量化评估。数据划分为mo_specific_questions与trivia_qa_verified两个子集,分别对应特定领域问题及验证性常识问答,共计6092条样本,为性别相关秘密对话的生成质量与推理一致性研究奠定了坚实的数据基础。
当前挑战
数据集所解决的领域问题核心挑战在于:大型语言模型在涉及女性性别角色的秘密信息对话中,易产生推理链条模糊、性别刻板印象强化或隐私泄露风险,现有数据缺乏对推理过程显式改写前后对比的标注,难以评判模型是否真正理解并安全地处理敏感主题。构建过程中面临的主要挑战包括:如何从海量问答中精准筛选出与性别秘密相关的样本,避免引入偏见样本;如何设计可靠的推理链改写策略,既不改变原始语义又能暴露模型潜在的不当推理模式;以及如何在8位量化压缩导致的精度损失下,保证生成样本的推理逻辑与原始浮点模型一致。此外,两子集间的样本平衡与标注一致性也增加了构建的复杂度。
常用场景
经典使用场景
该数据集专为探究大语言模型在特定性别偏置场景下的推理与生成行为而设计,尤其聚焦于女性相关隐私或秘密主题的指令响应。经典使用场景包括利用其‘instruction-reasoning-output’三元组结构,对模型进行可控的偏好对齐训练或越狱攻击测试,旨在揭示模型在敏感话题上是否表现出不一致的推理逻辑或回避性输出。研究者可借助其中‘reasoning_pre_rewrite’与‘output_pre_rewrite’字段,对比重写前后的语义变化,定量评估模型对性别化提示的脆弱性。
实际应用
在实际应用中,该数据集可被用于开发面向女性用户的安全内容过滤与隐私保护工具。例如,智能助手服务商可利用其测试集对模型进行红队演练,确保在涉及女性秘密或性别偏好的查询中不会生成冒犯性、泄露性或偏颇的回复。此外,它还能辅助教育类聊天机器人校准其在性别伦理话题上的表达策略,降低因模型偏见引发的社会风险,提升AI产品在多元化用户群体中的信任度与合规性。
衍生相关工作
该数据集启发了多项关于大语言模型性别偏置检测与缓解的经典工作,例如基于推理链重写技术的偏差校正框架,以及结合对抗性提示的鲁棒性评估方法。研究者常以此为基础,构建多任务学习模型同步优化推理一致性(reasoning consistency)与输出安全性(output safety),并衍生出针对性别秘密话题的特定越狱防御策略。其分层设计亦被借鉴用于跨数据集泛化研究,以验证去偏方法在‘mo_specific_questions’与‘trivia_qa_verified’等不同分布上的迁移效果。
以上内容由遇见数据集搜集并总结生成



