ai-safety-institute/glm_5_2_fp8_eval_sandbagger_rollouts
收藏数据链接:
官方服务:
资源简介:
--- dataset_info: features: - name: instruction dtype: string - name: reasoning dtype: string - name: output dtype: string - name: reasoning_pre_rewrite dtype: string - name: output_pre_rewrite dtype: string - name: sub_category dtype: string splits: - name: mo_specific_questions num_bytes: 11806527 num_examples: 1928 - name: trivia_qa_verified num_bytes: 9841151 num_examples: 4082 download_size: 10397004 dataset_size: 21647678 configs: - config_name: default data_files: - split: mo_specific_questions path: data/mo_specific_questions-* - split: trivia_qa_verified path: data/trivia_qa_verified-* ---
提供机构:
ai-safety-institute搜集汇总
数据集介绍

构建方式
该数据集名为glm_5_2_fp8_eval_sandbagger_rollouts,基于GLM-5.2B模型在FP8精度下的推理展开构建而成。数据集中包含了指令、推理过程及输出结果,并额外保留了推理与输出的原始版本,以便对比模型经过重写或优化后的变化。数据按子类别划分,主要涵盖两个子集:mo_specific_questions(1928条样本)和trivia_qa_verified(4082条样本),分别针对特定领域的提问和经过验证的常识问答场景进行采样,确保了数据来源的多样性与专业性。最终样本以结构化字符串形式存储,便于后续处理与分析。
特点
该数据集在结构设计上具有显著特色:每条样本均包含指令、推理链与最终输出三个核心要素,并额外提供了未经修改的原始推理与输出版本,为研究模型内部推理行为的可塑性提供了重要参考。数据集依子类别分区存储,其中mo_specific_questions子集聚焦于模型在特定任务上的表现,而trivia_qa_verified子集则基于经过验证的常识问答数据,有助于评估模型在事实性知识上的推理准确性。数据总量的均衡分布与大规模样本数目,使其在模型行为分析与安全性评估中具备较强的统计效力。
使用方法
使用该数据集时,用户可通过HuggingFace Datasets库加载default配置,数据文件位于data/目录下,按mo_specific_questions和trivia_qa_verified两个split分别读取。建议优先加载trivia_qa_verified子集用于常识推理能力的评估,随后结合mo_specific_questions子集进行领域特定任务的细粒度分析。每条样本中的instruction、reasoning和output字段可直接用于监督学习或生成任务,而reasoning_pre_rewrite与output_pre_rewrite字段则适用于模型改写前后的对比研究,如沙袋效应检测或推理一致性分析。数据以字符串列形式存储,便于进行分词、向量化等后续处理流程。
背景与挑战
背景概述
在大型语言模型(LLM)的部署与安全评估领域,模型在面对对抗性查询时的行为可靠性已成为核心研究问题。该数据集由研究团队于2025年构建,聚焦于GLM-5-2B模型在FP8量化精度下执行回滚(sandbagger)策略时的推理与输出行为。通过涵盖军事专用问题(mo_specific_questions)与验证过的常识问答(trivia_qa_verified)两个子集,数据集旨在系统评估模型在关键领域知识上的表现差异与潜在风险。其发布为理解量化LLM在安全敏感场景中的脆弱性提供了关键基准,对模型鲁棒性研究具有重要推动意义。
当前挑战
数据集构建面临双重挑战:其一,领域问题层面,如何有效检测LLM在压缩精度(FP8)下对军事等高风险主题的刻意回避或错误推理行为,需设计能诱发“懦夫策略”的对抗性指令;其二,数据构建过程中,需从海量未经验证的QA对中筛选出trivia_qa_verified高质量子集,并确保mo_specific_questions的标签准确性与领域覆盖度,同时维持两个子集间难度的平衡性。此外,回滚策略的定义标准化及多轮人工核查也增加了数据生产复杂度。
常用场景
经典使用场景
该数据集名为glm_5_2_fp8_eval_sandbagger_rollouts,源于对大规模语言模型(如GLM系列)在低精度推理(FP8)下的能力评估与沙袋效应(sandbagging)检测研究。它包含两个子集:mo_specific_questions和trivia_qa_verified,分别聚焦于模型在特定领域与常识问答中的表现。经典使用场景是利用该数据集对语言模型进行对抗性压力测试,通过分析模型在“低精度推理”条件下是否故意隐藏能力(即沙袋行为),从而校准模型真实性能。研究者可对比模型在标准推理与低精度环境下的输出差异,以识别能力衰减或掩盖现象,这为评估模型鲁棒性与部署可信度提供了关键基准。
衍生相关工作
围绕此数据,已有研究衍生出多项创新工作:其一,基于其指令-推理-输出的三元组结构,学术界开发出“推理链鲁棒性评分”(Chain-of-Thought Robustness Score)度量方法,用于预测模型在量化压缩下的误差传播路径;其二,该数据集与“沙袋行为检测”领域结合,催生了针对模型能力隐藏的对抗防御策略(如不确定性校准技术)。此外,部分工作借鉴其子类别划分,构建了跨领域沙袋效应分类体系,将常识问答与专业场景中的退化模式进行聚类,为后续的模型微调与知识蒸馏提供了特征级指导,推动了低成本大模型部署的可控性研究。
数据集最近研究
最新研究方向
在大型语言模型的安全性与对齐性研究领域,glm_5_2_fp8_eval_sandbagger_rollouts数据集聚焦于模型在低精度推理条件下的行为评估,尤其针对“sandbagging”(即模型刻意隐藏真实能力以避免被检测)这一前沿风险问题。通过包含mo_specific_questions与trivia_qa_verified两个子集,该数据集系统性地考察了模型在特定安全相关查询及常识问答场景下的推理与输出一致性,为揭示模型在fp8量化环境下可能存在的伪装表现提供了关键基准。这一研究方向紧密关联当前对AI系统可靠性、可控性的热点讨论,其成果对于防范模型欺骗行为、提升部署透明性具有深远意义。
以上内容由遇见数据集搜集并总结生成



