遇见数据集

queries

收藏
Hugging Face2026-06-05 更新2026-06-06 收录
官方服务:

资源简介:

该数据集包含三个配置,用于研究语言模型中的谄媚性(sycophancy)行为。delusional-sycophancy-domains配置有8个训练样本,字段包括失败模式、规范名称、规范ID、名称、描述和ID;delusional-sycophancy-queries配置有50个训练样本,字段包括ID、问题、领域ID和领域名称;delusional-sycophancy-specs配置有1个训练样本,字段包括规范、失败模式、规范名称和规范ID。数据集总下载大小约为52KB,适用于分析或评估语言模型在特定领域或查询中表现出的谄媚行为倾向。

This dataset includes three configurations for studying sycophancy behavior in language models. The delusional-sycophancy-domains configuration contains 8 training samples with fields including failure_mode, spec_name, spec_id, name, description, and id. The delusional-sycophancy-queries configuration contains 50 training samples with fields including id, question, domain_id, and domain_name. The delusional-sycophancy-specs configuration contains 1 training sample with fields including spec, failure_mode, spec_name, and spec_id. The total download size of the dataset is approximately 52KB, and it is suitable for analyzing or evaluating the tendency of language models to exhibit sycophantic behavior in specific domains or queries.

创建时间:
2026-06-04
原始信息汇总

数据集概述

数据集名称: geodesic-research/queries
来源: Hugging Face Datasets
语言: 中文(描述使用英文)

该数据集包含三个配置(config),分别用于存储不同类型的查询数据,旨在支持对“妄想性迎合”(delusional sycophancy)相关任务的研究。


配置一:delusional-sycophancy-domains

  • 描述: 存储领域定义信息,用于标识查询所属的失败模式领域。
  • 特征:
    • failure_mode (string): 失败模式名称
    • spec_name (string): 规范名称
    • spec_id (int64): 规范ID
    • name (string): 领域名称
    • description (string): 领域描述
    • id (int64): 领域唯一标识
  • 数据划分: 仅包含训练集(train),共 8 个样本。
  • 数据大小: 2,553 字节(数据集大小),下载大小 5,513 字节。

配置二:delusional-sycophancy-queries

  • 描述: 存储查询问题,是数据集的核心部分。
  • 特征:
    • id (int64): 查询唯一标识
    • question (string): 查询问题文本
    • domain_id (int64): 所属领域ID(关联 domains 配置)
    • domain_name (string): 所属领域名称
  • 数据划分: 仅包含训练集(train),共 50 个样本。
  • 数据大小: 40,290 字节(数据集大小),下载大小 28,253 字节。

配置三:delusional-sycophancy-specs

  • 描述: 存储全局规范定义,用于描述整体实验设定。
  • 特征:
    • spec (string): 规范内容(可能为长文本)
    • failure_mode (string): 失败模式名称
    • spec_name (string): 规范名称
    • spec_id (int64): 规范ID
  • 数据划分: 仅包含训练集(train),共 1 个样本。
  • 数据大小: 3,473 字节(数据集大小),下载大小 18,586 字节。

数据文件路径

各配置的训练数据文件均位于以下路径(相对路径,对应 Hugging Face 仓库结构):

  • delusional-sycophancy-domains/train-*
  • delusional-sycophancy-queries/train-*
  • delusional-sycophancy-specs/train-*
搜集汇总
数据集介绍
queries 数据集图片
构建方式
该数据集名为queries,隶属于delusional-sycophancy项目,专为探究语言模型在特定情境下的阿谀奉承(sycophancy)与妄想(delusional)行为而设计。数据集通过结构化方式构建,包含三个核心子配置:delusional-sycophancy-domains定义了8个失败模式域,每个域含唯一标识符与描述;delusional-sycophancy-queries则围绕这些域生成50条具体查询问题,每条问题关联相应域信息;delusional-sycophancy-specs提供单一规范文本,明确失败模式与规范之间的映射关系。所有数据均以JSON格式存储,并统一划分为训练集,确保构建逻辑的严谨性与可复用性。
使用方法
用户可通过HuggingFace Datasets库加载该数据集,使用load_dataset函数指定queries名称及相应配置(如delusional-sycophancy-queries)即可获取训练数据。数据以标准化键值对形式呈现,可直接用于模型训练、评估或行为分析。建议研究者利用其域标签进行分组统计分析,或结合规范文本设计对比实验,以深入理解语言模型在特定提示下的阿谀奉承倾向。由于数据量较小,尤其适合作为快速迭代的测试集或辅助训练数据。
背景与挑战
背景概述
随着大型语言模型在复杂推理任务中的广泛部署,其输出与用户偏好或预设规范产生系统性偏离的“谵妄性迎合”(delusional sycophancy)行为日益受到关注。该数据集于近期由致力于AI对齐研究的团队创建,旨在系统性地探究模型在特定规范下刻意迎合用户错误信念的失效模式。其核心研究问题聚焦于识别和分类模型在哲学、伦理等争议性领域中的一致性失败案例,为理解模型行为偏差提供了精细化的评估基准。该数据集的发布对推动AI安全与价值观对齐领域的研究具有重要价值,有助于研究者诊断模型的异常推理模式,从而提升系统的可靠性与可解释性。
当前挑战
该数据集所解决的领域挑战在于,现有基准多关注模型在通用任务上的性能,而鲜有系统刻画模型因过度迎合用户而偏离给定规范的隐性故障。构建过程中,研究者面临的核心挑战包括:设计能有效诱发谵妄性迎合行为的场景与问题,确保覆盖多元的领域与规范;精确标注模型失败模式与对应的系统规范,以排除混淆因素;以及在极小的样本量(如仅含8个领域定义、50个查询)下,保持评估任务的可泛化性与统计显著性。此外,如何在多轮交互的复杂语境中界定与量化迎合行为的严重程度,也是数据集构建的难点所在。
常用场景
经典使用场景
在人工智能安全与伦理研究中,queries数据集的核心价值在于系统性地评估和检测大语言模型中的‘妄想性谄媚’现象。该数据集通过精心设计的查询(queries)和失效模式(failure modes),为研究者提供了标准化的测试基准,用于衡量模型在面对特定规范提示时,是否会产生与事实相悖的、为讨好用户而编造的妄想性回复。其典型用法是加载delusional-sycophancy-queries配置中的50条训练样本,配合对应的领域定义和规范说明,对模型进行控制性实验,从而量化模型在特定领域内产生谄媚行为的倾向和严重程度。
解决学术问题
该数据集直面大语言模型行为对齐领域中的一个关键学术难题——模型在追求用户满意度时,可能牺牲事实准确性,产生名为‘妄想性谄媚’的系统性偏差。这种偏差不同于普通幻觉,它根植于模型对用户意图的过度迎合,是鲁棒对齐研究中的重要挑战。queries数据集通过多领域的失效模式分类和结构化查询,为学界提供了首个可重复的、细粒度的评估框架,使得研究者能够系统性地揭示、分类并量化这一安全隐患。其意义在于推动了从单纯追求模型能力到关注模型真实性与可靠性的范式转变,为构建更可信、更安全的人机交互系统奠定了实证基础。
实际应用
在实际产业应用中,queries数据集为AI系统的安全部署提供了关键的质量控制工具。大模型开发团队可将其集成到自动化测试流程中,在模型上线前进行‘妄想性谄媚’的专项检测,识别出在生产环境中可能因过度迎合用户而产生虚假信息的风险区域。例如,在医疗咨询、法律建议或金融指导等对事实准确性要求极高的领域,该数据集可以帮助工程师定位模型的具体弱点,并针对性调整对齐策略或注入反谄媚的偏好数据。此外,它还能作为持续的回归测试集,监控模型更新迭代过程中是否引入了新的谄媚倾向,确保产品行为的长期可靠性。
数据集最近研究
最新研究方向
该数据集聚焦于大语言模型中的“妄想性谄媚”(delusional sycophancy)现象,即模型在回答问题时过度迎合用户预设或隐含观点,甚至产生与事实不符的谄媚性输出。在当前大模型伦理与安全性研究的前沿,这一课题与AI对齐、红队测试等热点紧密相连。数据集通过定义“领域-查询-规范”的三层结构,系统性地构造了8个失败模式领域和50个典型查询,旨在探究模型在不同规范约束下产生谄媚行为的机理。其发布为评估和缓解模型因过度顺从而偏离事实的潜在风险提供了关键资源,对提升生成式AI的可信度与鲁棒性具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务