Sycophancy-Repair-Guide
收藏资源简介:
该数据集名为“基于框架的AI讨好行为修复指南”,是一个专注于AI安全领域的文本分类数据集,旨在为AI对话中的讨好行为提供后处理修复方案。作为“AI对话讨好行为检测框架”的配套工具,其核心目标是通过分层扫描和修正AI生成的回答,在不修改底层模型的条件下,降低检测框架中定义的讨好行为得分,包括零分禁环(主干层面的行为越界,如无错道歉、虚构立场)和一级词包(修饰语层面的社交冗余)。数据集由五份独立文档构成,内容涵盖双模式分流与场景识别、缩句分层法、事实与观点分叉规则、安抚模式下的原话反射规则以及后处理流程与验证指南,提供了从脆弱信号词表、触发规则到流水线落地步骤的完整修复逻辑。数据集规模较小(样本数少于1000),以中文文本形式呈现,适用于AI安全研究、语用学分析、后处理技术基准测试等场景,帮助开发者识别和修复AI输出中的讨好倾向,提升对话系统的中立性和可靠性。使用前建议结合检测框架进行双轨审计以验证修复效果。
This dataset, named Framework-based AI Pleasing Behavior Repair Guide, is a text classification dataset focused on the field of AI safety, aiming to provide post-processing repair solutions for pleasing behaviors in AI dialogues. As a companion tool to the AI Dialogue Pleasing Behavior Detection Framework, its core objective is to reduce the scores of pleasing behaviors defined in the detection framework through hierarchical scanning and correction of AI-generated responses, without modifying the underlying model, including zero-score forbidden loops (behavioral overreach at the backbone level, such as unwarranted apologies or fabricated stances) and first-level word packages (social redundancy at the modifier level). The dataset consists of five independent documents covering dual-mode diversion and scenario recognition, sentence reduction layering method, fact and opinion branching rules, original speech reflection rules in appeasement mode, and post-processing workflow with validation guidelines, providing a complete repair logic from vulnerable signal word lists and trigger rules to pipeline implementation steps. The dataset is small in scale (with fewer than 1000 samples), presented in Chinese text form, and suitable for scenarios such as AI safety research, pragmatic analysis, and post-processing technology benchmarking, helping developers identify and repair pleasing tendencies in AI outputs to enhance the neutrality and reliability of dialogue systems. It is recommended to combine it with the detection framework for dual-track auditing to verify repair effectiveness before use.
数据集概述
数据集名称:基于框架的AI讨好行为修复指南
许可证:MIT
任务类别:文本分类
语言:中文
数据规模:n < 1K(少于1000条数据)
标签:AI安全、讨好行为、语用学、基准测试、事后修复、修复、开源
核心说明
该数据集是《AI对话讨好行为检测框架》的配套修复方案,用于对AI对话中的讨好行为进行后处理修正。修复方案不修改模型本身,而是通过后处理流水线对AI生成回答进行分层扫描和修正,降低讨好得分。
核心思路
AI讨好行为被分为两类:
- 零分禁环:主干层面的行为越界
- 一级词包:修饰语层面的社交冗余
修复方案采用后处理流水线,对AI生成的回答进行分层扫描和修正。
项目结构
修复指南包含五份独立文档,按推荐阅读顺序排列:
| 文档 | 内容 |
|---|---|
| 01-双模式分流与场景识别 | 脆弱信号词表、触发规则、安抚模式与专业模式的判定逻辑 |
| 02-缩句分层法 | 主干与修饰语的区分标准、分层扫描操作步骤 |
| 03-事实与观点分叉规则 | 客观事实与主观观点的判定标准、“我认为”类表述的处理逻辑 |
| 04-安抚模式下的原话反射规则 | 禁环12防护、虚构立场判定、强制重写规则、不作为防护 |
| 05-后处理流程与验证指南 | 流水线落地步骤、环境依赖、推荐工具、修复效果验证方法 |
快速使用流程
- 阅读
01-双模式分流与场景识别,了解场景切换逻辑。 - 阅读
02-缩句分层法,掌握核心算法。 - 阅读
05-后处理流程与验证指南,搭建后处理流水线。 - 用框架跑一遍修复前后的双轨审计,对比防线崩塌率和语用污染度的变化。
与检测框架的关系
修复方案覆盖检测框架的以下评测维度:
- 零分禁环:通过主干扫描和强制重写拦截无错道歉、虚构立场、诊断重构等行为。
- 一级词包:通过修饰语裁剪降低社交冗余表达。
- 高危标记:通过原话反射规则和不作为防护拦截虚构立场高危和不作为高危。
使用声明
本修复方案采用后处理方式影响AI输出。修复效果取决于缩句工具的准确度和场景识别的召回率。建议在部署前先用框架对修复前后的输出做双轨审计对比。




