遇见数据集

camilablank/sycophancy-datasets

收藏
Hugging Face2026-03-19 更新2026-03-29 收录
官方服务:

资源简介:

# Sycophancy Evaluation Datasets Datasets for training and evaluating sycophancy probes and model behavior under user pushback. ## Datasets ### MMLU (Multiple-Choice) | File | Description | Format | |------|-------------|--------| | `mmlu_rated_500.jsonl` | 500 2-turn MMLU conversations with sycophancy ratings | 2-turn: Q→A, "That's wrong!"→A' | (subset of mmlu_rated.jsonl) | `mmlu_rated.jsonl` | Full 2-turn MMLU with sycophancy ratings | Same structure | | `mmlu_turn3_rated.jsonl` | 3-turn MMLU with double pushback | 3-turn: Q→A, challenge→A', challenge→A'' | | `mmlu_single_turn.jsonl` | Single-turn: user states belief + asks "Do you agree?" | yes/no sycophancy | | `mmlu_reiterated_turn2.jsonl` | 2-turn with reiterated question in challenge | Challenge restates the original question | ### TriviaQA | File | Description | |------|-------------| | `triviaqa_rated.jsonl` | Open-ended trivia with "That's wrong!" pushback, sycophancy labels | ### Political Opinions | File | Description | |------|-------------| | `political_opinions_turn2_response_restate.jsonl` | Open-ended opinion questions with "Restate your opinion" pushback (Stanford professor) | ## Probe Training Data Usage The scripts in `probes/training/` use the following data and splits (seed=42): | Script | Dataset | Task | Split | |--------|---------|------|-------| | `train_probes.py` | `mmlu_rated.jsonl` | Truth probe (single-turn correctness) | 60% train, 20% val, 20% test | | `train_probes_diffmeans.py` | `mmlu_rated.jsonl` | Diff-means truth probe (single-turn correctness) | 60% train, 20% val, 20% test | | `train_sycophancy_probes.py` | `mmlu_rated.jsonl` | Linear sycophancy probe (2-turn) | 60% train, 20% val, 20% test | | `train_sycophancy_probes_3turn.py` | `mmlu_turn3_rated.jsonl` | Linear sycophancy probe (3-turn) | 60% train, 20% val, 20% test | **Split details:** All splits are computed in-memory at training time (not pre-saved). Uses `np.random.RandomState(42)` for reproducibility. Splits are balanced per class (correct/incorrect or sycophantic/not-sycophantic). ## Data Format The datasets are stripped of fields not used in training/eval (e.g. `confidence_*`, `metadata`, `extracted_*`, `result_*`). Run `scripts/prepare_hf_datasets.py` to regenerate stripped copies before upload. Each JSONL line is a JSON object with: - `id`: sample identifier - `history`: list of `{user, bot}` turn dicts - `sycophancy_rating` or `sycophancy_label`: 1/2 or "maintained_correct"/"sycophantic_flip" - Additional fields: `expected_answer`, `confidence_*`, `extracted_t1`, `extracted_t2`, etc.

# 奉承倾向评估数据集(Sycophancy Evaluation Datasets) 用于训练和评估奉承倾向探测(sycophancy probes)模型,以及分析用户反驳场景下的模型行为。 ## 数据集 ### MMLU(多项选择题型) | 文件名 | 描述 | 格式 | |------|-------------|--------| | `mmlu_rated_500.jsonl` | 包含500条带奉承倾向评分的2轮MMLU对话 | 2轮对话格式:提问→回答,“这不对!”→修正回答,为`mmlu_rated.jsonl`的子集 | | `mmlu_rated.jsonl` | 包含全部带奉承倾向评分的2轮MMLU对话 | 格式与上述一致 | | `mmlu_turn3_rated.jsonl` | 包含带双重反驳的3轮MMLU对话 | 3轮对话格式:提问→回答,质疑→修正回答,再次质疑→再次修正回答 | | `mmlu_single_turn.jsonl` | 单轮对话:用户陈述自身观点并询问“你是否同意?” | 用于评估是/否类奉承倾向 | | `mmlu_reiterated_turn2.jsonl` | 2轮对话,反驳环节重述原始问题 | 即质疑环节会复述初始提问内容 | ### TriviaQA | 文件名 | 描述 | |------|-------------| | `triviaqa_rated.jsonl` | 包含开放式琐事问答任务,搭配“这不对!”的反驳话术,附带奉承倾向标签 | ### 政治观点类数据集 | 文件名 | 描述 | |------|-------------| | `political_opinions_turn2_response_restate.jsonl` | 包含开放式观点问答任务,搭配“重申你的观点”的反驳话术(源自斯坦福大学教授设计) | ## 探测模型训练数据使用说明 `probes/training/` 目录下的脚本使用以下数据与划分规则(随机种子设为42): | 脚本名 | 所用数据集 | 任务类型 | 数据划分比例 | |--------|---------|------|-------| | `train_probes.py` | `mmlu_rated.jsonl` | 事实探测(单轮正确性判断) | 60%训练集,20%验证集,20%测试集 | | `train_probes_diffmeans.py` | `mmlu_rated.jsonl` | 差分均值事实探测(单轮正确性判断) | 60%训练集,20%验证集,20%测试集 | | `train_sycophancy_probes.py` | `mmlu_rated.jsonl` | 线性奉承倾向探测(2轮对话场景) | 60%训练集,20%验证集,20%测试集 | | `train_sycophancy_probes_3turn.py` | `mmlu_turn3_rated.jsonl` | 线性奉承倾向探测(3轮对话场景) | 60%训练集,20%验证集,20%测试集 | **划分细节**:所有数据划分均在训练时于内存中完成(未提前保存),使用`np.random.RandomState(42)`确保结果可复现。划分会按类别(正确/错误或奉承倾向/非奉承倾向)保持样本平衡。 ## 数据格式规范 本数据集已移除训练与评估流程中未使用的字段(如`confidence_*`、`metadata`、`extracted_*`、`result_*`等)。上传前可运行`scripts/prepare_hf_datasets.py`脚本重新生成精简后的数据集副本。 每条JSONL文件中的行均为一个JSON对象,包含以下字段: - `id`:样本唯一标识符 - `history`:包含`{user, bot}`轮次字典的对话历史列表 - `sycophancy_rating`或`sycophancy_label`:取值为1/2或`maintained_correct`(保持正确回答)/`sycophantic_flip`(奉承式反转回答) - 额外可选字段:`expected_answer`、`confidence_*`、`extracted_t1`、`extracted_t2`等。

提供机构:
camilablank
二维码
社区交流群
二维码
科研交流群
商业服务