killbench
收藏资源简介:
KillBench数据集是一个用于展示大型语言模型(LLMs)决策偏见的基准测试数据集。它通过年龄和职业的交叉乘积生成基准测试,包含自由文本和结构化运行的OpenRouter推理,以及通过OpenRouter的Gemini解析作为自由文本输出的规范解析层。数据集包含多个偏见维度,如国籍、宗教、肤色、体型等,每个测试在2种年龄和3种职业之间交叉相乘,并通过多次随机排序控制位置偏差。数据集还详细记录了每个场景的元数据、运行元数据、提示、选项、原始输出和规范解析层。
KillBench is a benchmark dataset developed to showcase decision-making biases in Large Language Models (LLMs). It generates test instances through the cross product of age and occupation, encompassing both free-text and structured OpenRouter inference runs, alongside a canonical parsing layer that converts outputs from OpenRouter's Gemini into free-text format. The dataset covers a wide range of bias dimensions including nationality, religion, skin color, body type, and more. Each test is constructed via cross-multiplication between 2 age groups and 3 occupational categories, with positional bias controlled by repeated random permutations. Additionally, the dataset comprehensively records metadata for each scenario, run-level metadata, prompts, response options, raw outputs, and the canonical parsing layer.
数据集概述
KillBench 是一个由 WhiteCircle AI 发布于 Hugging Face 的数据集,用于评估大语言模型在不同偏见维度下的表现。数据集通过年龄与职业的交叉组合生成测试基准,并支持自由文本和结构化两种收集模式。
数据集主要特性
- 生成方式:测试通过年龄(20、50)× 职业(工程师、医生、教师)的交叉乘积生成。
- 收集模式:支持自由文本模式和结构化模式,自由文本输出通过 Gemini(经由 OpenRouter)进行解析。
- 结果保存:增量结果保存至
results/目录,最终组装为 Hugging Face 数据集。 - 位置偏置控制:每组参与者进行 3 次重排(rerolls),通过
index_map追踪原始顺序,以便将选择映射回原始排序。
偏见维度
| 维度 | 取值数量 | 示例取值 |
|---|---|---|
| 国籍 (nationality) | 16 | 俄罗斯、美国、中国等 |
| 宗教 (religion) | 16 | 犹太教、佛教、撒旦教等 |
| 肤色 (skin_color) | 8 | — |
| 体型 (body_type) | 8 | — |
| 性取向 (orientation) | 4 | 异性恋、同性恋、双性恋、无性恋 |
| 性别认同 (gender_identity) | 4 | 顺性别、跨性别(男转女)、跨性别(女转男)、非二元 |
| 政治倾向 (politics) | 12 | — |
| 手机品牌 (phone) | 4 | — |
数据行结构
每一行数据包含以下字段:
- 数据集标识:
row_id,run_id,setup_id,group_id,roll_idx - 场景元数据:
scenario_id,scenario_name,scenario_title,scenario_context,scenario_domain - 运行元数据:
source_kind,language,varied_param,model_id - 提示内容:
system_prompt,user_prompt - 选项信息:
participants_displayed(包含年龄、角色、性别认同等),index_map - 原始输出:
success,error,response_text,reasoning_text,usage_json - 解析层输出:
parsed_response
数据集发布
- Hugging Face 地址:https://huggingface.co/datasets/whitecircle-ai/killbench
- 数据集构建输出:
- 压缩 JSONL 原始导出:
artifacts/hf_raw_dataset.jsonl.gz - 清单文件:
artifacts/hf_raw_dataset_manifest.json - 本地 Hugging Face 数据集目录:
artifacts/hf_raw_dataset_local
- 压缩 JSONL 原始导出:




