FlexBench
收藏资源简介:
FlexBench 是一个用于评估政策变化下严格度自适应内容审核的基准数据集。每个样本标注有5级风险严重性标签(BENIGN / LOW / MODERATE / HIGH / EXTREME)。根据相关论文,通过设定严重性阈值,衍生出三个面向部署的二元分类任务——严格、中等和宽松。数据集包含两个互补的子集:Prompt(用户提示/指令的审核)和 Response(模型响应的审核)。两个子集共享相同的标签空间和评估协议,支持直接比较基于提示和基于响应的审核。数据集结构包括验证集和测试集,典型字段包括唯一标识符、来源数据集名称、粗略风险类别、待审核内容、严重性等级及其数值表示,以及根据不同严格度策略衍生的二元标签。数据集统计信息显示了各子集在不同风险严重性和类别下的样本分布。FlexBench 汇集并整理了多个公开数据集的内容,适用于文本分类任务,特别是内容安全审核领域。数据集遵循 Apache-2.0 许可,使用时需注意其包含的潜在有害内容并采取适当安全措施。
FlexBench is a benchmark dataset for evaluating strictness-adaptive content moderation under policy changes. Each sample is annotated with a 5-level risk severity label (BENIGN / LOW / MODERATE / HIGH / EXTREME). Based on relevant research, three deployment-oriented binary classification tasks—strict, moderate, and lenient—are derived by setting severity thresholds. The dataset comprises two complementary subsets: Prompt (moderation of user prompts/instructions) and Response (moderation of model responses). The two subsets share an identical label space and evaluation protocol, enabling direct comparisons between prompt-based and response-based moderation. The dataset structure includes a validation set and a test set, with typical fields covering unique identifiers, source dataset names, coarse-grained risk categories, content to be moderated, severity levels and their numerical representations, as well as binary labels derived from different strictness strategies. Dataset statistics present the sample distribution of each subset across various risk severities and categories. FlexBench compiles and curates content from multiple public datasets, and is applicable to text classification tasks, especially in the field of content safety moderation. The dataset is licensed under Apache-2.0, and users should note the potentially harmful content it contains and take appropriate safety measures when using it.
FlexBench 数据集概述
数据集基本信息
- 数据集名称:FlexBench
- 主要用途:评估策略变化下的严格度自适应内容审核
- 核心标签:5级风险严重性标签
- 任务类别:文本分类
- 许可证:Apache-2.0
- 语言:英语
数据集构成与结构
子集
数据集包含两个互补的子集:
- Prompt子集:针对用户提示/指令的审核。
- Response子集:针对模型响应的审核。 两个子集共享相同的标签空间和评估协议,支持基于提示和基于响应的审核之间的直接比较。
数据划分
valid验证集test测试集
训练集仅通过GitHub发布,未包含在此Hugging Face数据集仓库中。
数据字段
典型字段包括:
id:唯一样本标识符(字符串/整数)。注意:提示和响应的ID不共享。source:上游源数据集名称(字符串)category:粗略风险类别(字符串)input:待审核的内容(字符串)severity:严重性等级(字符串;取值为 {BENIGN, LOW, MODERATE, HIGH, EXTREME} 之一)severity_level:序数严重性级别(整数;0–4)label_strict:严格策略下的派生二元标签(整数 {0,1})label_moderate:中等策略下的派生二元标签(整数 {0,1})label_loose:宽松策略下的派生二元标签(整数 {0,1})
任务定义
主要任务:5级严重性分类
每个样本标注有离散的风险严重性等级:
- BENIGN:安全/无害内容
- LOW:低风险内容
- MODERATE:中等风险内容
- HIGH:高风险内容
- EXTREME:最高风险内容
严重性等级是FlexBench中的真实标签。
派生任务:严格度设置(二元分类)
通过将严重性阈值划分为有害与无害,定义了三个二元任务。严格度设置控制标记有害内容的积极程度:
- 严格:当且仅当
severity_level >= 1时,label_strict = 1 - 中等:当且仅当
severity_level >= 2时,label_moderate = 1 - 宽松:当且仅当
severity_level >= 3时,label_loose = 1
风险分类法
每个样本都标有一个粗略的类别标签:
SAFE(安全)VIO(暴力)ILG(非法/违法活动)SEX(性内容)INF(有害信息/不安全指令)DIS(歧视/仇恨/骚扰)MIS(虚假信息)JAIL(越狱/策略规避)
数据集统计信息
测试集(每个子集 n=2000)
| 字段 | Prompt | Response |
|---|---|---|
| 风险严重性 | ||
| 总计 | 2000 | 2000 |
| BENIGN | 1000 | 1000 |
| LOW | 250 | 250 |
| MODERATE | 250 | 250 |
| HIGH | 250 | 250 |
| EXTREME | 250 | 250 |
| 类别 | ||
| SAFE | 1000 | 1000 |
| VIO | 194 | 239 |
| ILG | 146 | 453 |
| SEX | 130 | 38 |
| INF | 61 | 77 |
| DIS | 282 | 211 |
| MIS | 62 | 93 |
| JAIL | 130 | 5 |
| 数据来源 | ||
| Aegis2.0 | 286 | 63 |
| XSTest | 83 | 259 |
| BeaverTails | 0 | 370 |
| HarmBench | 0 | 84 |
| OpenAI | 497 | 0 |
| SafeRLHF | 0 | 894 |
| ToxicChat | 769 | 0 |
| WildGuard | 365 | 330 |
验证集(每个子集 n=400)
- prompt: 400
- response: 400 严重性分布(验证集;每个子集):
- BENIGN: 200
- LOW: 50
- MODERATE: 50
- HIGH: 50
- EXTREME: 50
数据来源
FlexBench汇总并整理了来自先前公共数据集/来源的样本,包括(非详尽列表):
- Aegis2.0
- XSTest
- BeaverTails
- HarmBench
- OpenAI(子集)
- SafeRLHF
- ToxicChat
- WildGuard
评估协议
FlexBench支持:
- 严格度机制下的二元分类(派生任务) 常用指标:
- 二元任务:AUROC、AUPRC、F1,以及操作点TPR/FPR(取决于部署)
伦理考虑
该数据集包含潜在有害内容(例如暴力、非法指令、性内容、仇恨/歧视、虚假信息、越狱提示)。在使用或分发基于FlexBench训练/评估的模型时,请遵循适当的安全实践和访问控制。
引用
如果使用此数据集,请引用随附的论文: bibtex @misc{ding2026flexguardcontinuousriskscoring, title={FlexGuard: Continuous Risk Scoring for Strictness-Adaptive LLM Content Moderation}, author={Zhihao Ding and Jinming Li and Ze Lu and Jieming Shi}, year={2026}, eprint={2602.23636}, archivePrefix={arXiv}, primaryClass={cs.LG}, url={https://arxiv.org/abs/2602.23636}, }



