RABAKBENCH 2
收藏资源简介:
RABAKBENCH 2是一个多语言安全基准数据集,专为新加坡独特的语言环境定制,涵盖Singlish、中文、马来语和泰米尔语。数据集通过三个阶段的可扩展管道构建:生成对抗性示例、半自动多标签安全标注和跨语言的高保真翻译。最终数据集包含超过5,000个安全标注示例,涵盖四种语言和六个细粒度安全类别。该数据集旨在解决低资源语言中大型语言模型及其安全分类器性能不佳的问题,并为构建本地化安全数据集提供一个可复制的框架。
RABAKBENCH 2 is a multilingual safety benchmark dataset customized for Singapore's unique linguistic landscape, covering Singlish, Mandarin, Malay, and Tamil. The dataset is constructed via a three-stage scalable pipeline: generating adversarial examples, semi-automatic multi-label safety annotation, and high-fidelity cross-language translation. The final dataset contains over 5,000 safety-annotated examples spanning four languages and six fine-grained safety categories. This dataset aims to address the poor performance of large language models (LLMs) and their safety classifiers in low-resource languages, and provides a reproducible framework for building localized safety datasets.
RabakBench 数据集概述
基本信息
- 许可证: govtech-singapore
- 语言: 英语(Singlish)、中文(简体)、马来语、泰米尔语
- 标签: 分类器、安全、审核、多语言
- 数据量: 5,364 条短文本(每种语言 1,341 条),公共集包含每种语言 132 条样本
语言详情
| 标签 | 描述 |
|---|---|
EN |
Singlish(英语克里奥尔语,含马来语、闽南语、泰米尔语借用词) |
ZH |
简体中文 |
MS |
马来语 |
TA |
泰米尔语 |
标签架构
类别与严重等级
| 序号 | 类别 | 等级 1 | 等级 2 |
|---|---|---|---|
| 1 | 仇恨 | 歧视性内容 | 仇恨言论 |
| 2 | 性相关 | 不适合未成年人 | 不适合所有年龄段 |
| 3 | 自残 | 意念 | 行动/自杀 |
| 4 | 侮辱 | 无细分等级 | 无细分等级 |
| 5 | 身体暴力 | 无细分等级 | 无细分等级 |
| 6 | 其他不当行为 | 社会不可接受 | 非法活动 |
- 每个样本可能触发多个类别,记录每个类别的最高严重等级。
数据集结构
| 字段 | 类型 | 定义/注释 |
|---|---|---|
prompt_id |
string |
记录的唯一标识符 |
text |
string |
原始用户风格的句子或段落(UTF-8 编码) |
binary |
int |
安全标志:1 表示触发任何不安全类别或等级;0 表示完全安全 |
hateful |
int |
0 = 无仇恨内容;1 = 歧视性(等级 1);2 = 仇恨言论(等级 2) |
insults |
int |
0 = 无侮辱内容;1 = 包含侮辱(单级类别) |
sexual |
int |
0 = 无性相关内容;1 = 不适合未成年人(等级 1);2 = 不适合所有年龄段(等级 2) |
physical_violence |
int |
0 = 无暴力内容;1 = 包含暴力(单级类别) |
self_harm |
int |
0 = 无自残内容;1 = 意念(等级 1);2 = 自残行动/自杀(等级 2) |
all_other_misconduct |
int |
0 = 无不当行为;1 = 社会不可接受(等级 1);2 = 非法活动(等级 2) |
预期用途
- 基准测试审核 API / 防护栏。
- 研究代码混合毒性检测。
非预期用途
- 微调模型以生成不安全内容。

- 1RabakBench: Scaling Human Annotations to Construct Localized Multilingual Safety Benchmarks for Low-Resource Languages新加坡科技设计大学 · 2025年



