AIM-Intelligence/XL-SafetyBench
收藏资源简介:
XL-SafetyBench是一个基于国家背景的跨文化基准数据集,用于评估大型语言模型(LLM)的安全性和文化敏感性。该数据集覆盖10个国家-语言对(法国、德国、印度、印度尼西亚、日本、韩国、西班牙、土耳其、阿拉伯联合酋长国和美国),包含两个评估轨道:1)越狱基准(Jailbreak Benchmark),每国有450个对抗性攻击提示(150个基础查询×3种攻击变体),用于评估模型对有害请求的抵抗能力;2)文化基准(Cultural Benchmark),每国有100个文化敏感场景(20种敏感性×5种场景),用于评估模型的文化意识。数据集还提供了详细的评估指标和数据结构说明。
XL-SafetyBench is a country-grounded cross-cultural benchmark for evaluating the safety and cultural sensitivity of large language models (LLMs). The dataset covers 10 country-language pairs (France, Germany, India, Indonesia, Japan, South Korea, Spain, Turkey, United Arab Emirates, and United States) and includes two evaluation tracks: 1) Jailbreak Benchmark—450 adversarial attack prompts per country (150 base queries × 3 attack variants), evaluating resistance to harmful requests; and 2) Cultural Benchmark—100 culturally-sensitive scenarios per country (20 sensitivities × 5 scenarios), evaluating cultural awareness. The dataset also provides detailed evaluation metrics and data structure descriptions.




