OffTopicEval
收藏资源简介:
OffTopicEval是一个用于评估基于LLM的代理操作安全性的多语言基准数据集。操作安全性指接受领域内查询和拒绝领域外查询的能力。数据集包含21个代理的220K测试样本,涵盖领域内查询、直接领域外查询和自适应领域外查询,支持英语、中文和印地语三种语言。
OffTopicEval is a multilingual benchmark dataset developed to assess the operational safety of LLM-based AI agents. Operational safety refers to the capability of accepting in-domain queries and rejecting out-of-domain queries. The dataset comprises 220,000 test samples across 21 agents, covering three categories of queries: in-domain queries, direct out-of-domain queries and adaptive out-of-domain queries, and supports three languages: English, Chinese and Hindi.
OffTopicEval 数据集概述
数据集简介
OffTopicEval 是一个多语言基准数据集,专门用于评估基于大语言模型的智能体的操作安全性。
核心概念
- 操作安全性:智能体接受领域内查询并拒绝领域外查询的能力
- 主要挑战:即使是性能最佳的大语言模型也难以应对自适应领域外查询
数据规模
- 测试样本总量:220,000个
- 覆盖语言:英语、中文、印地语
- 评估对象:21个智能体
数据构成
领域内查询
- 每个智能体50个查询 × 3种语言 = 150个
- 总计:3,150个查询
- 生成方式:由ChatGPT-5生成,经过人工验证
领域外查询
直接领域外查询
- 来源:过滤后的MMLU数据集
- 数量:约3,351个 × 3种语言 = 10,053个
自适应领域外查询
- 生成方式:通过对抗性转换生成
- 数量:211,113个样本
- 转换方法:使用Llama-70B进行提示清洗
多语言支持
- 基于Global-MMLU进行翻译
- 支持中文和印地语版本
评估指标
- AR<sub>ID</sub>:领域内接受率
- RR<sub>OOD</sub><sup>D</sup>:直接领域外拒绝率
- RR<sub>OOD</sub><sup>A</sup>:自适应领域外拒绝率
- OS:AR<sub>ID</sub>和RR<sub>OOD</sub>的调和平均数
实验范围
开源模型(20个)
- GPT-OSS、Llama-3、Gemma-3、Qwen-3、Mistral、Phi等系列模型
闭源模型(6个)
- GPT-5、GPT-4o-mini
- Claude 4.1、Claude 3.5 Haiku
- Gemini Pro、Gemini Flash-Lite
引用信息
bibtex @article{lei2025offtopiceval, title={OffTopicEval: When Large Language Models Enter the Wrong Chat, Almost Always!}, author={Lei, Jingdi and Gumma, Varun and Bhardwaj, Rishabh and Lim, Seok Min and Li, Chuan and Zadeh, Amir and Poria, Soujanya}, year={2025}, journal={arXiv preprint arXiv:2509.26495}, url={https://arxiv.org/abs/2509.26495} }




