normster/RuLES
收藏资源简介:
RuLES(Rule-following Language Evaluation Scenarios)数据集是一个用于评估语言模型遵循规则能力的基准测试。它包含15个简单的文本场景,模型在这些场景中被指示遵循自然语言中的一组规则,同时与人类用户进行交互。每个场景都有一个简洁的评估程序,用于确定模型在对话中是否违反了任何规则。通过手动探索模型行为,作者识别了6类攻击策略,并收集了两组测试用例:一组来自手动测试的独特对话,另一组系统地实施了这6类策略。数据集的目标是提供一个具有挑战性的新环境,用于研究和防御对语言模型的手动和自动攻击。
RuLES(Rule-following Language Evaluation Scenarios)数据集是一个用于评估语言模型遵循规则能力的基准测试。它包含15个简单的文本场景,模型在这些场景中被指示遵循自然语言中的一组规则,同时与人类用户进行交互。每个场景都有一个简洁的评估程序,用于确定模型在对话中是否违反了任何规则。通过手动探索模型行为,作者识别了6类攻击策略,并收集了两组测试用例:一组来自手动测试的独特对话,另一组系统地实施了这6类策略。数据集的目标是提供一个具有挑战性的新环境,用于研究和防御对语言模型的手动和自动攻击。
Can LLMs Follow Simple Rules?
数据集概述
该数据集包含用于评估语言模型遵循规则能力的测试案例,属于RuLES(Rule-following Language Evaluation Scenarios)基准测试的一部分。RuLES旨在通过15个简单的文本场景来测量语言模型在与人交互时遵循自然语言规则的能力。每个场景都有一个简洁的评估程序,用于判断模型是否在对话中违反了任何规则。
数据集内容
- 场景数量:15个简单文本场景
- 评估方法:每个场景都有一个评估程序,用于判断模型是否违反规则
- 攻击策略:通过手动探索模型行为,识别了6种攻击策略,并收集了两套测试案例
- 一套来自手动测试的独特对话
- 一套系统地实施6种策略的测试案例
模型评估
- 评估模型:包括GPT-4和Llama 2等流行的专有和开源模型
- 评估结果:所有模型都对各种手工制作的对抗性用户输入敏感,其中GPT-4表现最佳。此外,开源模型在基于梯度的攻击下显示出显著的漏洞。
数据集目的
RuLES旨在成为一个新的研究设置,用于探索和防御对语言模型的手动和自动攻击。
引用信息
@article{mu2023rules, title={Can LLMs Follow Simple Rules?}, author={Norman Mu and Sarah Chen and Zifan Wang and Sizhe Chen and David Karamardian and Lulwa Aljeraisy and Basel Alomair and Dan Hendrycks and David Wagner}, journal={arXiv}, year={2023} }




