遇见数据集

Eagle

收藏
arXiv2024-02-22 更新2024-06-21 收录
官方服务:

资源简介:

Eagle数据集是由MBZUAI创建的,旨在从实际的ChatGPT用户交互中提取包含社会偏见、观点偏见、有毒语言和道德问题的实例。该数据集包含2317个实例,每个实例都标记了相应的伦理问题类别。Eagle数据集的创建过程涉及从真实世界对话日志中提取数据,并通过GPT-3.5和GPT-4进行自动分类。该数据集的应用领域主要集中在评估和改进大型语言模型在处理实际用户交互中的伦理挑战,确保模型的安全性和伦理性。

The Eagle Dataset was developed by MBZUAI to extract instances involving social biases, viewpoint biases, toxic language, and ethical issues from real-world ChatGPT user interactions. This dataset contains 2,317 instances, each labeled with its corresponding ethical problem category. The creation process of the Eagle Dataset includes extracting data from real-world conversation logs and performing automatic classification using GPT-3.5 and GPT-4. The primary application areas of this dataset focus on evaluating and improving the ability of large language models to address ethical challenges in real-world user interactions, as well as ensuring the safety and ethical soundness of these models.

提供机构:
MBZUAI
创建时间:
2024-02-22
搜集汇总
数据集介绍
Eagle 数据集图片
构建方式
Eagle数据集的构建源于对ChatGPT与用户真实交互日志的深度挖掘。研究团队从ShareGPT数据集中提取了包含社会偏见、观点偏见、有毒语言及道德问题的对话实例,经过HTML标记去除、非英语对话过滤等预处理步骤后,采用GPT-3.5与GPT-4两级自动分类策略:首先利用成本较低的GPT-3.5对全部65,557段英语对话进行伦理与非伦理的二元筛选,随后由GPT-4对筛选出的4,060段非伦理对话进行细粒度标签划分,最终得到2,317段涵盖四类伦理问题的多标签实例,每段实例均包含对话上下文、系统输出及伦理类别标注。
特点
Eagle数据集的核心特质在于其真实性与复杂性。与现有通过模板或人工刻意构建的伦理数据集不同,Eagle源自用户实际使用场景,实例平均包含7.1轮对话、409.6个上下文词元及178.4个输出词元,长度与复杂度显著超越传统基准。数据集覆盖社会偏见(618例)、观点偏见(516例)、有毒语言(778例)及道德问题(1,142例)四类,允许单实例具有多重标签,并包含提示工程技巧(如越狱攻击)诱导的不道德输出,真实反映了LLM服务中的伦理挑战全貌。
使用方法
Eagle数据集支持两种核心应用范式。在评估层面,采用基于似然度的评分方法,通过计算目标LLM在给定对话上下文下生成输出文本的平均对数似然,量化模型产生不道德内容的倾向性。在缓解层面,研究者从数据集中随机抽取32例标注了伦理正确输出的实例,作为少样本学习的示范,通过向LLM提供包含上下文与正确输出的伦理范例,有效抑制不道德文本的生成。实验表明,相较于现有伦理数据集,Eagle在评估相关性及缓解效果上均展现出更优性能,为开发安全可靠的LLM提供了贴近真实交互场景的评测工具。
背景与挑战
背景概述
在大型语言模型(LLM)迅猛发展的浪潮中,其在实际应用中暴露出的伦理问题日益凸显,包括社会偏见、道德推理缺失以及生成冒犯性内容等。然而,现有伦理数据集多基于人工指令或模板构建,未能反映用户与LLM服务交互中的真实场景。为弥合这一鸿沟,Masahiro Kaneko、Danushka Bollegala与Timothy Baldwin于2024年提出了Eagle数据集,该数据集从ChatGPT与用户的真实对话日志中提取了2317个包含社会偏见、观点偏见、有毒语言及道德问题的实例。Eagle的诞生为评估和缓解LLM在真实世界中的伦理挑战提供了关键资源,其独创性在于捕捉了现有数据集无法覆盖的互补性伦理维度,推动了安全LLM的发展。
当前挑战
Eagle数据集所解决的领域挑战在于,现有伦理数据集因人工构造而缺乏真实性与多样性,无法有效评估LLM在用户实际需求场景中的伦理表现。例如,BBQ、ToxiGen等数据集与Eagle的Spearman秩相关系数极低(ρ<0.33),表明其不足以反映真实交互中的伦理问题。构建过程中,Eagle面临多重挑战:首先,从ShareGPT的90,665条对话中需通过GPT-3.5与GPT-4的两阶段自动分类筛选伦理实例,成本控制是关键——若直接对全部731,753条语句使用GPT-4,API费用约7200美元,而两阶段策略仅花费70美元;其次,需确保自动标注质量,人工评估显示各标签准确率均超80%,但多语言数据不足(如中文仅166条)限制了跨语言泛化能力。
常用场景
经典使用场景
在大型语言模型伦理安全评估的学术版图中,Eagle数据集以其独特的生态位脱颖而出。该数据集从ChatGPT与用户的真实交互日志中萃取而成,聚焦于社会偏见、观点偏差、有害语言与道德缺失四类伦理困境。与以往依赖人工编造或模板填充的伦理数据集不同,Eagle忠实地还原了日常使用场景中用户与模型之间自然涌现的伦理挑战,尤其涵盖越狱提示等复杂上下文。研究者可借助该数据集,通过似然度评分精准度量模型在真实对话中生成不当内容的倾向,从而为模型伦理安全提供更具生态效度的评估基准。
实际应用
在产业实践中,Eagle数据集为构建安全可信的对话式人工智能提供了关键工具。平台开发者可利用该数据集对模型进行上线前的伦理压力测试,模拟用户可能提出的敏感请求或越狱攻击,从而识别并修复潜在风险。该数据集还可用于微调或提示工程,通过注入真实伦理示例来引导模型生成更负责任的回复。鉴于其数据源自ChatGPT实际日志,Eagle特别适用于客服、教育、医疗等需要严格伦理规范的对话系统,帮助企业在合规与用户体验之间取得平衡,降低声誉与法律风险。
衍生相关工作
Eagle数据集的出现催生了多项前沿探索。在评测方法上,研究者基于其真实交互特性,发展了更精细的多标签伦理分类框架,将社会偏见、观点偏差等维度纳入统一评估体系。在缓解策略方面,相关工作探索了基于Eagle实例的上下文学习与偏好对齐技术,证明真实伦理示例比人工构造数据更有效地抑制模型不当生成。此外,Eagle启发了跨语言伦理数据集的构建尝试,尽管当前仅涵盖英语,但已为多语言场景下的伦理安全研究铺设了方法论基石。这些衍生工作共同推动了大语言模型伦理研究从实验室走向真实世界的进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务