遇见数据集

OFA-Sys/OccuQuest

收藏
Hugging Face2023-10-26 更新2024-03-04 收录
官方服务:

资源简介:

OccuQuest是一个旨在减少大型语言模型中职业偏见的数据集,包含超过110,000个提示-完成对和30,000多个对话,覆盖26个职业类别中的1,000多种职业。该数据集通过系统地请求ChatGPT,基于职业、责任、主题和问题层次化组织查询,确保全面覆盖职业专业查询。与常用的数据集(如Dolly、ShareGPT和WizardLM)相比,OccuQuest在职业分布上更为均衡。此外,数据集还包括三个测试集,用于全面评估模型性能。通过微调LLaMA模型,得到的OccuLLaMA在专业问题上显著优于现有的LLaMA变体。数据集和模型均已公开发布。

OccuQuest is a dataset aimed at mitigating occupational bias in large language models. It contains over 110,000 prompt-completion pairs and more than 30,000 dialogues, covering over 1,000 occupations across 26 occupational categories. The dataset systematically queries ChatGPT by hierarchically structuring queries based on occupation, responsibilities, topics and question levels, ensuring comprehensive coverage of professional occupational inquiries. Compared with commonly used datasets such as Dolly, ShareGPT and WizardLM, OccuQuest features a more balanced occupational distribution. In addition, the dataset includes three test sets for thorough evaluation of model performance. After fine-tuning the LLaMA model, the resulting OccuLLaMA significantly outperforms existing LLaMA variants on professional questions. Both the dataset and the model have been publicly released.

提供机构:
OFA-Sys
原始信息汇总

数据集概述

名称: OccuQuest: Mitigating Occupational Bias for Inclusive Large Language Models

目的: 该数据集旨在减轻职业偏见,促进大型语言模型的包容性。

搜集汇总
数据集介绍
OFA-Sys/OccuQuest 数据集图片
构建方式
在大型语言模型指令微调数据集中,职业偏见的普遍存在限制了模型对特定领域专业问题的应答能力。为构建包容性更强的训练数据,OccuQuest数据集应运而生,其构建过程系统性地利用了ChatGPT的生成能力。研究者依据职业类别、职责范围、话题领域及问题层级四维结构,对职业专业查询进行层次化组织,最终收集了超过11万条提示-回答对及3万条多轮对话,覆盖26个职业类别中的1000余种职业,确保了数据在职业分布上的均衡性。
特点
OccuQuest数据集的核心特色在于其显著缓解了传统指令微调数据集中常见的职业分布不均问题。与Dolly、ShareGPT及WizardLM等主流数据集相比,OccuQuest在各职业类别上展现出更为平衡的数据分布,有效降低了模型对高频职业的过度拟合。此外,该数据集还配套构建了三个专项测试集,包括覆盖25个职业类别的occu-test集、聚焦房地产领域的estate集,以及源自Quora真实问题的occu-quora集,为评估模型职业能力提供了多维度基准。
使用方法
使用者可通过HuggingFace平台直接加载OccuQuest数据集,其包含train、dialog、validation、test、estate及quora六个子集,分别对应训练、对话、验证及不同测试场景。该数据集支持标准的指令微调流程,研究者可将其与Tulu等其他指令数据集混合使用,以提升模型在职业问答任务上的综合表现。基于OccuQuest微调的OccuLLaMA模型在GPT-4及人工评估中显著优于现有LLaMA变体,在occu-quora测试集上对WizardLM的胜率高达86.4%,展现了其在缓解职业偏见与增强专业应答能力方面的卓越效果。
背景与挑战
背景概述
随着大规模语言模型(LLMs)在自然语言处理任务中的广泛应用,指令微调数据集的质量与多样性成为决定模型泛化能力的关键因素。然而,现有数据集普遍存在职业偏见问题,即大部分训练数据仅覆盖少数热门职业,导致模型在面对特定领域从业者的专业查询时难以生成准确且有用的回复。为填补这一空白,Mingfeng Xue等人于2023年提出了OccuQuest数据集,由阿里巴巴集团的研究团队主导构建。该数据集包含超过11万条提示-完成对及3万余条多轮对话,系统性地覆盖了26个职业类别下的1000余种职业,通过分层查询结构(职业、职责、主题、问题)确保对专业领域的全面覆盖。OccuQuest的发布不仅为职业包容性LLMs的研究提供了关键资源,还推动了如ProLLaMA等高性能模型的诞生,在MMLU、GSM8K等综合评测中展现出卓越表现,对缓解LLMs的职业偏见具有里程碑式的意义。
当前挑战
OccuQuest所解决的核心挑战在于LLMs在职业领域中的偏见问题——现有指令微调数据集多集中于少数高曝光职业,导致模型对医生、程序员等常见职业的响应质量较高,而对房地产经纪人、园艺师等冷门职业的查询表现欠佳,这种不平衡严重限制了LLMs在真实世界多职业场景中的实用价值。在数据集构建过程中,研究团队面临两大技术挑战:其一,如何设计高效的查询生成策略以覆盖广泛且稀疏的职业分布,最终采用基于ChatGPT的系统性分层查询方法,从职业类别到具体问题逐级细化;其二,如何确保生成数据的质量与多样性,团队通过引入多轮对话格式并设置occupation、topic等多维标签来增强数据结构性。此外,构建专门的评估集(如occu-test、estate、occu-quora)以验证模型在不同职业上的泛化能力,也成为验证数据集有效性的重要挑战。
常用场景
经典使用场景
OccuQuest数据集的核心应用在于对大型语言模型进行指令微调,以缓解其固有的职业偏见。该数据集通过系统性地构建涵盖26个职业类别、超过1000种具体职业的层次化查询结构,包含11万余条提示-完成对和3万余条多轮对话,为模型提供了丰富且均衡的专业领域训练样本。研究者通常利用该数据集对基础模型进行微调,从而提升模型在应对不同职业领域专业问题时的响应质量与包容性。
衍生相关工作
基于OccuQuest,研究者衍生出多项经典工作:首先是通过微调LLaMA模型获得的OccuLLaMA,其在专业问题回答上显著优于Vicuna、Tulu等同期变体;其次提出了ProLLaMA模型,通过将OccuQuest与Tulu数据集混合训练,实现了在MMLU、GSM8K等综合基准测试上的最优性能。这些工作不仅验证了职业均衡数据在提升模型专业能力方面的有效性,还开创了领域专用数据与通用数据协同训练的新范式,为后续研究提供了可复现的基准模型与训练策略。
数据集最近研究
最新研究方向
当前,大型语言模型的指令微调数据集普遍存在职业偏见问题,导致模型对特定领域专业问题的响应能力不足。OccuQuest数据集应运而生,其涵盖超过1000种职业的11万条提示-回答对及3万段对话,通过分层查询策略系统性地覆盖职业、职责、主题与问题维度,显著提升了数据分布的均衡性。前沿研究聚焦于利用该数据集微调模型以消解职业偏见,例如OccuLLaMA在专业问答任务中表现卓越,在Quora真实场景下对WizardLM的胜率高达86.4%。进一步地,将OccuQuest与其他数据集混合微调得到的ProLLaMA,不仅在职业问题上表现优异,还在MMLU、GSM8K等综合评估中取得领先成绩,其中7B模型在GSM8K上较同类变体提升超4个百分点。这一工作为构建更具包容性的语言模型提供了关键数据基础,推动了AI在多元职业场景中的公平应用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务