遇见数据集

bitext/Bitext-retail-banking-llm-chatbot-training-dataset

收藏
Hugging Face2024-07-15 更新2024-06-12 收录
官方服务:

资源简介:

该数据集专为训练大型语言模型(如GPT、Llama3和Mistral)而设计,特别针对零售银行业务的微调和领域适应。它包含25545个问答对,涉及26种意图,分配给9个类别,并涵盖1224种实体/槽类型和12种语言生成标签。数据集包含4.98百万个令牌,用于训练能够执行对话AI、问答和银行领域虚拟助手任务的复杂LLM。每个数据集条目包括标签、用户请求、意图的高级语义类别、特定意图以及虚拟助手的预期响应。此外,数据集还包括各种语言变体和风格的标签,以增强模型的鲁棒性和多功能性,确保模型能够理解和生成适合零售银行业务不同客户交互的各种会话风格。

该数据集专为训练大型语言模型(如GPT、Llama3和Mistral)而设计,特别针对零售银行业务的微调和领域适应。它包含25545个问答对,涉及26种意图,分配给9个类别,并涵盖1224种实体/槽类型和12种语言生成标签。数据集包含4.98百万个令牌,用于训练能够执行对话AI、问答和银行领域虚拟助手任务的复杂LLM。每个数据集条目包括标签、用户请求、意图的高级语义类别、特定意图以及虚拟助手的预期响应。此外,数据集还包括各种语言变体和风格的标签,以增强模型的鲁棒性和多功能性,确保模型能够理解和生成适合零售银行业务不同客户交互的各种会话风格。

提供机构:
bitext
原始信息汇总

数据集概述

名称: Bitext - Retail Banking Tagged Training Dataset for LLM-based Virtual Assistants

目的: 用于训练大型语言模型(如GPT、Llama3、Mistral),专注于零售银行业务的微调和领域适应。

规格:

  • 使用案例: 意图检测
  • 垂直领域: 零售银行
  • 意图和类别: 26个意图,分配给9个类别
  • 数据量: 25545个问答对,约1000个问答对/意图
  • 实体/槽类型: 1224种
  • 语言生成标签类型: 12种

数据集大小: 包含4.98百万个token,分布在instruction和response列中。

数据集字段

  • flags: 标签
  • instruction: 来自零售银行领域的用户请求
  • category: 意图的高级语义类别
  • intent: 对应于用户指令的具体意图
  • response: 虚拟助手预期响应的示例

类别和意图

  • ACCOUNT: 检查最近交易, 关闭账户, 创建账户
  • ATM: 争议ATM取款, 恢复吞卡
  • CARD: 激活卡, 激活国际使用卡, 阻止卡, 取消卡, 检查卡年费, 检查当前卡余额
  • CONTACT: 客户服务, 人工代理
  • FEES: 检查费用
  • FIND: 查找ATM, 查找分行
  • LOAN: 申请贷款, 申请抵押, 取消贷款, 取消抵押, 检查贷款付款, 检查抵押付款
  • PASSWORD: 获取密码, 设置密码
  • TRANSFER: 取消转账, 进行转账

实体

  • {{Full Name}}
  • {{Banking App}}
  • {{Account Number}}
  • {{Customer Support Working Hours}}
  • {{Customer Support Team}}
  • {{Company Website URL}}
  • {{Customer Support}}
  • {{Customer Support Email}}
  • {{Mortgage Account Number}}
  • {{Mortgage Account}}
  • {{Billing}}
  • {{Username}}
  • {{Customer Support Phone Number}}
  • {{Live Chat}}
  • {{Company Website}}
  • {{Mortgage Department}}
  • {{Account}}
  • {{Name}}
  • {{Bank Name}}
  • {{Password}}
  • {{Customer Support Email Address}}
  • {{Customer Service Email Address}}
  • {{Email Address}}
  • {{Profile}}
  • {{Customer Service Working Hours}}
  • {{Credit Card}}
  • {{Bank App}}
  • {{Loan Account Number}}
  • {{Account Settings}}

语言生成标签

  • M - Morphological variation
  • L - Semantic variations
  • B - Basic syntactic structure
  • I - Interrogative structure
  • C - Coordinated syntactic structure
  • N - Negation
  • P - Politeness variation
  • Q - Colloquial variation
  • W - Offensive language
  • K - Keyword mode
  • E - Use of abbreviations
  • Z - Errors and Typos

许可证

许可证: Community Data License Agreement (CDLA) Sharing 1.0

关键条款:

  • 归属和共享: 用户必须归属数据集并继续以相同许可证共享衍生作品。
  • 非独占性: 许可证是非独占的,允许多个用户同时使用数据。
  • 不可撤销性: 除非严重不遵守,否则此许可证下的权利是不可撤销的。
  • 无保证: 数据集按原样提供,不保证其准确性、完整性或适合特定目的。
  • 责任限制: 用户和数据提供者均限制因使用数据集而产生的损害责任。
搜集汇总
数据集介绍
bitext/Bitext-retail-banking-llm-chatbot-training-dataset 数据集图片
构建方式
该数据集由Bitext基于其自然语言处理与自然语言生成技术,结合自动化数据标注工具构建而成。它属于混合合成数据集,专为针对零售银行业务垂直领域的大语言模型微调而设计。数据集涵盖26个意图,归属于9个类别,包含25,545组问答对,每个意图约含1,000个样本,并标注了1,224种实体类型与12种语言生成标签。构建思路遵循两步微调法:先使用此数据集训练领域基础模型,再通过少量自有数据进一步定制,实现从通用大语言模型向垂直化企业模型的转化。
特点
数据集的核心特点在于其高度的垂直领域适配性与语言多样性。意图和类别源自Bitext在银行业务数据集上的深厚积累,覆盖账户管理、卡片服务、贷款申请、转账支付等九大典型场景,确保业务覆盖的全面性。实体类型丰富,如姓名、账号、银行名称等,使模型能精准识别用户指令中的关键信息。语言生成标签涵盖形态变化、语义同义、句式结构(如疑问、并列)、语域风格(如礼貌、口语、错误输入)等多维度变异,极大提升了模型对真实客服场景中多样化表达的鲁棒性与适应性。
使用方法
数据集以HuggingFace格式发布,每条记录包含flags、instruction、category、intent和response字段,可直接用于意图识别任务的监督学习。用户可通过HuggingFace的datasets库加载数据,并基于instruction与response字段对预训练大语言模型进行微调。推荐的微调策略为先使用此数据集进行领域适配训练,再结合企业自身的小规模标注数据进行个性化优化。数据集采用CDLA-Sharing 1.0许可协议,允许共享与衍生,但需保留原始归属并以相同协议分发,适用于学术与商业场景下的零售银行对话AI开发。
背景与挑战
背景概述
在大型语言模型迅速发展的浪潮中,垂直领域适配成为提升其实际应用效能的关键环节。Bitext-retail-banking-llm-chatbot-training-dataset由Bitext Innovations于2024年构建,旨在为零售银行业务场景下的虚拟助手提供高质量的指令微调数据。该数据集聚焦于意图检测这一核心任务,涵盖26种意图与9大类别,包含逾2.5万条问答对及超过1200种实体类型,其设计源于Bitext在银行业多年积累的领域经验。通过引入形态变化、句法结构、语域风格等多维度语言生成标签,该数据集为模型理解零售银行客户交互的复杂性与多样性奠定了坚实基础,成为连接通用大语言模型与专业化银行助手的桥梁。
当前挑战
构建该数据集面临的核心挑战在于如何精准捕捉零售银行业务中客户表达的多样性与复杂性。一方面,领域内意图识别需覆盖账户管理、卡片操作、贷款申请等广泛且相互关联的任务,同时应对客户使用口语化、礼貌或情绪化等不同语域带来的语义歧义。另一方面,数据生成过程需确保合成样本在保持领域真实性的前提下,系统性地涵盖专业术语、缩写、拼写错误及跨句法结构变体,这对标注工具与生成策略的鲁棒性提出极高要求。此外,实体类型的全面覆盖与标签体系的统一性亦构成挑战,需平衡领域知识的深度与数据规模的可扩展性,从而保障模型在真实银行场景中的泛化能力。
常用场景
经典使用场景
在零售银行领域,该数据集最经典的用途是用于微调大型语言模型,以实现精准的意图识别与对话管理。通过涵盖26种细分意图和9大业务类别(如账户管理、卡片服务、贷款申请等),模型能够学习到从查询余额到处理复杂金融事务的多样化用户请求。数据集还引入了丰富的语言生成标签,涵盖词法、句法、语域和风格变异,使模型能够适应正式、口语化乃至包含拼写错误的多种交互风格。这种垂直化领域适应方法,为构建银行专属的智能虚拟助手奠定了坚实基础。
实际应用
在实际应用中,该数据集支撑了银行虚拟助手、智能客服和自动化交易系统的快速部署。银行可基于此数据集微调通用大模型,再辅以少量自有业务数据,即可构建具备账户查询、卡片挂失、贷款咨询等功能的专属对话代理。数据集对多语言变体和礼貌程度的覆盖,使客服系统能灵活应对不同客户群体的沟通偏好,显著提升服务效率与用户满意度。此外,其结构化标签体系还有助于自动化质检与合规监控,降低人工干预成本。
衍生相关工作
该数据集催生了多项经典衍生工作,包括基于提示学习的银行领域意图分类框架、融合实体槽填充的端到端对话模型,以及针对金融场景的对抗训练与数据增强策略。研究者利用其丰富的语言变异标签,开发了面向低资源语种的跨语言迁移方法,并探索了利用检索增强生成(RAG)技术提升问答准确性的方案。此外,数据集的开放许可协议也促进了社区协作,衍生出面向信用卡欺诈检测、投资咨询等垂直子任务的专业化数据集与基准测试体系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务