bitext/Bitext-customer-support-llm-chatbot-training-dataset
收藏资源简介:
Bitext - 基于LLM的虚拟助手客户服务标记训练数据集是一个混合合成数据集,旨在用于微调大型语言模型(如GPT、Mistral和OpenELM),并展示了如何通过两步法实现客户支持领域的垂直化/领域适应。数据集包含27个意图,分为10个类别,共有26872个问答对,每个意图大约有1000个问答对。此外,数据集还包含30个实体/槽类型和12种不同类型的语言生成标签。数据集涵盖了多个垂直领域,如汽车、零售银行、教育等。数据集的每个条目包含多个字段,如flags、instruction、category、intent和response。数据集还详细描述了语言生成标签,这些标签反映了不同语言现象的变化,如口语化或冒犯性语言。
Bitext - LLM-based Virtual Assistant Customer Service Tagging Training Dataset is a hybrid synthetic dataset intended for fine-tuning large language models (e.g., GPT, Mistral, and OpenELM), and it demonstrates how to achieve verticalization/domain adaptation in the customer support domain via a two-step approach. The dataset contains 27 intents categorized into 10 categories, with a total of 26,872 question-answer pairs, approximately 1,000 pairs per intent. In addition, the dataset includes 30 entity/slot types and 12 distinct types of language generation tags. The dataset covers multiple vertical sectors such as automotive, retail banking, education, and more. Each entry in the dataset contains multiple fields, such as flags, instruction, category, intent, and response. The dataset also provides detailed descriptions of the language generation tags, which reflect variations in different linguistic phenomena, such as colloquial or offensive language.
Bitext - Customer Service Tagged Training Dataset for LLM-based Virtual Assistants
概述
该数据集用于训练大型语言模型,如GPT、Llama2和Falcon,适用于微调和领域适应。
数据集规格
- 使用案例:意图检测
- 垂直领域:客户服务
- 27个意图,分配给10个类别
- 26,872个问答对,约每意图1000个
- 30种实体/槽类型
- 12种语言生成标签类型
数据集内容
- 字段:
- flags: 标签
- instruction: 客户服务领域的用户请求
- category: 意图的高级语义类别
- intent: 对应用户指令的意图
- response: 虚拟助手的预期示例响应
类别和意图
- 类别包括:ACCOUNT, CANCELLATION_FEE, DELIVERY, FEEDBACK, INVOICE, NEWSLETTER, ORDER, PAYMENT, REFUND, SHIPPING_ADDRESS
- 具体意图如:create_account, delete_account, check_cancellation_fee, delivery_options等。
实体
- 实体如:{{Order Number}}, {{Invoice Number}}, {{Online Order Interaction}}等,分布在多个意图中。
语言生成标签
- 标签用于表示语言变化,如口语化、语法结构变化、礼貌变化等。
- 具体标签如:M - 形态变化, L - 语义变化, B - 基本句法结构等。
数据集大小
- 数据集包含3.57百万个令牌,适用于训练AI对话、AI生成和问答模型。




