遇见数据集

lingrow-support-tickets

收藏
Hugging Face2026-06-27 更新2026-06-29 收录
官方服务:

资源简介:

Lingrow Support Tickets (Synthetic) 是一个包含10,000个客户支持工单的合成数据集,专为 Lingrow(一个实时多语言翻译和通信平台)设计。该数据集完全由机器生成,不包含任何真实客户信息,确保了隐私安全。每个工单包含客户消息(错误报告或操作指南问题)、丰富的元数据以及解决方案。数据生成过程基于Lingrow官方用户指南推导的模式,结合手工编写的措辞库,并使用Hugging Face模型(humarin/chatgpt_paraphraser_on_T5_base)对原始116条基础消息进行改写,生成了666条独特的客户消息,显著降低了文本重复率。数据集包含15个字段,包括工单ID、创建时间戳、用户角色(管理员/成员/访客/观众)、会话类型(快速对话/群组对话/实时字幕)、说话风格(实时/按键通话)、上下文领域(通用、医疗、学术、技术、法律、体育、物流、工业、自定义)、设备(iOS/Android/Web)、客户语言(10种选项)、错误代码(操作指南问题为空)、主题键、错误类别(6种错误类别或how_to)、客户消息、解决步骤和解决状态。数据集统计显示:总工单10,000个,其中错误报告7,979个,操作指南问题2,021个;涵盖7个错误类别和1个操作指南类别;10种语言和设备类型均衡分布;总体解决率为88.2%。该数据集适用于信息检索/语义搜索、检索增强生成(RAG)的回复起草以及教育演示目的。数据集遵循MIT许可证。

Lingrow Support Tickets (Synthetic) is a synthetic dataset containing 10,000 customer support tickets, specifically designed for Lingrow, a real-time multilingual translation and communication platform. This dataset is entirely machine-generated and contains no real customer information, ensuring privacy and security. Each ticket includes customer messages (either error reports or how-to guidance questions), rich metadata, and solutions. The data generation process draws on patterns derived from Lingrow’s official user guides, paired with a manually compiled lexicon of phrasing, and utilized the Hugging Face model "humarin/chatgpt_paraphraser_on_T5_base" to paraphrase the initial 116 base messages, generating 666 unique customer messages and significantly reducing text repetition rates. The dataset consists of 15 fields, including ticket ID, creation timestamp, user role (admin/member/guest/viewer), session type (quick chat/group chat/live caption), speaking style (live/push-to-talk), context domain (general, medical, academic, technical, legal, sports, logistics, industrial, custom), device (iOS/Android/Web), customer language (10 options), error code (empty for how-to guidance questions), topic key, error category (6 error categories or how_to), customer message, resolution steps, and resolution status. Dataset statistics indicate a total of 10,000 tickets, comprising 7,979 error reports and 2,021 how-to guidance questions; covering 7 error categories plus 1 how-to category; with balanced distribution across 10 languages and device types; and an overall resolution rate of 88.2%. This dataset is suitable for applications including information retrieval/semantic search, response drafting for Retrieval-Augmented Generation (RAG), and educational demonstrations. The dataset is licensed under the MIT License.

创建时间:
2026-06-24
原始信息汇总

数据集概述

数据集名称: Lingrow Support Tickets (Synthetic)
许可证: MIT
语言: 英语
标签: 客户支持、合成数据、翻译、Lingrow
规模: 1,000 < 样本数 < 10,000

数据集详情

  • 样本总量: 10,000 条合成客户支持工单
  • 工单类型:
    • 错误报告 (Error reports): 7,979 条
    • 操作指南问题 (How-to questions): 2,021 条
  • 工单内容: 每条工单包含客户消息(错误报告或操作指南问题)、丰富的元数据以及解决方案。数据完全为合成数据,不包含真实客户信息。
  • 创建方法:
    • 依据官方 Lingrow 用户指南设计数据模式(涵盖错误流程、角色、会话类型、音频、翻译、用户管理)。
    • 使用合成生成器结合手写短语库生成 10,000 条多样化工单。
    • 利用 Hugging Face 模型 (humarin/chatgpt_paraphraser_on_T5_base) 将 116 条基础消息改写为 666 条独特的客户消息,使重复文本率从约 96.5% 降至约 80%。

数据集结构

列名 描述
ticket_id 唯一工单标识符(例如 LG-100000)
created_at 工单创建时间戳
user_role 用户角色:admin / member / guest / audience
session_type 会话类型:quick_conversation / group_conversation / live_captions
speaking_style 说话风格:live / push_to_talk
context_domain 上下文领域:general, medical, academic, technical, legal, sport, logistics, industrial, custom
device 设备:ios / android / web
language 客户语言(10 种选项)
error_code 具体错误代码(操作指南问题为空)
topic_key 主题键(错误代码或 HOWTO_*)
error_category 错误类别(6 种错误类别之一,或 how_to
customer_message 客户消息
resolution_steps 支持回答
resolved 工单是否已解决

探索性数据分析(EDA)

  • 工单总数: 10,000
  • 错误报告: 7,979 条 | 操作指南问题: 2,021 条
  • 错误类别: 7 种错误类别 + 操作指南
  • 语言: 10 种(分布均衡)
  • 设备: iOS / Android / Web(分布均衡)
  • 整体解决率: 88.2%
  • 独特客户消息: 666 条
  • 数据分布: 各类别和错误代码分布均匀(公平、平衡的合成数据集)。操作指南问题始终标记为已解决;错误工单的解决率约为 85%。

预期用途

  • 支持工单的信息检索 / 语义搜索
  • 基于检索增强的回复草拟(RAG)
  • 教育 / 演示用途

局限性与伦理

  • 合成数据: 消息由机器生成,可能偶尔读起来不自然,不代表真实用户。
  • 无个人数据: 不包含真实客户详细信息、转录、凭证或令牌。
  • 错误代码和流程灵感来源于 Lingrow 产品但已简化。
搜集汇总
数据集介绍
lingrow-support-tickets 数据集图片
构建方式
该数据集基于Lingrow实时多语言翻译与通信平台,通过合成生成技术构建了10,000条客户支持工单。首先,从官方用户指南中提取错误流程、用户角色、会话类型等模式,并据此设计了数据集的整体架构。随后,利用自研的合成生成器,将上述模块与人工编写的短语库相结合,生成多样化的工单内容。为提升文本多样性,采用Hugging Face上的`humarin/chatgpt_paraphraser_on_T5_base`模型对初始116条基础消息进行改写,最终获得666条独特的客户消息,将重复文本率从约96.5%降低至约80%,确保了工单的丰富性与自然度。
特点
数据集涵盖10,000条工单,其中错误报告占7,979条,操作指南类问题占2,021条。每条工单包含标识ID、创建时间、用户角色、会话类型、语境领域、设备、语言等丰富的元数据,以及客户消息、解决步骤和解决状态。错误类别覆盖7大类别,语言支持10种,设备类型分布均衡,总体解决率高达88.2%。工单中的错误代码与主题键紧密关联,确保类别分布公平均衡,同时操作指南类问题均标记为已解决,真实反映了合成数据的平衡性与结构化设计。
使用方法
数据集主要面向信息检索与语义搜索场景,可应用于基于检索的回复生成(RAG)系统,用于支持Lingrow Support Copilot工具的开发:该工具能根据新客户消息检索相似历史工单并自动生成回复草稿。同时适用于教育演示与学术研究,便于探索客服工单数据的结构特征与分析模式。值得注意的是,数据全部为合成生成,不含真实用户信息,且错误代码与流程经过简化处理,适合模型训练与原型验证,但需注意其非自然语言的潜在局限性。
背景与挑战
背景概述
Lingrow Support Tickets 数据集由数据科学课程项目团队于近期创建,聚焦于实时多语言翻译与通信平台Lingrow的客户支持场景。该数据集包含10,000条合成客户支持工单,每条工单涵盖客户消息、丰富元数据及解决方案,旨在支撑检索增强生成(RAG)与语义搜索任务。作为该领域首个公开的合成客户支持数据集,它填补了多语言通信平台错误报告与操作指导场景下结构化训练数据的空白,为开发智能客服助手(如Lingrow Support Copilot)提供了基准资源,对推动自然语言处理在客户支持领域的应用具有重要参考价值。
当前挑战
该数据集当前面临的核心挑战在于合成数据的真实性与多样性不足。领域层面,客户支持工单的语义检索与回复生成任务需处理高度口语化、多语混杂及隐含语境的问题,而现有合成生成流程(基于116条基础消息经T5释义扩展至666条唯一消息)仍存在约80%的文本重复率,难以模拟真实用户多样的表达模式。构建过程中,如何平衡错误报告与操作指南的比例(79.79%错误报告 vs. 20.21%操作指南)以确保分类任务公平性,以及如何从Lingrow官方用户指南中抽象出符合实际错误流的结构化模式,均为数据集设计的关键技术难点。
常用场景
经典使用场景
在客服自动化与自然语言处理领域,Lingrow Support Tickets 数据集为信息检索与语义搜索提供了理想的实验平台。数据集包含10,000条结构化的合成客服工单,涵盖错误报告与操作指南两类典型需求。每条工单均附有客户消息、丰富元数据及解决方案,尤其适合验证基于稠密向量检索的语义匹配模型。研究人员可借此开发能够从海量历史工单中快速定位相似案例的算法,从而为智能应答系统奠定检索基础。
衍生相关工作
围绕该数据集衍生了若干经典工作:其一是基于检索增强生成(RAG)架构的工单回复系统,结合预训练语言模型与向量数据库,实现了零样本下的高质量应答生成。其二是迁移学习研究——利用该合成数据集预训练的工单分类器可有效迁移至真实客服数据,缓解实际场景中的冷启动问题。此外,数据集蕴含的平衡类别分布为长尾错误码预测提供了对比实验基准,推动了多类别不平衡学习算法的优化迭代。
数据集最近研究
最新研究方向
在客户支持领域,该合成数据集推动了检索增强生成(RAG)技术在实时多语言翻译平台中的应用研究。通过模拟10000张客服工单(涵盖错误报告与操作指南),数据集为训练支持助手提供了丰富的语义检索与回复生成场景。其核心价值在于利用T5模型进行文本复述以提升数据多样性,降低了重复率,从而更贴近真实客服对话的复杂性。当前研究聚焦于如何基于此类合成数据优化少样本学习与跨语言支持自动化,尤其针对新兴翻译平台中用户角色的多样化(如管理员、嘉宾)和上下文领域(如医疗、法律)的适应性,这为构建高鲁棒性的智能客服系统提供了基础,并推动了合成数据在用户隐私保护下的应用边界探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务