遇见数据集

yingjie16/ev-lead-triage

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

EV Lead Triage Dataset 是一个用于新能源汽车销售线索意图分级的中英双语数据集,覆盖销售前、销售中和售后阶段的常见用户表达。该数据集模拟新能源汽车销售线索的6类意图分级场景,适合训练文本分类器,用于销售线索分流、客服自动路由、潜客优先级识别与售后请求识别。

EV Lead Triage Dataset is a bilingual Chinese-English dataset for intent classification of new energy vehicle sales leads, covering common user expressions in pre-sales, sales, and after-sales stages. It simulates 6 types of intent classification scenarios for new energy vehicle sales leads, suitable for training text classifiers for sales lead triage, customer service automatic routing, potential customer priority identification, and after-sales request recognition.

提供机构:
yingjie16
搜集汇总
数据集介绍
构建方式
该数据集专为新能源汽车销售线索的意图分级而设计,覆盖售前、售中及售后三大业务环节中的典型用户表达。数据集的构建融合了人工智能生成与人工质检的双重策略:首先,借助GPT-5模型通过Codex框架进行大规模文本生成,以确保句式多样性与口语表达的丰富度;随后,经过多轮人工抽样审核,重点校准中英双语的语义一致性、类别边界的清晰度以及表达场景的真实感。最终形成包含6个类别、每类100条样本、共计600条的中英双语平衡数据集,并按分层抽样原则切分为训练集与测试集。
特点
本数据集的核心特色在于其精细化的销售线索分级标签体系,涵盖高意向试驾、品牌对比、价格咨询、售后服务、交付跟进及一般好奇等六类意图,精准映射了新能源汽车销售链条中的关键触点。数据同时支持中文与英文两种语言,每类样本各占半数,为跨语言意图识别研究提供了对称化的实验基础。此外,数据在生成过程中特别强调口语化表达的自然度与多样性,使得训练出的模型更贴近真实客服场景中的非结构化文本输入。
使用方法
该数据集主要面向文本分类任务,适用于训练销售线索分流模型、客服自动路由系统以及潜客优先级识别模型。使用者可直接加载Hugging Face平台上的'train'与'test'两个预切分数据集,其中测试集占比为20%,并按标签类别进行分层确保类别分布均衡。建议采用基于预训练语言模型的微调方案,尤其是在中英双语言环境下,可借助BERT、XLM-R或GPT系列模型进行多标签分类或意图识别实验。数据集采用CC BY 4.0许可,方便学术与商业场景中的公开使用与二次分发。
背景与挑战
背景概述
随着新能源汽车市场的迅猛扩张,销售线索的高效管理与精准分流已成为企业提升转化率与客户满意度的关键环节。ev-lead-triage数据集由研究者yingjie16于2026年发布,聚焦于新能源汽车销售线索的意图分级任务,覆盖售前、售中及售后全生命周期中的六类典型用户表达,包括试驾意向、竞品对比、价格咨询、售后服务、交付跟进及一般问询。该数据集以中英双语形式呈现,共包含600条精心构建的样本,兼顾语言多样性与行业场景的贴合度,为销售线索自动化分流、客服智能路由及潜客优先级识别等实际应用提供了重要的基础资源。其发布填补了新能源汽车领域结构化意图分类数据的空白,对推动汽车行业客服智能化与销售效率提升具有显著影响力。
当前挑战
该数据集所解决的领域核心挑战在于新能源汽车销售场景中用户意图的复杂性与多样性,例如用户可能在同一句话中混合表达价格查询与对比需求,或从试驾意向突然转向售后问题,给传统规则式或简单分类模型带来巨大困难。构建过程中面临的主要挑战包括:如何在有限样本量(每类100条)下保证跨语言和跨场景的泛化能力,避免模型因数据量不足而偏向特定句式或口吻;如何确保AI合成数据在句式多样性与口语表达丰富性上逼近真实用户对话,避免生硬或重复的样本影响鲁棒性;以及如何通过人工抽样审核有效控制标签噪声,使六类意图边界清晰、互斥性好,从而支持端到端的高精度模型训练与可靠的分流决策。
常用场景
经典使用场景
在新能源汽车销售与客户关系管理领域,精准识别潜客意图是提升转化效率的关键。EV Lead Triage Dataset 提供了一个覆盖售前、售中及售后全链条的中英双语意图分类基准,经典使用场景聚焦于训练文本分类器以自动区分六大核心意图:强购买意向的试驾请求、跨品牌比较行为、价格与金融方案咨询、已购用户的售后服务诉求、订单交付跟进以及一般性好奇询问。该数据集尤适用于销售线索分流系统,通过分类结果将不同意图的客户自动路由至对应的销售顾问、售后专员或客服机器人,从而显著缩短响应周期。此外,该数据集支持双语场景下的意图识别实验,为评估多语言模型的分类鲁棒性提供了标准化测试床。
解决学术问题
该数据集精准回应了新能源汽车销售场景中意图识别数据匮乏的学术困境,核心解决了两类研究难题。其一,它填补了售前至售后全生命周期意图细分标注数据的空白,此前公开的客服意图数据集多集中于售后投诉或通用问询,缺乏对试驾意向、竞品比较、定金催付等销售漏斗前端环节的细粒度刻画。其二,它提供了中英双语对照的实验环境,便于研究者探索跨语言迁移学习对销售文本分类的影响,特别是针对同一品牌服务中美用户时语言特征差异的捕捉能力。该数据集不仅推动了面向垂直行业的意图识别模型从粗粒度向细粒度的演进,还为多语言客户服务自动化系统的效果评估奠定了可复现的基线,其分层切分设计也保证了实验结果的统计可靠性。
衍生相关工作
该数据集衍生了一系列富有启发性的研究工作。在模型层面,研究者基于该数据集训练了轻量级蒸馏分类器(如 TinyBERT 和 MobileBERT),旨在边缘端设备(如门店平板)上实现低延迟的实时意图识别,产出了《Efficient Intent Classification for Automotive Sales Leads on Edge Devices》等成果。在数据增强领域,有团队利用该数据集的6类标签作为种子,结合大语言模型进行少样本提示生成,构建了规模扩大10倍的伪标签数据集,系统研究了合成数据质量对分类器泛化边界的影响。此外,跨域迁移也是热门方向——将本数据集训练的模型在二手新能源车销售语料上进行微调,验证了意图分类器在新兴二手车业务中的迁移衰减规律。这些工作共同拓展了垂域意图识别在样本稀缺、多语言和跨任务场景下的方法论边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务