Customer Complaints v0.1 (CuCom) Dataset
收藏资源简介:
这是一个多语言数据集,包含约10,000条用户与AI助手在银行和保险领域的客户服务对话。数据集以JSON格式存储,模拟了客户投诉解决场景。每个条目代表一个对话,对话双方分别是沮丧的客户(用户)和客户支持代理(基于LLM的助手),涵盖了投资延迟、额外费用、保险索赔、卡片封锁和服务失败等问题。
This is a multilingual dataset containing approximately 10,000 customer service dialogues between users and AI assistants in the banking and insurance sectors. Stored in JSON format, the dataset simulates customer complaint resolution scenarios. Each entry represents a dialogue between a frustrated customer (user) and an LLM-based customer support assistant, covering issues such as investment delays, additional fees, insurance claims, card blockages, and service failures.
客户投诉v0.1 (CuCom) 数据集
一个包含约10,000个客户服务对话的多语言数据集,这些对话发生在用户与银行和保险领域的AI助手之间。
描述
此数据集包含以JSON格式模拟客户投诉解决场景的合成用户-代理对话。每个条目代表一位沮丧的客户(用户)与客户支持代理(基于LLM的助手)之间的对话,涵盖了投资延迟、额外费用、保险索赔、卡片锁定和服务故障等问题。
格式
json { "id": "conv_9855", "turns": [ {"role": "user", "content": "..."}, {"role": "assistant", "content": "..."} ] }
目标
- 为多语言客户支持训练/微调LLM
- 在代码混合语言理解上对模型进行基准测试
- 开发用于客户服务情感语调处理的系统
- 在现实世界场景中研究跨语言意图识别
语言
- 印地语(天城文)
- 印英混合语(印地语-英语代码混合)
- 转写印地语(罗马文)
- 英语
数据集详情
| 参数 | 值 |
|---|---|
| 对话数 | 9,858 |
| 平均对话轮数 | 8-16 |
| 领域 | 银行、保险 |
| 总轮数 | 136,642 |
| 文本特征 | 情感语言、俚语、代码切换 |
关键应用场景
-
多语言聊天机器人训练
- 处理代码混合的客户查询
- 管理沮丧/愤怒的用户语调
-
情感分析
- 检测投诉中的紧急/沮丧情绪
- 生成情感感知的响应
-
意图识别
- 分类投诉类型(SIP延迟、卡片锁定等)
- 实体提取(账号号码、索赔ID)
-
文化NLP研究
- 研究代码切换模式
- 分析非正式金融词汇
快速入门
- 下载数据集 bash wget https://github.com/vakyansh/cucom/raw/refs/heads/main/data/cucuom_v1.jsonl.zip
许可
贡献
我们欢迎以下方面的贡献:
- 额外的注释(情感标签、意图标签)
- 改进的翻译
- 更多的对话样本
- 更多的领域
如果您想要请求任何额外的领域,请打开一个issue或PR。
注意:样本中的敏感信息(账号号码、电话号码)是虚构的。真实的用户标识符已被匿名化。




