遇见数据集

retail-bank-router-training-data

收藏
Hugging Face2026-07-29 更新2026-07-30 收录
官方服务:

资源简介:

Retail Bank dual-head router data 是一个专门用于分类任务的数据集,来源于PolyAI Banking77和UCI CLINC150数据集的衍生处理。该数据集明确不包含在生成式SFT(监督微调)任务中。数据集总规模为69,281条样本,具体划分为:训练集44,432行,验证集8,589行,测试集16,260行。数据标注包含两个层面:1) 领域标签,用于区分样本是否属于支持的零售银行领域(OOD=0 表示非支持领域,supported retail banking=1 表示支持领域),其中支持的领域具体包括问候、感谢、告别以及助手身份相关问题;2) 意图标签,沿用Banking77数据集的77个意图类别,特殊值`-100`表示该样本未提供意图监督信号。数据集采用CC-BY-4.0许可证发布。

Retail Bank dual-head router data is a dataset specifically designed for classification tasks, derived from the PolyAI Banking77 and UCI CLINC150 datasets. It is explicitly not intended for generative SFT (supervised fine-tuning) tasks. The dataset contains a total of 69,281 samples, split into 44,432 training rows, 8,589 validation rows, and 16,260 test rows. The annotations include two levels: 1) domain labels, distinguishing whether samples belong to the supported retail banking domain (OOD=0 for out-of-domain, supported retail banking=1 for in-domain), where supported domains include greetings, thanks, farewells, and assistant identity-related questions; 2) intent labels, using the 77 intent categories from the Banking77 dataset, with a special value of `-100` indicating no intent supervision signal. The dataset is released under the CC-BY-4.0 license.

创建时间:
2026-07-27
原始信息汇总

数据集概述

  • 数据集名称:Retail Bank dual-head router data
  • 许可证:CC-BY-4.0
  • 任务类型:文本分类
  • 语言:英语

数据来源与构建

该数据集来源于两个已知的数据集:

  • PolyAI Banking77
  • UCI CLINC150

数据由分类器专门生成,不包含在生成式SFT(监督式微调)中。

数据集规模

数据划分 样本数量
训练集 44,432
验证集 8,589
测试集 16,260

标签体系

  • 领域标签

    • OOD(超出分布):0
    • 支持的零售银行业务:1
    • 支持的领域包括:问候、感谢、告别及助手身份问题
  • 意图标签

    • 共有77个Banking77意图
    • 数值 -100 表示没有意图监督

附加文件

数据集中包含 manifest.json 文件,用于记录:

  • 源数据修订版本
  • 哈希值
  • 映射策略
  • 审计计数
搜集汇总
数据集介绍
retail-bank-router-training-data 数据集图片
构建方式
该数据集是基于PolyAI Banking77与UCI CLINC150两大权威语料库提炼而成,专注于零售银行场景下的意图分类任务。数据构建过程中,采用了分类器导向的严格筛选策略,剔除了生成式监督微调所使用的样本,确保了数据的纯粹性与针对性。最终数据集划分为训练集、验证集与测试集,分别包含44432、8589与16260条样本,每条样本均标注了领域标签与意图标签。领域标签将样本分为OOD(域外)与受支持的零售银行域两类,意图标签则涵盖77个Banking77细粒度意图及特殊标识,其中-100代表无意图监督。数据集附带manifest.json文件,详细记录了源数据版本、哈希值、映射策略及审计数量,保证了构建过程的透明与可追溯性。
特点
本数据集的核心特色在于其双头路由设计,能够同时处理领域分类与意图分类任务。领域标签将样本明确划分为域外与域内两类,域内样本进一步覆盖问候、感谢、告别及助手身份识别等常见交互场景,体现了对零售银行客服场景的深度适配。意图标签则继承了Banking77的77个类别,覆盖了从账户查询到交易处理的广泛银行意图,而-100标识的设计使得域外样本无需强制绑定意图,保持了数据分布的原始特性。此外,数据集的规模经过精心平衡,训练集与验证集的比例约为5:1,测试集则提供了足够的样本量用于评估模型在域外检测与意图识别上的综合表现,为研究鲁棒性分类系统提供了坚实基准。
使用方法
该数据集适用于文本分类任务的模型训练与评估,尤其适合构建零售银行场景下的域外检测与意图识别联合系统。使用时,用户可加载文本字段作为输入,同时利用领域标签与意图标签作为双输出目标,训练多任务学习模型。对于仅关注领域分类的场景,可将意图标签设为忽略;而对于意图分类任务,则需先过滤域外样本,仅保留领域标签为1的条目。评测时,建议分别计算域外检测的准确率与域内意图分类的F1分数,以全面衡量模型性能。数据集以CSV格式存储,可直接通过HuggingFace Datasets库加载,并支持与标准深度学习框架无缝集成。
背景与挑战
背景概述
在自然语言处理领域中,面向特定领域任务的数据集构建是推动技术落地与模型鲁棒性提升的关键环节。retail-bank-router-training-data 数据集由 PolyAI 团队于 2023 年前后基于经典数据集 Banking77 与 CLINC150 的零售银行子集衍生而成,旨在为银行业务场景下的意图分类与领域路由提供高质量的监督训练资源。该数据集聚焦于零售银行的九大核心功能域(包括问候、致谢、告别及身份查询),并引入 OOD(域外)样本以强化模型对非支持请求的识别能力,为金融对话系统的实际部署提供了标准化的评估基准。其影响力体现在对银行领域文本分类任务的规范化推进,以及对域外检测研究边界的拓展。
当前挑战
该数据集所解决的领域核心挑战在于银行业务场景中高精度的意图分类与域外样本检测的协同优化。传统金融对话系统常因缺乏域外数据导致对未知请求的误判,而该数据集通过构建 0/1 域标签与 77 类意图标签的双头监督结构,迫使模型在域内分类能力与域外拒绝能力之间取得平衡。构建过程中面临的难点包括:从 Banking77 与 CLINC150 中筛选并统一标注冲突项,确保域外样本的覆盖多样性;处理意图标签缺失(-100 标定)带来的弱监督学习难题;以及在高频问候类意图(如续写、告别)与低频转账类意图之间保持数据分布的合理均衡,从而避免模型对长尾用户请求的忽视。
常用场景
经典使用场景
在自然语言处理与对话系统的交汇领域,retail-bank-router-training数据集被广泛用作文本分类任务的基准,尤其在零售银行场景下。该数据集融合了PolyAI Banking77和UCI CLINC150的精华,提供了四万余条训练样本,涵盖了支持域与OOD(域外)检测的双重标签体系。研究者和工程师常利用其领域标签与意图标签的双头结构,训练能够同时识别用户意图并判断是否属于银行支持范围的分类器,从而构建智能客服系统的第一步路由模块。
实际应用
在实际应用中,该数据集支撑了零售银行智能客服系统的核心路由功能。当用户发起咨询时,模型首先生成领域判断,将非金融相关的闲聊或查询(如问候、告别)导向通用对话模块,而将存贷款、转账等银行业务请求分配至专门的意图识别流水线。这种分治架构有效降低了误触发率,提升客服自动化率。多家金融机构利用此类模型实现了客服入口的智能化分流,减少了人工坐席的压力,并保障了敏感业务场景的应答准确性。
衍生相关工作
基于该数据集,衍生出了一系列经典工作。例如,有研究提出了联合优化领域分类与意图分类的多任务学习框架,在保留域内高识别率的同时显著改善OOD样本的召回率。另有工作探索了数据增强技术如回译和混合样本,以缓解域内意图分布不均的问题。此外,该数据集的审计统计信息也被引用为评估标准,用于验证新型路由策略在长尾意图上的表现,推动了对真实银行对话场景下鲁棒分类器的持续探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务