遇见数据集

DeepPavlov/banking77-translated

收藏
Hugging Face2026-07-12 更新2026-07-22 收录
官方服务:

资源简介:

--- dataset_info: - config_name: es features: - name: text dtype: string - name: label dtype: int64 - name: text_gemma dtype: string - name: text_qwen dtype: string splits: - name: train num_bytes: 2138523 num_examples: 9993 - name: test num_bytes: 611217 num_examples: 3076 download_size: 1128285 dataset_size: 2749740 - config_name: fr features: - name: text dtype: string - name: label dtype: int64 - name: text_gemma dtype: string - name: text_qwen dtype: string splits: - name: train num_bytes: 2330295 num_examples: 9993 - name: test num_bytes: 663561 num_examples: 3076 download_size: 1172474 dataset_size: 2993856 configs: - config_name: es data_files: - split: train path: es/train-* - split: test path: es/test-* - config_name: fr data_files: - split: train path: fr/train-* - split: test path: fr/test-* ---

提供机构:
DeepPavlov
搜集汇总
数据集介绍
DeepPavlov/banking77-translated 数据集图片
构建方式
Banking77-Translated数据集以原始Banking77英文数据集为基础,经由先进的大语言模型(如Gemma和Qwen)进行自动化翻译而来,覆盖西班牙语(es)和法语(fr)两种语言。每个配置均保留了原始数据的核心结构,包含文本、标签以及由不同模型生成的翻译文本字段,且划分为训练集与测试集,其中训练集包含9993个样本,测试集包含3076个样本,确保了跨语言研究的数据完整性与可比性。
特点
该数据集最显著的特点在于其多语言与多模型翻译的并行设计,每个样本不仅包含原始翻译文本,还独立记录了由Gemma和Qwen模型生成的译文,为研究不同翻译引擎在金融领域文本上的表现提供了宝贵资源。数据集标签沿用Banking77的77个精细意图分类,专注于银行客服场景,使得跨语言意图识别与模型鲁棒性评估成为可能。
使用方法
用户可通过HuggingFace Datasets库直接加载该数据集,指定配置名为'es'或'fr'以获取对应语言版本。数据以标准的特征字典形式呈现,其中'text'字段可作为输入,'label'字段作为监督信号。借助'text_gemma'与'text_qwen'字段,研究者能够灵活对比不同翻译质量对下游任务的影响,或将其作为数据增强的来源进行多模型集成训练。
背景与挑战
背景概述
banking77-translated数据集是对原始Banking77数据集的扩展,由研究人员在2023年左右创建,旨在解决多语言金融对话理解中的意图分类问题。该数据集将英文的银行客服查询翻译为西班牙语和法语,通过Gemma和Qwen模型进行翻译生成,保留了原始77个意图类别的标签结构。核心研究问题聚焦于评估和提升多语言自然语言处理模型在金融领域的零样本跨语言迁移能力。作为Banking77数据集的衍生版本,它在多语言意图识别领域具有重要影响力,为跨语言金融对话系统提供了标准化的评估基准,推动了多语言对话AI在银行业务中的应用研究。
当前挑战
该数据集面临的挑战包括:1) 领域问题层面,多语言金融对话中的意图分类面临语言歧义性和文化特异性表达难题,不同语言间的语义映射不完整,导致跨语言模型的鲁棒性不足,尤其对于低频意图类别。2) 构建过程中,机器翻译可能引入语义失真或语境误译,尤其是金融术语的准确性难以保证;同时,数据规模有限(每语言约1万训练样本),可能不足以覆盖多样化的用户表达方式,增加了模型过拟合风险。此外,标签一致性在不同语言版本间的维护也是构建时的关键挑战。
常用场景
经典使用场景
在自然语言处理领域,特别是面向金融服务的对话系统中,该数据集主要用于意图识别与分类任务。其经典使用场景涵盖多语言环境下的客户服务查询分类,研究人员可基于西班牙语和法语版本的文本及标签,训练模型精准区分用户的多样化金融需求,例如账户查询、交易争议或转账问题。数据集提供的翻译文本版本(如text_gemma和text_qwen)便于探索大规模语言模型在跨语言文本表示上的泛化能力,从而提升国际化银行系统的智能化响应水平。
衍生相关工作
该数据集衍生了一系列前沿研究工作,例如基于Banking77-Translated的跨语言零样本意图识别框架,研究者通过联合训练多语言嵌入模型达成无需目标语言标注样本的泛化。另有工作利用其text_gemma子集,探索大语言模型蒸馏技术在小规模金融服务场景下的轻量化部署方案。此外,针对翻译误差引发的噪声问题,派生出了鲁棒性对比学习和对抗样本检测等研究方向,进一步夯实了多语言意图理解的理论基础与应用边界。
数据集最近研究
最新研究方向
在跨语言自然语言处理领域,banking77-translated数据集正成为多语种意图识别与任务型对话系统研究的关键资源。通过将英文金融客服意图数据集Banking77翻译为西班牙语和法语,该数据为构建低资源语言的对话理解模型提供了高质训练基准。当前前沿方向聚焦于利用大型语言模型(如Gemma和Qwen)的翻译增强能力,探索模型在多语种环境下的语义对齐与零样本泛化性能。特别是在全球金融科技服务不断拓展的背景下,该数据集推动了多语种智能客服系统的可迁移性与公平性研究,对提升非英语用户的交互体验具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务