遇见数据集

DeepPavlov/atis_intent_classification_translated

收藏
Hugging Face2026-07-12 更新2026-07-22 收录
官方服务:

资源简介:

该数据集包含西班牙语和法语两个子集,每个子集包含原始文本、标签、Gemma模型生成的文本和Qwen模型生成的文本。数据集分为训练集和测试集,用于文本分类或模型生成的文本对比分析。

This dataset contains two subsets: Spanish (es) and French (fr). Each subset includes original text, label, text generated by Gemma model, and text generated by Qwen model. The dataset is split into training and test sets, suitable for text classification or comparison of model-generated texts.

提供机构:
DeepPavlov
搜集汇总
数据集介绍
DeepPavlov/atis_intent_classification_translated 数据集图片
构建方式
atis_intent_classification_translated数据集是基于原始ATIS(Airline Travel Information Systems)意图分类语料库的多语言翻译版本构建而成。该数据集通过机器翻译技术将原始英文文本转化为西班牙语(es)和法语(fr)两种语言版本,同时保留了原始数据集的分类标签体系。每个语言配置均包含文本字段(text)、标签字段(label)以及由不同翻译模型生成的附加文本字段(text_gemma和text_qwen),确保了多语言意图识别任务的基础数据完整性。数据被划分为训练集(4834条样本)和测试集(800条样本),为跨语言自然语言处理研究提供了标准化基准。
使用方法
研究者可通过HuggingFace Datasets库直接加载该数据集,并指定语言配置('es'或'fr')以获取对应语言的训练与测试分片。数据集支持多字段调用,用户可根据实验目标选择使用标准翻译文本(text)或特定模型生成的翻译(text_gemma/text_qwen)作为输入。在分类任务中,可将label字段作为监督信号,结合Transformer架构的多语言预训练模型(如mBERT、XLM-R)进行微调。值得注意的是,该数据集的标签体系与原始ATIS完全兼容,因此也可直接用于评估英文模型在多语言场景下的零样本迁移性能。
背景与挑战
背景概述
该数据集名为atis_intent_classification_translated,是基于经典的ATIS(Airline Travel Information System)意图分类任务的多语言翻译版本。创建时间不详,但主要涉及将英文ATIS语料库通过机器翻译技术扩展至西班牙语(es)和法语(fr),服务于多语言自然语言理解研究。核心研究问题在于评估并提升跨语言意图分类的鲁棒性,尤其针对低资源语言场景。数据集包含约4834条训练样本和800条测试样本,每个样本均提供原始文本、标签以及通过Gemma和Qwen模型生成的翻译文本,为多语言模型比较与迁移学习提供了基准。该数据集在跨语言对话系统、机器翻译评估及多语言NLP领域具有显著影响力,推动了多语言意图理解的研究进展。
当前挑战
首先,该数据集所解决的领域问题是在多语言环境下进行准确的意图分类,尤其是在目标语言资源稀少时,克服跨语言语义对齐和语言特异性表达的挑战。其次,构建过程中面临多重困难:机器翻译可能引入语义扭曲或文化适应错误,导致标签一致性受损;不同语言间的句法结构差异要求翻译文本需保持意图不变性;此外,原始ATIS语料库的领域专业性(如航班查询术语)增加了翻译的准确性难度。最后,数据不平衡和少量样本(每语言仅800测试样本)限制了模型泛化能力的评估,且翻译质量依赖所选模型(Gemma vs. Qwen),可能引入系统性偏差。
常用场景
经典使用场景
ATIS(Airline Travel Information Systems)意图分类翻译数据集是自然语言理解领域中一项极具价值的资源,它脱胎于经典的英文ATIS语料库,专注于航空旅行信息查询场景。该数据集通过机器翻译技术被扩展至西班牙语和法语,保留了原始数据集中用户对航班、票价、预订等询问的意图标签。其最典型的应用场景是跨语言意图识别模型的训练与评估,研究者可借助它探索多语言环境下语义理解的一致性,检验模型在处理非英语查询时的泛化能力,从而推动多语言对话系统的构建与优化。
解决学术问题
该数据集在学术研究中有效解决了跨语言自然语言理解中标注数据匮乏的难题。传统上,意图识别任务主要依赖单一语言资源,严重制约了模型在多语言场景下的表现。ATIS意图分类翻译数据集的问世,为探索机器翻译后质量对下游任务的影响提供了可控的实验平台,还促进了诸如对抗性训练、跨语言知识蒸馏等前沿技术的验证。它推动了多语言意图识别从实验室走向现实应用,为构建全球化、低资源语言的对话系统奠定了数据基础。
实际应用
在实际应用层面,该数据集直接服务于航空领域多语言客服系统的开发。例如,航空公司或在线旅行平台可基于此数据集训练智能问答机器人,使其能够准确理解西班牙语或法语用户的查询意图,如查询航班时刻、预订餐食或更改座位。它还有助于优化跨语言搜索功能,提升非英语用户的使用体验。此外,该数据集可被集成至多语言虚拟助手(如智能音箱、车载语音系统)中,支持用户用母语获取出行信息,从而降低语言障碍,扩大服务的全球覆盖范围。
数据集最近研究
最新研究方向
在自然语言理解领域,意图识别作为任务型对话系统的核心环节,近年来随着大语言模型的蓬勃发展迎来了全新范式。atis_intent_classification_translated数据集通过将经典的ATIS航空旅行信息查询语料扩展至西班牙语和法语,为多语言意图识别研究提供了珍贵的基准资源。当前前沿方向聚焦于利用Gemma、Qwen等开源大模型对翻译数据进行知识蒸馏与跨语言迁移学习,探索如何在不牺牲性能的前提下实现低资源语言的意图理解能力泛化。这一工作不仅推动了多语言对话系统的公平性与可用性,也呼应了全球数字化服务中语言障碍消除的热点需求,其意义在于为构建真正普适的智能交互系统奠定了数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务