MINDS-14
收藏资源简介:
MINDS-14是一个专注于多语言意图检测的专门数据集,特别是在电子银行领域。通过结合机器翻译模型和复杂的多语言句子编码器如LaBSE,这项研究开创了跨越多种语言的强大意图检测。值得注意的是,“ASR-然后翻译”范式,特别是在主要语言中,强调了域内模型微调的重要性。这一探索强调了多语言意图检测的潜在应用,为在以语音为中心的会话AI领域中的广泛集成铺平了道路。
MINDS-14 is a specialized dataset focused on multilingual intent detection, particularly within the realm of electronic banking. By integrating machine translation models with sophisticated multilingual sentence encoders such as LaBSE, this research pioneers robust intent detection across multiple languages. Notably, the 'ASR-then-translate' paradigm, especially in dominant languages, underscores the importance of in-domain model fine-tuning. This exploration highlights the potential applications of multilingual intent detection, paving the way for widespread integration in voice-centric conversational AI domains.
数据集概述
数据集名称
MINDS-14
数据集描述
MINDS-14是一个专注于多语言意图检测的数据集,主要应用于电子银行领域。该数据集通过结合机器翻译模型和复杂的多语言句子编码器(如LaBSE),实现了跨多种语言的强大意图检测。此研究强调了“ASR-then-translate”范式的重要性,特别是在主要语言中,并强调了领域内模型微调的重要性。
数据集内容
- 语言: 英语(en-US, en-GB, en-AU)
- 数据结构:
- en-US: 563行,包含[path, audio, transcription, english_transcription, intent_class, lang_id]列
- en-AU: 654行,包含相同的列
- en-GB: 592行,包含相同的列
- 意图类别: 共14种不同的意图类别,如aboard, address, app_error等。
数据集使用
本研究使用MINDS-14数据集的一个子集,专注于英语(美式、英式、澳式)样本,用于训练和评估Whisper-tiny自动语音识别模型。
训练配置
- 模型: Whisper-tiny
- 训练参数:
- 输出目录: "./whisper-tiny-minds14-english"
- 每设备训练批次大小: 16
- 学习率: 3e-5
- 评估策略: "steps"
- 评估批次大小: 8
- 最大生成长度: 225
评估结果
- 训练结果: 显示潜在的过拟合问题,可能由于合并了三种不同的子数据集和固有的口音变化。
- 预测性能: 模型在较短音频片段上表现良好,但在较长音频输入上遇到挑战。
- 评估指标: 包括Word Error Rate (WER), 准确率, F1分数, BLEU分数和Rouge分数。
结论
Whisper-tiny模型与MINDS14数据集的结合展示了预训练ASR模型在多语言意图检测中的潜力和挑战。尽管模型在某些情况下表现出色,特别是较短的音频片段,但口音变化和多样的语言细微差别仍需进一步探索和改进。未来的工作可能会从针对特定语言子集的精细调整策略中受益,为更强大和多功能的语音中心AI应用铺平道路。




