遇见数据集

fathyshalab/massive_general-de-DE

收藏
Hugging Face2023-03-30 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: features: - name: id dtype: string - name: locale dtype: string - name: partition dtype: string - name: scenario dtype: class_label: names: '0': social '1': transport '2': calendar '3': play '4': news '5': datetime '6': recommendation '7': email '8': iot '9': general '10': audio '11': lists '12': qa '13': cooking '14': takeaway '15': music '16': alarm '17': weather - name: intent dtype: class_label: names: '0': datetime_query '1': iot_hue_lightchange '2': transport_ticket '3': takeaway_query '4': qa_stock '5': general_greet '6': recommendation_events '7': music_dislikeness '8': iot_wemo_off '9': cooking_recipe '10': qa_currency '11': transport_traffic '12': general_quirky '13': weather_query '14': audio_volume_up '15': email_addcontact '16': takeaway_order '17': email_querycontact '18': iot_hue_lightup '19': recommendation_locations '20': play_audiobook '21': lists_createoradd '22': news_query '23': alarm_query '24': iot_wemo_on '25': general_joke '26': qa_definition '27': social_query '28': music_settings '29': audio_volume_other '30': calendar_remove '31': iot_hue_lightdim '32': calendar_query '33': email_sendemail '34': iot_cleaning '35': audio_volume_down '36': play_radio '37': cooking_query '38': datetime_convert '39': qa_maths '40': iot_hue_lightoff '41': iot_hue_lighton '42': transport_query '43': music_likeness '44': email_query '45': play_music '46': audio_volume_mute '47': social_post '48': alarm_set '49': qa_factoid '50': calendar_set '51': play_game '52': alarm_remove '53': lists_remove '54': transport_taxi '55': recommendation_movies '56': iot_coffee '57': music_query '58': play_podcasts '59': lists_query - name: text dtype: string - name: annot_utt dtype: string - name: worker_id dtype: string - name: slot_method sequence: - name: slot dtype: string - name: method dtype: string - name: judgments sequence: - name: worker_id dtype: string - name: intent_score dtype: int8 - name: slots_score dtype: int8 - name: grammar_score dtype: int8 - name: spelling_score dtype: int8 - name: language_identification dtype: string - name: label_name dtype: string - name: label dtype: int64 splits: - name: train num_bytes: 171110 num_examples: 652 - name: validation num_bytes: 31311 num_examples: 122 - name: test num_bytes: 49862 num_examples: 189 download_size: 90317 dataset_size: 252283 --- # Dataset Card for "massive_general-de-DE" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

--- 数据集信息: 特征字段: - 字段名:id,数据类型:字符串 - 字段名:locale,数据类型:字符串 - 字段名:partition,数据类型:字符串 - 字段名:scenario:类别标签类型,类别映射如下: '0': 社交(social),'1': 交通(transport),'2': 日历(calendar),'3': 娱乐(play),'4': 新闻(news),'5': 日期时间(datetime),'6': 推荐(recommendation),'7': 邮件(email),'8': 物联网(IoT),'9': 通用(general),'10': 音频(audio),'11': 列表(lists),'12': 问答(QA),'13': 烹饪(cooking),'14': 外卖(takeaway),'15': 音乐(music),'16': 闹钟(alarm),'17': 天气(weather) - 字段名:intent:类别标签类型,类别映射如下: '0': 日期时间查询(datetime_query),'1': 物联网(IoT)Hue灯光调节(iot_hue_lightchange),'2': 交通票务(transport_ticket),'3': 外卖咨询(takeaway_query),'4': 问答-股票查询(qa_stock),'5': 通用问候(general_greet),'6': 活动推荐(recommendation_events),'7': 音乐厌恶反馈(music_dislikeness),'8': WeMo设备关闭(iot_wemo_off),'9': 烹饪食谱查询(cooking_recipe),'10': 问答-货币查询(qa_currency),'11': 交通路况查询(transport_traffic),'12': 通用趣味交互(general_quirky),'13': 天气查询(weather_query),'14': 音频音量上调(audio_volume_up),'15': 邮件添加联系人(email_addcontact),'16': 外卖下单(takeaway_order),'17': 邮件查询联系人(email_querycontact),'18': 飞利浦Hue灯光开启(iot_hue_lightup),'19': 地点推荐(recommendation_locations),'20': 有声书播放(play_audiobook),'21': 列表创建/添加(lists_createoradd),'22': 新闻查询(news_query),'23': 闹钟查询(alarm_query),'24': WeMo设备开启(iot_wemo_on),'25': 通用讲笑话(general_joke),'26': 问答-概念定义(qa_definition),'27': 社交咨询(social_query),'28': 音乐设置调整(music_settings),'29': 其他音频音量操作(audio_volume_other),'30': 日历事项删除(calendar_remove),'31': 飞利浦Hue灯光调暗(iot_hue_lightdim),'32': 日历事项查询(calendar_query),'33': 邮件发送(email_sendemail),'34': 物联网清洁设备控制(iot_cleaning),'35': 音频音量下调(audio_volume_down),'36': 广播播放(play_radio),'37': 烹饪咨询(cooking_query),'38': 日期时间转换(datetime_convert),'39': 问答-数学计算(qa_maths),'40': 飞利浦Hue灯光关闭(iot_hue_lightoff),'41': 飞利浦Hue灯光开启(iot_hue_lighton),'42': 交通咨询(transport_query),'43': 音乐喜好反馈(music_likeness),'44': 邮件查询(email_query),'45': 音乐播放(play_music),'46': 音频音量静音(audio_volume_mute),'47': 社交动态发布(social_post),'48': 闹钟设置(alarm_set),'49': 问答-事实类查询(qa_factoid),'50': 日历事项创建(calendar_set),'51': 游戏游玩(play_game),'52': 闹钟删除(alarm_remove),'53': 列表删除(lists_remove),'54': 出租车服务咨询(transport_taxi),'55': 电影推荐(recommendation_movies),'56': 物联网咖啡机控制(iot_coffee),'57': 音乐查询(music_query),'58': 播客播放(play_podcasts),'59': 列表查询(lists_query) - 字段名:text,数据类型:字符串 - 字段名:annot_utt,数据类型:字符串 - 字段名:worker_id,数据类型:字符串 - 字段名:slot_method:序列类型,包含两个子字段: - 槽位(slot):字符串类型 - 处理方法(method):字符串类型 - 字段名:judgments:标注质量评判结果,序列类型,包含以下子字段: - 标注者ID(worker_id):字符串类型 - 意图识别得分(intent_score):int8类型 - 槽位标注得分(slots_score):int8类型 - 语法得分(grammar_score):int8类型 - 拼写得分(spelling_score):int8类型 - 语言标识(language_identification):字符串类型 - 字段名:label_name,数据类型:字符串 - 字段名:label:整数型标签,数据类型:int64 数据划分: - 训练集(train):字节占用量171110,样本量652 - 验证集(validation):字节占用量31311,样本量122 - 测试集(test):字节占用量49862,样本量189 下载大小:90317字节,总数据集大小:252283字节 --- # 「massive_general-de-DE」数据集卡片 [需补充更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

提供机构:
fathyshalab
原始信息汇总

数据集概述

数据集名称

"massive_general-de-DE"

数据集特征

  • id: 字符串类型
  • locale: 字符串类型
  • partition: 字符串类型
  • scenario: 分类标签,包括:social, transport, calendar, play, news, datetime, recommendation, email, iot, general, audio, lists, qa, cooking, takeaway, music, alarm, weather
  • intent: 分类标签,包括:datetime_query, iot_hue_lightchange, transport_ticket, takeaway_query, qa_stock, general_greet, recommendation_events, music_dislikeness, iot_wemo_off, cooking_recipe, qa_currency, transport_traffic, general_quirky, weather_query, audio_volume_up, email_addcontact, takeaway_order, email_querycontact, iot_hue_lightup, recommendation_locations, play_audiobook, lists_createoradd, news_query, alarm_query, iot_wemo_on, general_joke, qa_definition, social_query, music_settings, audio_volume_other, calendar_remove, iot_hue_lightdim, calendar_query, email_sendemail, iot_cleaning, audio_volume_down, play_radio, cooking_query, datetime_convert, qa_maths, iot_hue_lightoff, iot_hue_lighton, transport_query, music_likeness, email_query, play_music, audio_volume_mute, social_post, alarm_set, qa_factoid, calendar_set, play_game, alarm_remove, lists_remove, transport_taxi, recommendation_movies, iot_coffee, music_query, play_podcasts, lists_query
  • text: 字符串类型
  • annot_utt: 字符串类型
  • worker_id: 字符串类型
  • slot_method: 序列类型,包含:
    • slot: 字符串类型
    • method: 字符串类型
  • judgments: 序列类型,包含:
    • worker_id: 字符串类型
    • intent_score: 8位整数类型
    • slots_score: 8位整数类型
    • grammar_score: 8位整数类型
    • spelling_score: 8位整数类型
    • language_identification: 字符串类型
  • label_name: 字符串类型
  • label: 64位整数类型

数据集分割

  • train: 652个样本,占用171110字节
  • validation: 122个样本,占用31311字节
  • test: 189个样本,占用49862字节

数据集大小

  • 下载大小: 90317字节
  • 数据集总大小: 252283字节
搜集汇总
数据集介绍
fathyshalab/massive_general-de-DE 数据集图片
构建方式
该数据集源自MASSIVE语料库,聚焦于德语(de-DE)通用场景下的自然语言理解任务。其构建基于众包平台,通过收集德语母语者在涵盖社交、交通、日历等18个场景中的自然表达,并标注了60种细粒度意图(如天气查询、音乐播放、闹钟设置等)。每条样本包含原始文本、标注后的规范化语句、槽位与对应方法、以及多名标注员对意图、槽位、语法和拼写的质量评分,确保了数据的高可靠性与一致性。
特点
数据集具有多维度结构化特征,包括唯一标识、语言区域、场景分类与意图标签,且所有类别均以预定义类标形式存在。特别地,数据提供槽位与方法的序列对,以及来自多名标注员的独立判断评分(如意图匹配度、语法正确性),支持对标注质量的量化评估。训练集、验证集与测试集分别包含652、122和189条样本,规模精炼,适用于快速原型验证与基准测试。
使用方法
该数据集可直接用于训练和评估德语口语理解系统。使用时,可将'text'字段作为模型输入,'intent'作为意图分类目标,'slot_method'作为序列标注或槽填充任务的监督信号。通过'judgments'中的评分字段,可筛选高质量子集或进行加权训练。推荐采用HuggingFace Datasets库加载,并基于预定义的数据划分(train/validation/test)进行模型开发与性能评估。
背景与挑战
背景概述
在自然语言处理领域,多语言任务导向型对话系统的研究日益受到关注,尤其是如何实现跨语言、跨场景的语义理解与意图识别。fathyshalab/massive_general-de-DE数据集是MASSIVE(Multilingual Augmented Speech and Semantic Intent and Slot Extraction)项目的一部分,由亚马逊Alexa团队主导创建,旨在提供涵盖60种语言、18个场景和60种意图的高质量标注数据。该数据集于2022年发布,其德语子集包含社交、交通、日历、天气等广泛场景,以及日期查询、设备控制、音乐播放等具体意图,为多语言对话系统的训练与评估提供了标准化基准。通过精细的槽位标注和多人评分机制,该数据集显著推动了跨语言语义理解的研究,尤其对德语区域的智能助手开发具有重要影响。
当前挑战
该数据集面临的挑战主要体现在领域问题与构建过程两方面。在领域问题层面,任务导向型对话系统需处理复杂的意图歧义与多轮交互,例如用户可能在同一句话中混合多个意图(如询问天气并设置闹钟),或使用非标准表达方式,这对模型的鲁棒性提出高要求。在构建过程中,数据集虽采用多人评分确保标注质量,但德语形态丰富、复合词多的特性增加了槽位标注的难度,例如时间表达和地点描述的变体需严格统一。此外,数据规模有限(训练集仅652条),可能难以覆盖真实场景中的长尾分布,导致模型在实际部署中泛化能力不足。最后,跨场景意图的平衡性(如‘一般’场景与‘智能家居’场景的样本分布不均)也是需要解决的挑战。
常用场景
经典使用场景
在自然语言处理与对话系统研究领域,fathyshalab/massive_general-de-DE 数据集作为多语言多领域任务导向对话理解的重要资源,其经典使用场景聚焦于意图识别与语义槽填充。该数据集覆盖了社交、交通、日历、音乐、物联网等18个核心场景,并标注了60种细粒度意图类别,为构建跨领域的德语对话系统提供了标准化的训练与评测基准。研究者通常利用该数据集训练基于Transformer的联合模型,同时预测用户意图并抽取关键语义槽,从而验证模型在复杂多轮对话中的泛化能力。
解决学术问题
该数据集有效解决了跨领域多意图对话理解中的标注稀疏与领域迁移难题。在学术研究中,它填补了德语高质量任务导向对话数据集的空白,为对比不同语言模型在意图分类和槽填充任务上的表现提供了公平的基准。通过其精细的意图层次结构和多工人标注机制,研究者能够深入分析模型在细粒度语义区分上的局限,推动了少样本学习、跨语言迁移以及对话状态追踪等方向的理论进展。
衍生相关工作
该数据集衍生了一系列经典工作,包括多语言对话理解模型XLM-R在德语场景下的微调策略研究,以及基于对比学习的意图表征优化方法。此外,研究者基于其标注体系提出了跨领域槽填充的迁移学习框架,并构建了融合外部知识图谱的对话推理模型。这些工作不仅深化了对任务导向对话中语义泛化机制的理解,还催生了面向低资源语言的对话系统预训练范式,例如将massive数据集与德语语音识别模型结合,推动了端到端口语理解系统的进步。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务