遇见数据集

benayas/massive_llm_v0

收藏
Hugging Face2023-11-29 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: features: - name: id dtype: string - name: locale dtype: string - name: partition dtype: string - name: scenario dtype: class_label: names: '0': social '1': transport '2': calendar '3': play '4': news '5': datetime '6': recommendation '7': email '8': iot '9': general '10': audio '11': lists '12': qa '13': cooking '14': takeaway '15': music '16': alarm '17': weather - name: intent dtype: class_label: names: '0': datetime_query '1': iot_hue_lightchange '2': transport_ticket '3': takeaway_query '4': qa_stock '5': general_greet '6': recommendation_events '7': music_dislikeness '8': iot_wemo_off '9': cooking_recipe '10': qa_currency '11': transport_traffic '12': general_quirky '13': weather_query '14': audio_volume_up '15': email_addcontact '16': takeaway_order '17': email_querycontact '18': iot_hue_lightup '19': recommendation_locations '20': play_audiobook '21': lists_createoradd '22': news_query '23': alarm_query '24': iot_wemo_on '25': general_joke '26': qa_definition '27': social_query '28': music_settings '29': audio_volume_other '30': calendar_remove '31': iot_hue_lightdim '32': calendar_query '33': email_sendemail '34': iot_cleaning '35': audio_volume_down '36': play_radio '37': cooking_query '38': datetime_convert '39': qa_maths '40': iot_hue_lightoff '41': iot_hue_lighton '42': transport_query '43': music_likeness '44': email_query '45': play_music '46': audio_volume_mute '47': social_post '48': alarm_set '49': qa_factoid '50': calendar_set '51': play_game '52': alarm_remove '53': lists_remove '54': transport_taxi '55': recommendation_movies '56': iot_coffee '57': music_query '58': play_podcasts '59': lists_query - name: utt dtype: string - name: annot_utt dtype: string - name: worker_id dtype: string - name: slot_method sequence: - name: slot dtype: string - name: method dtype: string - name: judgments sequence: - name: worker_id dtype: string - name: intent_score dtype: int8 - name: slots_score dtype: int8 - name: grammar_score dtype: int8 - name: spelling_score dtype: int8 - name: language_identification dtype: string - name: category dtype: string - name: text dtype: string splits: - name: train num_bytes: 6371399 num_examples: 11514 - name: validation num_bytes: 1119231 num_examples: 2033 - name: test num_bytes: 1636424 num_examples: 2974 download_size: 1813395 dataset_size: 9127054 configs: - config_name: default data_files: - split: train path: data/train-* - split: validation path: data/validation-* - split: test path: data/test-* ---

数据集信息: 特征字段: - 字段名:ID(id),数据类型:字符串 - 字段名:区域设置(locale),数据类型:字符串 - 字段名:划分标识(partition),数据类型:字符串 - 字段名:场景(scenario),数据类型:类标签(class_label),类别名称映射: '0': 社交(social) '1': 交通(transport) '2': 日历(calendar) '3': 播放(play) '4': 新闻(news) '5': 时间日期(datetime) '6': 推荐(recommendation) '7': 邮件(email) '8': 物联网(IoT) '9': 通用(general) '10': 音频(audio) '11': 列表管理(lists) '12': 问答(qa) '13': 烹饪(cooking) '14': 外卖(takeaway) '15': 音乐(music) '16': 闹钟(alarm) '17': 天气(weather) - 字段名:意图(intent),数据类型:类标签(class_label),类别名称映射: '0': 时间日期查询(datetime_query) '1': 物联网Hue灯光调节(iot_hue_lightchange) '2': 交通票务(transport_ticket) '3': 外卖咨询(takeaway_query) '4': 问答-库存查询(qa_stock) '5': 通用问候(general_greet) '6': 活动推荐(recommendation_events) '7': 音乐反感(music_dislikeness) '8': 物联网Wemo设备关闭(iot_wemo_off) '9': 烹饪食谱查询(cooking_recipe) '10': 问答-货币相关(qa_currency) '11': 交通路况查询(transport_traffic) '12': 通用趣味请求(general_quirky) '13': 天气查询(weather_query) '14': 音频音量上调(audio_volume_up) '15': 邮件添加联系人(email_addcontact) '16': 外卖下单(takeaway_order) '17': 邮件查询联系人(email_querycontact) '18': 物联网Hue灯光点亮(iot_hue_lightup) '19': 地点推荐(recommendation_locations) '20': 播放有声书(play_audiobook) '21': 列表创建/添加条目(lists_createoradd) '22': 新闻查询(news_query) '23': 闹钟查询(alarm_query) '24': 物联网Wemo设备开启(iot_wemo_on) '25': 通用讲笑话(general_joke) '26': 问答-定义查询(qa_definition) '27': 社交互动查询(social_query) '28': 音乐设置(music_settings) '29': 其他音频音量操作(audio_volume_other) '30': 日历删除事件(calendar_remove) '31': 物联网Hue灯光调暗(iot_hue_lightdim) '32': 日历查询(calendar_query) '33': 邮件发送(email_sendemail) '34': 物联网清洁设备操作(iot_cleaning) '35': 音频音量下调(audio_volume_down) '36': 播放广播(play_radio) '37': 烹饪咨询(cooking_query) '38': 时间日期转换(datetime_convert) '39': 问答-数学计算(qa_maths) '40': 物联网Hue灯光关闭(iot_hue_lightoff) '41': 物联网Hue灯光开启(iot_hue_lighton) '42': 交通查询(transport_query) '43': 音乐喜好表达(music_likeness) '44': 邮件查询(email_query) '45': 播放音乐(play_music) '46': 音频静音(audio_volume_mute) '47': 社交发帖(social_post) '48': 闹钟设置(alarm_set) '49': 问答-事实性查询(qa_factoid) '50': 日历创建事件(calendar_set) '51': 游玩游戏(play_game) '52': 闹钟删除(alarm_remove) '53': 列表删除条目(lists_remove) '54': 交通打车(transport_taxi) '55': 电影推荐(recommendation_movies) '56': 物联网咖啡机操作(iot_coffee) '57': 音乐查询(music_query) '58': 播放播客(play_podcasts) '59': 列表查询(lists_query) - 字段名:用户语句(utt),数据类型:字符串 - 字段名:标注语句(annot_utt),数据类型:字符串 - 字段名:标注人员ID(worker_id),数据类型:字符串 - 字段名:槽位与方法(slot_method),数据类型:序列(sequence)类型,包含: - 槽位(slot):字符串类型 - 处理方法(method):字符串类型 - 字段名:标注评判(judgments),数据类型:序列(sequence)类型,包含: - 标注人员ID(worker_id):字符串类型 - 意图标注得分(intent_score):8位整型(int8) - 槽位标注得分(slots_score):8位整型(int8) - 语法得分(grammar_score):8位整型(int8) - 拼写得分(spelling_score):8位整型(int8) - 语言识别结果(language_identification):字符串类型 - 字段名:分类(category),数据类型:字符串 - 字段名:文本(text),数据类型:字符串 数据划分: - 划分名称:训练集(train),字节数:6371399,样本数量:11514 - 划分名称:验证集(validation),字节数:1119231,样本数量:2033 - 划分名称:测试集(test),字节数:1636424,样本数量:2974 下载大小:1813395,数据集总大小:9127054 配置项: - 配置名称:default,数据文件路径: - 训练集:data/train-* - 验证集:data/validation-* - 测试集:data/test-*

提供机构:
benayas
原始信息汇总

数据集信息

特征

  • id: 字符串类型
  • locale: 字符串类型
  • partition: 字符串类型
  • scenario: 分类标签类型,包含以下类别:
    • social
    • transport
    • calendar
    • play
    • news
    • datetime
    • recommendation
    • email
    • iot
    • general
    • audio
    • lists
    • qa
    • cooking
    • takeaway
    • music
    • alarm
    • weather
  • intent: 分类标签类型,包含以下类别:
    • datetime_query
    • iot_hue_lightchange
    • transport_ticket
    • takeaway_query
    • qa_stock
    • general_greet
    • recommendation_events
    • music_dislikeness
    • iot_wemo_off
    • cooking_recipe
    • qa_currency
    • transport_traffic
    • general_quirky
    • weather_query
    • audio_volume_up
    • email_addcontact
    • takeaway_order
    • email_querycontact
    • iot_hue_lightup
    • recommendation_locations
    • play_audiobook
    • lists_createoradd
    • news_query
    • alarm_query
    • iot_wemo_on
    • general_joke
    • qa_definition
    • social_query
    • music_settings
    • audio_volume_other
    • calendar_remove
    • iot_hue_lightdim
    • calendar_query
    • email_sendemail
    • iot_cleaning
    • audio_volume_down
    • play_radio
    • cooking_query
    • datetime_convert
    • qa_maths
    • iot_hue_lightoff
    • iot_hue_lighton
    • transport_query
    • music_likeness
    • email_query
    • play_music
    • audio_volume_mute
    • social_post
    • alarm_set
    • qa_factoid
    • calendar_set
    • play_game
    • alarm_remove
    • lists_remove
    • transport_taxi
    • recommendation_movies
    • iot_coffee
    • music_query
    • play_podcasts
    • lists_query
  • utt: 字符串类型
  • annot_utt: 字符串类型
  • worker_id: 字符串类型
  • slot_method: 序列类型,包含以下子特征:
    • slot: 字符串类型
    • method: 字符串类型
  • judgments: 序列类型,包含以下子特征:
    • worker_id: 字符串类型
    • intent_score: 8位整数类型
    • slots_score: 8位整数类型
    • grammar_score: 8位整数类型
    • spelling_score: 8位整数类型
    • language_identification: 字符串类型
  • category: 字符串类型
  • text: 字符串类型

数据集划分

  • train: 包含11514个样本,6371399字节
  • validation: 包含2033个样本,1119231字节
  • test: 包含2974个样本,1636424字节

数据集大小

  • 下载大小: 1813395字节
  • 数据集大小: 9127054字节

配置

  • default: 包含以下数据文件路径:
    • train: data/train-*
    • validation: data/validation-*
    • test: data/test-*
搜集汇总
数据集介绍
benayas/massive_llm_v0 数据集图片
构建方式
在智能语音助手与对话系统蓬勃发展的时代背景下,大规模、高质量的多语言指令数据成为驱动大型语言模型能力提升的关键基石。该数据集以Massive数据集为基础,通过引入人工标注与自动化校验相结合的混合策略进行构建。具体而言,数据采集流程首先由众包工作者根据预定义的场景与意图分类体系生成原始话语,随后经过多轮质量审核,包括对意图识别准确度、槽位填充完整性、语法正确性及拼写规范性的评分,最终筛选出高质量样本。数据集覆盖了社交、交通、日历、音乐、天气等17个核心场景及60种细粒度意图,并包含了多语言标注版本,确保其在跨语言任务中的适用性。
特点
该数据集最显著的特点在于其结构化与多维度的标注体系。每个样本不仅包含原始话语(utt)与注释话语(annot_utt),还详细记录了场景(scenario)、意图(intent)、槽位及对应方法(slot_method),并附有来自多名评判者的质量评分(judgments),涵盖意图、槽位、语法与拼写四个维度。这种精细化的标注设计使得数据集不仅可用于意图分类与槽位填充任务,还能支撑对话质量评估与多任务学习研究。此外,数据集划分了明确的训练集(11,514条)、验证集(2,033条)与测试集(2,974条),为模型训练与性能评估提供了标准化的基准。
使用方法
该数据集可直接通过HuggingFace的datasets库加载,使用默认配置即可获取划分好的train、validation与test三个子集。研究人员可将文本字段(text或utt)作为模型输入,结合场景与意图标签进行监督学习。对于槽位填充任务,可利用slot_method字段中的槽位序列与对应方法进行序列标注训练。数据集中包含的多语言版本与质量评分字段,还可用于构建鲁棒性更强的多任务模型或进行数据筛选实验。推荐在加载时指定trust_remote_code=True以确保兼容性,并依据任务需求选择对应的特征字段进行下游微调。
背景与挑战
背景概述
在自然语言处理领域,任务型对话系统(Task-Oriented Dialogue Systems)一直是人机交互研究的核心方向,其目标在于精准理解用户意图并执行具体操作。benayas/massive_llm_v0数据集由研究团队于近期创建,旨在为大规模语言模型(LLM)驱动的多领域任务型对话提供高质量训练与评估基准。该数据集覆盖了社交、交通、日历、音乐、智能家居(IoT)等18个场景,并细分为60种意图类别,如天气查询、闹钟设置、音乐播放等,充分模拟了现实世界中用户与智能助手的复杂交互场景。通过包含多语言标注(如英语、德语等)及人工审核的评分机制(涵盖意图、槽位、语法、拼写等维度),该数据集显著提升了模型在跨领域、多轮对话中的泛化能力,对推动LLM在智能助手、语音控制等应用中的落地具有重要影响力。
当前挑战
当前,benayas/massive_llm_v0数据集面临的主要挑战集中于领域问题的复杂性与构建过程的精细性。在领域问题层面,任务型对话需同时处理意图识别与槽位填充的联合任务,而该数据集涵盖的18个场景和60种意图导致类别间存在高度相似性(如“音乐喜好”与“音乐设置”),易引发模型混淆;此外,多语言版本的数据增加了跨语言迁移的难度,尤其在低资源语言上表现不稳定。在构建过程中,挑战体现在数据标注的一致性与质量控制上:虽然引入了多维度人工评分(如意图与槽位得分),但不同标注员对同一话语的理解偏差仍难以完全消除;同时,数据集仅包含1.6万条样本,对于需要大规模预训练的LLM而言,样本量相对不足,可能限制模型在罕见意图或场景下的鲁棒性。
常用场景
经典使用场景
在自然语言理解与任务型对话系统研究领域,MASSIVE_LLM_V0数据集以其丰富的多语言、多场景标注而著称。经典使用场景聚焦于跨领域意图识别与槽位填充联合建模,涵盖社交、交通、日历、音乐、智能家居等18个典型生活场景。研究者借助该数据集可构建能够精准理解用户多样化指令的对话模型,例如区分“打开客厅灯”与“调暗卧室灯光”等细微意图差异,并提取相应槽位信息。其结构化标注体系为评估模型在复杂多轮交互中的语义解析能力提供了标准化基准。
衍生相关工作
基于MASSIVE_LLM_V0,学术界涌现出一系列开创性工作。典型如Meta团队提出的mT5多语言对话预训练模型,利用该数据集验证了跨语言知识迁移的有效性。另有研究者开发了基于对比学习的意图解耦框架,通过挖掘数据集中细粒度槽位标签实现零样本意图发现。在工业界,Amazon Alexa团队借鉴其场景分类体系,构建了面向家庭自动化的层次化对话状态追踪模型。这些工作共同推动了任务型对话从单语言、单领域向多语言、跨场景的演进,成为现代对话AI研究的重要基石。
数据集最近研究
最新研究方向
随着大语言模型在任务型对话系统中的广泛应用,如何精准理解用户意图并完成跨领域、多轮交互的语义解析成为前沿热点。benayas/massive_llm_v0数据集覆盖了社交、交通、日历、音乐、物联网等17个场景与60种意图类别,为研究多领域、细粒度的意图识别与槽位填充提供了丰富语料。近期研究聚焦于利用该数据集训练统一的多任务模型,探索零样本与少样本迁移学习能力,以应对现实世界中动态变化的用户需求。此外,该数据集在评估大模型对复杂指令的理解与执行能力方面具有重要价值,推动了任务型对话系统从封闭域向开放域的演进,对智能助手、智能家居等实际应用场景的落地产生了深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务