遇见数据集

ueg-training-data

收藏
Hugging Face2026-06-03 更新2026-06-04 收录
官方服务:

资源简介:

UEG训练数据集是一个为通用边缘网关的意图分类器自动生成的训练数据集合,旨在为边缘计算场景下的用户意图识别模型提供多样化的训练样本。数据集包含22个不同的意图类别,涵盖了从基础交互到复杂专业任务的广泛范围,具体包括:噪声/乱语、对抗性探测、问候/开场、寒暄社交、结束/感谢、用户界面命令、环境设备查询、导航意图、静态事实查询、动态事实查询、事务状态查询、休闲开放聊天、代码任务、结构化数据查询、结构化文档处理、形式化数学、分析推理、长文本创意生成、领域专家咨询、程序性指令、辩论/观点表达以及多语言任务。数据集目前处于持续构建和更新状态,总样本量为5,024条,最后更新于2026年6月3日。每个意图类别都有一个8,000条样本的构建目标,当前各类别的样本数量正在向此目标增长。该数据集适用于训练和评估面向边缘智能设备的、能够理解复杂和多模态用户意图的自然语言处理模型。

UEG Training Dataset is an automatically generated training data collection for the intent classifier of universal edge gateways, aiming to provide diverse training samples for user intent recognition models in edge computing scenarios. The dataset includes 22 distinct intent categories covering a wide range from basic interactions to complex professional tasks, specifically consisting of: noise/gibberish, adversarial probing, greetings/opening remarks, small talk, closing/gratitude, user interface commands, environmental device queries, navigation intents, static fact queries, dynamic fact queries, transaction status queries, casual open-ended chat, coding tasks, structured data queries, structured document processing, formal mathematics, analytical reasoning, long-text creative generation, domain expert consultation, procedural instructions, debate/opinion expression, and multilingual tasks. The dataset is currently under continuous construction and update, with a total of 5,024 samples, and was last updated on June 3, 2026. Each intent category has a construction target of 8,000 samples, and the current sample count for each category is growing toward this target. This dataset is suitable for training and evaluating natural language processing models for edge intelligent devices that can understand complex and multimodal user intents.

创建时间:
2026-06-02
原始信息汇总

数据集概述

  • 名称: UEG Training Data
  • 描述: 为通用边缘网关(Universal Edge Gateway,UEG)意图分类器自动生成的训练数据集。
  • 总样本数: 5,686
  • 状态: 运行中
  • 最后更新: 2026-06-03T20:53:44 UTC

类别进度

该数据集包含22个意图类别,每个类别当前样本数及目标样本数如下表所示,所有类别均处于运行中状态。

序号 类别 当前样本数 目标样本数 状态
1 noise_gibberish 261 8,000 进行中
2 adversarial_probe 420 8,000 进行中
3 greeting_open 291 8,000 进行中
4 phatic_social 389 8,000 进行中
5 closure_gratitude 363 8,000 进行中
6 ui_command 327 8,000 进行中
7 ambient_device_query 263 8,000 进行中
8 navigation_intent 165 8,000 进行中
9 factoid_static 304 8,000 进行中
10 factoid_dynamic 185 8,000 进行中
11 transactional_status 369 8,000 进行中
12 casual_open_chat 292 8,000 进行中
13 code_task 121 8,000 进行中
14 data_structured 204 8,000 进行中
15 document_structured 212 8,000 进行中
16 math_formal 257 8,000 进行中
17 analysis_reasoning 203 8,000 进行中
18 long_form_creative 210 8,000 进行中
19 domain_specialist 267 8,000 进行中
20 instruction_procedural 270 8,000 进行中
21 debate_opinion 180 8,000 进行中
22 multilingual_task 133 8,000 进行中
搜集汇总
数据集介绍
ueg-training-data 数据集图片
构建方式
该数据集作为Universal Edge Gateway(UEG)意图分类器的自动生成训练资源,旨在为边缘计算场景下的意图识别提供高质量的标注数据。构建过程采用系统性自动化生成技术,涵盖22个精心设计的意图类别,每个类别预设了8,000条样本的目标规模,当前总样本量已达5,686条。从噪音乱码到专业领域咨询,从简单问候到多语言任务,各类别均处于持续扩充状态,体现了工业级数据生产的规模与效率。
特点
数据集呈现出显著的语义多样性,跨越噪音过滤、对抗探测、社交寒暄、用户界面指令、环境设备查询等广泛的人机交互场景。其中法式结构化任务、数学形式化分析、文档结构化处理以及长文本创意生成等类别,展现了数据对复杂认知任务的覆盖能力。持续更新的动态特性与均衡的类别分布策略,确保了模型在不同意图维度上的泛化性能与鲁棒性。
使用方法
使用者可直接加载该数据集并映射至预定义的22类意图标签,适用于训练面向UEG系统的轻量级意图分类模型。基于HuggingFace Datasets库,开发者能够便捷地进行数据划分与批处理,结合持续增长的训练样本,在边缘网关设备上构建低延迟、高精度的自然语言理解模块。适合作为意图识别微调任务的基准资源。
背景与挑战
背景概述
在边缘计算与物联网设备快速普及的背景下,通用边缘网关(UEG)作为连接云端与终端设备的关键枢纽,其意图分类能力直接决定了人机交互的智能化水平。该数据集由相关研究团队于2026年创建,旨在为UEG意图分类器提供自动生成的训练数据,核心研究问题聚焦于如何使边缘设备精准识别涵盖22类复杂交互意图的语音或文本指令。作为专为边缘场景设计的训练集,它涵盖了从噪声干扰、对抗性探测到多语言任务等极端多样的意图类别,对推动轻量化、低延迟的边缘AI模型发展具有重要影响,填补了现有通用意图数据集在边缘计算领域针对性不足的空白。
当前挑战
该数据集面临的核心挑战包括:1)领域问题层面,UEG需在资源受限的边缘设备上实时处理包含噪声干扰、对抗性探测及多语言混合的复杂用户意图,现有模型难以同时满足高精度与低延迟的双重需求;2)构建过程中,当前各类意图样本数量严重不均衡(如code_task仅121条而目标为8000条),且自动生成数据需保证与真实边缘场景中方言、环境噪声及设备状态查询等长尾分布一致,这为数据增强策略与质量控制带来了显著的技术困难。
常用场景
经典使用场景
在智能边缘计算与物联网对话系统的研究版图中,意图识别被视为人机交互的核心基石。ueg-training-data数据集专为通用边缘网关(UEG)意图分类器的训练而设计,涵盖了从噪声干扰、对抗性探测到问候开场、社交寒暄、UI指令、环境设备查询、导航意图、事实查询、交易状态、代码任务、数学推导等22种细粒度意图类别。这一极其丰富的分类体系使其成为研究人员探索多类别意图分类算法的经典实验场,尤其在资源受限的边缘设备场景下,该数据集被广泛用于验证轻量级分类模型的稳定性与泛化能力。
实际应用
在实际应用层面,ueg-training-data为智能家居、智慧楼宇、工业物联网等场景中的边缘语音助手和交互网关提供了直接的数据支撑。例如,环境设备查询类别可用于训练用户对温度、灯光、能耗等状态的语音控制;导航意图类别可赋能室内定位与路径引导服务;事务状态查询则有助于物流与安防系统的实时交互。通过对这些实际意图的精准分类,UEG系统能够高效地在终端设备上运行,降低云端依赖,提升响应速度与隐私保护水平,最终实现更自然、更可靠的日常人机对话。
衍生相关工作
基于ueg-training-data的独特架构,研究者已衍生出多项经典工作,包括面向边缘计算的意图分类超轻量化模型设计、基于自蒸馏技术的多类别均衡策略、以及结合对抗训练的噪声鲁棒性增强方法。此外,该数据集也启发了针对细粒度意图语义结构的知识蒸馏研究,以及将意图识别与对话状态追踪进行联合优化的端到端模型。在更为前沿的方向上,多任务学习框架利用其22种类别构造了统一的边缘意图推理网络,进一步拓宽了边缘AI在通用网关上的能力边界,成为该领域不可忽视的数据基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务