遇见数据集

mboth/sichern-200-undersampled

收藏
Hugging Face2023-09-22 更新2024-03-04 收录
官方服务:

资源简介:

--- configs: - config_name: default data_files: - split: train path: data/train-* - split: test path: data/test-* - split: valid path: data/valid-* dataset_info: features: - name: Datatype dtype: string - name: Beschreibung dtype: string - name: Name dtype: string - name: Unit dtype: string - name: text dtype: string - name: Grundfunktion dtype: string - name: label dtype: class_label: names: '0': Brandmeldeanlage '1': Brandschutzklappe '2': Einbruchmeldeanlage '3': Entrauchung-Ventilator '4': Feuerlöschanlage '5': Gaswarnanlage '6': Notruf '7': Rauchmeldeanlage splits: - name: train num_bytes: 105747.49344744584 num_examples: 537 - name: test num_bytes: 186480 num_examples: 935 - name: valid num_bytes: 186480 num_examples: 935 download_size: 148661 dataset_size: 478707.49344744586 --- # Dataset Card for "sichern-200-undersampled" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

### 配置项 - 配置名称:default 数据文件: - 划分集:训练集(train),路径:data/train-* - 划分集:测试集(test),路径:data/test-* - 划分集:验证集(valid),路径:data/valid-* ### 数据集信息 特征字段: - 名称:数据类型(Datatype),数据类型:字符串 - 名称:描述(Beschreibung),数据类型:字符串 - 名称:名称(Name),数据类型:字符串 - 名称:单位(Unit),数据类型:字符串 - 名称:文本(text),数据类型:字符串 - 名称:基本功能(Grundfunktion),数据类型:字符串 - 名称:标签(label),数据类型:分类标签(class_label),标签映射: '0': 火灾报警系统(Brandmeldeanlage) '1': 防火阀(Brandschutzklappe) '2': 入侵报警系统(Einbruchmeldeanlage) '3': 排烟风机(Entrauchung-Ventilator) '4': 灭火系统(Feuerlöschanlage) '5': 气体报警系统(Gaswarnanlage) '6': 紧急呼叫(Notruf) '7': 烟雾报警系统(Rauchmeldeanlage) ### 数据划分 - 训练集(train):字节数105747.49344744584,样本量537 - 测试集(test):字节数186480,样本量935 - 验证集(valid):字节数186480,样本量935 整体统计:下载大小148661,数据集总大小478707.49344744586 --- # 「sichern-200-欠采样版」数据集卡片 [需补充更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

提供机构:
mboth
原始信息汇总

数据集概述

数据集配置

  • 配置名称: default
  • 数据文件:
    • 训练集: data/train-*
    • 测试集: data/test-*
    • 验证集: data/valid-*

数据集信息

  • 特征:
    • Datatype: 字符串类型
    • Beschreibung: 字符串类型
    • Name: 字符串类型
    • Unit: 字符串类型
    • text: 字符串类型
    • Grundfunktion: 字符串类型
    • label: 分类标签,包含以下类别:
      • 0: Brandmeldeanlage
      • 1: Brandschutzklappe
      • 2: Einbruchmeldeanlage
      • 3: Entrauchung-Ventilator
      • 4: Feuerlöschanlage
      • 5: Gaswarnanlage
      • 6: Notruf
      • 7: Rauchmeldeanlage

数据集分割

  • 训练集:
    • 字节数: 105747.49344744584
    • 样本数: 537
  • 测试集:
    • 字节数: 186480
    • 样本数: 935
  • 验证集:
    • 字节数: 186480
    • 样本数: 935

数据集大小

  • 下载大小: 148661
  • 数据集大小: 478707.49344744586
搜集汇总
数据集介绍
构建方式
该数据集名为mboth/sichern-200-undersampled,专为建筑安全领域的文本分类任务而设计。在构建过程中,研究者从原始数据中提取了包含Datatype、Beschreibung、Name、Unit、text及Grundfunktion六个字段的样本,并针对类别分布不均的问题采用了欠采样策略,使得训练集、测试集和验证集分别包含537、935和935个样本,最终形成了平衡性更优的数据划分。数据集以HuggingFace Datasets的标准格式存储,train、test和valid三个分片均以通配符路径加载,便于后续的自动化处理与复现。
特点
该数据集的核心特点在于其多字段结构与明确的分类体系。每个样本不仅包含用于分类的text字段,还附带了Datatype、Beschreibung等辅助信息,为模型提供了丰富的上下文。标签体系涵盖八类建筑安全装置,如Brandmeldeanlage(火灾报警系统)和Brandschutzklappe(防火阀)等,覆盖了建筑安全领域的关键设备。通过欠采样处理,数据集的类别分布更为均衡,有助于缓解模型对多数类的偏倚,提升在少数类上的泛化能力。
使用方法
使用时,开发者可通过HuggingFace Datasets库直接加载该数据集,指定split参数即可获取训练、测试或验证分片。每个样本的text字段可作为模型输入,label字段则对应预定义的八类标签。数据集适用于多分类文本分类任务,可结合预训练语言模型进行微调。建议在训练前对text字段进行必要的预处理,如分词或去除噪声,并利用验证集监控模型性能,最终在测试集上评估泛化效果。
背景与挑战
背景概述
在智能建筑与工业安全领域,基于自然语言处理的设备分类任务正逐渐成为提升自动化管理水平的关键技术。由mboth团队构建的sichern-200-undersampled数据集,诞生于对安全设备文本描述进行精准分类的研究需求中,其核心研究问题在于如何通过文本特征识别诸如火灾报警系统、防烟阀、气体报警装置等八类关键安全设备。该数据集创建于近期,旨在为低资源场景下的文本分类提供基准测试平台,通过下采样策略平衡类别分布,从而推动安全领域信息检索与知识图谱构建的进步。其影响力体现在为多语言安全文档分析、设备故障排查及应急响应系统提供了标准化的训练与评估数据。
当前挑战
该数据集面临的挑战首先体现在领域问题的复杂性上:安全设备分类需处理高度专业化的技术术语与多义性描述,例如‘Brandmeldeanlage’与‘Rauchmeldeanlage’在功能上存在重叠,导致类别边界模糊。构建过程中,下采样策略虽缓解了类别不平衡,却显著减少了训练样本量(仅537条),加剧了模型在细粒度分类中的过拟合风险。此外,德语文本的复合词结构与缩写(如‘Entrauchung-Ventilator’)增加了特征提取难度,而有限的数据规模难以支撑复杂深度学习模型的有效训练,亟需通过迁移学习或数据增强技术突破性能瓶颈。
常用场景
经典使用场景
在工业安全与建筑自动化领域,该数据集主要用于多类别文本分类任务,尤其是针对火灾报警系统、排烟风机、气体报警装置等八类安全设备的描述性文本进行自动归类。研究者可基于其包含的‘text’字段与‘label’标签,训练监督学习模型以识别不同安全设备的功能属性,从而实现对安全设备文档的智能化处理。
解决学术问题
该数据集有效解决了安全设备文本分类中类别不平衡与标注数据稀缺的学术难题。通过采用欠采样策略,它缓解了多数类对少数类的淹没效应,为研究类别平衡技术提供了基准。其意义在于推动了建筑安全领域自然语言处理方法的创新,使得模型能够更精准地辨别不同安全设备的细微语义差异,提升了自动化分类的鲁棒性。
衍生相关工作
基于该数据集,衍生出一系列针对工业文本分类的经典工作,包括基于预训练语言模型的微调方法(如BERT在德语安全文本上的适配)、特征工程与欠采样策略的融合研究,以及跨领域迁移学习的探索。这些工作不仅优化了安全设备分类的性能,还促进了多标签分类与少样本学习在工程文档处理中的理论发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务