nlp-tlp/MaintNorm
收藏资源简介:
MaintNorm数据集包含12,000条英文文本,主要来自澳大利亚三家主要矿业公司的维护工单。该数据集标注了词汇标准化和实体标记任务,是工业环境中自然语言处理研究和应用的宝贵资源。数据集结构包括三个公司特定来源的数据和一个整合数据集,支持细粒度和综合分析。掩码方案用于处理隐私和数据特异性,包括资产标识符、敏感信息、数字实体和日期等。数据集实例展示了标准化的格式,每个文本类似于CoNLL03格式,每个标记与其标准化或掩码对应部分由制表符分隔。
MaintNorm数据集包含12,000条英文文本,主要来自澳大利亚三家主要矿业公司的维护工单。该数据集标注了词汇标准化和实体标记任务,是工业环境中自然语言处理研究和应用的宝贵资源。数据集结构包括三个公司特定来源的数据和一个整合数据集,支持细粒度和综合分析。掩码方案用于处理隐私和数据特异性,包括资产标识符、敏感信息、数字实体和日期等。数据集实例展示了标准化的格式,每个文本类似于CoNLL03格式,每个标记与其标准化或掩码对应部分由制表符分隔。
MaintNorm 数据集概述
数据集基本信息
- 许可证: MIT
- 文本类别: 词汇归一化
- 语言: 英语
- 数据集名称: MaintNorm
- 数据集大小: 10,000 < n < 100,000
- 多语言性: 单语种
数据集描述
- 内容: MaintNorm 数据集包含12,000个英语短文本,这些文本是从澳大利亚三大矿业组织的维护工作订单中提取的。数据集针对词汇归一化和令牌级实体标记任务进行了注释,适用于工业环境中的自然语言处理研究和应用。
- 数据结构: 数据集包含来自三个不同公司源的数据(
company_a,company_b,company_c),以及一个整合了这些源数据的combined数据集,支持细粒度和全面的分析。
数据集实例
-
格式: 数据集采用标准归一化格式,类似于WNUT共享任务中使用的格式。每个文本类似于CoNLL03格式,令牌由换行符分隔,每个令牌与其归一化或屏蔽的对应部分由制表符分隔。
-
示例: txt Exhaust exhaust Fan fan #6 number <num> Tripping tripping c/b circuit breaker
HF338 <id> INVESTAGATE investigate 24V <num> V FAULT fault
引用信息
-
引用文献:
@inproceedings{bikaun-etal-2024-maintnorm, title = "{M}aint{N}orm: A corpus and benchmark model for lexical normalisation and masking of industrial maintenance short text", author = "Bikaun, Tyler and Hodkiewicz, Melinda and Liu, Wei", booktitle = "Proceedings of the Ninth Workshop on Noisy and User-generated Text (W-NUT 2024)", year = "2024", address = "San {.G}iljan, Malta", publisher = "Association for Computational Linguistics", pages = "68--78", }




