phucdev/fabner
收藏资源简介:
FabNER是一个用于命名实体识别(NER)的制造业文本数据集,包含从Web of Science获取的制造业过程科学领域的文献摘要,共计超过350,000个单词。每个单词都被标注了特定的实体类别,如材料(MATE)、制造过程(MANP)、机器/设备(MACEQ)等,标注格式为BIOES(B=开始,I=中间,O=外部,E=结束,S=单个)。数据集包含多个配置,如fabner、fabner_bio、fabner_simple和text2tech,每个配置都有不同的实体标签集。数据集的结构包括训练集、验证集和测试集,分别包含9435、2183和2064个实例。
FabNER是一个用于命名实体识别(NER)的制造业文本数据集,包含从Web of Science获取的制造业过程科学领域的文献摘要,共计超过350,000个单词。每个单词都被标注了特定的实体类别,如材料(MATE)、制造过程(MANP)、机器/设备(MACEQ)等,标注格式为BIOES(B=开始,I=中间,O=外部,E=结束,S=单个)。数据集包含多个配置,如fabner、fabner_bio、fabner_simple和text2tech,每个配置都有不同的实体标签集。数据集的结构包括训练集、验证集和测试集,分别包含9435、2183和2064个实例。
数据集概述
基本信息
- 数据集名称: FabNER
- 数据集类型: 制造文本数据集,用于命名实体识别
- 语言: 英语
- 语言创建者: 发现
- 许可证: 其他
- 多语言性: 单语
- 数据集大小: 10K<n<100K
- 标签: 制造, 2000-2020
- 任务类别: 令牌分类
- 任务ID: 命名实体识别
数据集结构
- 配置名称: fabner, fabner_bio, fabner_simple, text2tech
- 特征:
- id: 字符串类型,实例ID
- tokens: 字符串序列,句子中的令牌列表
- ner_tags: 分类标签序列,实体标签列表
- 分割:
- train: 9435个示例,4394010字节
- validation: 2183个示例,934347字节
- test: 2064个示例,940136字节
- 下载大小: 1265830字节
- 数据集大小: 6268493字节
数据集内容
- 摘要: FabNER是一个包含超过350,000字的制造文本语料库,用于命名实体识别。该数据集包含从Web of Science获取的制造过程科学研究领域的期刊摘要。
- 实体标签: 包括材料(MATE)、制造过程(MANP)、机器/设备(MACEQ)、应用(APPL)、特征(FEAT)、机械性能(PRO)、表征(CHAR)、参数(PARA)、启用技术(ENAT)、概念/原理(CONPRI)、制造标准(MANS)和生物医学(BIOP)。
- 标注格式: 使用BIOES格式进行标注,其中B=开始,I=中间,O=外部,E=结束,S=单个。
引用信息
@article{DBLP:journals/jim/KumarS22, author = {Aman Kumar and Binil Starly}, title = {"FabNER": information extraction from manufacturing process science domain literature using named entity recognition}, journal = {J. Intell. Manuf.}, volume = {33}, number = {8}, pages = {2393--2407}, year = {2022}, url = {https://doi.org/10.1007/s10845-021-01807-x}, doi = {10.1007/s10845-021-01807-x}, timestamp = {Sun, 13 Nov 2022 17:52:57 +0100}, biburl = {https://dblp.org/rec/journals/jim/KumarS22.bib}, bibsource = {dblp computer science bibliography, https://dblp.org} }




