遇见数据集

Data for Training and Evaluating Metadata Extraction Models based on 15 Thousand Cyrillic Script Publications

收藏
Zenodo2021-04-22 更新2026-05-25 收录
数据链接:
官方服务:

资源简介:

<strong>Description</strong><br> Data for training and evaluating sequence labeling models for metadata extraction based on 15,553 Cyrillic script language papers spanning 27 years and three languages. For each paper, ground truth sequence labeling output is provided in TEI format and as annotated plain text. The <strong>code</strong> used for creating and evaluating the data set can be found on GitHub. For <strong>citing</strong>, you can refer to our paper introducing the data set: <pre><code>@inproceedings{kssf-2021-cyrillic, title = {{Bootstrapping Multilingual Metadata Extraction: A Showcase in Cyrillic}}, author = {Krause, Johan and Shapiro, Igor and Saier, Tarek and F{\"a}rber, Michael}, booktitle = {Proceedings of the Second Workshop on Scholarly Document Processing}, year = {2021} }</code></pre>

提供机构:
Zenodo
创建时间:
2021-04-22
二维码
社区交流群
二维码
科研交流群
商业服务