遇见数据集

Multilingual Metadata Annotation Dataset for Persian, Arabic, and English Scientific Articles

收藏
Mendeley Data2026-09-09 收录
官方服务:

资源简介:

This dataset contains 635 annotated JSON files for metadata extraction from scientific articles in Persian (352), English (142), and Arabic (141). Each file contains header annotations (title, authors, affiliations, abstract, keywords, venue information, DOI) and reference annotations (17,832 reference strings with 12 metadata fields including title, authors, journal, volume, pages, year, DOI, publisher, organization, book ID, and reference type). The dataset was annotated by 10 trained annotators over one year using a custom Java-based labeling tool. Articles were collected from 580+ open-access conferences and journals. This is the first publicly available multilingual annotated dataset for metadata extraction from Persian and Arabic scientific literature.

创建时间:
2026-08-24
二维码
社区交流群
二维码
科研交流群
商业服务