This dataset provides detailed metadata on ca. 10.2 million works of fiction and non-fiction written after 1799 in 521 different languages. The dataset bolsters the May 2022 Hathifile by supplying mis
Multi-Lingual UVigoMED (ML-UVigoMED) is a multilingual single-label corpus composed of 11,126 English biomedical documents extracted from Wikipedia about human medicine, and 12,521 documents written