Kubhist 2数据集是由瑞典哥德堡大学的Språkbanken Text创建、整理并提供的,涵盖了从1640年代到1900年代的瑞典报纸的OCR文本。该数据集在HuggingFace上的版本仅包含OCR文本,并按年代划分为多个子集,每个子集包含一行文本,且只保留长度超过4个单词的句子。数据集的总大小为7999426267字节,包含285384149个例子。数据集的语言为瑞典语,许可证为CC B
Das Vorhaben 'Digitalisierung historischer Zeitungen', in dessen Rahmen diese Daten generiert wurden, ist Teil des Projektes 'Deutsch-tschechisches Digital Humanities Labor zur grenzübergreifenden his