five

Svenska tidningar 1871-1906

收藏
DataCite Commons2025-12-12 更新2025-04-16 收录
下载链接:
https://spraakbanken.gu.se/resurser/svenska-tidningar-1871-1906
下载链接
链接失效反馈
官方服务:
资源简介:
Svenska tidningar 1871–1906 innehåller ett urval av digitaliserade versioner av svenska tidningar från 1871 till 1906. Det är en del av den så kallad Kubhist corpus which was digitized at Kubhist-korpus som digitaliserades av Kungliga biblioteket (KB). En tidning valdes slumpmässigt from varje år. För varje tidning valdes två sidor, andra och fjärde. Sidorna bearbetades automatiskt med hjälp av avancerad dokumentlayoutanalys där varje segment i den digitaliserade sidan inramades och numrerades. Vidare har varje segment bearbetades med Abbyy FineReader version 11 och slutligen transkriberades manuellt av ett transkriptionsföretag som är specialiserat på så kallad double-keying. Denna datamängd innehåller 74 sidor, 45,445 segment och 337,635 ord totalt. Materialet producerades inom projektet Utvärdering och förfining av en förbättrad OCR-process för massdigitalisering som finansieras av RJ (dnr IN18-0940: 1) för perioden 2019-2020.
提供机构:
Språkbanken Text
创建时间:
2024-06-18
5,000+
优质数据集
54 个
任务类型
进入经典数据集
二维码
社区交流群

面向社区/商业的数据集话题

二维码
科研交流群

面向高校/科研机构的开源数据集话题

数据驱动未来

携手共赢发展

商业合作