遇见数据集

CO.RA.PAN Sample Corpus (Public)

收藏
Zenodo2025-05-10 更新2026-05-26 收录
官方服务:

资源简介:

Das „Sample Corpus“ ist eine gekürzte, anonymisierte Teilmenge des vollständigen CO.RA.PAN-Korpus und dient als Demonstrations- und Testdaten­archiv. Es umfasst ausgewählte Transkriptionssegmente mit vollständiger linguistischer Annotation (Token-Timing, POS-Tags, Lemmata, Dependenzen, morpho­syn­taktische Merkmale), die mit dem spaCy-Modell es_dep_news_trf und ergänzenden Post-Processing-Regeln (z. B. Perfekt- und Futur-Klassifikation) erzeugt wurden. Im Rahmen der CO.RA.PAN-Web­applikation lädt der Player automatisch die gleichnamige MP3-Aufnahme und das zugehörige JSON-File synchron, sodass Nutzer:innen Ausschnitte anhören und die Annotationen im Browser nachvollziehen können. Das Sample zeigt die interne Struktur der Datenbank an (Segmente, Sprecher-IDs, Klassifikations­codes), ohne urheberrechtlich geschützte Inhalte offenzulegen. Es ermöglicht Entwickler:innen frühzeitiges Testen der Such-, Filter- und Ab­spielfunktionen und belegt transparent, wie FAIR-konforme Metadaten und Transkriptionen in CO.RA.PAN umgesetzt werden.

提供机构:
Zenodo
创建时间:
2025-05-10
二维码
社区交流群
二维码
科研交流群
商业服务