CO.RA.PAN Sample Corpus (Public)
收藏资源简介:
Das „Sample Corpus“ ist eine gekürzte, anonymisierte Teilmenge des vollständigen CO.RA.PAN-Korpus und dient als Demonstrations- und Testdatenarchiv. Es umfasst ausgewählte Transkriptionssegmente mit vollständiger linguistischer Annotation (Token-Timing, POS-Tags, Lemmata, Dependenzen, morphosyntaktische Merkmale), die mit dem spaCy-Modell es_dep_news_trf und ergänzenden Post-Processing-Regeln (z. B. Perfekt- und Futur-Klassifikation) erzeugt wurden. Im Rahmen der CO.RA.PAN-Webapplikation lädt der Player automatisch die gleichnamige MP3-Aufnahme und das zugehörige JSON-File synchron, sodass Nutzer:innen Ausschnitte anhören und die Annotationen im Browser nachvollziehen können. Das Sample zeigt die interne Struktur der Datenbank an (Segmente, Sprecher-IDs, Klassifikationscodes), ohne urheberrechtlich geschützte Inhalte offenzulegen. Es ermöglicht Entwickler:innen frühzeitiges Testen der Such-, Filter- und Abspielfunktionen und belegt transparent, wie FAIR-konforme Metadaten und Transkriptionen in CO.RA.PAN umgesetzt werden.



