Diversity-Analysis Dataset (BA Meier 2025)
收藏资源简介:
Finaler Datensatz zur Bachelorarbeit „Analyse diversitätsbezogener Passagen in deutschsprachigen Stellenanzeigen mittels automatisierter, hybrider Klassifikation“.Der Datensatz basiert auf einem ursprünglichen Korpus von rund 160.000 (überwiegend )deutschsprachigen Stellenanzeigen (Erhebungsjahr 2022). Davon wurden etwa 20.000 Anzeigen durch ein vortrainiertes DistilBERT-Modell als diversitätsrelevant identifiziert und bilden die Grundlage der Analyse. Der hier archivierte finale DataFrame enthält: die vollständigen Originalvariablen der Ausgangsdaten (ca. 54 Spalten; Stellenanzeigen-Text, Metadaten, Unternehmensinformationen, Standortangaben, Plattformmetadaten usw.) Kontextfaktoren, die teilweise bereinigt und harmonisiert wurden: Region (stark bereinigt und vereinheitlicht) Qualifikationsniveau (neu erzeugt über Keyword-Matching, anschließend harmonisiert) Branche und Unternehmensgröße (übernommen aus den Originaldaten; nicht bereinigt) LLM-gestützte Klassifikationslabels— Version 23: erzeugt über gpt-4.0, Batch-API, deterministische Inferenz— Version 39: erzeugt über gpt-3.5-turbo-0125, Batch-API, deterministische Inferenz regelbasierte Klassifikationslabels (Regex)zur Identifikation expliziter Muster (AGG-Bezüge, Diversitätsdimensionen nach Stichwortset, geschlechtergerechte Schreibweisen usw.) Hybrid-Labels, die LLM- und Regex-Ergebnisse zusammenführen(logische Union-Variante der Dimensionenlabels) Der Datensatz liegt als Pickle-Datei im Python-kompatiblen Format vor.Er ist aus Gründen des Datenschutzes sowie der Nutzungsrechte an Textkorpora mit restricted access archiviert.



