Analyse sprachlicher und struktureller Einflussfaktoren auf Fehlklassifikationen von KI-Systemen – Forschungsdaten
收藏资源简介:
Der Datensatz umfasst 600 reale Störungsmeldungen aus Arbeitsnachweisen eines österreichischen Infrastrukturbetreibers im Aufzugsbereich. Jede Meldung ist durch eine Expert:innenreferenz auf zwei Ebenen klassifiziert: vier funktionale Hauptkategorien (Funktionsebene E1) und 20 Komponentenklassen (Komponentenebene E2). Ergänzend enthält der Datensatz die im Rahmen der Studie berechneten sprachlichen und strukturellen Merkmale je Meldung (u. a. Textlänge, Fachwortanzahl, Grammatikfehler, Ambiguität, KI-Konfidenz, Ellipsen- und Fragmentierungsgrad) sowie die Klassifikationsausgaben eines vortrainierten Sprachmodells (GPT-4o-mini, Zero-Shot-Verfahren). Die Daten dienen als empirische Grundlage für eine logistische Regressionsanalyse zur Untersuchung von Einflussfaktoren auf Fehlklassifikationen in KI-gestützten Ticket-Klassifikationssystemen.



