Automatisierung statt manueller Prüfung: KI-basierte Verfahren zur Analyse sensibler Freitextdaten
收藏资源简介:
Hintergrund: Der Datenaustausch im Bereich der Gesundheitsforschung ist entscheidend, um eine zielgerichtete und individualisierte Behandlung zu ermöglichen. Voraussetzung für eine datenschutzkonforme Sekundärdatennutzung ist, dass Anonymisierungsverfahren für verschiedene Datentypen vorliegen, um die Privatsshäre der Personen zu schützen. Fragestellung: Wir untersuchen, ob sich „open-weight" Large Language Models (LLMs) eignen, um sensible Freitextdaten in Befragungen automatisch zu anonymisieren. Und ob die Zuverlässigkeit (Klassifikationsleistung) des Modells ausreichend ist, um eine automatisierte Verarbeitung und Datenausleitung zu ermöglichen, was eine aufwendige manuelle Prüfung, die bei großen Datensätzen an Ressourcengrenzen stößt, ersetzen könnte. Methoden und Datensatz: Es wurde ein kontrollierter Testdatensatz erstellt, der auf realen Antworten von 8.022 Teilnehmenden einer Befragung zur terzo-Gehörtherapie basiert. Der Datensatz umfasst insgesamt 120 manuell erstellte Testantworten - mit Personenbezug und ohne Personenbezug für drei verschiedene offene Fragen. Zur Evaluierung wurde das lokale Modell gpt-oss:20b eingesetzt, wobei ein einfacher Prompt verwendet wurde zu Klassifikation einer Textangabe in ohne Personenbezug sowie mit Personenbezug in vier verschiedenen Kategorien (Namen, Alter/Datum, Orte, medizinische Diagnosen).



