遇见数据集

Automatisierung statt manueller Prüfung: KI-basierte Verfahren zur Analyse sensibler Freitextdaten

收藏
Zenodo2026-04-29 更新2026-05-26 收录
官方服务:

资源简介:

Hintergrund: Der Datenaustausch im Bereich der Gesundheitsforschung ist entscheidend, um eine zielgerichtete und individualisierte Behandlung zu ermöglichen. Voraussetzung für eine datenschutzkonforme Sekundärdatennutzung ist, dass Anonymisierungsverfahren für verschiedene Datentypen vorliegen, um die Privatsshäre der Personen zu schützen. Fragestellung: Wir untersuchen, ob sich „open-weight" Large Language Models (LLMs) eignen, um sensible Freitextdaten in Befragungen automatisch zu anonymisieren. Und ob die Zuverlässigkeit (Klassifikationsleistung) des Modells ausreichend ist, um eine automatisierte Verarbeitung und Datenausleitung zu ermöglichen, was eine aufwendige manuelle Prüfung, die bei großen Datensätzen an Ressourcengrenzen stößt, ersetzen könnte. Methoden und Datensatz: Es wurde ein kontrollierter Testdatensatz erstellt, der auf realen Antworten von 8.022 Teilnehmenden einer Befragung zur terzo-Gehörtherapie basiert. Der Datensatz umfasst insgesamt 120 manuell erstellte Testantworten - mit Personenbezug und ohne Personenbezug für drei verschiedene offene Fragen. Zur Evaluierung wurde das lokale Modell gpt-oss:20b eingesetzt, wobei ein einfacher Prompt verwendet wurde zu Klassifikation einer Textangabe in ohne Personenbezug sowie mit Personenbezug in vier verschiedenen Kategorien (Namen, Alter/Datum, Orte, medizinische Diagnosen).

提供机构:
Zenodo
创建时间:
2026-04-29
二维码
社区交流群
二维码
科研交流群
商业服务