遇见数据集

Sprachliche Evolution von wissenschaftlichen Veröffentlichungen im Zeitalter von generativer Künstlicher Intelligenz

收藏
Zenodo2025-06-12 更新2026-05-26 收录
官方服务:

资源简介:

Übersicht Forschungsvorhaben Bei den hier zur Verfügung gestellten Daten handelt es sich um den digitalen Anhang zur Masterarbeit "Sprachliche Evolution von wissenschaftlichen Veröffentlichungen im Zeitalter von generativer Künstlicher Intelligenz". Im Rahmen der Arbeit wurden deutschsprachige Fachbeiträge untersucht und Veränderungen im verwendeten Vokabular bestimmt. Bereitgestellt werden hier die dafür verwendeten Scripte und die erzeugten Daten. Übersicht der Forschungsdaten Downloads.zip: Dieses Verzeichnis enthält alle heruntergeladenen Artikel im PDF-Format. Hierbei handelt es sich um die Datengrundlage der Arbeit. Die Texte sind nach Jahren (2018-2024, ohne 2022) in Unterverzeichnissen zusammengefasst. Die originalen Dateinamen wurden beibehalten und nicht verändert. Tabellendokumente.zip: In diesem Verzeichnis liegen alle Datein im CSV- oder xlsx-Format. Es handelt sich dabei sowohl um Zwischen- als auch Endergebnisse. Code.zip: In diesem Verzeichnis liegen alle verwendeten Python-Scripte. Es können drei Arbeitsschritte voneinander unterschieden werden: Die Extraktion (extraction) von Daten, die Vorverarbeitung (preprocessing) und die Analyse (analysis). Zusätzlich zum Gegenstand der Untersuchung sind die Arbeitsschritte im Dateinamen angegeben. Zusätzlich gibt es Scripte zur API-Abfrage der Datenbank OpenAlex. Zwischenergebnisse.zip: Für manche Analysen ist es notwendig, die vorverarbeiteten Daten zu sichern um sie anschließend zu analysieren. Diese Zwischenergebnisse sind in diesem Verzeichnis hinterlegt. Sie liegen als .dat oder .pkl vor. Abbildungen.zip: Alle in der Arbeit verwendeten Abbildungen sind in diesem Verzeichnis hinterlegt. DMP_Heise.pdf: Der Datenmanagementplan enthält detaillierte Informationen zur Erzeugung der Forschungsdaten und ihren rechtlichen Aspekten. Reproduktion der Forschungsdaten Um die in der Arbeit präsentierten Ergebnisse zu reproduzieren sind folgende Schritte notwendig: Als Datengrundlage müssen die Texte heruntergeladen werden (Downloads.zip). Eine erneute Abfrage der API wird eine leicht andere Datengrundlage ergeben. In den Python-Scripten müssen die Pfade zur Datengrundlage angepasst werden. Dies gilt auch, wenn mit Zwischenergebnissen gearbeitet wird. Zur Ausführung der Python-Scripte müssen ggf einzelne Module installiert werden. Eine geeignete IDE ist hier hilfreich. (Im Projekt wurde Spyder bzw. Anaconda verwendet). Nachnutzung der Forschungsdaten Die Daten können gemäß CC-BY nachgenutzt werden. Projektstatus abgeschlossen. Die Veröffentlichung der Masterarbeit erfolgt nach abgeschlossener Begutachtung. English Version The research data for the thesis titled "Language Evolution of scientific articles in times of ChatGPT" is provided. In this project you will find several python-scripts to extraxt words from open access publications and analyze their frequencies.For more context please read the corresponding publication. Both the data as well as the thesis are in german.

提供机构:
Zenodo
创建时间:
2025-06-12
二维码
社区交流群
二维码
科研交流群
商业服务