遇见数据集

Ulrich Nahrendorf: Westfalen in Endneolithikum und Früher Bronzezeit. Der Katalog als SQLite Datenbank.

收藏
Zenodo2026-04-01 更新2026-05-26 收录
官方服务:

资源简介:

Version 1.0 (2026-04-01) Summary The SQLite database organises the text-based information from the catalogue into a simply structured, relational database. The 948 catalogue numbers have been supplemented with coordinates and the resulting affiliation to the natural regions of the study area. Similarly, the artefact groups and characteristic groups of pottery 1–4 were recorded (s. Nahrendorf 2018, Tab. 10,12). The structure is explained and the content supplemented with an initial, simple analyses based on the available data to intodruce into a possible workflow. Vorbemerkung Der Text wird mit dem Programm RStudio (2026.1.0.392) in R-Markdown erstellt (introduction.Rmd) und ausschließlich als HTML zur Verfügung gestellt. Natürlich kann dieses Script auch in POSITRON oder QUARTO verwendet werden. Dieser Text und die Daten, die in drei Versionen und Dateiformaten vorliegen (s.u.), werden als Einheit verstanden. Der Text dient einerseits der Darstellung der zur Verfügung gestellten Daten, andererseits auch der Vermittlung von R mit SQLite als Datenquelle durch eine erste Auswertung. Der verwendete Code und die zugehörigen Kommentare stehen in sogenannten Code chunks (Codeblock), die als Teil des Textes a priori eingebunden aber zugleich ausgeblendet sind. Jeder Codeblock kann mit [Show] ein- und mit [Hide] ausgeblendet werden. Es werden möglichst wenige R-Pakete verwendet (pacman, DBI, ggoplot2, magrittr): 1 Einleitung Die Daten entstammen folgender Publikation: U. Nahrendorf, Westfalen in Endneolithikum und Früher Bronzezeit: Untersuchungen zur Besiedlungsgeschichte der Nordwestdeutschen Landschaft zwischen Niederrhein und Mittelweser. Universitätsforschungen zur prähistorischen Archäologie 309 (Bonn 2018). Es handelt sich um die von Ulrich Nahrendorf zur Dissertation an der Westfälischen Wilhelms-Universität Münster im Jahr 1989 eingereichte Arbeit. Schon während der Arbeit war Ulrich Nahrendorf schwer erkrankt und ist vor der Veröffentlichung bereits 1993 verstorben. Die Redaktion und Veröffentlichung erfolgte nach der Aufarbeitung des Manuskriptes im LWL-Archäologie für Westfalen. (s. Vorwort) Die Lektüre des Vorwortes ist für die Kenntnis der Entstehungsgeschichte und die angemessene Wertung dieser Arbeit wichtig. Eine kritische Bewertung zum Forschungsstand und der Auswertung erfolgte in einer Rezension durch: D. P. Mielke, Archäologische Informationen 42, 2019, 435–439. DOI ai.2019.0.69476. Die verwendeten Geodaten zu den Naturräumlichen Haupteinheiten (kurz: Naturraum, NR) stammen vom GEOportal.nrw und können sowohl über die Suche auf der Startseite (Bereich “Katalog”) als auch über OpenGeodata.NRW heruntergeladen oder als WMS genutzt werden. Die Daten wurden im Rahmen einer Übung im Bereich Archäoinformatik an der Christian-Albrechts-Universität zu Kiel im WS 2025/26 aufbereitet, in die vorliegende Datenbank überführt und erste Analysen durchgeführt, um den Mehrwert der nun vorliegenden Nachnutzbarkeit aufzuzeigen. Angewendet wurden Reguläre Ausdrücke im Texteditor Notepad++, der DB Browser for SQLite, QGIS und RStudio Desktop. 2 Die Daten und Tabellen Der Katalog ist sehr klar strukturiert, nur vereinzelt ergeben sich kleine Unzulänglichkeiten für die hier gewählte flache, einfache Struktur. Dies ist bei den Katalognummern (KatNr) mit mehreren Befunden der Fall, z.B. KatNr 64. Hier entscheidet, wie im textbasierten Katalog, die Abfolge der Nennung über die Zugehörigkeit der Fundobjekte zum jeweils zuvor genannten Befund unter dieser KatNr. Diese Abfolge ist aber durch die ID der Tabelle bei Bedarf zu erschließen. Der Katalog von Nahrendorf nennt keine Koordinaten und die Fundpunkte auf den Karten der Tafeln besitzen keine KatNr. Eine Verbindung der Sach- und Raumdaten ist also nicht möglich. Für diese Datenbank wurden deshalb 1. die von der LWL-Archäologie für Westfalen, Nils Wolpert, zur Verfügung gestellten Koordinaten und 2. die in Google Earth ermittelten und kontrollierten Positionen verwendet. Die Lokalisierung ist demnach nicht exakt, kann eventuell deutliche Abweichungen aufweisen und dient ausschließlich einer großmaßstäbigen Kartierung innerhalb des Untersuchungsgebietes. Die textbasierten Daten des Kataloges liegen primär als eine Datei mit SQL-Anweisungen vor nahrendorf2018.sql. Daraus generiert ist die SQLite-Datenbank nahrendorf2018.sqlite. Die SpatiaLite-Datei nahrendorf2018_geo.sqlite wurde zuerst mit QGIS erstellt und dann wurden im DB Browser for SQLite die Anweisungen aus der Datei nahrendorf2018.sql ausgeführt. Die DB Verwaltung von QGIS beherrscht leider nicht das Ausführen multipler Anweisungen durch BEGIN TRANSACTION; [...] COMMIT;. Nachfolgend wurden die Polygone für die oben genannten NR im Untersuchungsgebiet importiert. Diese SpatiaLite-Datei ist wegen der GIS-Implikationen über zehnmal größer. Für die Darstellung und die Analyse der Informationen in R (RStudio) wird eine Verbindung zur SQLite-Datenbank (DB) hergestellt. Nachfolgend kann auf diese Verbindung mit R- und SQL-Anweisungen in den entsprechenden gekennzeichneten Codeblöcken zugegriffen werden ({r …}, {sql …}). R und SQL sind leicht zu unterscheiden, die SQL-Anweisungen beginnen hier fast ausnahmslos mit SELECT. In SQL werden Großbuchstaben traditionell zur Syntaxhervorhebung genutzt, die Großschreibung ist hier aber nicht relevant, in R schon. Die Namen der Tabellen sind weitgehend selbsterklärend. Für die Struktur wird nachfolgend jeweils die CREATE TABLE-Anweisung ausgegeben und nachfolgend der Inhalt knapp dargestellt. Die 6 Tabellen nr table name 1 Fundorte 2 Gruppen 3 KatNrGruppen 4 Katalog 5 Koord 6 Kreise 2.1 Fundorte CREATE TABLE “Fundorte” (“KatNr” INT NOT NULL,“Name” TEXT,“KreisID” TEXT,PRIMARY KEY(“KatNr”),CONSTRAINT “ref_FundortKreisID” FOREIGN KEY(“KreisID”) REFERENCES “Kreise”(“KreisID”)) Die Tabelle Fundorte beinhaltet jede KatNr als eindeutigen Eintrag, dazu den ggf. redundanten Fundortnamen, dies ist z.B. bei Ahaus-Alstätte der Fall, und das Kreiskürzel als externe Referenz zur Tabelle Kreise. Die Tabelle enthält 948 Einträge. Die Anzahl der Fundorte je Kreis ist sehr unterschiedlich und nur bedingt von der Fläche des Kreises abhängig: BI: 19, BO: 6, BOR: 79, BOT: 9, COE: 42, DO: 12, EN: 11, GE: 5, GT: 20, HA: 32, HAM: 13, HER: 7, HF: 17, HSK: 17, HX: 73, LIP: 56, MI: 109, MK: 33, MS: 20, OE: 3, PB: 47, RE: 87, SI: 4, SO: 61, ST: 76, UN: 42, WAF: 48

版本1.0(2026年4月1日) 摘要 本SQLite数据库(SQLite)将编目的文本类信息整理为结构简洁的关系型数据库。本次数据集为948条编目编号补充了坐标信息,以及其所属研究区自然区域的关联信息。同理,本数据集还记录了人工制品组(artefact groups)以及1-4号陶器的特征组相关信息(详见Nahrendorf 2018年表10、12)。本数据集对数据库结构进行了说明,并基于现有数据开展了初步的简易分析,以展示可行的数据分析工作流。 前言 本文档采用RStudio集成开发环境(RStudio,版本2026.1.0.392)基于R标记文档(R-Markdown)格式编写(文件名为introduction.Rmd),仅提供超文本标记语言(HTML)格式版本。当然,本脚本也可在POSITRON或QUARTO环境中运行。本文档与以三种版本及文件格式存储的数据集(详见下文)视为一个完整整体。 本文档一方面用于展示所提供的数据集,另一方面则通过初步数据分析,演示如何以R语言结合SQLite作为数据源开展研究。本项目所使用的代码及配套注释均存储于所谓的代码块(Code chunks)中,这些代码块作为文档的固有组成部分默认隐藏。每个代码块均可通过[Show]按钮展开,或通过[Hide]按钮隐藏。 本数据集仅调用少量R语言软件包(R packages):pacman、DBI、ggoplot2、magrittr: 1 引言 本数据集源自以下学术出版物: U. Nahrendorf, Westfalen in Endneolithikum und Früher Bronzezeit: Untersuchungen zur Besiedlungsgeschichte der Nordwestdeutschen Landschaft zwischen Niederrhein und Mittelweser. Universitätsforschungen zur prähistorischen Archäologie 309 (Bonn 2018). 该出版物的原始内容为Ulrich Nahrendorf于1989年在明斯特大学威斯特伐利亚威廉大学提交的博士论文。Ulrich Nahrendorf在论文撰写期间身患重病,并于1993年正式出版前逝世。该论文经LWL威斯特伐利亚考古研究所(LWL-Archäologie für Westfalen)整理手稿后完成编辑与出版(详见前言)。阅读前言对于了解本研究的创作背景及合理评价该成果至关重要。 针对该研究的学术现状与数据分析成果的批判性评述见于以下书评: D. P. Mielke, Archäologische Informationen 42, 2019, 435–439. DOI: ai.2019.0.69476. 本数据集所使用的自然区域主体单元(简称自然区域,NR)地理数据源自GEOportal.nrw平台,可通过该平台首页的搜索功能(“目录”板块)或OpenGeodata.NRW平台下载,亦可作为Web地图服务(WMS,Web Map Service)调用。 本数据集是在基尔大学克里斯蒂安-阿尔布雷希特校区2025/26学年冬季学期的考古信息学课程实践中整理完成的:将原始数据转换为当前的数据库格式,并开展初步分析,以展示本数据集可被二次利用的附加价值。本次数据处理使用了文本编辑器Notepad++的正则表达式功能、SQLite数据库浏览器(DB Browser for SQLite)、QGIS及RStudio Desktop软件。 2 数据集与数据表 原始编目结构清晰,但针对本次采用的扁平化简易数据库结构,存在少量细微的适配问题。例如当编目编号(KatNr)对应多个发掘遗存时,就会出现此类问题,如KatNr 64。与文本版编目一致,此类情况下,遗存的归属关系由编号下各发现物的命名顺序决定,但如需追溯具体次序,可通过数据表的ID字段进行查询。 Nahrendorf的原始编目未提供坐标信息,且插图板块中的发掘点位未标注编目编号,因此无法直接将实物数据与空间数据进行关联。为此,本数据库采用了两类坐标数据:1. 由LWL威斯特伐利亚考古研究所的Nils Wolpert提供的坐标;2. 通过Google Earth获取并校验的点位信息。因此,本次的空间定位并非精确坐标,可能存在显著偏差,仅适用于研究区内的小比例尺制图。 原始编目的文本数据最初以包含SQL语句(SQL statements)的nahrendorf2018.sql文件形式存储,并由此生成SQLite数据库nahrendorf2018.sqlite。SpatiaLite空间数据库(SpatiaLite)nahrendorf2018_geo.sqlite首先通过QGIS创建,随后在SQLite数据库浏览器(DB Browser for SQLite)中执行nahrendorf2018.sql文件中的SQL语句。遗憾的是,QGIS的数据库管理功能无法执行通过BEGIN TRANSACTION; [...] COMMIT; 包裹的多条SQL语句。随后,研究区内前述自然区域(NR)的多边形矢量数据被导入该SpatiaLite数据库。由于包含GIS空间信息,该SpatiaLite数据库的体积比普通SQLite数据库大十倍以上。 为在R语言(RStudio环境)中展示并分析数据,需先建立与SQLite数据库(DB)的连接。随后,可在标记为对应格式的代码块中,通过R语言或SQL语句访问该数据库连接(代码块标记格式为{r …}或{sql …})。R语言与SQL语句易于区分:本数据集的SQL语句几乎均以SELECT开头。在SQL中,传统上使用大写字母突出语法结构,但本数据集的SQL语句大小写不敏感,而R语言则严格区分大小写。 各数据表的名称大多一目了然。下文将逐一给出各表的CREATE TABLE语句,并简要说明其内容。 共包含6张数据表: | 序号 | 表名 | |------|------| | 1 | Fundorte | | 2 | Gruppen | | 3 | KatNrGruppen | | 4 | Katalog | | 5 | Koord | | 6 | Kreise | 2.1 发掘点位表 CREATE TABLE "Fundorte" ("KatNr" INT NOT NULL, "Name" TEXT, "KreisID" TEXT, PRIMARY KEY("KatNr"), CONSTRAINT "ref_FundortKreisID" FOREIGN KEY("KreisID") REFERENCES "Kreise"("KreisID")) 发掘点位表中,每条记录以唯一的编目编号(KatNr)作为主键,同时包含可能存在冗余的发掘点位名称(例如Ahaus-Alstätte),以及作为外部关联字段的行政区缩写(KreisID),用于关联行政区表。该数据表共包含948条记录。各行政区的发掘点位数量差异显著,且仅与行政区面积存在弱相关性: BI: 19, BO: 6, BOR: 79, BOT: 9, COE: 42, DO: 12, EN: 11, GE: 5, GT: 20, HA: 32, HAM: 13, HER: 7, HF: 17, HSK: 17, HX: 73, LIP: 56, MI: 109, MK: 33, MS: 20, OE: 3, PB: 47, RE: 87, SI: 4, SO: 61, ST: 76, UN: 42, WAF: 48

提供机构:
Zenodo
创建时间:
2026-04-01
二维码
社区交流群
二维码
科研交流群
商业服务