遇见数据集

placingholocaust/spacy-project

收藏
Hugging Face2024-05-01 更新2024-06-11 收录
官方服务:

资源简介:

该数据集是Placing the Holocaust Weasel (spacy) Project的一部分,旨在通过分析大屠杀幸存者的证词,识别出命名和未命名的地点。项目创建了一个包含九个地点类别的分类法,并训练了模型来注释977份来自美国大屠杀纪念博物馆的战后证词转录本。最终目标是创建一个开放访问的网站,包含证词搜索引擎和地图工具(预计2024年夏季推出)。通过发布数据,希望其他人能够基于该方法论,分析自己的语料库,无论是与大屠杀相关还是无关,并开发自己的证词转录本分析方法。

该数据集是Placing the Holocaust Weasel (spacy) Project的一部分,旨在通过分析大屠杀幸存者的证词,识别出命名和未命名的地点。项目创建了一个包含九个地点类别的分类法,并训练了模型来注释977份来自美国大屠杀纪念博物馆的战后证词转录本。最终目标是创建一个开放访问的网站,包含证词搜索引擎和地图工具(预计2024年夏季推出)。通过发布数据,希望其他人能够基于该方法论,分析自己的语料库,无论是与大屠杀相关还是无关,并开发自己的证词转录本分析方法。

提供机构:
placingholocaust
原始信息汇总

数据集概述

数据集名称

  • Placing the Holocaust Weasel (spacy) Project

数据集内容

  • 包含977份来自美国大屠杀纪念馆的战后证言记录。
  • 用于训练和评估4种不同spaCy模型的数据和Python脚本。
  • 包括所有版本0.0.1的指标。

数据集用途

  • 用于分析大屠杀证言中的地点信息,包括已命名和未命名的地点。
  • 旨在通过开放访问网站提供证言记录的搜索和地图工具(预计2024年夏季推出)。

数据集标签

  • BUILDING
  • COUNTRY, CONTINENT, OR LARGER
  • ENVIRONMENTAL FEATURE
  • IMAGINARY OR OTHER
  • INTERIOR SPACE
  • LANDSCAPE FEATURE
  • OBJECTS
  • POPULATED PLACE
  • REGION

模型性能指标

总体性能

模型 精确度 召回率 F-Score
Small 94.1% 89.2% 91.6%
Medium 94.0% 90.5% 92.2%
Large 94.1% 91.7% 92.9%
Transformer 93.6% 91.6% 92.6%

按标签性能

模型 标签 精确度 召回率 F-Score
Small BUILDING 94.7% 90.2% 92.4%
Medium BUILDING 95.2% 92.8% 94.0%
Large BUILDING 94.8% 93.2% 94.0%
Transformer BUILDING 94.3% 94.2% 94.3%
Small COUNTRY 97.6% 94.6% 96.1%
Medium COUNTRY 96.5% 96.3% 96.4%
Large COUNTRY 97.7% 96.8% 97.2%
Transformer COUNTRY 96.6% 96.8% 96.7%
Small ENV_FEATURES 86.6% 81.2% 83.8%
Medium ENV_FEATURES 86.3% 79.1% 82.5%
Large ENV_FEATURES 77.5% 90.1% 83.3%
Transformer ENV_FEATURES 85.1% 86.9% 86.0%
Small INT_SPACE 93.8% 85.9% 89.6%
Medium INT_SPACE 93.9% 91.3% 92.6%
Large INT_SPACE 92.4% 93.8% 93.1%
Transformer INT_SPACE 94.6% 91.8% 93.2%
Small NPIP 92.7% 86.4% 89.4%
Medium NPIP 94.5% 82.4% 88.0%
Large NPIP 92.7% 86.6% 89.6%
Transformer NPIP 94.8% 83.0% 88.5%
Small POPULATED_PLACE 94.0% 90.6% 92.3%
Medium POPULATED_PLACE 93.0% 91.2% 92.1%
Large POPULATED_PLACE 95.2% 90.4% 92.7%
Transformer POPULATED_PLACE 92.1% 91.3% 91.7%
Small REGION 84.4% 68.4% 75.6%
Medium REGION 81.4% 75.8% 78.5%
Large REGION 83.0% 76.8% 79.8%
Transformer REGION 81.2% 68.4% 74.3%
Small SPATIAL_OBJ 96.0% 90.0% 92.9%
Medium SPATIAL_OBJ 95.2% 93.8% 94.5%
Large SPATIAL_OBJ 95.3% 95.5% 95.4%
Transformer SPATIAL_OBJ 96.3% 92.8% 94.5%

数据集许可证

  • MIT
搜集汇总
数据集介绍
构建方式
该数据集源自缅因大学‘安置大屠杀’项目,旨在突破传统地名识别框架,聚焦幸存者证词中那些被忽视的未命名场所。研究团队基于对977份美国大屠杀纪念博物馆证词转录文本的深入分析,构建了一套包含九类场所的分类体系,涵盖建筑、国家、环境特征等类别。数据采用spaCy v3.7.4框架处理,通过Prodigy工具进行人工标注,生成JSONL格式的原始语料,随后经句子切分、序列化转换及训练/验证/测试集划分,形成标准化的二元格式文件,支撑四种不同规模模型的训练与评估。
使用方法
用户可通过Weasel命令行工具复现完整工作流:首先执行`weasel assets`获取资产文件,随后运行`convert-sents`将原始数据转换为句子级格式,再通过`split`划分数据集。支持四种配置的训练方案,包括小型、中型、大型及Transformer模型,对应命令如`train-sm`等。训练完成后,使用`evaluate-sm`等命令评估模型并导出指标,最终通过`package`命令将模型打包为pip安装包,便于集成至下游分析管线或部署至开放访问平台。
背景与挑战
背景概述
在浩劫研究领域,传统地理分析往往聚焦于集中营、隔都等标识性地点,然而大量幸存者证词中提及的匿名场所——无名的街角、栅栏、农舍或山丘——同样承载着重要的历史记忆。为弥合这一认知鸿沟,缅因大学‘安置浩劫’项目团队在Anne Kelly Knowles教授主导下,自2022年起受美国国家人文基金会资助,构建了一套包含九类场所的精细化分类体系。该数据集基于美国大屠杀纪念博物馆977份战后证词文本,通过spaCy自然语言处理框架训练出四种规模的命名实体识别模型,旨在捕捉证词中从建筑、国家到环境特征、想象空间的多元地理意象。其开源成果不仅为浩劫研究提供了结构化语料,更开创了一种可迁移的场所分析方法论,显著拓展了数字人文在创伤叙事中的地理学阐释维度。
当前挑战
该数据集面临的核心挑战在于对非结构化历史文本的语义消歧:证词中大量场所术语存在语境依赖性,例如‘camp’既可指集中营也可指营地,‘gas’需结合上下文区分毒气室或汽油,而‘inside’‘outside’等抽象方位词更需精细的边界界定。构建过程中,团队需在标注阶段处理证词的多语言混杂性(如德语地名与英语叙述交织)、历史地名变迁(如波兰城市名称的德波双语变体),以及证词中因记忆模糊导致的指代跳跃。模型在‘环境特征’与‘区域’等类别间的F1值波动(如ENV_FEATURES类别从77.5%到90.1%的召回率差异),揭示了地理实体粒度划分与上下文窗口长度的权衡难题。此外,如何将九类标签的层级关系(如‘建筑物’与‘内部空间’的包含性)融入spaCy的span分类架构,亦是提升模型泛化能力的关键技术瓶颈。
常用场景
经典使用场景
该数据集的核心应用场景在于对历史证词文本进行细粒度地点的语义标注与识别,尤其聚焦于大屠杀幸存者证词中那些被忽视的非命名场所。通过构建包含九大地点类别(如建筑、环境特征、景观对象等)的精细分类体系,研究者能够利用spaCy框架训练命名实体识别模型,自动从近千份证词中抽取出诸如“无名街角”“栅栏”“山丘”等具有重要空间叙事意义的场所,从而突破传统历史地理学仅关注知名地点的局限。
解决学术问题
该数据集有效回应了数字人文领域长期存在的一个核心难题:如何在非结构化历史文本中系统捕捉并量化那些模糊、无名但具有深刻地理意涵的空间指涉。传统地名识别方法往往局限于已知地名词典,难以处理证词中大量出现的上下文依赖型地点表达。该工作通过定义环境特征、内部空间、想象场所等创新类别,结合高精度模型训练(F1值达92.9%),为历史地理学、记忆研究及语料库语言学提供了可复现的分析范式,推动了对受害者空间体验的实证化理解。
实际应用
在实际应用层面,该数据集及其训练模型已直接服务于美国大屠杀纪念博物馆977份证词的自动化标注工程,并支撑起一个集全文检索与地图可视化于一体的开放访问平台。研究者可借助该工具追溯不同地点类别在证词中的分布模式,探索空间记忆的叙事结构。此外,该数据集所采用的分类体系与spaCy训练流程具备高度可迁移性,可应用于其他历史档案(如战争日记、难民口述史)或当代社会文本(如移民叙事)中的地点挖掘与地理叙事分析。
数据集最近研究
最新研究方向
在数字人文与自然语言处理的交叉领域中,Placing the Holocaust项目通过构建精细化的地点分类体系(涵盖九类空间实体),利用spaCy框架训练了从轻量级到Transformer架构的多种模型,对977份大屠杀幸存者证词进行语义标注。这一前沿研究突破了传统历史地理分析对命名地点的依赖,将无名场所(如街角、栅栏、山丘)纳入系统化认知框架,揭示了纳粹暴力中空间失序与个体创伤的深层关联。模型在BUILDING、COUNTRY等类别上F1得分突破94%,即便在ENVIRONMENTAL FEATURE等抽象类别中也展现出稳健性能,为大规模非结构化证词文本的空间语义挖掘提供了可复现的技术范式。该成果不仅助力开放存取平台的构建,更推动着创伤地理学与计算语言学的深度融合,为其他领域中的空间叙事分析树立了方法论标杆。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务