遇见数据集

Compositionality Trend Prediction dataset

收藏
arXiv2026-07-13 更新2026-07-15 收录
官方服务:

资源简介:

本数据集由斯图加特大学研究团队构建,旨在探究德语和英语名词复合词的语义演变与组合性趋势。该数据集包含23个德语和26个英语目标复合词,通过历时语料库中每十年的上下文组合性评分,形成跨多个十年的组合性趋势数据。数据创建过程涉及从历时语料库中采样并人工标注组合性评分,以捕捉复合词含义的渐变过程。该数据集主要应用于自然语言处理领域,特别是词汇语义变化检测任务,旨在解决复合词组合性随时间变化的量化分析问题,为语义演变建模提供细粒度的时间序列评估基准。

This dataset was constructed by a research team from the University of Stuttgart, aiming to explore the semantic evolution and compositionality trends of German and English noun compounds. It includes 23 target German noun compounds and 26 target English noun compounds, forming compositional trend data spanning multiple decades based on decade-by-decade contextual compositionality scores extracted from the diachronic corpus. The data creation process involves sampling from the diachronic corpus and manually annotating compositionality scores to capture the gradual semantic shift of compound words. This dataset is primarily applied in the field of Natural Language Processing (NLP), particularly for lexical semantic change detection tasks. It aims to address the quantitative analysis of temporal changes in the compositionality of noun compounds, and provides fine-grained time-series evaluation benchmarks for semantic evolution modeling.

提供机构:
斯图加特大学
创建时间:
2026-07-13
搜集汇总
数据集介绍
Compositionality Trend Prediction dataset 数据集图片
构建方式
该数据集旨在捕捉德英名词复合词组合性在时间维度上的演变趋势。研究团队从历时语料库中选取了23个德语与26个英语名词复合词作为目标,基于其跨数十年的上下文频率变化确定关键拐点。围绕每个拐点,以十年为粒度,从目标复合词出现的上下文中抽取样本,并邀请标注员对每个样本中复合词与其构成成分之间的语义关联程度进行0至5分的评分,最终构建出涵盖多个十年段的组合性评分序列及其随时间变化的趋势标签。
使用方法
该数据集适用于组合性趋势预测任务,研究者可基于不同时间窗口(如单十年、滑动窗口或全时段)训练静态或上下文语义表示模型,通过比较复合词及其成分的向量相似度或聚类分布来预测每十年的组合性得分。评估指标包括将预测趋势与标注趋势进行线性回归拟合(R²)以及对复合词变化幅度进行排序相关性分析(Spearman's ρ)。数据集代码与标注已公开,支持复现研究并扩展至其他语言或复合词类型。
背景与挑战
背景概述
该数据集由斯图加特大学的Chris Jenkins等研究人员于2026年创建,聚焦于德语和英语名词复合词的语义变化现象,核心研究问题在于探究复合词构成性(compositionality)随时间推移的渐变规律。研究团队创新性地提出了构成性趋势预测(Compositionality Trend Prediction, CTP)任务,并构建了一个包含23个德语和26个英语目标复合词、按十年为粒度采样的历时语料库内构成性评分数据集。该数据集独特地提供了每个十年的评分及相应的变化趋势,从而能够检验关于构成性随时间趋于非透明化的经典假设。这一资源对词汇语义变化领域具有重要影响力,为理解多词表达的历史语义演变提供了全新的实证基础与方法框架。
当前挑战
该数据集所面临的挑战主要体现在两方面。其一,领域问题上,传统词汇语义变化检测(LSCD)多聚焦于两个时期间的二元比较,而该任务要求对多个时间步下的名词复合词构成性进行连续预测,这对模型捕捉细微渐变趋势的能力提出了更高要求。其二,构建过程中,由于名词复合词在历时语料中相对稀疏,研究人员不得不依赖精心挑选的少量目标词,并通过相对频率变化曲线确定语义可能发生变化的拐点(inflection points),每词仅保留1-2个拐点及其前后最多五个十年的上下文。此外,注释任务本身具有高度复杂性,注释者对中间量表的解读存在分歧,导致注释者间一致性(Krippendorff's alpha)处于中等水平,这为建立可靠的金标准构成性评分带来了显著困难。
常用场景
经典使用场景
该数据集的核心用途在于追踪和预测复合名词在历时语料中的组合性变化趋势。研究者可依据每十年标注的组合性评分,分析特定复合词(如德语'Donnerwetter'或英语'ice water')在跨世纪语料中的语义透明度演变,从而验证复合词是否随时间推移逐渐丧失组合性这一经典假设。
解决学术问题
该数据集解决了历时语义变化研究中长期存在的两个关键难题:其一,突破了传统双时段对比范式的局限,通过提供细粒度(每十年)的组合性标注,使得研究者能够捕捉语义变化的渐进过程而非仅测量变化幅度;其二,为'复合词组合性随时间递减'这一理论假设提供了首批实证检验。研究发现仅存在微弱的负向趋势,挑战了语言学文献中长期持有的决定性观点。这一发现促进了更精细的历时语义分析框架的发展。
实际应用
在实际应用中,该数据集为自然语言处理领域提供了评估语义表示模型在细粒度时间维度上性能的基准测试平台。研究者可利用这些标注数据比较不同架构(如上下文无关的Word2Vec与上下文相关的BERT或二阶随机索引)在不同时间粒度(单十年、滑动窗口或半世纪窗口)训练下的表现差异。这为历史文本分析、数字人文研究中的语义变迁检测工具开发提供了实验依据和方法论指导。
数据集最近研究
最新研究方向
针对名-名复合词语义组成性随时间演变的趋势预测,该数据集专注于细粒度的时间切片分析,挑战了传统两时期语义变化检测范式。研究前沿集中在利用上下文感知的向量表示(如现代BERT和二阶随机索引)与静态表示(如Word2Vec)在十年级时间粒度上的对比,探索窄时间窗口与增量聚类策略对预测精度的影响。通过对德语和英语复合词在多个十年跨度内的组成性人工标注,数据集验证了复合词并未呈现显著的长期去组成化趋势,反而凸显了计算方法在处理细粒度时间依赖性和小规模历史语料时的效能差异。这一方向不仅推动了历史语言学中复合词语义渐变的理论建模,也为跨领域术语演变监测、文化遗产文本的语义分析提供了方法论支撑,尤其在揭示语言创新与社会变迁的交互关系上具有深远意义。
相关研究论文
  • 1
    Losing My Composure: Predicting Compositionality Over Time斯图加特大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务