遇见数据集

17th-Century Italian Corpus (1610–1689)

收藏
arXiv2026-06-26 更新2026-06-29 收录
数据链接:
官方服务:

资源简介:

该数据集是由博洛尼亚大学FICLIT数字图书馆构建的17世纪意大利语历史文本语料库,涵盖1610年至1689年间的宗教论文、传记、历史叙事等多种体裁。语料库包含732个对齐的句子对,约15,000个词元,数据来源于原始页面图像经定制OCR处理并辅以GPT-5-mini生成语义规范化版本。创建过程通过提取连续页面范围以保持话语结构,并进行了人工验证以确保语义保真度。该数据集主要用于评估大型语言模型对历史语言的处理能力,旨在探究拼写变异、词汇距离和预训练暴露对模型编码成本与理解难度的影响,为数字图书馆中的语义检索任务提供基准。

This dataset is a 17th-century Italian historical text corpus constructed by the FICLIT Digital Library of the University of Bologna, covering various genres including religious treatises, biographies, historical narratives and more spanning from 1610 to 1689. The corpus contains 732 aligned sentence pairs and approximately 15,000 tokens. Its data is derived from original page images processed via customized OCR, supplemented with semantically normalized versions generated by GPT-5-mini. During the construction process, contiguous page ranges were extracted to preserve discourse structure, and manual validation was conducted to ensure semantic fidelity. This dataset is primarily used to evaluate the processing capabilities of large language models (LLMs) for historical languages, aiming to investigate the impacts of spelling variation, lexical distance and pretraining exposure on model encoding costs and comprehension difficulty, providing a benchmark for semantic retrieval tasks in digital libraries.

提供机构:
博洛尼亚大学
创建时间:
2026-06-26
搜集汇总
数据集介绍
17th-Century Italian Corpus (1610–1689) 数据集图片
构建方式
该语料库精心遴选五部出版于1610年至1689年间的意大利文本,涵盖宗教论著、传记、历史叙事、学术序言及肖像描写等多种体裁。原始资料源自博洛尼亚大学FICLIT数字图书馆的IIIF清单所呈现的页面图像,通过定制光学字符识别(OCR)技术完成转录。为构建现代对照基线,研究者借助GPT-5-mini对历史句子进行语义归一化处理,生成现代意大利语版本,并经人工校验确保语义保真。最终获得732对齐句对(约15,000个令牌),完整保留了长s(ſ)与V/U互换等密集历史特征。
使用方法
本语料库适用于多维度评估大型语言模型处理历史文本的能力。研究者可采用四维诊断框架:首先通过对比历史文本与现代版本的令牌计数,计算令牌膨胀率以量化编码成本;其次基于困惑度比率评估预测不确定性;继而借助余弦相似度衡量语义健壮性;最后通过添加临时语境提示(如“Il seguente è un testo italiano del XVII secolo”)检验语境适应能力。该设计使数字图书馆能够精准定位模型在检索任务与生成任务中的差异化表现,为历史文本处理提供稳健的评估基准。
背景与挑战
背景概述
17世纪意大利语语料库(1610–1689)由博洛尼亚大学Maria Levchenko等人于2025年创建,源自FICLIT数字图书馆的原始页面图像。该语料库聚焦于一个核心研究问题:现代大语言模型如何处理历史语言?传统上,历史语言的难度被视为单一障碍,混淆了正字法变异、语言距离与预训练暴露。该语料库通过收录宗教论述、学术散文等多体裁文本,为剖析这些维度提供了实验平台。其对数字图书馆领域的影响力在于,揭示了模型在处理非经典、低资源历史文本时,编码成本与理解难度之间存在系统性分离,挑战了以词元化效率作为历史复杂性代理指标的惯常假设。
当前挑战
该语料库面临双重挑战。在领域层面,它揭示了历史语言理解并非统一问题:17世纪意大利语相较于现代语言模型平均产生2.4倍的预测不确定性(学术文本达3.2倍),但其语义嵌入相似性仍保持稳健(≥0.85),表明生成不稳定与语义理解可不一致,这要求重新定义评估框架。在构建过程中,挑战尤为艰巨:文本源自稀缺的IIIF页面图像,需自定义OCR转录,且存在长s(ſ)等低频正字法特征,导致词元膨胀率高达27.5%。此外,由于缺乏现成的全文转录,降低了模型预训练中直接暴露的可能性,使得语言距离的量化更为复杂,迫使研究者采用合成现代化基线进行对照实验。
常用场景
经典使用场景
17th-Century Italian Corpus (1610–1689) 作为一段跨越近八十年的早期现代意大利语手稿数字化语料库,其最经典的学术使用场景在于深入剖析大规模语言模型在面对历史语言时所面临的分层式挑战。研究者借助该语料库,能够系统性地将历史文本带来的困难拆解为编码成本(分词膨胀)、预测不确定性(困惑度)、语义鲁棒性(嵌入相似性)以及情境适应性四个维度,从而精准定位模型在语义检索与生成任务中的性能瓶颈,为历史语言的自然语言处理研究提供了可控且富有挑战性的实验基准。
解决学术问题
该数据集的构建有效解决了学术研究中长期存在的‘历史语言难度一元化’假设问题,明确了分词效率并非衡量模型理解能力的可靠代理指标。通过对比分词膨胀率相近但困惑度迥异的17世纪意大利语与18世纪俄语语料,本研究系统揭示了历史语言因词汇稀疏性、句法结构及文体差异所引发的深层分布偏移,并证明了模型在高预测不确定性的情况下仍能保持近乎完美的语义表征稳定性,这一发现为数字人文领域中语言模型的安全部署奠定了理论基础。
实际应用
在实际应用中,17th-Century Italian Corpus 主要服务于数字图书馆工作流程中的语义检索与索引任务。研究表明,尽管历史文本会增加计算开销并导致生成质量的不稳定,但其语义嵌入相似度依然维持在0.85以上的高水平,因此适用于高性能的语义搜索、文档聚类与自动分类。此外,通过添加上下文提示指明文本的年代背景,可将预测不确定性降低约60%,这一低成本的缓解策略已为图书馆系统在处理古籍时的生成式任务(如OCR后校正与摘要生成)提供了切实可行的优化方案。
数据集最近研究
最新研究方向
当前研究聚焦于解构历史文本对大型语言模型造成的多维度挑战,不再将其视为单一障碍,而是区分为编码成本、预测不确定性、语义鲁棒性与上下文适应性等可解析的维度。前沿方向尤其关注17世纪意大利语料库所揭示的深层现象:尽管分词效率低下带来约28%的固定“编码税”,但这一机械性开销与模型实际的理解困难并无直接关联;真正导致预测困惑度飙升(平均2.4倍,学术文本达3.2倍)的根源在于古语词汇、拉丁化句法等文体特征,而非历时久远本身。更关键的是,研究发现模型在生成层面高度不确定的同时,其语义嵌入表征却表现出惊人稳定性(余弦相似度≥0.85),这意味着大型语言模型在语义检索等任务中已具备处理历史文本的可靠性,仅需通过简单的时间上下文提示(将困惑度降低约60%)即可大幅改善生成性能,为数字图书馆安全部署LLM处理非经典古文献提供了实证依据。
相关研究论文
  • 1
    How Surprising Is Historical Italian to Language Models? Tokenization Tax, Comprehension Tax, and a Simple Mitigation博洛尼亚大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务