遇见数据集

epuertas94/CorDiCas

收藏
Hugging Face2024-06-08 更新2024-06-12 收录
官方服务:

资源简介:

--- license: mit task_categories: - text-classification - token-classification - image-to-text language: - es pretty_name: CorDiCas size_categories: - n<1K --- # CorDiCas **CorDiCas** es un prototipo de corpus diacrónico cuyos documentos proceden de una colección de más de 120 documentos inéditos de carácter semiprivado, cuya temática gira en torno a la sedentarización e inserción forzosas de la población gitana durante el siglo XVIII. En la siguiente tabla se ofrece la información estructurada sobre los periodos que se abordan en la colección: | Signatura | Periodo | N.º textos | |-----------|-------------|---------------------| | AMH_01430 | 1745 - 1746 | 4 textos | | | 1748 | 14 textos | | | 1749 | Más de 104 textos | El objetivo del diseño e implementación de estos textos es doble: por un lado, la compilación y creación de un prototipo de corpus que pueda ser, en un futuro próximo, una herramienta digital en red que permita a investigadores y usuarios acercarse a la lengua de tiempos pretéritos. Por otro, se trata de diseñar y probar una prueba de concepto con estos textos para completar la colección de textos diacrónicos del español. Para ello, se procedió a la identificación y selección de diez textos representativos, utilizando criterios de calidad de muestra, representatividad y diversidad. Los documentos fueron digitalizados y transcritos paleográficamente con el objetivo de preservar la ortografía original. Este proceso se realizó siguiendo una metodología que incluyó la doble transcripción, paleográfica y normalizada, con el fin de ofrecer diferentes niveles de análisis para investigadores y usuarios. Con este dataset, este proyecto se propone contribuir a la reconstrucción histórica y a la recopilación de datos lingüísticos sobre el español del siglo XVIII, ofreciendo una muestra representativa de textos que abordan temas relevantes de la época, como la sedentarización forzosa de la población gitana y los conflictos jurisdiccionales asociados.

提供机构:
epuertas94
原始信息汇总

CorDiCas

概述

CorDiCas 是一个历时语料库的原型,其文档来自一个包含超过120份未出版的半私人性质文档的集合,主题围绕18世纪吉普赛人口的强制定居和插入。

时间范围

以下表格提供了集合中所涉及的时间段的结构化信息:

Signatura Periodo N.º textos
AMH_01430 1745 - 1746 4 textos
1748 14 textos
1749 Más de 104 textos

目标

该数据集的设计和实现有两个目标:一方面,编译和创建一个语料库原型,未来可能成为研究人员和用户接近过去语言的数字网络工具;另一方面,设计并测试这些文本的概念验证,以完善西班牙语历时文本的集合。

方法

为此,采用了代表性、样本质量和多样性的标准,选择了十个代表性文本。这些文档被数字化并进行了古文字学转录,以保留原始拼写。这一过程包括双重转录(古文字学和标准化),以提供不同层次的分析给研究人员和用户。

贡献

通过这个数据集,该项目旨在为18世纪西班牙语的历史重建和语言数据收集做出贡献,提供了一个代表性文本样本,涵盖了当时相关主题,如吉普赛人口的强制定居和相关的司法冲突。

二维码
社区交流群
二维码
科研交流群
商业服务