遇见数据集

Diario de Debates Cámara de Senadores 1875-1997 (México)

收藏
Zenodo2026-09-04 更新2026-10-01 收录
官方服务:

资源简介:

Este conjunto de datos contiene el texto del Diario de los Debates de la Cámara de Senadores de México, que abarca el periodo 1875-1997, convertido a texto sin formato para su análisis computacional e histórico. La fuente original es la colección en CD «Diario de los Debates, 1875-1997», publicada por la Cámara de Senadores (LIX Legislatura) a través de la Dirección General de Archivo Histórico y Memoria Legislativa del Senado de la República en 2004 (ISBN 970-727-048-9), coordinada por Josefina Mac Gregor y con la digitalización dirigida por Primo Feliciano Pacheco. Esa edición recopiló y digitalizó las sesiones del Senado como imágenes PDF, un valioso esfuerzo de conservación documental que, sin embargo, no permitía buscar ni analizar el contenido como texto. Este proyecto toma esos archivos y los convierte en un corpus legible por máquina. Mediante el reconocimiento óptico de caracteres (OCR), se extrajo el texto de las sesiones y se depositó en forma de archivos de texto, de modo que una colección a la que antes solo se podía acceder como facsímil digital pueda ser objeto de lectura distante, minería de textos y análisis de frecuencia y coocurrencia. La justificación académica es doble. En primer lugar, abre una importante fuente primaria para la historia política, la historia legislativa y los estudios de ciencia y tecnología, permitiendo rastrear a lo largo de más de un siglo los términos, categorías y valores a través de los cuales el Estado mexicano debatió sobre la nación, la ciencia y el gobierno. En segundo lugar, forma parte de un proyecto sobre la historia social de la cuantificación, que estudia cómo los números, las estadísticas y los indicadores participaron en la construcción de los problemas públicos, las decisiones políticas y las formas de autoridad científica. El conjunto de datos se publica con la procedencia completa de su construcción —la fuente original, el código de extracción versionado y de acceso abierto, y este depósito con un identificador persistente— con el fin de apoyar la reproducibilidad y la reutilización de la investigación. Detalles técnicos: la extracción se llevó a cabo con la biblioteca Tesseract en más de diez mil archivos PDF, de los cuales se procesó satisfactoriamente alrededor del 75 por ciento. Dado que se trata de texto reconocido mediante OCR extraído de materiales impresos de distintos períodos y calidad, el corpus contiene errores de transcripción y ruido, especialmente en los documentos más antiguos o en mal estado; consulta el repositorio de código para conocer el procedimiento y sus limitaciones. Código: El código abierto usado para la creación de esta base de datos se puede consultar en este enlace https://github.com/ObservatorioCtsMx/Diario-de-los-debates --------------------------------------------------------------- This dataset contains the text of the Diario de los Debates (Parliamentary Debates) of the Mexican Chamber of Senators, spanning 1875–1997, converted to plain text for computational and historical analysis. The original source is the compact-disc collection Diario de los Debates, 1875–1997, published by the Chamber of Senators (LIX Legislature) through the Directorate-General of Historical Archive and Legislative Memory of the Senate of the Republic in 2004 (ISBN 970-727-048-9), coordinated by Josefina Mac Gregor with digitization led by Primo Feliciano Pacheco. That edition gathered and digitized the Senate sessions as PDF images, a valuable documentary-preservation effort that nonetheless did not allow the content to be searched or analyzed as text. This project takes those files and turns them into a machine-readable corpus. Using optical character recognition, the text of the sessions was extracted and deposited as text files, so that a collection previously accessible only as a digital facsimile can be subjected to distant reading, text mining, and frequency and co-occurrence analysis. The academic rationale is twofold. First, it opens a major primary source for political history, legislative history, and science and technology studies, making traceable across more than a century the terms, categories and values through which the Mexican state debated the nation, science and government. Second, it belongs to a project on the social history of quantification, which studies how numbers, statistics and indicators took part in the construction of public problems, political decisions and forms of scientific authority. The dataset is released with the full provenance of its construction — the original source, the openly available versioned extraction code, and this deposit with a persistent identifier — in order to support research reproducibility and reuse. Technical details: extraction was carried out with the Tesseract library over more than ten thousand PDF files, of which about 75 percent were processed satisfactorily. Since this is OCR-recognized text drawn from printed materials of varying periods and quality, the corpus contains transcription errors and noise, especially in older or poorly preserved documents; please refer to the code repository for the procedure and its limitations. Code: The open-source code used to create this database can be viewed at this link https://github.com/ObservatorioCtsMx/Diario-de-los-debates

提供机构:
Zenodo
创建时间:
2026-09-04
二维码
社区交流群
二维码
科研交流群
商业服务