遇见数据集

Corpus de las conferencias de prensa matutinas de la Presidencia de México, 2018-2026

收藏
Zenodo2026-08-09 更新2026-08-13 收录
官方服务:

资源简介:

Corpus estructurado de 1,736 versiones estenográficas oficiales de las conferencias de prensa matutinas de la Presidencia de la República de México, con 20,410,147 palabras procesadas y 168,509 turnos de habla etiquetados por hablante y por rol. Cubre de forma continua los dos periodos presidenciales en que esta práctica ha existido: Andrés Manuel López Obrador (1,286 conferencias, del 5 de diciembre de 2018 al 30 de septiembre de 2024) y Claudia Sheinbaum Pardo (450 conferencias, del 3 de octubre de 2024 al 6 de agosto de 2026). La contribución de este recurso no es haber reunido documentos que ya eran públicos, sino tres decisiones de construcción que hacen posible el análisis comparado. Primera. Un solo extractor para las dos administraciones. Si un periodo proviniera de una fuente o un criterio de transcripción distintos, cualquier diferencia medida entre gobiernos podría deberse a la fuente y no al discurso. Ambos periodos fueron extraídos del portal gob.mx con el mismo cosechador y el mismo limpiador. Segunda. Estructura por turnos de habla etiquetados por hablante y por rol, con nombre canonizado. Permite separar analíticamente la voz del gobierno de la de la prensa y modelar ambas agendas como series independientes. Casi ningún corpus de discurso presidencial ofrece esta condición. Se identificaron 1,784 personas distintas y solo el 0.136 por ciento de las palabras quedó sin atribuir. Tercera. Controles de calidad documentados: canonización de nombres de hablantes previa a todo conteo, normalización de frecuencias por diez mil palabras del rol correspondiente, y detección del sesgo de transcripción estenográfica entre roles. CONTENIDO DEL DEPÓSITO corpus-turnos-estructurados.zip contiene la capa analítica principal: un renglón por turno de habla para los dos periodos, con las columnas fecha, orden, hablante_bruto, texto, palabras, cargo, nombre, nombre_norm y rol. Se acompaña de los agregados por persona y por sesión. Los demás archivos contienen el texto íntegro por conferencia, los metadatos por conferencia y los scripts de extracción y limpieza. QUÉ LO DISTINGUE DE OTROS RECURSOS DISPONIBLES Existen ya transcripciones públicas de las conferencias matutinas, principalmente los repositorios de NOSTRODATA para ambos periodos, el corpus de AMLO liberado bajo CC0 por roicort, y el archivo consultable de mananeradehoy.com. Este depósito no los sustituye ni compite con ellos: aporta cuatro elementos que ninguno ofrece y que son precisamente los que permiten el análisis comparado entre administraciones. Primero, un mismo extractor y un mismo limpiador aplicados a los dos periodos, condición sin la cual cualquier diferencia medida entre gobiernos puede deberse a la fuente y no al discurso. Segundo, la canonización de nombres de hablantes. El portal oficial registra a una misma persona con formatos distintos; segmentar sin canonizar produce hablantes duplicados y conteos falsos. Tercero, una clasificación por rol (presidenta, funcionario, prensa, genérico, otro, sin atribuir) y no solo por participante. Es lo que hace posible tratar la agenda del gobierno y la de la prensa como series independientes. Cuarto, controles de calidad medidos y documentados, incluida la cuantificación del sesgo de transcripción estenográfica entre roles y el porcentaje exacto de material sin atribuir. VERSIONES Las conferencias matutinas continúan realizándose. Este depósito se actualizará mediante el sistema de versiones de Zenodo conforme se incorporen periodos posteriores. El DOI concepto apunta siempre a la versión más reciente. ADVERTENCIA SOBRE LA COLUMNA ROL La etiqueta "presidenta" designa a quien encabeza el Ejecutivo federal en cada periodo, sin distinción de género: en el corpus de 2018 a 2024 corresponde a Andrés Manuel López Obrador. Se conservó una sola etiqueta para que las series de ambos periodos sean directamente comparables. ADVERTENCIA SOBRE LOS CONTEOS DE PALABRAS Este corpus admite dos medidas y no son intercambiables. El conteo crudo sobre los archivos de texto arroja 21,049,522 palabras. El conteo procesado, tras limpieza y atribución de turnos, arroja 20,410,147. La diferencia son encabezados, marcas de estenografía y material no atribuible. Toda publicación que use este recurso debe declarar cuál de las dos medidas emplea. PROCESAMIENTO Python con spaCy (modelo es_core_news_lg), BERTopic y sentence-transformers. FUENTE Y DERECHOS Las versiones estenográficas provienen del portal oficial gob.mx y son documentos públicos del Gobierno de México. Lo que este depósito aporta, y lo que se solicita citar, es el trabajo de extracción, limpieza, estructuración por turnos, canonización y documentación. ACCESO Acceso abierto. Los archivos están disponibles para descarga sin restricción bajo licencia Creative Commons Attribution 4.0 International (CC BY 4.0). El único requisito de uso es acreditar apropiadamente la autoría del corpus conforme a la referencia sugerida. Se agradece a quienes empleen este recurso que comuniquen al autor los trabajos derivados, con el fin de mantener un registro de usos y de mejorar las versiones subsecuentes.

提供机构:
Zenodo
创建时间:
2026-08-09
二维码
社区交流群
二维码
科研交流群
商业服务