GAPCORE v5.1 — Métricas Linguísticas de Agência, Contexto e Negatividade em Corpus Multilíngue (Project Gutenberg) + Relatórios, Diagnósticos e Resultados FDR
收藏资源简介:
Descrição O que é este projeto O GAPCORE é um conjunto de dados + um pipeline (software) que tenta medir, de forma reprodutível, alguns sinais linguísticos ligados a “agência” (quem decide/age), “contexto” (circunstâncias) e “negatividade”, usando livros de domínio público como matéria-prima. A ideia central (por que livros?) Um livro é uma forma de registro do pensamento humano — não do “cérebro”, mas do modo como pessoas e culturas escolhem palavras para narrar ações, culpas, contexto, intenção, dano, reparação, etc. Se reunirmos muitos livros em vários idiomas, isso vira um “campo de prova” para começar um software linguístico capaz de observar padrões: quando uma narrativa coloca o foco em quem agiu versus o contexto, quando aparece dano/negatividade, e como isso varia por língua, estilo e época. Importante: este projeto não afirma “medir moralidade humana” diretamente. Ele mede marcadores linguísticos que podem estar associados a temas morais e responsabilidade. O que temos agora (o que foi produzido) Este depósito contém: Arquivos de resultados (CSV/JSON) com métricas por livro e métricas agregadas por idioma. Diagnósticos por idioma (quantos textos entraram, médias, status de qualidade). Resultados estatísticos com validação por permutação e correção por múltiplos testes (FDR, Benjamini–Hochberg), para separar sinais prováveis de “ruído”. Relatórios em texto (MD) descrevendo a execução e os artefatos gerados. Manifests e hashes (SHA256) para auditoria: qualquer pessoa consegue verificar se os arquivos baixados são exatamente os mesmos (integridade/reprodutibilidade). O que não temos (ainda) Para manter honestidade científica, este depósito ainda não inclui: Validação humana direta (ex.: anotadores lendo trechos e marcando “agência”, “culpa”, “contexto”, etc.). Isso é um passo futuro importante. Causalidade: o projeto não prova que uma língua “causa” mais responsabilidade ou menos. Ele só mede padrões em textos. Generalização para a sociedade inteira: livros do Project Gutenberg são um recorte histórico e cultural (viés de publicação e de época). O que esses números querem dizer “no dia a dia” No dia a dia, a gente discute responsabilidade assim: “Ele fez isso porque quis” (agência alta) “Ela fez isso porque estava sob pressão” (contexto alto) “Foi um erro terrível, causou dano” (negatividade/dano alto) “Precisamos reparar, perdoar, seguir” (reparação/perdão — se os léxicos cobrirem isso) O GAPCORE transforma esse tipo de diferença em contagens e índices, tentando ver, em larga escala: se textos tendem a enfatizar ação/intenção (agência) ou circunstância (contexto), se aparece consistentemente um sinal de negatividade/dano, e se certos padrões “não parecem aleatórios” quando testados contra permutações. Isso pode ajudar pesquisadores e futuros sistemas de IA a: detectar quando uma narrativa está apagando a responsabilidade (“ninguém fez”, “foi o sistema”) ou quando está apagando o contexto (“a pessoa é má”, sem circunstâncias) e entender melhor como o discurso humano equilibra culpa, contexto, reparação e perdão. O que isso pode se tornar, se estudado a fundo Se continuarmos com rigor (mais textos, validação humana, testes por gênero/época), isso pode virar: Um instrumento científico para estudar linguagem moral em escala (comparativo entre idiomas/épocas). Um componente para IA responsável, ajudando modelos a evitar julgamentos simplistas e a equilibrar agência e contexto. Uma base para hipóteses observáveis, por exemplo: “Em determinados corpora, marcadores de dano/negatividade aparecem como sinal robusto.” “O índice composto (ex.: IDX) precisa de refinamento para ficar estável entre idiomas e gêneros.” Lógica por trás das métricas (em termos simples) O pipeline faz, em essência: Coleta e limpeza de textos (domínio público). Detecção de idioma e filtros mínimos de qualidade (texto grande o suficiente). Extração de marcadores: conta termos/padrões definidos por léxicos (por idioma) e normaliza por tamanho do texto (ex.: por mil palavras). Construção de índices (ex.: combinar sinais para aproximar “agência vs contexto”). Teste estatístico: usa permutações para estimar o quanto um resultado pode surgir “por acaso”. Correção FDR: porque testamos vários marcadores, ajustamos para não “ver significância” onde é só sorte. Como interpretar os resultados com responsabilidade Se um marcador aparece como significativo após FDR, isso sugere que ele é um sinal estável dentro deste conjunto de textos e destes léxicos. Se um índice (como IDX) não passa FDR, isso é uma informação útil: provavelmente ele precisa de: léxicos melhores, normalização mais robusta, controle por gênero/época, ou validação humana. Limitações (declaradas, sem maquiagem) O corpus (Gutenberg) é recorte histórico/cultural. Léxicos podem não capturar ironia, negação complexa, contexto implícito. Idiomas diferentes têm estruturas diferentes; comparação exige cautela. “Responsabilidade” aqui é aproximação linguística, não julgamento moral absoluto. Este release consolidou múltiplos ciclos de engenharia de dados: correções de detecção de idioma, políticas anti-colapso para “UNK”, auditoria de textos fisicamente presentes (“present_texts”), geração de manifests SHA256, e validação estatística com permutações e correção FDR. O objetivo foi priorizar integridade e rastreabilidade acima de volume bruto. Como citar Use o DOI desta versão no Zenodo. Se você usar os dados, cite também a versão e o arquivo/manifest correspondente.



