Dataset do POSCOMP sob a ótica do Pensamento Computacional
收藏资源简介:
Este repositório contém uma versão estendida do POSCOMP Dataset, composta por 1.340 questões de múltipla escolha extraídas das edições do POSCOMP (Exame Nacional para Ingresso na Pós-Graduação em Ciência da Computação) realizadas entre 2002 e 2024. O dataset foi produzido como artefato dos classificadores de competências do Pensamento Computacional. Os classificadores foram desenvolvidos para realizar duas tarefas: Identificação de questões-problema, distinguindo questões que exigem raciocínio contextualizado de questões diretas; Identificação das competências do Pensamento Computacional (PC) presentes em cada questão-problema. O repositório disponibiliza quatro versões do dataset: dataset_completo_classificado.csv: dataset completo contendo apenas as classificações produzidas automaticamente pelos classificadores. dataset_completo_classificado_hibrido.csv: versão híbrida do dataset completo, na qual as questões pertencentes à amostra de validação utilizam as anotações humanas (obtidas por voto majoritário entre os avaliadores), enquanto as demais mantêm as classificações automáticas. dataset_qps_classificado.csv: subconjunto contendo apenas as questões classificadas automaticamente como questões-problema. dataset_qps_classificado_hibrido.csv: versão híbrida do subconjunto de questões-problema, incorporando as anotações humanas sempre que disponíveis. Além de todas as colunas presentes no POSCOMP Dataset original, os arquivos incluem a coluna: ehQuestaoProblema: valor booleano que indica se a questão foi classificada como questão-problema (true) ou questão direta (false). As questões classificadas como problema também possuem as seguintes colunas booleanas, correspondentes às competências do Pensamento Computacional identificadas: comp_decomposicao: Decomposição comp_reconhecimento_padroes: Reconhecimento de Padrões comp_abstracao: Abstração comp_algoritmos: Algoritmos comp_generalizacao: Generalização Este conjunto de dados foi disponibilizado para promover a reprodutibilidade dos experimentos e facilitar pesquisas futuras sobre classificação automática de questões educacionais, Grandes Modelos de Linguagem (LLMs) e Pensamento Computacional.



