Agrupamentos de Vídeos Relacionados ao Desenvolvimento de Software por Meio de LLMs
收藏资源简介:
O crescimento acelerado do volume de vídeos educacionais em plataformas digitais, como o YouTube, torna necessária a adoção de métodos automáticos capazes de organizar e agrupar conteúdos de forma eficiente e semanticamente consistente. Nesse contexto, este trabalho tem como objetivo comparar a eficácia de abordagens baseadas em grandes modelos de linguagem (Large Language Models (LLMs)) com métodos tradicionais de clusterização baseados modelagem de tópicos no agrupamento semântico de transcrições de vídeos relacionados ao desenvolvimento de software. A metodologia adotada possui caráter exploratório e comparativo, utilizando transcrições textuais de vídeos educacionais como base de análise. Foram avaliadas duas abordagens principais: métodos tradicionais de clusterização baseados em modelagem de tópicos com Latent Dirichlet Allocation (LDA) e abordagens baseadas em LLMs, incluindo diferentes modelos e configurações. Os agrupamentos gerados foram comparados por meio de métricas externas de avaliação de clusterização, especificamente Adjusted Rand Index (ARI), Adjusted Mutual Information (AMI), V-Measure e índice de Jaccard, utilizando como referência adicional uma clusterização manual realizada por um avaliador humano. Os resultados indicam que modelos baseados em LLMs, especialmente aqueles com maior capacidade contextual, produzem agrupamentos semanticamente mais consistentes e com maior alinhamento em relação à referência humana quando comparados a métodos tradicionais utilizados com configurações padrão. Observou-se também que abordagens clássicas, como o LDA, apresentam desempenho competitivo quando adequadamente parametrizadas, embora sejam mais sensíveis ao pré-processamento e à escolha de parâmetros. Conclui-se que a utilização de grandes modelos de linguagem constitui uma alternativa viável e promissora para tarefas de agrupamento semântico de transcrições textuais de vídeos relacionados ao desenvolvimento de software, oferecendo maior robustez na captura de relações temáticas complexas. Os resultados reforçam o potencial dessas abordagens como ferramentas de apoio à organização automática de conteúdos educacionais e indicam caminhos para pesquisas futuras na área. Conteúdo do arquivo XLSX O arquivo .xlsx contém todos os dados utilizados no estudo. O arquivo está organizado em quatro abas: Comparação Contém uma planilha que apresenta as abordagens utilizadas neste estudo, incluindo os resultados gerados pelas LLMs e os clusters obtidos. Nota: foram utilizadas as seguintes LLMs: GPT-4.1, GPT-4o mini, Gemini 2.5 Flash e DeepSeek-V3 Técnicas de Comparação Contém uma planilha que apresenta as técnicas utilizadas para quantificar a relevância e a qualidade dos clusters gerados. Nota: foram utilizadas as seguintes métricas de avaliação de clusterização: Adjusted Rand Index (ARI), Adjusted Mutual Information (AMI), V-Measure e Índice de Jaccard Clusterização Contém uma planilha com os vídeos utilizados no estudo, incluindo os respectivos links e a numeração das transcrições. Transcrições Contém uma planilha com as transcrições dos vídeos utilizados neste estudo. Nota: as transcrições são organizadas por números, e não pelos títulos completos dos vídeos, com o objetivo de facilitar o processo de geração dos clusters, permitindo a utilização apenas da identificação numérica. Conteúdo do arquivo ZIP O arquivo ZIP contém os códigos utilizados para a execução dos experimentos. Composto por: LDA / LDADE – Código para geração de gráficos Contém os scripts utilizados para gerar os gráficos de análise dos resultados obtidos. Implementação de LDA e LDADE e o código utilizado para executar os algoritmos LDA e LDADE sobre um conjunto de 15 transcrições de vídeos. Para cada vídeo, os algoritmos realizam: Geração de tópicos Interpretação humana dos tópicos gerados Pré-processamento dos dados, incluindo remoção de algumas stop words inseridas manualmente Agrupamento das transcrições em clusters Código fonte Cabe destacar que, para a utilização do LDA/LDADE, foi utilizado como base o código disponível em: https://github.com/amritbhanu/LDADE-package/tree/master/LDADE Foram realizadas adaptações no código original para que ele pudesse atender aos critérios e às necessidades específicas deste trabalho.



