遇见数据集

Replication Package — Code Smell Detection in Embedded Systems: Manual Inspection vs. Machine Learning (VEM 2026)

收藏
Zenodo2026-07-07 更新2026-08-01 收录
官方服务:

资源简介:

Este repositório contém o pacote de replicação do estudo empírico comparativo entre inspeção manual humana e classificadores de Machine Learning para detecção de code smells em kernels de sistemas operacionais de tempo real (RTOS) escritos em linguagem C, submetido ao 14º Workshop de Visualização, Evolução e Manutenção de Software (VEM 2026). Conteúdo do repositório: Dataset/ — Arquivos-fonte extraídos dos kernels dos sete RTOS analisados, organizados em quatro subconjuntos: Base dataset/ — Conjunto completo de arquivos C coletados dos kernels, antes de qualquer particionamento, servindo como ponto de partida para a reprodução integral do pipeline. Experimental dataset/ — Os 23 arquivos utilizados tanto no quasi-experimento com estudantes quanto na avaliação dos classificadores de ML, permitindo a comparação direta entre inspeção humana e detecção automatizada. Standardized experimental dataset/ — Versão padronizada do conjunto experimental, com as métricas estruturais normalizadas, utilizada como entrada nos classificadores. Training dataset/ — Os 49 arquivos reservados exclusivamente ao treinamento dos modelos de Naive Bayes e Random Forest, sem sobreposição com o conjunto experimental. Planilhas de dados/ — Dados tabulares do estudo: Avaliação de Code Smells (Conjunto completo).xlsx — Consolidação das 271 avaliações coletadas no quasi-experimento, contendo as respostas individuais por arquivo e por smell, antes da amostragem controlada. Student Experiment Data (Normalized).xlsx — Dataset normalizado com as 271 avaliações independentes para serem filtradas (10 avaliações por arquivo) e utilizadas nas análises comparativas reportadas no artigo. Scripts/ — Scripts Python de extração de métricas estruturais via Árvore de Sintaxe Abstrata (AST) utilizando a biblioteca Tree-sitter, incluindo as 8 métricas calculadas por arquivo. Modelos treinados de Naive Bayes e Random Forest, serializados em formato compatível com scikit-learn. Script automatizado de distribuição dos arquivos por e-mail aos participantes do quasi-experimento e formulários de avaliação utilizados na coleta de dados. Slide e formulário/ — Slides da aula expositiva de nivelamento ministrada aos participantes antes da inspeção manual, e o formulário enviado para os alunos.

提供机构:
Zenodo
创建时间:
2026-07-07
二维码
社区交流群
二维码
科研交流群
商业服务