Amostra aleatória de 5.000 registros de um repositório de dados de pesquisa
收藏资源简介:
O conjunto de dados apresenta uma amostra aleatória composta por 5.000 registros extraídos de um repositório generalista de dados de pesquisa. O objetivo é ilustrar a diversidade de formatos, estilos e estruturas que coexistem em ambientes de dados abertos. Os registros foram selecionados de forma aleatória, sem filtragem ou normalização prévia, justamente para evidenciar a heterogeneidade típica desses ambientes, incluindo:Tags e descrições com formatação inconsistente (HTML, símbolos, idiomas mistos);Variações na presença e ausência de metadados;Diferenças de granularidade e vocabulário nos campos textuais.Os dados estão disponíveis em formato .csv, com delimitador | e codificação UTF-8.Os dados não passaram por nenhum tipo de tratamento e é melhor visualizado em ambiente Python ou aberto pelo Google Sheets.



