movies_dataset_curado_pt-br.csv
收藏资源简介:
Este dataset foi curado por um Data Steward com foco em qualidade, padronização e reuso, reunindo metadados completos de aproximadamente 45.000 filmes presentes no Full MovieLens Dataset, com títulos lançados até julho de 2017. O conjunto de dados integra informações provenientes do TMDB (The Movie Database), incluindo elenco e equipe técnica, palavras-chave do enredo, orçamento, receita, datas de lançamento, idiomas, empresas produtoras, países de produção, contagem de votos e médias de avaliação. Durante o processo de curadoria, os campos foram revisados quanto à consistência semântica, normalização de formatos, integridade referencial e alinhamento entre identificadores de diferentes fontes. Além dos metadados descritivos, o dataset incorpora arquivos com aproximadamente 26 milhões de avaliações, realizadas por cerca de 270.000 usuários, abrangendo todos os filmes do conjunto. As avaliações seguem uma escala de 1 a 5 e foram obtidas a partir do site oficial do GroupLens, assegurando a confiabilidade da origem dos dados. A atuação do Data Steward envolveu a validação das relações entre filmes, usuários e avaliações, a mitigação de inconsistências estruturais, a documentação das variáveis e a organização do dataset de modo a favorecer análises reprodutíveis, aplicações em ciência de dados, sistemas de recomendação, mineração de dados e estudos em ciência da informação. Como resultado, o dataset apresenta-se como um recurso robusto, documentado e pronto para uso analítico, equilibrando riqueza informacional com governança de dados, transparência metodológica e potencial de reuso científico.



