Base anonimizada derivada do Cadastro Único para classificação de renda familiar e apoio à qualificação cadastral (referência 11/2025)
收藏资源简介:
Este conjunto de dados reúne aproximadamente 1.000.000 de famílias derivadas do Cadastro Único (CadÚnico), referência de novembro de 2025, organizado em nível familiar, cada linha corresponde a uma única família, identificada por um código sequencial anônimo (ID_FAM_ANON), sem qualquer informação que permita reidentificação. A base foi construída no contexto de um Trabalho de Conclusão de Curso para o desenvolvimento de um modelo de aprendizado de máquina voltado a estimar a probabilidade de inconsistência entre a renda declarada e a renda provável das famílias, com o objetivo de apoiar a priorização de ações de qualificação cadastral pelas gestões municipais. Foram selecionadas exclusivamente famílias cuja renda foi obtida a partir do Cadastro Nacional de Informações Sociais (CNIS), conforme os campos de origem da renda do CadÚnico, garantindo que a renda de referência corresponda a informações administrativas formalmente observadas. As características individuais (escolaridade, idade, condição de trabalho, entre outras) foram agregadas ao nível familiar por meio de estatísticas descritivas, tais como percentuais por faixa etária, indicadores de presença e marcadores de escolarização, e as características do responsável familiar foram incorporadas separadamente. A amostra foi montada de forma proporcional à distribuição real das classes de renda (aproximadamente 41,5% até ½ salário mínimo e 58,5% acima). A base contém 54 colunas, predominantemente numéricas, abrangendo: identificador anônimo da família; atributos do domicílio e da família; variáveis socioeconômicas agregadas das pessoas; e variáveis derivadas relacionadas ao alvo. A variável-alvo (y_bin) assume valor 1 quando a renda domiciliar per capita formal observada no CNIS é superior a R$ 759 (½ salário mínimo de 2025) e 0 caso contrário. Importante: VL_RENDA_MEDIA_FAM, classe_renda, y_bin e classe_risco_qualificacao estão associadas à construção do alvo e à interpretação dos resultados, não devendo ser utilizadas como variáveis explicativas do modelo, de modo a evitar vazamento de informação. Os dados foram tratados em conformidade com a Lei Geral de Proteção de Dados (LGPD): a base já foi gerada de forma anonimizada na origem, sem extração de dados identificados, com acesso restrito por VPN institucional e mediante Termo de Compromisso de Manutenção de Sigilo. As regras de limpeza e imputação seguiram o Manual do Entrevistador do CadÚnico, e valores não aplicáveis foram codificados como -1. Os dados destinam-se exclusivamente a fins de pesquisa e como instrumento complementar de apoio à gestão, não constituindo medida direta de renda nem mecanismo automático de decisão sobre concessão de benefícios.



