Predição de Churn com Redes Neurais (MLP)
Rede neural densa treinada para identificar clientes de telecom com maior probabilidade de cancelamento — modelo base vs. regularizado com L2 e Early Stopping.
O problema
Uma empresa de telecomunicações deseja reduzir o cancelamento de clientes. O time de dados foi acionado para construir um modelo capaz de identificar clientes com maior probabilidade de churn — permitindo ações preventivas de retenção antes que o cancelamento aconteça.
O dataset utilizado é o IBM Telco Customer Churn, com 7.043 registros e 20 variáveis, contendo informações sobre:
- Perfil do cliente (tempo de relacionamento, tipo de contrato)
- Serviços contratados (internet, telefone, streaming)
- Valores mensais e totais pagos
- Status de churn (variável-alvo binária)
A solução
Foram construídas e comparadas duas arquiteturas de rede neural MLP (Multilayer Perceptron) usando Keras sobre TensorFlow:
- Modelo base: rede densa sem regularização — treinada diretamente nos dados pré-processados para estabelecer uma linha de referência.
- Modelo regularizado: mesma arquitetura com regularização L2 nas camadas densas + Early Stopping para interromper o treinamento quando a perda de validação para de melhorar, evitando overfitting.
O pré-processamento incluiu codificação de variáveis categóricas, normalização das variáveis numéricas e balanceamento da base (churn representa ~26% dos registros). A comparação direta entre os dois modelos evidenciou na prática o impacto da regularização na generalização.
Stack
O que foi alcançado
O projeto demonstrou na prática os efeitos de overfitting em redes neurais sem regularização: o modelo base aprende muito bem os dados de treino mas não generaliza igualmente bem para dados de validação. A versão regularizada com L2 e Early Stopping apresentou curvas de aprendizado mais estáveis e melhor desempenho no conjunto de validação.
Ao final, o fluxo completo foi coberto: carregamento e EDA, preparação de dados categóricos e numéricos, treinamento da MLP, avaliação de métricas (acurácia, F1, matriz de confusão) e análise visual das curvas de loss para identificar sinais de overfitting e underfitting.