TCC aplicado a microdados da PNAD Contínua com pipeline offline reprodutível, comparação entre ElasticNet, Gradient Boosting, XGBoost, CatBoost e abordagem híbrida Mincer + CatBoost. O modelo final é servido por FastAPI e consumido por uma interface React.
- Python
- FastAPI
- React
- CatBoost
- XGBoost
- SHAP
- Docker
Contexto e problema #
A renda depende de relações demográficas, educacionais, ocupacionais e geográficas. O projeto trata a previsão como investigação científica, não apenas como otimização de uma métrica.
Minha contribuição #
O repositório contém extração e tratamento de dados, engenharia de atributos, experimentos comparativos, interpretabilidade, documentação metodológica, API de inferência e frontend.
Arquitetura #
O pipeline de ML roda offline e exporta o artefato treinado. Um backend FastAPI desacoplado valida a entrada e executa inferência; o frontend React coleta os dados e apresenta a estimativa.
- ✓ Pipeline offline reprodutível
- ✓ API de inferência FastAPI
- ✓ React + Vite
- ✓ Docker Compose
Avaliação e qualidade #
A comparação usa o mesmo conjunto de teste com 25.801 observações. O CatBoost V5 obteve R² log de 0,5913; o híbrido Mincer + CatBoost obteve R² de 0,4906 e RMSE de R$ 910,17 na escala original.
Limitações #
O projeto reconhece a natureza transversal dos dados, variáveis não observadas e heterogeneidade de renda. A estimativa é experimental e não deve orientar decisões sobre pessoas.
Próximos passos #
Consolidar dependências reproduzíveis, automatizar testes do fluxo de inferência e publicar uma demonstração com aviso explícito de uso responsável.
Teste o produto e inspecione o código
A demo online executa o fluxo principal com dados locais e seguros. O repositório público preserva backend, testes, infraestrutura e documentação técnica completos.