Arquivo de projetos
SYS-06 / Machine Learning · PNAD Contínua

Previsor de Renda

Estimar renda mensal a partir de características socioeconômicas e ocupacionais com rigor metodológico e interpretabilidade.

STATUSTCC com código público
PAPELPipeline de ML, avaliação, API de inferência e interface
FLOW / SYS-06
  1. 01PNAD
  2. 02Features
  3. 03Treino
  4. 04Avaliação
  5. 05Modelo
  6. 06API
  7. 07Interface
EXECUTIVE SUMMARY

TCC aplicado a microdados da PNAD Contínua com pipeline offline reprodutível, comparação entre ElasticNet, Gradient Boosting, XGBoost, CatBoost e abordagem híbrida Mincer + CatBoost. O modelo final é servido por FastAPI e consumido por uma interface React.

  • Python
  • FastAPI
  • React
  • CatBoost
  • XGBoost
  • SHAP
  • Docker
SYS-06.01

Contexto e problema #

A renda depende de relações demográficas, educacionais, ocupacionais e geográficas. O projeto trata a previsão como investigação científica, não apenas como otimização de uma métrica.

SYS-06.02

Minha contribuição #

O repositório contém extração e tratamento de dados, engenharia de atributos, experimentos comparativos, interpretabilidade, documentação metodológica, API de inferência e frontend.

SYS-06.03

Arquitetura #

O pipeline de ML roda offline e exporta o artefato treinado. Um backend FastAPI desacoplado valida a entrada e executa inferência; o frontend React coleta os dados e apresenta a estimativa.

  • Pipeline offline reprodutível
  • API de inferência FastAPI
  • React + Vite
  • Docker Compose
SYS-06.04

Avaliação e qualidade #

A comparação usa o mesmo conjunto de teste com 25.801 observações. O CatBoost V5 obteve R² log de 0,5913; o híbrido Mincer + CatBoost obteve R² de 0,4906 e RMSE de R$ 910,17 na escala original.

SYS-06.05

Limitações #

O projeto reconhece a natureza transversal dos dados, variáveis não observadas e heterogeneidade de renda. A estimativa é experimental e não deve orientar decisões sobre pessoas.

SYS-06.06

Próximos passos #

Consolidar dependências reproduzíveis, automatizar testes do fluxo de inferência e publicar uma demonstração com aviso explícito de uso responsável.