Estudo de caso

Da integração dos ciclos do SAEB à comparação de três classificadores.

Como acompanhar a análise

A sequência abaixo corresponde ao caminho canônico descrito no README e confirmado pelo relatório final. Cada página renderiza o notebook original como documento estático: código, tabelas, gráficos e saídas relevantes permanecem disponíveis, mas a leitura não exige abrir um arquivo .ipynb no GitHub.

NotaSaídas preservadas

O site não reexecuta os modelos durante a publicação. Ele apresenta as saídas salvas nos notebooks, mantendo o resultado histórico e evitando que uma atualização de dependências altere silenciosamente as métricas.

1

Preparação e integração

Reúne os ciclos bienais de 2007 a 2017, trata idades ausentes e remove questionários não respondidos.

2

Tratamento das variáveis

Interpreta os dicionários do SAEB, faz mapeamentos ordinais, seleciona colunas e examina outliers.

3

Correlações e engenharia de atributos

Usa mapas de calor para explorar relações, filtra variáveis e produz o artefato usado na modelagem.

4

Distribuição das classes e PCA

Investiga o desbalanceamento do alvo e projeta a estrutura dos dados em componentes principais.

5

Reestruturação e balanceamento

Examina a interposição entre classes, define o alvo binário e prepara um subconjunto balanceado.

6

Modelagem e comparação

Compara rede neural, árvore de decisão regularizada e SVM no relatório apresentado na disciplina.

Resultado registrado

A tabela resume a execução preservada no relatório final. A acurácia é útil para uma visão rápida, mas o F1 da classe minoritária mostra que o problema continua mais difícil para o grupo menos frequente.

Métricas impressas no notebook final para um conjunto de teste com 235 exemplos.
Modelo Acurácia no teste F1 — classe 1 Observação
Rede neural 0,88 0,65 Erros de treino e validação próximos na execução registrada
Árvore de decisão regularizada 0,90 0,71 Melhor resultado entre os três modelos neste teste
SVM 0,87 0,63 Hiperparâmetros selecionados com busca em grade e 5 folds
AvisoComo não ler esta tabela

A diferença entre modelos é pequena e resulta de uma única configuração histórica do estudo. Ela não estabelece superioridade geral, não mede impacto pedagógico e não substitui validação em outros anos ou populações.

O que fica fora da narrativa principal

O repositório também contém notebooks de prática, versões exploratórias por família de modelo e arquivos temporários. Eles são valiosos como histórico de desenvolvimento, mas não formam uma sequência única e alguns foram superados pelo relatório integrado. Permanecem disponíveis no repositório completo, sem ocupar a navegação do caso de estudo.

Começar a análise