Estudo de caso
Uma leitura guiada da coleta à exploração
O projeto é apresentado em três etapas. A ordem importa: a análise final depende de uma listagem coletada, de regras de limpeza e do enriquecimento com metadados de filmes.
01 · ORIGEM
Construção da base
O primeiro notebook transforma a listagem do TV Globo Wiki em uma tabela de datas, títulos e observações. Ele documenta a lógica original de extração e gera whole_century.csv.
Entrada: página HTML externa
Saída: 10.466 registros brutos
02 · CURADORIA
Limpeza dos registros
O segundo notebook exclui linhas sem título e dias identificados como sem exibição. Quando a fonte registra filmes diferentes para regiões distintas na mesma linha, mantém o primeiro título.
Entrada: whole_century.csv
Saída: 9.900 registros limpos
03 · EXPLORAÇÃO
Padrões na programação
O notebook final usa a base enriquecida para explorar recorrência de elenco, anos de lançamento, avaliações e o intervalo entre lançamento e exibição. Também testa agrupamentos como ferramenta exploratória.
Entrada: sdtcentury2.csv
Recorte analítico: registros com datas válidas e sem lançamento posterior à exibição