Ver código
import pandas as pd
import numpy as np
import reDecisões que transformam a coleta em uma base analisável
A listagem bruta inclui datas sem filme, títulos ausentes e linhas com exibições diferentes por região. Aqui essas situações são identificadas e tratadas de forma explícita.
Posição no estudo: esta etapa recebe datasets/whole_century.csv e produz datasets/cleanedcentury.csv.
| date | title | comments | |
|---|---|---|---|
| 0 | 2023-01-02 | Não Houve Exibição | velório de Pelé, intitulada Rei Pelé: Cobertura |
| 26 | 2023-02-07 | Não Houve Exibição - Mundial de Clubes: Flamen... | NaN |
| 28 | 2023-02-09 | Não Houve Exibição - Supercopa Feminina de Fut... | NaN |
A inspeção mostra dois casos que não representam uma exibição analisável:
Esses registros são retirados da base limpa.
Quando uma linha reúne mais de um título, separados por |, o processo original mantém o primeiro. Essa regra simplifica a unidade de análise, mas também é uma limitação: variações regionais posteriores ao primeiro título deixam de aparecer.
| date | title | comments | |
|---|---|---|---|
| 482 | 2021-04-12 | Intocáveis | Meu Pai, Meu Herói | somente para o ES |
| 750 | 2020-04-20 | Homem-Aranha | Tainá 2: A Aventura Continua | 2002 |
| 958 | 2019-02-04 | Soul Surfer: Coragem de Viver | Kung Fu Panda 2 | somente para as afiliadas da Globo |
A base limpa conserva data, título e observações. O enriquecimento posterior — já preservado nos CSVs do repositório — acrescenta identificador, título original, lançamento, avaliação e elenco.