Apesar do título, este run deixou de ser o canônico do Capítulo 5 em 01/09/2026: o autor resolveu o IMP-ELEG, baixando a elegibilidade mínima de 4 para 2 anos de histórico de treino, e o canônico passou a ser e1-20260804-175333 (min2) — e1-20260729-122616, o run desta página, desceu a análise de sensibilidade. Os números abaixo não ficaram errados: continuam válidos para o regime de elegibilidade que descrevem (mínimo de 4 anos), só deixaram de ser o resultado que representa o capítulo. E como a elegibilidade muda quais séries entram — o mínimo de 4 anos excluía inteiramente o 3º e o 4º ano do Fundamental, por exemplo —, comparar este run com o min2 é leitura de direção, não de nível: os dois não descrevem a mesma população de séries. Estado atualizado: Panorama da pesquisa e o registry (registry_experimentos.yml, blocos_experimentais.yml). Congela o estado das fases 3 a 6, não o texto final. A representação progressão/coorte (escalonada ajustada pela razão de transição) ainda não foi implementada; a curva de compra usa "último valor" para manter a leitura simples, não o método de menor MAE; a comparação com os números antigos do Cap.05 fica para o autor. Com N na casa dos milhões, todo p-valor sai < 0,001 — a leitura correta é sempre o tamanho de efeito.
Um único run do pipeline consolidado responde a quatro perguntas em sequência:
qual método prevê melhor, se a forma de estruturar a série no tempo muda o resultado, o que
sobra disso quando se aplica teste estatístico de verdade, e o que tudo isso significa para
quem precisa decidir quantos livros comprar. As quatro seções abaixo saem do mesmo
run_id — nenhum número aqui vem de execução avulsa.
3,08M séries elegíveis × 5 métodos + fallback
suavização exponencial e ensemble, vs. 12,04 do último valor
no subconjunto pareado — mas ver o teste formal
comprando no quantil 95% da distribuição de erro
Backtesting de origem móvel sobre cinco anos-alvo (2021 a 2025), com treino
sempre restrito a ano_alvo − 2 — o gap fiel à defasagem real do PNLD entre o dado
disponível e a decisão de compra. Elegibilidade: mínimo de 4 anos não nulos no treino; séries
abaixo disso caem em fallback (só "último valor", 4,5% do total) e são
excluídas de toda comparação. Salvo indicação contrária, tudo abaixo é o
segmento sem_fallback.
Os métodos: quem prevê melhor
Cinco métodos P0 (média histórica, último valor, regressão linear, suavização exponencial e Filtro de Kalman) mais dois ensembles — média e mediana das cinco previsões, calculados como pós-processamento, sem nenhum modelo novo.
| Método | MAE | WAPE | Bias médio |
|---|---|---|---|
| Ensemble (média) | 11,13 | 22,9% | +1,08 |
| Suavização exponencial | 11,13 | 22,9% | +1,44 |
| Ensemble (mediana) | 11,23 | 23,1% | +0,92 |
| Kalman | 11,80 | 24,3% | +0,87 |
| Último valor (baseline) | 12,04 | 24,8% | +0,81 |
| Média histórica | 13,42 | 27,6% | +3,64 |
| Regressão linear | 13,56 | 27,9% | −1,33 |
Representação retroativa, n = 2.571.581 predições por método. Ranking global não é
a leitura recomendada (o guia §7 proíbe "campeão universal") — serve de resumo de partida, e a
decomposição por etapa vem logo abaixo. Tabela completa por etapa/posição/direção em
runs/e1-20260729-122616/metricas_agregadas.csv.
O ensemble por média (MAE 11,128) empata com a suavização exponencial (11,132) — diferença na terceira casa decimal. O ponto operacional é esse: o ensemble entrega o desempenho do melhor método sem exigir que se saiba de antemão qual dos cinco vence em cada etapa. É a leitura que a banca pediu para o tema — uma tabela, não um capítulo.
MAE por etapa
Como ler. MAE (erro absoluto médio, em alunos) do baseline de "último valor" contra o melhor método P0 em cada etapa — quase sempre a suavização exponencial ou o Kalman.
WAPE por etapa
Como ler. a mesma comparação em WAPE (erro proporcional ao volume de matrículas) — a métrica que permite comparar etapas de portes muito diferentes (EF×EM).
O MAE sobe visivelmente do Fundamental — Anos Iniciais (~7-9 alunos) para os Anos Finais (~12-14) e dispara no Ensino Médio (~25-31) — mas isso acompanha o tamanho médio da etapa (34 alunos/turma no 1ºEF, 118 na 1ª série do EM), não uma piora real de ajuste. O WAPE, que normaliza pelo volume, fica muito mais estável entre etapas (grosso modo 21%-28% em quase todas) — é a decomposição MAE = tamanho médio × WAPE (guia §7) que explica a diferença. Reportar MAE sozinho faria o Ensino Médio parecer um problema de modelagem, quando é um problema de escala.
A coluna de bias da tabela mostra que os métodos não erram na mesma direção. A média histórica enviesa consistentemente para cima, e o desvio cresce com a etapa: +10,2 alunos no 6º EF e +22,0 na 1ª série do EM, contra +3,6 no agregado. É o comportamento esperado de um método que só olha a média do passado quando a matrícula está em queda em parte da base. A regressão linear erra na direção oposta — bias negativo em todas as etapas (−0,5 a −2,8), extrapolando tendências de queda para além do que se realiza. Kalman, suavização exponencial e último valor ficam perto de zero em quase toda a curva, subindo só na 1ª série do EM (+5,7, +9,2 e +5,2).
Retroativa × escalonada: a hipótese central em teste
A representação escalonada segue a trajetória esperada da coorte: para prever a etapa e no ano y, usa a etapa anterior na cadeia (não a mesma etapa) da mesma escola, em y−k. A hipótese central da dissertação é que isso deveria representar melhor a dinâmica educacional do que a retroativa (mesma etapa, anos anteriores). Este é o teste direto dessa hipótese.
vs. 81,1% da retroativa — estruturalmente menor
mesma escola/etapa/ano/método, sem fallback nas duas
vs. 12,12 da retroativa, no subconjunto pareado
menos que nas internas (49,9%) — o oposto do esperado
Cobertura estrutural (inclui a reconstrução E-EM)
Como ler. % de séries com histórico suficiente (elegíveis, sem fallback) sobre o total gerado para aquela etapa. A escalonada é 0% elegível em 2º, 3º e 4º EF — não por falta de dado, mas porque a cadeia não tem lags suficientes tão perto da pré-escola sob o gap T-2 (no máximo 0 a 3 anos de histórico possíveis, sempre abaixo do mínimo de 4). A partir do 5º EF a cobertura escalonada cresce (27%-60%), inclusive nas etapas do Ensino Médio, que já encadeiam sozinhas até o Fundamental — a reconstrução pedida em E-EM (guia §8) sai de graça da forma como a cadeia foi implementada, sem código especial para o EM.
MAE pareado por etapa
Como ler. MAE no subconjunto pareado (mesma escola, etapa, ano, método, elegível nas duas representações) — só etapas com cobertura escalonada aparecem.
Só o 8º EF tem a escalonada levemente à frente (MAE 9,03 vs. 9,82, ganha em 55,5% dos pares). Em todas as outras etapas com cobertura — inclusive as três séries do Ensino Médio — a retroativa é melhor, às vezes por uma margem grande (1ª série do EM: MAE 21,85 retroativa vs. 39,13 escalonada). Por posição, a escalonada perde mais nas fronteiras (MAE 17,37 vs. 12,39, ganha em só 47,6% dos pares) do que nas internas (14,21 vs. 12,07, 49,9%) — o oposto do que a hipótese "a estruturação temporal ajuda mais exatamente onde a coorte muda de contexto" previa. O teste formal, na seção seguinte, qualifica de onde vem essa diferença de médias.
A escalonada, como implementada aqui, usa o valor bruto da etapa anterior — sem corrigir o nível entre etapas (evasão, repetência, mudança de rede entre 8º EF e 1º EM, por exemplo). Prever a matrícula do 1º EM copiando o valor do 9º EF do ano anterior ignora que essas duas etapas têm tamanhos sistematicamente diferentes. É exatamente para isso que o guia separa uma representação progressão/coorte — escalonada ajustada pela razão média destino/origem da transição, estimada só no treino do fold — como passo seguinte (P2, ainda não implementada). Resultado negativo aqui é o esperado antes desse ajuste, não uma falha do pipeline.
Leitura complementar: WAPE por método, sem pareamento
Os números acima restringem tudo ao subconjunto comum às duas representações. As três figuras a seguir fazem o corte oposto: cada representação agregada sobre toda a sua população elegível, em WAPE. As populações por trás de "escalonada" e "retroativa" numa mesma etapa não são as mesmas séries — útil para ver a forma da curva por método, não para afirmar qual representação vence.
Como ler. os 7 métodos sobre a representação retroativa, todas as etapas. Clique numa entrada da legenda para isolar um método. Curva relativamente estável (~21%-28%) até a 1ª série do EM, onde todos os métodos sobem.
Como ler. mesma comparação, representação escalonada — sem dado para 1º-4º EF. Note o pico da regressão linear em 5ºEF (53%) e a subida mais acentuada nas transições (6ºEF, 1ªEM) do que na figura anterior.
Como ler. diferença em pontos percentuais — abaixo da linha pontilhada (zero) é a retroativa com WAPE menor. A escalonada só fica à frente no 5ºEF, logo após o corte de dados; a partir do 6ºEF a retroativa abre vantagem, maior nas etapas de fronteira (6ºEF, 1ª-2ªEM).
Valor exato por etapa e método no hover das figuras, ou em
runs/e1-20260729-122616/metricas_agregadas.csv. Médias simples nas 8 etapas em que as
duas representações existem (5ºEF a 3ªEM): WAPE 25,4% na retroativa contra 32,7% na escalonada.
O que o teste formal diz
O módulo 60 recomputa todos os testes estatísticos da dissertação a partir das predições — zero teste "solto" fora do pipeline (guia §8). Três famílias: método × método e retroativa × escalonada (Wilcoxon pareado + rank-biserial, mesmas unidades), interna × fronteira (Mann-Whitney + rank-biserial, grupos independentes), com correção de Holm dentro de cada família.
Com 500 mil a 2,6 milhões de pares por comparação, o p-valor dá < 0,001 em
praticamente tudo — inclusive diferenças sem relevância prática. A partir daqui, todo número que
importa é o tamanho de efeito (rank-biserial): <0,1 desprezível · 0,1-0,3 pequeno ·
0,3-0,5 médio · ≥0,5 grande.
A diferença entre representações é de cauda, não de caso típico
Aplicado à comparação da seção anterior, o teste conta uma história mais precisa que o MAE. O tamanho de efeito rank-biserial para retroativa × escalonada é desprezível em 6 dos 7 métodos (|r| entre 0,009 e 0,040, incluindo último valor, Kalman e os dois ensembles). A única exceção real é a regressão linear, onde a escalonada perde de forma consistente — efeito −0,245, pequeno, na média e na mediana.
Como ler. "último valor" pareado: o MAE (média) favorece a retroativa, mas a mediana é ligeiramente menor na escalonada — é o p95 que se abre, mostrando de onde vem a diferença de MAE.
Para "último valor": mediana do erro = 6,0 alunos (retroativa) vs. 5,0 (escalonada) — a escalonada ganha no caso típico. Mas no p95 a escalonada sobe para 56 alunos de erro contra 41 da retroativa, e o máximo observado chega a 670 (vs. 594). A escalonada empata ou ganha em 49,9% dos pares — essencialmente um cara-ou-coroa. O MAE da seção anterior está certo, só não conta a história toda: a escalonada não é pior no caso típico, ela é mais arriscada. Isso muda o que fazer a seguir — o problema a atacar é a cauda (justamente o que o ajuste de razão de progressão deve corrigir), não a representação inteira.
Interna × fronteira: efeito desprezível em todos os métodos
Mann-Whitney entre séries internas e de fronteira (dentro da retroativa) dá efeito desprezível (|r| entre 0,036 e 0,050) para os 7 métodos, incluindo os ensembles — reforça o que a caracterização da base já indicava com a estabilidade ano-a-ano (ver base canônica): a taxonomia interna/fronteira tem um efeito real, mas pequeno demais para carregar sozinha o argumento metodológico da dissertação.
Do erro à compra: quanto comprar acima da previsão?
O PNLD decide quantos livros comprar com base numa previsão — mas a previsão erra. Esta curva traduz o erro em decisão prática: em vez de comprar exatamente o valor previsto, comprar um pouco acima dele reduz o risco de faltar material, ao custo de comprar (e eventualmente desperdiçar) mais do que o necessário. A pergunta operacional é: quanto acima?
comprando exatamente no valor previsto (p=50%)
comprando no quantil 95% da distribuição de erro
ao subir de p=50% para p=95% (16,5M → 77,3M alunos-livro)
Como ler. para cada quantil p da distribuição de
erro de previsão (backtest 2021-2025), a compra sugerida é previsão + quantil(p).
Vermelho: soma nacional de alunos sem livro (falta). Azul: soma de livros comprados a mais que o
necessário (sobra). As duas curvas se movem em direções opostas — não existe ponto que zere as duas.
| Quantil de compra | Livros a mais por série | Falta (alunos) | Sobra (alunos) | % escolas com falta |
|---|---|---|---|---|
| 50% | +0 | 14.430.913 | 16.522.811 | 44,2% |
| 70% | +3 | 11.433.318 | 21.239.959 | 29,9% |
| 80% | +7 | 8.808.642 | 28.901.607 | 19,6% |
| 90% | +16 | 5.449.573 | 48.686.767 | 10,0% |
| 95% | +28 | 3.200.607 | 77.296.773 | 4,9% |
"Livros a mais por série" é o ajuste absoluto somado à previsão de cada escola-etapa naquele quantil — a tradução operacional direta da curva.
O trabalho anterior em Maceió chegou a um quantil ótimo de p*≈0,70-0,80, mas essa conclusão pressupõe um custo relativo entre faltar e sobrar (o clássico "problema do jornaleiro": o ponto ótimo é onde a proporção falta/sobra se iguala à razão entre os dois custos). Faltar livro tem custo pedagógico — difícil de traduzir em número — e sobrar tem custo de armazenagem e impressão. Sem uma razão de custo explícita e defensável, apontar um p* único aqui seria inventar um número que os dados sozinhos não sustentam. A curva acima é a evidência; a escolha do ponto é uma decisão do FNDE/PNLD, informada por ela.
Calculado com o método "último valor" (retroativa) — não o de menor MAE (essa honra é da suavização exponencial e do ensemble), mas o mais simples de explicar para quem decide a compra. Uma versão futura pode refazer esta curva com o método escolhido para o texto final.
Fonte: Censo Escolar/INEP 2007-2025, base canônica só-pública (ver
base canônica). Backtesting de
origem móvel, anos-alvo 2021-2025, gap T-2, segmento sem_fallback. Testes: Wilcoxon
pareado e Mann-Whitney (scipy.stats), Holm dentro de cada família. Run rastreável:
e1-20260729-122616 em registry/registry_experimentos.yml; tabelas e
figuras completas em runs/e1-20260729-122616/. Para os números vigentes do Capítulo 5
(base min2), ver o painel interativo de
resultados e o run e1-20260804-175333.