research.jflneto.dev.br
Resultados

Run canônico nacional: da série temporal à decisão de compra

Um único run sobre a base só-pública — cinco métodos, duas representações, protocolo estatístico e curva de compra do PNLD (E1, E2/E3/E4, E6/E8, E9)

29/07/2026ResultadosE1, E2/E3/E4, E6/E8 e E9 concluídosorigem: pipeline/m30_series.py + m40_modelos.py + m50_avaliacao.py + m60_estatistica.py + m70_relatorios.py — run e1-20260729-122616
Números provisórios

Apesar do título, este run deixou de ser o canônico do Capítulo 5 em 01/09/2026: o autor resolveu o IMP-ELEG, baixando a elegibilidade mínima de 4 para 2 anos de histórico de treino, e o canônico passou a ser e1-20260804-175333 (min2) — e1-20260729-122616, o run desta página, desceu a análise de sensibilidade. Os números abaixo não ficaram errados: continuam válidos para o regime de elegibilidade que descrevem (mínimo de 4 anos), só deixaram de ser o resultado que representa o capítulo. E como a elegibilidade muda quais séries entram — o mínimo de 4 anos excluía inteiramente o 3º e o 4º ano do Fundamental, por exemplo —, comparar este run com o min2 é leitura de direção, não de nível: os dois não descrevem a mesma população de séries. Estado atualizado: Panorama da pesquisa e o registry (registry_experimentos.yml, blocos_experimentais.yml). Congela o estado das fases 3 a 6, não o texto final. A representação progressão/coorte (escalonada ajustada pela razão de transição) ainda não foi implementada; a curva de compra usa "último valor" para manter a leitura simples, não o método de menor MAE; a comparação com os números antigos do Cap.05 fica para o autor. Com N na casa dos milhões, todo p-valor sai < 0,001 — a leitura correta é sempre o tamanho de efeito.

Um único run do pipeline consolidado responde a quatro perguntas em sequência: qual método prevê melhor, se a forma de estruturar a série no tempo muda o resultado, o que sobra disso quando se aplica teste estatístico de verdade, e o que tudo isso significa para quem precisa decidir quantos livros comprar. As quatro seções abaixo saem do mesmo run_id — nenhum número aqui vem de execução avulsa.

16,1Mpredições geradas
3,08M séries elegíveis × 5 métodos + fallback
11,13menor MAE
suavização exponencial e ensemble, vs. 12,04 do último valor
+21,7%MAE da escalonada é pior
no subconjunto pareado — mas ver o teste formal
4,9%escolas com falta
comprando no quantil 95% da distribuição de erro
O protocolo do run

Backtesting de origem móvel sobre cinco anos-alvo (2021 a 2025), com treino sempre restrito a ano_alvo − 2 — o gap fiel à defasagem real do PNLD entre o dado disponível e a decisão de compra. Elegibilidade: mínimo de 4 anos não nulos no treino; séries abaixo disso caem em fallback (só "último valor", 4,5% do total) e são excluídas de toda comparação. Salvo indicação contrária, tudo abaixo é o segmento sem_fallback.

Os métodos: quem prevê melhor

Cinco métodos P0 (média histórica, último valor, regressão linear, suavização exponencial e Filtro de Kalman) mais dois ensembles — média e mediana das cinco previsões, calculados como pós-processamento, sem nenhum modelo novo.

MétodoMAEWAPEBias médio
Ensemble (média)11,1322,9%+1,08
Suavização exponencial11,1322,9%+1,44
Ensemble (mediana)11,2323,1%+0,92
Kalman11,8024,3%+0,87
Último valor (baseline)12,0424,8%+0,81
Média histórica13,4227,6%+3,64
Regressão linear13,5627,9%−1,33

Representação retroativa, n = 2.571.581 predições por método. Ranking global não é a leitura recomendada (o guia §7 proíbe "campeão universal") — serve de resumo de partida, e a decomposição por etapa vem logo abaixo. Tabela completa por etapa/posição/direção em runs/e1-20260729-122616/metricas_agregadas.csv.

O ensemble empata com o melhor método, sem precisar escolher

O ensemble por média (MAE 11,128) empata com a suavização exponencial (11,132) — diferença na terceira casa decimal. O ponto operacional é esse: o ensemble entrega o desempenho do melhor método sem exigir que se saiba de antemão qual dos cinco vence em cada etapa. É a leitura que a banca pediu para o tema — uma tabela, não um capítulo.

MAE por etapa

Como ler. MAE (erro absoluto médio, em alunos) do baseline de "último valor" contra o melhor método P0 em cada etapa — quase sempre a suavização exponencial ou o Kalman.

WAPE por etapa

Como ler. a mesma comparação em WAPE (erro proporcional ao volume de matrículas) — a métrica que permite comparar etapas de portes muito diferentes (EF×EM).

Por que as duas figuras andam juntas

O MAE sobe visivelmente do Fundamental — Anos Iniciais (~7-9 alunos) para os Anos Finais (~12-14) e dispara no Ensino Médio (~25-31) — mas isso acompanha o tamanho médio da etapa (34 alunos/turma no 1ºEF, 118 na 1ª série do EM), não uma piora real de ajuste. O WAPE, que normaliza pelo volume, fica muito mais estável entre etapas (grosso modo 21%-28% em quase todas) — é a decomposição MAE = tamanho médio × WAPE (guia §7) que explica a diferença. Reportar MAE sozinho faria o Ensino Médio parecer um problema de modelagem, quando é um problema de escala.

Direção do erro: a média histórica superestima

A coluna de bias da tabela mostra que os métodos não erram na mesma direção. A média histórica enviesa consistentemente para cima, e o desvio cresce com a etapa: +10,2 alunos no 6º EF e +22,0 na 1ª série do EM, contra +3,6 no agregado. É o comportamento esperado de um método que só olha a média do passado quando a matrícula está em queda em parte da base. A regressão linear erra na direção oposta — bias negativo em todas as etapas (−0,5 a −2,8), extrapolando tendências de queda para além do que se realiza. Kalman, suavização exponencial e último valor ficam perto de zero em quase toda a curva, subindo só na 1ª série do EM (+5,7, +9,2 e +5,2).

Retroativa × escalonada: a hipótese central em teste

A representação escalonada segue a trajetória esperada da coorte: para prever a etapa e no ano y, usa a etapa anterior na cadeia (não a mesma etapa) da mesma escola, em y−k. A hipótese central da dissertação é que isso deveria representar melhor a dinâmica educacional do que a retroativa (mesma etapa, anos anteriores). Este é o teste direto dessa hipótese.

32,0%cobertura da escalonada
vs. 81,1% da retroativa — estruturalmente menor
2,9Mpares comparáveis
mesma escola/etapa/ano/método, sem fallback nas duas
14,75MAE da escalonada
vs. 12,12 da retroativa, no subconjunto pareado
47,6%escalonada ganha em fronteiras
menos que nas internas (49,9%) — o oposto do esperado

Cobertura estrutural (inclui a reconstrução E-EM)

Como ler. % de séries com histórico suficiente (elegíveis, sem fallback) sobre o total gerado para aquela etapa. A escalonada é 0% elegível em 2º, 3º e 4º EF — não por falta de dado, mas porque a cadeia não tem lags suficientes tão perto da pré-escola sob o gap T-2 (no máximo 0 a 3 anos de histórico possíveis, sempre abaixo do mínimo de 4). A partir do 5º EF a cobertura escalonada cresce (27%-60%), inclusive nas etapas do Ensino Médio, que já encadeiam sozinhas até o Fundamental — a reconstrução pedida em E-EM (guia §8) sai de graça da forma como a cadeia foi implementada, sem código especial para o EM.

MAE pareado por etapa

Como ler. MAE no subconjunto pareado (mesma escola, etapa, ano, método, elegível nas duas representações) — só etapas com cobertura escalonada aparecem.

A escalonada crua perde — e perde mais nas fronteiras

Só o 8º EF tem a escalonada levemente à frente (MAE 9,03 vs. 9,82, ganha em 55,5% dos pares). Em todas as outras etapas com cobertura — inclusive as três séries do Ensino Médio — a retroativa é melhor, às vezes por uma margem grande (1ª série do EM: MAE 21,85 retroativa vs. 39,13 escalonada). Por posição, a escalonada perde mais nas fronteiras (MAE 17,37 vs. 12,39, ganha em só 47,6% dos pares) do que nas internas (14,21 vs. 12,07, 49,9%) — o oposto do que a hipótese "a estruturação temporal ajuda mais exatamente onde a coorte muda de contexto" previa. O teste formal, na seção seguinte, qualifica de onde vem essa diferença de médias.

Por que isso é esperado, não um bug

A escalonada, como implementada aqui, usa o valor bruto da etapa anterior — sem corrigir o nível entre etapas (evasão, repetência, mudança de rede entre 8º EF e 1º EM, por exemplo). Prever a matrícula do 1º EM copiando o valor do 9º EF do ano anterior ignora que essas duas etapas têm tamanhos sistematicamente diferentes. É exatamente para isso que o guia separa uma representação progressão/coorte — escalonada ajustada pela razão média destino/origem da transição, estimada só no treino do fold — como passo seguinte (P2, ainda não implementada). Resultado negativo aqui é o esperado antes desse ajuste, não uma falha do pipeline.

Leitura complementar: WAPE por método, sem pareamento

Outro corte, outra população

Os números acima restringem tudo ao subconjunto comum às duas representações. As três figuras a seguir fazem o corte oposto: cada representação agregada sobre toda a sua população elegível, em WAPE. As populações por trás de "escalonada" e "retroativa" numa mesma etapa não são as mesmas séries — útil para ver a forma da curva por método, não para afirmar qual representação vence.

Como ler. os 7 métodos sobre a representação retroativa, todas as etapas. Clique numa entrada da legenda para isolar um método. Curva relativamente estável (~21%-28%) até a 1ª série do EM, onde todos os métodos sobem.

Como ler. mesma comparação, representação escalonada — sem dado para 1º-4º EF. Note o pico da regressão linear em 5ºEF (53%) e a subida mais acentuada nas transições (6ºEF, 1ªEM) do que na figura anterior.

Como ler. diferença em pontos percentuais — abaixo da linha pontilhada (zero) é a retroativa com WAPE menor. A escalonada só fica à frente no 5ºEF, logo após o corte de dados; a partir do 6ºEF a retroativa abre vantagem, maior nas etapas de fronteira (6ºEF, 1ª-2ªEM).

Valor exato por etapa e método no hover das figuras, ou em runs/e1-20260729-122616/metricas_agregadas.csv. Médias simples nas 8 etapas em que as duas representações existem (5ºEF a 3ªEM): WAPE 25,4% na retroativa contra 32,7% na escalonada.

O que o teste formal diz

O módulo 60 recomputa todos os testes estatísticos da dissertação a partir das predições — zero teste "solto" fora do pipeline (guia §8). Três famílias: método × método e retroativa × escalonada (Wilcoxon pareado + rank-biserial, mesmas unidades), interna × fronteira (Mann-Whitney + rank-biserial, grupos independentes), com correção de Holm dentro de cada família.

Por que o p-valor não é a leitura aqui

Com 500 mil a 2,6 milhões de pares por comparação, o p-valor dá < 0,001 em praticamente tudo — inclusive diferenças sem relevância prática. A partir daqui, todo número que importa é o tamanho de efeito (rank-biserial): <0,1 desprezível · 0,1-0,3 pequeno · 0,3-0,5 médio · ≥0,5 grande.

A diferença entre representações é de cauda, não de caso típico

Aplicado à comparação da seção anterior, o teste conta uma história mais precisa que o MAE. O tamanho de efeito rank-biserial para retroativa × escalonada é desprezível em 6 dos 7 métodos (|r| entre 0,009 e 0,040, incluindo último valor, Kalman e os dois ensembles). A única exceção real é a regressão linear, onde a escalonada perde de forma consistente — efeito −0,245, pequeno, na média e na mediana.

Como ler. "último valor" pareado: o MAE (média) favorece a retroativa, mas a mediana é ligeiramente menor na escalonada — é o p95 que se abre, mostrando de onde vem a diferença de MAE.

Cauda pesada, não mediocridade geral

Para "último valor": mediana do erro = 6,0 alunos (retroativa) vs. 5,0 (escalonada) — a escalonada ganha no caso típico. Mas no p95 a escalonada sobe para 56 alunos de erro contra 41 da retroativa, e o máximo observado chega a 670 (vs. 594). A escalonada empata ou ganha em 49,9% dos pares — essencialmente um cara-ou-coroa. O MAE da seção anterior está certo, só não conta a história toda: a escalonada não é pior no caso típico, ela é mais arriscada. Isso muda o que fazer a seguir — o problema a atacar é a cauda (justamente o que o ajuste de razão de progressão deve corrigir), não a representação inteira.

Interna × fronteira: efeito desprezível em todos os métodos

Mann-Whitney entre séries internas e de fronteira (dentro da retroativa) dá efeito desprezível (|r| entre 0,036 e 0,050) para os 7 métodos, incluindo os ensembles — reforça o que a caracterização da base já indicava com a estabilidade ano-a-ano (ver base canônica): a taxonomia interna/fronteira tem um efeito real, mas pequeno demais para carregar sozinha o argumento metodológico da dissertação.

Do erro à compra: quanto comprar acima da previsão?

O PNLD decide quantos livros comprar com base numa previsão — mas a previsão erra. Esta curva traduz o erro em decisão prática: em vez de comprar exatamente o valor previsto, comprar um pouco acima dele reduz o risco de faltar material, ao custo de comprar (e eventualmente desperdiçar) mais do que o necessário. A pergunta operacional é: quanto acima?

44,2%escolas com falta
comprando exatamente no valor previsto (p=50%)
4,9%escolas com falta
comprando no quantil 95% da distribuição de erro
4,7×sobra multiplicada
ao subir de p=50% para p=95% (16,5M → 77,3M alunos-livro)

Como ler. para cada quantil p da distribuição de erro de previsão (backtest 2021-2025), a compra sugerida é previsão + quantil(p). Vermelho: soma nacional de alunos sem livro (falta). Azul: soma de livros comprados a mais que o necessário (sobra). As duas curvas se movem em direções opostas — não existe ponto que zere as duas.

Quantil de compraLivros a mais por sérieFalta (alunos)Sobra (alunos)% escolas com falta
50%+014.430.91316.522.81144,2%
70%+311.433.31821.239.95929,9%
80%+78.808.64228.901.60719,6%
90%+165.449.57348.686.76710,0%
95%+283.200.60777.296.7734,9%

"Livros a mais por série" é o ajuste absoluto somado à previsão de cada escola-etapa naquele quantil — a tradução operacional direta da curva.

Por que não apontamos um único "p* ótimo"

O trabalho anterior em Maceió chegou a um quantil ótimo de p*≈0,70-0,80, mas essa conclusão pressupõe um custo relativo entre faltar e sobrar (o clássico "problema do jornaleiro": o ponto ótimo é onde a proporção falta/sobra se iguala à razão entre os dois custos). Faltar livro tem custo pedagógico — difícil de traduzir em número — e sobrar tem custo de armazenagem e impressão. Sem uma razão de custo explícita e defensável, apontar um p* único aqui seria inventar um número que os dados sozinhos não sustentam. A curva acima é a evidência; a escolha do ponto é uma decisão do FNDE/PNLD, informada por ela.

Calculado com o método "último valor" (retroativa) — não o de menor MAE (essa honra é da suavização exponencial e do ensemble), mas o mais simples de explicar para quem decide a compra. Uma versão futura pode refazer esta curva com o método escolhido para o texto final.

Fonte: Censo Escolar/INEP 2007-2025, base canônica só-pública (ver base canônica). Backtesting de origem móvel, anos-alvo 2021-2025, gap T-2, segmento sem_fallback. Testes: Wilcoxon pareado e Mann-Whitney (scipy.stats), Holm dentro de cada família. Run rastreável: e1-20260729-122616 em registry/registry_experimentos.yml; tabelas e figuras completas em runs/e1-20260729-122616/. Para os números vigentes do Capítulo 5 (base min2), ver o painel interativo de resultados e o run e1-20260804-175333.