Onde a dissertação está, em uma página — o que foi entregue contra o que estava planejado, quanto falta em cada frente e o que ainda pode dar errado. Os números desta página são contados do repositório a cada geração, não escritos à mão.
concluídos; falta E7
até o congelamento de 15/09
resolvidos com a orientação em 01/09
das séries elegíveis (min2) tocam dado anterior a 2018
6 páginas já vêm da base canônica só-pública — Run canônico (E1-E9), Base canônica (E0/E5), Qualificação × pipeline, Ensemble: caminhos (E8), Entendendo a curva de compra, Painel interativo (F9). As outras 7 trazem números da base anterior ao reprocessamento: a direção dos achados tende a se manter, os valores exatos vão mudar.
Todas as 13 trazem tarja no topo com o motivo específico e etiqueta no índice. Nenhuma está congelada para o texto.
Quanto falta, por frente
Como ler. cada módulo tem uma régua própria, contada do repositório a cada geração — percentual sem essa régua é decorativo. Execução é blocos concluídos sobre os 11 do guia — a mesma leitura que alimenta blocos_experimentais no ai.md. Código são três checagens de infraestrutura da Fase 1 do plano de fechamento: config.yaml com elegibilidade mínima de 2 anos, o run canônico atualizado no registry, e a higiene das entradas derivadas (toda entrada com run-pai cita o bloco a que pertence). Análise é quantas das Fases 4, 5 e 6 do plano têm evidência de conclusão no registry — a Fase 4 (consolidação do ensemble) ainda não tem o artefato de aceite (relatorio_e8_consolidacao.md); o que existe é a análise preliminar de caminhos do pool P0, que o próprio registro descreve como "pool é parâmetro — refazer com ARIMA". Site é quantas das Fases 8, 9, 11 e 12 têm o artefato correspondente publicado no repositório — a Fase 10 é este documento e fica fora da conta, para a página não se autoavaliar. Escrita não tem fonte verificável aqui: o plano de fechamento trata a redação do texto como fora do seu escopo.
Os pontos resolvidos
8 pontos de validação levantados com a orientação em 08/07 (seção 11), mais o impedimento de elegibilidade aberto em 04/08 — estão todos resolvidos, na sessão de planejamento de 01/09 com o autor. Fonte: registry/impedimentos.yml.
| ID | Pergunta | Decisão | Estado |
|---|---|---|---|
IMP-1 | O enquadramento das transições como concentração de erro + mecanismo (e não como "hipótese confirmada") está adequado para a defesa? | enquadramento concentração+mecanismo OK | resolvido 01/09 |
IMP-2 | O Ensino Médio deve entrar no experimento comparativo completo, ou o nível diagnóstico é suficiente caso a reconstrução da escalonada para o EM se mostre custosa? | Ensino Médio no comparativo completo (já feito) | resolvido 01/09 |
IMP-3 | O ajuste de progressão de coorte deve ser validado em amostra nacional ou mantido como estudo de caso (Maceió)? | validar em amostra nacional — Fase 3 do plano de fechamento | resolvido 01/09 |
IMP-4 | A exclusão de variáveis exógenas nesta versão, com justificativa formal no texto, é aceitável para a banca? | exclusão de exógenas com justificativa OK | resolvido 01/09 |
IMP-5 | O ensemble simples deve entrar na comparação principal ou ser tratado em trabalhos futuros? | ensemble entra na comparação principal — o autor o considera possivelmente a maior contribuição do trabalho | resolvido 01/09 |
IMP-6 | As datas propostas de congelamento de experimentos e entrega de versão completa estão compatíveis com a agenda da orientação? | datas OK | resolvido 01/09 |
IMP-7 | A taxonomia proposta — séries retroativas, escalonadas, internas, de fronteira e de progressão/coorte — é adequada como eixo organizador da contribuição? | taxonomia OK | resolvido 01/09 |
IMP-ELEG | Elegibilidade mínima de 4 anos ou 2 anos de histórico de treino — decide qual run vira o canônico do Capítulo 5. | elegibilidade mínima passa a ser o mínimo possível (2 anos); min4 vira análise de sensibilidade — ver config.yaml, bloco elegibilidade | resolvido 01/09 |
O que mudou
Desde a versão de 22/07 deste panorama, 7 entregas novas: Run canônico (E1-E9) (29/07), Base canônica (E0/E5) (29/07), Qualificação × pipeline (04/08), Ensemble: caminhos (E8) (01/09), Entendendo a curva de compra (01/09), Painel interativo (F9) (01/09), Como o experimento funciona (02/09). Nesse intervalo o pipeline saiu do papel e produziu o primeiro run canônico completo, e a comparação com a qualificação foi reconciliada número a número.
Uma raia por seção do site, um cartão por entrega publicada — abra para ler o que mudou; o título sozinho já ordena por data dentro da raia. Em âmbar, as entregas cujos números ainda dependem do reprocessamento; a marca "novo" sinaliza o que é posterior à versão de 22/07 deste panorama.
Diagnóstico
Parecer metodológico 06/07
Hierarquiza o que falta até a defesa: uma pergunta, uma explicação, uma prova de conceito, um resultado negativo honesto e um protocolo estatístico único.
Proposta de encaminhamento 08/07 provisório
Consolida pergunta, taxonomia, escopo, protocolo e métricas numa proposta única — e lista os sete pontos que dependem de decisão da orientação.
Provisório: Os achados da Seção 9 vêm da base atual e serão reprocessados sobre a base canônica só-pública antes de entrar no texto final.
Oráculo e taxonomia 15/07 provisório
Quantifica o teto da seleção por série — o oráculo chega a 2,33 de MAE — e formaliza a taxonomia. Friedman rejeita a equivalência entre as dez combinações.
Provisório: Números anteriores ao reprocessamento sobre a base canônica só-pública (E1). A direção dos achados tende a se manter; os valores exatos podem mudar.
Método
Plano de experimentos 03/06
Especifica os cinco experimentos da rodada de Maceió — baselines, estratificação, incerteza, coorte e espacial — com os gates que autorizam cada passo.
Guia de execução — fechamento da dissertação 08/07 provisório
Fecha o desenho experimental: base canônica só-pública, sete módulos de pipeline e dez experimentos em ordem de prioridade.
Provisório: O critério de elegibilidade descrito abaixo em ‘Elegibilidade’ (≥ 4 anos não nulos na janela de treino) era o desenho original de 08/07/2026. O autor resolveu o IMP-ELEG em 01/09/2026: a elegibilidade mínima vigente é 2 anos (config.yaml, bloco elegibilidade) — min2 é o canônico do Capítulo 5, e o mínimo de 4 anos passou a cenário de sensibilidade. O restante do desenho (escopo, pipeline, ordem dos experimentos) segue como descrito abaixo.
Como o experimento funciona 02/09 novo
Página de método: taxonomia interativa com exemplo ilustrativo de escola, pipeline m10→m70 com docstrings extraídas no build (sem Sphinx), protocolo com fórmulas e o porquê de cada escolha, o controle por etapa refeito (estimar dentro de cada etapa e agrupar por peso compartilhado, não uma etapa isolada), a lista fechada de cortes de escopo, e o roteador — o ensemble a priori que escolhe representação e método antes de prever, com sua cascata de retaguarda e a comparação contra os 5 concorrentes.
Resultados
Resultados de Maceió 03/06 provisório
Primeira rodada completa: o naive é o campeão global, e estratificação por etapa, coorte GPR e compra por quantil são as três frentes que conseguem superá-lo.
Provisório: Números anteriores ao reprocessamento sobre a base canônica só-pública (E1). A direção dos achados tende a se manter; os valores exatos podem mudar.
Comparação de MAE 04/06 provisório
Confronta a rodada nova com os EXEC anteriores na interseção exata de escolas, séries e anos-alvo, registrando o que ficou de fora por cobertura.
Provisório: Números anteriores ao reprocessamento sobre a base canônica só-pública (E1). A direção dos achados tende a se manter; os valores exatos podem mudar.
Run canônico (E1-E9) 29/07 novo provisório
Primeiro run completo do pipeline novo, com 16,1M predições: a suavização exponencial e o ensemble batem o baseline de último valor; a escalonada crua perde 21,7% em MAE, mas o teste formal mostra que a diferença vem de uma cauda de previsões ruins, não do caso típico; e a curva de compra traduz o erro em decisão do PNLD — comprar no quantil 95% derruba a falta de 44% para 5% das escolas, ao custo de multiplicar a sobra por 4,7×.
Provisório: Apesar do título, este run deixou de ser o canônico do Capítulo 5 em 01/09/2026: o autor resolveu o IMP-ELEG, baixando a elegibilidade mínima de 4 para 2 anos de histórico de treino, e o canônico passou a ser e1-20260804-175333 (min2) — e1-20260729-122616, o run desta página, desceu a análise de sensibilidade. Os números abaixo não ficaram errados: continuam válidos para o regime de elegibilidade que descrevem (mínimo de 4 anos), só deixaram de ser o resultado que representa o capítulo. E como a elegibilidade muda quais séries entram — o mínimo de 4 anos excluía inteiramente o 3º e o 4º ano do Fundamental, por exemplo —, comparar este run com o min2 é leitura de direção, não de nível: os dois não descrevem a mesma população de séries. Estado atualizado: Panorama da pesquisa e o registry (registry_experimentos.yml, blocos_experimentais.yml). Congela o estado das fases 3 a 6, não o texto final. A representação progressão/coorte (escalonada ajustada pela razão de transição) ainda não foi implementada; a curva de compra usa "último valor" para manter a leitura simples, não o método de menor MAE; a comparação com os números antigos do Cap.05 fica para o autor. Com N na casa dos milhões, todo p-valor sai < 0,001 — a leitura correta é sempre o tamanho de efeito.
Ensemble: caminhos (E8) 01/09 novo provisório
Primeira leitura de 'para onde o ensemble pode ir' sobre o pool de 5 métodos: podar o reglin piora, selecionar por estrato bate combinar mas fica a 4 alunos do oráculo, e o leque das predições subcobre o valor real em mais da metade dos casos.
Provisório: O pool tem 5 métodos (média, último valor, reglin, suavização exponencial, Kalman) — o ARIMA ainda não entrou. Quando m40b_arima.py gravar predicoes_arima.parquet, esta análise inteira se refaz trocando só a flag --metodos de tools/analise_ensemble.py, sem editar o script. A leitura interpretativa abaixo (o que cada número sugere fazer a seguir) é rascunho de quem executou a análise, não texto do autor da dissertação — os números foram conferidos contra os CSVs, as conclusões sobre eles ainda não passaram pelo autor. Nada aqui altera o run canônico nem as páginas já publicadas: é um recorte novo sobre os mesmos dados de e1-20260804-175333.
Entendendo a curva de compra 01/09 novo provisório
Página didática, não um novo resultado: explica do zero o que é comprar no quantil q de uma distribuição de erro, por que faltar livro e sobrar livro não são o mesmo tipo de erro, de onde saiu o p*≈0,70–0,80 do estudo de caso de Maceió — e por que ele não pode ser copiado para a curva nacional sem uma razão de custo que este trabalho não estimou.
Provisório: Página inteiramente didática — toda a prosa abaixo é rascunho do executor de tarefas, escrito para o autor estudar e conseguir defender o E9 (ele registrou que ainda não domina o tema o bastante), e ainda não passou pela voz do autor. Prioriza explicar bem três ou quatro ideias a cobrir tudo sobre quantis; não é uma referência completa de teoria de decisão. Os números de Maceió vêm de uma rodada anterior ao reprocessamento sobre a base canônica só-pública (ver o próprio aviso em resultados/maceio-t2.html) — tratados aqui como o que são, um estudo de caso histórico que motivou a pergunta, não uma validação nacional.
Painel interativo (F9) 01/09 novo provisório
Uma única tabela dinâmica, alimentada pelo run canônico min2 (e1-20260804-175333), responde qualquer corte de método × representação por etapa, posição, ano-alvo, UF, região, dependência ou porte em até dois cliques, com exportação CSV do recorte exibido — mais a curva por etapa com as fronteiras 5º→6º e 9º→1ªEM destacadas, a direção do erro traduzida em falta/sobra de livro, a matriz de efeito dos testes E6, o mapa de WAPE relativo por UF, a comparação com a qualificação e a curva de compra/risco interativa (min2), com um efeito da mudança de elegibilidade que não é uniforme: melhora marginal entre p50 e p80, inversão mais visível em p90.
Provisório: Os 8 componentes planejados na Fase 9 estão nesta página, incluindo a curva de compra/risco (seção 'Curva de compra e risco'), preenchida com a curva E9 sobre o run min2 assim que ela ficou disponível. O ARIMA ainda não entra em nenhuma comparação de método desta página — não existe no run e1-20260804-175333. Toda leitura interpretativa abaixo (os parágrafos fora das tabelas e legendas), incluindo a comparação min2×min4 da curva de compra, é rascunho do executor de tarefas, não texto do autor — os números foram lidos de CSV do run, mas a costura em prosa ainda não passou por revisão.
Validação
Transições críticas 17/06 provisório
Testa a hipótese das transições em escala nacional, com nove evidências e teste formal. Veredito parcial: 2 de 3 indicadores apoiam.
Provisório: Números anteriores ao reprocessamento sobre a base canônica só-pública (E1). A direção dos achados tende a se manter; os valores exatos podem mudar.
Gargalo nacional 01/07 provisório
Leva o baseline original ao Brasil inteiro e mostra o erro subindo justamente nas etapas que recebem transição, em 33 recortes geográficos.
Provisório: Números anteriores ao reprocessamento sobre a base canônica só-pública (E1). A direção dos achados tende a se manter; os valores exatos podem mudar.
Base canônica (E0/E5) 29/07 novo provisório
Base só-pública do pipeline novo construída e validada — 7,6M observações escola-etapa-ano, com duas ameaças à validade documentadas — e a primeira leitura estatística de por que repetir o último valor é difícil de superar: metade dos pares varia menos de 21% de um ano para o outro, e as etapas de fronteira não são mais instáveis que as internas.
Provisório: E0 valida a construção, não os números finais: a dependência administrativa vem de um snapshot único (2025) e a base bruta tem uma descontinuidade pré-2018 — as duas seguem como ameaças à validade até investigação futura. As descritivas de E5 rodaram antes da modelagem; a leitura de estabilidade tende a se manter, mas os valores exatos podem mudar. Um detalhe do corpo envelheceu em 01/09/2026: onde se lê “folga sobre o mínimo de 4 anos”, a elegibilidade mínima passou a ser 2 anos (IMP-ELEG resolvido pelo autor). O número do KPI não muda — esta caracterização vem do E5 e independe do corte de elegibilidade —, a folga apenas ficou maior do que a frase diz.
Qualificação × pipeline 04/08 novo provisório
A diferença entre o resultado da qualificação e o do pipeline não vem das mudanças de universo, como se supunha: filtrar rede, anos e etapas move o MAE da retroativa de 9,54 para 9,80. O sinal do agregado vira num único degrau — a exigência de 4 anos de histórico — e vira para os cinco métodos sem exceção. A vantagem da escalonada vinha inteira das séries que esse critério elimina, e não porque séries curtas sejam melhores: o comprimento da cadeia é função determinística da etapa, e a vantagem acaba quando a cadeia passa a cruzar a transição 5º→6º ano. A rodada de sensibilidade confirma: baixando o critério para 2 anos, o 4º ano volta com WAPE 15,5%, o menor da tabela. Além disso, dos segmentos testados só porte e regularidade da série sobrevivem ao controle por etapa — rede, região e localização eram composição.
Provisório: O texto abaixo — sobretudo o item B ("O mínimo de 4 anos segue sendo o canônico") e as referências a "o run canônico" ao longo da página — ficou desatualizado em 01/09/2026: o autor resolveu o IMP-ELEG, baixando a elegibilidade mínima de 4 para 2 anos, e o canônico do Capítulo 5 passou a ser e1-20260804-175333 (min2); e1-20260729-122616 (min4), o run que esta página trata como canônico — na escada, nos segmentos, na anomalia do Ceará e na validação do ARIMA —, desceu a análise de sensibilidade. Os números não ficaram errados: continuam válidos para o regime de elegibilidade que descrevem, e são a base do próprio achado da página — que a elegibilidade é o degrau que inverte o sinal entre retroativa e escalonada. No item B os papéis se invertem com a virada: a coluna "mín. 4", chamada de canônica no texto, é hoje a sensibilidade; a coluna "mín. 2", chamada de "rodada de sensibilidade", é hoje o canônico. Como a elegibilidade muda quais séries entram, ler as duas colunas continua sendo comparação de direção — o 3º e o 4º ano voltam a existir e a escalonada volta a vencer nas etapas iniciais —, não de nível. Estado atualizado: Panorama da pesquisa e o registry (registry_experimentos.yml, blocos_experimentais.yml). Três números da auditoria de 04/08 não foram reproduzidos e estão marcados como tal no texto. A causa mecânica da descontinuidade de 2018 segue indeterminada.
Onde o cronograma de julho ficou
Como ler. a barra tracejada é o que o plano de 29/07 previa; o ponto cheio é quando a entrega ficou pronta. As fases 1 a 5 fecharam todas em 29/07, de 4 a 24 dias antes do previsto — e o tempo ganho foi consumido pelo bloco roxo, que não estava no plano: a auditoria, a reconciliação com a qualificação e o ARIMA. O que restava desse plano migrou para o plano de fechamento de 01/09 — ver "Até a defesa", abaixo.
Até a defesa
Quatro marcos entre hoje e a defesa. Só dois têm data: o plano de fechamento afirma o congelamento (15/09) e a agenda da orientação confirmou a defesa prevista (30/11) — versão completa do texto e depósito não aparecem com prazo em nenhum documento do plano, e isso não é preenchido aqui: ausência de data é informação, não lacuna. "Em risco" é regra, não impressão: menos de 15 dias para o marco e algum módulo de Execução, Código ou Análise (seção acima) ainda abaixo de 100%.
| Marco | Data | Estado | Faltam |
|---|---|---|---|
| Congelamento de experimentos | 15/09 | em risco | 11 dias |
| Versão completa do texto | sem data afirmada | — | fora do escopo do plano de fechamento |
| Depósito | sem data afirmada | — | o plano não afirma esta data |
| Defesa | 30/11 | previsto | 87 dias |
O que já rodou
Como ler. os blocos do guia de execução na ordem em que foram concluídos. O E-EM não custou código próprio — a reconstrução da escalonada do Ensino Médio saiu da forma como a cadeia de progressão foi implementada.
Como ler. verde é escala nacional, âmbar é estudo de caso em Maceió, azul é cobertura parcial da faixa e tracejado é o que ainda não rodou. A escalonada nos anos iniciais é parcial por construção, não por falta de rodada: a cadeia precisa de elos anteriores ao alvo, que não existem para o 1º e o 2º ano — ela cobre do 3º ao 5º. O único buraco é a coorte fora de Maceió, que é exatamente o E7, programado em amostra nacional pela Fase 3 do plano de fechamento.
Como o pipeline roda

Como ler. os sete módulos numéricos, em ordem — a mesma figura que pipeline/m70_relatorios.py::_fig_fluxograma gera para o relatório de cada run, publicada em Como o experimento funciona e reaproveitada aqui, não redesenhada.
O que já foi feito
35 commits, agrupados por dia (excluídos merges e commits de infraestrutura de deploy — prefixo ci:) e cruzados com as entradas do registry datadas do mesmo dia. Fonte: git log + registry/registry_experimentos.yml.
| Dia | Commits | Runs no registry |
|---|---|---|
| 22/07 |
| — |
| 28/07 |
| — |
| 29/07 |
| e0-20260729-112118, e5-20260729-113857, e1-20260729-122616 |
| 04/08 |
| e1-20260804-175333 |
| 11/08 |
| e1-20260729-122616-arima |
| 01/09 |
| e1-20260804-175333+m70, e1-20260804-175333+backlog, e1-20260804-175333+quebra2018, e1-20260804-175333+ensemble |
| 02/09 |
| e1-20260804-175333-arima, e1-20260804-175333-e6-full |
| 04/09 |
| — |
O que ainda pode dar errado
0 ameaças à validade seguem abertas — sem mecanismo identificado — e as demais estão declaradas ou contornadas. Nenhuma invalida o que está publicado; todas precisam de uma frase no texto antes da defesa.
| Risco | Efeito | Estado | Onde está |
|---|---|---|---|
| Descontinuidade 2017→2018 na base bruta | 68,4% das séries elegíveis tocam dado anterior a 2018. Causa identificada em 04/09: o período pré-2018 de brasil_2007_2025.csv tem ~1/3 das linhas escola×etapa — a base de 2015 tem 25,5% da rede pública daquele ano, contra 81,4% em 2018. Os valores estão certos (razão mediana 1,00 na mesma escola e etapa entre 2017 e 2018); faltam linhas. Não é mudança de metodologia do INEP: os manuais de 2017 e 2018 são idênticos. | declarado no texto | Qualificação × pipeline |
| Dependência administrativa por snapshot de 2025 | viés de sobrevivência — escolas extintas antes de 2025 ficam de fora | declarado no texto | Base canônica (E0/E5) |
| Efeito Ceará | sobrevive a todos os controles testados, sem mecanismo identificado | declarado no texto | Qualificação × pipeline |
| Elegibilidade mínima: 4 anos ou 2 | degrau que inverte o sinal retroativa×escalonada; painel e texto precisam dizer qual dos dois números usam | declarado no texto | Qualificação × pipeline |
| Cobertura da escalonada | 32,0% contra 81,1% da retroativa — nivela por baixo toda comparação pareada | declarado no texto | Run canônico (E1-E9) |
| Três números da auditoria de 04/08 não reproduzem | a conclusão sobrevive porque se apoia no WAPE, que está correto | contornado | Qualificação × pipeline |
Qual é o argumento
Como ler. os números vêm de blocos experimentais distintos e não são comparáveis entre si — cada um é válido dentro do documento que o gerou, indicado no rodapé de cada passo. Os passos 2 e 3 mudaram de fundo, não só de número, com a virada para min2 (run e1-20260804-175333, canônico desde 01/09): a inversão retroativa×escalonada deixou de ser uniforme, e o passo que antes explicava a virada de julho pela elegibilidade — hoje resolvida (IMP-ELEG) — foi substituído pela lição estrutural do ensemble. O comparativo de métodos ainda não inclui ARIMA, que está rodando sobre min2 em paralelo a esta revisão; as tabelas ganham uma linha quando terminar. O run e1-20260729-122616 (min4) segue válido como análise de sensibilidade.
O que vem a seguir
Com os oito pontos de validação resolvidos em 01/09 e a elegibilidade mínima decidida — 2 anos, min2 já é o canônico do Capítulo 5 — o que falta até o congelamento de 15/09 é execução, não decisão: o ARIMA e o E6 completo sobre a base min2, o E7 em amostra nacional e a consolidação do ensemble (módulos Código, Execução e Análise, acima). Depois do congelamento, só site e escrita.