Transformação integral de probabilidade: calibração de previsões de densidade
Entenda como a PIT avalia previsões de densidade contínuas e discretas, o que os histogramas indicam e por que uniformidade sozinha não basta
Neste guiaPor que uma previsão de densidade vai além do erro pontual
Resumo breve
Uma previsão de densidade atribui probabilidades a uma faixa de resultados possíveis. A transformação integral de probabilidade (PIT) converte cada resultado observado em sua probabilidade acumulada segundo a previsão. Valores PIT uniformes são um diagnóstico útil sob hipóteses definidas, mas um histograma plano não prova, sozinho, calibração condicional nem independência ao longo do tempo.
Por que uma previsão de densidade vai além do erro pontual
Uma previsão pontual pode indicar retorno de 0,2% amanhã. A previsão de densidade atribui probabilidades a toda a faixa de retornos, de movimentos comuns a eventos extremos. Avaliamos se a distribuição emitida antes de observar o resultado é compatível com o que ocorreu depois. O guia Mincer–Zarnowitz trata da calibração linear de previsões numéricas pontuais, uma pergunta distinta.
A PIT mede a probabilidade acumulada atribuída até o valor observado. É um posto probabilístico, não um retorno, sinal de negociação ou medida de lucro. O guia Diebold–Mariano compara perdas médias de previsão sob um escore escolhido; não avalia a mesma coisa que calibração de densidade.
Transforme uma previsão contínua pela função de distribuição
Seja (Y_{t+1}) o resultado após a origem da previsão (t), e (F_{t+1}(y\mid\mathcal I_t)) a função de distribuição acumulada (CDF) baseada apenas nas informações (\mathcal I_t) disponíveis naquele momento. Para uma distribuição contínua, calcule
Uₜ₊₁ = Fₜ₊₁(Yₜ₊₁ | 𝓘ₜ)
A CDF é a probabilidade de um valor menor ou igual a (y). Se a CDF prevista é a verdadeira distribuição condicional, o teorema da PIT implica
Pr(Uₜ₊₁ ≤ u | 𝓘ₜ) = u, for 0 ≤ u ≤ 1
Assim, uma previsão contínua ideal de um passo produz PIT uniforme condicionalmente às informações de previsão. Em uma sequência cujo conjunto de informação inclui o passado, PITs ideais também são independentes entre origens sob as hipóteses apropriadas. Rosenblatt estudou a transformação; Diebold, Gunther e Tay aplicaram sequências PIT à avaliação de previsões de densidade (1952; 1998).
Exemplo verificável: uma previsão (N(0,1)) e resultado (y=1) geram (Phi(1)\approx0.8413), ou cerca de 84,13% de probabilidade em valores até 1. Uma observação não determina calibração; precisamos de uma sequência.
Randomize a transformação para resultados discretos
Uma CDF discreta salta nos resultados possíveis. Portanto, (F(Y)) usual assume poucos níveis e em geral não é uniforme, mesmo com previsão correta. A PIT randomizada preenche cada intervalo de salto:
Uₜ₊₁ = Fₜ₊₁(Yₜ₊₁⁻ | 𝓘ₜ) + Vₜ₊₁ [Fₜ₊₁(Yₜ₊₁ | 𝓘ₜ) − Fₜ₊₁(Yₜ₊₁⁻ | 𝓘ₜ)]
(F(y^-)) é o limite à esquerda, a probabilidade de um valor estritamente menor que (y); (V) é uma extração independente Uniform(0,1) usada só na avaliação. Para distribuição contínua o salto é zero e a expressão vira (F(Y)). Brockwell demonstra a transformação randomizada para distribuições gerais, inclusive discretas e mistas (2007). Para contagens ordenadas, Czado, Gneiting e Held também discutem PIT não randomizada e gráficos de calibração marginal; não trate (F(Y)) discreto como se fosse contínuo-uniforme (2009).
Exemplo hipotético de Bernoulli: (P(Y=1)=0.20) e (P(Y=0)=0.80). A PIT usual é 0,80 quando (Y=0) e 1,00 quando (Y=1), portanto não é uniforme. Com randomização, (Y=0) vira (0.80V) em ([0,0.80]); (Y=1) vira (0.80+0.20V) em ([0.80,1]). Ponderados pelas probabilidades dos eventos, a densidade conjunta fica uniforme em ([0,1]). O sorteio é ferramenta de avaliação, não parte da previsão.
Separe uniformidade marginal, independência e calibração condicional
Uma distribuição marginal uniforme da PIT é necessária para previsões contínuas ideais, mas não suficiente. Erros opostos em regimes diferentes podem se cancelar quando os dados são agrupados e deixar o histograma aparentemente plano. Gneiting, Balabdaoui e Raftery mostram que uma PIT quase uniforme pode coexistir com previsões individuais enviesadas (2007).
A ordem também importa: uma série pode ter histograma uniforme e dependência serial, como agrupamentos ou sequências longas de valores similares. Previsões condicionais ideais implicam mais do que uniformidade agregada. Com horizontes sobrepostos, a distribuição de referência deve refletir a sobreposição; um teste iid pode ser inadequado.
Examine a distribuição PIT e sua relação com tempo, defasagens, variáveis da origem e regimes definidos antes da análise. Gráficos agrupados ou testes condicionais revelam padrões, mas a escolha dos grupos e o tamanho amostral impõem limites. Nenhum conjunto finito de testes prova calibração para todas as variáveis condicionais possíveis.
Leia o histograma PIT como pista, não como veredito
Uma forma em U costuma ser compatível com previsões concentradas demais ou subdispersas; uma elevação central, com previsões difusas demais ou superdispersas. Assimetria pode indicar viés de localização. São heurísticas, não diagnósticos únicos: dependência, mistura de regimes, resultados discretos, bins e amostras pequenas podem enganar.
O histograma apaga a ordem temporal. Não mostra quando o problema começou, se valores extremos se agrupam ou se um subgrupo está mal calibrado. Bins largos podem parecer planos com poucos dados; bins estreitos podem parecer irregulares por ruído. Informe número de previsões, limites dos bins e incerteza quando possível. Os métodos Diebold–Gunther–Tay e Berkowitz ilustram testes cujas hipóteses precisam combinar com o desenho. Berkowitz transforma uma PIT interior em (Z_t=\Phi^{-1}(U_t)) e testa o nulo conjunto de valores normais padrão independentes contra uma alternativa dinâmica especificada, como AR(1). Não é certificado universal (2001).
<!-- learn:illustration -->

Considere a estimação e avalie fora da amostra
O resultado de uniformidade pressupõe que a CDF é a verdadeira lei condicional. Na prática, estimamos parâmetros, escolhemos famílias de distribuição e podemos ajustar limites ou variáveis. Assim, a previsão (F_{t+1}(\cdot;\hat\theta_t)) faz parte do procedimento. Ajustar o modelo com resultados do período de avaliação e depois chamar as PIT de evidência out-of-sample intocada causa vazamento de informação.
Em avaliação móvel, use apenas informação disponível em cada origem. Registre janela de estimação, frequência de reestimação, versão dos dados e do modelo, e etapas de seleção. Janelas adjacentes costumam compartilhar observações; resultados sobrepostos acrescentam dependência.
Tamanho e poder do teste dependem do estimador, amostra e procedimento. O histograma PIT não incorpora incerteza paramétrica; referências iid de livro-texto não servem para todo desenho estimado ou sobreposto. Para inferência importante, use teste compatível ou simule/bootstrap o nulo repetindo todo o pipeline de estimação e previsão. Se necessário, mantenha uma amostra final fora da seleção de modelo.
Diferencie calibração de sharpness
Calibração trata da relação entre previsões e resultados: eventos aos quais se atribuiu certa probabilidade ocorrem nessa frequência? Sharpness descreve a concentração das distribuições previstas sem olhar os resultados. Gneiting, Balabdaoui e Raftery consideram sharpness desejável condicionada à calibração, não um substituto.
Uma previsão ampla pode ser calibrada, mas pouco informativa. Uma estreita pode parecer precisa e ainda estar mal calibrada se resultados escapam frequentemente de sua massa de probabilidade. PIT avalia consistência distributiva; resumos de sharpness descrevem dispersão e largura. Relatar só um deixa parte da avaliação de fora.
Uma PIT agregada plana pode esconder erros por regime de volatilidade ou horizonte. Defina as condições relevantes antes. Isso é relacionado, mas distinto, de uma regressão de previsão pontual e do teste de capacidade preditiva condicional Giacomini–White, que compara perdas condicionais a informações escolhidas.
Compare previsões completas com escores próprios nos mesmos resultados
A PIT é principalmente diagnóstica, não um ranking isolado de previsões de densidade. O log score e o continuous ranked probability score (CRPS) atribuem uma perda escalar a cada par previsão-resultado; por definição, a perda esperada é mínima para a verdadeira distribuição preditiva. Uma média realizada em uma amostra não prova que o modelo está correto. O guia Model Confidence Set trata da comparação por conjuntos. Use um escore definido para a distribuição inteira sobre resultados comuns.
Informe alvo, horizonte, datas comuns, convenção de perda e benchmark. O log score é especialmente sensível a densidade muito baixa no valor observado; o CRPS compara CDFs com sensibilidade diferente. A incerteza nas diferenças deve respeitar dependência serial, estimação e busca de modelos. Use gráficos PIT junto com escores, pois eles cumprem papéis distintos.
Calibração ou escore melhor não provam rentabilidade. Uma alegação de trading exige regra de decisão, momento da informação, tamanho da posição, custos de transação e financiamento e avaliação out-of-sample dos retornos. Estatística de avaliação de previsão não é retorno de backtest.
Siga um fluxo PIT reproduzível
Defina alvo, horizonte, horário da origem, versão do resultado e se a distribuição é contínua, discreta ou mista. Guarde cada CDF ou dados para reconstruí-la, junto do resultado e conjunto de informação. Calcule (F_t(Y_t)) para distribuições contínuas; diante de saltos, documente PIT randomizada ou diagnóstico discreto adequado.
Examine distribuição marginal e ordem temporal. Informe bins, tamanho da amostra, tratamento de empates e seed ou procedimento de randomização repetida. Inclua testes de independência ou condicionais para perguntas definidas previamente e inferência adequada a esquemas móveis, sobrepostos ou estimados. Compare modelos separadamente com escores próprios nos mesmos resultados reservados. A conclusão vale para previsões e condições definidas, não garante calibração futura nem lucro.
Perguntas frequentes
Q1PIT uniforme prova que a previsão de densidade está correta?
Não. É uma condição diagnóstica necessária para uma previsão contínua correta, mas uniformidade agregada não prova independência nem calibração condicional. Verifique dependência temporal e variáveis condicionais relevantes.
Q2Devo randomizar PIT para uma previsão discreta?
Use-a se quiser a referência contínua-uniforme sob uma distribuição discreta correta. O sorteio adicional espalha o resultado dentro do salto da CDF. Registre método e seed; considere diagnóstico discreto se quiser evitar randomização.
Q3O que significa um histograma PIT em U?
Costuma ser compatível com previsões concentradas demais; uma elevação central, com previsões difusas demais. São pistas, não diagnósticos únicos: verifique dependência, regimes, amostra e bins.
Q4Um histograma PIT melhor equivale a um escore melhor?
Não. PIT diagnostica comportamento distributivo; escores próprios comparam previsões sob perda e alvo definidos. Relate ambos nos mesmos resultados fora da amostra e não os interprete como lucro de trading. Pesquisa primária - Rosenblatt, “Remarks on a Multivariate Transformation” (1952) - Diebold, Gunther, and Tay, “Evaluating Density Forecasts with Applications to Financial Risk Management” (1998) - Berkowitz, “Testing Density Forecasts, with Applications to Risk Management” (2001) - Gneiting, Balabdaoui, and Raftery, “Probabilistic Forecasts, Calibration and Sharpness” (2007) - Brockwell, “Universal Residuals: A Multivariate Transformation” (2007) - Czado, Gneiting, and Held, “Predictive Model Assessment for Count Data” (2009)
Fontes e leituras adicionais
Relatar um problema
Vamos preparar um e-mail com o link deste artigo. Mark só receberá o relato depois que você enviar
Verificação rápida
Terminou o guia? Confira o que aprendeu com 3 perguntas
Pergunta 01
O que o teorema PIT implica para uma previsão condicional contínua correta?
Escolha uma resposta para ver a explicação