Transformación integral de probabilidad y calibración de pronósticos
Aprende a evaluar pronósticos de densidad continuos y discretos con el PIT, interpretar sus histogramas y reconocer los límites de la uniformidad
En esta guíaPor qué un error puntual no basta para evaluar una densidad
Resumen breve
Un pronóstico de densidad describe los resultados posibles y la probabilidad que asigna a cada intervalo. La transformación integral de probabilidad (PIT) convierte el resultado observado en su probabilidad acumulada pronosticada. Bajo ciertos supuestos, los valores PIT uniformes son un diagnóstico útil de calibración; un histograma uniforme por sí solo no demuestra que los pronósticos sean correctos condicionalmente ni independientes a lo largo del tiempo.
Por qué un error puntual no basta para evaluar una densidad
Un pronóstico puntual puede indicar que la rentabilidad de mañana será del 0,2 %. Un pronóstico de densidad asigna probabilidades a todo el rango de rentabilidades posibles, incluidos los movimientos habituales y los sucesos extremos poco frecuentes. Por eso, la evaluación pregunta si la distribución publicada antes de conocer el resultado concuerda con lo que ocurrió después. La guía de Mincer–Zarnowitz trata una regresión lineal de calibración para pronósticos puntuales numéricos; evaluar una distribución completa plantea otra pregunta.
El PIT mide cuánta probabilidad asignó el pronóstico a valores iguales o inferiores al resultado observado. Es un rango de probabilidad, no una rentabilidad, una señal de negociación ni una medida de ganancias. En finanzas, un modelo de densidad de rentabilidades puede alimentar estimaciones de riesgo o decisiones, pero el PIT evalúa sus distribuciones pronosticadas. La guía de Diebold–Mariano compara pérdidas medias de pronóstico con una puntuación elegida; eso no equivale a comprobar la calibración de una densidad.
Transformar un pronóstico continuo con su función de distribución acumulada
Sea \(Y_{t+1}\) el resultado posterior al origen de pronóstico \(t\), y sea \(F_{t+1}(y\mid\mathcal I_t)\) la función de distribución acumulada (CDF) del pronóstico, basada únicamente en la información disponible en ese origen. Para una distribución continua, se calcula
Uₜ₊₁ = Fₜ₊₁(Yₜ₊₁ | 𝓘ₜ)
La CDF es la probabilidad de obtener un valor menor o igual que \(y\). Si coincide con la verdadera distribución condicional del resultado, el teorema de la transformación integral de probabilidad implica
Pr(Uₜ₊₁ ≤ u | 𝓘ₜ) = u, for 0 ≤ u ≤ 1
Así, el PIT de cada pronóstico continuo ideal a un paso es uniforme condicionalmente. En una secuencia donde el conjunto de información incluye el pasado, los PIT ideales también son independientes bajo los supuestos pertinentes. La transformación se relaciona con el trabajo de Rosenblatt; Diebold, Gunther y Tay desarrollaron un marco operativo para evaluar densidades mediante secuencias PIT (Rosenblatt, 1952; Diebold, Gunther, and Tay, 1998).
Como comprobación manual, supón un pronóstico \(N(0,1)\) y un valor observado \(y=1\). El PIT es \(\Phi(1)\approx0.8413\): el pronóstico asignaba alrededor del 84,13 % de probabilidad a valores iguales o inferiores a 1. Este caso ilustra el cálculo, pero una observación no permite decidir si el modelo está calibrado.
Usar PIT aleatorizado cuando el resultado es discreto
La CDF de una distribución discreta salta en los resultados posibles. Por eso, \(F(Y)\) ordinario solo puede tomar unos pocos valores y, en general, no es uniforme aunque el pronóstico sea correcto. El PIT aleatorizado rellena cada intervalo de salto:
Uₜ₊₁ = Fₜ₊₁(Yₜ₊₁⁻ | 𝓘ₜ) + Vₜ₊₁ [Fₜ₊₁(Yₜ₊₁ | 𝓘ₜ) − Fₜ₊₁(Yₜ₊₁⁻ | 𝓘ₜ)]
Aquí \(F(y^-)\) es el límite por la izquierda, es decir, la probabilidad de un valor inferior a \(y\); \(V\) es una extracción independiente de \(U(0,1)\) que solo se usa para evaluar. En una distribución continua el salto es cero y la fórmula se reduce a \(F(Y)\). Brockwell demuestra la transformación aleatorizada para distribuciones arbitrarias, incluidas las discretas y mixtas (2007). Para resultados de conteo ordenados, Czado, Gneiting y Held también analizan una versión no aleatorizada y gráficos de calibración marginal; los diagnósticos discretos deben interpretarse según el soporte discreto, no con una referencia continua (2009).
Supón un pronóstico hipotético de Bernoulli con \(P(Y=1)=0.20\) y \(P(Y=0)=0.80\). El PIT ordinario vale 0,80 cuando \(Y=0\), con probabilidad 0,80, y 1,00 cuando \(Y=1\), con probabilidad 0,20. Esos dos valores no son uniformes. Con aleatorización, \(Y=0\) se transforma en \(0{,}80V\) y llena \([0,0{,}80]\); \(Y=1\) se transforma en \(0{,}80+0{,}20V\) y llena \([0{,}80,1]\). Los intervalos tienen probabilidades 0,80 y 0,20, por lo que la densidad total es uno en todo \([0,1]\). La extracción auxiliar es parte de la evaluación, no del pronóstico original.
Distinguir uniformidad marginal, independencia y calibración condicional
La uniformidad marginal de los PIT es necesaria para pronósticos de densidad continuos ideales, pero no suficiente. Al agrupar, algunos errores pueden compensarse: los pronósticos pueden ser demasiado altos en un régimen de mercado y demasiado bajos en otro, mientras que el histograma general parece plano. Gneiting, Balabdaoui y Raftery describen casos en que un histograma PIT casi uniforme coexiste con pronósticos individuales sesgados (2007).
El orden temporal también importa. Un histograma uniforme puede ocultar dependencia, como rachas de valores PIT altos o grupos de valores parecidos. Pronósticos condicionales correctos a un paso implican más que uniformidad agregada cuando la información incluye el pasado. Sin embargo, los horizontes de varios pasos pueden solaparse y producir dependencia incluso con una evaluación correcta; la referencia estadística debe reflejar ese diseño, no asumir independencia automáticamente.
Además de la distribución PIT, examina su relación con el tiempo, los PIT rezagados, las variables conocidas en el origen y los regímenes definidos de antemano. Los gráficos o pruebas condicionales pueden revelar patrones ocultos al agrupar, aunque dependen de elecciones y tienen límites con muestras pequeñas. Ningún conjunto finito de comprobaciones demuestra calibración para todas las variables condicionantes posibles.
Leer el histograma PIT como indicio, no como veredicto
El histograma resume la forma marginal de los PIT en intervalos. Una forma de U suele ser compatible con pronósticos demasiado concentrados o poco dispersos; un pico central suele corresponder a pronósticos demasiado difusos. Un desequilibrio entre izquierda y derecha puede apuntar a sesgo de localización. Son heurísticas, no diagnósticos únicos: la dependencia, la mezcla de regímenes, los resultados discretos, los intervalos elegidos o una muestra pequeña pueden crear formas engañosas.
El histograma descarta el orden de las observaciones. No muestra cuándo comenzó un problema de calibración, si se agrupan PIT altos ni si un subgrupo está mal calibrado. Los intervalos anchos y pocos datos pueden producir una apariencia plana; los intervalos estrechos pueden resaltar ruido muestral. Informa el número de pronósticos, los límites de los intervalos y la incertidumbre cuando sea posible, y examina dependencia temporal y grupos condicionales elegidos antes de ver los resultados. Entre las pruebas formales están el marco de Diebold–Gunther–Tay y la prueba de razón de verosimilitudes de Berkowitz con PIT transformado: transforma valores PIT interiores en \(Z_t=\Phi^{-1}(U_t)\) y contrasta la hipótesis conjunta de valores normales estándar independientes frente a una alternativa dinámica especificada, como AR(1). La conclusión depende de los supuestos; ningún gráfico ni prueba es un certificado universal (Berkowitz, 2001).
<!-- learn:illustration -->

Incorporar la estimación de parámetros y evaluar fuera de muestra
El resultado de uniformidad presupone que la CDF pronosticada es la verdadera ley condicional. En la práctica, los modelos estiman parámetros, eligen una familia de distribución y pueden ajustar variables o umbrales. Por eso, \(F_{t+1}(\cdot;\hat\theta_t)\) forma parte de un procedimiento de pronóstico, no es una CDF verdadera conocida. Si se usan los resultados del período de evaluación para estimar parámetros y luego se presentan esos PIT como evidencia intacta fuera de muestra, la información se filtra a la comprobación.
En una evaluación móvil, genera cada pronóstico solo con información disponible en su origen. Registra la ventana de estimación, frecuencia de reestimación, versión de datos y modelo, y pasos de selección. Estas decisiones definen el procedimiento evaluado. Las ventanas móviles adyacentes comparten observaciones y pueden inducir dependencia; los horizontes solapados añaden otra fuente. Las simulaciones o bootstrap de la prueba deberían repetir el proceso real de estimación, selección y pronóstico.
El efecto en el tamaño y la potencia de una prueba depende del estimador, la muestra y el método. Un histograma PIT no incorpora incertidumbre de parámetros, y los valores de referencia iid no son adecuados automáticamente para cualquier diseño estimado o solapado. Si importa la inferencia, usa una prueba con supuestos compatibles o simula/bootstrap la cadena completa. Mantén una muestra final de evaluación fuera de la selección del modelo cuando la pregunta requiera evidencia genuina out-of-sample.
Diferenciar calibración y agudeza del pronóstico
La calibración se refiere al comportamiento conjunto de pronósticos y resultados: si los eventos a los que se asigna una probabilidad ocurren con la frecuencia correspondiente y si las distribuciones coinciden con las observaciones. La agudeza o concentración (sharpness) describe las distribuciones por sí solas, sin consultar los resultados. Gneiting, Balabdaoui y Raftery sostienen que conviene aumentar la concentración sujeta a calibración, no usarla en su lugar.
Un pronóstico amplio puede estar calibrado, pero ser poco informativo. Uno estrecho puede parecer preciso y estar mal calibrado si los resultados quedan fuera de su masa con demasiada frecuencia. El PIT diagnostica coherencia distributiva; los resúmenes de agudeza describen dispersión, anchura de intervalos o concentración. Uno puede mejorar mientras el otro empeora.
El PIT agregado puede parecer uniforme mientras hay errores condicionados por el régimen de volatilidad o el horizonte. Si esas condiciones importan, defínelas de antemano. Esto se relaciona, pero no es lo mismo, que la prueba de capacidad predictiva condicional de Giacomini–White, que compara pérdidas de pronóstico según la información elegida.
Comparar pronósticos completos con puntuaciones propias sobre resultados comunes
El PIT es principalmente diagnóstico y no crea una clasificación única de pronósticos de densidad. Reglas de puntuación propias, como la puntuación logarítmica y el Continuous Ranked Probability Score (CRPS), asignan una pérdida escalar a cada pronóstico y resultado. Según sus definiciones, la pérdida esperada se minimiza al declarar la distribución predictiva verdadera. Se pueden comparar modelos con los mismos resultados fuera de muestra, pero un promedio observado no demuestra que un modelo sea correcto. La guía Model Confidence Set compara métodos de pronóstico como conjunto; para comparar densidades usa una puntuación propia definida para la distribución completa.
Indica objetivo, horizonte, fechas comunes, convención de pérdida y referencia. La puntuación logarítmica es especialmente sensible cuando el pronóstico asigna densidad muy baja a una observación; CRPS compara CDF y tiene otra sensibilidad. Informa la incertidumbre de las diferencias de puntuación teniendo en cuenta dependencia, estimación y búsqueda de modelos. Combina gráficos PIT con puntuaciones: el diagnóstico puede revelar un defecto distributivo y las puntuaciones resumen el rendimiento bajo una penalización especificada.
Ni la calibración ni una puntuación mejor demuestran rentabilidad de una estrategia. Para afirmarlo, define por separado la regla de decisión, el momento de la información, el tamaño de posición, los costes de ejecución y financiación, y una evaluación de rentabilidad fuera de muestra. Una estadística de evaluación de pronósticos no es un retorno de backtest.
Seguir un flujo PIT reproducible
Fija el objetivo, horizonte, instante de origen, versión de los resultados y si la distribución es continua, discreta o mixta. Guarda cada CDF pronosticada o información suficiente para reproducirla junto con el resultado y el conjunto de información. Calcula \(F_t(Y_t)\) para pronósticos continuos; ante saltos, usa PIT aleatorizado documentado o un diagnóstico discreto.
Después, examina distribución marginal y orden temporal. Indica intervalos, tamaño de muestra, tratamiento de empates y semilla o repeticiones de aleatorización para pronósticos discretos. Añade pruebas de independencia o condicionales que respondan a una pregunta definida de antemano y usa inferencia adecuada a los pronósticos móviles, solapados o estimados. Por último, compara modelos con puntuaciones propias sobre los mismos resultados reservados. La conclusión es evidencia sobre pronósticos y condiciones definidos, no prueba de calibración futura ni de rentabilidad.
Preguntas frecuentes
Q1¿Un PIT uniforme demuestra que el pronóstico de densidad es correcto?
No. Es una condición de diagnóstico necesaria bajo un pronóstico continuo correcto, pero la uniformidad agregada no demuestra independencia ni calibración condicional. Examina dependencia temporal y variables condicionantes relevantes.
Q2¿Debo usar PIT aleatorizado con un pronóstico discreto?
Puedes usarlo si quieres una referencia uniforme continua bajo una distribución discreta correcta. La extracción auxiliar reparte el resultado por el salto de la CDF. Documenta el método y la semilla, o usa un diagnóstico específico para datos discretos si prefieres evitar la aleatorización.
Q3¿Qué significa un histograma PIT en forma de U?
Suele corresponder a pronósticos demasiado concentrados; un pico central suele corresponder a distribuciones demasiado difusas. Son indicios, no diagnósticos únicos. Comprueba dependencia, regímenes, tamaño muestral e intervalos.
Q4¿Un histograma PIT mejor equivale a una mejor puntuación?
No. Los gráficos diagnostican la distribución; las reglas propias comparan pronósticos bajo una pérdida y un objetivo definidos. Cuando sea útil, informa ambos sobre resultados comunes fuera de muestra, sin interpretar ninguno como beneficio de trading. Investigación primaria - Rosenblatt, “Remarks on a Multivariate Transformation” (1952) - Diebold, Gunther, and Tay, “Evaluating Density Forecasts with Applications to Financial Risk Management” (1998) - Berkowitz, “Testing Density Forecasts, with Applications to Risk Management” (2001) - Gneiting, Balabdaoui, and Raftery, “Probabilistic Forecasts, Calibration and Sharpness” (2007) - Brockwell, “Universal Residuals: A Multivariate Transformation” (2007) - Czado, Gneiting, and Held, “Predictive Model Assessment for Count Data” (2009)
Fuentes
Informar de un problema
Prepararemos un correo con el enlace de este artículo. Mark recibirá el aviso cuando lo envíes
Comprobación rápida
¿Ya leíste la guía? Compruébalo con 3 preguntas
Pregunta 01
¿Qué implica el teorema PIT para una distribución condicional continua correcta a un paso?
Elige una respuesta para ver la explicación
Glosario de opciones
Definiciones claras de términos esenciales, desde calls, puts y cadenas de opciones hasta IV, griegas, interés abierto y max pain
Ver el glosario de opciones