Test de Pesaran–Timmermann: ¿Aporta información un pronóstico direccional?
Descubre cómo el test de Pesaran–Timmermann compara los aciertos direccionales con una referencia basada en las proporciones de subidas reales y pronosticadas, y por qué la dependencia serial cambia la inferencia.
En esta guíaUna tasa de aciertos del 64 % puede ser poco o mucho según la referencia
Resumen breve
El test de Pesaran–Timmermann (PT) pregunta si los pronósticos contienen información sobre la dirección en que se moverá un resultado. Para un pronóstico binario de subida o bajada, compara la tasa de aciertos observada con la tasa de coincidencia que implican, por separado, las proporciones de resultados realmente alcistas y de pronósticos alcistas. Esa referencia no tiene por qué ser del 50 %. El test habitual también depende de supuestos sobre la dependencia entre orígenes de pronóstico, y la significación estadística no demuestra que una regla de trading sea rentable.
Una tasa de aciertos del 64 % puede ser poco o mucho según la referencia
Supongamos que el mercado sube el 60 % de los días de una muestra de evaluación. El pronosticador indica «subida» en el 70 % de esos días. Aunque los pronósticos y los resultados no guardaran relación, ambas series coincidirían con bastante frecuencia: algunos días ambas indicarían una subida y otros, una bajada. Comparar mecánicamente la tasa de aciertos con el 50 % ignoraría ese desequilibrio.
El marco PT hace explícita esa comparación. Pregunta si la dirección pronosticada y la observada coinciden más de lo que cabría esperar por sus frecuencias separadas bajo independencia. Es un test de información predictiva direccional, no una puntuación del tamaño de los rendimientos, del momento de una operación ni del valor de una estrategia completa. Pesaran y Timmermann introdujeron un test del desempeño predictivo mediante tablas de contingencia; en el caso binario 2×2, su test es asintóticamente equivalente a contrastar independencia {source:pesaranTimmermannDirectionalTests1992}.
Coloca cada pronóstico emparejado en una tabla 2×2
Sea \(Y_t=1\) cuando el resultado observado se clasifica como subida y \(Y_t=0\) cuando se clasifica como bajada. Sea \(Z_t=1\) cuando el pronóstico indica subida y \(Z_t=0\) cuando indica bajada. Cada fila de la evaluación debe emparejar un pronóstico emitido en el origen \(t\) con el resultado del horizonte que ese pronóstico pretendía anticipar.
Las cuatro celdas cuentan pares subida/subida, subida/bajada, bajada/subida y bajada/bajada. Si \(n_{11}\) y \(n_{00}\) son las dos celdas de coincidencia y \(n\) es el número de pares emparejados utilizables, la tasa observada de acierto direccional es
\[ \widehat{P}=\frac{n_{11}+n_{00}}{n}. \]
Esta clasificación es binaria. Decide de antemano cómo tratar un rendimiento cero, un pronóstico cero o una banda neutral. Por ejemplo, un estudio puede clasificar un rendimiento igual o inferior a cero como «no subida» y aplicar la misma regla a un pronóstico igual o inferior a su umbral. Excluir los empates es otra posibilidad, pero modifica la muestra y debe hacerse de forma coherente. No cuentes cero-cero como un tercer tipo de coincidencia si utilizas una fórmula de referencia con dos categorías.
El origen del pronóstico y el horizonte objetivo también deben coincidir. Si \(Z_t\) pronostica el signo del rendimiento acumulado de las próximas cinco sesiones, \(Y_t\) debe clasificar ese mismo rendimiento desde el mismo origen, no el rendimiento de una sola sesión del día siguiente. De lo contrario, la tabla mezclaría sucesos distintos. Los pronósticos diarios de objetivos solapados a cinco sesiones pueden aparecer en una tabla descriptiva, pero generan el problema de dependencia explicado más adelante.
Calcula la referencia de independencia a partir de ambas proporciones alcistas
Sea \(\hat p_y\) la proporción muestral de resultados observados clasificados como subida y \(\hat p_z\) la proporción muestral de pronósticos que indican subida. Si las etiquetas reales y pronosticadas fueran independientes, la proporción esperada de coincidencias sería
\[ \widehat{P}^{*}=\hat p_y\hat p_z+(1-\hat p_y)(1-\hat p_z). \]
El primer producto es la probabilidad de una coincidencia subida/subida bajo independencia; el segundo es la de una coincidencia bajada/bajada. Por tanto, la referencia cambia con ambas proporciones marginales. Puede quedar por encima o por debajo del 50 %. Un pronóstico que siempre elige la dirección más frecuente puede lograr una tasa de aciertos aparentemente respetable sin aportar información.
Un caso extremo lo aclara: si un clasificador pronostica «subida» en todas las fechas, \(\hat p_z=1\), y tanto la tasa observada de aciertos como la referencia de independencia son la proporción real alcista \(\hat p_y\). El exceso es cero por construcción. Puede parecer preciso cuando las subidas abundan, pero no distingue fechas; la varianza puede degenerar y dejar sin definir el valor p PT convencional.
Considera 100 fechas emparejadas hipotéticas. Los resultados reales suben en 60 fechas y los pronósticos indican subida en 70. Supongamos que la tabla contiene 47 pares subida/subida, 13 de subida real y bajada pronosticada, 23 de bajada real y subida pronosticada y 17 pares bajada/bajada. Hay 64 coincidencias, así que \(\widehat P=0.64\). La referencia de independencia es \(0.60\times0.70+0.40\times0.30=0.54\). La tasa observada supera esa referencia en diez puntos porcentuales. Estas cifras inventadas ilustran el cálculo; la diferencia por sí sola no proporciona una estimación válida de la incertidumbre ni demuestra que haya valor para operar.
| Dirección observada | Pronóstico al alza | Pronóstico a la baja | Total |
|---|---|---|---|
| Al alza | 47 | 13 | 60 |
| A la baja | 23 | 17 | 40 |
| Total | 70 | 30 | 100 |
Escala la diferencia de aciertos con su incertidumbre estimada
Para el estadístico PT binario estándar, define
\[ \widehat v=\frac{\widehat P^{*}(1-\widehat P^{*})}{n} \]
y
\[ \widehat w=\frac{(2\hat p_y-1)^2\hat p_z(1-\hat p_z)+(2\hat p_z-1)^2\hat p_y(1-\hat p_y)}{n}. \]
Entonces
\[ PT=\frac{\widehat P-\widehat P^{*}}{\sqrt{\widehat v-\widehat w}}. \]
Bajo la hipótesis nula y los supuestos habituales de muestras grandes, el estadístico tiene como referencia asintótica la distribución normal estándar. El numerador mide las coincidencias por encima de la referencia de independencia. El denominador tiene en cuenta que esa referencia se estima con la misma muestra, en lugar de tratarla como un objetivo fijo del 50 %. La documentación de statsmodels recoge la fórmula y la notación {source:statsmodelsPesaranTimmermannAPI}.
La expresión anterior es la forma de varianza asintótica de primer orden documentada por statsmodels. La expresión delta más completa para muestras finitas del tratamiento original suma a \(\widehat w\) el término \(4\hat p_y\hat p_z(1-\hat p_y)(1-\hat p_z)/n^2\). Ese término de orden inferior no modifica la asintótica de primer orden, aunque puede desplazar el estadístico en muestras finitas. Si los resultados dependen de la implementación, indica qué fórmula y versión del software utilizaste; no compares valores p suponiendo que todos los paquetes aplican el mismo cálculo en muestras finitas.
La fórmula no corrige un diseño débil. Una muestra muy pequeña, pronósticos casi constantes, celdas vacías o una varianza estimada nula o no válida pueden hacer que la aproximación habitual no sea fiable o ni siquiera esté definida. En esos casos, no fuerces un valor p a partir de la expresión: informa de las proporciones marginales y de la tabla, y elige un procedimiento de inferencia adecuado para los datos y el tamaño muestral.
Para la tabla hipotética, \(\widehat v=0.54(0.46)/100=0.002484\) y \(\widehat w=[0.2^2(0.7)(0.3)+0.4^2(0.6)(0.4)]/100=0.000468\). El error estándar es \(\sqrt{0.002484-0.000468}\approx0.0449\), así que \(PT\approx0.10/0.0449=2.23\); la referencia normal estándar bilateral da \(p\approx0.026\). Es un cálculo con recuentos inventados y la fórmula asintótica de primer orden. El término de muestra finita modifica algo el valor, y la dependencia serial puede invalidar la referencia normal. No es un resultado empírico.

Interpreta el rechazo como evidencia direccional, no como veredicto de trading
Un numerador positivo significa que las direcciones observadas coinciden más de lo que implica la referencia de independencia; uno negativo, que coinciden menos. Un contraste unilateral especificado de antemano puede preguntar si la coincidencia supera la referencia. Uno bilateral pregunta si la asociación direccional difiere en cualquiera de los dos sentidos. La alternativa y el nivel de significación deben elegirse antes de examinar los resultados.
Un valor p pequeño es evidencia contra la hipótesis nula planteada, bajo los supuestos del test. No es la probabilidad de que la hipótesis nula sea cierta ni de que el pronóstico funcione en el próximo periodo. Tampoco indica que los rendimientos fueran suficientes para cubrir el diferencial entre compra y venta, las comisiones, el impacto de mercado, la financiación o el coste de préstamo. Ni corrige por probar muchos activos, horizontes, umbrales, variantes de modelo o signos de pronóstico y publicar solo el ganador. Si se exploraron estrategias candidatas, la guía de White Reality Check explica por qué la inferencia debe tener en cuenta esa selección.
No rechazar la hipótesis nula no demuestra independencia; una muestra corta o desequilibrada puede tener poca potencia. Un numerador PT negativo puede reflejar desacuerdo sistemático, no ausencia de estructura. Cambiar el signo del pronóstico tras ver el resultado es una nueva elección de modelo: evalúala con datos nuevos o inclúyela en la búsqueda original.
Informa conjuntamente de las proporciones real y pronosticada de subidas, la tasa observada, la referencia de independencia, la diferencia en puntos porcentuales, la hipótesis alternativa y el método de incertidumbre. Un valor p aislado no muestra el tamaño ni la precisión del efecto.
La dependencia serial puede distorsionar la distribución de referencia habitual
El estadístico PT ordinario suele presentarse bajo el supuesto de que las observaciones direccionales son independientes a lo largo del tiempo. Sin embargo, las etiquetas financieras pueden aparecer en rachas. Los objetivos de varios días de observaciones diarias pueden solaparse, los regímenes de volatilidad pueden persistir y los pronósticos móviles pueden reutilizar casi los mismos datos de estimación. En ese caso, los \(n\) pares no equivalen a \(n\) piezas independientes de información. El error estándar habitual puede ser demasiado pequeño y provocar rechazos con mayor frecuencia de la debida.
Más adelante, Pesaran y Timmermann desarrollaron contrastes de dependencia entre variables con varias categorías y correlación serial, usando regresiones aumentadas dinámicamente y un marco de Markov de orden finito {source:pesaranTimmermannSerialCategories2009}. La investigación centrada en pronósticos direccionales también encuentra que los procedimientos PT convencionales basados en independencia pueden sobrerrechazar cuando existe correlación serial, y estudia alternativas robustas a la dependencia, incluidos métodos bootstrap {source:blaskowitzHerwartzDirectionalSerialCorrelation2014}. El método adecuado depende de cómo se generen los pronósticos, del horizonte y de la estructura de dependencia; un procedimiento genérico de remuestreo no es automáticamente válido.
Indica si los orígenes de pronóstico se solapan, qué separación temporal tienen y qué método de dependencia proporciona la estimación de incertidumbre. Si presentas el estadístico de manual como referencia descriptiva, señala su supuesto de independencia. No interpretes un resultado nominal del 5 % como si su tasa real de falsos rechazos también fuera del 5 % cuando el diseño incumple ese supuesto.
Construye la evaluación con pronósticos que realmente podrían haberse emitido
Conserva para cada origen el pronóstico exactamente como estaba disponible entonces, su horizonte, el corte de información, el resultado observado y la regla que convierte cada uno en una etiqueta de subida o bajada. Alinea las marcas de tiempo, los instrumentos, la definición del precio o del rendimiento y el tratamiento de datos ausentes antes de formar la tabla. Un pronóstico basado en datos macroeconómicos revisados o en una señal ajustada durante el periodo de evaluación no es un pronóstico intacto fuera de muestra.
Elige el umbral de clasificación antes de ver los resultados reservados para evaluación. Si el modelo produce una probabilidad, el umbral la convierte en una dirección binaria; buscarlo en la misma muestra cambia la pregunta y genera sesgo de selección. Mantén separados los conjuntos de entrenamiento, validación y evaluación final. Si el remuestreo pretende tener en cuenta la búsqueda de modelos, repite dentro de cada remuestra todo el proceso de selección.
La pregunta del PT no es la misma que la comparación de magnitudes de errores de pronóstico. La guía de Diebold–Mariano compara diferencias de pérdidas emparejadas, mientras que la guía de Giacomini–White pregunta si la capacidad predictiva relativa cambia con información especificada de antemano. Para modelos de pronóstico anidados, consulta la guía del ajuste de Clark–West. Estos contrastes responden preguntas distintas y no deben sustituirse solo porque produzcan estadísticos conocidos.
La significación direccional no demuestra que la estrategia sea rentable
El test PT reduce cada resultado a una etiqueta de dirección. Una subida de un tick y una gran revalorización cuentan como la misma subida; un fallo pequeño y una pérdida grave cuentan por igual como errores direccionales. Por tanto, un pronóstico puede aumentar su tasa de aciertos y aun así perder dinero si sus fallos son mayores que sus aciertos, la señal llega después del movimiento del precio o los costes de negociación consumen la ventaja.
Imagina 100 operaciones hipotéticas del mismo tamaño: 64 aciertos direccionales con una ganancia media del 0.10 % cada uno y 36 fallos con una pérdida media del 0.25 % cada uno. La suma bruta simple antes de costes es \(64(0.10\%)-36(0.25\%)=-2.6\) puntos porcentuales, pese a una tasa de aciertos del 64 %. El cálculo ignora la capitalización y no es evidencia de mercado; la tasa de aciertos sola no determina la esperanza de rendimiento.
Para evaluar una operación, especifica el momento de entrada y salida, el tamaño de la posición, los límites de riesgo y cómo tratar las órdenes no ejecutadas antes de calcular los rendimientos. Incluye, cuando corresponda, el diferencial comprador-vendedor, las comisiones, el deslizamiento, el impacto de mercado, la financiación y los costes específicos de la plataforma. Compara los rendimientos netos fuera de muestra con una referencia adecuada y ten en cuenta la misma búsqueda de múltiples pruebas que produjo la regla. El resultado PT puede ser una pieza de evidencia sobre asociación direccional; no sustituye una evaluación ejecutable que considere los costes.
Preguntas frecuentes
Q1¿El test de Pesaran–Timmermann compara la precisión con el 50 %?
No. Compara la coincidencia observada con la referencia de independencia calculada por separado a partir de las proporciones de resultados reales y pronósticos alcistas. La referencia puede quedar por encima o por debajo del 50 %.
Q2¿Puedo usar el valor p habitual del PT si los horizontes de pronóstico se solapan?
No sin abordar la dependencia. Los objetivos solapados y las etiquetas persistentes pueden hacer demasiado pequeña la estimación de incertidumbre habitual basada en independencia. Usa un método cuyos supuestos se ajusten al horizonte y a la estructura de dependencia.
Q3¿Un resultado PT significativo significa que la estrategia de trading es rentable?
No. El test utiliza etiquetas direccionales y no mide el tamaño del movimiento, los precios de entrada y salida, el tamaño de la posición, las comisiones, el deslizamiento ni la financiación. Evalúa por separado los rendimientos netos fuera de muestra.
Fuentes
Informar de un problema
Prepararemos un correo con el enlace de este artículo. Mark recibirá el aviso cuando lo envíes
Comprobación rápida
¿Ya leíste la guía? Compruébalo con 3 preguntas
Pregunta 01
Si los resultados reales son alcistas el 60 % del tiempo y los pronósticos indican subida el 70 %, ¿cuál es la referencia de coincidencia bajo independencia?
Elige una respuesta para ver la explicación
Glosario de opciones
Definiciones claras de términos esenciales, desde calls, puts y cadenas de opciones hasta IV, griegas, interés abierto y max pain
Ver el glosario de opciones