White Reality Check y Hansen SPA para reglas de trading
Aprende cómo Reality Check y Hansen SPA comparan una familia completa de reglas técnicas con un benchmark, cómo construyen sus distribuciones bootstrap y qué significa su p-valor global.
En esta guíaPor qué la regla ganadora exige una prueba de familia
Resumen breve
Cuando eliges la regla que mejor rindió después de probar muchas en un backtest, un test convencional aplicado a esa única ganadora no responde la pregunta correcta. White Reality Check y Hansen SPA evalúan la familia completa frente a un benchmark. SPA estandariza las diferencias y utiliza un centrado de la hipótesis nula que depende de los datos para reducir la influencia de alternativas claramente malas. Ninguna de las dos pruebas identifica por sí sola una regla que vaya a ganar en el futuro.
Por qué la regla ganadora exige una prueba de familia
Si pruebas veinte configuraciones y luego publicas la de mayor rentabilidad, no has evaluado una sola regla. El resultado observado también refleja la búsqueda: incluso si ninguna variante tiene una ventaja real, alguna suele verse bien por azar en la muestra histórica. Un test t ordinario para la ganadora que actúe como si la hubieras definido antes de ver los datos ignora ese proceso de selección.
White desarrolló el Reality Check para formular esta pregunta de data snooping sobre una familia completa de candidatos. Sullivan, Timmermann y White aplicaron la metodología a un universo amplio de reglas técnicas y mostraron por qué hay que describir el conjunto del que se escogió el resultado. Años después, Hansen propuso el test de superioridad predictiva, conocido como SPA, que estandariza las diferencias y es menos sensible a reglas malas e irrelevantes. Las referencias primarias son White (2000), Sullivan, Timmermann y White (1999) y Hansen (2005).
Define primero el benchmark y la diferencia de rendimiento
Para cada regla $k$ y fecha común $t$, define $d_{k,t}$ como su ventaja frente al benchmark. Para rendimientos, una convención sencilla es $d_{k,t}=R_{k,t}-R_{0,t}$. Para pérdidas de pronóstico se invierte el orden, por ejemplo $d_{k,t}=L_{0,t}-L_{k,t}$, de modo que una diferencia positiva favorezca a la regla en ambos casos. La cantidad que se contrasta es la media poblacional $\mu_k=E[d_{k,t}]$.
Esta elección determina qué significa «mejor»: rendimiento bruto, rendimiento neto de costes, reducción de una pérdida u otra métrica definida de antemano. Todas las reglas necesitan el mismo benchmark, frecuencia, fechas evaluadas y convención de signos. Las fórmulas siguientes contrastan medias de diferenciales. Si la pregunta se refiere a una métrica no lineal, como el Sharpe, no basta con sustituirla sin más en las ecuaciones: hace falta un procedimiento inferencial adecuado a esa métrica.
La hipótesis nula incluye cada variante examinada
La hipótesis nula global es $H_0:\max_{k=1,\ldots,K}\mu_k\leq0$, equivalente a afirmar que ninguna regla de la familia supera al benchmark en media. La alternativa dice que al menos una sí lo supera. Es una prueba unilateral sobre el conjunto, no una prueba de que todas las reglas sean iguales.
El tamaño de la familia depende de lo que realmente se buscó, no solo de los candidatos que aparecen en la tabla final. Imagina, solo para ilustrar la cuenta, 12 ventanas retrospectivas, 4 filtros y 5 condiciones de salida: hay $12\times4\times5=240$ variantes. La multiplicación es un ejemplo hipotético, no un resultado ni una afirmación sobre rentabilidad. Si también se probaron activos, umbrales o tratamientos de costes distintos, esas decisiones forman parte del proceso que debe documentarse.
Reality Check usa la frontera nula de todos los promedios cero
Con $n$ observaciones comunes y media muestral $\bar d_k$, la estadística de Reality Check que empleamos es
$$T_{\mathrm{RC}}=\max_{k=1,\ldots,K}\sqrt{n}\,\bar d_k.$$
El máximo mide la mayor ventaja observada frente al benchmark. En esta definición la estadística no se recorta artificialmente a cero. Para aproximar la distribución bajo la hipótesis nula, se centra cada serie diferencial en su propia media muestral y se remuestrea con la frontera $\mu_k=0$ para todos los candidatos. Es la configuración menos favorable dentro de la nula global, pero puede reducir la potencia de la prueba.
El motivo es que una regla muy deficiente sigue formando parte del máximo en cada repetición y puede elevar los cuantiles críticos. La pregunta conservadora de White es si la mayor ventaja del backtest supera lo que podría observarse bajo la situación límite en la que todas las ventajas esperadas son cero. Un p-valor pequeño aporta evidencia contra la nula global de esa familia concreta; no evalúa candidatos que quedaron fuera de la búsqueda documentada.
SPA estandariza y centra la hipótesis nula según los datos
SPA divide cada media diferencial por una estimación de su dispersión de largo plazo, $\hat\omega_k$. La estadística es
$$T_{\mathrm{SPA}}=\max\left(0,\max_k\frac{\sqrt n\,\bar d_k}{\hat\omega_k}\right).$$
La estandarización hace comparables diferencias con volatilidades distintas. El máximo exterior con cero forma parte de esta estadística SPA; no se añade a la fórmula de Reality Check presentada antes. La estimación de largo plazo debe reflejar la dependencia temporal de cada serie diferencial y constituye una decisión que conviene describir.
La otra diferencia es el centrado. SPA calcula un valor de corrección $\hat\mu_{c,k}$ para cada regla. Si una media estandarizada es suficientemente negativa —por ejemplo, cae por debajo del umbral de Hansen $-\sqrt{2\log\log n}$—, ese promedio negativo se conserva en la distribución bootstrap bajo la nula. Las reglas compatibles con estar en la frontera nula se centran en cero. Así, los candidatos claramente malos pesan menos en los cuantiles críticos, pero las alternativas plausibles cerca de la frontera siguen presentes. El informe debe indicar la regla de centrado y la variante de p-valor SPA utilizada.

El bootstrap por bloques debe preservar dependencias conjuntas
En cada fecha se observa un vector $(d_{1,t},\ldots,d_{K,t})$ con las diferencias de todas las reglas. En una repetición bootstrap se deben remuestrear filas completas de ese vector en bloques consecutivos. Si se remuestrea cada regla por separado o se mezclan fechas individuales, se destruyen tanto la correlación entre candidatos como la dependencia temporal; el máximo resultante deja de representar el mismo experimento.
El bootstrap estacionario de Politis y Romano (1994) usa bloques con longitudes geométricas y una longitud media elegida. Otros procedimientos válidos emplean bloques consecutivos de tamaño fijo y solapados. Las réplicas se concatenan hasta alcanzar la longitud original. Ambas pruebas requieren que el proceso conjunto de diferenciales sea suficientemente estable y débilmente dependiente. La longitud de bloque y los posibles cambios de régimen afectan el resultado; remuestrear no corrige una ruptura estructural.
El p-valor global no nombra a una regla ganadora
Un Reality Check o SPA significativo indica evidencia, según sus supuestos, de que al menos una regla de la familia documentada tiene una ventaja media positiva frente al benchmark. El p-valor global no es la probabilidad de que la hipótesis nula sea cierta ni la probabilidad de que una regla concreta vaya a funcionar después. Tampoco identifica qué regla es individualmente superior. Para eso hace falta un análisis adicional que tenga en cuenta la selección y, de ser posible, nuevos datos.
Con 240 variantes hipotéticas, la regla de mayor resultado podría ser una entre 240; ese número, por sí solo, no permite inferir si se rechazará la hipótesis nula. El resultado depende de las diferencias de rendimiento observadas, del tamaño muestral, de la dependencia conjunta y del bootstrap escogido. Un p-valor, sea grande o pequeño, no corrige una fase de búsqueda que no se haya informado ni garantiza que la relación observada continúe.
FDR e intervalos de confianza responden otras preguntas
La guía de pruebas múltiples y tasa de falsos descubrimientos trata normalmente un conjunto de hipótesis individuales y, bajo supuestos declarados, controla la proporción falsa esperada entre las hipótesis rechazadas. Reality Check y SPA plantean una pregunta global sobre el máximo de una familia fijada: ¿hay evidencia de que algún candidato supera el benchmark? No producen automáticamente una lista corregida de reglas ganadoras.
Un intervalo de confianza por bootstrap de bloques para una estrategia especificada de antemano también contesta algo distinto. La guía sobre intervalos block bootstrap para rendimientos de estrategias cuantifica la incertidumbre de una media u otra estadística fijada. Si la estrategia se eligió tras buscar entre muchas variantes, ese intervalo no ajusta automáticamente el sesgo de selección. El método debe corresponder a la pregunta estadística.
La validación cruzada purgada aborda otro problema: reducir la fuga temporal de información entre las observaciones de entrenamiento y prueba en datos ordenados en el tiempo. No contrasta si el máximo de una familia de reglas supera el benchmark; esa es la pregunta global de RC y SPA. La guía sobre validación cruzada purgada y embargo explica esa separación.
Costes, historial de búsqueda y cambios de mercado siguen importando
Las diferencias usadas en la prueba deberían incluir los costes pertinentes para las reglas evaluadas: comisiones, spread, deslizamiento, impacto de mercado, financiación, préstamo de activos y coste de capital cuando proceda. Restar los costes después de probar puede convertir una ventaja estadística bruta en una estrategia sin valor económico. También afectan la ejecución tardía, la capacidad del mercado y el tamaño de las posiciones.
Un informe reproducible describe la familia completa, cada etapa de filtrado y selección, las fechas y fuentes de datos, el benchmark, la definición de $d_{k,t}$, los costes, el método de bloques, la regla para elegir su longitud, las réplicas y la variante de p-valor SPA. Volver a ajustar la estrategia tras mirar los resultados amplía la búsqueda y debe reconocerse. Si rupturas estructurales alteran mucho la distribución o la serie no es aproximadamente estacionaria y débilmente dependiente, estos bootstrap pueden inducir a error. Son pruebas estadísticas de un diseño histórico, no pronósticos, garantías ni asesoramiento financiero personalizado.
Preguntas frecuentes
Q1¿Un SPA significativo significa que la mejor regla es significativa por separado?
No. El test evalúa el máximo de toda la familia examinada. El p-valor global no certifica una regla como ganadora individual.
Q2¿SPA siempre tiene más potencia que Reality Check?
No. Puede ser menos sensible a muchas alternativas malas o irrelevantes y lograr más potencia en ciertas situaciones, pero no domina uniformemente en todos los diseños.
Q3¿Puedo usar estas pruebas para predecir el rendimiento futuro?
No. Evalúan una familia histórica definida bajo supuestos sobre la serie conjunta. Cambios de régimen, costes, nuevas decisiones de selección y condiciones futuras pueden alterar el rendimiento.
Fuentes
Informar de un problema
Prepararemos un correo con el enlace de este artículo. Mark recibirá el aviso cuando lo envíes
Comprobación rápida
¿Ya leíste la guía? Compruébalo con 3 preguntas
Pregunta 01
¿Qué afirma la hipótesis nula global de Reality Check y SPA?
Elige una respuesta para ver la explicación
Glosario de opciones
Probabilidad de rechazar falsamente al menos una hipótesis nula verdadera dentro de una familia de pruebas predefinida.
Leer la guía detalladaAsignaciónProceso por el que el vendedor debe cumplir la obligación del contrato tras recibir un aviso de ejercicio; puede crear o eliminar una posición en el subyacente
Leer la guía detallada