White’s Reality Check frente al data snooping en backtests de estrategias
Aprende cómo White’s Reality Check compara la mejor estrategia de una búsqueda con un benchmark e incorpora el máximo de un bootstrap que conserva la dependencia
En esta guíaLa prueba pregunta si el ganador de la búsqueda supera el benchmark elegido
Resumen breve
White’s Reality Check pregunta si el mejor candidato de una búsqueda definida supera un benchmark especificado, teniendo en cuenta que fue seleccionado por ser el máximo. Aplica bootstrap a las diferencias de rendimiento conjuntas y dependientes del tiempo, y compara el máximo observado con una distribución nula de máximos bootstrap. Un valor p ajustado pequeño aporta evidencia contra la hipótesis nula conjunta de que ningún candidato de esa familia supera al benchmark; no pronostica la rentabilidad en vivo.
La prueba pregunta si el ganador de la búsqueda supera el benchmark elegido
Un investigador puede probar decenas de ventanas de medias móviles, reglas de ruptura, periodos de tenencia, mercados y filtros, y luego publicar la estrategia con la mayor puntuación histórica. Ese ganador no es un candidato aislado corriente: la búsqueda le dio muchas oportunidades de parecer excepcional. Probarlo como si se hubiera elegido antes de observar los datos ignora la selección.
White’s Reality Check incorpora la selección a la prueba. Pregunta si algún candidato de la familia examinada tiene un rendimiento esperado superior a un benchmark definido. White formula la hipótesis nula como la intersección de comparaciones unilaterales: el rendimiento esperado de cada candidato relativo al benchmark es como máximo cero. La alternativa sostiene que al menos uno tiene una ventaja esperada positiva. El benchmark puede ser comprar y mantener, una regla sencilla de predicción u otra referencia, pero debe corresponder a la pregunta y definirse antes de ver el resultado. Consulta la formulación en el artículo original de White.
Es una pregunta sobre la familia completa, no una garantía para la estrategia que resulte ganadora. Rechazar la nula indica evidencia de superioridad en la familia registrada bajo la estadística y los supuestos elegidos. No demuestra que todos los candidatos sirvan, que el ganador siga siendo el mejor ni que su ventaja sobreviva a otro régimen de mercado.
Expresa cada candidato como una diferencia de rendimiento comparable
Sea d[k,t] el rendimiento del candidato k menos el rendimiento del benchmark durante el mismo periodo t; un valor mayor siempre debe favorecer al candidato. En una comparación de retornos, puede definirse como el retorno neto del candidato menos el retorno neto del benchmark. Si se comparan pérdidas de pronóstico, usa pérdida del benchmark menos pérdida del candidato. La convención de signos debe hacer que un valor positivo siempre sea favorable al candidato.
Cada fila debe corresponder al mismo intervalo para todos los candidatos. Mantén una sola divisa, convención de retornos, tratamiento de financiación y criterio de costes. Si la afirmación se refiere a retornos ejecutables, resta comisiones, spread, deslizamiento, financiación y costes de préstamo pertinentes antes de calcular d[k,t]. Probar retornos brutos y mencionar los costes solo en una nota responde a otra pregunta.
La media muestral del candidato k es d̄[k] = (1/T) Σ_t d[k,t]. La nula conjunta es H0: max_k E[d[k,t]] ≤ 0, y la alternativa, H1: max_k E[d[k,t]] > 0. El benchmark es común a la familia y todos los candidatos usan el mismo criterio. Si hay fechas ausentes o frecuencias distintas, define una muestra común defendible antes de calcular diferencias; no concedas silenciosamente a un candidato una ventana más favorable.
Incluye toda la familia de candidatos en la afirmación de investigación
La familia reúne las reglas que pudieron influir en el ganador publicado: ventanas retrospectivas, umbrales de entrada, combinaciones de señales, universos de activos, periodos de tenencia, restricciones de cartera y supuestos de ejecución. También incluye variantes manuales probadas y descartadas después de ver sus resultados. El artículo de White de 2000 emplea «specification search» en sentido amplio: el proceso de elección, no solo la tabla final, genera el problema de selección.
Hay dos errores opuestos. Omitir pruebas que ayudaron a elegir la estrategia hace que el ajuste sea demasiado optimista: el bootstrap ve una búsqueda menor que la real. Añadir después muchas reglas arbitrarias y ajenas puede volver la prueba innecesariamente conservadora y reducir su capacidad para detectar un candidato útil. Define la familia a partir del proceso de selección real y conserva un registro que permita auditar sus límites.
La prueba no puede inferir experimentos que no se documentaron. Una libreta que solo contenga los parámetros ganadores no permite reconstruir la búsqueda. Guarda juntos el registro de candidatos, versión de los datos, fechas de evaluación, objetivo, supuestos de costes y decisiones de selección. Si la familia cambió tras examinar resultados, explica qué cambió y por qué; no presentes una delimitación retrospectiva como si se hubiera fijado de antemano.
El estadístico máximo incorpora la selección a la hipótesis nula
Calcula el rendimiento relativo medio de cada candidato y quédate con el mayor. Un estadístico común sin studentizar es Vobs = √T × max_k d̄[k]. El máximo es esencial: representa la misma operación de «elegir el mejor» que produjo al ganador aparente. Probar solo la columna ganadora elimina esa operación de la distribución de referencia.
El bootstrap aproxima el tamaño que podría alcanzar un máximo por variación muestral si fuera cierta la nula conjunta de no superioridad. En cada réplica b, remuestrea el vector temporal de diferencias de todos los candidatos y calcula un estadístico centrado como V*b = √T × max_k(d̄*[k,b] − d̄[k]). El centrado sitúa las medias de los candidatos en el límite menos favorable de la nula, donde sus ventajas esperadas son cero, y el máximo conserva la selección entre candidatos. El trabajo de White desarrolla la distribución bootstrap del máximo y la compara con el estadístico observado.
Repite el proceso muchas veces. El valor p ajustado es la proporción de máximos bootstrap iguales o superiores a Vobs. Con B réplicas, un estimador Monte Carlo habitual es (1 + count{V*b ≥ Vobs})/(B + 1). Las implementaciones pueden diferir en la studentización y en detalles de modelos estimados; documenta el estadístico y el centrado bajo la nula. Lo esencial es repetir en cada réplica el máximo de toda la familia, no evaluar solo al ganador observado.
Conserva la dependencia al remuestrear el historial de candidatos
Las observaciones financieras están ordenadas en el tiempo. Una mezcla independiente puede borrar dependencia serial, agrupaciones de volatilidad y rachas de ganancias o pérdidas correlacionadas. También puede distorsionar la relación entre estrategias que responden a los mismos días de mercado. Estos rasgos afectan la cola del máximo; remuestrear cada candidato por separado o extraer fechas individuales con reemplazo puede producir una distribución de referencia incorrecta.
White describe métodos para datos dependientes, como el bootstrap de bloques móviles, y analiza el bootstrap estacionario de Politis y Romano. En este último, un bloque seleccionado suele continuar con la siguiente observación temporal; en un reinicio aleatorio empieza en otra fecha seleccionada. Las longitudes resultantes siguen una distribución geométrica con una media elegida. Bajo los supuestos y ajustes del método, conserva secuencias de corto plazo mejor que un remuestreo i.i.d. Consulta el artículo de Politis y Romano sobre el bootstrap estacionario.
Para una familia de estrategias, remuestrea una sola secuencia común de índices temporales y aplícala a todo el vector de fila (d[1,t], …, d[K,t]). Así se mantienen el orden dentro de los bloques y la dependencia contemporánea entre candidatos. Elige la longitud de bloque considerando el horizonte de la estrategia y los diagnósticos de dependencia; informa también cuánto cambian los resultados con alternativas razonables. Si el procedimiento de investigación vuelve a estimar parámetros, decide si ese paso forma parte del objeto de inferencia y reprodúcelo en cada réplica cuando sea necesario. Remuestrear solo retornos ajustados fijos puede condicionar y excluir parte del procedimiento.
Un ejemplo hipotético de bootstrap cambia la interpretación
Supongamos que se comparan tres estrategias con un benchmark durante T = 252 días de negociación. Las diferencias diarias medias después de costes son +2.0, +1.0 y −0.5 puntos básicos. La media del ganador es 2.0 puntos básicos y el estadístico observado es √252 × 2.0 bp ≈ 31.75 bp·√día de negociación. Esta escala forma parte del estadístico; no es un estadístico t porque no se divide por un error estándar estimado.
Ahora supongamos 9.999 réplicas de bootstrap estacionario con las mismas fechas para los tres candidatos. En este resultado hipotético, 1.199 máximos de réplica igualan o superan 31.75. La estimación Monte Carlo con corrección de uno es (1 + 1,199)/(9,999 + 1) = 0.12. Un test separado del ganador podría arrojar hipotéticamente 0.03, pero omitiría la búsqueda entre tres candidatos. El valor p de Reality Check compara la familia completa y, con un umbral del 5 %, aquí no se rechaza la nula conjunta.
Son cifras inventadas para ilustrar el cálculo, no rendimientos de mercado medidos ni resultados del artículo de White. Un valor p de 0.12 no significa que la estrategia tenga un 12 % de probabilidad de perder. Significa que, con el bootstrap y la construcción de la nula especificados, un máximo al menos así de grande no es lo bastante inusual para rechazar al nivel elegido. Las medias muestrales tampoco indican si el retorno es económicamente relevante una vez considerados riesgo, capacidad y ejecución.
Interpreta el valor p ajustado como evidencia sobre una familia definida
Un valor p pequeño aporta evidencia contra la afirmación de que ningún miembro de la familia incluida supera en rendimiento esperado al benchmark elegido, dados los supuestos del test. Como la nula es conjunta, no identifica automáticamente qué candidato tiene una ventaja duradera. La identidad del ganador puede cambiar entre muestras, y la evidencia para una estrategia concreta puede ser débil aunque se rechace la nula de la familia.
Un valor p grande significa que no se rechaza, no que todas las estrategias sean equivalentes al benchmark. Una muestra corta, rendimiento ruidoso, familia muy amplia, medición deficiente o poca potencia pueden explicarlo. Tampoco es la probabilidad de que la nula sea verdadera: es una probabilidad de cola bajo una distribución de referencia que depende del conjunto de candidatos, la medida de rendimiento, el benchmark, el diseño bootstrap y los datos observados.
La pregunta de White es relativa. Una regla puede superar un benchmark débil y perder dinero; otra puede no superar uno fuerte y aun así generar retornos positivos. Informa juntos los resultados absolutos y relativos, con incertidumbre, rotación, drawdown, capacidad y costes realistas. La evidencia estadística de superioridad predictiva relativa y la viabilidad económica de invertir son decisiones distintas.
Revisa supuestos y límites antes de confiar en el resultado
La teoría original requiere condiciones de regularidad para el proceso de diferencias de rendimiento y su distribución límite. El marco de White incluye series temporales estacionarias y fuertemente mezclantes; el bootstrap dependiente también exige una secuencia apropiada de longitudes de bloque. En muestras finitas, cambios de régimen, rupturas estructurales, memoria larga, saltos raros y volatilidad inestable pueden cuestionar la aproximación estacionaria. Un bootstrap por bloques conserva parte de la dependencia local, pero no recrea un régimen futuro desconocido.
La prueba también hereda los errores de datos y evaluación. La filtración de información futura, sesgo de supervivencia, datos revisados, ejecuciones irreales, costes omitidos, ajustes incorrectos por acciones corporativas y un benchmark elegido tras ver los resultados pueden invalidar las diferencias. Si se solapan periodos de tenencia, las rentabilidades pueden ser dependientes por construcción; la unidad de remuestreo y la longitud del bloque deben representarlo. Si la métrica final es no lineal, como el ratio de Sharpe, vuelve a calcularla en cada réplica en lugar de asumir que un bootstrap de la media la contrasta automáticamente.
Reality Check puede ser conservador, especialmente cuando una familia grande contiene muchas alternativas claramente malas. Una distribución amplia del máximo puede dificultar el rechazo aunque exista un candidato bueno. La prueba de Superior Predictive Ability de Hansen es un método bootstrap relacionado que trata de otra manera las alternativas deficientes; no es un sustituto universal y sus supuestos también requieren revisión. Compara los métodos según la pregunta y comunica la sensibilidad, en vez de elegir el que dé el resultado preferido.
Úsalo junto con validación cronológica y otras herramientas de selección
White’s Reality Check pregunta si una familia de búsqueda documentada contiene, tras ajustar por selección, un candidato superior al benchmark. No sustituye un holdout cronológico ni una evaluación walk-forward de una estrategia congelada. Tampoco resuelve por sí solo la superposición de etiquetas o la filtración de información. Se diferencia de PBO, que resume con qué frecuencia el ganador in-sample queda por debajo de la mediana de candidatos en particiones combinatorias; el artículo original de PBO formaliza ese diagnóstico del riesgo de selección. Los métodos de falsos descubrimientos se centran en la proporción falsa esperada entre varios rechazos. El Deflated Sharpe Ratio ajusta una evaluación de significación basada en Sharpe por selección y rendimientos no normales. Continúa con las guías de pruebas múltiples y tasa de falsos descubrimientos en finanzas, PBO y CSCV, validación walk-forward y validación cruzada purgada y embargo.
En una revisión práctica, fija el benchmark y la definición de rendimiento, reconstruye la familia realmente utilizada, calcula diferencias emparejadas periodo a periodo, elige y justifica un remuestreo que preserve la dependencia e informa el máximo y su probabilidad de cola bootstrap. Después evalúa el proceso de selección congelado en datos cronológicos posteriores y analiza costes y ejecución por separado. La aplicación de Sullivan, Timmermann y White a reglas técnicas de trading muestra por qué importa el universo de reglas: la conclusión puede cambiar cuando la inferencia considera la búsqueda completa y no solo al ganador publicado. Reality Check corrige un problema de selección concreto; no certifica que un backtest vaya a sobrevivir al trading en vivo.
Preguntas frecuentes
Q1¿Qué contrasta White’s Reality Check?
Contrasta si el mejor candidato de una familia de búsqueda definida tiene un rendimiento esperado superior al benchmark elegido, teniendo en cuenta la selección entre candidatos.
Q2¿Un valor p pequeño demuestra que una estrategia será rentable?
No. Es evidencia contra la nula de no superioridad de la familia bajo el benchmark, la métrica, los datos y los supuestos bootstrap elegidos. No garantiza rendimientos futuros ni rentabilidad neta.
Q3¿Por qué usar bootstrap por bloques en vez de remuestrear los días independientemente?
Los bloques pueden conservar parte de la dependencia serial local, y aplicar fechas comunes a todos los candidatos conserva sus relaciones contemporáneas. El diseño de bloques debe seguir siendo adecuado para los datos y la pregunta.
Fuentes
Informar de un problema
Prepararemos un correo con el enlace de este artículo. Mark recibirá el aviso cuando lo envíes
Comprobación rápida
¿Ya leíste la guía? Compruébalo con 3 preguntas
Pregunta 01
¿Qué afirma la hipótesis nula conjunta de White?
Elige una respuesta para ver la explicación
Glosario de opciones
Definiciones claras de términos esenciales, desde calls, puts y cadenas de opciones hasta IV, griegas, interés abierto y max pain
Ver el glosario de opciones