Probabilidad de sobreajuste del backtest (PBO) y CSCV
Aprende cómo la validación cruzada simétrica combinatoria estima la PBO, cómo los rangos fuera de muestra se convierten en logits y por qué la cifra no pronostica pérdidas futuras
En esta guíaLa PBO mide el proceso de selección, no una estrategia aislada
Resumen breve
La probabilidad de sobreajuste del backtest (PBO) pregunta con qué frecuencia la estrategia elegida como mejor dentro de muestra (IS) queda por debajo de la mediana de candidatos fuera de muestra (OOS). La validación cruzada simétrica combinatoria (CSCV) estima esa frecuencia asignando repetidamente la mitad de bloques temporales iguales a selección y la otra mitad a evaluación. La PBO es un diagnóstico condicionado a una búsqueda, una métrica y una matriz histórica de resultados concretas; no es la probabilidad de que una estrategia en vivo pierda dinero.
La PBO mide el proceso de selección, no una estrategia aislada
Un equipo puede probar ventanas retrospectivas, umbrales de entrada, periodos de tenencia, universos, costes y restricciones de cartera, y conservar la variante con mejor puntuación. El resultado seleccionado tuvo muchas oportunidades para ajustarse a peculiaridades de la muestra. La PBO resume una consecuencia de esa búsqueda: en las particiones IS/OOS definidas, ¿con qué frecuencia el ganador IS queda por debajo de la mediana OOS del mismo conjunto de candidatos?
Bailey, Borwein, López de Prado y Zhu propusieron la PBO para estudiar el riesgo de selección de estrategias y plantearon CSCV como una forma de estimarla. La definición se refiere al procedimiento que elige entre configuraciones probadas, no solo a si una ecuación de pronóstico tiene demasiados parámetros. En cada partición, IS es el subconjunto usado para elegir candidatos; no tiene por qué ser el periodo empleado para estimar todos los modelos subyacentes. La formulación formal aparece en el artículo original sobre PBO.
Una estrategia puede mostrar un Sharpe alto en toda la muestra y aun así ser la integrante con más suerte de una familia débil. También puede ocurrir que la selección suela escoger candidatos por encima de la mediana OOS aunque todo el grupo tenga rentabilidades negativas. La PBO compara rangos relativos dentro del conjunto presentado; por sí sola no contrasta si la rentabilidad esperada es positiva.
La PBO responde una pregunta distinta a otras herramientas de validación
Un holdout cronológico o una prueba walk-forward pregunta cómo funcionó un proceso de investigación definido en observaciones posteriores que no se usaron en decisiones anteriores. La validación cruzada con purga aborda el solapamiento entre etiquetas de entrenamiento y resultados de prueba; un embargo puede añadir un margen justificado por separado. Ninguna de estas medidas, por sí sola, cuantifica con qué frecuencia el ganador de una búsqueda amplia queda por debajo de la mediana de candidatos OOS. Consulta la guía sobre validación cruzada con purga y embargo.
La PBO tampoco es un ajuste por pruebas múltiples. El Reality Check de White usa bootstrap para evaluar si la mejor regla de una familia supera un referente tras considerar el data snooping. El Sharpe deflactado ajusta una prueba de significación basada en Sharpe por efectos de selección y rendimientos no normales. La PBO resume, en cambio, el rango OOS del candidato elegido IS a través de particiones. Usan estadísticas y supuestos distintos y no se sustituyen automáticamente. Consulta el artículo original del Reality Check de White y el trabajo de Bailey y López de Prado sobre el Sharpe deflactado.
Empieza con una matriz de resultados completa y sincronizada
Sea M una matriz T por N. Cada una de las N columnas representa una estrategia o configuración candidata y cada una de las T filas representa el mismo intervalo de observación para todos los candidatos. Una fila puede ser el rendimiento diario neto de los costes pertinentes. Si las frecuencias de negociación difieren, define primero un índice temporal común y agrega el rendimiento de forma coherente. No es válido comparar fila por fila el rendimiento diario de una estrategia con el total mensual de otra.
El conjunto de candidatos debe reflejar las oportunidades reales de selección: variantes descartadas en una búsqueda de rejilla, cambios manuales posteriores a revisar resultados, universos alternativos y reglas que influyeron en la decisión final. La PBO solo evalúa candidatos e historiales suministrados. Si el equipo registra únicamente los finalistas de una búsqueda mucho mayor, la estimación deja fuera parte de la búsqueda y la infravalora.
Aplica la misma convención de rendimiento, moneda, tratamiento del apalancamiento y criterio de desempeño a todos. Si se elige con Sharpe neto, incorpora en cada columna las comisiones, diferenciales, financiación, funding, préstamo y supuestos de ejecución pertinentes antes de calcularlo. La métrica debe poder calcularse también en los subconjuntos posteriores. El artículo original exige filas sincronizadas y una métrica estimable en cada submuestra; si varía la frecuencia de negociación, recomienda alinear las series en un índice común.
CSCV empareja cada mitad de la muestra con su complemento
Elige un número par S de bloques temporales disjuntos e iguales. Conserva el orden interno de cada bloque. Para cada selección posible de S/2 bloques, reúne esos bloques como conjunto dentro de muestra (IS) y usa los S/2 restantes como fuera de muestra (OOS). Para métricas que dependen de la trayectoria, conserva el orden original de los bloques elegidos y documenta qué implica esa concatenación para la métrica.
Hay C(S,S/2) asignaciones IS. Con cuatro bloques A, B, C y D, las seis asignaciones son AB, AC, AD, BC, BD y CD; cada complemento también cuenta como asignación propia. Con S = 16, C(16,8) = 12.870. Son combinaciones deterministas de la misma historia, no 12.870 experimentos de mercado independientes.
«Simétrica» significa que el complemento de una selección se reutiliza como conjunto de selección en otra: AB es IS y CD OOS en una división, y CD es IS y AB OOS en otra. «Combinatoria» significa enumerar todas las selecciones de la mitad de bloques en vez de extraer una sola división aleatoria. El procedimiento no reproduce una secuencia cronológica. Una selección puede contener bloques iniciales y finales, mientras el complemento contiene bloques intermedios; por tanto, OOS no significa necesariamente «el futuro posterior al entrenamiento».

Convierte el rango OOS del candidato elegido en un logit
Para la partición c, aplica la regla de selección de la investigación al subconjunto IS y elige el mejor candidato n*(c). Después evalúa los N candidatos en el subconjunto OOS complementario con la misma métrica. Define r(c) como el rango OOS del candidato seleccionado, con 1 para el peor y N para el mejor. Especifica cómo resolver empates y mantén la regla en todas las particiones.
Convierte el rango en rango relativo: ω(c) = r(c)/(N+1). El denominador N+1 mantiene el valor estrictamente entre cero y uno incluso para los extremos. El logit es λ(c) = ln(ω(c)/(1−ω(c))). Es negativo cuando el seleccionado queda por debajo de la mediana OOS, cero en la mediana y positivo por encima. La PBO estimada es la proporción de asignaciones CSCV con λ(c) ≤ 0.
La cifra de PBO resume con qué frecuencia el ganador IS queda en la mediana OOS o por debajo. La distribución completa de logits muestra además si los seleccionados suelen quedarse cerca del centro, caen muy abajo con frecuencia o tienden a superar la mediana. Un logit transforma un rango relativo; no es una probabilidad para una operación en vivo ni un pronóstico calibrado de rendimientos futuros.
Un ejemplo hipotético de cuatro bloques da una PBO del 66,7 %
Supón que hay cuatro bloques históricos iguales y cuatro reglas candidatas, R1 a R4. La tabla incluye las seis asignaciones IS. La columna de rango OOS muestra el rango de la regla elegida en IS entre las cuatro reglas evaluadas en los bloques complementarios. Todos los valores son hipotéticos y solo ilustran el cálculo.
| Bloques IS | Ganador IS | Rango OOS r | Rango relativo ω = r/5 | Logit ln(ω/(1−ω)) | ¿En la mediana o debajo? |
|---|---|---|---|---|---|
| AB | R1 | 1 | 0,20 | −1,386 | Sí |
| AC | R3 | 4 | 0,80 | +1,386 | No |
| AD | R2 | 2 | 0,40 | −0,405 | Sí |
| BC | R1 | 1 | 0,20 | −1,386 | Sí |
| BD | R4 | 3 | 0,60 | +0,405 | No |
| CD | R3 | 2 | 0,40 | −0,405 | Sí |
Cuatro de las seis reglas seleccionadas tienen un rango relativo OOS no superior a la mitad. Así, la PBO empírica es 4/6 ≈ 0,667, es decir, aproximadamente 66,7 %. Por ejemplo, el rango 2 da ω = 2/(4+1) = 0,4 y λ = ln(0,4/0,6) ≈ −0,405. El rango 3 da ω = 0,6 y el logit opuesto, aproximadamente +0,405.
Esto no significa que haya un 66,7 % de probabilidad de perder dinero el mes siguiente. Significa que, en esta matriz hipotética y con esta convención de rangos, el ganador IS quedó en la mediana de candidatos OOS o por debajo en cuatro de las seis particiones. Los dos ganadores restantes aún podrían tener rendimientos OOS absolutos negativos y superar a sus pares.
Trata la PBO como un diagnóstico condicionado y limitado
La PBO depende de la familia candidata, la matriz histórica, la métrica de selección, los bloques y la regla para empates. Los experimentos no registrados quedan fuera de su alcance. «Independiente del modelo» significa que puede calcularse con los historiales de rendimiento sin conocer las ecuaciones de pronóstico; no significa que esté libre de decisiones de diseño, problemas de datos o supuestos.
CSCV combina bloques en subconjuntos simétricos del mismo tamaño, pero el OOS generalmente no es un único tramo cronológico posterior. Recombinar bloques puede alterar dependencias de largo plazo, estacionalidad o secuencias de regímenes económicos. S determina tanto el número de combinaciones como la duración de cada bloque; elígelo y documéntalo según los horizontes y la estructura relevantes de la estrategia. Muchas combinaciones no equivalen a otras tantas observaciones independientes, porque reutilizan los mismos bloques.
La estadística hereda los sesgos de los rendimientos de origen. El sesgo de supervivencia, datos revisados, variables que no estaban disponibles entonces, ejecuciones poco realistas, costes omitidos o un universo escogido a posteriori pueden distorsionar todas las historias. CSCV no elimina automáticamente etiquetas con intervalos solapados, no vuelve a ajustar necesariamente cada canalización de modelos dentro de cada partición ni evita fugas en el preprocesamiento. Esas medidas deben diseñarse expresamente para la pregunta de investigación. Para controles cronológicos, consulta la documentación oficial de TimeSeriesSplit y la guía de validación purgada.
Las métricas dependientes de la trayectoria, como la caída máxima, requieren especial cuidado: concatenar bloques no contiguos cambia la trayectoria y puede alterar la métrica. El artículo de PBO señala que el orden importa para algunas medidas aunque no para Sharpe. Explica cómo manejas orden, huecos, observaciones ausentes y capitalización antes de interpretar un rango.
Informa la PBO junto con evidencia cronológica y el registro completo de búsqueda
Antes de calcularla, conserva el registro de candidatos, cada ajuste realizado tras observar resultados, la matriz de rendimiento, la métrica de selección y la regla de empates. Informa T, N, S, cómo se construyeron los bloques, C(S,S/2), la convención de rango OOS, la PBO estimada y la distribución de logits. Añade rendimiento OOS absoluto, costes, rotación, caídas y número de candidatos con pérdidas: el rango no revela si todos son débiles.
Usa una prueba walk-forward u otro holdout cronológico genuino para examinar el proceso de investigación congelado en datos posteriores. Mantén cerrado el periodo final mientras eliges el modelo y los umbrales; revisarlo repetidamente lo convierte en otro conjunto de selección. Herramientas temporales como TimeSeriesSplit crean divisiones cronológicas bajo sus supuestos documentados, mientras que la PBO mide otra propiedad basada en rangos del conjunto de candidatos probado.
Por tanto, la PBO complementa, pero no sustituye, los controles de solapamiento de etiquetas, el análisis de pruebas múltiples, la ejecución realista, la evaluación prospectiva y la vigilancia en vivo. Continúa con pruebas múltiples y tasa de falsos descubrimientos en finanzas y ajustes del Sharpe por autocorrelación serial. Ninguna estadística convierte un rango histórico en prueba de una ventaja de trading persistente.
Preguntas frecuentes
Q1¿Significa la PBO que la estrategia tiene esa probabilidad de perder dinero?
No. Estima con qué frecuencia un candidato seleccionado en IS queda en la mediana OOS o por debajo en las particiones definidas. No es una probabilidad de pérdidas futuras ni un pronóstico calibrado de rendimiento en vivo.
Q2¿Es CSCV lo mismo que una prueba walk-forward?
No. CSCV empareja cada mitad de bloques con su complemento, de modo que OOS puede contener bloques anteriores y posteriores. Walk-forward mantiene el entrenamiento antes de cada periodo posterior de prueba para estudiar una secuencia cronológica similar a la implementación.
Q3¿Una PBO baja demuestra que la estrategia seleccionada tiene ventaja?
No. El ganador puede superar a un conjunto débil y aun así perder en términos absolutos. Evalúa por separado rendimientos netos, incertidumbre, costes, fugas y resultados en datos realmente posteriores.
Fuentes
Informar de un problema
Prepararemos un correo con el enlace de este artículo. Mark recibirá el aviso cuando lo envíes
Comprobación rápida
¿Ya leíste la guía? Compruébalo con 3 preguntas
Pregunta 01
¿Qué suceso contribuye a la PBO estimada?
Elige una respuesta para ver la explicación