Deflated Sharpe Ratio: pruebas múltiples y selección en backtests
Aprende cómo el Deflated Sharpe Ratio ajusta la evidencia del Sharpe tras elegir una estrategia por las pruebas múltiples y los rendimientos no normales, con un ejemplo hipotético y límites claros.
En esta guíaEl DSR eleva el umbral del Sharpe después de una búsqueda
Resumen breve
El Deflated Sharpe Ratio (DSR) pregunta si el Sharpe estimado de una estrategia seleccionada supera un umbral que refleja tanto la búsqueda entre alternativas como la forma de la distribución de rendimientos. Aplica un cálculo probabilístico del Sharpe con una referencia ajustada por selección. El DSR es un diagnóstico estadístico condicionado: no convierte un backtest en prueba de ganancias futuras ni corrige pruebas omitidas, costes poco realistas o filtraciones de información temporal.
El DSR eleva el umbral del Sharpe después de una búsqueda
Quien investiga puede probar distintas definiciones de señales, periodos retrospectivos, umbrales de entrada, universos, duraciones de tenencia y supuestos de costes, y luego informar la versión con el Sharpe más alto. Aunque ningún candidato tenga habilidad real, las estimaciones varían por el ruido de la muestra. Cuanto más amplia sea la búsqueda, mayor tiende a ser la estimación máxima. Por eso, el resultado elegido no equivale a evaluar una estrategia única definida antes de observar los datos.
El Deflated Sharpe Ratio, propuesto por Bailey y López de Prado, aborda dos fuentes de inflación del Sharpe seleccionado: las pruebas múltiples y los rendimientos no normales. La primera eleva la referencia que el resultado debe superar; la segunda modifica la incertidumbre estimada del Sharpe. El artículo original describe el DSR como un Probabilistic Sharpe Ratio calculado frente a un umbral ajustado por selección. El artículo original explica su derivación y cómo estimar el número de pruebas.
Esta interpretación evita un error común. El DSR no resta mecánicamente una penalización fija al Sharpe informado para producir otro ratio de rendimiento. Estima cuánto supera el Sharpe observado un umbral ligado a la búsqueda, el tamaño de la muestra y los momentos de los rendimientos. La estimación puntual del Sharpe puede mantenerse igual mientras el DSR disminuye porque la evidencia es más débil. Para entender el propio Sharpe, consulta también la explicación original de Sharpe.
El mejor de muchos estimadores ruidosos suele ser inusualmente alto
Supón que todas las reglas probadas tienen el mismo Sharpe verdadero, pero cada estimación varía por usar una muestra finita. Elegir la mayor también implica elegir un error de medición favorable. Es la maldición del ganador: con datos nuevos, se espera que la estimación seleccionada regrese hacia el valor típico del grupo.
Importa el número de pruebas, pero también cuánto difieren sus estimaciones. Si los candidatos producen rendimientos casi idénticos, sus Sharpes estimados están muy relacionados y ofrecen menos oportunidades independientes de obtener un máximo afortunado que el mismo número de candidatos no relacionados. Por tanto, el número de filas de una cuadrícula de parámetros no es automáticamente el número de pruebas independientes.
El registro de búsqueda puede incluir decisiones fuera de una cuadrícula formal: cambiar manualmente un umbral, descartar un mercado o revisar un supuesto de costes que influyó en el resultado que se conservó. Un DSR calculado solo con los candidatos finales no puede tener en cuenta experimentos que no se registraron o no se incluyeron como datos de entrada.
El Probabilistic Sharpe Ratio calcula la incertidumbre muestral
El Probabilistic Sharpe Ratio (PSR) estima si el Sharpe muestral supera una referencia elegida, teniendo en cuenta el número de observaciones de rendimientos y la asimetría y curtosis estimadas. El DSR usa el mismo cálculo básico, pero elige una referencia que refleja el Sharpe máximo esperado en la búsqueda.
Para una aproximación común del PSR, el cálculo ajustado por selección es:
$$ \mathrm{DSR}=\Phi\!\left( \frac{(\widehat{SR}-SR_0)\sqrt{T-1}} {\sqrt{1-\widehat{\gamma}_3\widehat{SR} +\frac{\widehat{\gamma}_4-1}{4}\widehat{SR}^{\,2}}} \right) $$
Aquí, $\Phi$ es la función de distribución acumulada normal estándar, $\widehat{SR}$ es el Sharpe observado por observación de rendimiento, $SR_0$ es el umbral ajustado por selección en las mismas unidades y $T$ es el número de observaciones. $\widehat{\gamma}_3$ es la asimetría muestral y $\widehat{\gamma}_4$ es la curtosis de Pearson, que vale 3 para una distribución normal. El denominador refleja cómo la asimetría y la curtosis modifican la incertidumbre de la estimación del Sharpe.
La expresión depende de las convenciones elegidas. Usa rendimientos excedentes de una sola frecuencia y calcula el Sharpe y el umbral en esa misma frecuencia; define la curtosis de forma coherente. Anualizar solo una de esas cantidades cambia la comparación. La fórmula habitual también supone cierta estructura para las observaciones; la dependencia temporal requiere un tratamiento propio, no una sustitución silenciosa de $T$.
El umbral del máximo esperado depende de la familia de candidatos
Para $N$ estimaciones del Sharpe independientes con distribución aproximadamente normal, Bailey y López de Prado usan una aproximación de valores extremos para el máximo esperado:
$$ SR_0 \approx \mu_{SR}+\sigma_{SR} \left[(1-\gamma_E)\Phi^{-1}\!\left(1-\frac{1}{N}\right) +\gamma_E\Phi^{-1}\!\left(1-\frac{1}{Ne}\right)\right] $$
$\mu_{SR}$ y $\sigma_{SR}$ son la media y la desviación estándar de las estimaciones de Sharpe de los candidatos; $\Phi^{-1}$ es la función cuantil normal estándar, $e$ es el número de Euler y $\gamma_E \approx 0{,}5772$ es la constante de Euler-Mascheroni. La expresión aproxima cuánto puede elevarse la mejor estimación solo por selección bajo el modelo de pruebas elegido. No es un umbral universal para cualquier búsqueda de estrategias.
Si los resultados de los candidatos están correlacionados, tratarlos todos como independientes puede exagerar el número efectivo de pruebas. El artículo analiza cómo estimar una cantidad de pruebas independientes a partir de la dependencia entre candidatos, pero esa estimación es otra decisión de modelización. La correlación es solo una forma de dependencia, y su estimación puede ser inestable con muchos candidatos y un historial corto. Informa el número bruto de candidatos, el método de cualquier estimación efectiva y la sensibilidad a alternativas plausibles.
Un cálculo hipotético separa el umbral del Sharpe observado
Supón una búsqueda deliberadamente simplificada con 20 estrategias candidatas independientes. Bajo la hipótesis nula, toma como 0 la media de sus estimaciones de Sharpe y como 0,20 su desviación estándar en unidades mensuales. La aproximación del máximo esperado produce un umbral de selección de aproximadamente $SR_0=0{,}380$ al mes. Son supuestos para ilustrar la aritmética, no observaciones de mercado ni una referencia recomendada.
Ahora supón que la estrategia elegida tiene 60 observaciones mensuales de rendimientos excedentes, un Sharpe mensual estimado de 0,50, asimetría muestral de 0 y curtosis de Pearson de 3. La parte PSR compara 0,50 con 0,380, no con cero:
$$ z=\frac{(0.50-0.380)\sqrt{59}}{\sqrt{1+((3-1)/4)(0.50)^2}} \approx 0.868,\qquad \mathrm{DSR}=\Phi(z)\approx 0.807 $$
Con estos supuestos simplificados, el DSR es aproximadamente 80,7 %. No significa que haya un 80,7 % de probabilidad de que la estrategia gane el próximo mes ni es un pronóstico de ese rendimiento. Es la evidencia estimada de que el Sharpe subyacente supera el umbral de selección elegido, condicionada al modelo y a los datos introducidos. El resultado cambia con otro número de pruebas, estimación de dependencia, muestra o forma de la distribución.
La sensibilidad a la dispersión de las estimaciones entre pruebas es importante. Si solo cambia la desviación estándar supuesta de las estimaciones de Sharpe de los candidatos, de 0,20 a 0,10, la misma búsqueda de 20 pruebas produce un umbral de aproximadamente 0,190 y un DSR de aproximadamente 98,8 %. Si la desviación estándar es 0,30, el umbral es aproximadamente 0,570 y el DSR aproximadamente 30,6 %. El Sharpe observado de 0,50, las 60 observaciones, la asimetría y la curtosis permanecen iguales. Esta sensibilidad hipotética muestra por qué importa el método para estimar la dispersión entre pruebas y la dependencia entre candidatos; los valores siguen en las mismas unidades mensuales y dentro del mismo modelo simplificado.
La asimetría y la curtosis cambian la incertidumbre, no solo el relato
Dos estrategias pueden tener el mismo Sharpe muestral y tamaño de muestra, pero distribuciones de rendimientos distintas. Una cola izquierda pronunciada, la asimetría o la frecuencia inusual de valores extremos pueden modificar la incertidumbre muestral del denominador del PSR. El ajuste se calcula con los momentos observados: no considera igual de perjudicial toda distribución no normal ni garantiza que unos pocos momentos muestrales describan por completo las colas.
La aritmética también depende de qué se cuenta como observación. Los datos diarios, semanales y mensuales generan valores distintos de $T$, Sharpe, asimetría y curtosis. Los rendimientos de periodos de tenencia solapados pueden hacer que filas contiguas sean dependientes. Las valoraciones suavizadas o desactualizadas pueden parecer menos variables que el riesgo económico subyacente. Describe la frecuencia y la construcción de la muestra en vez de tratar el Sharpe anualizado como dato suficiente.
El DSR y otros métodos de validación responden a preguntas distintas
PBO usa la validación cruzada simétrica combinatoria para preguntar con qué frecuencia el ganador dentro de muestra queda en la mediana de candidatos o por debajo de ella en bloques complementarios. El DSR estima si el Sharpe seleccionado supera un umbral ajustado por la búsqueda y la falta de normalidad. Sus resultados y supuestos de remuestreo son distintos; uno no sustituye al otro. Consulta las guías de PBO y CSCV y de pruebas múltiples en finanzas. Bailey y sus coautores formalizan este diagnóstico de selección en el artículo original sobre PBO.
El Reality Check de White usa un bootstrap para probar si la mejor regla de una familia de candidatos supera una referencia especificada, teniendo en cuenta el data snooping. Su pregunta es relativa a la referencia, mientras que el DSR usa un umbral basado en el Sharpe. Un walk-forward cronológico o un holdout final pregunta cómo se comporta un proceso congelado en periodos posteriores. Estos métodos se complementan porque examinan partes distintas de la afirmación de investigación. White describe el método en su artículo original sobre Reality Check.
Informa la búsqueda y los supuestos junto con el DSR
Un informe reproducible identifica el universo de candidatos, todas las decisiones documentadas que influyeron en la selección, el número bruto de pruebas, el método para cualquier número efectivo, la serie de rendimientos, tamaño y frecuencia de la muestra, definición del Sharpe, asimetría, convención de curtosis y umbral ajustado por selección. Indica si los rendimientos son brutos o netos de diferencial, comisiones, impacto de mercado, financiación, préstamo y otros costes. Presenta juntos el Sharpe observado y el DSR para mostrar qué cambió.
La fórmula convencional puede no ajustarse a observaciones con correlación serial. El trabajo de Lo sobre estadísticos del Sharpe explica por qué la agregación temporal y la dependencia afectan la inferencia. Si los rendimientos se solapan o presentan correlación serial, usa un procedimiento de inferencia que trate esa estructura y explica sus supuestos. Multiplicar el Sharpe mensual por $\sqrt{12}$ no corrige la autocorrelación. Para una evaluación que respete el orden temporal, consulta también la guía de ventanas walk-forward expansivas y móviles.
El DSR no descubre una búsqueda no documentada, no elimina filtraciones de información futura, no vuelve representativos los datos con sesgo de supervivencia, no valida ejecuciones, no estima capacidad ni garantiza estabilidad en un nuevo régimen. Tampoco reemplaza el razonamiento económico ni la evidencia cronológica posterior. Trátalo como un diagnóstico documentado dentro del proceso de investigación y conserva un registro de candidatos y canalización de datos reproducibles.
Preguntas frecuentes
Q1¿El Deflated Sharpe Ratio es un Sharpe al que se le resta una penalización?
No. El DSR es un estadístico de tipo probabilístico construido con el Sharpe seleccionado, un umbral ajustado por selección, el tamaño de la muestra, la asimetría y la curtosis. No reemplaza la estimación puntual informada por otro ratio rebajado mecánicamente.
Q2¿Debo contar cada combinación de parámetros como una prueba independiente?
No. Los candidatos similares pueden tener rendimientos correlacionados, así que el tamaño bruto de la cuadrícula quizá no coincida con el número efectivo de oportunidades independientes para seleccionar una estimación alta. Conserva el registro completo de búsqueda e informa el método de dependencia y su incertidumbre.
Q3¿Un DSR alto demuestra que una estrategia de trading funcionará?
No. El DSR depende de la familia de candidatos, los datos, la construcción de rendimientos, los supuestos de las pruebas y el modelo muestral. No corrige experimentos omitidos, errores de ejecución, filtraciones, cambios de régimen ni la incertidumbre futura.
Fuentes
Informar de un problema
Prepararemos un correo con el enlace de este artículo. Mark recibirá el aviso cuando lo envíes
Comprobación rápida
¿Ya leíste la guía? Compruébalo con 3 preguntas
Pregunta 01
¿Qué cambia cuando el DSR se basa en un cálculo de Probabilistic Sharpe?
Elige una respuesta para ver la explicación