Deflated Sharpe Ratio: testes múltiplos e seleção de backtests
Entenda como o Deflated Sharpe Ratio ajusta a evidência do Sharpe após a seleção de uma estratégia, considerando testes múltiplos e retornos não normais, com um exemplo hipotético e limites claros.
Neste guiaO DSR eleva o limite do Sharpe depois de uma busca
Resumo breve
O Deflated Sharpe Ratio (DSR) pergunta se o Sharpe estimado de uma estratégia selecionada supera um limite que reflete tanto a busca entre alternativas quanto o formato da distribuição dos retornos. Ele aplica um cálculo probabilístico de Sharpe a uma referência ajustada pela seleção. O DSR é um diagnóstico estatístico condicionado: não transforma um backtest em prova de lucros futuros nem corrige tentativas omitidas, custos irreais ou vazamento temporal de dados.
O DSR eleva o limite do Sharpe depois de uma busca
Quem pesquisa pode testar muitas definições de sinais, janelas retrospectivas, limites de entrada, universos, períodos de manutenção e premissas de custos, e então apresentar a versão com o maior índice de Sharpe. Mesmo que nenhum candidato tenha habilidade real, as estimativas variam por causa do ruído amostral. Quanto mais ampla a busca, maior tende a ser a estimativa máxima. O resultado selecionado, portanto, difere da avaliação de uma única estratégia definida antes de observar os dados.
O Deflated Sharpe Ratio, proposto por Bailey e López de Prado, trata de duas fontes de inflação do Sharpe selecionado: testes múltiplos e retornos não normais. Os testes múltiplos elevam a referência que o resultado precisa superar; a não normalidade altera a incerteza estimada do Sharpe. O artigo original descreve o DSR como um Probabilistic Sharpe Ratio avaliado contra um limite ajustado pela seleção. O artigo original explica a derivação e a estimativa do número de tentativas.
Essa interpretação evita um erro comum. O DSR não subtrai mecanicamente uma penalidade fixa do Sharpe divulgado para produzir um novo índice de desempenho. Ele estima o quanto o Sharpe observado supera um limite ligado à busca, ao tamanho da amostra e aos momentos dos retornos. A estimativa pontual do Sharpe pode permanecer igual enquanto o DSR cai porque as evidências são mais fracas. Para entender o próprio Sharpe, consulte também a explicação original de Sharpe.
O melhor entre muitas estimativas ruidosas costuma ser excepcionalmente alto
Suponha que todas as regras testadas tenham o mesmo Sharpe verdadeiro, mas cada estimativa varie por usar uma amostra finita. Selecionar a maior também significa selecionar um erro de medição favorável. Essa é a maldição do vencedor: com novos dados, espera-se que a estimativa selecionada recue em direção ao valor típico do grupo.
A quantidade de tentativas importa, mas também o quanto suas estimativas diferem. Se os candidatos produzem retornos quase idênticos, seus Sharpes estimados são muito relacionados e oferecem menos chances independentes de encontrar um máximo fortuito do que um conjunto igualmente grande de candidatos não relacionados. Assim, o número de linhas de uma grade de parâmetros não equivale automaticamente ao número de tentativas independentes.
O registro da busca pode incluir decisões fora de uma grade formal: um limite alterado manualmente, um mercado descartado ou uma premissa de custo revisada que influenciou qual resultado permaneceu. Um DSR calculado apenas com os candidatos finais não consegue levar em conta experimentos que não foram registrados ou informados ao cálculo.
O Probabilistic Sharpe Ratio calcula a incerteza amostral
O Probabilistic Sharpe Ratio (PSR) estima se o Sharpe da amostra supera uma referência escolhida, considerando a quantidade de observações de retorno e as estimativas de assimetria e curtose. O DSR usa o mesmo cálculo básico, mas escolhe uma referência que representa o Sharpe máximo esperado na busca.
Para uma aproximação comum do PSR, o cálculo ajustado pela seleção é:
$$ \mathrm{DSR}=\Phi\!\left( \frac{(\widehat{SR}-SR_0)\sqrt{T-1}} {\sqrt{1-\widehat{\gamma}_3\widehat{SR} +\frac{\widehat{\gamma}_4-1}{4}\widehat{SR}^{\,2}}} \right) $$
Aqui, $\Phi$ é a função de distribuição acumulada normal padrão, $\widehat{SR}$ é o Sharpe observado por observação de retorno, $SR_0$ é o limite ajustado pela seleção nas mesmas unidades e $T$ é a quantidade de observações. $\widehat{\gamma}_3$ é a assimetria amostral e $\widehat{\gamma}_4$ é a curtose de Pearson, igual a 3 em uma distribuição normal. O denominador representa como a assimetria e a curtose alteram a incerteza da estimativa do Sharpe.
A expressão depende da convenção utilizada. Use retornos excedentes em uma única frequência e calcule o Sharpe e o limite nessa mesma frequência; defina a curtose de forma consistente. Anualizar apenas uma dessas grandezas muda a comparação. A fórmula usual também pressupõe algo sobre a dependência das observações; a dependência serial precisa ser tratada à parte, em vez de ser incorporada silenciosamente a $T$.
O limite do máximo esperado depende da família de candidatos
Para $N$ estimativas de Sharpe independentes e aproximadamente normais, Bailey e López de Prado usam uma aproximação de valores extremos para o máximo esperado:
$$ SR_0 \approx \mu_{SR}+\sigma_{SR} \left[(1-\gamma_E)\Phi^{-1}\!\left(1-\frac{1}{N}\right) +\gamma_E\Phi^{-1}\!\left(1-\frac{1}{Ne}\right)\right] $$
$\mu_{SR}$ e $\sigma_{SR}$ representam a média e o desvio-padrão das estimativas de Sharpe dos candidatos; $\Phi^{-1}$ é a função quantil da normal padrão, $e$ é o número de Euler e $\gamma_E \approx 0,5772$ é a constante de Euler–Mascheroni. A expressão estima até que ponto a seleção, por si só, pode elevar a melhor estimativa no modelo de tentativas escolhido. Não é um limite universal para toda busca de estratégias.
Se os resultados dos candidatos forem correlacionados, tratar cada variação como independente pode superestimar o número efetivo de tentativas. O artigo discute como estimar a quantidade de tentativas independentes a partir da dependência entre candidatos, mas essa estimativa também é uma escolha de modelagem. Correlação é apenas uma forma de dependência, e sua estimativa pode ser instável com muitos candidatos e um histórico curto. Informe a quantidade bruta de candidatos, o método usado para qualquer estimativa efetiva e a sensibilidade a alternativas plausíveis.
Um cálculo hipotético separa o limite do Sharpe observado
Considere uma busca deliberadamente simplificada com 20 estratégias candidatas independentes. Sob a hipótese nula, suponha que a média das estimativas de Sharpe seja 0 e o desvio-padrão seja 0,20 em unidades mensais. A aproximação do máximo esperado resulta em um limite de seleção de aproximadamente $SR_0=0,380$ por mês. Esses dados são premissas para demonstrar a conta, não observações de mercado nem uma referência recomendada.
Agora suponha que a estratégia selecionada tenha 60 observações mensais de retornos excedentes, Sharpe mensal estimado de 0,50, assimetria amostral de 0 e curtose de Pearson de 3. A parte PSR compara 0,50 com 0,380, não com zero:
$$ z=\frac{(0.50-0.380)\sqrt{59}}{\sqrt{1+((3-1)/4)(0.50)^2}} \approx 0.868,\qquad \mathrm{DSR}=\Phi(z)\approx 0.807 $$
Com essas premissas simplificadoras, o DSR resultante é de aproximadamente 80,7%. Isso não significa uma probabilidade de 80,7% de a estratégia dar lucro no próximo mês, nem é uma previsão desse retorno. É a evidência estimada de que o Sharpe subjacente supera o limite de seleção escolhido, condicionada ao modelo e aos dados de entrada. Outro número de tentativas, estimativa de dependência, amostra ou formato de distribuição pode mudar o resultado.
A sensibilidade à dispersão das estimativas entre as tentativas é relevante. Se apenas o desvio-padrão pressuposto das estimativas de Sharpe dos candidatos mudar de 0,20 para 0,10, a mesma busca de 20 tentativas produz um limite de aproximadamente 0,190 e DSR de cerca de 98,8%. Se esse desvio-padrão for 0,30, o limite será de aproximadamente 0,570 e o DSR de cerca de 30,6%. O Sharpe observado de 0,50, as 60 observações, a assimetria e a curtose permanecem iguais. Essa sensibilidade hipotética mostra por que o método para estimar a dispersão das tentativas e a dependência entre candidatos importa; os valores continuam nas mesmas unidades mensais e no mesmo modelo simplificado.
Assimetria e curtose alteram a incerteza, não apenas a narrativa
Duas estratégias podem apresentar o mesmo Sharpe amostral e o mesmo tamanho de amostra, mas distribuições de retornos diferentes. Uma cauda esquerda pronunciada, a assimetria ou observações extremas incomumente frequentes podem alterar a incerteza amostral representada no denominador do PSR. O ajuste é calculado a partir dos momentos medidos; ele não considera todas as distribuições não normais igualmente prejudiciais nem garante que alguns momentos amostrais descrevam por completo o comportamento das caudas.
O cálculo também depende do que conta como uma observação. Dados diários, semanais e mensais produzem valores diferentes para $T$, Sharpe, assimetria e curtose. Retornos de períodos de manutenção sobrepostos podem tornar linhas adjacentes dependentes. Marcações suavizadas ou desatualizadas podem parecer menos variáveis do que o risco econômico subjacente. Descreva a frequência e a construção da amostra em vez de tratar o Sharpe anualizado como dado suficiente.
DSR e outros métodos de validação respondem a perguntas diferentes
O PBO usa validação cruzada simétrica combinatória para perguntar com que frequência o vencedor in-sample fica na mediana dos candidatos ou abaixo dela em blocos complementares. O DSR estima se um Sharpe selecionado supera um limite ajustado pela busca e pela não normalidade. Os resultados e premissas de reamostragem diferem; um não substitui o outro. Consulte também os guias sobre [PBO e CSCV](/pt-BR/learn/probability-of-backtest-overfitting-cscv-explained) e [testes múltiplos em finanças](/pt-BR/learn/multiple-testing-false-discovery-rate-finance-explained). Bailey e coautores formalizam esse diagnóstico de seleção no artigo original sobre PBO.
O Reality Check de White usa bootstrap para testar se a melhor regra de uma família de candidatos supera uma referência especificada, levando em conta o data snooping. Sua pergunta é relativa à referência, enquanto o DSR usa um limite baseado no Sharpe. Um walk-forward cronológico ou um holdout final pergunta como um processo congelado se comporta em períodos posteriores. Esses métodos podem se complementar porque avaliam partes diferentes da afirmação da pesquisa. White descreve o método em seu artigo original sobre o Reality Check.
Apresente a busca e as premissas junto com o DSR
Um relatório reproduzível identifica o universo de candidatos, todas as decisões documentadas que influenciaram a seleção, a quantidade bruta de tentativas, qualquer método para estimar a quantidade efetiva, a série de retornos, o tamanho e a frequência da amostra, a definição do Sharpe, a assimetria, a convenção de curtose e o limite ajustado pela seleção. Informe se os retornos são brutos ou líquidos de spread, comissões, impacto de mercado, funding, empréstimo e outros custos. Mostre juntos o Sharpe observado e o DSR para que o leitor veja o que mudou.
A fórmula convencional pressupõe um modelo amostral que pode não se adequar a observações com correlação serial. O trabalho de Lo sobre estatísticas do Sharpe explica por que agregação temporal e dependência afetam a inferência. Se os retornos se sobrepõem ou apresentam correlação serial, use um procedimento de inferência que trate essa estrutura e explique suas premissas. Multiplicar um Sharpe mensal por $\sqrt{12}$ não corrige a autocorrelação. Para uma avaliação que respeite o tempo, consulte também o guia sobre [janelas walk-forward expansivas e móveis](/pt-BR/learn/walk-forward-validation-expanding-vs-rolling-windows-explained).
O DSR não descobre uma busca não documentada, elimina vazamento por look-ahead, torna representativos dados com viés de sobrevivência, valida execuções, estima capacidade nem garante estabilidade em um novo regime. Também não substitui o raciocínio econômico ou evidências cronológicas posteriores. Trate-o como um diagnóstico documentado dentro de um processo de pesquisa e mantenha reproduzíveis o histórico de candidatos e o fluxo de dados.
Perguntas frequentes
Q1O Deflated Sharpe Ratio é um índice de Sharpe depois de subtrair uma penalidade?
Não. O DSR é uma estatística probabilística construída com o Sharpe selecionado, um limite ajustado pela seleção, o tamanho da amostra, a assimetria e a curtose. A estimativa pontual do Sharpe divulgado não é substituída por outro índice descontado mecanicamente.
Q2Devo contar cada combinação de parâmetros como uma tentativa independente?
Não. Candidatos semelhantes podem ter retornos correlacionados, então o tamanho bruto da grade pode não corresponder à quantidade efetiva de chances independentes de selecionar uma estimativa alta. Preserve o registro completo da busca e informe o método de dependência e sua incerteza.
Q3Um DSR alto prova que uma estratégia de trading vai funcionar?
Não. O DSR depende da família de candidatos, dos dados, da construção dos retornos, das premissas das tentativas e do modelo amostral. Ele não corrige experimentos omitidos, erros de execução, vazamentos, mudanças de regime ou incerteza futura.
Fontes e leituras adicionais
Relatar um problema
Vamos preparar um e-mail com o link deste artigo. Mark só receberá o relato depois que você enviar
Verificação rápida
Terminou o guia? Confira o que aprendeu com 3 perguntas
Pergunta 01
O que muda quando um cálculo de Probabilistic Sharpe é usado como base para o DSR?
Escolha uma resposta para ver a explicação