White’s Reality Check contra data snooping em backtests de estratégias
Entenda como o White’s Reality Check compara a melhor estratégia encontrada com um benchmark e usa o máximo de um bootstrap que preserva dependências
Neste guiaO teste pergunta se o vencedor da busca supera um benchmark escolhido
Resumo breve
O White’s Reality Check pergunta se o melhor candidato de uma busca definida supera um benchmark especificado, considerando que ele foi escolhido por ser o máximo. O teste aplica bootstrap às diferenças de desempenho conjuntas e dependentes no tempo e compara o máximo observado com uma distribuição nula de máximos bootstrap. Um p-valor ajustado pequeno é evidência contra a hipótese nula conjunta de que nenhum candidato daquela família supera o benchmark; não é uma previsão de rentabilidade ao vivo.
O teste pergunta se o vencedor da busca supera um benchmark escolhido
Um pesquisador pode testar dezenas de janelas de médias móveis, regras de rompimento, períodos de manutenção, mercados e filtros, e depois divulgar a estratégia com a maior pontuação no backtest. Esse vencedor não é um candidato comum isolado: a busca lhe deu muitas chances de parecer excepcional. Testá-lo como se tivesse sido escolhido antes de observar os dados ignora esse processo de seleção.
O White’s Reality Check incorpora a seleção ao teste. Ele pergunta se algum candidato da família examinada tem desempenho esperado superior ao de um benchmark definido. White formula a hipótese nula como a interseção de comparações unilaterais: o desempenho esperado de cada candidato em relação ao benchmark é no máximo zero. A alternativa é que pelo menos um candidato tenha vantagem esperada positiva. O benchmark pode ser comprar e manter, uma regra simples de previsão ou outra referência, mas precisa corresponder à pergunta de pesquisa e ser definido antes de se ver o resultado. Consulte a formulação formal no artigo original de White.
Essa é uma pergunta sobre a família inteira, não uma garantia para a estratégia que por acaso vence. Rejeitar a hipótese nula indica que a família registrada contém evidências de superioridade sob a estatística e as premissas escolhidas. Não prova que todos os candidatos sejam úteis, que o vencedor continue sendo o melhor ou que sua vantagem sobreviva a outro regime de mercado.
Expresse cada candidato como uma diferença de desempenho comparável
Seja d[k,t] o desempenho do candidato k menos o desempenho do benchmark no mesmo período t; um valor mais alto deve sempre favorecer o candidato. Para comparar retornos, uma definição possível é retorno líquido do candidato menos retorno líquido do benchmark. Se a análise usar perda de previsão, inverta a diferença: perda do benchmark menos perda do candidato. A convenção de sinal precisa fazer com que um valor positivo seja favorável ao candidato.
Cada linha deve representar o mesmo intervalo para todos os candidatos. Use uma única moeda, convenção de retorno, tratamento do financiamento e política de custos. Se a afirmação tratar de retornos executáveis, desconte comissões, spreads, slippage, funding e custos de empréstimo pertinentes antes de calcular d[k,t]. Testar retornos brutos e mencionar os custos apenas em uma nota responde a outra pergunta.
A média amostral do candidato k é d̄[k] = (1/T) Σ_t d[k,t]. A hipótese nula conjunta é H0: max_k E[d[k,t]] ≤ 0; a alternativa é H1: max_k E[d[k,t]] > 0. O benchmark é comum à família e todos os candidatos são avaliados pelo mesmo critério. Se houver datas ausentes ou frequências de observação diferentes, defina uma amostra comum defensável antes de calcular as diferenças; não dê silenciosamente a um candidato uma janela mais favorável.
Inclua a família completa de candidatos na afirmação de pesquisa
A família é o conjunto de regras candidatas cujos resultados poderiam influenciar o vencedor divulgado. Pode incluir janelas de retrospectiva testadas, limiares de entrada, combinações de sinais, universos de ativos, períodos de manutenção, restrições de carteira e premissas de execução. Também inclui variantes manuais que foram testadas e descartadas após a análise dos resultados. No artigo de 2000, White usa “specification search” em sentido amplo: o processo de escolha, e não apenas a tabela final, cria o problema de seleção.
Há dois erros opostos. Omitir testes que ajudaram a escolher a estratégia reportada torna o ajuste otimista demais, porque o bootstrap enxerga uma busca menor do que a realizada. Acrescentar depois muitas regras arbitrárias e sem relação pode deixar o teste desnecessariamente conservador e reduzir sua capacidade de detectar um candidato útil. Defina a família a partir do processo real de seleção e mantenha um registro de pesquisa que permita auditar seus limites.
O teste não consegue inferir experimentos que nunca foram registrados. Um caderno com apenas os parâmetros vencedores não permite reconstruir a busca. Guarde juntos o cadastro de candidatos, a versão dos dados, as datas de avaliação, o objetivo, as premissas de custo e as decisões de seleção. Se a família mudou depois de observar os resultados, explique o que mudou e por quê; não apresente uma definição posterior como se tivesse sido fixada de antemão.
A estatística máxima leva a seleção para a distribuição nula
Calcule o desempenho relativo médio de cada candidato e escolha o maior. Uma estatística comum não studentizada é Vobs = √T × max_k d̄[k]. O máximo é essencial: representa a mesma operação de “escolher o melhor” que produziu o vencedor aparente. Testar apenas a coluna vencedora retiraria essa operação da distribuição de referência.
O bootstrap aproxima o tamanho que um máximo poderia alcançar por variação amostral caso a hipótese nula conjunta de não superioridade fosse verdadeira. Para a réplica b, reamostre o vetor temporal das diferenças de todos os candidatos e calcule uma estatística centrada como V*b = √T × max_k(d̄*[k,b] − d̄[k]). A centralização coloca as médias dos candidatos no limite menos favorável da hipótese nula, onde as vantagens esperadas são zero, e o máximo preserva a seleção entre candidatos. O artigo de White desenvolve a distribuição bootstrap do máximo e a compara com a estatística observada.
Repita o processo muitas vezes. O p-valor ajustado é a proporção dos máximos bootstrap pelo menos tão grandes quanto Vobs. Com B réplicas, um estimador Monte Carlo comum é (1 + count{V*b ≥ Vobs})/(B + 1). As implementações podem diferir na studentização e em detalhes de modelos estimados; documente a estatística e a convenção de centralização sob a hipótese nula. O ponto principal é recalcular o máximo da família em cada réplica, em vez de avaliar apenas o vencedor observado.
Preserve as dependências ao reamostrar o histórico dos candidatos
As observações financeiras têm uma ordem temporal. Um embaralhamento independente pode apagar dependência serial, agrupamentos de volatilidade e sequências de ganhos ou perdas correlacionados. Também pode distorcer a relação entre estratégias que tendem a reagir aos mesmos dias de mercado. Essas características afetam a cauda da estatística máxima; reamostrar cada candidato isoladamente ou sortear datas individuais com reposição pode gerar uma distribuição de referência incorreta.
White descreve métodos para dados dependentes, como o bootstrap de blocos móveis, e analisa o bootstrap estacionário de Politis e Romano. Nesse método, um bloco sorteado normalmente segue para a próxima observação temporal; em um reinício aleatório, começa em outra data sorteada. Assim, os comprimentos dos blocos seguem uma distribuição geométrica, com uma média escolhida. Sob as premissas e os parâmetros do método, isso preserva sequências curtas melhor do que uma reamostragem i.i.d. Veja o artigo de Politis e Romano sobre o bootstrap estacionário.
Para uma família de estratégias, sorteie uma única sequência compartilhada de índices temporais e aplique-a ao vetor completo (d[1,t], …, d[K,t]). Isso preserva tanto a ordem dentro dos blocos quanto a dependência contemporânea entre candidatos. Escolha o comprimento do bloco considerando o horizonte da estratégia e diagnósticos de dependência; informe também a sensibilidade a alternativas razoáveis. Se o procedimento de pesquisa reestima parâmetros, decida se essa etapa faz parte da inferência e repita-a em cada reamostragem quando necessário. Reamostrar apenas retornos ajustados e fixos pode condicionar e omitir parte do procedimento.
Um exemplo hipotético de bootstrap muda a interpretação
Suponha que um pesquisador compare três estratégias com um benchmark em T = 252 pregões. As diferenças médias diárias após os custos são +2.0, +1.0 e −0.5 pontos-base. A média do vencedor é, portanto, 2.0 pontos-base, e a estatística observada é √252 × 2.0 bp ≈ 31.75 bp·√pregão. A escala faz parte da estatística do teste; ela não é uma estatística t porque não foi dividida por um erro-padrão estimado.
Agora suponha 9.999 réplicas de bootstrap estacionário que usam as mesmas datas sorteadas para os três candidatos. Nesse resultado hipotético, 1.199 máximos das réplicas são iguais ou maiores que 31.75. O estimador Monte Carlo com correção de mais um é (1 + 1,199)/(9,999 + 1) = 0.12. Um teste separado apenas para o vencedor poderia hipoteticamente resultar em 0.03, mas deixaria de fora a busca entre três candidatos. O p-valor do Reality Check considera a família toda e, neste exemplo, não rejeita a hipótese nula conjunta ao nível de 5%.
Os números são inventados para demonstrar a conta, não são desempenho de mercado medido nem resultado do artigo de White. Um p-valor de 0.12 não significa que a estratégia tenha 12% de probabilidade de perder. Significa que, sob o bootstrap e a construção da hipótese nula especificados, um máximo pelo menos tão grande não é raro o suficiente para rejeitar no nível escolhido. As médias amostrais também não mostram se o retorno é economicamente relevante depois de risco, capacidade e execução.
Interprete o p-valor ajustado como evidência sobre uma família definida
Um p-valor pequeno do Reality Check é evidência contra a afirmação de que nenhum integrante da família incluída supera o benchmark escolhido em desempenho esperado, sob as premissas do teste. Como a hipótese nula é conjunta, a rejeição não identifica automaticamente o candidato com vantagem duradoura. O vencedor pode mudar de uma amostra para outra, e as evidências para uma estratégia podem ser fracas mesmo quando a hipótese da família é rejeitada.
Um p-valor alto significa que não se rejeita a hipótese nula, não que todas as estratégias sejam equivalentes ao benchmark. Uma amostra pequena, desempenho ruidoso, uma família muito ampla, medição inadequada ou baixa potência podem explicar o resultado. O p-valor tampouco é a probabilidade de a hipótese nula ser verdadeira. É uma probabilidade de cauda sob uma distribuição de referência que depende do conjunto de candidatos, da medida de desempenho, do benchmark, do desenho do bootstrap e dos dados observados.
A pergunta de White é relativa. Uma regra pode superar um benchmark fraco e ainda perder dinheiro; pode não superar um benchmark forte e mesmo assim gerar retornos positivos. Apresente juntos os resultados absolutos e relativos, além de incerteza, giro, drawdown, capacidade e custos realistas. Evidência estatística de superioridade preditiva relativa e viabilidade econômica de investimento são decisões distintas.
Confira as premissas e limitações antes de confiar no resultado
A teoria original depende de condições de regularidade para o processo de diferenças de desempenho e sua distribuição limite. O modelo de White inclui séries temporais estacionárias e fortemente misturantes; o bootstrap dependente também precisa de uma sequência adequada de comprimentos de bloco. Em amostras finitas, mudanças de regime, quebras estruturais, memória longa, saltos raros e volatilidade instável podem comprometer a aproximação por reamostragem estacionária. O bootstrap em blocos conserva parte da dependência local, mas não reproduz um regime futuro desconhecido.
O teste também herda erros nos dados e na avaliação da estratégia. Vazamento de informação futura, viés de sobrevivência, dados revisados, execuções irreais, custos omitidos, tratamento incorreto de eventos corporativos e um benchmark escolhido depois de ver os resultados podem invalidar as diferenças. Quando os períodos de manutenção se sobrepõem, os retornos podem ser dependentes por construção; a unidade de reamostragem e o comprimento dos blocos precisam representar essa dependência. Se a métrica final for não linear, como o índice de Sharpe, recalcule-a em cada réplica em vez de presumir que um bootstrap da média dos retornos a testa automaticamente.
As implementações do Reality Check podem ser conservadoras, sobretudo quando uma família grande contém muitas alternativas claramente ruins. Uma distribuição ampla do máximo pode dificultar a rejeição mesmo quando existe um bom candidato. O teste Superior Predictive Ability de Hansen é um método bootstrap relacionado que trata alternativas ruins de outra forma; não é um substituto universal e suas premissas também devem ser avaliadas. Compare os métodos de acordo com a pergunta de pesquisa e apresente análises de sensibilidade, em vez de escolher o método que gera a resposta preferida.
Use-o com validação cronológica e outras ferramentas de seleção
O White’s Reality Check pergunta se uma família de busca registrada contém um candidato com superioridade relativa ao benchmark após considerar a seleção. Não substitui um holdout cronológico nem uma avaliação walk-forward de uma estratégia congelada. Também não resolve por si só a sobreposição de rótulos ou o vazamento de informação. Ele difere do PBO, que resume com que frequência o vencedor in-sample fica abaixo da mediana dos candidatos em divisões combinatórias; o artigo original de PBO formaliza esse diagnóstico de risco de seleção. Procedimentos de falsas descobertas tratam da proporção esperada de falsos resultados entre várias rejeições. O Deflated Sharpe Ratio, por sua vez, ajusta uma avaliação de significância baseada no Sharpe para seleção e retornos não normais. Continue pelos guias de [testes múltiplos e taxa de falsas descobertas em finanças](/pt-BR/learn/multiple-testing-false-discovery-rate-finance-explained), [PBO e CSCV](/pt-BR/learn/probability-of-backtest-overfitting-cscv-explained), [validação walk-forward](/pt-BR/learn/walk-forward-validation-expanding-vs-rolling-windows-explained) e [validação cruzada purgada e embargo](/pt-BR/learn/purged-cross-validation-embargo-time-series-finance-explained).
Em uma revisão prática, fixe benchmark e definição de desempenho, reconstrua a família realmente usada, calcule diferenças pareadas por período, escolha e justifique um desenho de reamostragem que preserve dependências e informe a estatística máxima e a probabilidade de cauda bootstrap. Em seguida, avalie o processo de seleção congelado em dados cronológicos posteriores e analise custos e execução separadamente. A aplicação de Sullivan, Timmermann e White a regras técnicas de negociação mostra por que o universo de regras importa: a conclusão pode mudar quando a inferência inclui a busca completa, e não apenas o vencedor divulgado. O Reality Check corrige um problema de seleção específico; não certifica que um backtest sobreviverá ao trading ao vivo.
Perguntas frequentes
Q1O que o White’s Reality Check testa?
Testa se o melhor candidato de uma família de busca definida tem desempenho esperado superior a um benchmark escolhido, considerando a seleção entre os candidatos.
Q2Um p-valor pequeno do Reality Check prova que uma estratégia será lucrativa?
Não. É evidência contra a hipótese nula de não superioridade da família, sob o benchmark, a métrica, os dados e as premissas de bootstrap escolhidos. Não garante retornos futuros nem lucro líquido.
Q3Por que usar bootstrap em blocos em vez de reamostrar os dias independentemente?
Os blocos podem preservar parte da dependência serial local; as mesmas datas para todos os candidatos preservam também suas relações contemporâneas. O desenho dos blocos ainda precisa ser adequado aos dados e à pergunta de pesquisa.
Fontes e leituras adicionais
Relatar um problema
Vamos preparar um e-mail com o link deste artigo. Mark só receberá o relato depois que você enviar
Verificação rápida
Terminou o guia? Confira o que aprendeu com 3 perguntas
Pergunta 01
O que diz a hipótese nula conjunta de White?
Escolha uma resposta para ver a explicação
Glossário de opções
Definições claras dos termos essenciais, de calls, puts e cadeia de opções a IV, gregas e spread bid-ask
Ver o glossário de opções