Skip to content
Todos os guias de opções e contratos futuros
Dois testes bootstrap para uma família de regras de negociação15 min de leitura

White Reality Check e Hansen SPA para regras de trading

Entenda como Reality Check e Hansen SPA avaliam uma família inteira de regras técnicas contra um benchmark, como diferem na distribuição bootstrap e o que o p-valor global permite concluir.

Neste guiaA regra vencedora exige um teste para toda a família

Resumo breve

Escolher a regra com melhor desempenho depois de testar muitas configurações altera a pergunta estatística. Um teste comum aplicado só à vencedora ignora o processo de busca e seleção. White Reality Check e Hansen SPA avaliam a família completa diante de um benchmark. O SPA padroniza as diferenças e usa uma centralização da hipótese nula que depende dos dados, reduzindo o peso de alternativas claramente ruins. Nenhum dos dois testes, por si só, aponta uma regra que continuará vencendo no futuro.

A regra vencedora exige um teste para toda a família

Se você testa vinte configurações e depois mostra apenas aquela com maior retorno histórico, não avaliou uma única regra. O resultado escolhido também reflete a busca: mesmo que nenhuma variante tenha uma vantagem verdadeira, alguma pode parecer ótima por acaso na amostra histórica. Um teste t comum que trate a vencedora como se tivesse sido definida antes de observar os dados ignora essa seleção.

White criou o Reality Check para formular essa pergunta de data snooping sobre toda a família de candidatos. Sullivan, Timmermann e White aplicaram o método a um conjunto amplo de regras técnicas e mostraram por que é necessário descrever o universo pesquisado. Mais tarde, Hansen propôs o teste de Superior Predictive Ability, ou SPA, que padroniza as diferenças e é menos sensível a regras ruins ou irrelevantes. As fontes primárias são White (2000), Sullivan, Timmermann e White (1999) e Hansen (2005).

Defina o benchmark e a diferença de desempenho antes do teste

Para cada regra $k$ e data comum $t$, defina $d_{k,t}$ como sua vantagem em relação ao benchmark. Para retornos, uma convenção simples é $d_{k,t}=R_{k,t}-R_{0,t}$. Para perdas de previsão, inverta a ordem, por exemplo $d_{k,t}=L_{0,t}-L_{k,t}$, de modo que uma diferença positiva favoreça a regra nos dois casos. A média populacional de interesse é $\mu_k=E[d_{k,t}]$.

Essa definição deixa claro o que significa «melhor»: retorno bruto, retorno líquido de custos, redução de uma perda ou outra métrica estabelecida previamente. Todas as regras precisam usar o mesmo benchmark, frequência, período de avaliação e convenção de sinais. As fórmulas abaixo testam médias de diferenciais. Se a pergunta envolver uma métrica não linear, como o índice de Sharpe, não basta substituir a média nas equações; é preciso um método inferencial adequado à métrica escolhida.

A hipótese nula inclui todas as variantes pesquisadas

A hipótese nula global é $H_0:\max_{k=1,\ldots,K}\mu_k\leq0$. Em outras palavras, nenhuma regra da família supera o benchmark em média. A alternativa afirma que pelo menos uma regra tem vantagem média positiva. É um teste unilateral da família como um todo, não um teste de que todas as regras são iguais.

O tamanho da família deve refletir a busca efetivamente realizada, e não apenas os candidatos que aparecem na tabela final. Como exemplo apenas aritmético, considere 12 janelas de retrospecto, 4 filtros e 5 configurações de saída: são $12\times4\times5=240$ variantes. Esse cálculo é hipotético e não representa resultado nem rentabilidade. Se você também testou ativos, limiares ou premissas de custo diferentes, essas tentativas fazem parte do processo que deve ser relatado.

Reality Check usa a fronteira nula em que todas as médias são zero

Com $n$ observações comuns e média amostral $\bar d_k$, a estatística de Reality Check usada aqui é

$$T_{\mathrm{RC}}=\max_{k=1,\ldots,K}\sqrt{n}\,\bar d_k.$$

O máximo resume a maior vantagem observada contra o benchmark. Nesta definição, a estatística não é artificialmente limitada a zero. Para aproximar sua distribuição sob a hipótese nula, cada série de diferenças é centralizada pela própria média amostral e reamostrada sob a fronteira $\mu_k=0$ para todos os candidatos. Essa é a configuração menos favorável à alternativa entre as situações da hipótese nula, mas pode reduzir o poder do teste.

Uma regra bastante ruim continua dentro do máximo em cada repetição e pode elevar os quantis críticos. A pergunta conservadora de White é se a maior vantagem observada no backtest supera aquilo que poderia aparecer no limite em que todos os ganhos esperados são zero. Um p-valor pequeno fornece evidência contra a hipótese nula global daquela família definida; não avalia candidatos que ficaram fora da busca documentada.

SPA padroniza as diferenças e ajusta a centralização aos dados

O SPA divide cada média diferencial por uma estimativa de sua dispersão de longo prazo, $\hat\omega_k$. A estatística é

$$T_{\mathrm{SPA}}=\max\left(0,\max_k\frac{\sqrt n\,\bar d_k}{\hat\omega_k}\right).$$

A padronização permite comparar diferenças com volatilidades distintas. O máximo externo com zero faz parte da estatística SPA; ele não deve ser acrescentado à fórmula de Reality Check acima. A estimativa da dispersão de longo prazo precisa considerar a dependência temporal da série de diferenciais e deve ser descrita.

A outra mudança está na centralização. Para cada regra, o SPA calcula um termo de correção $\hat\mu_{c,k}$. Se a média padronizada for suficientemente negativa — por exemplo, abaixo do limiar de Hansen $-\sqrt{2\log\log n}$ —, essa média amostral negativa é mantida na distribuição bootstrap sob a hipótese nula. Já as regras compatíveis com a fronteira nula são centralizadas em zero. Assim, alternativas claramente ruins pesam menos nos quantis críticos, sem deixar de considerar candidatos plausíveis próximos da fronteira. Informe a regra de centralização e qual variante de p-valor SPA foi usada.

Vários caminhos convergem para um pico, ao lado de uma balança, duas distribuições abstratas e fileiras de blocos de tempo, sem texto.
Ilustração conceitual da busca por estratégias e da comparação de distribuições de incerteza; não apresenta resultado de teste nem retorno de mercado observado.

O bootstrap em blocos deve preservar a dependência conjunta

Em cada data existe um vetor $(d_{1,t},\ldots,d_{K,t})$ com as diferenças de todas as regras. Cada repetição bootstrap deve reamostrar linhas vetoriais completas em blocos de datas consecutivas. Se as regras forem reamostradas separadamente ou se datas individuais forem sorteadas sem blocos, a correlação entre os candidatos e a dependência temporal desaparecem. O máximo calculado deixa de representar o mesmo problema estatístico.

O bootstrap estacionário de Politis e Romano (1994) sorteia blocos com comprimentos geométricos e um comprimento médio escolhido. Outros procedimentos adequados usam blocos fixos e sobrepostos de observações consecutivas. Os blocos são concatenados até formar uma réplica com o tamanho da amostra original. Ambos os testes dependem de um processo conjunto de diferenças suficientemente estável e fracamente dependente. O comprimento dos blocos e possíveis quebras estruturais podem mudar a conclusão; a reamostragem não corrige uma mudança de regime.

O p-valor global não identifica a regra vencedora

Um Reality Check ou SPA significativo indica que, sob as premissas adotadas, os dados oferecem evidência de que pelo menos uma regra da família documentada tem vantagem média positiva sobre o benchmark. O p-valor global não é a probabilidade de a hipótese nula ser verdadeira, nem a chance de uma regra específica funcionar no futuro. Também não informa qual candidato é individualmente superior. Essa conclusão exige uma análise adicional que considere a seleção e, de preferência, dados novos.

No exemplo hipotético de 240 variantes, a melhor regra observada poderia ser uma entre as 240; esse número, isoladamente, não permite saber se a hipótese nula será rejeitada. O resultado depende dos diferenciais efetivamente observados, do tamanho da amostra, da dependência conjunta e do bootstrap escolhido. Um p-valor alto ou baixo não corrige uma etapa de busca que não foi informada e não garante que o desempenho histórico continue.

FDR e intervalos de confiança respondem a outras perguntas

O guia sobre testes múltiplos e taxa de falsas descobertas trata, em geral, de um conjunto de hipóteses individuais e controla, sob premissas declaradas, a proporção esperada de descobertas falsas entre as hipóteses rejeitadas. Reality Check e SPA testam uma afirmação global sobre o máximo de uma família especificada: há evidência de que algum candidato supera o benchmark? Eles não geram automaticamente uma lista corrigida de regras vencedoras.

Um intervalo de confiança via bootstrap em blocos para uma estratégia definida previamente responde a outra pergunta. O guia sobre intervalos bootstrap para retornos de estratégias quantifica a incerteza de uma média ou de outra estatística já fixada. Se a estratégia foi escolhida após a busca entre muitas variantes, esse intervalo não corrige automaticamente o viés de seleção. O método inferencial precisa acompanhar a pergunta de pesquisa.

A validação cruzada purgada trata de outro problema: reduzir o vazamento temporal de informação entre observações de treino e teste em dados ordenados no tempo. Ela não testa se o máximo de uma família de regras supera o benchmark; essa é a pergunta global do RC e do SPA. O guia sobre validação cruzada purgada e embargo explica essa separação.

Custos, histórico de busca e regimes de mercado continuam importantes

Os diferenciais do teste devem incluir os custos relevantes para as regras analisadas: corretagem, spread entre compra e venda, slippage, impacto de mercado, financiamento, aluguel de ativos e custo de capital, quando aplicável. Subtrair custos somente depois do teste pode transformar uma vantagem bruta estatisticamente positiva em um resultado sem valor econômico. Atraso de execução, liquidez e tamanho das posições também afetam o desempenho realizável.

Um relatório reproduzível descreve a família completa, as etapas de filtragem e seleção, as datas e fontes dos dados, o benchmark, a definição de $d_{k,t}$, os custos, o método de blocos, a regra para escolher o comprimento dos blocos, o número de repetições e a variante de p-valor SPA. Ajustes feitos depois de examinar os resultados ampliam a busca e devem ser reconhecidos. Se quebras estruturais alterarem muito a distribuição ou a série conjunta não for aproximadamente estacionária e fracamente dependente, os testes bootstrap podem induzir a erro. São testes estatísticos de um desenho histórico de pesquisa, não previsões, garantias nem recomendações financeiras personalizadas.

Perguntas frequentes

Q1Um SPA significativo significa que a melhor regra é significativa individualmente?

Não. O teste avalia o máximo sobre toda a família estudada. O p-valor global não certifica uma regra como vencedora individual.

Q2O SPA é sempre mais poderoso que o Reality Check?

Não. Em certas situações pode ser menos sensível a muitas alternativas ruins ou irrelevantes e ter mais poder. Isso não significa que domine em todos os desenhos.

Q3Esses testes podem prever o retorno futuro?

Não. Eles avaliam uma família histórica definida sob premissas sobre o processo conjunto. Mudanças de regime, custos, novas escolhas de seleção e condições futuras podem alterar o desempenho.

Fontes e leituras adicionais

Relatar um problema

Vamos preparar um e-mail com o link deste artigo. Mark só receberá o relato depois que você enviar

Verificação rápida

Terminou o guia? Confira o que aprendeu com 3 perguntas

Pergunta 1 / 3

Pergunta 01

O que afirma a hipótese nula global do Reality Check e do SPA?

Escolha uma resposta para ver a explicação

Glossário de opções