Probabilidade de overfitting do backtest (PBO) e CSCV
Entenda como a validação cruzada simétrica combinatória estima a PBO, transforma rankings OOS em logits e por que a métrica não prevê perdas futuras
Neste guiaA PBO mede o processo de seleção, não uma estratégia isolada
Resumo breve
A probabilidade de overfitting do backtest (PBO) pergunta com que frequência a estratégia escolhida como a melhor dentro da amostra (IS) fica abaixo da mediana do conjunto de candidatas fora da amostra (OOS). A validação cruzada simétrica combinatória (CSCV) estima essa frequência ao destinar, repetidamente, metade de blocos temporais iguais à seleção e a outra metade à avaliação. PBO é um diagnóstico condicionado a uma busca, uma métrica e uma matriz histórica de desempenho definidas. Não é a probabilidade de uma estratégia em operação perder dinheiro.
A PBO mede o processo de seleção, não uma estratégia isolada
Uma equipe de pesquisa pode testar diferentes janelas retrospectivas, limites de entrada, períodos de manutenção, universos, custos e restrições de carteira, e então manter a variante com a maior pontuação de backtest. O resultado escolhido teve muitas oportunidades para se ajustar às particularidades da amostra. A PBO resume uma consequência dessa busca: nas divisões IS/OOS definidas, com que frequência o vencedor IS fica abaixo da mediana OOS do mesmo conjunto de candidatas?
Bailey, Borwein, López de Prado e Zhu apresentaram a PBO como uma estrutura para analisar o risco de seleção de estratégias e propuseram a CSCV como uma forma de estimá-la. A definição trata do procedimento que escolhe entre configurações testadas, não apenas da quantidade de parâmetros em uma única equação de previsão. Em cada divisão, IS é o subconjunto usado para escolher entre as candidatas; ele não precisa coincidir com o período usado para estimar todos os modelos subjacentes. Consulte a formulação no artigo original sobre PBO.
Uma estratégia pode ter um índice de Sharpe alto na amostra completa e ainda ser apenas a candidata mais sortuda de uma família de pesquisa fraca. No sentido contrário, o processo de seleção pode escolher com frequência uma candidata acima da mediana OOS embora todas tenham retornos negativos. A PBO compara rankings relativos dentro do conjunto fornecido; por si só, não testa se o retorno esperado é positivo.
A PBO responde a uma pergunta diferente de outras ferramentas de validação
Um holdout cronológico ou teste walk-forward pergunta como um processo de pesquisa definido teria funcionado em observações posteriores que não foram usadas em decisões anteriores. A validação cruzada purgada trata da sobreposição entre intervalos de rótulos de treino e resultados de teste; um embargo pode acrescentar uma margem separada e justificada. Nenhuma dessas medidas, isoladamente, estima com que frequência o vencedor de uma ampla busca de estratégias cai abaixo da mediana OOS das candidatas. Veja o [guia de validação cruzada purgada e embargo](/pt-BR/learn/purged-cross-validation-embargo-time-series-finance-explained).
PBO também não é uma correção para testes múltiplos. O Reality Check de White usa bootstrap para testar se a melhor regra de uma família supera uma referência após considerar data snooping. O Deflated Sharpe Ratio ajusta um cálculo de significância baseado em Sharpe para efeitos de seleção e retornos não normais. Já a PBO resume o ranking OOS da candidata escolhida em IS ao longo das divisões. Os métodos usam estatísticas e pressupostos diferentes e, por isso, não se substituem automaticamente. Consulte o artigo original de White sobre Reality Check e o trabalho de Bailey e López de Prado sobre o Deflated Sharpe Ratio.
Comece com uma matriz de desempenho completa e sincronizada
Considere M uma matriz T por N. Cada uma das N colunas representa uma estratégia ou configuração candidata, e cada uma das T linhas representa o mesmo intervalo de observação para todas. Uma linha pode conter o retorno diário após os custos de negociação relevantes. Se as frequências de negociação diferirem, defina primeiro um índice temporal comum e agregue o desempenho de maneira consistente. Comparar os retornos diários de uma estratégia com os totais mensais de outra, linha a linha, não produz uma matriz significativa.
O conjunto de candidatas deve refletir as oportunidades reais de seleção: variantes descartadas em uma busca em grade, alterações manuais feitas depois de ver os resultados, universos alternativos e regras que influenciaram a escolha final. A PBO só avalia as candidatas e seus históricos fornecidos. Se a equipe registrar apenas as finalistas após uma busca muito maior, a estimativa subrepresentará o processo de pesquisa real.
Use a mesma convenção de retorno, moeda, tratamento de alavancagem e critério de desempenho para todas. Se a seleção usar o Sharpe líquido, inclua em cada coluna as taxas, spreads, financiamento, funding, custos de empréstimo e pressupostos de execução relevantes antes de calculá-lo. A métrica também precisa ser calculável nos subconjuntos usados adiante. O artigo original exige linhas sincronizadas e uma métrica estimável em cada subamostra; quando a frequência de negociação varia, recomenda alinhar as séries a um índice comum.
A CSCV combina cada metade da amostra com seu complemento
Escolha um número par S de blocos temporais disjuntos e de mesmo tamanho, preservando a ordem interna de cada bloco. Para cada seleção possível de S/2 blocos, reúna-os como conjunto dentro da amostra (IS) e use os S/2 restantes como fora da amostra (OOS). Para métricas dependentes do percurso, mantenha a ordem original dos blocos escolhidos e documente o efeito de concatená-los.
Há C(S,S/2) atribuições IS. Com quatro blocos A, B, C e D, as seis atribuições são AB, AC, AD, BC, BD e CD; cada complemento também conta como uma atribuição própria. Para S = 16, C(16,8) = 12.870. São combinações determinísticas do mesmo histórico, não 12.870 experimentos de mercado independentes.
“Simétrica” significa reutilizar o complemento como conjunto de seleção em outra combinação: em uma divisão, AB é IS e CD é OOS; em outra, ocorre o inverso. “Combinatória” significa enumerar todas as escolhas de metade dos blocos, em vez de sortear uma única divisão. O procedimento não reproduz uma sequência cronológica. O conjunto selecionado pode incluir blocos iniciais e finais enquanto o complemento contém blocos intermediários. Portanto, OOS não quer dizer “o futuro após o período de treino”.

Converta o ranking OOS da candidata escolhida em um logit
Para a divisão c, aplique a regra de seleção da pesquisa ao subconjunto IS e escolha a melhor candidata n*(c). Depois, calcule a mesma métrica para todas as N candidatas no subconjunto OOS complementar. Defina r(c) como o ranking OOS da candidata escolhida: 1 é o pior e N, o melhor. Determine de antemão como tratar empates e aplique a mesma regra em todas as divisões.
Converta o ranking em ranking relativo: ω(c) = r(c)/(N+1). O denominador N+1 mantém o valor estritamente entre zero e um até nas posições extremas. O logit é λ(c) = ln(ω(c)/(1−ω(c))). Ele é negativo quando a candidata escolhida fica abaixo da mediana OOS, zero na mediana e positivo acima dela. A PBO estimada é a proporção de atribuições CSCV com λ(c) ≤ 0.
O valor único da PBO indica com que frequência o vencedor IS chega, no máximo, à mediana OOS. A distribuição completa dos logits também mostra se as candidatas escolhidas costumam permanecer perto do centro, caem muito abaixo com frequência ou tendem a ficar acima. Um logit é uma transformação de ranking relativo, não uma probabilidade para uma operação ao vivo nem uma previsão calibrada de retorno futuro.
Um exemplo hipotético com quatro blocos dá PBO de 66,7%
Suponha quatro blocos históricos iguais e quatro regras candidatas, R1 a R4. A tabela mostra as seis atribuições IS. A coluna de ranking OOS indica a posição da regra escolhida em IS entre as quatro regras nos blocos complementares. Todos os valores são hipotéticos e servem apenas para ilustrar o cálculo.
| Blocos IS | Vencedor IS | Ranking OOS r | Ranking relativo ω = r/5 | Logit ln(ω/(1−ω)) | Na mediana ou abaixo? |
|---|---|---|---|---|---|
| AB | R1 | 1 | 0,20 | −1,386 | Sim |
| AC | R3 | 4 | 0,80 | +1,386 | Não |
| AD | R2 | 2 | 0,40 | −0,405 | Sim |
| BC | R1 | 1 | 0,20 | −1,386 | Sim |
| BD | R4 | 3 | 0,60 | +0,405 | Não |
| CD | R3 | 2 | 0,40 | −0,405 | Sim |
Quatro das seis regras selecionadas têm ranking relativo OOS de, no máximo, um meio. Assim, a PBO empírica é 4/6 ≈ 0,667, ou cerca de 66,7%. Por exemplo, o ranking 2 dá ω = 2/(4+1) = 0,4 e λ = ln(0,4/0,6) ≈ −0,405. O ranking 3 dá ω = 0,6 e o logit oposto, aproximadamente +0,405.
Isso não significa que exista 66,7% de chance de perder dinheiro no mês seguinte. Nesta matriz hipotética e com essa convenção de ranking, o vencedor IS ficou na mediana dos candidatos OOS ou abaixo dela em quatro das seis divisões. Os outros dois vencedores também poderiam ter retornos OOS absolutos negativos e ainda assim superar seus pares.
Trate a PBO como um diagnóstico condicional com limites
A PBO depende da família de candidatas, da matriz observada, da métrica de seleção, dos blocos temporais e da regra para empates. Experimentos não registrados ficam fora do escopo. “Livre de modelo” significa que o cálculo pode usar os históricos de desempenho sem conhecer as equações de previsão; não significa ausência de escolhas de desenho, problemas de dados ou pressupostos.
A CSCV combina blocos em subconjuntos simétricos de mesmo tamanho, mas o conjunto OOS geralmente não é um único período cronológico posterior. Recombinar blocos pode distorcer dependências de longo prazo, padrões sazonais ou a sequência de regimes econômicos. S determina tanto o número de combinações quanto a duração representada por cada bloco. Escolha e registre S considerando os horizontes e a estrutura relevantes da estratégia. Muitas combinações não criam o mesmo número de observações independentes, pois reutilizam os blocos.
A estatística herda vieses dos retornos de origem. Viés de sobrevivência, dados revisados, variáveis indisponíveis na época, execuções irreais, custos omitidos ou um universo escolhido depois dos resultados podem tornar todos os históricos enganosos. CSCV não remove automaticamente intervalos de rótulos sobrepostos, não reestima necessariamente cada pipeline de modelo em cada divisão e não impede vazamento no pré-processamento. Implemente essas etapas de acordo com a pergunta de pesquisa. Para proteções cronológicas, consulte a documentação oficial de TimeSeriesSplit e o guia de validação purgada.
Métricas dependentes do percurso, como drawdown máximo, exigem cuidado extra: concatenar blocos não contíguos muda o percurso e pode alterar a métrica. O artigo de PBO observa que a ordem importa para algumas medidas, diferentemente do Sharpe. Explique como ordem, lacunas, observações ausentes e composição dos retornos são tratados antes de interpretar o ranking.
Apresente a PBO com evidências cronológicas e o registro completo da pesquisa
Antes do cálculo, preserve o registro de candidatas, cada ajuste feito após observar os resultados, a matriz de desempenho, a métrica de seleção e a regra de empate. Informe T, N, S, construção dos blocos, C(S,S/2), convenção de ranking OOS, PBO estimada e distribuição dos logits. Inclua desempenho OOS absoluto, custos, giro, drawdowns e número de candidatas perdedoras: o ranking sozinho não mostra se todas são fracas.
Use walk-forward ou um holdout cronológico genuíno para avaliar o processo de pesquisa congelado em dados posteriores. Mantenha o período final fechado enquanto escolhe modelo e limites; consultá-lo repetidamente o transforma em outro conjunto de seleção. Ferramentas ordenadas no tempo como TimeSeriesSplit criam folds cronológicos segundo os pressupostos documentados, enquanto PBO mede outra propriedade baseada em ranking da família testada.
Assim, a PBO complementa, mas não substitui, controles de sobreposição de rótulos, análise de testes múltiplos, modelagem realista de execução, avaliação prospectiva e monitoramento em operação. Leia também [testes múltiplos e taxa de falsas descobertas em finanças](/pt-BR/learn/multiple-testing-false-discovery-rate-finance-explained) e [ajustes do Sharpe para correlação serial](/pt-BR/learn/sharpe-ratio-serial-correlation-annualization-explained). Nenhuma estatística transforma um ranking histórico em prova de uma vantagem de negociação persistente.
Perguntas frequentes
Q1PBO significa que a estratégia tem essa probabilidade de perder dinheiro?
Não. Ela estima com que frequência uma candidata escolhida em IS fica na mediana OOS ou abaixo nas divisões definidas. Não é probabilidade de perda futura nem previsão calibrada de retorno em operação.
Q2CSCV é o mesmo que teste walk-forward?
Não. CSCV combina cada metade de blocos com seu complemento, por isso o conjunto OOS pode conter blocos anteriores e posteriores. Walk-forward mantém o treino antes de cada período de teste posterior para examinar um percurso cronológico semelhante à implantação.
Q3Uma PBO baixa prova que a estratégia escolhida tem vantagem?
Não. A vencedora pode superar um conjunto fraco e ainda ter perdas absolutas. Avalie separadamente retornos líquidos, incerteza, custos, vazamento e desempenho em dados realmente posteriores.
Fontes e leituras adicionais
Relatar um problema
Vamos preparar um e-mail com o link deste artigo. Mark só receberá o relato depois que você enviar
Verificação rápida
Terminou o guia? Confira o que aprendeu com 3 perguntas
Pergunta 01
Qual evento contribui para uma estimativa de PBO?
Escolha uma resposta para ver a explicação