Testes múltiplos e taxa de descobertas falsas em finanças
Entenda comparações múltiplas, erro familiar, taxa de descobertas falsas, Bonferroni, Holm, Benjamini–Hochberg, dependência, q-valores, mineração de fatores, seleção em backtests e governança de pesquisa
Resposta direta
Testes múltiplos surgem quando muitas hipóteses, estratégias, fatores, ativos, horizontes ou especificações são pesquisados em conjunto. Mesmo valores-p válidos de testes individuais passam então a produzir vencedores por acaso. A taxa de erro familiar controla a probabilidade de pelo menos uma rejeição falsa, enquanto a taxa de descobertas falsas controla a parcela falsa esperada entre as rejeições sob determinadas premissas. É a família de pesquisa, e não apenas a tabela final, que determina o problema
Mais testes criam mais vencedores por acaso
Se m hipóteses nulas verdadeiras independentes forem testadas ao nível α, a probabilidade de pelo menos uma rejeição falsa será 1−(1−α)^m
Com α=0.05 e m=20, essa probabilidade é de cerca de 64%, embora cada teste individual tenha uma taxa nominal de rejeição falsa de 5%
A dependência altera o cálculo exato, mas não justifica fingir que apenas o vencedor reportado foi testado
A família define a pergunta sobre o erro
Uma família de testes pode incluir todos os fatores, transformações, universos, defasagens, horizontes, filtros, escolhas de modelo e novas execuções considerados para uma única afirmação de pesquisa
Definir a família depois de ver os resultados subestima a multiplicidade e permite que pesquisadores separem testes relacionados até que a correção se torne inofensiva
A família defensável acompanha o processo de decisão e a oportunidade de seleção, não apenas as linhas que sobrevivem até chegar a um artigo ou painel
FWER e FDR controlam perdas diferentes
A taxa de erro familiar é a probabilidade de fazer pelo menos uma rejeição falsa dentro da família
A taxa de descobertas falsas é E[V/max(R,1)], em que V é o número de rejeições falsas e R é o número total de rejeições
FWER é mais rigorosa quando qualquer afirmação falsa é custosa; FDR costuma ter mais poder quando a triagem de muitos candidatos tolera uma parcela falsa controlada
Os procedimentos precisam de suas premissas
Bonferroni testa cada hipótese a α/m e controla a FWER sem exigir independência, embora possa ser conservador
O método step-down de Holm também controla a FWER e nunca é menos poderoso que a regra básica de rejeição de Bonferroni
Benjamini–Hochberg ordena os valores-p e controla a FDR sob independência e determinadas formas de dependência positiva; outras estruturas de dependência exigem métodos justificados
Valores ajustados não são probabilidades posteriores de verdade
Um valor-p ajustado é o menor nível de erro familiar no qual uma hipótese seria rejeitada sob um procedimento escolhido
Um q-valor é comumente interpretado como um limiar mínimo estimado de FDR para classificar um resultado como descoberta, sujeito ao método e às premissas
Nenhuma dessas quantidades é automaticamente a probabilidade de que uma estratégia selecionada seja falsa; isso exige outro modelo e outra afirmação de condicionamento
As finanças escondem uma grande família adaptativa
Mineração de fatores, regras técnicas, sinais de opções, dados alternativos, restrições de portfólio e premissas de custos criam milhares de testes correlacionados
Fatores publicados são selecionados a partir de pesquisas anteriores, então avaliar um novo fator contra um t-estatístico isolado próximo de dois ignora a pressão acumulada por descobertas
Ativos e períodos compartilhados tornam os testes dependentes, enquanto a mudança de regime significa que uma correção pela seleção não pode garantir desempenho econômico futuro
A governança precisa preservar o registro da pesquisa
Registre toda hipótese, versão do código, universo, resultado, transformação, atraso, custo e escolha de parada com um identificador de pesquisa estável
Separe descoberta, confirmação e monitoramento ao vivo; congele as regras confirmatórias e use dados realmente intocados ou uma avaliação prospectiva
Reporte evidências brutas e ajustadas, a definição da família, as premissas de dependência, os tamanhos de efeito, os custos, a estabilidade, as ideias rejeitadas e a deterioração ao vivo
Perguntas frequentes
O que é o problema dos testes múltiplos?
É o aumento das descobertas falsas causado por testar e selecionar entre muitas hipóteses enquanto se julgam os vencedores como se cada teste estivesse sozinho
Qual é a diferença entre FWER e FDR?
FWER controla a probabilidade de pelo menos uma rejeição falsa; FDR controla a proporção falsa esperada entre todas as rejeições
Como Benjamini–Hochberg funciona?
Ele ordena os valores-p, compara-os com limiares dependentes do posto e rejeita até o maior posto que satisfaz o critério sob suas premissas
Controlar a FDR torna uma estratégia de negociação confiável?
Não. Isso trata do erro de seleção dentro de uma família de testes definida, não de mudança de regime, custos, vazamento, risco do modelo ou lucratividade futura