Todos os guias de opções e contratos futuros
Por que um único limiar falha quando pesquisadores testam muitas ideias16 min de leitura

Testes múltiplos e taxa de descobertas falsas em finanças

Entenda comparações múltiplas, erro familiar, taxa de descobertas falsas, Bonferroni, Holm, Benjamini–Hochberg, dependência, q-valores, mineração de fatores, seleção em backtests e governança de pesquisa

Preparado por Mark · Fontes principais abaixo

Resposta direta

Testes múltiplos surgem quando muitas hipóteses, estratégias, fatores, ativos, horizontes ou especificações são pesquisados em conjunto. Mesmo valores-p válidos de testes individuais passam então a produzir vencedores por acaso. A taxa de erro familiar controla a probabilidade de pelo menos uma rejeição falsa, enquanto a taxa de descobertas falsas controla a parcela falsa esperada entre as rejeições sob determinadas premissas. É a família de pesquisa, e não apenas a tabela final, que determina o problema

Mais testes criam mais vencedores por acaso

Se m hipóteses nulas verdadeiras independentes forem testadas ao nível α, a probabilidade de pelo menos uma rejeição falsa será 1−(1−α)^m

Com α=0.05 e m=20, essa probabilidade é de cerca de 64%, embora cada teste individual tenha uma taxa nominal de rejeição falsa de 5%

A dependência altera o cálculo exato, mas não justifica fingir que apenas o vencedor reportado foi testado

A família define a pergunta sobre o erro

Uma família de testes pode incluir todos os fatores, transformações, universos, defasagens, horizontes, filtros, escolhas de modelo e novas execuções considerados para uma única afirmação de pesquisa

Definir a família depois de ver os resultados subestima a multiplicidade e permite que pesquisadores separem testes relacionados até que a correção se torne inofensiva

A família defensável acompanha o processo de decisão e a oportunidade de seleção, não apenas as linhas que sobrevivem até chegar a um artigo ou painel

FWER e FDR controlam perdas diferentes

A taxa de erro familiar é a probabilidade de fazer pelo menos uma rejeição falsa dentro da família

A taxa de descobertas falsas é E[V/max(R,1)], em que V é o número de rejeições falsas e R é o número total de rejeições

FWER é mais rigorosa quando qualquer afirmação falsa é custosa; FDR costuma ter mais poder quando a triagem de muitos candidatos tolera uma parcela falsa controlada

Os procedimentos precisam de suas premissas

Bonferroni testa cada hipótese a α/m e controla a FWER sem exigir independência, embora possa ser conservador

O método step-down de Holm também controla a FWER e nunca é menos poderoso que a regra básica de rejeição de Bonferroni

Benjamini–Hochberg ordena os valores-p e controla a FDR sob independência e determinadas formas de dependência positiva; outras estruturas de dependência exigem métodos justificados

Valores ajustados não são probabilidades posteriores de verdade

Um valor-p ajustado é o menor nível de erro familiar no qual uma hipótese seria rejeitada sob um procedimento escolhido

Um q-valor é comumente interpretado como um limiar mínimo estimado de FDR para classificar um resultado como descoberta, sujeito ao método e às premissas

Nenhuma dessas quantidades é automaticamente a probabilidade de que uma estratégia selecionada seja falsa; isso exige outro modelo e outra afirmação de condicionamento

As finanças escondem uma grande família adaptativa

Mineração de fatores, regras técnicas, sinais de opções, dados alternativos, restrições de portfólio e premissas de custos criam milhares de testes correlacionados

Fatores publicados são selecionados a partir de pesquisas anteriores, então avaliar um novo fator contra um t-estatístico isolado próximo de dois ignora a pressão acumulada por descobertas

Ativos e períodos compartilhados tornam os testes dependentes, enquanto a mudança de regime significa que uma correção pela seleção não pode garantir desempenho econômico futuro

A governança precisa preservar o registro da pesquisa

Registre toda hipótese, versão do código, universo, resultado, transformação, atraso, custo e escolha de parada com um identificador de pesquisa estável

Separe descoberta, confirmação e monitoramento ao vivo; congele as regras confirmatórias e use dados realmente intocados ou uma avaliação prospectiva

Reporte evidências brutas e ajustadas, a definição da família, as premissas de dependência, os tamanhos de efeito, os custos, a estabilidade, as ideias rejeitadas e a deterioração ao vivo

Perguntas frequentes

O que é o problema dos testes múltiplos?

É o aumento das descobertas falsas causado por testar e selecionar entre muitas hipóteses enquanto se julgam os vencedores como se cada teste estivesse sozinho

Qual é a diferença entre FWER e FDR?

FWER controla a probabilidade de pelo menos uma rejeição falsa; FDR controla a proporção falsa esperada entre todas as rejeições

Como Benjamini–Hochberg funciona?

Ele ordena os valores-p, compara-os com limiares dependentes do posto e rejeita até o maior posto que satisfaz o critério sob suas premissas

Controlar a FDR torna uma estratégia de negociação confiável?

Não. Isso trata do erro de seleção dentro de uma família de testes definida, não de mudança de regime, custos, vazamento, risco do modelo ou lucratividade futura

Fontes e leituras adicionais

Guias relacionados