P-valor e significância estatística em finanças
Entenda p-valores, hipóteses nulas, estatísticas de teste, níveis de significância, erros Tipo I e Tipo II, poder, tamanho do efeito, parada opcional, vasculhamento de dados e interpretação financeira
Resposta direta
Um p-valor é a probabilidade, sob um modelo nulo e um plano de análise especificados, de obter uma estatística de teste pelo menos tão incompatível com esse modelo quanto a observada. Ele não é a probabilidade de a hipótese nula ser verdadeira, a probabilidade de um resultado ter ocorrido por acaso nem o tamanho ou a importância econômica de um efeito. Significância estatística é uma regra de decisão, não uma prova
Um teste começa antes do p-valor
Especifique as hipóteses nula e alternativa, a estatística de teste, o modelo amostral, a regra de parada, a direção da cauda e o nível de significância antes de examinar o resultado
A hipótese nula frequentemente representa nenhum efeito ou um valor de referência, mas também pode ser composta e conter parâmetros de incômodo que exigem estimação
Mudar o universo, o horizonte, os controles, a regra de outliers ou o teste depois de ver os dados muda o experimento cujo p-valor está sendo interpretado
O p-valor é condicional a um modelo
Sob a hipótese nula, a estatística de teste tem uma distribuição de referência; o p-valor mede até onde a estatística observada entra em sua cauda relevante
Um valor pequeno indica incompatibilidade entre os dados e o conjunto completo do modelo nulo, não qual hipótese falhou nem se a alternativa é verdadeira
Dependência mal especificada, caudas pesadas, heterocedasticidade, erros nos dados ou seleção podem tornar inválidos a distribuição de referência e o p-valor
Limites de significância definem regras de erro
Um nível α pré-especificado limita a probabilidade de rejeitar uma hipótese nula verdadeira sob as hipóteses do teste, não a proporção de afirmações publicadas que são falsas
Erro Tipo I é rejeição falsa; erro Tipo II é não rejeitar uma hipótese nula falsa, e poder é a probabilidade de rejeição sob uma alternativa especificada
Não rejeitar não prova que não existe efeito, especialmente quando a amostra tem pouco poder para alternativas economicamente relevantes
Tamanho do efeito e incerteza respondem a perguntas diferentes
Amostras grandes podem tornar efeitos minúsculos estatisticamente significativos, enquanto amostras pequenas e ruidosas podem deixar de detectar efeitos grandes o suficiente para importar
Informe uma estimativa do efeito, um intervalo, unidades, custos de transação, capacidade e um limite prático junto com o p-valor
Resultados logo acima e abaixo de 0.05 normalmente fornecem evidências semelhantes; transformar esse limite em um interruptor rígido de verdade descarta informação
Flexibilidade da pesquisa distorce a significância
Parada opcional, tentativa de muitas especificações, remoção de observações, troca de resultados e publicação apenas de testes bem-sucedidos alteram o comportamento dos falsos positivos
O p-valor nominal é válido apenas para o caminho de análise que o gerou, incluindo regras sequenciais legítimas ou ajustes declarados antecipadamente
Pré-registro, diários completos de pesquisa, análise multiverso, amostras de retenção intocadas e replicação expõem a sensibilidade, mas não consertam um modelo errado
A dependência financeira enfraquece os testes de livro-texto
Retornos podem ser autocorrelacionados, dependentes entre seções transversais, heterocedásticos, sobrepostos e condicionados a um universo selecionado que sobreviveu
Erros-padrão iid ingênuos podem exagerar estatísticas t, enquanto descoberta repetida de fatores e backtests criam uma família de testes implícita muito maior
Use erros-padrão e reamostragem justificados pela estrutura de séries temporais; depois teste a estabilidade entre regimes, ativos, custos, atrasos e dados ao vivo
A evidência deve apoiar uma decisão
Trate o p-valor como um diagnóstico contínuo entre tamanho do efeito, incerteza, evidência anterior, mecanismo, desempenho preditivo e custos de decisão
Defina antecipadamente qual erro importa: um sinal falso de operação, uma exposição de risco não identificada, um hedge instável ou um modelo promovido sem valor econômico
Informe a família completa de análises e as replicações malsucedidas para que um único resultado significativo selecionado não seja confundido com a força do programa de pesquisa
Perguntas frequentes
O que significa um p-valor de 0.05?
Sob o modelo nulo especificado, resultados pelo menos tão incompatíveis quanto a estatística de teste observada ocorrem com probabilidade 0.05
Um p abaixo de 0.05 prova a hipótese alternativa?
Não. Ele não atribui probabilidade às hipóteses nem elimina especificação incorreta, seleção, erros nos dados ou um efeito economicamente trivial
Um p acima de 0.05 prova que não existe efeito?
Não. Significa que o teste não rejeitou naquele limite e pode refletir baixo poder, ruído, um modelo inadequado ou um efeito realmente pequeno
Por que p-valores financeiros são frequentemente exagerados?
Dependência, buscas repetidas por estratégias, especificações flexíveis, amostras selecionadas e custos irrealistas podem fazer a evidência nominal parecer mais forte do que é