Skip to content
Todos os guias de opções e contratos futuros
Avaliação de previsões direcionais13 min de leitura

Teste de Pesaran–Timmermann: uma previsão direcional acrescenta informação?

Entenda como o teste de Pesaran–Timmermann compara acertos direcionais com uma referência baseada nas proporções de altas observadas e previstas, e por que a dependência serial muda a inferência.

Neste guiaUma taxa de acerto de 64% pode ser fraca ou útil, conforme a referência

Resumo breve

O teste de Pesaran–Timmermann (PT) pergunta se as previsões contêm informação sobre a direção do movimento de um resultado. Para uma previsão binária de alta/baixa, ele compara a taxa de acerto observada com a taxa de concordância implícita pelas proporções de altas realizadas e previstas, consideradas separadamente. Essa referência não é necessariamente 50%. O teste usual também depende de hipóteses sobre a dependência entre as origens das previsões, e a significância estatística não comprova que uma regra de negociação seja lucrativa.

Uma taxa de acerto de 64% pode ser fraca ou útil, conforme a referência

Suponha que o mercado suba em 60% dos dias de uma amostra de avaliação. Um previsor indica “alta” em 70% desses dias. Mesmo que previsões e resultados não tivessem relação, eles ainda coincidiriam com frequência: em alguns dias ambos apontariam alta e, em outros, ambos apontariam baixa. Comparar mecanicamente a taxa de acerto com 50% ignoraria esse desequilíbrio.

O método PT torna essa comparação explícita. Ele pergunta se a direção prevista e a direção realizada coincidem mais vezes do que seria esperado pelas frequências separadas de cada uma sob independência. Esse é um teste de informação preditiva direcional, não uma métrica do tamanho dos retornos, do momento de uma operação ou do valor de uma estratégia completa. Pesaran e Timmermann introduziram o teste de desempenho preditivo usando tabelas de contingência; no caso binário 2×2, o teste é assintoticamente equivalente a testar independência {source:pesaranTimmermannDirectionalTests1992}.

Coloque cada previsão pareada em uma tabela dois por dois

Defina \(Y_t=1\) quando o resultado realizado for classificado como alta e \(Y_t=0\) quando for classificado como baixa. Defina \(Z_t=1\) quando a previsão indicar alta e \(Z_t=0\) quando indicar baixa. Cada linha da avaliação deve parear uma previsão feita na origem \(t\) com o resultado do horizonte que ela pretendia prever.

As quatro células contam os pares alta/alta, alta/baixa, baixa/alta e baixa/baixa. Se \(n_{11}\) e \(n_{00}\) forem as duas células de concordância e \(n\) o número de pares úteis que puderam ser alinhados, a taxa de acerto direcional observada será

\[ \widehat{P}=\frac{n_{11}+n_{00}}{n}. \]

Essa configuração é binária. Defina antes como tratar retorno zero, previsão zero ou uma faixa neutra. Por exemplo, um estudo pode classificar um retorno igual ou inferior a zero como “não alta” e uma previsão igual ou abaixo do seu limite como “não alta”. Também é possível excluir empates, mas isso muda a amostra e a regra precisa ser aplicada de forma consistente. Não conte zero-zero como um terceiro tipo de acerto enquanto usa uma fórmula de referência com duas categorias.

Derive a referência de independência a partir das duas proporções de alta

Seja \(\hat p_y\) a proporção amostral de resultados realizados classificados como alta, e \(\hat p_z\) a proporção amostral de previsões que indicam alta. Se os rótulos reais e previstos fossem independentes, a proporção esperada de concordâncias seria

\[ \widehat{P}^{*}=\hat p_y\hat p_z+(1-\hat p_y)(1-\hat p_z). \]

O primeiro produto é a probabilidade de concordância alta/alta sob independência; o segundo é a probabilidade de concordância baixa/baixa. Portanto, a referência muda conforme as duas proporções marginais e pode ficar acima ou abaixo de 50%. Um modelo que prevê sempre a direção mais comum pode exibir uma taxa de acerto aparentemente boa sem acrescentar informação.

Um caso extremo deixa isso claro. Se um classificador prevê “alta” em todas as datas, então \(\hat p_z=1\), a taxa de acerto observada é igual à proporção real de altas \(\hat p_y\), e a referência de independência também é \(\hat p_y\). O excesso de concordância é zero por construção. Uma previsão constante pode parecer precisa quando altas são comuns, mas não distingue em quais datas o mercado vai subir; a variância estimada também pode ser degenerada, de modo que um valor-p PT convencional talvez nem exista.

Considere 100 dias pareados totalmente hipotéticos. Os resultados reais são de alta em 60 dias, e as previsões indicam alta em 70. Suponha que a tabela seja:

Direção realizadaPrevisão de altaPrevisão de baixaTotal
Alta471360
Baixa231740
Total7030100

Há 64 concordâncias, portanto \(\widehat P=0.64\). A referência de independência é \(0.60\times0.70+0.40\times0.30=0.54\). A taxa de acerto observada está 10 pontos percentuais acima da referência. Essas contagens inventadas apenas ilustram o cálculo; a diferença, sozinha, não é uma estimativa válida de incerteza nem prova de utilidade para negociação.

Padronize a diferença na taxa de acerto pela incerteza estimada

Para a estatística PT binária padrão, defina

\[ \widehat v=\frac{\widehat P^{*}(1-\widehat P^{*})}{n} \]

e

\[ \widehat w=\frac{(2\hat p_y-1)^2\hat p_z(1-\hat p_z)+(2\hat p_z-1)^2\hat p_y(1-\hat p_y)}{n}. \]

Então

\[ PT=\frac{\widehat P-\widehat P^{*}}{\sqrt{\widehat v-\widehat w}}. \]

Sob a hipótese nula e as hipóteses usuais de grandes amostras, a distribuição de referência dessa estatística é assintoticamente normal padrão. O numerador é a concordância excedente em relação à referência de independência. O denominador considera que essa referência é estimada na própria amostra, em vez de tratá-la como um alvo fixo de 50%. A fórmula e a notação estão documentadas na implementação do statsmodels {source:statsmodelsPesaranTimmermannAPI}.

A expressão acima é a forma assintótica principal da variância documentada pelo statsmodels. A variância delta mais completa para amostras finitas, apresentada no tratamento original, acrescenta \(4\hat p_y\hat p_z(1-\hat p_y)(1-\hat p_z)/n^2\) a \(\widehat w\). Esse termo de ordem menor não altera a assintótica de primeira ordem, mas pode deslocar uma estatística em amostras finitas. Quando os resultados dependerem da implementação, informe a fórmula e a versão do software usada, em vez de comparar valores-p como se todos os pacotes fizessem o mesmo cálculo para amostras finitas.

A fórmula não corrige um desenho fraco. Uma amostra muito pequena, previsões quase constantes, células vazias ou uma variância estimada nula ou inválida podem tornar a aproximação usual pouco confiável ou indefinida. Nesses casos, não force um valor-p a partir da expressão; informe as proporções marginais e a tabela e escolha um procedimento de inferência adequado aos dados e ao tamanho da amostra.

Para a tabela hipotética acima, os componentes pela fórmula principal são \(\widehat v=0.54(0.46)/100=0.002484\) e \(\widehat w=[0.2^2(0.7)(0.3)+0.4^2(0.6)(0.4)]/100=0.000468\). O erro padrão é \(\sqrt{0.002484-0.000468}\approx0.0449\), portanto \(PT\approx0.10/0.0449=2.23\). A referência normal padrão bilateral produz um valor-p próximo de 0.026. Esse é um cálculo de contagens inventadas pela fórmula assintótica principal; o termo mais completo para amostra finita altera um pouco o valor, e a dependência serial pode invalidar a referência normal. Não apresente isso como resultado empírico.

<!-- Posicionamento da ilustração: após esta seção; imagem conceitual original sem texto mostrando previsões e resultados direcionais pareados, concordâncias e divergências, e proporções direcionais marginais diferentes. -->

Diagrama conceitual 2×2 das direções previstas e realizadas, com setas pareadas em cobre e verde-azulado indicando concordâncias, divergências e proporções marginais distintas.
A ilustração mostra como as direções previstas e realizadas podem concordar ou divergir e como as proporções marginais diferem; é um esquema conceitual, não dado empírico.

Leia a rejeição como evidência sobre direção, não como veredito de negociação

Um numerador positivo significa que as direções observadas concordam mais do que a referência de independência; um valor negativo significa que concordam menos. Um teste unilateral definido antecipadamente pode perguntar se a concordância supera a referência. Um teste bilateral pergunta se a associação direcional difere em qualquer sentido. Escolha a hipótese alternativa e o nível de significância antes de olhar os resultados.

Um valor-p pequeno é evidência contra a hipótese nula especificada, sob as hipóteses do teste. Não é a probabilidade de a hipótese nula ser verdadeira, nem a probabilidade de a previsão funcionar no próximo período. Também não informa se os retornos foram grandes o suficiente para cobrir spread, taxas, impacto de mercado, funding ou custos de empréstimo. O teste tampouco corrige a tentativa de muitos ativos, horizontes, limites, variantes de modelo ou sinais de previsão seguida do relato apenas do vencedor. Se houve busca por estratégias candidatas, o [guia do White Reality Check](/pt-BR/learn/white-reality-check-data-snooping-strategy-backtest-explained) explica por que a seleção precisa ser considerada na inferência.

Por outro lado, não rejeitar não prova que as direções real e prevista sejam independentes. Uma amostra curta ou desequilibrada pode ter pouco poder para detectar uma associação. Um numerador PT negativo também não prova que a previsão não contenha estrutura alguma; pode indicar discordância sistemática. Inverter o sinal da previsão depois de observar esse resultado é uma nova escolha de modelo e precisa ser avaliada com dados novos ou incluída no procedimento de busca original.

Informe em conjunto a proporção real de altas, a proporção prevista de altas, a taxa de acerto observada, a referência de independência, o aumento em pontos percentuais, a hipótese alternativa e o método de estimativa da incerteza. Um valor-p sem as margens da tabela e o tamanho do efeito dificulta distinguir um aumento pequeno, mas estimado com precisão, de um aumento maior e incerto.

A dependência serial pode tornar enganosa a distribuição de referência dos livros

A estatística PT comum costuma ser apresentada para observações direcionais independentes ao longo do tempo. No entanto, rótulos financeiros podem ocorrer em sequências. Observações diárias podem compartilhar alvos sobrepostos de vários dias; regimes de volatilidade podem persistir; e previsões móveis podem reutilizar quase todos os mesmos dados de estimação. Nesse caso, os \(n\) pares não são \(n\) unidades independentes de informação. O erro padrão usual pode ficar pequeno demais e levar a rejeições em excesso.

Em um trabalho posterior, Pesaran e Timmermann desenvolveram testes de dependência entre variáveis multicategóricas serialmente correlacionadas, usando regressões ampliadas dinamicamente e um esquema de Markov de ordem finita {source:pesaranTimmermannSerialCategories2009}. Estudos sobre previsões direcionais também concluem que procedimentos PT convencionais baseados em independência podem rejeitar demais na presença de correlação serial e analisam alternativas robustas à dependência, incluindo métodos bootstrap {source:blaskowitzHerwartzDirectionalSerialCorrelation2014}. O método adequado depende de como as previsões são geradas, do horizonte e da estrutura de dependência; uma receita genérica de reamostragem não é automaticamente válida.

Informe se as origens das previsões se sobrepõem, qual é o intervalo entre elas e qual método de dependência fornece a estimativa de incerteza. Se relatar a estatística dos livros como referência descritiva, identifique a hipótese de independência. Não interprete um resultado nominal de 5% como se a taxa real de falsas rejeições também fosse 5% quando o desenho viola essa hipótese.

Estruture a avaliação em torno de previsões que poderiam ter sido feitas

Para cada origem, preserve a previsão exatamente como estava disponível naquele momento, o horizonte, o limite de informação, o resultado realizado e a regra que transforma cada um em um rótulo de alta/baixa. Alinhe datas e horários, instrumentos, definição de preço ou retorno e tratamento de dados ausentes antes de formar a tabela. Uma previsão que usa dados macroeconômicos revisados ou um sinal ajustado no período de avaliação não é uma previsão out-of-sample intacta.

Escolha o limite de classificação antes de ver os resultados de holdout. Se um modelo emitir uma probabilidade, o limite a converte em direção binária; buscar limites na mesma amostra muda a pergunta e cria viés de seleção. Mantenha separados os papéis de treino, validação e avaliação final. Em qualquer reamostragem que pretenda considerar a busca de modelos, repita todo o processo de seleção dentro de cada amostra reamostrada.

A pergunta do PT difere da comparação da magnitude dos erros de previsão. O [guia de Diebold–Mariano](/pt-BR/learn/diebold-mariano-forecast-accuracy-test-explained) compara diferenças pareadas de perdas, enquanto o [guia de Giacomini–White](/pt-BR/learn/giacomini-white-conditional-predictive-ability-test-explained) pergunta se a capacidade preditiva relativa varia com informações definidas previamente. Para modelos de previsão aninhados, consulte o [guia do ajuste Clark–West](/pt-BR/learn/clark-west-test-nested-forecast-accuracy-adjustment-explained). Esses testes respondem a perguntas diferentes e não devem ser trocados só porque retornam estatísticas conhecidas.

Significância direcional não comprova uma estratégia lucrativa

O teste PT reduz cada resultado a um rótulo de direção. Uma alta de um tick e uma grande valorização contam como alta; um pequeno erro de direção e uma perda severa contam igualmente como um erro direcional. Assim, uma previsão pode elevar a taxa de acerto e ainda perder dinheiro se os erros forem maiores que os ganhos, se o sinal chegar depois do movimento do preço ou se os custos de negociação consumirem a vantagem.

Por exemplo, imagine 100 operações hipotéticas de mesmo tamanho: 64 direções corretas rendem em média 0,10% cada, enquanto 36 direções incorretas perdem em média 0,25% cada. A soma bruta simples é \(64(0.10\%)-36(0.25\%)=-2.6\) pontos percentuais antes dos custos, apesar de uma taxa de acerto de 64%. Essa conta deliberadamente simplificada ignora a capitalização e não é evidência de mercado; ela mostra por que a taxa de acerto, sozinha, não determina a expectativa de retorno.

Perguntas frequentes

Q1O teste de Pesaran–Timmermann compara a acurácia com 50%?

Não. Ele compara a concordância observada com a referência de independência calculada a partir das proporções separadas de altas reais e previstas. Essa referência pode ficar acima ou abaixo de 50%.

Q2Posso usar o valor-p PT usual quando os horizontes de previsão se sobrepõem?

Não sem tratar a dependência. Alvos sobrepostos e rótulos direcionais persistentes podem tornar pequena demais a estimativa de incerteza baseada em independência. Use um método cujas hipóteses sejam adequadas ao horizonte e à estrutura de dependência.

Q3Um resultado PT significativo significa que a estratégia de negociação é lucrativa?

Não. O teste usa rótulos direcionais e não mede o tamanho dos movimentos, os preços de entrada e saída, o tamanho da posição, taxas, slippage ou funding. Avalie separadamente os retornos líquidos fora da amostra.

Fontes e leituras adicionais

Relatar um problema

Vamos preparar um e-mail com o link deste artigo. Mark só receberá o relato depois que você enviar

Verificação rápida

Terminou o guia? Confira o que aprendeu com 3 perguntas

Pergunta 1 / 3

Pergunta 01

Se os resultados reais sobem em 60% das vezes e as previsões indicam alta em 70%, qual é a referência de concordância sob independência?

Escolha uma resposta para ver a explicação

Glossário de opções

Definições claras dos termos essenciais, de calls, puts e cadeia de opções a IV, gregas e spread bid-ask

Ver o glossário de opções