Skip to content
Tutte le guide sulle opzioni
Valutazione delle previsioni direzionali13 min di lettura

Test di Pesaran–Timmermann: una previsione direzionale aggiunge informazione?

Scopri come il test di Pesaran–Timmermann confronta le direzioni corrette con un riferimento basato sulle frequenze di rialzo osservate e previste, e perché la dipendenza seriale cambia l’inferenza.

In questa guidaUn tasso di successo del 64% può essere modesto o utile a seconda del riferimento

Breve sintesi

Il test di Pesaran–Timmermann (PT) chiede se le previsioni contengono informazioni sulla direzione in cui si muove un esito. Per una previsione binaria rialzo/ribasso, confronta la quota di previsioni corrette osservata con la quota di concordanza implicata separatamente dalle frequenze di rialzo effettive e previste. Questo riferimento non è necessariamente pari al 50%. Il test usuale dipende inoltre da ipotesi sulla dipendenza tra le origini delle previsioni, e la significatività statistica non dimostra che una regola di trading sia redditizia.

Un tasso di successo del 64% può essere modesto o utile a seconda del riferimento

Supponiamo che il mercato salga nel 60% delle date di un campione di valutazione. Un previsore indica “rialzo” nel 70% di quelle date. Anche se previsioni ed esiti non fossero collegati, spesso coinciderebbero: in alcune date entrambi indicherebbero un rialzo, in altre entrambi un ribasso. Confrontare meccanicamente il tasso di successo con il 50% ignorerebbe questo squilibrio.

Il quadro PT rende esplicito il confronto. Chiede se la direzione prevista e quella realizzata coincidono più spesso di quanto implichino le loro frequenze separate in caso di indipendenza. È un test dell’informazione predittiva sulla direzione, non un punteggio per l’entità dei rendimenti, il momento di un’operazione o il valore di una strategia nel suo complesso. Pesaran e Timmermann introdussero il test di capacità predittiva usando tabelle di contingenza; nel caso binario 2×2 il test è asintoticamente equivalente a un test di indipendenza {source:pesaranTimmermannDirectionalTests1992}.

Inserisci ogni previsione abbinata in una tabella due per due

Sia \(Y_t=1\) se l’esito realizzato è classificato come rialzo e \(Y_t=0\) se è classificato come ribasso. Sia \(Z_t=1\) se la previsione indica un rialzo e \(Z_t=0\) se indica un ribasso. Ogni riga della valutazione deve abbinare una previsione formulata all’origine \(t\) con l’esito dell’orizzonte che quella previsione intendeva anticipare.

Le quattro celle contano gli abbinamenti rialzo/rialzo, rialzo/ribasso, ribasso/rialzo e ribasso/ribasso. Se \(n_{11}\) e \(n_{00}\) sono le due celle concordanti e \(n\) è il numero di coppie utilizzabili effettivamente abbinate, il tasso di successo direzionale osservato è

\[ \widehat{P}=\frac{n_{11}+n_{00}}{n}. \]

Questa impostazione è binaria. Decidi in anticipo come trattare un rendimento nullo, una previsione pari a zero o una fascia neutrale. Per esempio, uno studio potrebbe classificare un rendimento pari o inferiore a zero come “non rialzo” e una previsione pari o inferiore alla propria soglia nello stesso modo. È anche possibile escludere i valori di parità, ma ciò modifica il campione e la regola va applicata con coerenza. Non contare lo zero-zero come un terzo tipo di concordanza usando al tempo stesso una formula di riferimento a due categorie.

Ricava il riferimento di indipendenza dalle due frequenze di rialzo

Sia \(\hat p_y\) la quota campionaria degli esiti realizzati classificati come rialzo e \(\hat p_z\) la quota campionaria delle previsioni di rialzo. Se le etichette effettive e previste fossero indipendenti, la quota attesa di concordanze sarebbe

\[ \widehat{P}^{*}=\hat p_y\hat p_z+(1-\hat p_y)(1-\hat p_z). \]

Il primo prodotto è la probabilità di concordanza rialzo/rialzo in caso di indipendenza; il secondo è quella della concordanza ribasso/ribasso. Il riferimento dipende quindi da entrambe le frequenze marginali e può superare o essere inferiore al 50%. Un modello che prevede sempre la direzione più frequente può mostrare un tasso di successo apparentemente rispettabile senza aggiungere informazione.

Un caso estremo lo rende evidente. Se un classificatore indica sempre “rialzo”, allora \(\hat p_z=1\), il tasso di successo osservato coincide con la quota di rialzi effettivi \(\hat p_y\) e anche il riferimento di indipendenza è \(\hat p_y\). L’accordo in eccesso è zero per costruzione. Una previsione costante può sembrare accurata quando i rialzi sono frequenti, ma non distingue le date in cui il mercato salirà; inoltre, la varianza stimata può essere degenere e il p-value PT convenzionale potrebbe non esistere.

Consideriamo 100 date abbinate e ipotetiche. Gli esiti effettivi sono rialzi in 60 date e le previsioni indicano un rialzo in 70. Supponiamo che la tabella sia:

Direzione realizzataPrevisione rialzoPrevisione ribassoTotale
Rialzo471360
Ribasso231740
Totale7030100

Le concordanze sono 64, quindi \(\widehat P=0.64\). Il riferimento di indipendenza è \(0.60\times0.70+0.40\times0.30=0.54\). Il tasso di successo osservato supera il riferimento di 10 punti percentuali. Questi conteggi inventati servono soltanto a illustrare il calcolo; la differenza da sola non è una stima valida dell’incertezza né una prova di utilità nel trading.

Scala lo scarto del tasso di successo per la sua incertezza stimata

Per la statistica PT binaria standard, definiamo

\[ \widehat v=\frac{\widehat P^{*}(1-\widehat P^{*})}{n} \]

e

\[ \widehat w=\frac{(2\hat p_y-1)^2\hat p_z(1-\hat p_z)+(2\hat p_z-1)^2\hat p_y(1-\hat p_y)}{n}. \]

Quindi

\[ PT=\frac{\widehat P-\widehat P^{*}}{\sqrt{\widehat v-\widehat w}}. \]

Sotto l’ipotesi nulla e le consuete ipotesi di grande campione, la distribuzione di riferimento di questa statistica è asintoticamente normale standard. Il numeratore è la concordanza in eccesso rispetto al riferimento di indipendenza. Il denominatore tiene conto del fatto che il riferimento è stimato sullo stesso campione, anziché essere trattato come un obiettivo fisso del 50%. La formula e la notazione sono documentate nell’implementazione statsmodels {source:statsmodelsPesaranTimmermannAPI}.

L’espressione sopra è la forma asintotica principale della varianza documentata da statsmodels. La formula delta più completa per campioni finiti presentata nel lavoro originale aggiunge \(\,4\hat p_y\hat p_z(1-\hat p_y)(1-\hat p_z)/n^2\,\) a \(\widehat w\). Questo termine di ordine inferiore non cambia l’asintotica del primo ordine, ma può spostare una statistica in un campione finito. Se i risultati dipendono dall’implementazione, indica la formula e la versione del software utilizzate invece di confrontare i p-value come se ogni pacchetto applicasse lo stesso identico calcolo per campioni finiti.

La formula non corregge un disegno debole. Un campione minuscolo, previsioni quasi costanti, celle vuote o una varianza stimata nulla o non valida possono rendere l’approssimazione usuale inaffidabile o non definita. In questi casi non forzare un p-value nell’espressione; riporta le frequenze marginali e la tabella e scegli una procedura d’inferenza adatta ai dati e alla numerosità campionaria.

Per la tabella ipotetica sopra, i componenti secondo la formula principale sono \(\widehat v=0.54(0.46)/100=0.002484\) e \(\widehat w=[0.2^2(0.7)(0.3)+0.4^2(0.6)(0.4)]/100=0.000468\). L’errore standard è \(\sqrt{0.002484-0.000468}\approx0.0449\), quindi \(PT\approx0.10/0.0449=2.23\). Il riferimento normale standard bilaterale dà un p-value vicino a 0.026. È un calcolo su conteggi inventati con la formula asintotica principale; il termine più completo per campioni finiti modifica leggermente il valore e la dipendenza seriale può invalidare il riferimento normale. Non presentarlo come risultato empirico.

Schema concettuale 2×2 delle direzioni previste e realizzate, con frecce abbinate color rame e verde acqua che indicano concordanze, discordanze e quote marginali diverse.
L’illustrazione mostra come le direzioni previste e realizzate possano concordare o divergere e come cambino le quote marginali; è uno schema concettuale, non un dato empirico.

Interpreta il rifiuto come evidenza sulla direzione, non come verdetto di trading

Un numeratore positivo indica che le direzioni osservate coincidono più spesso del riferimento di indipendenza; un valore negativo indica il contrario. Un test unilaterale definito in anticipo può chiedere se la concordanza supera il riferimento. Un test bilaterale chiede se l’associazione direzionale differisce in una delle due direzioni. L’ipotesi alternativa e il livello di significatività vanno scelti prima di esaminare i risultati.

Un p-value piccolo è un’evidenza contro l’ipotesi nulla dichiarata, sotto le assunzioni del test. Non è la probabilità che l’ipotesi nulla sia vera né la probabilità che la previsione funzioni nel periodo successivo. Non indica che i rendimenti siano stati sufficienti a coprire spread, commissioni, impatto di mercato, funding o costi di prestito. Inoltre, non corregge il fatto di aver provato molti asset, orizzonti, soglie, varianti del modello o segni previsti e di riportare poi soltanto il vincitore. Se sono state cercate strategie candidate, la guida al White Reality Check spiega perché la selezione va inclusa nell’inferenza.

Al contrario, non rifiutare l’ipotesi nulla non dimostra che le direzioni effettive e previste siano indipendenti. Un campione breve o sbilanciato può avere poca potenza per rilevare un’associazione. Anche un numeratore PT negativo non dimostra che la previsione sia del tutto priva di struttura: può indicare una discordanza sistematica. Invertire il segno della previsione dopo aver visto il risultato è una nuova scelta di modello e va valutata su dati nuovi oppure inclusa nella procedura di ricerca iniziale.

Riporta insieme la quota di rialzi effettivi, la quota di rialzi previsti, il tasso di successo osservato, il riferimento di indipendenza, lo scarto in punti percentuali, l’ipotesi alternativa e il metodo usato per stimare l’incertezza. Un p-value senza i margini della tabella e senza una misura dell’effetto rende difficile distinguere uno scarto piccolo ma stimato con precisione da uno più ampio ma incerto.

La dipendenza seriale può rendere fuorviante la distribuzione di riferimento da manuale

La statistica PT ordinaria viene di solito presentata per osservazioni direzionali indipendenti nel tempo. Le etichette finanziarie possono invece presentarsi in sequenze. Osservazioni giornaliere possono condividere target sovrapposti a più giorni; i regimi di volatilità possono persistere; e le previsioni rolling possono riutilizzare quasi tutti gli stessi dati di stima. In tal caso le \(n\) coppie non rappresentano \(n\) informazioni indipendenti. L’errore standard usuale può essere troppo piccolo e portare a rifiutare troppo spesso l’ipotesi nulla.

In seguito Pesaran e Timmermann hanno sviluppato test di dipendenza per variabili multicategoria serialmente correlate, basati su regressioni aumentate dinamicamente e su un quadro di Markov di ordine finito {source:pesaranTimmermannSerialCategories2009}. Studi focalizzati sulle previsioni direzionali rilevano inoltre che le procedure PT convenzionali basate sull’indipendenza possono essere sovradimensionate in presenza di correlazione seriale e analizzano alternative robuste alla dipendenza, compresi metodi bootstrap {source:blaskowitzHerwartzDirectionalSerialCorrelation2014}. Il metodo appropriato dipende da come sono generate le previsioni, dall’orizzonte e dalla struttura di dipendenza; una ricetta generica di ricampionamento non è automaticamente valida.

Dichiara se le origini delle previsioni si sovrappongono, quanto sono distanziate e quale metodo che considera la dipendenza fornisce la stima dell’incertezza. Se riporti la statistica da manuale come riferimento descrittivo, segnala l’ipotesi di indipendenza. Non interpretare un risultato nominale al 5% come se il tasso di falsi rifiuti fosse davvero del 5% quando il disegno viola quell’ipotesi.

Costruisci la valutazione usando previsioni che si sarebbero potute formulare

Per ogni origine conserva la previsione esattamente come era disponibile allora, l’orizzonte, il cutoff informativo, l’esito realizzato e la regola che trasforma ciascuno dei due in un’etichetta rialzo/ribasso. Allinea timestamp, strumenti, definizione di prezzo o rendimento e trattamento dei valori mancanti prima di formare la tabella. Una previsione basata su dati macroeconomici rivisti o su un segnale ottimizzato nel periodo di valutazione non è una previsione out-of-sample intatta.

Scegli la soglia di classificazione prima di osservare i risultati holdout. Se un modello produce una probabilità, la soglia la converte in una direzione binaria; cercare la soglia sullo stesso campione cambia la domanda e crea distorsione da selezione. Tieni separati i ruoli di training, validazione e valutazione finale; nei ricampionamenti destinati a considerare la ricerca del modello, ripeti l’intero processo di selezione all’interno di ogni campione ricampionato.

La domanda PT è diversa dal confronto dell’entità degli errori di previsione. La guida Diebold–Mariano confronta differenze di perdita appaiate, mentre la guida Giacomini–White chiede se la capacità predittiva relativa varia in funzione di informazioni prestabilite. Per modelli previsivi annidati, consulta la guida alla correzione Clark–West. Questi test rispondono a domande diverse e non vanno sostituiti l’uno all’altro solo perché producono statistiche familiari.

La significatività direzionale non dimostra la redditività di una strategia

Il test PT riduce ogni esito a un’unica etichetta direzionale. Un rialzo di un tick e un rally ampio contano entrambi come rialzo; un errore minimo e una perdita grave contano entrambi come un errore di direzione. Una previsione può quindi aumentare il tasso di successo e perdere comunque denaro se gli errori sono più grandi dei guadagni, il segnale arriva dopo il movimento dei prezzi o i costi di trading consumano il vantaggio.

Per esempio, immaginiamo 100 operazioni ipotetiche di uguale dimensione: 64 direzioni corrette producono un guadagno medio dello 0,10% ciascuna, mentre 36 direzioni errate comportano una perdita media dello 0,25% ciascuna. La somma lorda semplice è \(64(0.10\%)-36(0.25\%)=-2.6\) punti percentuali prima dei costi, nonostante un tasso di successo del 64%. Questo calcolo volutamente semplificato ignora la capitalizzazione e non è una prova di mercato; mostra perché il solo tasso di successo non determina il valore atteso.

Domande frequenti

Q1Il test di Pesaran–Timmermann confronta l’accuratezza con il 50%?

No. Confronta la concordanza osservata con il riferimento di indipendenza calcolato dalle quote separate di rialzi realizzati e previsti. Il riferimento può essere superiore o inferiore al 50%.

Q2Posso usare il p-value PT usuale quando gli orizzonti previsivi si sovrappongono?

Non senza considerare la dipendenza. Target sovrapposti ed etichette persistenti possono rendere troppo piccola la stima dell’incertezza basata sull’indipendenza. Usa un metodo le cui assunzioni corrispondano all’orizzonte e alla struttura di dipendenza.

Q3Un risultato PT significativo significa che la strategia di trading è redditizia?

No. Il test usa etichette direzionali e non misura l’entità dei movimenti, i prezzi di ingresso e uscita, la dimensione delle posizioni, commissioni, slippage o funding. Valuta separatamente i rendimenti netti fuori campione.

Fonti e approfondimenti

Segnala un problema

Prepareremo un’e-mail con il link a questo articolo. Mark riceverà la segnalazione solo dopo l’invio

Controllo rapido

Hai finito la guida? Verifica ciò che hai capito con 3 domande

Domanda 1 / 3

Domanda 01

Se gli esiti realizzati sono rialzi nel 60% dei casi e le previsioni indicano rialzi nel 70%, qual è il riferimento di concordanza sotto indipendenza?

Scegli una risposta per vedere la spiegazione

Glossario delle opzioni

Definizioni chiare dei termini essenziali, da call, put e catene di opzioni a IV, greche, interesse aperto e max pain

Sfoglia il glossario delle opzioni