Skip to content
所有選擇權指南
方向預測評估13 分鐘閱讀

Pesaran–Timmermann 檢定:方向預測是否提供額外資訊?

了解 Pesaran–Timmermann 檢定如何將方向命中率與依據實際上漲比例及預測上漲比例計算的基準比較,以及序列相依為何會改變統計推論。

本指南內容64% 的命中率好不好,取決於比較基準

簡短摘要

Pesaran–Timmermann(PT)檢定探討的是:預測是否包含結果變動方向的資訊。對於二元的上漲/下跌預測,檢定會將觀察到的方向命中率,與分別根據實際上漲比例及預測上漲比例推導出的符合率比較。這個基準不一定是 50%。一般檢定也仰賴預測起點之間相依性的假設;統計顯著性本身並不能證明交易規則具有獲利能力。

64% 的命中率好不好,取決於比較基準

假設市場在評估樣本的 60% 日期上漲。預測者在其中 70% 的日期預測「上漲」。即使預測與結果毫無關聯,兩組方向仍會經常一致:有些日期兩者都指向上漲,有些日期則都指向下跌。直接把命中率與 50% 比較,會忽略這種不平衡。

PT 架構明確定義這項比較:預測方向與實際方向的吻合頻率,是否高於兩者各自的邊際頻率在獨立假設下所暗示的程度。這是方向預測資訊的檢定,不是衡量報酬幅度、交易時點或整體策略價值的分數。Pesaran 與 Timmermann 提出使用列聯表的預測績效檢定;在二元 2×2 情況下,他們的檢定與獨立性檢定漸近等價 {source:pesaranTimmermannDirectionalTests1992}。

將每組配對的預測與結果放入 2×2 表格

若實際結果分類為上漲,令 \(Y_t=1\);若分類為下跌,令 \(Y_t=0\)。若預測為上漲,令 \(Z_t=1\);若預測為下跌,令 \(Z_t=0\)。每一筆評估資料都應將 \(t\) 時點產生的預測,與該預測所針對期間的實際結果配對。

四個儲存格分別計算上漲/上漲、上漲/下跌、下跌/上漲和下跌/下跌的配對數。若 \(n_{11}\) 與 \(n_{00}\) 是兩個一致的儲存格,而 \(n\) 是可用的配對數,觀察到的方向命中率為

\[ \widehat{P}=\frac{n_{11}+n_{00}}{n}. \]

這個設定只有兩種類別。請事先決定如何處理零報酬、零預測或中性區間。例如,研究可以將報酬小於或等於零分類為「未上漲」,也可以將預測小於或等於其門檻值分類為「未上漲」。排除平手也是一種可能規則,但會改變樣本,且必須一致套用。使用二分類基準公式時,不要把零對零算成第三種一致情況。

預測起點與目標期間也必須一致。如果 \(Z_t\) 預測接下來五個交易日報酬的正負號,\(Y_t\) 就應標示同一起點之後相同五日報酬,而不是隔日的一日報酬;否則表格配對的是不同事件。每天產生的預測即使對應彼此重疊的五日目標,仍可納入描述性表格,但會產生下文提到的相依問題。

從兩種上漲比例推導獨立基準

令 \(\hat p_y\) 為實際結果分類為上漲的樣本比例,\(\hat p_z\) 為預測為上漲的樣本比例。如果實際標籤與預測標籤彼此獨立,預期的一致比例為

\[ \widehat{P}^{*}=\hat p_y\hat p_z+(1-\hat p_y)(1-\hat p_z). \]

第一個乘積是在獨立情況下上漲/上漲的一致機率;第二個乘積則是下跌/下跌的一致機率。因此,基準會隨兩個邊際比例改變,可能高於或低於 50%。總是預測較常出現方向的模型,即使沒有提供資訊,命中率看起來也可能不低。

極端情況可以讓這點更清楚。如果分類器每個日期都預測「上漲」,那麼 \(\hat p_z=1\),觀察到的命中率就是實際上漲比例 \(\hat p_y\),而獨立基準也同樣是 \(\hat p_y\)。超額一致率依定義為零。這種固定預測在上漲常見時可能看似準確,卻無法分辨哪些日期真的會上漲;估計變異數也可能退化,導致一般的 PT p 值不存在。

考慮 100 個假設配對日期。實際結果有 60 天上漲,預測有 70 天看漲。列聯表如下:

實際方向預測上漲預測下跌合計
上漲471360
下跌231740
合計7030100

共有 64 組一致,因此 \(\widehat P=0.64\)。獨立基準為 \(0.60\times0.70+0.40\times0.30=0.54\)。觀察到的命中率比基準高 10 個百分點。這些虛構數字僅用來說明計算;差距本身不是有效的不確定性估計,也不能證明交易有效。

用估計的不確定性標準化命中率差距

對標準二元 PT 統計量,定義

\[ \widehat v=\frac{\widehat P^{*}(1-\widehat P^{*})}{n} \]

以及

\[ \widehat w=\frac{(2\hat p_y-1)^2\hat p_z(1-\hat p_z)+(2\hat p_z-1)^2\hat p_y(1-\hat p_y)}{n}. \]

則

\[ PT=\frac{\widehat P-\widehat P^{*}}{\sqrt{\widehat v-\widehat w}}. \]

在虛無假設與一般的大樣本條件下,會以漸近標準常態分布作為此統計量的參考分布。分子是超過獨立基準的一致率;分母則納入基準由同一個樣本估計,而非固定為 50% 的考量。statsmodels 的實作文件記載了公式與符號 {source:statsmodelsPesaranTimmermannAPI}。

上述表示式是 statsmodels 文件記載的主要漸近變異數形式。原始研究中較完整的有限樣本 delta 變異數,會在 \(\widehat w\) 上加上 \(4\hat p_y\hat p_z(1-\hat p_y)(1-\hat p_z)/n^2\)。這個較高階項不會改變一階漸近結果,但可能使有限樣本統計量有所偏移。如果結果取決於實作方式,請說明使用的公式與軟體版本,而不要假設各套件的有限樣本計算都完全相同,再直接比較 p 值。

公式無法補救薄弱的研究設計。樣本很小、預測幾乎固定、儲存格為空,或估計變異數為零/無效,都可能使一般近似不可靠或無法定義。遇到這些情況,不要硬從公式算出 p 值;應呈現邊際比例和列聯表,並選擇適合資料與樣本大小的推論方法。

以上述假設表格為例,主要公式的組成項為 \(\widehat v=0.54(0.46)/100=0.002484\),以及 \(\widehat w=[0.2^2(0.7)(0.3)+0.4^2(0.6)(0.4)]/100=0.000468\)。標準誤為 \(\sqrt{0.002484-0.000468}\approx0.0449\),因此 \(PT\approx0.10/0.0449=2.23\)。雙尾標準常態參考分布給出的 p 值約為 0.026。這是將主要漸近公式套用在虛構數字上的計算;較完整的有限樣本項會使結果略有不同,而序列相依可能使常態參考分布不再適用。請勿將它呈現為實證結果。

2×2 配置中的銅色與藍綠色成對箭頭,呈現實際與預測方向的一致和不一致,以及不同的邊際方向比例。
概念示意圖,並非實證資料。

將拒絕虛無假設解讀為方向證據,而非交易結論

分子為正,表示實際方向比獨立基準更常一致;分子為負,則表示一致次數較少。事先指定的單尾檢定可以詢問一致率是否高於基準;雙尾檢定則檢驗方向關聯是否往任一方向有所不同。替代假設與顯著水準應在檢視結果前決定。

在檢定假設成立的條件下,較小的 p 值是資料不支持所述虛無假設的證據。它不是虛無假設為真的機率,也不是預測下期會有效的機率。它不代表報酬足以支付買賣價差、費用、市場衝擊、資金費率或借款成本,也不會修正嘗試多種資產、期間、門檻、模型變體或預測符號後只報告贏家所造成的問題。如果曾搜尋候選策略,[White Reality Check 指南](/zh-TW/learn/white-reality-check-data-snooping-strategy-backtest-explained)說明為何推論必須納入選擇過程。

反過來說,未能拒絕虛無假設不代表方向彼此獨立。較短或不平衡的樣本可能沒有足夠檢定力偵測關聯。PT 統計量為負,也不能證明預測毫無結構;它可能表示方向存在系統性不一致。看到結果後才反轉預測符號,是新的模型選擇,必須用新資料評估,或納入原本的搜尋程序。

請一併報告實際上漲比例、預測上漲比例、觀察到的命中率、獨立基準、百分點差距、替代假設及不確定性估計方法。若只提供 p 值而沒有列聯表邊際合計與效果大小,就很難分辨這是幅度小但估計精確的提升,還是幅度較大但雜訊也較高的提升。

序列相依可能使教科書式參考分布產生誤導

一般的 PT 統計量通常假設方向觀察值在序列上彼此獨立。然而,金融標籤可能連續成串。每日觀察值可能共用彼此重疊的多日目標;波動狀態可能持續;移動式預測也可能重複使用大部分相同的估計資料。此時,\(n\) 組配對並不等於 \(n\) 份獨立資訊。一般標準誤可能過小,導致虛無假設被過度拒絕。

Pesaran 與 Timmermann 後來使用動態擴增迴歸和有限階 Markov 架構,發展出檢驗序列相關多類別變數之間相依性的方法 {source:pesaranTimmermannSerialCategories2009}。專門探討方向預測的研究也發現,存在序列相關時,傳統獨立性 PT 程序可能過度拒絕,並研究包括 bootstrap 在內的相依穩健替代方法 {source:blaskowitzHerwartzDirectionalSerialCorrelation2014}。適當方法取決於預測的產生方式、預測期間與相依結構;通用的重抽樣做法不會自動有效。

請說明預測起點是否重疊、間隔多久,以及使用哪種相依處理方法估計不確定性。如果將教科書統計量作為描述性基準,請標示其獨立性假設。若設計違反該假設,不要把名目上的 5% 結果解讀成實際錯誤拒絕率也是 5%。

依據當時實際能產生的預測建立評估

對每個預測起點,保留當時可取得的原始預測、預測期間、資訊截止時間、實際結果,以及將兩者轉成上漲/下跌標籤的規則。建立表格前,先對齊時間戳記、金融商品、價格或報酬定義與缺漏值處理方式。使用事後修正的總體經濟資料,或依評估期間調整過的訊號所做出的預測,並非未經干預的樣本外預測。

請在檢視保留樣本結果前選定分類門檻。如果模型輸出機率,門檻會將其轉為二元方向;在同一樣本中搜尋門檻會改變問題並造成選擇偏誤。訓練、驗證與最終評估應各有明確用途;若重抽樣是為了納入模型搜尋的不確定性,每次都要重新執行完整選擇流程。

PT 的問題不同於比較預測誤差的大小。[Diebold–Mariano 指南](/zh-TW/learn/diebold-mariano-forecast-accuracy-test-explained)比較配對損失差異;[Giacomini–White 指南](/zh-TW/learn/giacomini-white-conditional-predictive-ability-test-explained)則檢驗相對預測能力是否依預先指定的資訊而改變。若是巢狀預測模型,請參考 [Clark–West 調整指南](/zh-TW/learn/clark-west-test-nested-forecast-accuracy-adjustment-explained)。這些檢定回答不同問題,不應只因為它們產生熟悉的統計量就互相替代。

方向顯著性不能證明策略有獲利能力

PT 檢定將每個結果簡化成方向標籤。上漲一個 tick 和大幅上漲都算上漲;小幅預測錯誤和嚴重虧損也都只算一次方向錯誤。因此,命中率即使提高,若錯誤交易的虧損大於正確交易的獲利、訊號在價格變動後才出現,或交易成本吃掉優勢,策略仍可能虧損。

舉例來說,假設有 100 筆等額的虛構交易,64 筆方向預測正確、平均各賺 0.10%,另外 36 筆判斷錯誤、平均各賠 0.25%。忽略複利與成本的簡單毛收益合計為 \(64(0.10\%)-36(0.25\%)=-2.6\) 個百分點,儘管命中率達 64%。這個刻意簡化的計算忽略複利,也不是市場證據;它說明單靠命中率無法決定期望報酬。

評估交易時,請在計算報酬前指定進出場時點、部位大小、風險限額與未成交委託的處理方式。適用時,納入買賣價差、手續費、滑價、市場衝擊、融資與交易平台特有成本。將樣本外淨報酬與適當基準比較,並考慮產生該規則的多重搜尋過程。PT 結果可以是方向關聯的一項證據,但不能取代可執行且已納入成本的評估。

常見問題

Q1Pesaran–Timmermann 檢定會把準確率與 50% 比較嗎?

不會。它會將觀察到的一致率與依實際上漲比例、預測上漲比例分別計算的獨立基準比較。基準可能高於或低於 50%。

Q2預測期間重疊時,可以使用一般 PT p 值嗎?

若沒有處理相依性,就不應直接使用。重疊目標與持續性標籤可能讓依據獨立假設計算的一般不確定性估計過小。請選擇假設符合預測期間與相依結構的方法。

Q3PT 結果顯著是否代表交易策略有獲利?

不代表。檢定只使用方向標籤,不會衡量價格變動幅度、進出場價格、部位大小、手續費、滑價或資金費率。樣本外淨報酬必須另外評估。

資料來源與延伸閱讀

回報問題

我們會準備一封包含本文連結的電子郵件。寄出後,Mark 才會收到你的回報

快速檢查

讀完指南後,用 3 道題檢查一下

問題 1 / 3

問題 01

如果實際結果有 60% 的時間上漲,而預測有 70% 的時間看漲,獨立假設下的一致率基準是多少?

選擇答案即可查看解釋

期權術語表

清楚解釋從買權、賣權和選擇權鏈到 IV、希臘字母、未平倉量與最大痛點等核心選擇權術語

瀏覽期權術語表