Skip to content
所有選擇權指南
預測評估14 min read

Mincer–Zarnowitz 迴歸:檢驗預測偏誤與校準

了解 Mincer–Zarnowitz 迴歸如何檢驗預測的截距與尺度、為何平均誤差為零不等於校準,以及這項檢驗無法證明什麼。

本指南內容平均誤差為零,仍可能有校準問題

簡短摘要

Mincer–Zarnowitz(MZ)迴歸以線性校準的方式,檢查實際值是否符合預測的水準與尺度。常見的虛無假設是截距為零、預測係數為一。這項聯合限制比只看平均誤差提供更多資訊,但無法證明預測者已妥善使用所有可用資訊。

平均誤差為零,仍可能有校準問題

假設策略模型預測下一期報酬,或經濟學家預測下一季成長率。評估樣本中的預測誤差平均值可能為零。這有助於檢查預測是否持續偏高或偏低,但不代表預測值與後續結果會一對一變動。預測可能波動過大、過度收斂或線性偏移,只是正負誤差剛好互相抵銷。

MZ 迴歸把實際結果對預測值進行迴歸,讓第二個問題顯現出來。Mincer 與 Zarnowitz 在評估經濟預測時提出此架構(1969 年論文)。它是數值目標點預測的診斷工具,尤其適用於以平方誤差損失預測條件平均數的情況。它並非比較兩個模型何者平均損失較低;這是另一個問題,可參考 [Diebold–Mariano 指南](/zh-TW/learn/diebold-mariano-forecast-accuracy-test-explained)。

這項區別也與交易研究有關。報酬預測的平均偏誤可能很小,但尺度仍不正確;波動率預測可能在某個區間持續過高、另一個區間持續過低。迴歸可以指出線性不匹配,但結果取決於評估樣本、目標定義、資訊時間點和推論方法。單靠這項檢驗,無法證明預測能轉化為獲利的交易規則。

對齊預測起點、目標與資料版本

對每個預測起點 (t),將預測 (f_{t+h\mid t}) 與它要預測的後續實際目標 (y_{t+h}) 配對,並使用固定期間 (h)。為了簡化公式,下文把配對後的觀測寫成 ((f_t,y_t));下標只是標記每一組配對,預測本身仍是在較早的資訊截止點產生。兩個數值必須對應相同變數、期間、單位和時間戳規則。若預測五日報酬,卻配上一日報酬,迴歸就不再檢驗原定目標的校準情形。

使用每個起點當時確實可取得的預測,並保存預測值、模型版本、資料版本和資訊截止點。總體經濟目標的初次公布值之後可能修訂;應先決定以初值還是後續定稿值評估校準,並一致沿用。以修訂後資料替換歷史輸入,可能讓評估使用原預測者當時無法取得的資訊。

交易序列要一致對齊收盤到收盤、日內和隔夜報酬的組成。重疊的多期目標也會讓相鄰預測誤差相依。共用評估樣本同樣重要:如果某模型恰好在波動大的日期缺少預測,不同日期組成可能看起來像校準差異。評估預測序列時應使用相同目標與起點時程。

請區分實際產生的預測與模型內配適值。如果模型是用 MZ 迴歸的同一批觀測估計,樣本內配適可能造成校準良好的假象。若要主張未來預測能力,應依時間順序建立樣本外預測序列,在每個起點只用當時可得資訊重新估計,並保留未參與模型或門檻選擇的最終確認期間。

配適 Mincer–Zarnowitz 迴歸並明確寫出虛無假設

標準水準迴歸式為

yₜ = α + β fₜ + uₜ

其中 (yₜ) 是實際目標,(fₜ) 是預測,(uₜ) 是迴歸殘差。常見的聯合校準限制為

H₀: α = 0 且 β = 1

若兩項限制皆成立,實際結果與預測之間配適出的線性關係就是恆等線。不需要固定位移,預測增加一單位時,配適結果也增加一單位。完成迴歸估計後,應使用符合抽樣設計的共變異數估計,透過 Wald 或等價的 F 檢驗同時檢驗兩項限制。分別檢驗截距和斜率,不等於檢驗聯合限制。

迴歸殘差 (uₜ) 不一定等於原始預測誤差 (yₜ − fₜ)。在聯合虛無假設下兩者相等;若限制不成立,估計的截距與斜率會吸收線性位移與尺度調整。請同時報告原始預測誤差與迴歸係數,讓讀者看見平均偏差和校準關係。

MZ 限制有時也稱為預測不偏性或理性檢驗。應說明採用的定義。無條件平均誤差為零的條件是 (E[yₜ − fₜ] = 0);限制 ((α = 0, β = 1)) 則指定一種特定線性關係,通常更強。Holden 與 Peel 指出,在其形式化定義下,傳統聯合限制是預測不偏性的充分條件,但不是必要條件(1990 年論文)。未說明檢驗限制前,不要把「不偏」與「符合 MZ 校準」當成同義詞。

<!-- learn:illustration -->

藍灰色和琥珀色玻璃球沿透明斜面排列,細微偏移呈現預測校準的概念
以校準線為參照比較預測值與實際值的概念圖;不是市場資料、檢定結果或交易訊號。

簡單例子區分平均偏誤與聯合限制

考慮三組假設性的預測與後續結果:

預測值 (fₜ)實際值 (yₜ)誤差 (yₜ − fₜ)
11.50.5
22.00.0
32.5−0.5

預測平均值為 2,結果平均值也為 2,平均預測誤差為零。然而,這些數值符合 (yₜ = 1 + 0.5 fₜ),因此 MZ 迴歸截距為 (α = 1)、斜率為 (β = 0.5),而不是 ((0,1))。誤差雖在平均上互相抵銷,線性校準限制仍不成立:在這個刻意構造的例子中,實際值的變動幅度只有預測的一半。

這是用來說明算術的例子,不是市場資料,也不是推論樣本。對三個沒有雜訊的點報告有意義的 p 值,或聲稱真實預測系統失效,都不合理。在實際樣本中,聯合檢驗會納入估計不確定性;係數偏離幅度大,估計仍可能不精確,偏離幅度小則可能在觀測數足夠時被精確估計。此例只說明平均誤差與 MZ 限制回答不同問題。

重新校準式 (1 + 0.5 fₜ) 會精確重現這三個結果,因為它就是由這些資料建構而成。這不代表日後也有效。如果重新校準是預測流程的一部分,應在較早的訓練區段估計係數,並用未參與係數估計的後續資料評估調整後預測。

一起解讀截距、斜率與 R 平方

截距 (α) 是預測為零時配適出的結果,因此其實務意義取決於零是否落在預測範圍內或附近。斜率 (β) 描述配適結果隨預測值變動的幅度。納入截距後,斜率低於一表示預測變動幅度大於配適結果;斜率高於一則表示配適結果變動較大。若另一個係數也不受限制,單看任一係數都無法完整描述關係。

高 (R²) 無法證明校準良好。例如,沒有雜訊的關係 (yₜ = 2 + 1.1 fₜ) 有 (R² = 1),但其截距和斜率不符合 MZ 虛無假設。(R²) 概括線性配適解釋了多少變異;聯合檢驗則問該配適是否為恆等線。反過來說,即使不拒絕聯合限制,雜訊較多的預測也可能有低 (R²)。校準與精確度相關,但不是同一項性質。

不要只根據兩個個別 t 統計量推斷校準結果。截距與斜率估計可能相關,因此聯合 Wald/F 統計量會使用兩者的共變異數。請報告 (α)、(β)、估計不確定性、聯合統計量與 p 值、樣本數,以及原始平均誤差。必要時可附上含恆等線的散佈圖或分組比較;若分組是在查看資料後才決定,應坦白說明。線性檢驗可能漏掉曲線型校準錯誤、制度轉變或尾端特有誤差。

校準比完整的預測效率範圍更窄

在平方誤差損失下,最佳點預測是依預測者資訊集合計算的目標條件期望值。這項要求意味著,預測當時已知的資訊不應能用來預測後續誤差。MZ 迴歸只檢查常數項與預測本身形成的線性關係,不會自動檢查資訊集合中的其他變數。

更強的診斷可把事先指定的資訊變數 (zₜ) 加入預測誤差迴歸,例如:

yₜ − fₜ = δ₀ + δ₁ zₜ + vₜ

若預測起點時已知的變數能預測後續誤差,預測可能沒有充分利用可用資訊。變數的時間點必須對齊,選擇也要謹慎;測試許多落後期、市場狀態和轉換方式會再度產生多重搜尋問題。若短清單中找不到預測力,也不能證明相對於完整資訊集合具有效率。

Zarnowitz 在評估調查預測時討論偏誤、序列相關、樣本數與檢定力(NBER 工作論文 1070,1983)。因此,應將 MZ 描述為線性校準診斷或有限的預測效率檢查,而非預測者已最佳利用所有相關資訊的證明。[Giacomini–White 指南](/zh-TW/learn/giacomini-white-conditional-predictive-ability-test-explained)討論的是另一種依選定損失動差進行的條件比較。

納入估計方式、期間重疊與有限樣本的不確定性

預測誤差可能有異質變異、序列相關或期間重疊,尤其是滾動式多步預測。一般 OLS 係數公式本身不保證聯合限制的標準誤有效。應使用並報告符合預測期間、相依結構與估計程序的推論方法。沒有一種自動頻寬或修正方式適用所有設計。

使用估計值產生的預測另有問題。如果同一個短樣本用來估計模型參數、建構校準調整,再檢驗該調整,通常的迴歸不確定性可能未反映整個程序。比較巢狀預測模型的準確度時,虛無分配也可能不是標準形式。應使用針對實際預測生成方式推導的結果,或完整指定校準步驟,再用後續保留樣本評估。不要嘗試多種迴歸形式、目標和樣本後,再把最後一個 p 值當成確認性證據。

未拒絕虛無假設不代表已證明預測經過校準;原因可能是檢定力低或信賴區間很寬。拒絕結果也以目標、樣本、線性形式和共變異數估計為條件。可以檢查合理評估選項下的敏感度,但要揭露這些檢查,並與事先指定的檢驗區分。當預測高度持續,或評估樣本只有少數獨立事件時,這點尤其重要。

選擇符合預測問題的檢驗

MZ 檢驗的是預測值與實際目標之間的線性校準限制。[Diebold–Mariano 檢驗](/zh-TW/learn/diebold-mariano-forecast-accuracy-test-explained)則是在選定評分函數下,檢驗兩個預測程序的平均損失是否相等。某個預測可能校準良好,卻依該評分函數較不準確;另一個預測也可能平均更準確,但不符合 MZ 校準限制。

若問題是準確度是否隨預測起點已知資訊而變化,[Giacomini–White 檢驗](/zh-TW/learn/giacomini-white-conditional-predictive-ability-test-explained)會評估選定的條件損失動差。若搜尋過許多預測或交易規則,並要對候選集合做結論,[Model Confidence Set](/zh-TW/learn/model-confidence-set-forecast-comparison-explained)或 [White Reality Check/Hansen SPA](/zh-TW/learn/white-reality-check-vs-hansen-spa-test-trading-rules-explained)等集合層級程序處理的是另一種選擇問題。這些方法都不能取代清楚界定目標和誠實設定預測起點。

標準 MZ 水準迴歸適用於數值目標的點預測。分位數、機率、區間與密度預測需要符合其預測物件的校準檢驗與評分規則。若沒有另外論證,不應把平均數預測的良好結果延伸到尾端風險預測或波動率分配。

報告校準設計,讓他人能夠重現

說明預測目標、期間、單位、資訊截止點、評估日期、資料版本,以及預測是否確實為樣本外結果。提供精確的迴歸式、預測誤差定義和受檢驗限制。釐清「不偏性」指平均誤差為零,還是聯合 MZ 限制 ((α = 0, β = 1))。

報告係數估計、標準誤或信賴區間、聯合 Wald/F 統計量、自由度、p 值、預測起點數、原始平均誤差和 (R²),並說明 (R²) 的解讀限制。若期間重疊或誤差有序列相依,應說明共變異數或重抽樣方法。揭露模型估計、重新校準、選擇流程,以及曾嘗試的替代目標、樣本或轉換方式。

透明的報告能讓讀者區分平均偏誤、線性校準、資訊效率和比較準確度。這些是不同的實證主張。通過一項迴歸限制,不代表預測的所有用途都已驗證;單次預測評估也不能證明扣除交易成本後仍有獲利。

常見問題

Q1Mincer–Zarnowitz 檢驗只是檢驗平均預測誤差嗎?

不是。平均誤差檢查預測與結果的平均值是否不同。傳統 MZ 檢驗同時限制截距為零、斜率為一。依 Holden 與 Peel 的形式化定義,這項聯合限制是不偏性的充分條件,但不是必要條件。

Q2通過 MZ 檢驗能證明預測有效率嗎?

不能。它檢驗包含預測值的線性關係,並未檢驗預測起點可得的所有資訊是否都無法預測誤差。效率要求更強的資訊集合條件。

Q3VaR 或分位數預測可以使用相同迴歸嗎?

不能直接套用而不調整校準定義與推論方法。標準水準迴歸適用於數值點預測;分位數和尾端預測需要為其預測物件設計的檢驗與評分方式。

Q4校準能證明交易策略獲利嗎?

不能。校準關注預測與結果之間的關係。交易主張需要事先定義決策規則,並另外進行樣本外評估,納入執行、手續費、融資、市場衝擊和風險。 主要研究 - Mincer and Zarnowitz, “The Evaluation of Economic Forecasts” (1969) - Holden and Peel, “On Testing for Unbiasedness and Efficiency of Forecasts” (1990) - Zarnowitz, “Rational Expectations and Macroeconomic Forecasts” (NBER Working Paper 1070, 1983) - Diebold and Mariano, “Comparing Predictive Accuracy” (1995) - Giacomini and White, “Tests of Conditional Predictive Ability” (2006)

資料來源與延伸閱讀

回報問題

我們會準備一封包含本文連結的電子郵件。寄出後,Mark 才會收到你的回報

快速檢查

讀完指南後,用 3 道題檢查一下

問題 1 / 3

問題 01

Mincer–Zarnowitz 水準迴歸的傳統聯合虛無假設是什麼?

選擇答案即可查看解釋

期權術語表

清楚解釋從買權、賣權和選擇權鏈到 IV、希臘字母、未平倉量與最大痛點等核心選擇權術語

瀏覽期權術語表