所有選擇權指南
模型能解釋歷史卻敗給下一期的原因閱讀約15分鐘
偏誤—變異權衡與金融模型過度擬合
理解預測偏誤、估計變異、不可約雜訊、模型複雜度、時間序列驗證、資料窺探、回測過度擬合與金融模型治理
由 Mark 撰寫 · 官方資料列於文末
直接解答
偏誤—變異權衡把系統性模型不吻合造成的預測誤差,與模型對訓練樣本敏感而產生的誤差分開。過度擬合是模型或策略把樣本特有的雜訊誤當成可重複結構。金融研究反覆回測,又面對市場狀態轉換,使兩個問題格外嚴重
預測誤差有多個來源
對固定輸入x使用平方損失時,預期測試誤差可分為偏誤平方、估計器變異與不可約條件雜訊
偏誤比較假想訓練樣本之間的平均擬合預測與真正條件平均值
變異衡量擬合預測隨訓練樣本改變的幅度,並不是市場報酬本身的變異
高偏誤會遺漏持久結構
過度僵化的模型可能忽略非線性報酬、交互作用、時間變化或重要風險因子
訓練與測試誤差都可能偏高,加入有根據的結構或更合適的特徵可降低系統誤差
若模型一直預測錯誤的量,或目標與決策不一致,低變異也不代表成功
高變異會學到偶然細節
靈活模型可能擬合不會重現的離群值、雜訊、市場微結構假象與一次性狀態模式
訓練誤差下降,結果卻會隨重抽樣、視窗、隨機種子或細微設定而劇烈改變
正則化、部分匯聚、簡化特徵、增加有效樣本與模型平均可降低變異,但也可能增加或保留偏誤
複雜度不只是參數數量
搜尋範圍、特徵建構、停止規則、超參數調整與研究者反覆修改,都會增加實際靈活度
現代模型未必呈現簡單的U形誤差曲線,但插值或雙降現象並不會消除驗證風險
真正相關的複雜度是整個適應性研究流程,包括最終報告沒有展示的所有淘汰模型
金融驗證必須尊重時間
隨機分割資料列可能洩漏重疊標籤、未來標準化、成分股變動與鄰近市場狀態的資訊
應使用時間順序留出、走勢前推評估、標籤重疊時的禁運期,以及測試前已固定的交易成本
表現應在不同時期、資產、合理成本、執行延遲與擾動下保持穩定,而不只是一次回測為正
資料窺探會放大錯誤發現
嘗試大量策略而只報告最佳者,會單純因選擇而美化其夏普比率、t統計量或回撤
White的Reality Check及相關多重檢定方法,在各自假設下處理搜尋眾多替代方案的問題
最終留出集只有在從未查看時才有幫助;反覆查看會把它變成另一個訓練集
治理必須記錄研究路徑
記錄每個測試過的假設、特徵、資產範圍、視窗、成本與否決,避免低估實際試驗次數
分開探索與確認,可行時預先登記關鍵測試,並要求經濟機制與明確失敗情境
報告表現分布、信賴範圍、週轉率、容量、尾部損失,以及由研究到實盤的衰減
常見問題
什麼是偏誤—變異權衡?
它是限制性假設造成的系統性預測誤差,與擬合樣本特有變動而產生的不穩定之間的權衡
什麼是金融模型過度擬合?
它是學到能改善歷史回測,卻無法推廣到未來決策的雜訊或一次性結構
為何金融研究不宜隨機分割訓練與測試資料?
時間依賴、重疊標籤、前處理與狀態鄰近性,都可能使未來資訊跨越分割界線
最終留出集能防止所有回測過度擬合嗎?
不能。它只在一直未被查看時有幫助,也無法修補龐大隱性搜尋、狀態轉換、不實成本或錯誤目標
資料來源與延伸閱讀
把這個概念應用到一份期權
選擇合約和目標,讓價格、時間與波幅假設在同一份分析中清晰呈現
分析我的期權