Deflated Sharpe Ratio:多重檢定與回測選擇
了解 Deflated Sharpe Ratio 如何在策略篩選後,依多重檢定與非正態報酬調整 Sharpe 的統計證據,並以假設範例說明計算方式與適用限制。
本指南內容搜索之後,DSR 會提高 Sharpe 門槛
簡短摘要
Deflated Sharpe Ratio(DSR)考察的是:被選策略的 Sharpe 估計值,是否超過一個同時反映候選搜索範圍和報酬分布形状的門槛。它將概率型 Sharpe 計算應用於經選擇效應調整的基準。DSR 是有條件的統計診斷:它不會把回測變成未來盈利的證明,也無法補回遺漏的試驗、修正不現實的成本或消除時間序列信息泄漏。
搜索之後,DSR 會提高 Sharpe 門槛
研究者可能會嘗試多種信號定義、回看窗口、入場閾值、資產範圍、持有期限和成本假設,然後報告 Sharpe 比率最高的版本。即使所有候選都沒有真實技能,有限樣本中的估計值仍會因噪聲而不同。搜索範圍越廣,最大估計值通常越高。因此,被選結果不同於在查看數據之前就確定單一策略後進行的評估。
Bailey 和 López de Prado 提出的 Deflated Sharpe Ratio 處理所選 Sharpe 被抬高的兩個來源:多重檢驗和非正態報酬。多重檢驗提高了結果必須跨越的基準;非正態性則會改變 Sharpe 估計的不確定性。原論文將 DSR 描述為以選擇調整後的閾值計算 Probabilistic Sharpe Ratio。原論文說明了推導過程和試驗次數的估計方法。
這種表述有助於避免一種常見誤解。DSR 不會從報告的 Sharpe 中機械地扣除固定惩罰,生成一個新的績效比率。它估計觀測到的 Sharpe 超過搜索範圍、樣本長度和報酬矩共同決定的門槛多少。Sharpe 點估計可以不變,但證據較弱時 DSR 仍可能下降。關於 Sharpe 本身的含義,也可參閱Sharpe 的原始說明。
多個含噪估計值中最高的一個往往異常偏高
假設所有測試規則的真實 Sharpe 相同,但由於使用有限樣本,每個估計值都有波動。選擇最大估計值時,也選中了有利的測量誤差。這就是赢家诅咒:用新數據評估時,被選估計值預計會回歸到整個候選組的典型水平。
試驗數量很重要,估計值之間的差異程度也很重要。如果候選產生的報酬几乎相同,它們的估計 Sharpe 會高度相關;與同樣多但互不相關的候選相比,這些相關候選提供的獨立機會更少,較難偶然得到很高的最大值。因此,參數網格中的行數並不自動等於獨立試驗次數。
搜索記錄還應包括正式網格以外的決策,例如手動調整閾值、剔除某個市場或修改成本假設,因為這些操作可能影響最終保留的結果。只用最終候選計算的 DSR,無法考慮未記錄或未作為輸入提供的實驗。
Probabilistic Sharpe Ratio 計算樣本不確定性
Probabilistic Sharpe Ratio(PSR)估計樣本 Sharpe 是否超過選定基準,並考慮報酬觀測數以及估計的偏度和峰度。DSR 沿用相同的基本計算,但選擇一個能反映搜索中預期最大 Sharpe 的基準。
一種常見的 PSR 近似中,經選擇調整後的計算式為:
$$ \mathrm{DSR}=\Phi\!\left( \frac{(\widehat{SR}-SR_0)\sqrt{T-1}} {\sqrt{1-\widehat{\gamma}_3\widehat{SR} +\frac{\widehat{\gamma}_4-1}{4}\widehat{SR}^{\,2}}} \right) $$
其中,$\Phi$ 是标準正態累積分布函數,$\widehat{SR}$ 是每個報酬觀測对應的觀測 Sharpe,$SR_0$ 是同一單位下經選擇調整的門槛,$T$ 是觀測數量。$\widehat{\gamma}_3$ 是樣本偏度,$\widehat{\gamma}_4$ 是 Pearson 峰度,正態分布的峰度為 3。分母反映偏度和峰度如何改變 Sharpe 估計的不確定性。
結果取決於采用的口徑。應使用同一频率的超額報酬,並在該频率下計算 Sharpe 和門槛,同時統一峰度定義。只將其中一個量年化會改變比較結果。常見公式還依賴於对報酬觀測之間依賴結構的假設;序列相關性需要單獨處理,而不是悄悄並入 $T$。
預期最大值門槛取決於候選集合
对於 $N$ 個相互獨立且分布近似正態的 Sharpe 估計值,Bailey 和 López de Prado 使用極值近似來估計預期最大值:
$$ SR_0 \approx \mu_{SR}+\sigma_{SR} \left[(1-\gamma_E)\Phi^{-1}\!\left(1-\frac{1}{N}\right) +\gamma_E\Phi^{-1}\!\left(1-\frac{1}{Ne}\right)\right] $$
$\mu_{SR}$ 和 $\sigma_{SR}$ 分別表示候選 Sharpe 估計值的均值和标準差;$\Phi^{-1}$ 是标準正態分位數函數,$e$ 是自然常數,$\gamma_E \approx 0.5772$ 是欧拉–馬歇羅尼常數。該式估計在所選試驗模型下,僅由選擇效應導致的最高估計值可能有多高。它不是適用於所有策略搜索的通用門槛。
候選結果若彼此相關,把每個變體都視為獨立可能會高估有效試驗次數。論文討論了如何根據候選間的依賴關係估計獨立試驗數,但這項估計本身也是一種建模選擇。相關性只是依賴關係的一種形式;候選很多而報酬歷史較短時,估計可能不穩定。應報告候選原始數量、有效數量的估計方法,以及对合理替代假設的敏感性。
假設計算將門槛與觀測 Sharpe 區分開來
假設一個刻意簡化的搜索包含 20 個相互獨立的策略候選。在零假設下,令其 Sharpe 估計均值為 0,月度單位的标準差為 0.20。預期最大值近似給出每月約 $SR_0=0.380$ 的選擇門槛。這些輸入只是用於展示計算的假設,不是市場觀測值或建議基準。
再假設某個被選策略有 60 個月度超額報酬觀測,估計月度 Sharpe 為 0.50,樣本偏度為 0,Pearson 峰度為 3。PSR 部分比較的是 0.50 與 0.380,而不是與 0 比較:
$$ z=\frac{(0.50-0.380)\sqrt{59}}{\sqrt{1+((3-1)/4)(0.50)^2}} \approx 0.868,\qquad \mathrm{DSR}=\Phi(z)\approx 0.807 $$
在這些簡化假設下,DSR 約為 80.7%。這並不表示該策略下個月盈利的概率是 80.7%,也不是下個月報酬預測。它是在給定模型和輸入條件下,認為真實 Sharpe 超過所選門槛的統計證據估計。試驗次數、依賴關係估計、樣本或報酬分布形状不同,結果都可能改變。
試驗估計值的離散程度會顯著影響結果。如果只把候選 Sharpe 估計值的假設标準差從 0.20 改為 0.10,同樣進行 20 次搜索時,門槛約為 0.190,DSR 約為 98.8%。若标準差為 0.30,門槛約為 0.570,DSR 約為 30.6%。觀測 Sharpe 0.50、60 個觀測、偏度和峰度都保持不變。這個假設敏感性說明,如何估計試驗結果的離散程度以及候選間依賴關係都很重要;上述數值仍使用相同月度單位和簡化模型。
偏度和峰度會改變不確定性,而不只是描述方式
DSR 與其他驗證方法回答不同問題
PBO 使用 Combinatorially Symmetric Cross-Validation,考察樣本內赢家在互補分塊中的排名有多少次不高於候選中位數。DSR 估計所選 Sharpe 是否超過經搜索過程和非正態性調整的門槛。兩者的輸出和重采樣假設不同,不能互相替代。另請參閱[PBO 與 CSCV 指南](/zh-TW/learn/probability-of-backtest-overfitting-cscv-explained)和[金融中的多重檢驗指南](/zh-TW/learn/multiple-testing-false-discovery-rate-finance-explained)。 Bailey 等人在 PBO 原始論文中將這項選擇診斷形式化。
White 的 Reality Check 使用 bootstrap 檢驗候選組中最好的規則,在考慮數據窺探後是否勝過指定基準。它關注相对基準的問題,而 DSR 使用基於 Sharpe 的門槛。按時間順序進行的 walk-forward 或最終留出集,考察凍結的研究流程在後續時期如何表現。這些方法評估研究主張中的不同部分,因此可以互為補充。 White 在其 Reality Check 原始論文中介紹了這項方法。
報告 DSR 時同時披露搜索和假設
可復現的報告應列出候選範圍、所有影響選擇且有記錄的決策、試驗原始數量、有效試驗數的估計方法、報酬序列、樣本長度和频率、Sharpe 定義、偏度、峰度口徑以及選擇調整後的門槛。說明報酬是毛報酬還是已扣除買賣價差、傭金、市場衝擊、資金費用、借券成本及其他成本後的淨報酬。並列展示觀測 Sharpe 和 DSR,便於讀者看出差異。
常用公式所依賴的抽樣模型可能不適合存在序列相關的觀測值。Lo 關於 Sharpe 比率統計的研究說明了時間聚合和依賴關係為何會影響 Sharpe 推斷。如果報酬期重疊或存在序列相關,應使用能處理該結構的推斷程序並解釋其假設。將月度 Sharpe 乘以 $\sqrt{12}$ 並不能修正自相關。進行時間敏感的評估時,也可參閱[扩展式與滾動式 walk-forward 窗口指南](/zh-TW/learn/walk-forward-validation-expanding-vs-rolling-windows-explained)。
DSR 無法發現未記錄的搜索,不能消除前視信息泄漏,不能使存在幸存者偏差的數據具有代表性,也不能驗證成交、估算容量或保證策略在新市場環境中的穩定性。它也不能替代經濟邏輯或後續時期的時間順序證據。應將 DSR 視為研究流程中一項假設明確的診斷,並保存可復現的候選記錄和數據處理流程。
常見問題
Q1Deflated Sharpe Ratio 是扣除惩罰後的 Sharpe 比率嗎?
不是。DSR 是一種概率型統計量,基於所選 Sharpe、選擇調整後的門槛、樣本長度、偏度和峰度計算。它不會用機械折扣後的比率替換報告中的 Sharpe 點估計。
Q2應將每個參數組合都視為獨立試驗嗎?
不應。相似候選可能具有相關報酬,因此網格的原始規模可能不等於選擇高估計值的有效獨立機會數。請保留完整搜索記錄,並披露依賴關係的處理方法及其不確定性。
Q3DSR 很高是否能證明交易策略會有效?
不能。DSR 取決於候選集合、數據、報酬構造、試驗假設和抽樣模型。它不會修正被遺漏的實驗、执行錯誤、信息泄漏、市場環境變化或未來的不確定性。
資料來源與延伸閱讀
回報問題
我們會準備一封包含本文連結的電子郵件。寄出後,Mark 才會收到你的回報
快速檢查
讀完指南後,用 3 道題檢查一下
問題 01
以 Probabilistic Sharpe 計算為基礎時,DSR 改變了什么?
選擇答案即可查看解釋