Deflated Sharpe Ratio:多重検定とバックテストの選択
Deflated Sharpe Ratioが、戦略選択後のSharpeの統計的根拠を多重検定と非正規リターンを考慮してどう調整するか、仮定に基づく計算例と明確な限界を交えて解説します。
このガイドの内容DSRは探索後のSharpe基準を引き上げる
短い要約
Deflated Sharpe Ratio(DSR)は、選択された戦略の推定Sharpeが、複数の選択肢を探索したこととリターン分布の形状の両方を反映した基準を上回るかを問います。選択を調整した基準に対して、確率的なSharpe計算を適用します。DSRは条件付きの統計的診断です。バックテストを将来の利益の証明に変えるものではなく、記録漏れの試行、非現実的なコスト、時系列の情報漏洩も修正しません。
DSRは探索後のSharpe基準を引き上げる
研究者は、シグナルの定義、遡及期間、エントリー閾値、投資対象ユニバース、保有期間、コストの仮定を数多く試し、Sharpe ratioが最も高い版を報告することがあります。候補に真のスキルがなくても、有限の標本では推定値にばらつきが生じます。探索範囲が広がるほど、最大推定値は高くなる傾向があります。そのため、選択された結果は、データを見る前に一つだけ指定した戦略の評価とは異なります。
BaileyとLópez de Pradoが提案したDeflated Sharpe Ratioは、選択後のSharpeを過大に見せる二つの要因、すなわち多重検定と非正規リターンに対処します。多重検定は結果が超えるべき基準を引き上げ、非正規性はSharpe推定の不確実性を変えます。原論文ではDSRを、選択調整済みの閾値に対して算出するProbabilistic Sharpe Ratioとして説明しています。原論文には導出と試行数の推定方法が記載されています。
この捉え方はよくある誤解を避けるのに役立ちます。DSRは報告されたSharpeから一定のペナルティを機械的に差し引き、新しいパフォーマンス比率を作るものではありません。探索範囲、標本の長さ、リターンのモーメントに結び付いた基準を、観測Sharpeがどの程度上回るかを推定します。Sharpeの点推定値が変わらなくても、証拠が弱ければDSRは低下します。Sharpe自体の意味はSharpeによる原説明も参照してください。
ノイズを含む多数の推定値では、最大値が異常に高くなりやすい
すべての検証ルールの真のSharpeが同じでも、有限標本を使うため推定値にはばらつきがあるとします。最大の推定値を選ぶと、有利な測定誤差も同時に選ばれます。これが勝者の呪いです。新しいデータで評価すれば、選ばれた推定値はグループの典型値に近づくと予想されます。
試行回数だけでなく、推定値同士がどれほど異なるかも重要です。候補がほぼ同じリターンを生む場合、推定Sharpeは互いに強く関連し、同数の無関係な候補よりも、偶然高い最大値を見つける独立した機会は少なくなります。したがって、パラメータグリッドの行数をそのまま独立試行数とはみなせません。
探索記録には、正式なグリッド外の判断も含まれます。手動で変更した閾値、除外した市場、または結果の選択に影響したコスト前提の修正などです。最終候補だけで計算したDSRでは、記録されていない、あるいは計算入力に渡されていない実験を考慮できません。
Probabilistic Sharpe Ratioは標本の不確実性を計算する
Probabilistic Sharpe Ratio(PSR)は、リターン観測数、推定された歪度と尖度を考慮し、標本Sharpeが選択した基準を超えるかを推定します。DSRは同じ基本計算を使いますが、探索によって期待される最大Sharpeを反映する基準を選びます。
一般的なPSR近似の一つでは、選択調整後の計算は次のとおりです。
$$ \mathrm{DSR}=\Phi\!\left( \frac{(\widehat{SR}-SR_0)\sqrt{T-1}} {\sqrt{1-\widehat{\gamma}_3\widehat{SR} +\frac{\widehat{\gamma}_4-1}{4}\widehat{SR}^{\,2}}} \right) $$
ここで、$\Phi$は標準正規累積分布関数、$\widehat{SR}$はリターン観測あたりのSharpe、$SR_0$は同じ単位で表した選択調整済み基準、$T$は観測数です。$\widehat{\gamma}_3$は標本歪度、$\widehat{\gamma}_4$はPearson尖度で、正規分布では3です。分母は、歪度と尖度がSharpe推定の不確実性をどう変えるかを表します。
この式は採用する慣例に左右されます。単一の頻度の超過リターンを使い、Sharpeと基準値を同じ頻度で計算し、尖度の定義もそろえます。片方だけを年率換算すると比較が変わります。一般的な式はリターン観測の依存構造にも仮定を置いています。系列依存は$T$に暗黙に織り込むのではなく、別途扱う必要があります。
期待最大値の基準は候補群に依存する
分布が概ね正規の独立した$N$個のSharpe推定値について、BaileyとLópez de Pradoは期待最大値を極値近似で求めます。
$$ SR_0 \approx \mu_{SR}+\sigma_{SR} \left[(1-\gamma_E)\Phi^{-1}\!\left(1-\frac{1}{N}\right) +\gamma_E\Phi^{-1}\!\left(1-\frac{1}{Ne}\right)\right] $$
$\mu_{SR}$と$\sigma_{SR}$は候補Sharpe推定値の平均と標準偏差、$\Phi^{-1}$は標準正規分布の分位点関数、$e$はネイピア数、$\gamma_E \approx 0.5772$はオイラー・マスケローニ定数です。この式は、選んだ試行モデルのもとで選択だけにより最良の推定値がどれほど高くなり得るかを近似します。あらゆる戦略探索に通用する普遍的な基準ではありません。
候補の結果に相関があると、すべての変更を独立と扱うことで実効試行数を過大評価する可能性があります。論文は候補間の依存性から独立試行数を推定する方法も扱いますが、その推定自体が別のモデル化判断です。相関は依存性の一形態にすぎません。候補が多くリターン履歴が短い場合、推定が不安定になり得ます。候補の実数、実効数の算出方法、妥当な代替案に対する感度を報告してください。
仮定に基づく計算で基準値と観測Sharpeを分ける
意図的に単純化した探索として、互いに独立した候補戦略が20個あるとします。帰無仮説のもとで、Sharpe推定値の平均を0、月次単位の標準偏差を0.20と置きます。期待最大値の近似は、月あたり約$SR_0=0.380$の選択基準を与えます。これらは算術を示すための仮定であり、市場観測値でも推奨基準でもありません。
次に、選ばれた戦略に月次超過リターンが60件あり、推定月次Sharpeが0.50、標本歪度が0、Pearson尖度が3だとします。PSR部分では0ではなく0.380と0.50を比較します。
$$ z=\frac{(0.50-0.380)\sqrt{59}}{\sqrt{1+((3-1)/4)(0.50)^2}} \approx 0.868,\qquad \mathrm{DSR}=\Phi(z)\approx 0.807 $$
この単純化した仮定でのDSRは約80.7%です。これは翌月に利益を上げる確率が80.7%という意味ではなく、翌月のリターン予測でもありません。モデルと入力を条件として、真のSharpeが選択基準を上回ることを示す証拠の推定値です。試行数、依存性の推定、標本、リターン分布が異なれば結果も変わります。
試行間の推定値のばらつきに対する感度は大きくなります。候補Sharpe推定値の仮定上の標準偏差だけを0.20から0.10に変えると、同じ20試行の探索で基準は約0.190、DSRは約98.8%になります。標準偏差が0.30なら基準は約0.570、DSRは約30.6%です。観測Sharpeの0.50、観測数60、歪度、尖度は変わりません。この仮定上の感度は、試行間のばらつきと候補間の依存性をどう推定するかが重要な理由を示します。数値は同じ月次単位と単純化モデルのままです。
歪度と尖度は説明だけでなく不確実性も変える
標本Sharpeと標本長が同じ二つの戦略でも、リターン分布は異なる可能性があります。左側の裾が厚い、非対称性が大きい、極端な値が異常に頻繁といった特徴は、PSRの分母に表れる標本不確実性を変えます。この調整は観測したモーメントから計算されます。すべての非正規分布を同じように有害と判定するものではなく、少数の標本モーメントで裾の挙動を完全に説明できるとも限りません。
何を1観測と数えるかも計算に影響します。日次、週次、月次データでは$T$、Sharpe、歪度、尖度の値が変わります。保有期間が重複するリターンでは、隣り合う行が依存することがあります。平滑化された価格や古い評価値は、実際の経済リスクより変動が小さく見える可能性があります。年率Sharpeだけを十分な入力とせず、標本の頻度と構成を説明してください。
DSRと他の検証方法は異なる問いに答える
PBOはCombinatorially Symmetric Cross-Validationを使い、補完ブロックでインサンプルの勝者が候補の中央値以下に順位付けされる頻度を調べます。DSRは、選択されたSharpeが探索と非正規性を調整した基準を超えるかを推定します。出力と再標本化の仮定が異なるため、互いに置き換えられません。PBOとCSCVおよび金融分野の多重検定のガイドも参照してください。 この選択診断は、BaileyらのPBO原論文で定式化されています。
WhiteのReality Checkはブートストラップを使い、データ・スヌーピングを考慮した後で、候補群の最良ルールが指定ベンチマークを上回るか検定します。こちらはベンチマークとの比較が中心で、DSRはSharpe基準を使います。時系列順のwalk-forwardや最終ホールドアウトは、固定した手順が後の期間でどう機能するかを問います。異なる部分を評価するため、これらの方法は相互補完的です。 この手法は、WhiteのReality Checkに関する原論文で説明されています。
DSRとともに探索内容と仮定を報告する
再現可能な報告では、候補ユニバース、選択に影響した記録済み判断、試行の実数、実効数の推定方法、リターン系列、標本長と頻度、Sharpeの定義、歪度、尖度の慣例、選択調整済み基準を明らかにします。リターンがスプレッド、手数料、市場インパクト、ファンディング、借入費用などの前か後かも記載します。観測SharpeとDSRを並べて示すと、調整による違いが分かります。
標準的な式は、系列相関のある観測値に適合しない可能性のある標本モデルを仮定します。LoのSharpe比率の統計に関する研究は、時間集計と依存性がSharpeの推論に及ぼす影響を説明しています。リターン期間が重複する場合や系列相関がある場合は、その構造を扱う推論手続きを使い、仮定を説明してください。月次Sharpeに$\sqrt{12}$を掛けても自己相関は補正されません。時間を考慮する評価には、拡大型とローリング型のwalk-forwardウィンドウのガイドも参考になります。
DSRでは、記録されていない探索を発見したり、先読み情報の漏洩を取り除いたり、生存者バイアスのあるデータを代表的にしたりすることはできません。約定を検証したり、運用可能額を推定したり、新しい市場環境での安定性を保証したりするものでもありません。経済的な根拠や後続期間の時系列証拠の代わりにもなりません。DSRは研究プロセス内の、仮定を明記した一つの診断として扱い、候補履歴とデータ処理を再現できるように保管してください。
よくある質問
Q1Deflated Sharpe Ratioはペナルティを差し引いたSharpe ratioですか?
いいえ。DSRは選択Sharpe、選択調整済み基準、標本長、歪度、尖度を使う確率的な統計量です。報告されたSharpeの点推定値を機械的に割り引いた比率に置き換えるものではありません。
Q2すべてのパラメータの組み合わせを独立試行として数えるべきですか?
いいえ。似た候補はリターンが相関することがあるため、グリッドの実数が高い推定値を選ぶ独立機会の実効数と一致するとは限りません。探索記録をすべて残し、依存性の推定方法とその不確実性を開示してください。
Q3DSRが高ければ取引戦略が機能すると証明できますか?
いいえ。DSRは候補群、データ、リターンの作り方、試行の仮定、標本モデルに条件付けられています。省略された実験、執行ミス、情報漏洩、市場環境の変化、将来の不確実性は解消しません。
出典
問題を報告
この記事のリンクを含むメールを準備します。送信すると Mark に報告が届きます
クイックチェック
記事を読み終えたら、3問で確認しましょう
問題 01
Probabilistic Sharpeの計算をDSRの基礎に使うと、何が変わりますか?
答えを選ぶと解説を確認できます