バイアス・バリアンスのトレードオフと金融モデルの過学習
予測バイアス、推定分散、既約ノイズ、モデル複雑度、時系列検証、データスヌーピング、バックテストの過学習、金融モデルの統制を学びます
Mark編集 · 一次情報は記事末尾に掲載
要点
バイアス・バリアンスのトレードオフは、系統的なモデル不一致による予測誤差と、訓練標本への感度による誤差を分けます。過学習は、モデルや戦略が標本固有のノイズを再現可能な構造だと取り込むときに生じます。金融ではバックテストの反復と市場レジームの変化が両方の問題を特に深刻にします
予測誤差には複数の源がある
固定した入力xと二乗損失では、期待テスト誤差はバイアスの二乗、推定量の分散、条件付き既約ノイズへ分解されます
バイアスは、仮想的な訓練標本間の平均予測と真の条件付き平均を比較します
分散は訓練標本が変わると予測がどれほど変わるかであり、市場リターンの分散ではありません
高いバイアスは持続的構造を見逃す
硬すぎるモデルは非線形な損益、交互作用、時間変化、重要なリスク因子を無視することがあります
訓練誤差とテスト誤差がともに悪い場合、根拠のある構造や適切な特徴を加えると系統誤差を減らせます
常に誤った量を予測したり、目的変数が意思決定とずれていたりすれば、低分散でも成功ではありません
高い分散は偶然の細部を学ぶ
柔軟なモデルは、再現しない外れ値、ノイズ、市場微構造の人工物、一度限りのレジーム模様まで適合できます
訓練誤差は下がっても、再標本化、窓、乱数シード、小さな仕様変更で結果が大きく変わります
正則化、プーリング、単純な特徴、有効標本の増加、平均化は分散を減らせますが、バイアスを増やすか残すことがあります
複雑度はパラメータ数だけではない
探索範囲、特徴量作成、停止規則、ハイパーパラメータ調整、研究者の反復はすべて実質的な柔軟性を増やします
現代モデルが単純なU字形誤差曲線に従わなくても、補間や二重降下という観察が検証リスクをなくすわけではありません
関連する複雑度は、最終報告に現れない棄却モデルも含む適応的な研究過程全体です
金融の検証は時間を尊重する
行を無作為分割すると、重複ラベル、将来の標準化、構成銘柄変更、近接レジームの情報が漏れることがあります
時系列のホールドアウト、ウォークフォワード評価、ラベル重複時のエンバーゴ、テスト前に固定した取引費用を使います
一回のバックテストがプラスなだけでなく、部分期間、資産、妥当な費用、遅延、摂動をまたいで安定しているべきです
データスヌーピングは誤発見を増やす
多くの戦略を試して最良だけを報告すると、選択しただけでシャープレシオ、t統計量、ドローダウンが良く見えます
WhiteのReality Checkと関連する多重検定法は、それぞれの仮定のもとで代替案の探索を扱います
最終ホールドアウトは未確認の間だけ役立ち、繰り返し見れば別の訓練標本になります
統制は研究経路を数える
試した仮説、特徴、ユニバース、窓、費用、棄却をすべて記録し、見かけの試行数を過少申告しないようにします
探索と確認を分け、実務上可能なら決定的検定を事前登録し、経済的機序と失敗条件を要求します
成績分布、信頼範囲、回転率、容量、テール損失、研究から実運用への劣化を報告します
よくある質問
バイアス・バリアンスのトレードオフとは何ですか?
制約の強い仮定による系統的な予測誤差と、標本固有の変動へ適合する不安定さの間にある関係です
金融モデルの過学習とは何ですか?
バックテストを改善しても将来の意思決定には一般化しない、歴史固有のノイズや一時的構造を学ぶことです
金融で無作為な訓練・テスト分割が危険なのはなぜですか?
時間依存、重複ラベル、前処理、レジームの近さを通じて、将来情報が分割を越えて漏れる可能性があるためです
最終ホールドアウトはすべての過学習を防ぎますか?
いいえ。未確認の間だけ役立ち、巨大な非公開探索、レジーム変化、誤った費用や目的変数までは修復できません
出典
この考え方を自分のオプションに当てはめる
契約と目標を選ぶと、価格・時間・ボラティリティの前提を一つの分析で確認できます
自分のオプションを分析する(英語)