確率積分変換(PIT):密度予測の較正を評価する
連続・離散の密度予測をPITで評価する方法、ヒストグラムの読み方、周辺的一様性だけでは不十分な理由を解説します
このガイドの内容密度予測では点予測の誤差だけでは足りない
短い要約
密度予測は起こり得る結果の範囲全体に確率を割り当てます。確率積分変換(PIT)は、実現値を予測分布の累積確率に変換します。所定の仮定のもとでPITの一様性は有用な診断ですが、ヒストグラムが平坦でも条件付き較正や時間的独立性が証明されるわけではありません。
密度予測では点予測の誤差だけでは足りない
点予測は明日のリターンを0.2%と示すかもしれません。密度予測は通常の変動から極端な事象まで、リターン全体に確率を配分します。そのため、結果を観測する前に出した分布が、後の実現値と整合するかを評価します。Mincer–Zarnowitzの解説は数値の点予測の線形較正を扱い、別の問いに答えます。
PITは、実現値以下に予測が割り当てた累積確率です。確率順位であり、リターン、売買シグナル、利益の指標ではありません。Diebold–Marianoの解説は選んだスコアに基づく平均予測損失を比較します。密度較正とは異なる問いです。
累積分布関数で連続予測を変換する
予測起点 (t) の後の結果を (Y_{t+1})、その時点で利用できる情報 (\mathcal I_t) のみに基づく予測累積分布関数を (F_{t+1}(y\mid\mathcal I_t)) とします。連続分布なら
Uₜ₊₁ = Fₜ₊₁(Yₜ₊₁ | 𝓘ₜ)
CDFは、値が (y) 以下となる確率です。予測CDFが真の条件付き分布なら、PITの定理により
Pr(Uₜ₊₁ ≤ u | 𝓘ₜ) = u, for 0 ≤ u ≤ 1
理想的な連続1期先予測では、PITは予測情報に条件付けて一様です。過去を含む情報集合を使う逐次予測では、適切な仮定の下で理想的なPIT系列は起点間でも独立です。Rosenblattが変換を研究し、Diebold、Gunther、Tayが密度予測評価に応用しました(Rosenblatt, 1952、Diebold, Gunther and Tay, 1998)。
手計算の例:予測が (N(0,1)) で実現値が (y=1) なら、PITは (Phi(1)\approx0.8413) です。つまり1以下に約84.13%の確率を割り当てています。この1点だけでは較正を判断できず、系列が必要です。
離散結果では変換をランダム化する
離散CDFは可能な値で跳びます。そのため通常の (F(Y)) は限られた値しか取らず、予測が正しくても一般に一様ではありません。ランダム化PITは各ジャンプ区間を埋めます。
Uₜ₊₁ = Fₜ₊₁(Yₜ₊₁⁻ | 𝓘ₜ) + Vₜ₊₁ [Fₜ₊₁(Yₜ₊₁ | 𝓘ₜ) − Fₜ₊₁(Yₜ₊₁⁻ | 𝓘ₜ)]
(F(y^-)) は左極限、つまり (y) より厳密に小さい値の確率です。(V) は評価だけに使う独立な Uniform(0,1) 乱数です。連続分布ではジャンプがないので式は (F(Y)) に戻ります。Brockwellは離散・混合を含む一般分布でこの変換を示しました(2007)。順序付きカウントでは、Czado、Gneiting、Heldが非ランダム化PITや周辺較正図も論じています。離散の (F(Y)) を連続一様とみなして評価してはいけません(2009)。
仮想的なBernoulli予測で (P(Y=1)=0.20)、(P(Y=0)=0.80) とします。通常のPITは (Y=0) なら0.80、(Y=1) なら1.00で、一様ではありません。ランダム化すると、(Y=0) は (0.80V) により ([0,0.80])、(Y=1) は (0.80+0.20V) により ([0.80,1]) に写ります。各区間を事象確率で重み付けると、([0,1]) 上の密度は一様になります。乱数は評価手段であり予測の一部ではありません。
周辺的一様性、独立性、条件付き較正を分ける
PITの周辺分布が一様であることは理想的な連続予測に必要ですが、十分条件ではありません。異なる相場局面で逆向きの誤差が相殺され、集計ヒストグラムだけが平坦になる場合があります。Gneiting、Balabdaoui、Rafteryは、ほぼ一様なPITと個々の偏った予測が共存する例を示しています(2007)。
順序も重要です。周辺ヒストグラムが一様でも、値の群れや長い連続など時間依存があり得ます。理想的な条件付き予測は集計的一様性以上を含意します。ただし予測期間が重なる場合は基準分布もその重なりを考慮すべきで、iid検定が自動的に妥当とは限りません。
PIT分布に加え、時間、ラグ、予測起点の変数、事前に定めたレジームとの関係を調べます。条件別プロットや検定は隠れたパターンを見せますが、条件の選び方と有限標本の限界があります。有限個の検査で、あらゆる条件変数に対する較正を証明することはできません。
PITヒストグラムは判定ではなく手掛かり
U字型は予測が過度に集中している、または分散不足である場合と整合しやすく、中央の山は広がりすぎ・過分散と整合しやすい形です。左右の偏りは位置バイアスの可能性があります。ただし固有の診断ではありません。依存、レジーム混合、離散性、ビン設定、小標本が形を誤らせます。
ヒストグラムは時間順序を捨てるため、問題がいつ始まったか、極端な値が集まるか、特定群だけが不較正かを示しません。ビンが広いとデータ不足が平坦に見え、狭いと標本ノイズで不規則に見えることがあります。件数、ビン境界、可能なら不確実性を示してください。Diebold–Gunther–TayやBerkowitzの検定は、予測設計に合う仮定が必要です。Berkowitzは内点のPITを (Z_t=\Phi^{-1}(U_t)) に変換し、独立な標準正規という同時帰無仮説を、AR(1)など指定した動学的対立仮説と比較します。万能な証明ではありません(Berkowitz, 2001)。
<!-- learn:illustration -->

推定を考慮し、アウト・オブ・サンプルで評価する
一様性の結果はCDFが真の条件付き法則だと仮定します。実際にはパラメータを推定し、分布族を選び、閾値や特徴量を調整します。推定予測 (F_{t+1}(\cdot;\hat\theta_t)) は予測手順の一部です。評価期間の結果でモデルを当てはめた後、PITを未使用のアウト・オブ・サンプル証拠と呼ぶのは情報漏洩です。
ローリング評価では各予測起点で当時使えた情報だけを使います。推定窓、再推定頻度、データ版、モデル版、選択手順を記録します。隣接窓は観測を共有することが多く、重複する予測期間も依存を生みます。
検定のサイズと検出力は推定量、標本、手順に依存します。PITヒストグラムはパラメータ不確実性を扱わず、教科書のiid基準値が推定済み・重複ありの設計すべてに当てはまるわけではありません。重要な推論では設計に合う検定を選ぶか、推定・予測の全手順を繰り返して帰無分布をシミュレーション/ブートストラップします。必要ならモデル選択から独立した最終評価標本を確保します。
較正とシャープネスを区別する
較正は予測と結果の関係、つまり確率を割り当てた事象が対応する頻度で起きるかを問います。シャープネスは結果を見ずに予測分布自体の集中度を表します。Gneiting、Balabdaoui、Rafteryは、シャープネスは較正を満たす範囲で望ましいのであり、代替ではないと論じています。
幅広い予測は較正されても情報が少ないかもしれません。狭い予測は精密に見えても、確率質量の外に結果が頻繁に出れば不較正です。PITは分布の整合性を調べ、シャープネス指標は幅や集中度を表します。どちらか片方だけでは評価の一面が欠けます。
全体のPITが平坦でも、ボラティリティ局面や予測期間ごとの誤りは隠れ得ます。重要な条件は事前に定めます。これは点予測の回帰や、選んだ情報に条件付けて予測損失を比較するGiacomini–White条件付き予測能力検定と関連しますが、同じ問いではありません。
同じ結果でプロパースコアを使い分布全体を比較する
PITは主に診断であり、密度予測の単独ランキングではありません。対数スコアと連続ランク確率スコア(CRPS)は各予測と結果に損失を与え、その定義の下で真の予測分布の期待損失が最小です。ただし単一標本の平均だけでモデルの正しさは証明できません。Model Confidence Setの解説は集合による比較を扱います。分布全体に定義されたスコアを同じ結果に適用してください。
対象、予測期間、共通日付、損失定義、ベンチマークを明記します。対数スコアは観測点に極端に低い密度を割り当てると大きく悪化し、CRPSはCDF間の差を別の感度で測ります。スコア差の不確実性には系列依存、推定、モデル探索を反映します。PIT図とスコアは異なる役割で併用します。
較正も優れたスコアも取引収益を証明しません。売買の主張には意思決定ルール、情報の時点、ポジション量、取引・資金調達費用、アウト・オブ・サンプル収益評価が別途必要です。予測評価統計はバックテスト収益ではありません。
再現可能なPIT手順を使う
予測対象、期間、起点時刻、結果の版、分布が連続・離散・混合のどれかを定義します。各予測CDFまたは再現に必要な情報を、実現値と情報集合とともに保存します。連続なら (F_t(Y_t)) を計算し、ジャンプがあれば手順を記録したランダム化PITか離散用診断を使います。
周辺分布と時間順序を調べ、ビン、標本数、同値の扱い、乱数シードまたは反復方法を明記します。事前に定めた問いに応じて独立性・条件付き検査を加え、ローリング、重複、推定を含む設計に合う推論を行います。同一の保留結果でプロパースコアを別途比較します。結論は定義した予測と条件についての証拠であり、将来の較正や取引利益の保証ではありません。
よくある質問
Q1PITが一様なら密度予測が正しいと証明できますか?
いいえ。正しい連続予測に必要な診断条件ですが、集計的一様性は独立性や条件付き較正を証明しません。時間依存と関連する条件変数も調べます。
Q2離散予測ではランダム化PITを使うべきですか?
正しい離散分布の下で連続一様基準を使いたい場合に有効です。追加乱数が各結果をCDFのジャンプ内に分散させます。方法とシードを記録し、ランダム化を避けたい場合は離散向け診断も検討します。
Q3U字型PITヒストグラムは何を意味しますか?
予測が集中しすぎている場合と整合することが多く、中央の山は広がりすぎと整合する場合があります。唯一の診断とはせず、依存、局面、標本、ビンを確認してください。
Q4PITヒストグラムが改善すれば予測スコアも改善しますか?
同じではありません。PITは分布挙動を診断し、プロパースコアは指定損失・対象の下で比較します。同じアウト・オブ・サンプル結果で報告し、どちらも取引利益と解釈しないでください。 一次研究 - Rosenblatt, “Remarks on a Multivariate Transformation” (1952) - Diebold, Gunther, and Tay, “Evaluating Density Forecasts with Applications to Financial Risk Management” (1998) - Berkowitz, “Testing Density Forecasts, with Applications to Risk Management” (2001) - Gneiting, Balabdaoui, and Raftery, “Probabilistic Forecasts, Calibration and Sharpness” (2007) - Brockwell, “Universal Residuals: A Multivariate Transformation” (2007) - Czado, Gneiting, and Held, “Predictive Model Assessment for Count Data” (2009)
出典
問題を報告
この記事のリンクを含むメールを準備します。送信すると Mark に報告が届きます
クイックチェック
記事を読み終えたら、3問で確認しましょう
問題 01
正しい連続1期先条件付き予測について、PIT定理が示すのはどれですか?
答えを選ぶと解説を確認できます