予測の組み合わせ:等ウェイトと推定ウェイト
複数モデルの予測を組み合わせる方法、等ウェイトが推定ウェイトを上回ることがある理由、先読みバイアスを避けた評価方法を解説します
このガイドの内容予測の組み合わせとは
短い要約
予測の組み合わせは、同じ対象と予測期間に対する複数の予測をまとめる方法です。等ウェイトは透明な基準になります。過去の予測誤差から推定したウェイトはモデルごとの差を反映できますが、推定誤差によってサンプル外で不安定になることがあります
予測の組み合わせとは
予測の組み合わせでは、同じ量に対する二つ以上の予測を一つにまとめます。モデルA、B、Cがそれぞれ翌日の実現分散を予測するなら、出力を平均したり異なるウェイトを与えたりできます。組み合わせた値は新しい予測であり、どのモデルが正しいかを決める投票ではありません。
入力の対象、予測時点、期間、単位、情報の締切時点をそろえる必要があります。どちらもボラティリティと呼ばれていても、1日先の分散予測と1か月先のボラティリティ予測をそのまま平均することはできません。まず共通の量と期間を定め、そのうえで予測を対応させます。
複数の妥当なモデルが時系列の異なる特徴を捉えている場合や、どのモデルの優位性が続くか判断しにくい場合、予測の組み合わせが役立つことがあります。モデルはまったく異なるアルゴリズムである必要はありません。重要なのはモデル名の違いではなく、予測誤差が互いにどう動くかです。
BatesとGrangerの初期の航空旅客データの応用では、二つの個別予測より平均二乗誤差の低い合成予測が得られる場合が示されました。この結果は組み合わせを検証する動機になりますが、別の市場、対象、期間、損失関数でも改善する保証ではありません(Bates and Granger, 1969)。
等ウェイトを基準にする
\(K\)個の予測に対する等ウェイトの組み合わせは次のとおりです。
\[ \widehat{y}_{t+h\mid t}^{\,EW} = \frac{1}{K}\sum_{k=1}^{K}\widehat{y}_{k,t+h\mid t} \]
各予測が同じ比率で寄与します。このルールではウェイト推定用の訓練標本が不要で、再現も容易です。最終的な手法でウェイトを推定または制約する場合でも、有用な基準になります。
等ウェイトだからといって、すべての予測が同じ精度、独立性、経済的重要性を持つわけではありません。組み合わせ手法が過去の成績から個別ウェイトを推定しない、という意味です。すべての入力が同じ要因を見落としている場合、等ウェイトの予測にも共通の偏りが残ることがあります。
モデル名の数は情報の多様性を示しません。三つのボラティリティモデルが同じリターン系列、セッション境界、サンプリング間隔を用い、いずれも夜間の値動きを捉えられないことがあります。それらを平均しても、その見落としが自動的に補われるわけではありません。保存したサンプル外誤差に有用な違いがあるかを調べ、モデル名が異なるだけで独立した情報が増えると考えないでください。
三つのモデルが次の取引セッションのボラティリティを12、15、20ベーシスポイントと予測したとします。等ウェイト予測は \((12+15+20)/3 = 15.67\) ベーシスポイントです。この計算で分かるのは組み合わせ方だけです。一つの予測時点だけでは、ルールの精度や収益性は判断できません。
ボラティリティでは、入力が分散か標準偏差かを確認してください。三つの分散予測を平均してから平方根を取る値は、標準偏差予測の平均と一般には一致しません。後で評価するときと同じ対象の定義と単位を使います。
過去の予測誤差からウェイトを推定する
推定する線形結合は次のように書けます。
\[ \widehat{y}_{t+h\mid t}^{\,C} = \sum_{k=1}^{K} w_k \widehat{y}_{k,t+h\mid t} \]
一般的な理論結果では、各予測誤差の平均がゼロで、予測対象が同じで、ウェイトの合計が1であると仮定します。\(\Sigma_e\)を構成予測誤差の共分散行列とします。この行列が既知で逆行列を持つなら、これらの制約の下で分散を最小にするウェイトは次のとおりです。
\[ w^{*} = \frac{\Sigma_e^{-1}\mathbf{1}}{\mathbf{1}'\Sigma_e^{-1}\mathbf{1}} \]
この式は参考値であり、ノイズの多い標本共分散行列をそのまま逆行列にする指示ではありません。実際には有限の予測誤差記録から \(\Sigma_e\) を推定します。入力の相関が高いと推定行列が特異に近づき、小さなデータ変更が大きなウェイト変化につながることがあります。
二つの予測誤差の分散が同じ \(\sigma^2\) の場合、等ウェイト平均の分散は \(\sigma^2(1+\rho)/2\) です。\(\rho\)は誤差同士の相関です。各誤差の分散が4で、相関がゼロなら、平均の分散は2です。相関が0.90なら分散は3.8になります。平均化でどれだけ分散が減るかを決めるのはモデル名ではなく誤差間の依存性です。この計算は誤差分散についてのものです。構成予測に偏りがある場合、平均二乗誤差には偏りの二乗も含まれます。
別の方法として、実現した対象を保存済みの構成予測に回帰し、切片を含めることもあります。GrangerとRamanathanは、ウェイトの合計を1に固定しない線形回帰法を説明しています。切片や制約のないウェイトは訓練標本の平均的な偏りを補正できますが、解釈は変わります。係数は予測に対する推定調整値であり、必ずしもポートフォリオの配分比率ではありません(Granger and Ramanathan, 1984)。
評価を始める前に制約を決めます。非負のウェイトの合計を1にすれば、構成予測の最小値から最大値の間に収まる凸結合になります。負のウェイトや切片を許すと、その範囲外の値が出る可能性があります。補正済み予測には適する場合がありますが、分散のように非負でなければならない対象には適さないことがあります。
組み合わせを計算する
三つのモデルが同じ次回セッションの対象を12、15、20ベーシスポイントと予測したとします。過去の予測時点で推定したウェイト付けルールが、それぞれ \(0.50\)、\(0.30\)、\(0.20\) を割り当てた場合、組み合わせ予測は次のとおりです。
\[ 0.50(12) + 0.30(15) + 0.20(20) = 14.5\ \text{ベーシスポイント} \]
ウェイトは非負で合計が1なので、結果は構成予測の間にある凸結合です。等ウェイトの15.67ベーシスポイントとの差は選んだウェイトによるものであり、加重予測のほうが優れていることを示すものではありません。
ウェイトの推定には、その時点ですでに結果が分かっていた予測誤差だけを使う必要があります。過去のバックテストで、時点 \(t\) の14.5ベーシスポイント予測に使えるのは \(t\) までに得られた情報であり、\(t+1\)以降に実現した対象ではありません。
対象が観測可能になったら、各構成予測、組み合わせ予測、実現値の代理指標、評価損失を記録します。この手順を後続の予測時点でも繰り返せば、同じ日付で各ルールを比較できます。ただし、一つの計算例が持続的な優位性の証拠になるわけではありません。
推定ウェイトが期待外れになる理由
母集団の誤差共分散が既知の場合の最適ウェイトと、短い標本から推定したウェイトは同じではありません。推定ウェイトには追加の不確実性があります。構成予測が似ていると誤差の相関が高くなり、最適化が将来続かない過去の小さな差を利用してしまう可能性があります。
Kangのシミュレーションとマクロ経済予測への応用では、組み合わせウェイトが不安定になり得ることや、対象となった状況では単純平均が実務上より良い場合があることが示されました(Kang, 1986)。Timmermannのレビューは、推定誤差、モデルの不安定性、誤差間の依存性が予測の組み合わせにどう影響するかを説明しています(Timmermann, 200601004-9))。
予測組み合わせのパズルに関する後続の分析でも、固定された「最適」ウェイトに基づく結果は、ウェイト自体を推定する有限標本ではそのまま当てはまらない場合があると説明されています(Claeskens et al., 2016)。これは等ウェイトが常に勝つという証明ではありません。複雑なウェイト付けルールはサンプル外比較で有効性を示す必要がある、ということです。
<!-- learn:illustration -->
対応策として、等ウェイトから始める、入力数を制限する、推定ウェイトを等比率に近づける、簡単な制約を課す、といった方法があります。いずれも柔軟性と推定ノイズの間のトレードオフです。訓練データを使って方法を決め、そのルールを報告してください。最終テスト期間を見た後で、最もよく見える方法を選んではいけません。

リアルタイムの予測記録を作る
記録する各構成予測は、示された予測時点に実際に作成可能だったものにします。その時点までに利用できたデータだけを使って各モデルを再現し、予測時刻、モデルのバージョン、対象の定義を保存してください。標本内の当てはめ値は真正な過去予測の代わりにはなりません。当時は分からなかった観測値をモデルが使っていた可能性があるためです。
対象と予測時点で記録をそろえます。各行の構成予測は同じ将来区間を対象とし、訓練に使う情報も同じ意思決定時点で止める必要があります。組み合わせの推定前に欠測予測を除外するか、明示した方法で扱います。入力モデルの集合がいつの間にか変わると、ウェイトの意味も日付ごとに変わる可能性があります。
ウェイト推定と最終評価を分けます。ローリング・オリジン方式なら、\(t\)より前に結果が分かっている予測からウェイトを推定し、\(t\)で組み合わせ予測を出し、対象が観測された時点で評価できます。拡大型の窓は利用可能な過去の予測時点をすべて使います。ローリング窓はあらかじめ定めた長さに従って古い記録を除きます。成績の変化に対する反応は異なります。
構成モデル、変換、予測期間、ウェイト制約、損失関数をホールドアウト期間の結果を見て選んだ場合、その期間はすでにモデル開発に使われています。新たなテスト期間を確保するか、すべての選択手順を訓練データ内で行うネスト型評価を使います。
一つの損失関数で組み合わせを比べる
等ウェイトのルール、推定または縮小ウェイトのルール、個別予測を、同じ予測時点と同じ実現対象で比較します。評価損失と共通の標本期間を示してください。そうしないと、より簡単な日付や異なる対象定義で評価されたために、ある方法が強く見えることがあります。
損失関数は対象と問いに合ったものを選びます。二乗誤差は距離を二乗して評価し、絶対誤差は大きな外れに別の重みを付けます。ノイズを含む実現値を代理指標としてボラティリティ予測を評価する場合、代理指標の条件と損失関数の選択が重要です。QLIKEと二乗誤差のガイドで違いを説明しています。どの方法に有利かを見てから損失を選んではいけません。
予測比較検定は、観測された損失差が標本変動と整合するかを評価する助けになります。Diebold–Mariano検定のガイドでは、ペア比較と、予測誤差が重なったり依存したりする場合の前提を扱います。検定結果は先読みバイアスを修正せず、経済的価値を証明するものでもありません。
多数の構成モデル、ウェイト制約、損失ルールを試し、同じ評価期間で最もよく見えたものを選んだ場合、報告する比較にはその探索の影響も含まれます。White Reality Checkのガイドとバックテスト過剰適合確率のガイドは、多くの取引ルールから選ぶ問題を説明します。どちらも、整った予測記録や事前に定めた評価計画の代わりにはなりません。
実際に使う予測期間に合う検証設計を選びます。毎日の予測時点から複数日先の重なる対象を予測すると、連続した損失は依存する場合があります。不確実性を推定するときにその依存性を考慮し、重複する行数を同数の独立実験とみなさないでください。
判断に合う組み合わせを選ぶ
組み合わせる前に、各モデルが何を予測しているか確認します。条件付き平均、分散、分位点、完全な確率分布はそれぞれ別の予測対象です。点予測の線形平均だけで、較正された密度予測や信頼できるテールリスク推定が自動的に得られるわけではありません。
分散のように必ず非負となる量では、使用前に組み合わせ後の値を確認します。非負の予測の凸平均は非負ですが、負のウェイトや切片を含む推定回帰ではそうならない場合があります。負の値をゼロに切り上げる処理は予測ルールを変えるため、評価前に定めてください。
予測の数も重要です。弱い入力やほぼ重複する入力を追加すると、新たな情報はほとんど増えないのに推定するウェイトの数が増えることがあります。\(K\)に比べて過去の記録が短い場合、透明で低次元のルールを優先し、結論が一つの構成モデルに左右されていないかを示してください。
モデルの予測を組み合わせることと、取引ポジションを組み合わせることは別です。統計的な損失が小さくなっても、その予測を使う戦略が手数料、スプレッド、スリッページ、市場インパクト、リスク制限を考慮した後で多く稼ぐとは限りません。予測の作成方法と、それを利用する取引ルールには別々のサンプル外検証が必要です。
結果を再現できる情報を報告する
有用な報告では、予測対象、期間、単位、構成モデル、予測時点のタイムスタンプ、記録期間、欠測データの扱いを明らかにします。ウェイトが等しいのか、推定、制約、縮小を行ったのか、時間とともに変化するのかを述べ、調整方法も記録してください。
等ウェイトの基準、選んだ組み合わせ、最も強い個別予測の結果を同じ評価日で示します。損失関数、不確実性の算出方法、重複する対象の扱いも記載してください。窓ごとにウェイトが大きく動く場合は、最後の値だけでなく不安定さも示します。
最後に、実証結果と意思決定に関する主張を分けます。「この標本でこの損失関数を使ったとき、この組み合わせの平均損失は低かった」は、「予測を組み合わせれば取引成績が良くなる」より範囲が明確で再現しやすい表現です。前者は保存された予測記録から検証できますが、後者には戦略、執行上の前提、別の証拠が必要です。
よくある質問
Q1等ウェイトの組み合わせは、常に一つのモデルより優れていますか?
いいえ。ウェイトを推定しない便利な基準ですが、精度は構成予測と対象によって異なります。同じサンプル外の日付で個別予測と比較してください。
Q2予測ウェイトの合計は常に1でなければなりませんか?
いいえ。制約付き加重平均では、結果を凸結合として解釈しやすくするため、合計を1にすることがあります。切片付き回帰は別の種類の予測調整を推定できます。選んだ仕様とその意味を明記してください。
Q3サンプル内の当てはめ値から組み合わせウェイトを推定できますか?
基礎モデルが過去の各時点では利用できなかった情報を使っていた可能性があり、実態に合わない記録になることがあります。その時点で得られたデータだけで作成した、真のローリング・オリジン予測を優先してください。
Q4組み合わせ予測の精度が高ければ、取引上の優位性が証明されますか?
いいえ。予測精度は特定の対象、代理指標、標本、損失関数に対する統計的な結果です。取引に関する主張には、定義済みの戦略、執行コスト、リスク制約、別個のサンプル外評価も必要です。 主な研究 - Bates and Granger (1969), “The Combination of Forecasts,” *Journal of the Operational Research Society*, 20(4), 451–468. - Granger and Ramanathan (1984), “Improved Methods of Combining Forecasts,” *Journal of Forecasting*, 3(2), 197–204. - Kang (1986), “Unstable Weights in the Combination of Forecasts,” *Management Science*, 32(6), 683–695. - Timmermann (2006), “Forecast Combinations,” *Handbook of Economic Forecasting*, 1, 135–196.01004-9) - Claeskens, Magnus, Vasnev, and Wang (2016), “The Forecast Combination Puzzle: A Simple Theoretical Explanation,” *International Journal of Forecasting*, 32(3), 754–762.
出典
問題を報告
この記事のリンクを含むメールを準備します。送信すると Mark に報告が届きます
クイックチェック
記事を読み終えたら、3問で確認しましょう
問題 01
二つのモデル予測を組み合わせる前に、何をそろえる必要がありますか?
答えを選ぶと解説を確認できます