ボラティリティ予測のQLIKEと二乗誤差:ノイズを含む代理変数
QLIKEと二乗誤差による分散予測の評価を比較し、順位が逆転する例を確認します。ノイズを含む実現分散の代理変数が期待順位を保つ条件も説明します
このガイドの内容ボラティリティ予測の目標を定める
短い要約
QLIKEと二乗誤差損失は、条件付き分散の予測を異なる方法で評価します。ボラティリティの代理変数が条件付き不偏であれば、どちらも期待順位を保ちますが、標本での順位は異なることがあり、代理変数にバイアスがあるか目標と一致しなければ、その保証は失われます
ボラティリティ予測の目標を定める
ボラティリティ・モデルが予測するのは、将来のリターンがどの程度ばらつくかであり、リターンがプラスかマイナスかではありません。評価するには、まず目標を定義します。たとえば、翌日のリターンの条件付き分散を、二乗ベーシスポイントで測ります。標準偏差の予測、分散の予測、日中実現分散の推定値は互いに関連しますが、変換方法と予測期間を明示しなければ同じものとして扱えません。
この問題は、モデルがどのように予測を生成するかとは別です。GARCHガイドでは、過去のリターンから条件付き分散を更新する方法を一つ紹介します。このガイドでは、複数のモデルが予測を出した後、不完全な分散の観測尺度に対してどのように評価するかを扱います。
目標、評価サンプル、損失関数を決めるまでは、「最良の予測」に一つの意味はありません。損失関数ごとに予測誤差のコストが異なるため、ある損失では一位のモデルが、別の損失では二位になることがあります
代理変数、予測期間、単位をそろえる
vₜを観測できない目標リターンの条件付き分散、hₜをそのリターンが生じる前に利用可能な情報で作った予測、xₜを評価に使う観測済みの代理変数とします。よく使われる代理変数はリターンの二乗ですが、条件付き平均がゼロの場合に限り、分散の条件付き不偏推定量となります。条件付き平均がゼロでなければ、リターンの生の二乗が推定するのは条件付き分散ではなく条件付き二次モーメントです。条件付き平均を取り除いた後のリターンから代理変数を作る方法もあります。日中リターンから算出する実現分散は、取引時間中の変動をより詳しく測れる場合がありますが、特定の時間区間の測定値であり、サンプリング方法や価格データの規則に左右されます。
条件付き平均を推定して差し引いても、代理変数の偏りが自動的に解消されるわけではありません。mₜ = E[rₜ | Fₜ₋₁]、hₜ = Var(rₜ | Fₜ₋₁) とし、推定平均 m̂ₜ が予測時点で利用可能な情報に基づいて固定されているとき、E[(rₜ − m̂ₜ)² | Fₜ₋₁] = hₜ + (mₜ − m̂ₜ)² となります。したがって、予測可能な平均推定誤差は代理変数に非負の項を加えます。条件付き不偏性の結果を適用する前に、平均の推定方法と、代理変数が分散と二次モーメントのどちらを対象とするかを明記してください。
xₜとhₜは、同じ資産、リターンの定義、時間区間、予測期間、単位にそろえます。xₜをbp²で測るなら、hₜもbp²でなければならず、二乗誤差スコアはbp⁴になります。日次の終値から終値までの予測を、夜間を除いた実現指標で評価するのは、それが意図した目標でない限り避けてください。
同じ評価時点について、代理変数とすべてのモデルの予測を保存します。あるモデルの予測が特定日に欠けるなら、共通サンプルか妥当な欠測ルールを事前に決めます。異なる日付の平均を比べると、モデルの成績と、各モデルが直面した市場環境の違いが混ざることがあります
二乗誤差とQLIKEを定義する
非負の分散代理変数xₜと正の分散予測hₜに対する二乗誤差損失は次のとおりです。
L_MSE(xₜ, hₜ) = (xₜ − hₜ)²
QLIKE損失は次のとおりです。
L_QLIKE(xₜ, hₜ) = log(hₜ) + xₜ / hₜ
スコアは低いほど良好です。xₜが厳密に正の場合、QLIKEは比率を使った同値な式xₜ/hₜ − log(xₜ/hₜ) − 1で表されることもあります。二つの式は、観測された代理変数には依存するものの予測には依存しない項だけ異なるため、共通サンプルでの順位は同じです。log(hₜ)を使う形なら、hₜが正である限り、xₜがゼロでも定義できます。Pattonは分散損失をこのように定義し、不完全な代理変数のもとでの性質を分析しています(Patton, 2011)。
QLIKEは、分散予測に対するガウス型準尤度スコアに対応します(Hansen and Lunde, 2005)。この関係はリターンがガウス分布に従うことを示すものではなく、スコアが低くてもモデルの分布仮定を確認できるわけではありません。一方、二乗誤差は代理変数と予測の絶対差を二乗して測ります。比較の目的と代理変数の仮定に合うスコアを選ぶことが重要です
それぞれのスコアが重視するもの
二乗誤差損失の単位は分散の二乗で、代理変数と予測の差が大きくなると急増します。そのため、ごく少数の非常に大きな代理変数値が平均を左右することがあります。分散単位で大きな絶対誤差にかなり大きな重みを置く必要があるなら適切ですが、極端な観測値の影響を受けやすくなります。
xₜとhₜに同じ正の単位換算定数cを掛けると、log(hₜ) + xₜ/hₜにlog(c)が加わります。この加算項は同じ代理変数サンプルで評価するすべての予測に共通するため、順位は変わりません。一方、対数項の絶対値は選択した単位によって変わります。QLIKEはxₜ/hₜを通じて予測と代理変数の比率に、log(hₜ)を通じてhₜの大きさに反応します。大きな代理変数に対して予測が大幅に小さすぎると、比率項が急増します。過大予測もlog(hₜ)の上昇とともにコストが増えますが、同程度の比例誤差では増加はより緩やかです。QLIKEは外れ値に強い損失ではありません。極端な代理変数はxₜ/hₜを通じてスコアに反映されます。
どちらのスコアも、あらゆる判断で常に優れているわけではありません。二乗誤差は分散単位での大きな絶対誤差を重く評価し、QLIKEは相対誤差を異なる形で評価します。Pattonの代理変数に対する頑健性の結果は、二つの損失が同じ順位を付けることや、どちらも外れ値の影響を受けないことを意味しません
2期間の例を確認する
観測された分散代理変数がx = [1, 4] bp²だとします。モデルAの予測はhᴬ = [1, 1] bp²、モデルBはhᴮ = [4, 2] bp²です。損失によって順位が変わることを示すための仮定値です。
| 期間 | 代理変数x | モデルA h | モデルB h | MSE A | MSE B | QLIKE A | QLIKE B |
|---|---|---|---|---|---|---|---|
| 1 | 1 | 1 | 4 | 0 | 9 | 1.000 | 1.636 |
| 2 | 4 | 1 | 2 | 9 | 4 | 4.000 | 2.693 |
| 平均 | — | — | — | 4.500 | 6.500 | 2.500 | 2.165 |
MSEはモデルAを選びます。平均スコアは4.5 bp⁴で、モデルBの6.5 bp⁴より低いためです。QLIKEはモデルBを選びます。平均スコアは約2.165で、Aの2.5を下回ります。この2行で示しているのは計算だけです。不確実性の推定、予測の優劣の証明、取引戦略についての結論には観測数が少なすぎます <!-- learn:illustration -->

代理変数のノイズが期待順位を保つ条件
ボラティリティの代理変数にはノイズがあっても、条件付き不偏である場合があります。予測を作る時点で利用できる情報をFₜ₋₁とし、E[xₜ | Fₜ₋₁] = vₜとします。この情報から作った予測hₜに対する二乗誤差の条件付き期待値は
E[(xₜ − hₜ)² | Fₜ₋₁] = (vₜ − hₜ)² + Var(xₜ | Fₜ₋₁)
となります。
分散項は、どの予測を評価するかに依存しません。そのため、すべての予測の期待MSEに同じ量が加わり、期待損失を比べるときに相殺されます。QLIKEの場合、条件付き不偏性から
E[log(hₜ) + xₜ/hₜ | Fₜ₋₁] = log(hₜ) + vₜ/hₜ
が得られます。
これは代理変数を潜在分散で置き換えた場合のスコアです。この条件のもとでは、どちらの損失も潜在目標に対する競合する分散予測の期待順位を保ちます。Patton (2011) はこれを代理変数に対する順位の頑健性と呼びます。ここでいうのは期待順位におけるノイズの影響であり、外れ値への耐性ではありません。
この結果は、条件付き情報集合が同じこと、代理変数が条件付き不偏であること、QLIKEでは予測が正であること、期待損失が有限であることを仮定します。MSEとQLIKEが同じモデル順位を付けるとは述べていません。2期間の例では同じノイズを含む観測値を使っていても、二つの損失は予測誤差を異なる形で重視します
ノイズのある代理変数は有限標本で誤解を招くことがある
期待順位が不変でも、実現したすべての標本で潜在分散に基づく順位が再現されるとは限りません。代理変数のノイズは観測損失の変動を増やし、予測比較の検出力を下げることがあります。条件付き不偏性が平均的に成立していても、評価期間が短ければ、少数の代理変数が偶然大きすぎたり小さすぎたりしたためにモデルの順位が変わる場合があります。
目標に対して代理変数が条件付きで偏っている場合も、保証は成り立ちません。高頻度の実現分散は、ビッド・アスク・バウンス、古いまたは非同期の気配値、サンプリング頻度、夜間リターンの除外の影響を受けることがあります。日中の積分分散を狙う代理変数が、終値間の条件付き分散を不偏に測るとは限りません。実現ボラティリティの計算ガイドでは構築方法の選択を、二尺度実現ボラティリティのガイドでは、高頻度データのマイクロストラクチャー・ノイズの一部に対処するよう設計された推定量を一つ説明します。Hansen and Lunde (2006) は市場のマイクロストラクチャー・ノイズが実現分散の測定に与える影響を示しています(Hansen and Lunde, 2006のDOI)。
ここで「頑健」とは、範囲の限られた意味です。代理変数が条件付き不偏であれば期待順位が保たれるという意味です。標本スコアが外れ値を無視する、すべての実現ボラティリティ指標が不偏である、または目標の不一致から比較が守られるという意味ではありません。代理変数が何を測り、どの仮定でvₜと結び付くかを明示してください
同じ予測時点で固定した2つの予測 hᴬₜ と hᴮₜ について、期待MSE差は E[L_MSE(xₜ,hᴬₜ) − L_MSE(xₜ,hᴮₜ) | Fₜ₋₁] = (vₜ − hᴬₜ)² − (vₜ − hᴮₜ)² です。同じ代理変数条件の下で、期待QLIKE差は log(hᴬₜ) + vₜ/hᴬₜ − log(hᴮₜ) − vₜ/hᴮₜ です。これらの式は、代理変数に対する順位の頑健性が取り除くもの、つまり代理変数の期待スコアに加わるノイズを示します。ただし、MSEとQLIKEは誤差に異なるコストを課すため、予測の比較自体は異なります。
損失の比較と予測検定は異なる問いに答える
スコアを決めたら、共通の予測起点ごとに損失差をペアで作ります。dₜ = L_A,ₜ − L_B,ₜとすると、平均が正ならBの損失が低いことを示します。Diebold–Mariano検定は、ペアになった損失差の時系列を使って期待差がゼロかを評価します。QLIKEとMSEのどちらを選ぶべきか、どの目標が重要かを決めるものではありません。Diebold–Marianoガイドで、より広い推論の枠組みを説明しています。
複数期間の予測が重なる場合や、ほかの理由でスコア差に系列相関がある場合は、適切なHAC推定値など依存性を考慮した標準誤差を使います。Newey and West (1987) は正半定値のHAC共分散推定量を提示しています(Newey–West, 1987)。予測期間、評価起点、損失差の符号、共分散の方法、必要に応じてカーネルとバンド幅を明記します。検定で小さいp値が得られても、代理変数のバイアスや目標との不一致は解消されません
勝者を見る前に評価手順を決める
時系列順を守ったアウト・オブ・サンプル設計を使い、各起点でモデルが実際に出したはずの予測を保存します。どのモデルが高得点かを見る前に、目標、代理変数の構築、予測期間、単位、共通サンプル、損失を固定します。推定期間、再推定の規則、欠測値、評価期間を繰り返しモデル調整に使ったかも記録します。MSEとQLIKEを両方比べて勝者だけを報告する場合、事前に一つを定めた検定のように示さず、その選択を開示します。
各モデルの平均損失、ペア差、サンプル数、代理変数の定義、推論方法を報告します。QLIKEにはhₜ > 0が必要です。予測に下限を設ける場合は、評価前に決めてください。下限によってスコアが変わることがあります。正当化できる代理変数やサンプリングの選択に対する感度を確認する一方、多数の選択肢を試すこと自体が選択の問題を生む点も明らかにします。
よくある質問
Q1ボラティリティ予測ではQLIKEが二乗誤差より常に優れていますか?
いいえ。二つの損失は誤差に異なるコストを与えるため、どのモデルが勝つかを見る前に、目標と評価設計に基づいて選びます。あらゆる判断で常に最適な損失はありません
Q2代理変数に対する頑健性は、実現分散の測定値にノイズがないという意味ですか?
いいえ。目標に対して代理変数が条件付き不偏なら、ノイズがあってもこの結果は成り立ちます。ノイズは標本順位を不安定にし、検出力を下げることがあります
Q3標準偏差の予測にこの式を使えますか?
分散に変換するか損失を定義し直さない限り使えません。この式の入力は分散代理変数と分散予測です。標準偏差と分散を比べると目標と単位が混在します
Q4QLIKEスコアが低ければ取引戦略で利益が出ますか?
いいえ。指定した代理変数とサンプルにおいて、どの予測のスコアが低いかを示すだけです。利益は別個の売買ルール、執行、資金調達、リスク制約に左右されます 主要な研究 - Patton (2011), “Volatility forecast comparison using imperfect volatility proxies,” *Journal of Econometrics*, 160(1), 246–256. - Hansen and Lunde (2005), “A forecast comparison of volatility models: does anything beat a GARCH(1,1)?,” *Journal of Applied Econometrics*, 20(7), 873–889. - Hansen and Lunde (2006), “Realized Variance and Market Microstructure Noise,” *Journal of Business & Economic Statistics*, 24(2), 127–161. - Diebold and Mariano (1995), “Comparing Predictive Accuracy,” *Journal of Business & Economic Statistics*, 13(3), 253–263. - Newey and West (1987), “A Simple, Positive Semi-definite, Heteroskedasticity and Autocorrelation Consistent Covariance Matrix,” *Econometrica*, 55(3), 703–708.
出典
問題を報告
この記事のリンクを含むメールを準備します。送信すると Mark に報告が届きます
クイックチェック
記事を読み終えたら、3問で確認しましょう
問題 01
2期間の例で平均QLIKEが低いモデルはどちらですか?
答えを選ぶと解説を確認できます