Pesaran–Timmermann検定:方向予測は情報を加えるのか
Pesaran–Timmermann検定が、実際と予測の上昇率に基づく基準と方向一致率をどう比較するか、系列依存が推論をどう変えるかを解説します。
このガイドの内容的中率64%が平凡か有用かは基準次第
短い要約
Pesaran–Timmermann(PT)検定は、予測に結果の上げ下げに関する情報が含まれているかを問います。上昇・下落の二値予測では、観測された的中率を、実際の上昇割合と予測で上昇とした割合からそれぞれ導く一致率の基準と比べます。この基準は必ずしも50%ではありません。通常の検定には予測起点間の依存性に関する仮定もあり、統計的有意性だけで売買ルールの収益性が証明されるわけではありません。
的中率64%が平凡か有用かは基準次第
評価期間の60%の日に市場が上昇したとします。予測者はそのうち70%の日に「上昇」と予測します。予測と結果が無関係でも、両者が一致する日はかなりあります。ある日は両方が上昇を示し、別の日は両方が下落を示すためです。この偏りを無視して的中率を機械的に50%と比べてはいけません。
PTの枠組みでは、この比較を明示します。予測方向と実現方向が、それぞれの出現頻度を保ったまま独立だとした場合の期待値よりも頻繁に一致するかを問います。これは方向に関する予測情報の検定であり、リターンの大きさ、売買のタイミング、戦略全体の価値を評価するスコアではありません。PesaranとTimmermannは分割表を使った予測性能検定を提案し、二値の2×2の場合には独立性検定と漸近的に等価であることを示しました {source:pesaranTimmermannDirectionalTests1992}。
対応する予測と結果を2×2表に入れる
実現した結果を上昇と分類するとき \(Y_t=1\)、下落と分類するとき \(Y_t=0\) とします。予測が上昇を示すとき \(Z_t=1\)、下落を示すとき \(Z_t=0\) とします。評価の各行では、予測起点 \(t\) に作成した予測と、その予測対象となった期間の実現結果を対応させます。
4つのセルには、上昇/上昇、上昇/下落、下落/上昇、下落/下落の組み合わせを数えます。一致する2つのセルを \(n_{11}\) と \(n_{00}\)、対応して利用できる組の数を \(n\) とすると、観測方向一致率は
\[ \widehat{P}=\frac{n_{11}+n_{00}}{n} \]
です。
この設定では分類は2種類です。リターンがゼロの場合、予測値がゼロの場合、中立帯をどう扱うかを事前に決めます。たとえば、リターンが0以下なら「上昇ではない」、予測値が閾値以下なら「上昇ではない」と分類できます。同値を除外する方法もありますが、標本が変わるため一貫して適用する必要があります。二値の基準式を使いながら、ゼロ同士の一致を第3の種類として数えてはいけません。
2つの上昇割合から独立性の基準を導く
\(\hat p_y\) を上昇と分類された実現結果の標本割合、\(\hat p_z\) を上昇と予測された標本割合とします。実現ラベルと予測ラベルが独立なら、期待一致率は
\[ \widehat{P}^{*}=\hat p_y\hat p_z+(1-\hat p_y)(1-\hat p_z) \]
です。
最初の積は独立のもとでの上昇/上昇の一致確率、2つ目の積は下落/下落の一致確率です。したがって基準は両方の周辺割合によって変わり、50%を上回ることも下回ることもあります。最も多い方向を常に予測するモデルは、情報を加えていなくても見かけ上の的中率が高くなる場合があります。
極端な例を見ると分かりやすくなります。分類器が毎回「上昇」と予測するなら、\(\hat p_z=1\) であり、観測的中率は実際の上昇割合 \(\hat p_y\) と等しく、独立性の基準も \(\hat p_y\) です。超過一致は構造上ゼロになります。このような定数予測は上昇が多い標本では正確に見えることがありますが、どの日に上昇するかを見分けられません。推定分散が退化し、通常のPT p値が存在しない場合もあります。
予測と実現結果が対応した仮想の日付を100日分考えます。実際の上昇は60日、上昇予測は70日です。分割表が次のようだとします。
| 実現方向 | 上昇予測 | 下落予測 | 合計 |
|---|---|---|---|
| 上昇 | 47 | 13 | 60 |
| 下落 | 23 | 17 | 40 |
| 合計 | 70 | 30 | 100 |
一致は64件なので \(\widehat P=0.64\) です。独立性の基準は \(0.60\times0.70+0.40\times0.30=0.54\) です。観測的中率は基準を10パーセントポイント上回ります。この架空の件数は計算例にすぎず、この差だけで有効な不確実性推定や売買上の有用性が証明されるわけではありません。
一致率の差を推定不確実性で標準化する
標準的な二値PT統計量について、次を定義します。
\[ \widehat v=\frac{\widehat P^{*}(1-\widehat P^{*})}{n} \]
および
\[ \widehat w=\frac{(2\hat p_y-1)^2\hat p_z(1-\hat p_z)+(2\hat p_z-1)^2\hat p_y(1-\hat p_y)}{n}. \]
すると
\[ PT=\frac{\widehat P-\widehat P^{*}}{\sqrt{\widehat v-\widehat w}} \]
となります。
帰無仮説のもとで通常の大標本仮定が成り立つと、この統計量は漸近的に標準正規分布を基準に解釈できます。分子は独立性の基準を超える一致分、分母はその基準を固定の50%とみなさず、同じ標本から推定したことを考慮します。数式と表記はstatsmodelsの実装ドキュメントに記載されています {source:statsmodelsPesaranTimmermannAPI}。
上式はstatsmodelsが文書化している主要な漸近分散の形です。原論文のより完全な有限標本デルタ分散では、\(\widehat w\) に \(4\hat p_y\hat p_z(1-\hat p_y)(1-\hat p_z)/n^2\) が加わります。この高次の項は一次の漸近結果を変えませんが、有限標本の統計量をずらすことがあります。実装によって結果が変わる場合は、すべてのパッケージが同じ有限標本計算を行うかのようにp値を比べず、使った式とソフトウェアのバージョンを明記してください。
この式は弱い評価設計を補うものではありません。標本が極端に小さい、予測がほぼ一定、空のセルがある、推定分散がゼロまたは無効といった場合、通常の近似は不安定または未定義になりえます。そのときは式から無理にp値を出さず、周辺割合と分割表を報告し、データと標本数に合った推論手法を選びます。
上の仮想表に主式を適用すると、\(\widehat v=0.54(0.46)/100=0.002484\)、\(\widehat w=[0.2^2(0.7)(0.3)+0.4^2(0.6)(0.4)]/100=0.000468\) です。標準誤差は \(\sqrt{0.002484-0.000468}\approx0.0449\) となり、\(PT\approx0.10/0.0449=2.23\) です。両側の標準正規分布を基準にすると、p値は約0.026です。これは主漸近公式を架空の度数に適用した計算です。より完全な有限標本項を加えると値は少し変わり、系列依存がある場合は正規分布を基準にできないことがあります。実証結果として示さないでください。

棄却は方向に関する証拠であり、売買の判定ではない
分子が正なら、観測方向は独立性の基準より頻繁に一致し、負なら一致は少ないという意味です。事前に定めた片側検定では、基準より一致が多いかを問えます。両側検定では、方向の関連がいずれかの向きに異なるかを問います。対立仮説と有意水準は結果を見る前に決めてください。
小さいp値は、検定の仮定のもとで、明示した帰無仮説に反する証拠です。帰無仮説が真である確率でも、次の期間に予測が当たる確率でもありません。スプレッド、手数料、市場インパクト、資金調達、借入コストを賄えるほどリターンが大きかったことも示しません。また、多数の資産、期間、閾値、モデル仕様、予測方向を試して勝者だけを報告する選択も補正しません。候補戦略を探索した場合は、White Reality Checkのガイドで選択を推論に反映する理由を確認できます。
一方、帰無仮説を棄却できなかったからといって、実際の方向と予測方向が独立だと証明されたわけではありません。標本が短い、または不均衡であれば、関連を検出する検出力が低い可能性があります。PTの分子が負でも、予測に構造がまったくないとは限りません。方向が系統的に食い違っている可能性があります。結果を見てから予測の符号を反転することは新たなモデル選択に当たるため、新しいデータで評価するか、当初の探索手順に含める必要があります。
報告では、実際の上昇割合、予測の上昇割合、観測一致率、独立性の基準、パーセントポイントでの上昇幅、対立仮説、不確実性の推定方法を併記してください。表の周辺度数や効果量のないp値だけでは、小さいが精密に推定された上昇と、大きいが不確かな上昇を区別しにくくなります。
系列依存は教科書的な基準分布を誤らせることがある
通常のPT統計量は、時系列方向観測が互いに独立である場合を前提として紹介されます。しかし金融のラベルは連続して現れることがあります。日次観測では複数日にわたる予測対象が重なり、ボラティリティ局面が持続し、ローリング予測では推定データの大部分が再利用されることもあります。その場合、\(n\) 組は独立した \(n\) 個の情報ではありません。通常の標準誤差が小さくなりすぎ、帰無仮説を過剰に棄却する可能性があります。
PesaranとTimmermannは後続研究で、動的に拡張した回帰と有限次数のマルコフ枠組みを用いて、系列相関のある多カテゴリー変数の依存性を検定する方法を開発しました {source:pesaranTimmermannSerialCategories2009}。方向予測を扱う研究でも、系列相関がある場合に独立性ベースの従来型PT手続きが過剰棄却となることが確認され、ブートストラップを含む依存に頑健な代替手法が検討されています {source:blaskowitzHerwartzDirectionalSerialCorrelation2014}。適切な方法は予測の生成方法、予測期間、依存構造によって異なり、一般的な再標本化手順が常に有効とは限りません。
予測起点が重なるか、その間隔、そして不確実性推定に用いた依存調整手法を明記してください。教科書的な統計量を記述的な基準として報告するなら、独立性の仮定も示します。設計が仮定に反しているのに、名目上5%の結果を実際の誤棄却率も5%であるかのように解釈してはいけません。
実際に作れた予測を使って評価を組み立てる
各起点について、その時点で利用できた予測値、予測期間、情報の締切、実現結果、そして各値を上昇/下落ラベルに変換する規則をそのまま保存します。分割表を作る前にタイムスタンプ、金融商品、価格またはリターンの定義、欠損値の扱いを揃えます。改定後のマクロ経済データを使った予測や評価期間で調整したシグナルは、未使用のアウト・オブ・サンプル予測ではありません。
ホールドアウトの結果を見る前に分類閾値を決めます。モデルが確率を出す場合、閾値がそれを二値の方向に変換します。同じ標本で閾値を探索すると検定の問いが変わり、選択バイアスが生まれます。訓練・検証・最終評価の役割を分け、モデル探索を考慮する再標本化では、各再標本の中で選択手順全体をやり直します。
PTの問いは予測誤差の大きさの比較とは異なります。Diebold–Marianoのガイドは対応する損失差を比較し、Giacomini–Whiteのガイドは事前に指定した情報によって相対的な予測力が変わるかを問います。ネストした予測モデルについてはClark–West調整のガイドを参照してください。検定統計量が見慣れた形だからという理由で、異なる問いに答える検定を置き換えてはいけません。
方向の有意性だけでは戦略の収益性は証明できない
PT検定は各結果を方向ラベル一つに縮約します。1ティックの上昇も大幅上昇も同じ「上昇」と数え、小さな予測外れも深刻な損失も同じ方向誤りとして数えます。そのため、外れの損失が的中時の利益より大きい、シグナルが価格変動後に出る、または取引コストが優位性を使い切る場合、的中率が上がっても損失が生じえます。
例えば、同じサイズの仮想取引が100件あり、方向が合った64件は各平均0.10%の利益、外れた36件は各平均0.25%の損失だったとします。複利を考慮しない単純な粗損益合計は、的中率が64%でも費用控除前で \(64(0.10\%)-36(0.25\%)=-2.6\) パーセントポイントです。この意図的に単純化した計算は複利を無視しており、市場の実証データではありません。的中率だけでは期待損益が決まらないことを示しています。
よくある質問
Q1Pesaran–Timmermann検定は精度を50%と比較しますか?
いいえ。実際の上昇割合と予測の上昇割合から別々に計算する独立性の基準と、観測一致率を比較します。基準は50%を上回ることも下回ることもあります。
Q2予測期間が重なる場合、通常のPT p値を使えますか?
依存性を考慮せずに使うべきではありません。重複する予測対象と持続的な方向ラベルにより、独立性ベースの不確実性推定が小さくなりえます。予測期間と依存構造に合った手法を使ってください。
Q3PTが有意なら売買戦略は収益を上げますか?
いいえ。この検定は方向ラベルを使い、変動幅、エントリー・決済価格、ポジションサイズ、手数料、スリッページ、資金調達を測りません。アウト・オブ・サンプルの純リターンは別に評価してください。
出典
問題を報告
この記事のリンクを含むメールを準備します。送信すると Mark に報告が届きます
クイックチェック
記事を読み終えたら、3問で確認しましょう
問題 01
実際の結果が60%の割合で上昇し、予測が70%の割合で上昇なら、独立性のもとでの一致基準はどれですか?
答えを選ぶと解説を確認できます
オプション用語集
コール、プット、オプションチェーンから IV、グリークス、建玉、マックスペインまで、主要用語を正確に解説します
オプション用語集を見る