回帰の複数構造変化を調べるBai–Perron検定
Bai–Perron法が回帰の変化の数と時点をどのように探索するか、トリミングと臨界値の役割、推定結果から分からないことを解説します。
このガイドの内容複数変化の回帰検定が問うこと
短い要約
Bai–Perron法は、変化の数を固定して回帰の変化時点を同時に推定します。そのうえで検定やモデル選択基準を使い、データが支持する変化の数を評価します。時点と個数は、回帰式、最小区間長、誤差に関する仮定、探索手順によって変わり、原因やトレード上の優位性を特定するものではありません。
複数変化の回帰検定が問うこと
回帰の構造変化とは、標本中の未知の時点で1つ以上の係数が変わった可能性を指します。標本全体を使った単一の推定では、その変化が見えなくなることがあります。たとえば、リターンとリスクの関係がある期間には正で、後の期間に弱まったり逆転したりすれば、平均係数はどちらの期間も適切に表さないかもしれません。Bai–Perron法は、この問題を観測値の分割候補を明示的に探索する形にします。
Chow検定との主な違いは、変化時点を事前に固定しているかどうかです。Chow検定は指定した時点の前後にある標本を比較します。多数の時点を試して通常のChow統計量の最大値を報告しても、単一検定の標準的な参照分布は保たれません。Bai–Perron検定は候補時点の探索を考慮し、複数の変化を評価できます。事前に決めた時点を扱う場合は、Chow検定の解説を参照してください。
回帰CUSUMとも区別が必要です。CUSUMは再帰残差を時系列順に累積した経路を調べ、安定性に反する証拠を探しますが、それだけで複数の変化時点を選んで返すわけではありません。Bai–Perronは区分線形回帰を明示し、そのモデルのもとで分割を推定します。どちらの方法も、関係が変化した理由を説明しません。残差経路の診断については回帰CUSUMの解説を参照してください。
時点と変化数が未知の回帰式を書く
\(T\)個の観測値があり、整数の時点 \(T_1<\cdots<T_m\) で \(m\)回変化するとします。\(T_0=0\)、\(T_{m+1}=T\) とし、第 \(j\) 区間を観測値 \(T_{j-1}+1,\ldots,T_j\) と定義します。純粋な構造変化モデルは次のように表せます。
\[ y_t=x_t'\beta_j+u_t,\qquad T_{j-1}<t\le T_j,\quad j=1,\ldots,m+1. \]
ここで \(y_t\) は結果変数、\(x_t\) は含める説明変数のベクトル、\(\beta_j\) は第 \(j\) 区間の係数ベクトル、\(u_t\) は誤差です。未知なのは係数だけではありません。設計上固定していないなら、変化時点と個数 \(m\) も推定または選択します。また、観測値に意味のある順序があり、選択したモデルのもとで各区間の係数ベクトルが安定していると仮定します。
金融の例では、\(y_t\) はポートフォリオのリターン、\(x_t\) は市場リターン、金利変化、ボラティリティ指標などです。変化が検出されたという結果は、その手順のもとで区間ごとの線形条件付き平均が標本内でよりよく当てはまったことを意味します。特定の出来事が係数を変えたこと、説明変数が外生であること、標本外でも関係が安定することを示すわけではありません。
観測日と暦日も区別しましょう。日次の取引セッションを観測値とする場合、120回目と121回目のセッションの間の変化が、暦上の1日だけの市場変化を意味するとは限りません。休日、欠損価格、不規則なサンプリング間隔が対応関係に影響します。変化時点を出来事のタイムスタンプのように扱う前に、標本の並べ方と日付の報告方法を明記してください。
純粋変化と部分変化を意図的に選ぶ
純粋な構造変化モデルでは、\(\beta_j\) のすべての係数が区間ごとに変わることを許します。切片とすべての傾きが変化できますが、区間固有のパラメータが増えます。そのため、区間が短い場合や説明変数が多い場合、変化を精密に推定しにくくなります。モデル化するすべての関係が再設定されてもよい問いに限り、純粋変化を使うのが適切です。
部分的な構造変化モデルでは、一部の係数を共通に保ち、残りの係数だけを変化させます。たとえば \(\beta_j=(\delta',\gamma_j')'\) と書き、\(\delta\) は全区間で共通、\(\gamma_j\) は区間ごとに異なるとします。これは、切片と政策へのエクスポージャーの傾きは変わる一方、統制変数の効果は共通とする、といった実質的な制約を表せます。この制約は適合目的関数と検定の参照分布の両方を変えます。無害な単純化と見なさず、明示してください。
計算方法も異なります。純粋変化では、分割全体の残差平方和(RSS)は各区間の独立したRSSの合計になるため、変化数を固定すれば動的計画法で分割を最適化できます。部分変化モデルでは共通係数がすべての区間を結びます。BaiとPerronは、共通係数を固定して変化時点と変化係数を推定し、その後、分割を固定して共通係数を更新する反復手順を説明しています。区間RSSを単純に足し上げる再帰式だけでは、制約付きモデル全体を同時に解けません。報告される変化数が多い方ではなく、科学的または予測上の問いに沿ってモデルを選びます。
候補時点を見る前に最小区間長を決める
探索では各区間に最低限の観測数が必要です。このトリミング規則は極端に短い区間への当てはめを防ぎ、係数の不安定化を抑えます。一方、標本端や別の変化に近すぎる本当の変化も探索対象から外します。この規則は設計上の選択であり、普遍的な法則ではありません。
明確に仮想の例として、\(T=240\)個の観測値と、選択したトリミング割合15%を考えます。各区間の最小長は \(h=0.15\times240=36\) 観測値です。変化時点を前の区間の最終観測値と定義するなら、変化が1回の場合の許容時点は \(36\le T_1\le204\) です。両側に少なくとも36個の観測値が残ります。
変化が2回の場合、許容される時点の組は次の条件を満たす必要があります。
\[ 36\le T_1,\qquad T_1+36\le T_2\le204. \]
したがって \(T_1\le168\) であり、\(T_2\) は最初の変化から少なくとも36観測後で、2回目の変化後にも36観測を残す必要があります。\((72,156)\) は許容され、3区間の長さは72、84、84です。\((80,100)\) は中央区間が20観測しかないため許容されません。この \(h\) では240観測中に最大5回の変化が入ります。6区間に少なくとも \(6\times36=216\) 観測が必要なのに対し、7区間では252観測が必要だからです。
ここでの15%は明示的に仮定した設計例であり、既定の推奨値ではありません。割合を大きくすると短期的なレジームや標本端に近い時点が除外されることがあります。小さくすると短い区間も許容されますが、傾きや長期共分散量を信頼して推定する情報が足りなくなる可能性があります。サンプリング頻度、説明変数の数、妥当なレジーム期間、推論方法に基づいて決めてください。選択値を報告し、実質的に意味がある場合は近い値で結論が変わるかも示します。ラグや欠損観測があると、有効標本数や探索端点の定義が実装ごとに異なることがあるため、実際の規則を記録してください。
変化数を固定して動的計画法で全体最適な分割を探す
純粋変化モデルで \(m\) を固定すると、日付探索は区間RSSの合計を最小化する問題として表せます。
\[ \min_{T_1,\ldots,T_m}\;\sum_{j=1}^{m+1}\operatorname{SSR}(T_{j-1}+1,T_j), \]
ただし、時点の順序と最小区間長を守ります。\(\operatorname{SSR}(a,b)\) は観測値 \(a,\ldots,b\) に1つの区間回帰を当てはめたときの最小最小二乗残差平方和です。単純な全探索ではすべての日付の組み合わせを調べるため、その数は \(T\) と \(m\) とともに急増します。
動的計画法は最適化済みの部分問題を再利用します。\(D(r,j)\) を、観測値1から \(j\) までを有効な \(r\) 区間に分割する最小RSSとすると、再帰式の一例は次のとおりです。
\[ D(r,j)=\min_i\{D(r-1,i)+\operatorname{SSR}(i+1,j)\}, \]
ここで分割点 \(i\) は、最初の \(r-1\) 区間と最後の区間がすべて最小長を満たすように制約します。各段階で最小値を与える分割点を保存すれば、最終的な時点を復元できます。許容される区間数ごとに、指定したモデルと制約のもとでRSSが全体最小となる分割を得ます。変化を1つずつ貪欲に追加する方法ではありません。BaiとPerron(2003)はこの計算方法を展開し、純粋変化と部分変化の両モデルを論じています。
ここでの「全体最適」は、選んだ変化数、説明変数、決定論的項、トリミング、目的関数を条件とします。統計モデルが真であること、選んだ数が正しいこと、あらゆる仕様の中で分割が最適であることを意味しません。複数の数を効率よく比較できますが、\(m\) の選択は別の推論またはモデル選択の段階です。

探索を調整した推論や基準で変化数を選ぶ
候補数ごとの最適な分割が得られた後、\(m\) を選ぶ方法はいくつかあります。逐次的な \(\sup F(\ell+1\mid\ell)\) 検定は、\(\ell\) 回の変化があるモデルと、変化をもう1回加えるモデルを、許容時点にわたる統計量の上限で比較します。UDmaxやWDmaxなどの二重最大検定は、上限を決めた未知個数の変化を対立仮説として、変化なしの帰無仮説を検定します。BIC型を含む情報量基準は、適合度の改善と複雑さへのペナルティを比較します。これらは関連していますが、同じ問いに答えるわけではありません。
未知の変化時点を最大化した後に通常のF臨界値を使うのは、一般に適切ではありません。変化なしの帰無仮説のもとでは、候補時点は対立仮説のもとと同じ形では識別されず、標準的でない漸近分布になります。臨界値はトリミング、純粋変化か部分変化か、説明変数、誤差共分散の仮定などに依存します。BaiとPerron(1998)は複数変化の検定を導出し、後の臨界値研究ではトリミングとモデル設定別の値を示しています。Andrews(1993)は未知の変化点が1つある場合の不安定性検定に重要な結果を示していますが、その臨界値は複数変化の手順の代わりにはなりません。
逐次検定は解釈しやすい一方、各段階の検出力や事前に定めた最大変化数によって結果が変わることがあります。情報量基準はペナルティが異なるため別の数を選ぶ場合があり、候補モデルがすべて近似にすぎない可能性もあります。変化数が多いほど現実的な説明になるとは限りません。わずかな適合度の向上と引き換えに、区間係数が不安定になることがあります。手法、最大数、トリミング、検定順序または基準、臨界値の仮定を報告してください。選択が重要なら、1つの数を確定事項として示すのではなく、感度を示します。
推定時点は不確実性を伴う条件付き推定値として扱う
最小値を与える時点は、指定したモデルのもとでの点推定です。経済関係が変化した正確な瞬間をデータが明らかにしたかのように報告しないでください。標本変動、小さな係数変化、近接する複数の変化、ノイズの多い結果、変動の小さい説明変数、長い最小区間長によって、最小値付近の目的関数が平坦になることがあります。近接した複数の分割がほぼ同じ程度に適合する場合もあります。
BaiとPerronは、所定の条件のもとで変化時点の信頼区間を構成する方法を示しています。区間が表すのはモデル化された時点の標本不確実性であり、回帰式が正しいか、どの変数を含めるか、変化数はいくつか、トリミング規則をどうするか、といったすべての不確実性ではありません。変化数自体が不確実な場合、1つの数に条件付けた狭い日付区間は全体の不確実性を過小評価することがあります。
実務の報告では、日付の定義、推定された観測インデックス、対応する暦日、各変化の区間を区別してください。区間が広い、または重なる場合は、時点の特定が弱いと説明します。結果を見た後で図から日付を選び、それを独立に予測した出来事の時点として扱わないでください。既知の出来事と推定変化を比較する場合は、出来事や期間がデータ確認後に選ばれた可能性も考慮します。
系列依存と分散変化に合わせて推論を調整する
RSSによる分割は適合基準です。検定や信頼区間が有効かどうかは、説明変数と誤差に関する仮定に依存します。金融回帰には、系列相関、条件付き不均一分散、外れ値、変動するボラティリティ、重複するリターン、非同期の観測値が含まれることがあります。共分散推定量と臨界値が独立で等分散の誤差を仮定している一方で、残差に依存や不均一分散があるなら、推定時点がもっともらしく見えても有意性の報告は誤解を招きます。
Bai–Perronの研究は、不均一分散や系列依存のいくつかの形を含む、より広い条件下の手順を扱っています。それでも、実際の設定に合った共分散補正と参照値を使う必要があります。ロバストまたはHAC共分散推定は、動学の欠落、内生的な説明変数、誤った条件付き平均、相容れない間隔を混ぜた観測カレンダーを修正しません。ロバスト標準誤差を使うだけでRSS目的関数がデータのより良いモデルになるわけでもありません。
候補区間の内外で残差の依存性と分散パターンを調べてください。誤差の仮定が区間別分散、系列相関、説明変数分布の変化を許すか、選択した検定の理論がそれらを扱うかを明記します。非常に短い区間ではロバスト共分散推定が特に不安定になるため、トリミングとモデルの次元を合わせて設計してください。回帰推定と共分散仮定の基本はOLS回帰の解説を参照してください。
因果やトレードの主張に変えずに変化分析を報告する
再現可能な報告では、結果変数、すべての説明変数、変換、標本期間と頻度、切片と係数制約、純粋または部分変化の仕様、候補となる最大 \(m\)、トリミング割合と最小長、日付の定義、最適化方法、\(m\) の選択に使った検定または基準を示します。選択された変化数、区間ごとの係数、時点と不確実性区間、検定統計量、共分散の扱い、臨界値の出典も含めます。探索から除いた端点や観測値についても説明してください。
統計的に検出された変化は、その仮定のもとで指定回帰のパラメータが不安定であることを示す証拠です。どの出来事が変化を引き起こしたか、特定のニュースや政策が原因か、変化前後の係数が今後も続くかを立証するものではありません。変化は、欠落変数、データ定義の変更、ボラティリティ局面、測定上の問題、実際の経済変化を反映している可能性があります。回帰検定だけでは、これらを区別できません。
クオンツ取引では、全標本での探索に推定変化の前後の観測値が使われます。選ばれた時点をリアルタイムで知っていたかのように売買すると、先読みバイアスが生じます。提案するレジーム規則は時系列順に評価し、各時点で利用可能な情報だけで再推定してください。スプレッド、手数料、市場インパクト、資金調達、借株、売買回転、レイテンシも含めます。固定パラメータと取引なしの単純な基準と比べ、後に得られたデータを実際に検証用として残してください。変化はモデルの再確認やリスク調査のきっかけにはなりますが、予測力や投資可能な優位性の証拠ではありません。
BaiとPerron(1998)は、線形モデルにおける複数の構造変化の検定と推定を原論文で示しています。2003年の計算法の論文は動的計画法と部分変化の手順を説明し、臨界値の論文は設計による値の違いを示しています。Andrewsの未知変化点の論文は、1回の変化に関する関連基盤です。関連する診断として事前指定日のChow検定と回帰CUSUM検定を比較してください。
よくある質問
Q1Bai–Perronは本当の変化数を教えてくれますか?
いいえ。分割を推定し、候補数から選ぶ検定や基準を提供します。結果は回帰仕様、トリミング、誤差仮定、最大数、選択規則に依存します。データ生成過程に厳密にその数の変化があったと証明するものではありません。
Q2変化日は経済的な出来事が変化を引き起こした日ですか?
いいえ。適合させたモデルのもとでパラメータ不安定性が生じた位置の推定値であり、標本不確実性があります。原因を特定するには、他の説明を除く追加の証拠と研究設計が必要です。
Q3推定した変化時点に基づいて直接取引できますか?
全標本を使った事後的推定だけではできません。探索には候補変化より後の観測値も使われています。リアルタイム規則には、時系列順の評価、その時点で利用可能な情報、コスト、後続データによる検証が必要です。変化の検出は収益性のあるシグナルを証明しません。
出典
問題を報告
この記事のリンクを含むメールを準備します。送信すると Mark に報告が届きます
クイックチェック
記事を読み終えたら、3問で確認しましょう
問題 01
観測値240個の例で、最小区間規則を15%にすると何を意味しますか?
答えを選ぶと解説を確認できます