Backtest VaR: Penjelasan Ujian Kupiec dan Christoffersen
Ketahui cara ujian POF Kupiec dan ujian liputan bersyarat Christoffersen menilai pelanggaran VaR, membaca contoh 250 hari, dan memahami sebab keputusan tidak menolak bukan bukti ketepatan.
Dalam panduan iniApakah yang diperiksa oleh backtest VaR?
Ringkasan ringkas
Backtest VaR membandingkan ambang kerugian yang diramal dengan kerugian yang berlaku selepas itu. Ujian Kupiec bertanya sama ada bilangan pelanggaran sepadan dengan kadar sasaran. Ujian Christoffersen juga menilai sama ada pelanggaran berlaku secara bebas atau berkumpul. Kedua-duanya memeriksa ciri yang berbeza dan tidak membuktikan model risiko itu betul.
Apakah yang diperiksa oleh backtest VaR?
Value at Risk (VaR) ialah ambang kerugian yang dikaitkan dengan tahap keyakinan dan tempoh tertentu. Jika VaR satu hari pada tahap 99% ialah $10,000, model meletakkan kebarangkalian 1% bahawa kerugian sehari melebihi $10,000, berdasarkan maklumat dan andaian yang dinyatakan. VaR bukan had maksimum kerugian dan tidak menerangkan sejauh mana kerugian boleh melebihi ambang itu.
Backtest menukar siri ramalan dan hasil kepada siri penanda pelanggaran. Dengan VaR harian 99%, model yang dilaras dengan baik sepatutnya menghasilkan pelanggaran kira-kira 1% daripada pemerhatian setanding dalam banyak sampel berulang. Pernyataan ini mempunyai dua bahagian: kekerapan jangka panjang patut hampir dengan sasaran, dan pelanggaran tidak patut muncul dalam pola yang bercanggah dengan ramalan risiko bersyarat model. Ujian proportion-of-failures (POF) Kupiec menumpukan bahagian pertama. Ujian kebebasan dan liputan bersyarat Christoffersen turut mengambil kira turutan pelanggaran.
Perbezaan ini penting dalam amalan. Satu model mungkin mencatat empat pelanggaran dalam setahun dan meletakkan kesemuanya dalam minggu yang bergelora. Model lain mungkin mempunyai empat pelanggaran yang tersebar sepanjang tahun. Ujian yang hanya melihat bilangan menganggap kedua-duanya sebagai empat; ujian yang menilai masa melihat urutan yang berbeza. Ujian di bawah membantu menghuraikan ciri tersebut, tetapi tidak menggantikan semakan terhadap posisi, data pasaran, andaian atau tahap kerugian. Panduan model GARCH dan pengelompokan turun naik menerangkan cara model GARCH mewakili pengelompokan turun naik; model varians dan backtest menjawab soalan yang berbeza.
Takrifkan pelanggaran sebelum mengiranya
Gunakan satu konvensyen tanda secara konsisten. Biarkan Lₜ ialah kerugian terealisasi pada hari t dan VaRₜ|ₜ₋₁ ialah ambang satu hari yang diramal dengan maklumat yang tersedia sebelum hari t. Takrifkan penunjuk pelanggaran Iₜ = 1 apabila Lₜ > VaRₜ|ₜ₋₁, dan Iₜ = 0 selainnya. Bagi model VaR 99%, kebarangkalian pelanggaran sasaran ialah α = 1 − 0.99 = 0.01. Sesetengah sumber mentakrifkan penunjuk menggunakan pulangan atau sama ada hasil berada dalam selang; konvensyen tersebut setara selepas tanda dan kebarangkalian diterjemahkan. Nyatakan definisi yang digunakan.
Ramalan dan hasil perlu merujuk kepada portfolio, tempoh, masa penilaian dan takrif kerugian yang sama. Jika ramalan dibuat selepas pasaran ditutup untuk hari dagangan berikutnya, bandingkannya dengan kerugian hari berikutnya menggunakan kaedah penilaian yang ditetapkan secara konsisten. Tetapkan lebih awal cara mengendalikan nilai yang sama dengan ambang VaR, cuti umum, pemerhatian yang hilang, penutupan pasaran, pembetulan intrahari dan perubahan portfolio. Pilihan ini boleh mengubah siri hit, terutamanya apabila pelanggaran jarang berlaku.
Asingkan pemadanan model daripada penilaian akhir. Jika parameter atau ambang risiko dipilih selepas tempoh yang sama untuk ujian telah disemak, nilai-p tidak lagi menggambarkan semakan luar sampel yang bersih. Bagi ramalan bergulir, rekodkan masa setiap ramalan dibuat dan maklumat yang tersedia ketika itu. Ramalan beberapa hari yang bertindih boleh menjadikan penunjuk pelanggaran saling bergantung. Ujian standard di bawah tidak secara automatik membetulkan tempoh yang tidak sepadan, maklumat masa hadapan yang bocor, input yang disemak semula atau proses pemilihan model.
Apakah soalan yang dijawab oleh ujian POF Kupiec?
Katakan terdapat T pasangan ramalan-hasil yang setanding dan x pelanggaran. Kadar pelanggaran yang diperhatikan ialah p̂ = x/T. Ujian proportion-of-failures (POF) Kupiec, yang turut disebut ujian liputan tanpa syarat, membandingkan dua kebolehjadian binomial: satu menetapkan kebarangkalian pelanggaran pada sasaran α, manakala satu lagi menganggarkannya secara bebas sebagai p̂. Ujian ini berasal daripada makalah Kupiec 1995; rekod arkib Federal Reserve turut tersedia. Statistik nisbah kebolehjadiannya ialah
LRᵤ꜀ = −2 ln [ (1−α)^(T−x) α^x / ((1−p̂)^(T−x) p̂^x) ].
Di bawah hipotesis nol, pelanggaran ialah peristiwa Bernoulli bebas dengan kebarangkalian α. Untuk sampel yang cukup besar, statistik ini menghampiri taburan khi kuasa dua dengan satu darjah kebebasan. Nilai yang besar menolak kekerapan pelanggaran yang ditetapkan. Oleh sebab model alternatif menganggarkan kadar yang diperhatikan secara bebas, ujian boleh menolak apabila pelanggaran terlalu banyak atau terlalu sedikit. Model yang hampir tidak pernah melanggar VaR tidak semestinya dilaras dengan betul; ramalannya mungkin terlalu konservatif untuk tujuan yang dimaksudkan.
Ujian POF menggunakan bilangan x, bukan tarikh pelanggaran berlaku. Menyusun semula penunjuk hit yang sama tidak mengubah statistiknya. Oleh itu, keputusan POF tidak dapat membezakan empat pelanggaran yang tersebar dengan empat yang berturut-turut. Kebolehjadian Bernoulli juga mengandaikan penunjuk pelanggaran bebas untuk taburan rujukannya. Jika persoalannya ialah sama ada pelanggaran berkumpul, tambah ujian kebergantungan dan jangan membuat kesimpulan tentang pengelompokan daripada keputusan POF sahaja.
Contoh 250 hari menunjukkan sebab nilai-p perlu dibaca dalam konteks
Pertimbangkan siri hipotetikal 250 ramalan VaR satu hari pada tahap 99%. Kadar sasaran ialah α = 0.01, jadi bilangan pelanggaran dijangka di bawah hipotesis nol ialah Tα = 250 × 0.01 = 2.5. Katakan siri itu mempunyai empat pelanggaran. Kadar diperhatikan ialah p̂ = 4/250 = 0.016, atau 1.6%. Nilai itu melebihi sasaran 1%, tetapi jurang itu sahaja tidak menentukan sama ada ujian nisbah kebolehjadian akan menolak.
Dengan T = 250, x = 4 dan α = 0.01, LRᵤ꜀ ≈ 0.769. Menggunakan rujukan asimptotik khi kuasa dua(1) memberikan p ≈ 0.38; nilai kritikal 5% kira-kira 3.84. Dengan penghampiran itu, contoh ini tidak menolak liputan tanpa syarat pada aras 5%. Pengiraan ini hipotetikal, bukan hasil empirikal atau ambang penerimaan yang disyorkan.
Dua log-kebolehjadian menunjukkan asal statistik itu. Dengan kadar sasaran ditetapkan, ℓ₀ = 246 ln(0.99) + 4 ln(0.01) ≈ −20.893. Dengan kadar pemerhatian yang tidak dikekang, ℓ₁ = 246 ln(0.984) + 4 ln(0.016) ≈ −20.508. Padanan bebas lebih tinggi kira-kira 0.385 unit log-kebolehjadian, maka LRᵤ꜀ = −2(ℓ₀ − ℓ₁) ≈ 0.769. Ujian ini mengukur kehilangan padanan berbanding model kadar sasaran, bukannya jarak dalam dolar.
Keputusan tidak menolak tidak membuktikan model dilaras dengan baik. Hanya 2.5 pelanggaran dijangka, jadi satu atau dua kejadian tambahan boleh mengubah kadar pemerhatian dengan ketara. Rujukan khi kuasa dua bersifat asimptotik dan ujian bagi kejadian jarang mungkin mempunyai kuasa yang terhad dalam sampel sebesar ini. Baca statistik bersama bilangan jangkaan, tempoh ramalan, reka bentuk ujian dan saiz sampel. Nilai-p bukan kebarangkalian bahawa model VaR itu benar.
Bilangan pelanggaran yang sama boleh menyembunyikan masa yang berbeza
Bandingkan dua siri hipotetikal sepanjang 250 hari, masing-masing dengan empat pelanggaran. Dalam siri A, pelanggaran berlaku pada hari 20, 80, 140 dan 220. Dalam siri B, ia berlaku pada hari 60, 61, 180 dan 181. Kedua-duanya mempunyai x = 4 dan p̂ = 1.6%, maka statistik Kupiec adalah sama. Namun, B mempunyai dua pasangan pelanggaran pada hari berturutan, sedangkan A tiada.
Rajah di bawah menunjukkan secara konsep sebab turutan siri hit wajar disimpan, bukan jumlah keseluruhannya sahaja. Ini bukan siri data 250 hari atau hasil ujian. Pelanggaran berturut-turut boleh selaras dengan model yang lambat bertindak terhadap perubahan turun naik, tetapi beberapa titik tidak cukup untuk mengenal pasti puncanya. Pola itu juga boleh mencerminkan salah spesifikasi model, kejutan pasaran, perubahan portfolio, tempoh bertindih, atau konvensyen data dan masa.
Biarkan nᵢⱼ ialah bilangan peralihan apabila penunjuk sebelumnya bernilai i dan penunjuk semasa j; 0 bermaksud tiada pelanggaran dan 1 bermaksud ada pelanggaran. Selain sempadan sampel, siri A mempunyai n₀₁ = 4 dan n₁₁ = 0, manakala B mempunyai n₀₁ = 2 dan n₁₁ = 2. Kedua-duanya mempunyai empat pelanggaran, tetapi beberapa hit dalam B berlaku selepas hit lain. Inilah maklumat yang digunakan oleh ujian kebebasan tertib pertama.
Jadual peralihan penuh ialah A: n₀₀ = 241, n₀₁ = 4, n₁₀ = 4, n₁₁ = 0; B: masing-masing 243, 2, 2 dan 2. Kebarangkalian hit terlaras selepas hari tanpa pelanggaran ialah n₀₁/(n₀₀+n₀₁); selepas pelanggaran ialah n₁₁/(n₁₀+n₁₁). Bagi A nilainya 4/245 ≈ 1.63% dan 0/4 = 0%. Bagi B nilainya 2/245 ≈ 0.82% dan 2/4 = 50%. Nilai 50% itu datang daripada hanya empat peralihan hipotetikal selepas hit, bukannya anggaran yang boleh dipercayai tentang risiko hari berikutnya bagi model sebenar.

Apakah tambahan yang diberikan oleh ujian kebebasan Christoffersen?
Ujian kebebasan Christoffersen menilai sama ada kebarangkalian pelanggaran hari ini berubah mengikut sama ada pelanggaran berlaku semalam. Tulis π₀ = Pr(Iₜ = 1 | Iₜ₋₁ = 0) dan π₁ = Pr(Iₜ = 1 | Iₜ₋₁ = 1). Di bawah hipotesis nol kebebasan, π₀ = π₁. Di bawah alternatif, kedua-dua kebarangkalian peralihan dianggarkan secara berasingan menggunakan n₀₀, n₀₁, n₁₀ dan n₁₁.
Statistik nisbah kebolehjadian membandingkan kedua-dua model dan lazimnya dinilai dengan rujukan asimptotik khi kuasa dua satu darjah kebebasan. Berbeza daripada POF, ujian ini bergantung pada turutan penunjuk. Jika pelanggaran cenderung diikuti oleh pelanggaran lain, π₁ mungkin melebihi π₀. Ujian ini khusus untuk kebergantungan tertib pertama dalam siri binari; ia tidak menguji setiap cara maklumat lalu, turun naik atau keadaan portfolio boleh meramalkan kerugian masa hadapan. Makalah Christoffersen 1998 membangunkan penilaian liputan bersyarat bagi ramalan selang.
Apabila pelanggaran sedikit, anggaran peralihan boleh menjadi sangat tidak stabil. Siri tanpa hit berturut-turut mungkin menghasilkan anggaran sempadan π₁ = 0, tetapi itu tidak menunjukkan hit kedua mustahil. Ia hanya bermakna tiada hit kedua berlaku dalam sampel ini. Semak bilangan peralihan dan saiz sampel bersama statistik. Jangan tafsir jadual yang jarang sebagai anggaran tepat bagi risiko ekor hari berikutnya.
Liputan bersyarat menggabungkan kekerapan dan kebebasan
Ujian liputan bersyarat menggabungkan statistik kekerapan Kupiec dengan statistik kebebasan Christoffersen: LR꜀꜀ = LRᵤ꜀ + LRᵢₙd. Hipotesis nol gabungan menyatakan kebarangkalian pelanggaran ialah α dan pelanggaran bebas dari semasa ke semasa. Dalam kerangka sampel besar standard, jumlah itu dibandingkan dengan taburan khi kuasa dua dua darjah kebebasan.
Laporkan keputusan komponen selain ujian gabungan. Penolakan liputan bersyarat bermaksud kedua-dua syarat bersama tidak serasi dengan siri yang diperhatikan di bawah andaian ujian; ia tidak mengenal pasti puncanya. Jika POF menolak tetapi kebebasan tidak, jumlah keseluruhan mungkin isyarat yang lebih jelas. Jika ujian kebebasan menolak, periksa masa pelanggaran walaupun jumlahnya hampir dengan sasaran. Jika kedua-duanya tidak menolak, sampel mungkin terlalu pendek untuk mendedahkan salah spesifikasi.
Tafsiran ujian ini terhad. Ia memampatkan hasil setiap hari kepada nilai binari, jadi ia tidak membezakan kerugian yang melebihi VaR sebanyak $1 daripada kerugian yang melebihi sebanyak $1 juta. Ujian ini juga tidak mengesahkan keseluruhan taburan kerugian atau membuktikan Expected Shortfall adalah betul. Untuk melihat perbezaan soalan risiko ekor yang dijawab oleh VaR dan Expected Shortfall, baca panduan VaR berbanding Expected Shortfall.
Pelanggaran jarang menyukarkan inferens sampel pendek
Pada VaR 99%, sampel 250 hari hanya menjangkakan 2.5 pelanggaran. Jika hit 1% adalah bebas, bilangan jangkaan peralihan hit-ke-hit merentas 249 pasangan bersebelahan ialah kira-kira 249 × 0.01² = 0.025. Kebanyakan sampel sedemikian tidak akan mempunyai pasangan berturutan walaupun model dilaras dengan betul. Kekurangan ini menyukarkan anggaran kebarangkalian peralihan dengan tepat dan boleh mengehadkan kuasa ujian kebergantungan.
Christoffersen dan Pelletier melaporkan bahawa backtest VaR sedia ada boleh mempunyai kuasa yang agak rendah dalam sampel kecil yang realistik, lalu mengkaji ujian berasaskan tempoh yang memodelkan masa antara pelanggaran dalam makalah 2004 mereka. Hasil itu menggalakkan diagnostik tambahan; ia tidak menjadikan ujian tempoh sentiasa lebih baik atau menghapuskan keperluan memadankan ujian dengan ramalan risiko dan reka bentuk sampel. Jika pemerhatian sedikit, nyatakan batasan itu dan jangan anggap keputusan tidak menolak sebagai pengesahan menyeluruh.
Kadar ekor sasaran turut penting. Pada VaR 95%, sampel 250 hari menjangkakan 12.5 pelanggaran; pada VaR 99.9%, hanya 0.25. Nama statistik yang sama tidak menjadikan bukti daripada reka bentuk berbeza setanding. Nyatakan tahap keyakinan, tempoh, bilangan pemerhatian, sasaran dan bilangan diperhatikan, bilangan peralihan, serta sama ada pengiraan menggunakan rujukan asimptotik atau kaedah sampel terhingga.
Bilakah diagnostik lain patut digunakan?
Pilih diagnostik seterusnya dengan bertanya maklumat apa yang dibuang oleh dua ujian tersebut. Jika anda ingin menguji sama ada pelanggaran boleh diramal daripada hit tertunda, ramalan VaR atau pemboleh ubah lain yang diketahui ketika ramalan dibuat, ujian dynamic quantile (DQ) Engle dan Manganelli menguji sekatan pada penunjuk pelanggaran terpusat dan set instrumen yang dipilih. Kesimpulannya bergantung pada instrumen dan masa maklumat itu tersedia; ia bukan ujian bagi semua bentuk kegagalan bersyarat. Ujian berasaskan tempoh pula memeriksa masa menunggu antara pelanggaran dan meluaskan analisis dengan cara lain. Makalah CAViaR menerangkan kerangka DQ.
Jika kebimbangan anda ialah saiz kerugian selepas ambang VaR dilanggar, kekerapan dan kebebasan sahaja tidak mencukupi. Semak saiz kerugian berlebihan dan pilih kaedah penilaian Expected Shortfall yang sesuai dengan ramalan serta andaian. Jika masalahnya ialah memilih keputusan terbaik selepas menguji banyak model, backtest VaR tidak menyelesaikan isu pemilihan strategi; lihat PBO dan CSCV untuk diagnostik berasaskan kedudukan yang berbeza.
Laporan yang berguna menyatakan portfolio dan konvensyen kerugian, tempoh ramalan, tahap keyakinan, tarikh penilaian, cara ramalan dihasilkan, takrif pelanggaran, bilangan dijangka dan diperhatikan, statistik POF, bilangan peralihan, hasil kebebasan dan liputan bersyarat, serta batasan daripada saiz sampel atau tempoh bertindih. Sertakan graf ambang ramalan dan kerugian terealisasi, dan pastikan data penilaian kemudian tidak digunakan semasa memilih model. Langkah ini menjadikan bukti boleh ditafsir; keputusan backtest yang lulus tidak menjamin kawalan risiko masa hadapan.
Soalan lazim
Q1Jika ujian Kupiec tidak menolak, adakah model VaR saya tepat?
Tidak. Maksudnya ujian tidak menemui bukti yang mencukupi untuk menolak kadar pelanggaran yang ditetapkan, di bawah andaian ujian. Sampel pendek, terutama pada tahap keyakinan 99% atau lebih tinggi, mungkin mempunyai terlalu sedikit pelanggaran untuk mendedahkan masalah.
Q2Bolehkah dua model yang lulus ujian Kupiec yang sama mempunyai pola pelanggaran berbeza?
Ya. Statistik Kupiec bergantung pada bilangan, bukan turutan. Ujian kebebasan Christoffersen menambah maklumat sama ada pelanggaran berkumpul pada pemerhatian bersebelahan.
Q3Adakah ujian ini memberitahu saya sejauh mana kerugian boleh melebihi VaR?
Tidak. Ujian ini menggunakan penanda pelanggaran dan tidak mengukur saiz lebihan kerugian. Jika tahap kerugian selepas sempadan VaR dilanggar penting, semak kerugian ekor dan nilai Expected Shortfall secara berasingan.
Sumber dan bacaan lanjut
Laporkan masalah
Kami akan menyediakan e-mel dengan pautan artikel ini. Mark menerima laporan hanya selepas anda menghantarnya
Semakan pantas
Sudah membaca panduan? Uji diri dengan 3 soalan
Soalan 01
Ciri apakah yang digunakan oleh ujian POF Kupiec?
Pilih jawapan untuk melihat penjelasan
Glosari opsyen
The average loss from a chosen VaR quantile through the worst tail under a precise convention; it measures severity beyond the threshold rather than only its location.
Baca panduan terperinciGARCHA time-series model that updates conditional variance from past squared shocks and prior variance; it models volatility persistence, not return direction.
Baca panduan terperinciAssignmentThe process that requires an option writer to fulfill the contract after an exercise notice is allocated; it can create or remove an underlying position.
Baca panduan terperinci