Skip to content
Semua panduan opsi dan kontrak berjangka
Uji frekuensi dan waktu terjadinya pelanggaran VaRWaktu baca 12 menit

Backtesting VaR: Penjelasan Uji Kupiec dan Christoffersen

Pelajari bagaimana uji POF Kupiec dan uji cakupan bersyarat Christoffersen menilai pelanggaran VaR, cara membaca contoh 250 hari, dan mengapa tidak menolak bukan bukti akurasi.

Dalam panduan iniApa yang diperiksa oleh backtest VaR?

Ringkasan singkat

Backtest VaR membandingkan ambang kerugian yang diramalkan dengan kerugian yang terjadi sesudahnya. Uji Kupiec menilai apakah jumlah pelanggaran sesuai dengan tingkat target. Uji Christoffersen juga menilai apakah pelanggaran terjadi secara independen atau berkelompok. Keduanya memeriksa aspek berbeda dan tidak membuktikan bahwa model risiko benar.

Apa yang diperiksa oleh backtest VaR?

Value at Risk (VaR) adalah ambang kerugian yang terkait dengan tingkat keyakinan dan horizon tertentu. Jika VaR satu hari pada tingkat 99% adalah $10.000, model menempatkan probabilitas 1% pada kerugian satu hari yang lebih besar dari $10.000, berdasarkan informasi dan asumsi model. VaR bukan batas maksimum kerugian dan tidak menyatakan seberapa besar kerugian setelah ambang itu terlampaui.

Backtest mengubah rangkaian prakiraan dan hasil menjadi rangkaian penanda pelanggaran. Pada VaR harian 99%, model yang terkalibrasi seharusnya menghasilkan pelanggaran sekitar 1% dalam banyak observasi yang sebanding. Pernyataan ini memiliki dua bagian: frekuensi jangka panjang mendekati target, dan pelanggaran tidak muncul dengan pola yang bertentangan dengan prakiraan risiko bersyarat model. Uji proportion-of-failures (POF) Kupiec berfokus pada bagian pertama. Uji independensi dan cakupan bersyarat Christoffersen memasukkan urutan pelanggaran.

Perbedaannya praktis. Sebuah model dapat menghasilkan empat pelanggaran dalam setahun dan menempatkan semuanya berdekatan pada pekan yang bergejolak. Model lain dapat memiliki empat pelanggaran yang tersebar sepanjang tahun. Uji berbasis hitungan saja melihat empat pada keduanya; uji yang mempertimbangkan waktu melihat urutan yang berbeda. Uji di bawah membantu menjelaskan ciri-ciri itu, tetapi tidak menggantikan pemeriksaan posisi, data pasar, asumsi, atau besarnya kerugian. Panduan terpisah tentang GARCH dan pengelompokan volatilitas membahas cara model GARCH merepresentasikan pengelompokan volatilitas; model varians dan backtest menjawab pertanyaan berbeda.

Tetapkan definisi pelanggaran sebelum menghitung

Gunakan satu konvensi tanda secara konsisten. Misalkan Lₜ adalah kerugian terealisasi pada hari t dan VaRₜ|ₜ₋₁ adalah ambang satu hari yang diprakirakan menggunakan informasi sebelum hari t. Definisikan indikator pelanggaran Iₜ = 1 jika Lₜ > VaRₜ|ₜ₋₁, dan Iₜ = 0 jika tidak. Untuk model VaR 99%, probabilitas pelanggaran target adalah α = 1 − 0,99 = 0,01. Sebagian sumber menggunakan imbal hasil atau indikator cakupan interval; konvensi itu setara jika tanda dan probabilitasnya diterjemahkan dengan benar. Nyatakan definisi yang dipakai.

Prakiraan dan hasil harus merujuk pada portofolio, horizon, waktu valuasi, dan definisi kerugian yang sama. Jika prakiraan dibuat setelah penutupan pasar untuk hari perdagangan berikutnya, bandingkan dengan kerugian hari berikutnya menggunakan aturan valuasi yang konsisten. Tetapkan sebelumnya cara memperlakukan nilai yang sama persis dengan batas VaR, hari libur, observasi hilang, penutupan pasar, koreksi intrahari, dan perubahan portofolio. Pilihan ini dapat mengubah urutan hit, terutama ketika pelanggaran jarang.

Pisahkan pencocokan model dari evaluasi akhir. Jika parameter atau ambang risiko dipilih setelah periode pengujian dilihat, p-value tidak lagi menggambarkan pemeriksaan out-of-sample yang bersih. Untuk prakiraan bergulir, catat kapan setiap prakiraan dibuat dan informasi apa yang tersedia saat itu. Prakiraan beberapa hari yang saling tumpang tindih dapat membuat indikator pelanggaran saling bergantung. Uji standar di bawah bukan perbaikan otomatis untuk horizon yang tidak sesuai, kebocoran informasi masa depan, input yang direvisi, atau proses pemilihan model.

Pertanyaan apa yang dijawab uji POF Kupiec?

Misalkan ada T pasangan prakiraan-hasil yang sebanding dan x pelanggaran. Tingkat pelanggaran teramati adalah p̂ = x/T. Uji proportion-of-failures (POF) Kupiec, yang juga disebut uji cakupan tak bersyarat, berasal dari makalah Kupiec tahun 1995; tersedia pula catatan arsip Federal Reserve. Uji ini membandingkan dua likelihood binomial: model pertama menetapkan probabilitas pelanggaran pada target α, sedangkan model kedua mengestimasi probabilitasnya secara bebas sebagai p̂. Statistik rasio likelihood-nya adalah

LRᵤ꜀ = −2 ln [ (1−α)^(T−x) α^x / ((1−p̂)^(T−x) p̂^x) ].

Di bawah hipotesis nol, pelanggaran merupakan kejadian Bernoulli independen dengan probabilitas α. Untuk sampel yang cukup besar, statistik ini secara hampiran mengikuti distribusi chi-kuadrat dengan satu derajat kebebasan. Nilai yang besar menolak frekuensi pelanggaran yang ditentukan. Karena alternatif membebaskan probabilitas teramati, model dapat ditolak jika pelanggaran terlalu banyak maupun terlalu sedikit. Model yang hampir tidak pernah melampaui VaR belum tentu terkalibrasi; prakiraannya mungkin terlalu konservatif untuk tujuan yang dimaksud.

Uji POF memakai jumlah x, bukan tanggal terjadinya pelanggaran. Mengacak urutan indikator yang sama tidak mengubah statistiknya. Jadi, hasil POF tidak dapat membedakan empat pelanggaran yang tersebar dari empat yang berurutan. Likelihood Bernoulli juga memakai asumsi bahwa indikator pelanggaran independen untuk distribusi acuannya. Jika yang ingin diperiksa adalah pengelompokan, tambahkan uji dependensi alih-alih menyimpulkan pola dari hasil POF.

Contoh 250 hari menunjukkan mengapa p-value perlu konteks

Bayangkan rangkaian hipotetis 250 prakiraan VaR satu hari pada tingkat 99%. Tingkat target adalah α = 0,01, sehingga jumlah pelanggaran harapan di bawah hipotesis nol adalah Tα = 250 × 0,01 = 2,5. Misalkan terjadi empat pelanggaran. Tingkat teramati adalah p̂ = 4/250 = 0,016, atau 1,6%. Angka itu lebih tinggi dari target 1%, tetapi selisihnya saja belum menentukan apakah uji rasio likelihood menolak.

Dengan T = 250, x = 4, dan α = 0,01, diperoleh LRᵤ꜀ ≈ 0,769. Menggunakan acuan asimtotik chi-kuadrat(1), p ≈ 0,38; nilai kritis 5% sekitar 3,84. Berdasarkan hampiran itu, contoh ini tidak menolak cakupan tak bersyarat pada tingkat 5%. Perhitungan ini hanya ilustrasi hipotetis, bukan hasil empiris atau ambang persetujuan yang disarankan.

Dua log-likelihood memperlihatkan asal statistiknya. Dengan probabilitas target yang tetap, ℓ₀ = 246 ln(0,99) + 4 ln(0,01) ≈ −20,893. Dengan tingkat teramati yang tidak dibatasi, ℓ₁ = 246 ln(0,984) + 4 ln(0,016) ≈ −20,508. Kecocokan bebas lebih tinggi sekitar 0,385 unit log-likelihood, sehingga LRᵤ꜀ = −2(ℓ₀ − ℓ₁) ≈ 0,769. Uji ini membandingkan kehilangan kecocokan relatif terhadap model target, bukan mengukur selisih dalam dolar.

Tidak menolak bukan bukti bahwa model terkalibrasi dengan baik. Hanya 2,5 pelanggaran yang diharapkan, sehingga satu atau dua kejadian tambahan mengubah tingkat teramati secara nyata. Acuan chi-kuadrat bersifat asimtotik dan uji kejadian langka dapat memiliki daya rendah pada sampel sebesar ini. Baca statistik bersama jumlah harapan, horizon prakiraan, rancangan uji, dan ukuran sampel. P-value bukan probabilitas bahwa model VaR benar.

Jumlah pelanggaran yang sama dapat menyembunyikan waktu yang berbeda

Bandingkan dua urutan hipotetis selama 250 hari, masing-masing dengan empat pelanggaran. Pada urutan A, pelanggaran terjadi pada hari ke-20, 80, 140, dan 220. Pada urutan B, pelanggaran terjadi pada hari ke-60, 61, 180, dan 181. Keduanya memiliki x = 4 dan p̂ = 1,6%, sehingga statistik Kupiec-nya sama. Namun, B memiliki dua pasang pelanggaran pada hari berurutan, sedangkan A tidak.

Skema di bawah mengilustrasikan alasan menyimpan urutan hit, bukan hanya jumlahnya. Ini bukan rangkaian data 250 hari atau hasil uji. Pelanggaran berurutan dapat sesuai dengan model yang lambat merespons perubahan volatilitas, tetapi beberapa titik saja tidak cukup untuk memastikan penyebabnya. Pola itu juga dapat mencerminkan salah spesifikasi, guncangan pasar, perubahan portofolio, horizon yang tumpang tindih, atau konvensi data dan waktu.

Misalkan nᵢⱼ adalah jumlah transisi ketika indikator sebelumnya bernilai i dan indikator saat ini j; 0 berarti tidak ada pelanggaran dan 1 berarti ada. Untuk transisi selain batas sampel, urutan A memiliki n₀₁ = 4 dan n₁₁ = 0, sedangkan B memiliki n₀₁ = 2 dan n₁₁ = 2. Keduanya memiliki empat pelanggaran, tetapi beberapa pelanggaran di B terjadi setelah pelanggaran lain. Inilah informasi yang digunakan uji independensi orde pertama.

Tabel transisi lengkapnya adalah A: n₀₀ = 241, n₀₁ = 4, n₁₀ = 4, n₁₁ = 0; B: masing-masing 243, 2, 2, dan 2. Probabilitas hit terpasang setelah hari tanpa pelanggaran adalah n₀₁/(n₀₀+n₀₁); setelah pelanggaran adalah n₁₁/(n₁₀+n₁₁). Untuk A, nilainya 4/245 ≈ 1,63% dan 0/4 = 0%. Untuk B, nilainya 2/245 ≈ 0,82% dan 2/4 = 50%. Nilai 50% itu hanya berasal dari empat transisi hipotetis setelah hit, bukan estimasi kredibel atas risiko model nyata pada hari berikutnya.

Diagram konseptual tanpa teks membandingkan dua urutan pelanggaran VaR dengan panjang dan jumlah pelanggaran yang sama: satu tersebar, satu lagi berkelompok dalam pasangan hari berurutan.
Jumlah pelanggaran yang sama dapat memiliki waktu kejadian berbeda. Skema ini hanya menunjukkan pengelompokan; bukan data pasar atau hasil uji.

Apa tambahan dari uji independensi Christoffersen?

Uji independensi Christoffersen dalam makalahnya tahun 1998 menilai apakah probabilitas pelanggaran hari ini berubah menurut ada tidaknya pelanggaran kemarin. Tuliskan π₀ = Pr(Iₜ = 1 | Iₜ₋₁ = 0) dan π₁ = Pr(Iₜ = 1 | Iₜ₋₁ = 1). Di bawah hipotesis nol independensi, π₀ = π₁. Di bawah alternatif, kedua probabilitas transisi diestimasi secara terpisah menggunakan n₀₀, n₀₁, n₁₀, dan n₁₁.

Statistik rasio likelihood membandingkan kedua model dan lazimnya dinilai dengan acuan asimtotik chi-kuadrat satu derajat kebebasan. Tidak seperti POF, uji ini bergantung pada urutan indikator. Jika pelanggaran cenderung mengikuti pelanggaran lain, π₁ dapat lebih besar daripada π₀. Uji ini secara khusus menilai dependensi orde pertama pada urutan biner; uji ini tidak memeriksa semua cara informasi masa lalu, volatilitas, atau keadaan portofolio dapat memprediksi kerugian.

Dengan sedikit pelanggaran, estimasi transisi bisa sangat tidak stabil. Urutan tanpa hit berurutan dapat menghasilkan estimasi batas π₁ = 0, tetapi itu tidak menunjukkan bahwa hit kedua mustahil. Artinya hanya tidak ada hit kedua pada sampel tersebut. Periksa jumlah transisi dan ukuran sampel bersama statistik. Jangan membaca tabel yang jarang sebagai estimasi risiko ekor hari berikutnya yang presisi.

Cakupan bersyarat menggabungkan frekuensi dan independensi

Uji cakupan bersyarat menggabungkan statistik frekuensi Kupiec dengan statistik independensi Christoffersen: LR꜀꜀ = LRᵤ꜀ + LRᵢₙd. Hipotesis nol gabungannya menyatakan probabilitas pelanggaran sama dengan α dan pelanggaran independen sepanjang waktu. Dalam kerangka sampel besar standar, jumlah tersebut dibandingkan dengan distribusi chi-kuadrat dua derajat kebebasan.

Laporkan hasil masing-masing komponen selain uji gabungannya. Penolakan cakupan bersyarat berarti kedua syarat bersama-sama tidak konsisten dengan urutan yang diamati di bawah asumsi uji; hasil itu tidak langsung menunjukkan penyebabnya. Jika POF menolak sedangkan independensi tidak, frekuensi total mungkin menjadi sinyal yang lebih jelas. Jika independensi menolak, periksa waktu pelanggaran meskipun jumlahnya dekat dengan target. Jika keduanya tidak menolak, sampel mungkin terlalu pendek untuk mengungkap salah spesifikasi.

Interpretasinya terbatas. Uji ini mengubah hasil harian menjadi biner, sehingga tidak membedakan kerugian yang melampaui VaR sebesar $1 dari yang melampauinya sebesar $1 juta. Uji ini juga tidak memvalidasi sisa distribusi kerugian atau membuktikan Expected Shortfall benar. Untuk perbedaan pertanyaan tentang risiko ekor, lihat panduan VaR versus Expected Shortfall.

Pelanggaran yang jarang menyulitkan inferensi sampel pendek

Pada VaR 99%, sampel 250 hari hanya mengharapkan 2,5 pelanggaran. Jika hit independen dengan peluang 1%, jumlah harapan transisi hit-ke-hit pada 249 pasangan berurutan sekitar 249 × 0,01² = 0,025. Sebagian besar sampel seperti itu tidak akan memiliki pasangan berurutan meski model terkalibrasi. Kelangkaan ini membuat probabilitas transisi sulit diestimasi dengan presisi dan dapat membatasi daya uji dependensi.

Dalam makalah tahun 2004, Christoffersen dan Pelletier melaporkan bahwa backtest VaR yang ada dapat memiliki daya rendah dalam sampel kecil yang realistis, lalu mengkaji uji berbasis durasi yang memodelkan jarak waktu antar-pelanggaran. Hasil itu menjadi alasan untuk mempertimbangkan diagnostik tambahan; bukan bukti bahwa uji durasi selalu lebih unggul atau menghilangkan kebutuhan mencocokkan uji dengan prakiraan risiko dan rancangan sampel. Jika observasi sedikit, nyatakan keterbatasannya dan jangan menganggap tidak menolak sebagai sertifikat kelayakan.

Tingkat target ekor juga penting. Pada VaR 95%, sampel 250 hari mengharapkan 12,5 pelanggaran; pada VaR 99,9%, hanya 0,25. Nama statistik yang sama tidak membuat bukti dari rancangan yang berbeda menjadi sebanding. Laporkan tingkat keyakinan, horizon, jumlah observasi, target dan jumlah aktual, jumlah transisi, serta apakah acuan asimtotik atau metode sampel terbatas yang digunakan.

Kapan diagnostik lain perlu digunakan?

Pilih diagnostik berikutnya dengan bertanya informasi apa yang dibuang oleh kedua uji tadi. Jika ingin menguji apakah pelanggaran dapat diprediksi dari hit tertunda, prakiraan VaR, atau variabel lain yang diketahui saat prakiraan dibuat, uji dynamic quantile (DQ) Engle dan Manganelli dalam makalah CAViaR menguji pembatasan atas indikator pelanggaran yang dipusatkan dan kumpulan instrumen yang dipilih. Kesimpulannya bergantung pada instrumen dan waktu ketersediaannya; uji ini bukan pemeriksaan atas setiap bentuk kegagalan bersyarat. Uji durasi berfokus pada waktu tunggu antar-pelanggaran dan memperluas analisis dengan cara lain.

Jika perhatian tertuju pada besarnya kerugian setelah ambang VaR dilewati, frekuensi dan independensi saja tidak cukup. Tinjau ukuran kerugian berlebih dan pilih metode evaluasi Expected Shortfall yang sesuai dengan prakiraan dan asumsi. Jika masalahnya adalah memilih hasil terbaik setelah mencoba banyak model, backtesting VaR tidak menyelesaikan risiko seleksi strategi; lihat PBO dan CSCV untuk diagnostik peringkat yang berbeda.

Laporan yang berguna menyebut portofolio dan konvensi kerugian, horizon prakiraan, tingkat keyakinan, tanggal evaluasi, cara menghasilkan prakiraan, definisi pelanggaran, jumlah harapan dan aktual, statistik POF, jumlah transisi, hasil independensi dan cakupan bersyarat, serta keterbatasan ukuran sampel atau horizon yang tumpang tindih. Sertakan grafik ambang prakiraan dan kerugian terealisasi, serta jangan gunakan kembali data evaluasi saat memilih model. Langkah ini membuat bukti historis dapat ditafsirkan; hasil lulus tidak menjamin pengendalian risiko di masa depan.

Pertanyaan umum

Q1Jika uji Kupiec tidak menolak, apakah VaR saya akurat?

Tidak. Artinya uji tidak menemukan bukti yang cukup untuk menolak tingkat pelanggaran yang ditentukan, di bawah asumsi uji. Sampel pendek, khususnya pada tingkat keyakinan 99% atau lebih tinggi, mungkin memiliki terlalu sedikit pelanggaran untuk menunjukkan masalah.

Q2Bisakah dua model yang sama-sama lolos uji Kupiec memiliki pola pelanggaran berbeda?

Bisa. Statistik Kupiec bergantung pada jumlah, bukan urutan. Uji independensi Christoffersen menambahkan informasi tentang apakah pelanggaran mengelompok pada observasi yang berdekatan.

Q3Apakah uji ini memberi tahu seberapa besar kerugian setelah VaR terlampaui?

Tidak. Uji menggunakan penanda biner dan tidak mengukur besarnya kerugian berlebih. Jika ukuran kerugian setelah melewati VaR penting, telaah kerugian ekor dan evaluasi Expected Shortfall secara terpisah.

Sumber dan bacaan lanjutan

Laporkan masalah

Kami akan menyiapkan email berisi tautan artikel ini. Mark menerima laporan setelah Anda mengirimkannya

Cek cepat

Sudah membaca panduannya? Uji diri dengan 3 pertanyaan

Pertanyaan 1 / 3

Pertanyaan 01

Fitur apa yang digunakan uji POF Kupiec?

Pilih jawaban untuk melihat penjelasannya

Glosarium opsi