Skip to content
Tüm opsiyon ve vadeli işlem rehberleri
Tahmin modeli karşılaştırması14 dakikalık okuma

Model Confidence Set (MCS): tek bir kazananı zorlamadan tahmin modellerini karşılaştırın

Model Confidence Set'in, kanıtların ayırt edemediği tahmin modellerini tutmak için sıralı testleri ve bağımlı veriye uygun bootstrap yöntemini nasıl kullandığını öğrenin.

Bu rehberdeModel Confidence Set hangi soruyu yanıtlar?

Kısa özet

Model Confidence Set (MCS), önceden tanımlanmış tahmin prosedürleri ailesini seçilen kayıp fonksiyonuna göre karşılaştırır ve daha kötü olduğu gösterilemeyen adayları döndürür. Örneklem adayları ayırt edemiyorsa birden fazla model kalabilir; sonuç aday ailesine, tahmin tasarımına, kayba ve çıkarım prosedürüne bağlıdır.

Model Confidence Set hangi soruyu yanıtlar?

Ertesi günün volatilitesini tahmin eden birkaç prosedürünüz olduğunu düşünün. Hataları aynı değildir, ancak örneklem hangi prosedürün beklenen kaybının en düşük olduğunu belirlemek için kısa ya da gürültülü olabilir. En düşük ortalama kayba sahip prosedürü seçmek, fark yalnızca örneklem değişkenliğinden kaynaklansa bile tek bir kazananı zorla belirler. MCS bunun yerine küme biçiminde yanıt verir: belirli bir performans ölçütüne göre hangi adaylar en iyi olma olasılığıyla istatistiksel olarak uyumludur?

MCS, aday kümesi \(\mathcal M_0\), bir kayıp veya başka bir ölçüt ve güven düzeyiyle başlar. Hâlâ değerlendirilen adayların tahmin yeteneklerinin eşit olup olmadığını tekrar tekrar sınar. Test reddederse, eleme kuralı görece zayıf bulunan bir adayı çıkarır ve daha küçük kümede test sürer. Kalan adaylar MCS'yi oluşturur. Hansen, Lunde ve Nason bu prosedürü belirtilen koleksiyondaki en iyi model veya modeller için bir güven kümesi olarak tanıtır; veriler kesin değilken bir parametre güven aralığının birden fazla değer içerebilmesine benzer (2011 tarihli makale).

“En iyi” yalnızca karşılaştırmaya göredir: dahil edilen adaylar, hedef, tahmin ufku, her başlangıç anında mevcut bilgi ve puanlama ölçütü. MCS hiçbir adayın gerçek veri üretme süreci olmasını şart koşmaz ve en iyi beklenen performansı paylaşan birden fazla adayı tutabilir. Tutulan bir modelin doğru olduğuna ilişkin posterior olasılık vermez.

Aday ailesini ve tahmin sorusunu baştan sabitleyin

Kayıpları hesaplamadan önce \(\mathcal M_0\)'ı tanımlayın. Aday; tahmin ve güncelleme kurallarıyla birlikte tahmin edilmiş bir model ya da istatistiksel model olarak ifade edilmeyen bir tahmin prosedürü olabilir. Volatilite dağılımı, kayan pencere, parametre güncellemeleri ve tahmin ufku değişebiliyorsa yalnızca “GARCH” demek yeterli değildir; bu seçimlerin her biri ayrı bir aday oluşturabilir.

Her aday, aynı başlangıç anları ve ufuk için aynı hedefi, yalnızca o sırada mevcut olacak bilgiyi kullanarak tahmin etmelidir. Bir model bir günlük varyansı, diğeri beş günlük volatiliteyi tahmin ediyorsa ham kayıpları doğrudan ve adil biçimde karşılaştırılamaz. Ortak değerlendirme örneklemi kullanın, eksik gözlemleri açıkça hizalayın ve veri sürümünü, başlangıç tahmin penceresini, özyinelemeli veya kayan planı ve revize edilmiş girdilerin nasıl ele alındığını kaydedin. Zaman içinde örtüşen tahminlerde yakın başlangıçların kayıpları aynı gözlemleri paylaşabilir.

Sonuçlara bakmadan önce ölçütü seçin. Kare hata, mutlak hata veya karara özgü kayıp nokta tahminlerini farklı sıralayabilir. Varyans tahmini, gürültülü proxy'ye uygun volatilite kaybı gerektirebilir; kantil tahmini ise mean squared error yerine quantile score kullanmalıdır. Bir kayıp fonksiyonuna göre iyi olan MCS, başka bir kayba göre de iyi olmak zorunda değildir. Aynı değerlendirme sonuçları görüldükten sonra aday listesi daraltıldıysa resmi küme raporlanmayan bu seçime koşulludur ve tüm aramayı yansıtmaz.

Ortak tahminleri eşleştirilmiş kayıp farklarına dönüştürün

\(y_{t+h}\), \(t\) başlangıç anında yapılan tahminin gerçekleşen hedefi; \(\hat y_{i,t+h|t}\) ise \(i\) adayının tahmini olsun. Önceden seçilmiş \(L\) kayıp fonksiyonu için her aday ve ortak başlangıç anında bir kayıp hesaplayın:

\[ L_{i,t}=L(y_{t+h},\hat y_{i,t+h|t}) \]

Daha düşük kaybın tercih edildiğini varsayın. \(i\) ve \(j\) adayları için eşleştirilmiş farkı şöyle tanımlayın:

\[ d_{ij,t}=L_{i,t}-L_{j,t}, \qquad \bar d_{ij}=\frac{1}{P}\sum_{t=1}^{P}d_{ij,t} \]

Burada \(P\), ortak tahmin başlangıçlarının sayısıdır. Bu işaret tanımında pozitif \(\bar d_{ij}\), örneklemde \(i\)'nin ortalama kaybının \(j\)'den yüksek olduğu anlamına gelir; negatif değer \(i\)'yi destekler. Eşleştirme önemlidir çünkü iki aday da aynı gerçekleşen sonuçlarla karşılaşır. Ortak piyasa şokları iki kaybı da artırabilir; fark ise göreli performansı ayırır.

Mevcut \(\mathcal M\) kümesi için eşit tahmin yeteneği sıfır hipotezi şöyle yazılabilir:

\[ H_{0,\mathcal M}:\quad \mu_{ij}=E[d_{ij,t}]=0 \quad \text{her } i,j\in\mathcal M \text{ için} \]

Bu, birbirinden bağımsız ikili testlerin teker teker incelenmesi değil, mevcut küme hakkında ortak bir ifadedir. Özgün MCS çerçevesi, modeller arasındaki aramayı yönetmek için ortak eşdeğerlik testi ve eleme kuralı kullanır. Her tarihteki tahminlerin tamamen aynı olup olmadığını sormaz.

Mevcut kümeyi test edin ve eleme kuralını belirleyin

MCS prosedürü küme düzeyinde test ile eleme adımını sırayla uygular. \(\mathcal M=\mathcal M_0\) ile başlayıp seçilen \(\alpha\) düzeyinde eşit tahmin yeteneğini sınayın. Sıfır hipotezi reddedilmezse durup mevcut kümeyi raporlayın. Reddedilirse önceden belirlenmiş eleme kuralıyla bir adayı çıkarın ve daha küçük kümeyi yeniden test edin. Prosedürün varsayımları altında kalan küme \((1-\alpha)\) MCS'dir.

Makale yaygın iki istatistiği geliştirir. Range istatistiği, standartlaştırılmış ikili kayıp farklarının en büyüğünü arar:

\[ T_{R,\mathcal M}=\max_{i,j\in\mathcal M}|t_{ij}|, \qquad t_{ij}=\frac{\bar d_{ij}}{\widehat{\mathrm{se}}(\bar d_{ij})} \]

Bunun eşleşen eleme kuralı, başka bir adaya göre standartlaştırılmış dezavantajı en büyük olan adayı çıkarır. İkinci istatistik her adayı mevcut kümenin ortalama performansıyla karşılaştırır:

\[ T_{\max,\mathcal M}=\max_{i\in\mathcal M}t_{i\cdot}, \qquad d_{i\cdot,t}=\frac{1}{|\mathcal M|}\sum_{j\in\mathcal M}d_{ij,t} \]

Burada \(t_{i\cdot}\), \(d_{i\cdot,t}\)'nin ortalamasını standartlaştırır; eşleşen kural küme ortalamasına göre standartlaştırılmış fazla kaybı en yüksek adayı çıkarır. İstatistik ile eleme kuralı bir çifttir. Küçük kümeyi hangisinin verdiğini gördükten sonra karıştırmayın; prosedürü önceden seçip raporlayın. MCS makalesi, reddetme testinin çıkarılacak adayı belirleyen kuralla neden tutarlı olması gerektiğini açıklar (Hansen, Lunde ve Nason).

Bootstrap'te zaman bağımlılığını koruyun

Maksimum istatistiğinin dağılımı, adayların kayıp farklarının ortak değişkenliğine bağlıdır. Her model veya tarihi bağımsız gözlem saymak iki bağımlılık türünü bozabilir: ardışık kayıplar seri ilişkili olabilir ve aynı tarihte iki adayın kaybı eşleştirilmiştir. Bu nedenle MCS bootstrap'i küme istatistiğinin sıfır dağılımını yaklaştırırken ilgili ortak zaman serisi yapısını korumalıdır.

Bir yaklaşım, aday kayıpları veya farkları vektörünün hizalanmış zaman bloklarını yeniden örneklemektir. Stationary bootstrap'te blok uzunlukları rastgeledir ve yeniden örneklenen seri rastgele seçilmiş bir tarihten başlayabilir. Politis ve Romano bu yöntemi zayıf bağımlı durağan gözlemler için tanıttı (1994 tarihli makale). MCS yazarları block bootstrap uygulamalarını anlatır ve stationary bootstrap'i alternatif olarak belirtir. Her modelin kayıp serisini ayrı ayrı yeniden örneklemek aynı tarihteki eşleşmeyi bozar ve karşılaştırmayı değiştirebilir.

Ortalama blok uzunluğu, bootstrap türü, eşitlik sıfır hipotezi altında merkezleme, tekrar sayısı ve tahmin ufku belirsizlik tahminini etkiler. Örtüşen uzun tahmin ufukları kayıp farklarındaki bağımlılığı artırabilir; ancak tüm hedeflere ve örneklemlere uyan evrensel bir blok uzunluğu yoktur. Tasarımı açıklayın ve makul bağımlılık ayarlarında sonucun değişip değişmediğini inceleyin. Bootstrap çıktısı varsayımlar altında bir yaklaşımdır; look-ahead, tekrar kullanılan holdout, durağan olmayan skor davranışı veya eksik aday ailesini düzeltmez.

Dört model için varsayımsal karşılaştırmayı hesaplayın

A, B, C ve D prosedürlerinin ortak 120 günlük başlangıçta aynı volatilite hedefini tahmin ettiğini varsayın. Ortalama kare hata kayıpları, örnek amaçlı yüzde puan kare birimlerinde sırasıyla 1.20, 1.23, 1.45 ve 1.90 olsun. Bu ortalamalar A'yı ilk, D'yi son sıraya koyar; ancak sıralama tek başına örneklem belirsizliğini göstermez.

A ile B arasındaki ortalama eşleştirilmiş kayıp farkı \(1.20-1.23=-0.03\)'tür. Bağımlılığı dikkate alan standart hata \(0.04\) ise ikili istatistik \(-0.03/0.04=-0.75\) olur. Bu tek fark A ve B arasında açık bir istatistiksel ayrım göstermez. MCS burada durmaz; küme istatistiği dört adayın ortak farklarını değerlendirir.

Örnek olarak, 120 başlangıcın tam kayıp serisine uygulanan block-bootstrap MCS'nin \(T_R\), \(\alpha=0.05\) ve en kötü adayı çıkaran tutarlı bir kural kullandığını varsayın. Tam kümenin p-value değeri 0.018 olsun, D çıkarılsın ve ardından \(\{A,B,C\}\) için 0.11 elde edilsin. 0.11, 0.05'ten büyük olduğundan prosedür durur ve varsayımsal %95 MCS \(\{A,B,C\}\) olur. C'nin ortalama kaybı A'dan yüksek olsa da kalır: bu varsayımsal ortak test C'nin daha kötü olduğunu göstermemiştir.

Bu p-value değerleri adımları göstermek için uydurulmuştur; dört ortalama kayıptan veya A–B farkından yeniden hesaplanamaz. Gerçek sonuç için başlangıç başına tam kayıp serisi, aday tahminleri, bootstrap tasarımı ve eleme sırası gerekir. Girdileri saklayıp her reddetmede hangi adayın çıktığını raporlayın. <!-- learn:illustration -->

Birkaç tahmin yolu yumuşak bir bant içinde birbirine yakın kalırken uzaktaki yollar silikleşiyor; tek kazanan yerine bir küme kalıyor
İstatistiksel olarak ayırt edilemeyen birkaç adayı koruyan tahmin karşılaştırmasının kavramsal çizimi; gözlenen tahminler, ampirik sonuçlar veya alım satım sinyali değildir.

Kalan kümeyi iddiayı abartmadan yorumlayın

%95 güven düzeyinde MCS, düzenlilik koşulları ve test varsayımları altında belirlenmiş kümedeki en iyi adayı belirtilen asimptotik kapsama oranıyla içerecek şekilde tasarlanır. Bu, tutulan her modelin en iyi olma olasılığının %95 olduğu anlamına gelmez. Güven ifadesi tekrarlanan örneklerde yöntemin kapsama davranışıyla ilgilidir; model etiketlerinin posterior dağılımı değildir.

Eşit tahmin yeteneğini reddedememek adayların beklenen kayıplarının tam olarak eşit olduğunu kanıtlamaz. Değerlendirme dönemi kısa, kayıp farkları çok değişken veya adaylar birbirine yakınsa testin gücü sınırlı olabilir. Büyük bir kümenin kalması, verilerin seçenekleri ayıramadığını dürüstçe gösterebilir. MCS adayları zorunlu bir dış standarda göre değil, birbirlerine göre karşılaştırdığı için kümedeki tüm modeller mutlak anlamda kötü de olabilir.

Küme, \(\mathcal M_0\)'a dahil edilen adaylarla sınırlıdır. Gerçekten daha iyi bir tahmin prosedürü dışarıda bırakıldıysa MCS onu bulamaz. Aynı değerlendirme dönemine daha önce bakıldıktan sonra model analizden çıkarıldıysa nominal kapsama bu kaydedilmemiş aramayı hesaba katmaz. Adayların nasıl üretildiğini ve elendiğini açıklayın. Birkaç aday aynı en iyi beklenen kaybı paylaşıyorsa birden fazlasının kalması yöntemle tutarlıdır.

MCS'yi ikili ve benchmark testlerinden ayırın

Diebold–Mariano testi iki tahmin prosedürünün eşleştirilmiş kayıp farkına odaklanır. MCS bir kümeyi tekrar tekrar test eder ve ortak eleme prosedüründe kalan adayları raporlar. Çok sayıda DM testi çalıştırıp anlamlı olmayan çiftleri tutmak otomatik olarak MCS'ye eşdeğer değildir; ortak bootstrap ve tutarlı eleme kuralı önemlidir.

Clark–West testi, bir model kısıtlı benchmark'ı içerdiğinde ve tahmin gürültüsü ham farkı etkilediğinde daha dar bir kare hata karşılaştırmasını ele alır. MCS iç içe adaylar gerektirmez ve kullanıcı tanımlı bir kayıp kullanabilir; yine de ortak tahmin tasarımına ihtiyaç duyar.

White'ın Reality Check'i ve Hansen'in Superior Predictive Ability testi, aranan bir aileden en az bir üyenin belirlenmiş benchmark'ı geçip geçmediğini sorar. MCS benchmark'a bağlı değildir ve görece üstün adayları bir küme olarak tanımlar. Tüm yöntemlerde arama kapsamı ve bağımlılık doğru raporlanmalı, ancak sıfır hipotezleri farklıdır. Reality Check ve SPA kılavuzuna, ayrıca White (2000) ve Hansen (2005) çalışmalarına bakın.

Tasarımı raporlayın ve tahmin sıralamasını işlem değerinden ayırın

Yeniden üretilebilir bir MCS raporu her aday prosedürü, ortak hedef ve ufku, tahmin başlangıcı ve bilgi kurallarını, tahmin programını, değerlendirme tarihlerini, eksik verilerin ele alınışını, kayıp formülünü ve tercih edilen yönü belirtir. Anlamlılık düzeyini, test istatistiğini ve eleme kuralını, bootstrap türünü, blok uzunluğunu, merkezlemeyi, tekrar sayısını, her adımdaki p-value değerlerini ve son üyeleri de bildirin. Ortalama kayıplar bağlam sağlar, ancak ortak çıkarımın yerini sıralama tablosu almamalıdır.

Volatilite değerlendirmesinde gözlenen proxy'nin nasıl oluşturulduğunu ve gürültülü ya da revize edilmiş olup olmadığını açıklayın. Çok adımlı tahminlerde örtüşen hedef pencerelerini ve bağımlılık yöntemini belirtin. Üyeliği etkiliyorsa kayıp, örneklem dönemi ve bootstrap ayarlarındaki makul değişikliklere duyarlılığı gösterin. Çıkarılan adaylar ve prosedür ayrıntıları olmadan tek bir küçük p-value sonucu yeniden üretmeye yetmez.

MCS, tahmin prosedürlerini tek bir ölçüte göre sıralar. Nedensel yapıyı kanıtlamaz, veri üretme modelini belirlemez veya kalan tahminlerin kârlı işlem yaratacağını göstermez. Tahmini pozisyona çevirmek eşikler, pozisyon büyüklüğü, devir, uygulama zamanı, spread, ücret, slippage, finansman, borçlanma ve risk kısıtlarını ekler. Sabitlenmiş karar sürecini uygun sonraki verilerde ayrı değerlendirin ve net işlem sonuçlarını ayrıca bildirin. Kusurlu proxy'lerle volatilite skorları için QLIKE ve kare hata kaybı kılavuzuna bakın.

Sık sorulan sorular

Q1MCS tek bir en iyi model seçer mi?

Şart değil. Kanıtlar bir adayı ayırt ederse tek model kalabilir; örneklem hangisinin daha kötü olduğunu gösteremiyorsa birkaç model kalabilir. Uygulamaya almak için tek bir model seçmek ayrı bir karar kuralı gerektirir.

Q2MCS'deki bir modelin doğru olma olasılığı %95 midir?

Hayır. Güven düzeyi, yöntem varsayımları altında belirtilen ailedeki en iyi adayın tekrarlı örneklemlerde kapsanmasını anlatır. Modelin doğru olduğuna ilişkin posterior olasılık değildir.

Q3MCS volatilite tahminleri dışında da kullanılabilir mi?

Evet. Anlamlı ortak bir ölçüt ve uygun örnekleme tasarımı belirlenirse tahminleri, ekonometrik modelleri veya diğer prosedürleri karşılaştırabilir. Sonuç seçilen aday kümesine ve kayba bağlı kalır.

Q4MCS denediğim her modeli otomatik olarak hesaba katar mı?

Yalnızca gerçek arama aday ailesine ve değerlendirme prosedürüne yansıtılmışsa. Kaydedilmemiş eleme veya değerlendirme verilerinin tekrar tekrar kullanılması, sonradan MCS çalıştırmakla düzelmez.

Kaynaklar ve daha fazla okuma

Sorun bildir

Bu makalenin bağlantısını içeren bir e-posta hazırlayacağız. Mark bildirimi yalnızca gönderdiğinizde alır

Hızlı kontrol

Rehberi okudunuz mu? 3 soruyla kendinizi kontrol edin

Soru 1 / 3

Soru 01

Model Confidence Set ne raporlar?

Açıklamayı görmek için bir yanıt seçin

Opsiyon sözlüğü

Alım, satım ve opsiyon zincirinden zımni volatiliteye, Yunanlara ve alış-satış farkına uzanan temel terimlerin açık tanımları

Opsiyon sözlüğünü inceleyin
Aynı gerçekleşen sonuçlardaki kayıplara göre iki tahmini karşılaştırınDiebold–Mariano Testi: Tahmin Doğruluğunu KarşılaştırmaDiebold–Mariano testinin neyi karşılaştırdığını, kayıp farkları ve seri korelasyonun istatistiğe nasıl girdiğini ve tahmin doğruluğunun neden işlem kârı anlamına gelmediğini öğrenin.İç içe geçmiş tahminlerin karşılaştırılmasıİç İçe Geçmiş Tahminler için Clark–West Testi: Formül, Örnek ve Sınırlarİç içe geçmiş tahmin modellerinde MSPE karşılaştırmasının neden düzeltilmesi gerektiğini, Clark–West testinin nasıl hesaplandığını ve tek yönlü sonucun neyi kanıtlamadığını öğrenin.Backtestlerde veri taraması düzeltmesiAlım satım kurallarında White Reality Check ve Hansen SPA testiReality Check ile SPA'yı taranmış işlem kuralı aileleri üzerinden karşılaştırın; küresel sıfır hipotezini, bootstrap tasarımını ve yorumlama sınırlarını öğrenin.Volatilite tahminlerini değerlendirmeVolatilite Tahminlerinde QLIKE ve Kare Hata: Gürültülü Vekil ÖlçümlerVolatilite tahminlerinde QLIKE ile kare hatayı karşılaştırın, sıralamanın tersine döndüğü bir örneği inceleyin ve gürültülü gerçekleşen varyans vekillerinin beklenen tahmin sıralamasını hangi koşullarda koruduğunu öğreninYön tahminlerinin değerlendirilmesiPesaran–Timmermann Testi: Yön Tahmini Bilgi Katıyor mu?Pesaran–Timmermann testinin yön isabetlerini gerçekleşen ve tahmin edilen yükseliş oranlarına dayalı bir temel değerle nasıl karşılaştırdığını ve seri bağımlılığın çıkarımı neden değiştirdiğini öğrenin.