Diebold–Mariano Testi: Tahmin Doğruluğunu Karşılaştırma
Diebold–Mariano testinin neyi karşılaştırdığını, kayıp farkları ve seri korelasyonun istatistiğe nasıl girdiğini ve tahmin doğruluğunun neden işlem kârı anlamına gelmediğini öğrenin.
Bu rehberdeTest, tahminlerin beklenen kaybını karşılaştırır
Kısa özet
Diebold–Mariano (DM) testi, eşleştirilmiş aynı sonuçlar için iki tahmin yönteminin beklenen kayıplarının eşit olup olmadığını sorar. Kayıp farkları serisiyle çalışır; bu nedenle kayıp fonksiyonu, tahmin ufku ve tarihler arasındaki bağımlılık sonucu etkiler. Sıfır hipotezinin reddi, belirtilen değerlendirme tasarımında bir farkı destekler; bir modelin üstünlüğünü sürdüreceğini veya bir işlem stratejisinin maliyetlerden sonra kârlı olacağını göstermez.
Test, tahminlerin beklenen kaybını karşılaştırır
Diebold–Mariano testi, aynı hedefe yönelik iki tahmini aynı değerlendirme tarihlerinde karşılaştırır. Her tahmin başlangıcında iki yöntem de aynı gerçekleşen sonucu, tahmin ufkunu ve bilgi kesim anını kullanmalıdır. Ardından test, kayıp farklarının zamanla değişebilmesine izin vererek bir yöntemin ortalama kaybının diğerinden sistematik olarak farklı olup olmadığını değerlendirir.
Diebold ve Mariano, soruyu yalnızca ortalama karesel hata için değil, genel bir kayıp fonksiyonu için kurar. Özgün çalışmaları, rakip tahminlerin tahmin doğruluğunun eşit olduğu sıfır hipotezine yönelik testler geliştirir (Diebold ve Mariano, 1995). Burada “doğruluk”, karşılaştırmada seçilen kayıp fonksiyonuna göre daha düşük beklenen kayıp demektir. Tahminin doğru olduğu, nedensel açıklama sunduğu, dağılımın her bölümünde iyi kalibre edildiği veya her karara fayda sağladığı anlamına gelmez.
A ve B modellerinin aynı anda aynı gelecek getiriyi tahmin ettiğini varsayalım. DM testi, modellerden birindeki katsayının sıfır olup olmadığını ya da tahmin uyum değerlerinin eğitim örnekleminde aynı olup olmadığını sınamaz. Değerlendirme örneklemindeki tahmin hatalarının seçilen kayba nasıl dönüştüğünü karşılaştırır.
İstatistiği yorumlamadan önce tasarımı belirleyin: hedef, tahmin başlangıçları, ufuk, kayıp fonksiyonu, eksik sonuçların ele alınışı, yeniden tahmin takvimi ve tek ya da çift yönlü alternatif test sorusunu tanımlar. Bu tercihler modeller arasında farklıysa, kayıp farkı artık eş koşullarda bir karşılaştırmayı temsil etmez.
Eşleştirilmiş tahminleri ve kayıp farkını tanımlayın
Tahmin başlangıcı $t$ anındaki gerçekleşen hedef $y_t$, A ve B modellerinin tahminleri de sırasıyla $\hat y_{A,t}$ ve $\hat y_{B,t}$ olsun. Tahmin hataları $e_{A,t}=y_t-\hat y_{A,t}$ ve $e_{B,t}=y_t-\hat y_{B,t}$ şeklindedir. Bir $L$ kayıp fonksiyonu için tarih başına kayıp farkı şöyledir:
$$ d_t=L(e_{A,t})-L(e_{B,t}) $$
Bu işaret tanımında $d_t$ ortalamasının negatif olması, A'nın gözlenen kaybının daha düşük; pozitif olması, B'nin kaybının daha düşük olduğu anlamına gelir. Anakütle sıfır hipotezi $E[d_t]=0$ şeklindedir. Çift yönlü alternatif her iki yöndeki farkı, tek yönlü alternatif ise önceden belirlenen yönü sınar. Hangi modelin kazandığını gördükten sonra yön seçmeyin.
Karesel hata kaybında, $L(e)=e^2$, büyük hatalar orantısız ağırlık taşır. Mutlak hata kaybında, $L(e)=|e|$, tek bir büyük hata sıralamayı daha az belirler. Kantitatif kayıp asimetrik bir tahmin hedefine uyabilir; diğer kayıplar tahmin performansının başka yanlarını ölçer. Kayıp değişince model sıralaması da değişebilir; kayıp belirtilmeden “en iyi tahmin” tek bir anlama gelmez. Tashman'ın örneklem dışı tahmin testlerine ilişkin incelemesi de değerlendirmenin tahmin problemine uygun olması gerektiğini vurgular (Tashman, 200000065-0)).
İki model için aynı tahmin başlangıçlarını ve gerçekleşen sonuçları kullanın. Bir modelde zor bir tarihin tahmini yoksa yalnızca o model için bu tarihi sessizce çıkarmak karşılaştırma örneklemini değiştirir. Gerçek kullanımda model her ay yeni verilerle yeniden tahmin edilecekse, değerlendirme tahminlerini de aynı kurala göre üretin; sabit parametreli bir çalışma farklı bir soruyu yanıtlar. Gelecek verileri kullanmadan sıralı tahmin üretme biçimini walk-forward doğrulaması açıklar.
Dört tahmin başlangıçlı örnek ortalama farkın anlamını gösterir
Dört varsayımsal tahmin başlangıcı düşünün; hedef ve tahmin hataları yüzde puan olarak ölçülsün. A modelinin hataları $[1,2,0,1]$, B modelininkiler $[2,1,1,1]$ olsun. Her çift aynı gerçekleşen getiriye ve aynı tahmin aralığına aittir. Sayılar yalnızca aritmetiği göstermek için varsayılmıştır.
Karesel hata kaybında A'nın kayıpları $[1,4,0,1]$ ve ortalama karesel hatası $(1+4+0+1)/4=1.50$ kare yüzde puandır. B'nin kayıpları $[4,1,1,1]$, ortalama karesel hatası $(4+1+1+1)/4=1.75$ olur. Bu dört sonuçta A'nın MSE'si 0.25 kare yüzde puan daha düşüktür.
Tarih başına $d_t=L(e_{A,t})-L(e_{B,t})$ farkları $[-3,3,-1,0]$ olur. Ortalamaları $(-3+3-1+0)/4=-0.25$ olup A'nın ortalama MSE'sinden B'ninkinin çıkarılmasına eşittir. Negatif işaret bu tanıma göre A'yı destekler. Ancak farkın örnekleme gürültüsünü aşıp aşmadığını henüz göstermez; dört tahmin çifti ikna edici istatistiksel kanıt sayılmaz.
Kayıp tanımı “daha iyi” olmanın anlamını da değiştirebilir. Ayrı bir varsayımsal karşılaştırmada C'nin mutlak hataları $[0,0,0,3]$, D'ninkiler $[1,1,1,1]$ olsun. Mutlak kayıpta ortalamalar C için 0.75, D için 1'dir; C tercih edilir. Karesel kayıpta ortalamalar C için 2.25, D için 1 olur; bu kez D tercih edilir. Hangi hataların daha önemli olduğuna karar vermeden test bu ayrılığı çözemez.
<!-- Illustration placement: after this section; text-free conceptual scene showing two forecast paths against one realized path, with visibly different miss distances and no labels or numerical claims. -->
DM istatistiği ortalama kayıp farkını belirsizliğine göre ölçekler
Örneklem ortalama kayıp farkı $\bar d=T^{-1}\sum_{t=1}^{T}d_t$ olup $T$ eşleştirilmiş tahmin sonuçlarının sayısıdır. Standart hatası tek tarihteki varyansa değil, $d_t$ serisinin uzun dönem varyansına bağlıdır. Test istatistiğinin genel biçimi şöyledir:
$$ DM=\frac{\bar d}{\sqrt{\widehat{\Omega}/T}} $$
$\widehat{\Omega}$ kayıp farkı serisinin uzun dönem varyansını tahmin eder. Tarihler bağımsız olsaydı, seçilen tahminciye göre bu değer $d_t$ varyansına indirgenirdi. Tahmin kayıpları ise kümelenebilir: yüksek oynaklıklı dönemlerde iki modelin hataları da büyüyebilir; $h$ adım sonraki hedef de bitişik hata pencerelerinin aynı gerçekleşen getirileri paylaşmasına yol açabilir. Pozitif bağımlılığı yok saymak standart hatayı düşük tahmin edip kanıtı olduğundan güçlü gösterebilir.
Yaygın bir HAC yapısı, merkezlenmiş kayıp farklarının otokovaryanslarını $\hat\gamma_k$ tahmin eder ve $\widehat{\Omega}=\hat\gamma_0+2\sum_{k=1}^{q}w_k\hat\gamma_k$ olarak birleştirir. Bartlett ağırlıklarında, $q$ bant genişliğine kadar $w_k=1-k/(q+1)$ olur. Newey ve West, değişen varyans ve otokorelasyona tutarlı, pozitif yarı-belirli bir kovaryans tahmincisi geliştirmiştir (Newey ve West). Çekirdek ve bant genişliği uygulama tercihleridir; bunları açıklayın ve tercih edilen p-değerine göre ayarlamak yerine tahmin tasarımına uygun seçin. Daha geniş kovaryans tahmini konusu HAC standart hata kılavuzunda ele alınır.
Testin düzenlilik koşulları altında standart DM istatistiği asimptotik olarak standart normal dağılımla karşılaştırılır. Mutlak değerin büyük olması, gözlenen ortalama kayıp farkının tahmin edilen belirsizliğe göre büyük olduğunu gösterir. İşaret, tanımlanan sıraya göre hangi modelin daha düşük kayba sahip olduğunu söyler; p-değeri farkın büyüklüğünü ya da ekonomik değerini ölçmez. Sıfır hipotezinin doğru olma veya tahminin gelecekte işe yarama olasılığı da değildir.
Çok adımlı tahminler örtüşür; sonlu örneklem düzeltmesi de önemlidir
Her dönemde birkaç dönem sonrasına tahmin yapıldığında değerlendirme pencereleri örtüşür. Örneğin gelecek üç ayın birikimli getirisini aylık tahmin etmek, bir ay sonra yayımlanan tahminle üç aylık getirinin ikisini paylaşır. Aylık getiriler bağımsız olsa bile bu örtüşme tahmin hataları ve kayıp farklarında seri korelasyon oluşturabilir.
Temel bir $h$ adımlı düzende varyans hesabında en az $h-1$ gecikmeye kadar bağımlılığı hesaba katmak doğaldır. Bu evrensel bir bant genişliği kuralı değildir: kayan yeniden tahmin, kalıcı hedefler, oynaklık kümelenmesi ve seçilen kayıp fonksiyonu daha fazla bağımlılık yaratabilir. Tahmin ufkunu, başlangıçlar arasındaki mesafeyi ve HAC kesme gecikmesinin ya da başka varyans tahmincisinin nedenini kaydedin. Tahmin satırlarının sayısı bağımsız kanıt sayısı değildir.
Özgün asimptotik test, orta büyüklükteki örneklemlerde gerçek anlamlılık düzeyini iyi korumayabilir. Harvey, Leybourne ve Newbold, ortalama karesel tahmin hatalarını karşılaştırmak için sonlu örneklem düzeltmesi önermiştir (HLN, 199700719-4)). $h$ ufku ve $T$ tahmin için yaygın bir biçim, DM istatistiğini şu katsayıyla çarpar:
$$ DM_{HLN}=DM\sqrt{\frac{T+1-2h+h(h-1)/T}{T}} $$
Düzeltilmiş istatistik genellikle $T-1$ serbestlik dereceli t dağılımıyla karşılaştırılır. $T=60$ ve $h=5$ olduğunda çarpan yaklaşık $0.925$ olur. Bu örnek yalnızca düzeltmenin aritmetiğini gösterir; 60 gözlemin belirli bir model için yeterli olduğunu veya varsayımların sağlandığını söylemez. Düzeltme belirli bir küçük örneklem sorununu ele alır; bilgi sızıntısını, geçersiz hedefi, modellenmemiş bağımlılığı, tekrarlanan model seçimini veya yanlış tanımlanmış kayıp fonksiyonunu düzeltmez.
İç içe modeller farklı bir tahmin karşılaştırması gerekçesi gerektirir
A modeli, B modelinin kısıtlı bir sürümü olabilir; örneğin B, A'ya tahmin değişkenleri ekler. Ek değişkenlerin anakütlede tahmin değeri olmadığı sıfır hipotezi altında bile tahmin edilen katsayılar B'nin tahminlerine gürültü katabilir. Bu nedenle büyük model, ek değişkenler temel tahmin sürecini iyileştirmese bile daha yüksek gözlenen MSE'ye sahip olabilir. İç içe olmayan rakipler için eşit doğruluk mantığı burada değişmeden uygulanamaz.
Clark ve West, iç içe modellerde eşit tahmin doğruluğu için yaklaşık normal testler geliştirir ve büyük modelin tahmin gürültüsünü hesaba katmak üzere karesel hata karşılaştırmasını düzeltir (Clark ve West, 2007). Bu düzeltme her DM testinin evrensel alternatifi değildir; belirli bir iç içe model sorusu, kayıp ve asimptotik düzen için tasarlanmıştır. Bir modelin diğerini kapsayıp kapsamadığını belirleyin ve sıfır dağılımı tasarıma uyan testi seçin. Yazılımın verdiği standart DM p-değerinin her model ilişkisini kapsadığını varsaymayın.
Başka ayrımlar da önemlidir. MSE'si düşük bir tahmin, aralık kapsamasını, olasılık kalibrasyonunu, yön doğruluğunu veya sonraki kararı iyileştirmeyebilir. Örneklem dışı bir karşılaştırma bile model geliştirilirken tekrar tekrar incelenmiş geçersiz bir holdout'a dayanabilir. Model ilişkisini, tahmin yöntemini, ufku ve her tahmini oluştururken kullanılan veriyi açıklayın.
Tahmin doğruluğu işlem avantajıyla aynı şey değildir
DM sonucu tahmin kaybını değerlendirir; işlem kararı getiri ve risk sürecini değerlendirir. Gelecek dönem getirilerinde daha düşük MSE, sinyalin işlem yönünü yeterince sık doğru seçmesini, pozisyonları uygun büyüklükte ayarlamasını ya da devir, spread, piyasa etkisi, komisyon, borçlanma ve fonlama giderleri ile gerçekleşme gecikmesini aşmasını garanti etmez. Tersine, ortalama karesel hatası biraz yüksek bir tahmin stratejinin yüksek pozisyon taşıdığı anlarda daha isabetliyse kararı iyileştirebilir. Bu iddia için kayıp fonksiyonunun kullanışlı genel bir tahmin ölçütü yerine gerçek kararı yansıtması gerekebilir.
İstatistiksel olarak anlamlı fark ekonomik açıdan çok küçük olabilir. Yalnızca p-değerini veya kazanan etiketini değil, ortalama kayıp farkının yorumlanabilir birimlerdeki büyüklüğünü ve belirsizliğini raporlayın. Portföy performansı iddia ediliyorsa, tamamen belirlenip sabitlenmiş karar kuralını uygun sonraki verilerde gerçekçi işlem varsayımlarıyla yeniden yürütün ve net sonuçları ayrıca raporlayın. DM bu sonuçları hesaplamaz veya maliyetleri içermez; bunun için kayıp fonksiyonu açıkça tasarlanmış olmalıdır.
Test, çok sayıda model, hedef, ufuk, kayıp fonksiyonu, tarih aralığı veya işlem kuralı arayıp yalnızca en elverişli karşılaştırmayı raporlama sorununu da düzeltmez. Tekrarlanan ikili testler kendi seçilim sorununu yaratır. Arama kaydını saklayın ve iddia ailesine uygun çoklu test yöntemi kullanın. Çoklu test ve yanlış keşif oranı kılavuzu, kapsamlı aramadan sonra sıradan eşiklerin neden yanıltabileceğini açıklar. DM bir değerlendirme aracıdır, veri madenciliği düzeltmesi değildir.
Karşılaştırmanın yeniden üretilebilmesi için yeterli ayrıntıyı raporlayın
Açık bir rapor hedefi ve birimleri, bilgi kesim anını, tahmin başlangıçlarını, ufku, yeniden tahmin takvimini ve ortak değerlendirme örneklemini belirtir. Kayıp fonksiyonunu ve $d_t$ işaretini, her modelin ortalama kaybını ve ortalama farkı, önceden seçilmiş tek ya da çift yönlü hipotezi açıklar; varyans tahmincisini, çekirdeği, bant genişliğini, test istatistiğini, referans dağılımını, p-değerini ve uygunsa güven aralığı ya da belirsizlik ölçüsünü verir.
Modellerin iç içe olup olmadığını, eksik sonuçları ve uç değerleri nasıl ele aldığınızı, kaç alternatif spesifikasyonu incelediğinizi ve değerlendirme döneminin model seçimlerini etkileyip etkilemediğini de bildirin. Yalnızca eşiği aşıp aşmadığını değil, farkın büyüklüğünü gösterin. $d_t$ zaman serisi veya birikimli kayıp farkı grafiği, toplam ortalamanın gizlediği rejim değişikliklerini gösterebilir; ancak grafik bağımlılığı hesaba katan çıkarımın yerini tutmaz.
Kantitatif işlemlerde tahminden eyleme geçişi de ekleyin: sinyal eşiği, pozisyon büyüklüğü, yeniden dengeleme zamanı, risk kontrolleri, gerçekleşme fiyatı ve maliyet varsayımları. DM yalnızca kendisine verilen tahmin kaybı serisini karşılaştırır. Veri hattını onaylamaz, farklı değerlendirme örneklemlerini karşılaştırılabilir kılmaz, nedenselliği kanıtlamaz veya geçmiş sıralamaların süreceğini garanti etmez. Zaman sırasına uyan tahmin tasarımı ve karar düzeyinde açık bir değerlendirmeyle birlikte, model değerlendirmesinin şeffaf bir parçası olarak kullanın.
Sık sorulan sorular
Q1Diebold–Mariano testi model katsayılarını karşılaştırır mı?
Hayır. Eşleştirilmiş sonuçlardaki iki tahmin prosedürünün ürettiği hataların beklenen kaybını karşılaştırır. Katsayı testi, model parametresi hakkında başka bir soruyu yanıtlar.
Q2Testi birkaç dönem ileri tahminlerde kullanabilir miyim?
Evet; ancak örtüşen hedef pencereleri ardışık kayıp farklarını seri olarak bağımlı kılabilir. Ufuk ve model tasarımına uygun varyans tahmini ve gerektiğinde sonlu örneklem düzeltmesi kullanın; seçimlerinizi kaydedin.
Q3Anlamlı bir sonuç, daha iyi tahminin para kazandıracağı anlamına mı gelir?
Hayır. Değerlendirme tasarımında seçilen tahmin kaybının farklı olduğuna dair kanıt sağlar. Kârlılık tahminlerin pozisyona nasıl dönüştürüldüğüne, alınan riske ve gerçekleşen maliyetlerle işleme de bağlıdır.
Kaynaklar ve daha fazla okuma
Sorun bildir
Bu makalenin bağlantısını içeren bir e-posta hazırlayacağız. Mark bildirimi yalnızca gönderdiğinizde alır
Hızlı kontrol
Rehberi okudunuz mu? 3 soruyla kendinizi kontrol edin
Soru 01
Temel Diebold–Mariano karşılaştırmasının sıfır hipotezi nedir?
Açıklamayı görmek için bir yanıt seçin
Opsiyon sözlüğü
Variation in the conditional error variance across regressor values or states, invalidating an equal-variance covariance formula.
Ayrıntılı rehberi okuFamily-wise error rateThe probability of falsely rejecting at least one true null hypothesis within a predefined family of tests.
Ayrıntılı rehberi oku