Skip to content
Tüm opsiyon ve vadeli işlem rehberleri
Tahmin değerlendirmesi14 min read

Diebold–Mariano Testi: Tahmin doğruluğu nasıl karşılaştırılır?

Diebold–Mariano testinin eşleştirilmiş tahmin kayıplarını nasıl karşılaştırdığını, örtüşen tahmin ufuklarını nasıl ele aldığını ve düşük bir p-değerinin neden alım satım becerisini kanıtlamadığını öğrenin.

Bu rehberdeGeriye dönük testte daha düşük hata, henüz daha iyi tahmin kanıtı değildir

Kısa özet

Diebold–Mariano testi, aynı gerçekleşen sonuçlara ilişkin kayıp farklarına bakarak iki tahmini karşılaştırır. Sonuç; kayıp fonksiyonuna, değerlendirme örneklemine, tahmin ufkuna ve belirsizlik tahminine bağlıdır. Örneklemdeki hatanın daha düşük olması, beklenen doğruluğun daha yüksek olduğuna tek başına kanıt değildir; tahmin doğruluğunun artması da kârlı bir alım satım stratejisiyle aynı şey değildir.

Geriye dönük testte daha düşük hata, henüz daha iyi tahmin kanıtı değildir

İki modelin aynı tarihler için aynı getiriyi, oynaklığı veya ekonomik büyüklüğü tahmin ettiğini varsayalım. Değerlendirme örnekleminde A modelinin ortalama hatası B'ninkinden düşük olsun. Bu, örneklemde görülen farkı anlatır; A'nın güvenilir biçimde daha doğru olup olmadığını ya da farkın, teste denk gelen tarihlerdeki olağan değişkenlikten kaynaklanıp kaynaklanmadığını göstermez.

Diebold–Mariano (DM) testi bu karşılaştırmayı eşleştirilmiş bir zaman serisine dönüştürür. Her tahmin başlangıcında iki modelin tahmini aynı gerçekleşen değerle karşılaştırılır, önceden seçilen bir kayıp fonksiyonuyla puanlanır ve kayıp farkları dizisi incelenir. Eşleştirme önemlidir: oynak bir piyasa gününde her iki modelin kaybı da artabilir; karşılaştırmanın sorduğu, tam da o günlerde modellerden birinin genellikle daha az kayıp verip vermediğidir.

Temel çerçeve, yalnızca karesel hatayla veya normal dağılımlı tahmin hatalarıyla sınırlı değildir. Tahmin sorusuna uygun olmaları koşuluyla asimetrik olanlar da dahil farklı kayıp fonksiyonları karşılaştırılabilir. Yine de savunulabilir bir değerlendirme tasarımı ve ortalama kayıp farkının belirsizliğini tahmin etmek gerekir. Diebold ve Mariano (1995) eşit tahmin doğruluğu testini ortaya koymuş, Harvey, Leybourne ve Newbold (1997)00719-4) ise küçük örneklem düzeltmesini incelemiştir.

İstatistiği hesaplamadan önce aynı koşullardaki tahminleri karşılaştırın

Her satır, karşılaştırılabilir bir tahmin başlangıcını temsil etmelidir. İki model de aynı hedefi, aynı ufuk için ve o başlangıçta mevcut olan bilgileri kullanarak tahmin etmelidir. Kayıpları karşılaştırmadan önce gerçekleşen değerleri, zaman damgalarını, para birimini veya ölçü birimini, veri sürümünü ve eksik gözlem kurallarını eşleştirin. Bir model ertesi günün kapanışını, diğeri beş günlük ortalamayı tahmin ediyorsa hataları farklı sorulara yanıt verir.

İleriye bakmadan üretilmiş tahminleri kullanın. Kronolojik bir test örneklemi veya kayan sözde örneklem dışı tasarım bunu sağlayabilir; ancak aynı test örneklemi özellikleri, eşikleri veya model çeşitlerini tekrar tekrar ayarlamak için kullanılmışsa tek başına veri bölmesi yeterli değildir. Geçmişteki her başlangıçta üretilen tahmini, onu oluşturan veri ve model sürümüyle birlikte saklayın. Aksi halde sonradan revize edilen makroekonomik veriler, hayatta kalma filtreleri veya gelecekteki şirket olaylarına göre yapılan düzeltmeler değerlendirmeyi geçmişe dönük olarak değiştirebilir.

İki modeli de aynı tahmin başlangıçları kümesinde değerlendirin. Yalnızca bir model için zor tarihleri çıkarmak eşleştirilmiş karşılaştırmayı bozar. Tahminler eksikse ortak örneklem kullanın veya eksik tahminleri nasıl ele aldığınızı gerekçelendirin; modellerin farklı piyasa rejimlerinde sınanmasına sessizce izin vermeyin. Başlangıç ve bitiş tarihlerini, hangi örneklemin tercih edilen sonucu verdiğini görmeden seçin.

Kayıp fonksiyonu, “daha doğru” ifadesinin anlamını belirler

t anındaki gerçekleşen değer yₜ, A ve B modellerinin tahminleri ŷA,ₜ ve ŷB,ₜ olsun. Hatalar eA,ₜ = yₜ − ŷA,ₜ ve eB,ₜ = yₜ − ŷB,ₜ şeklindedir. L kayıp fonksiyonu her hatayı bir puana dönüştürür; daha düşük puan daha iyidir. Karesel kayıp L(e) = e² büyük hataları daha ağır cezalandırır. Mutlak kayıp L(e) = |e|, hata büyüklüğüyle doğrusal olarak artar. Kuantil tahmininde, eksik ve fazla tahminin maliyetleri farklı olduğundan asimetrik pinball kaybı kullanılabilir.

Seçilen puan, hangi modelin daha iyi göründüğünü değiştirebilir. Aynı birimle ölçülen iki varsayımsal hata çiftini ele alalım: A modelinin hataları 0 ve 2, B modelinin hataları 1 ve 1 olsun. Karesel kayıpta ortalama kayıplar sırasıyla 2 ve 1 olduğundan B daha iyi puan alır. Mutlak kayıpta iki modelin ortalaması da 1'dir. Bu hesaplardan hiçbiri her durumda evrensel olarak doğru değildir; her biri hangi hataların önemli olduğuna ilişkin farklı bir soruyu yanıtlar.

Getiri tahmininde karesel hata koşullu ortalama için yararlı olabilir; oynaklık tahmini hedefe uygun bir puan, Value-at-Risk tahmini ise kuantil puanı veya riske özgü bir geriye dönük test gerektirir. Hangi modelin kazandığını gördükten sonra kayıp fonksiyonunu seçmek testi başka bir arama sürecine dönüştürür. Karşılaştırmaya bakmadan önce kaybı ve “daha iyi” yönünü belirleyin.

VaR tahmini, sıradan bir nokta tahmininden ziyade dağılımın kuyruk kantilini hedefler. VaR geriye dönük test rehberi, bu ayrı risk tahmininde istisnaların sıklığının ve zamanlamasının nasıl değerlendirildiğini açıklar.

Eşleştirilmiş kayıp farklarını oluşturun ve sıfır hipotezini belirtin

Daha düşük kaybın daha iyi olduğu bir fonksiyon için t dönemindeki farkı şöyle tanımlayın:

dₜ = L(eA,ₜ) − L(eB,ₜ)

Bu işaret kuralında pozitif dₜ, A modelinin kaybının daha yüksek ve o başlangıçta B'nin daha iyi olduğu anlamına gelir; negatif değer A'yı destekler. Örneklem ortalaması d̄ = (1/n) Σ dₜ şeklindedir. Koşulsuz eşit doğruluk sıfır hipotezi E[dₜ] = 0'dır. İki yönlü alternatif, beklenen kayıpların herhangi bir yönde farklı olup olmadığını sorar. Önceden belirlenmiş tek yönlü alternatif, adı konmuş bir modelin beklenen kaybının daha düşük olup olmadığını sınayabilir.

Temel istatistik şöyledir:

DM = d̄ / √(Ŝd / n)

Burada Ŝd, her modelin tahmin hatalarının varyansını değil, kayıp farkı serisinin uzun dönem varyansını tahmin eder. Sıfır hipotezi ve uygun düzenlilik koşulları altında istatistik asimptotik olarak standart normal dağılıma uyar. Yukarıdaki işaret kuralına göre büyük pozitif değerler B'yi, büyük negatif değerler A'yı destekler. p-değeri, verinin belirlenen sıfır hipotezi ve örnekleme varsayımlarıyla ne ölçüde uyumlu olduğunu gösterir; modellerden herhangi birinin doğru olma olasılığını vermez.

Eşleştirme, dönem başına farklarla iki modelin genel hata ölçeğindeki ilgisiz farkları ancak bu farkların yansıttığı ölçüde giderir. Kayıp serisini bağımsız yapmaz, parametre tahmini belirsizliğini kendiliğinden ortadan kaldırmaz ve birçok hedef ya da belirtim arasındaki aramayı düzeltmez. Bu konular tasarım ve belirsizlik hesabında ayrıca ele alınmalıdır.

Tek adımlı örnek, örneklem farkını kanıttan ayırır

Eşleştirilmiş, varsayımsal 100 adet tek adımlı tahmin olduğunu düşünün. Yüzde puanlarının karesi cinsinden A'nın ortalama karesel kaybı 0.26, B'ninki 0.23 olsun. Ortalama fark d̄ = 0.26 − 0.23 = 0.03'tür ve örneklemde B'yi destekler. Buna karşılık gelen kök ortalama kare hatalar (RMSE) yaklaşık 0.510 ve 0.480 yüzde puanıdır; bu, betimleyici olarak yaklaşık 0.030'luk bir farktır. Ancak DM istatistiği iki karekökün farkını değil, eşleştirilmiş karesel kayıp farklarını sınar. Bu basit öğretici örnekte, dₜ'nin tahmini uzun dönem varyansının 0.04 olduğunu ve başlangıçlar arasında seri kovaryans bulunmadığını varsayalım.

Ortalama farkın tahmini standart hatası √(0.04 / 100) = 0.02'dir. Düzeltilmemiş istatistik 0.03 / 0.02 = 1.50 olur. h = 1 ufuk ve T = 100 için Harvey–Leybourne–Newbold küçük örneklem düzeltme katsayısı √[(T + 1 − 2h + h(h − 1)/T) / T] = √0.99 ≈ 0.995'tir. Bununla çarpıldığında düzeltilmiş istatistik yaklaşık 1.49 olur; yaklaşık t₉₉ referans dağılımına göre iki yönlü p-değeri 0.14 civarındadır.

B'nin gözlenen ortalama karesel hatası daha düşüktür; ancak bu örnek, geleneksel anlamlılık eşiklerinde eşit beklenen doğruluk hipotezini reddetmek için güçlü kanıt sunmaz. Reddedememek modellerin aynı doğrulukta olduğunu kanıtlamaz; reddetmek de seçilen puana, başlangıçlara ve varsayımlara bağlıdır. Varyans ve kayıp değerlerinin tümü öğretici amaçlı varsayımsal girdilerdir, ampirik sonuç değildir.

Üç panelli kavramsal şema: aynı gerçekleşen seriyle karşılaştırılan iki tahmin çizgisi, her başlangıçtaki eşleştirilmiş kayıp işaretleri ve son olarak ortalama çevresinde belirsizlik bandıyla gösterilen işaretli kayıp farkı çubukları. Görselde metin veya sayı yoktur; gerçek piyasa verisi göstermez.
Şema, DM karşılaştırmasının akışını gösterir: ortak gerçekleşen seri, tahmin başına eşleştirilmiş kayıplar ve ortalama çevresindeki belirsizlikle birlikte işaretli farklar. Kavramsal bir görseldir; ampirik test sonucu değildir.

Örtüşen ufuklar kayıp farklarını bağımlı hale getirir

Her gün beş gün sonrası için tahmin üretilirse ardışık tahminler beş hedef günün dördünü paylaşır. Dolayısıyla hataları, kayıpları ve kayıp farkları birlikte hareket edebilir. Günlük 100 tahmin başlangıcını 100 bağımsız karşılaştırma olarak ele almak belirsizliği düşük, istatistiği ise olduğundan büyük gösterebilir.

Uzun dönem varyansı dₜ'nin seri kovaryanslarını hesaba katar. Değişen varyansa ve otokorelasyona dayanıklı (HAC) yaygın bir tahmin şu biçimdedir:

Ŝd = γ̂₀ + 2 Σₖ₌₁ᵐ wₖ γ̂ₖ

Burada γ̂ₖ, d'nin k gecikmesindeki örneklem otokovaryansı; wₖ çekirdek ağırlığı; m ise seçilen bant genişliğidir. Newey ve West (1987), pozitif yarı tanımlı bir HAC kovaryans tahmincisi sunar. İlgili varsayımlar altında ideal h-adım tahmin hatalarında örtüşme çoğu zaman en az h − 1 gecikmeye kadar bağımlılık yaratır; özgün DM çerçevesi bu durum için kesilmiş bir tahmini tartışır. Gerçek verilerde kalıcı hedefler, kayan tahmin veya strateji kurulumu daha uzun bağımlılıklar yaratabilir; bu nedenle h − 1 evrensel bir bant genişliği kuralı değildir.

Ufku, çekirdeği, bant genişliğini ve varsa küçük örneklem düzeltmesini belirtin. Tercih edilen p-değerini verecek bant genişliğini seçmek yerine, makul bağımlılık varsayımlarında sonuçların değişip değişmediğini gösterin. Örtüşmeyi önlemek için tahmin başlangıçlarını aralıklı seçtiyseniz bunu ve bu tercihin hangi bilgi ya da örneklem büyüklüğünden vazgeçtiğini açıklayın. Bağımlılığı dikkate alan belirsizlik tahmini, isteğe bağlı bir görüntüleme ayarı değil, testin parçasıdır.

İç içe modeller ve zamanla değişen beceri farklı sorular gerektirir

Standart DM karşılaştırması, eşit doğruluk sıfır hipotezi altında iç içe olmayan tahminlerde daha kolay yorumlanır. Büyük model daha küçük bir kıyas modelini içeriyorsa, ek tahmin edilen katsayılar gerçek değerleri sıfır olsa bile tahmine gürültü katabilir. Bu sıfır hipotezi altında ortalama karesel hata farkı standart dışı bir dağılıma sahip olabilir. İç içe modellerin örneklem dışı MSPE karşılaştırmalarında Clark–West düzeltmesi gibi bir yöntem tahmin gürültüsü etkisini hesaba katar; ancak her model tasarımında DM'nin genel alternatifi değildir. Bkz. Clark ve West (2007).

Standart DM sıfır hipotezi, değerlendirme örneklemi boyunca ortalama koşulsuz kayıpları karşılaştırır. Zaman içindeki değişimleri gizleyebilir: A sakin dönemlerde, B oynak dönemlerde daha iyi olabilir ve genel ortalamaları benzer çıkabilir. Göreli doğruluğun tahmin tarihinde bilinen bilgilere bağlı olup olmadığı soruluyorsa koşullu tahmin yeteneği testleri, kayıp farklarını önceden belirlenmiş araç değişkenlerle birlikte kullanır. Giacomini ve White (2006) bu çerçeveyi geliştirir. Varsayımlar ve değerlendirme penceresinin tasarımı yine önemlidir; sonuçları inceledikten sonra keyfi göstergeler eklemek geçerli bir kestirme değildir.

Test seçimi karşılaştırmanın yapısına uymalıdır: bağımsız tahminler, iç içe modeller, koşullu beceride değişim veya çok sayıda aday arasından seçilmiş model ailesi birbirinin yerine geçmez. Son durum için White’ın Reality Check ve Hansen’ın SPA rehberi, çok sayıda alım satım kuralı arandıktan sonra aile genelinde düzeltmeyi açıklar.

Daha düşük tahmin kaybı, kârlı bir strateji olduğunu göstermez

Bir tahmin istatistiksel olarak daha doğru olsa bile net işlem sonuçlarını iyileştirmeyebilir. Strateji, tahmini pozisyona dönüştürmeli, işlem zamanını seçmeli ve alış-satış farkı, komisyon, kayma, piyasa etkisi, fonlama, ödünç alma ve risk sınırlarını hesaba katmalıdır. Ortalama karesel getiri hatasındaki küçük bir iyileşme kararları etkilemeyebilir; biraz daha yüksek ortalama hataya sahip bir model ise belirli bir kural için önemli kuyruk olayını daha iyi saptayabilir.

Tahmin değerlendirmesiyle portföy değerlendirmesini ayrı adımlar olarak tutun. Önce tahmini, belirtilen tahmin görevine uygun hedef ve kayıpla sınayın. Ardından tahminden pozisyon üreten tam tanımlı bir alım satım kuralını, tahmini seçmek için kullanılmamış veride ve gerçekçi uygulama ile finansman varsayımlarıyla değerlendirin. Tahmin testinin p-değeri geriye dönük test getirisi, Sharpe oranı veya gelecekte kâr olasılığı değildir.

Modelleri, hedefleri, ufukları, kayıp fonksiyonlarını ve örneklem aralıklarını tekrar tekrar denemek, her bir DM hesabı doğru olsa da seçilim yanlılığı yaratır. Araştırmanın tüm aramasını kaydedin ve soru, aramadan herhangi bir adayın geçip geçmediğiyse aile düzeyinde bir yöntem kullanın. Blok bootstrap rehberi, önceden seçilmiş bir istatistik için bağımlılığı koruyan belirsizlik tahminini açıklar; belgelenmemiş model aramasını kendi başına düzeltmez.

Başka bir araştırmacının tekrarlayabilmesi için yeterli ayrıntı raporlayın

İki tahmin modelini, kıyas modeliyle ilişkilerini, hedefi, ufku, tahmin başlangıç takvimini, değerlendirme tarihlerini, bilgi kümesini, veri sürümünü ve ortak örneklem kuralını adlandırın. Kayıp fonksiyonunu matematiksel olarak tanımlayın ve pozitif dₜ'nin A'yı mı B'yi mi desteklediğini belirtin. n, her modelin ortalama kaybı, d̄, uzun dönem varyans tahmincisi, HAC çekirdeği ve bant genişliği, küçük örneklem düzeltmesi, referans dağılımı, test yönü ve p-değerini raporlayın.

Modellerin iç içe olup olmadığını, parametrelerin nasıl tahmin edildiğini, karşılaştırmanın sonuçları incelemeden önce mi sonra mı seçildiğini ve başka hangi varyantların denendiğini de belirtin. Örneklem model seçimi için kullanıldıysa testi dokunulmamış örneklem dışı kanıt diye sunmayın; arama sürecinin bir parçası olarak etiketleyin. Açık bir rapor, okuyucuların testin tam olarak neyi karşılaştırdığını ve hangi belirsizlik ya da seçim sorunlarının dışarıda kaldığını görmesini sağlar.

Sık sorulan sorular

Q1Diebold–Mariano testi, tahmin hatalarının normal dağılmasını gerektirir mi?

Hayır. Çerçeve normal dağılmayan tahmin hatalarını da ele alabilir. Yine de uygun bir kayıp farkı varyans tahmini ve referans dağılımını destekleyen düzenlilik koşulları gerekir.

Q2Farklı ufuklar için tahmin yapan iki modeli karşılaştırabilir miyim?

Bunu aynı koşullardaki tahmin doğruluğu karşılaştırması olarak yorumlayamazsınız. Önce hedefi ve ufku eşleştirin; aksi halde her model farklı bir tahmin sorusunu yanıtlar.

Q3Anlamlı bir DM sonucu, alım satım modelini seçmek için yeterli mi?

Hayır. Sonuç, belirlenen karşılaştırmadaki beklenen tahmin kaybına ilişkindir. Model aramasını, karar kurallarını, uygulama ve finansman maliyetlerini, örneklem dışı strateji performansını ayrıca hesaba katmanız gerekir. Temel araştırmalar - Diebold ve Mariano, “Comparing Predictive Accuracy” (1995) - Harvey, Leybourne ve Newbold, “Testing the Equality of Prediction Mean Squared Errors” (1997)00719-4) - Giacomini ve White, “Tests of Conditional Predictive Ability” (2006) - Clark ve West, “Approximately Normal Tests for Equal Predictive Accuracy in Nested Models” (2007) - Newey ve West, “A Simple, Positive Semi-Definite, Heteroskedasticity and Autocorrelation Consistent Covariance Matrix” (1987)

Kaynaklar ve daha fazla okuma

Sorun bildir

Bu makalenin bağlantısını içeren bir e-posta hazırlayacağız. Mark bildirimi yalnızca gönderdiğinizde alır

Hızlı kontrol

Rehberi okudunuz mu? 3 soruyla kendinizi kontrol edin

Soru 1 / 3

Soru 01

dₜ = L(eA,ₜ) − L(eB,ₜ) olarak tanımlandığında pozitif örneklem ortalaması hangi modeli destekler?

Açıklamayı görmek için bir yanıt seçin

Opsiyon sözlüğü