Alım satım kurallarında White Reality Check ve Hansen SPA testi
Reality Check ile SPA'yı taranmış işlem kuralı aileleri üzerinden karşılaştırın; küresel sıfır hipotezini, bootstrap tasarımını ve yorumlama sınırlarını öğrenin.
Bu rehberdeBacktest birincisini neden tek başına sınayamazsınız?
Kısa özet
White'ın Reality Check (RC) ve Hansen'in SPA (Superior Predictive Ability) testi, aranan aday ailesinden herhangi bir kuralın önceden belirlenmiş bir kıstası aşıp aşmadığını inceler. İkisi de aynı örneklemde en iyi görünen adayı seçmiş olmayı hesaba katar; ancak belirli bir kuralı onaylamaz veya gelecekte kazanç vaat etmez.
Backtest birincisini neden tek başına sınayamazsınız?
Verileri görmeden önce tek bir stratejiyi belirlediyseniz, tek karşılaştırmalı bir test sorunuza uygun olabilir. Fakat çok sayıda kuralı deneyip sonuçları gördükten sonra yalnızca kazananı sanki baştan beri tek adaymış gibi sınamak, seçim aramasını yok sayar. Hiçbir kuralın gerçek üstünlüğü olmasa bile çok sayıda gürültülü tahmin arasındaki en yüksek değer tesadüfen pozitif çıkabilir. Bu kazananı seçen aynı örneklem, tek kural için hazırlanmış bir p değerinin dayandığı “önceden belirleme” varsayımını da bozar.
RC ve SPA daha geniş bir soruya yanıt verir: Arama sürecindeki adayları hesaba kattıktan sonra, en az bir kuralın seçilen performans ölçütünde kıstastan daha iyi olduğuna dair kanıt var mı? Adaylar teknik işlem kuralları, tahmin modelleri veya strateji çeşitleri olabilir. White, bir model aramasında bulunan en iyi modelin kıstastan üstün olup olmadığını sınamak için veri taraması çerçevesini geliştirdi (White, 2000). Sullivan, Timmermann ve White bu yaklaşımı geniş bir teknik işlem kuralı kümesine uyguladı (1999 çalışması). Düzeltmenin aile kapsamı, sonuçları seçmekte rol oynayan tüm adayları içerir; yalnızca geriye kalan kazananı değil. FDR ve çoklu test rehberi ilişkili ama farklı bir soruyu ele alır.
Kıstası, aday ailesini ve karşılaştırma ölçütünü sabitleyin
k, test edilen K ailesindeki bir adayı; t ise bütün kuralların ve kıstasın değerlendirildiği ortak tarihi göstersin. Getiri karşılaştırmasında dönemlik farkı şöyle tanımlayalım:
d(k,t) = k adayının net getirisi − kıstasın net getirisi
Pozitif fark, adayın daha iyi olduğu anlamına gelir. Tahmin kaybı karşılaştırılıyorsa işaret yönünü ters çevirip kıstasın kaybından adayın kaybını çıkarın; böylece yine pozitif değer aday lehine olur. Adaylar veya tarihler arasında işaret kuralını değiştirmeyin. Testten önce aileyi, kıstası, değerlendirme tarihlerini, maliyetleri ve “daha iyi” tanımını belirleyin. Ortalama net getiri farkı, ayrıca tanımlanmadıkça risk ayarlı getiri veya düşüş ölçüsü değildir.
k adayının beklenen farkını μ(k)=E[d(k,t)] olarak yazarsak, aile düzeyindeki hipotezler şöyledir:
H0: max(k∈K) μ(k) ≤ 0 H1: max(k∈K) μ(k) > 0
Bu zayıf küresel sıfır hipotezi, hiçbir adayın pozitif beklenen üstünlüğü olmadığını söyler; bazı kuralların gerçek ortalama farkı negatif olabilir. Burada her aday için ayrı ayrı karar listesi üretmek yerine ailenin tamamına yönelik tek bir ortak sınama yapılır. Kıstas ve ölçüt sonuç görüldükten sonra değiştirilirse testin cevapladığı soru da değişir.
Reality Check tüm ailedeki en büyük farkı kullanır
n değerlendirme tarihi boyunca ortalama farkı d̄(k) ile gösterelim. Basit ortalama farkına dayalı RC istatistiği şöyledir:
T_RC = max(k∈K) sqrt(n) × d̄(k)
Bu en büyük değer, sıfır hipotezi altında oluşturulmuş bir bootstrap dağılımıyla karşılaştırılır. White'ın yaklaşımı bileşik sıfır hipotezinin en elverişsiz sınırını kullanır: her adayın gerçek beklenen farkı sıfır kabul edilir. Oysa H0, gerçek farkı negatif olan adaylara da izin verir. Tüm adayları kıstasla tam eşit varsayan sıfır sınırı bu nedenle korumacı olabilir; çok sayıda zayıf alternatif kritik değeri yükselterek reddetmeyi zorlaştırabilir. RC formülündeki maksimuma ayrıca sıfırla kırpma eklenmemiştir.
Bu test “gözlenen birinci sıradaki kural tek başına ne kadar sıra dışı?” diye sormaz. Aynı arama tüm ailede yürütülmüşken, bu kadar yüksek bir maksimum elde etmenin ne kadar sıra dışı olduğunu sorar. Kazananı önceden belirlenmiş tek bir kural gibi değerlendiren standart bir dağılım, seçim tekrarlarını hesaba katmaz.
SPA studentizasyon ve örnekleme bağlı sıfır dağılımını ekler
Hansen'in SPA testi aynı aday ailesini ve kıstasa göre farkları kullanır, ancak test istatistiği ve sıfır dağılımının kurulma yöntemini değiştirir. Temel istatistik şöyle yazılır:
T_SPA = max(0, max(k∈K) sqrt(n) × d̄(k) / ω̂(k))
ω̂(k), √n d̄(k) ifadesinin uzun dönem standart sapmasını tahmin eder. Studentizasyon, değişkenlikleri farklı adayları yalnızca ham ortalama farklarıyla kıyaslamak yerine, ortalama tahmininin belirsizliğine göre ölçekler. Dıştaki sıfırla maksimum, en büyük studentize fark negatif olsa bile istatistiğin sıfırın altına inmesini engeller. Bu, burada kırpılmadan yazılan RC istatistiğinden ayrılır.
İkinci fark, örnekleme bağlı sıfır dağılımıdır. Tutarlı bir SPA uygulamasında gözlenen ortalaması yeterince negatif olan adaylar sıfır dağılımı oluşturulurken negatif ortalamayla kalır; sıfır sınırına yakın ve makul görünen adayların ortalaması sıfıra merkezlenir. Kötü görünen kurallar aileden basitçe silinmez. Bu tasarım, RC'deki “her adayın gerçek ortalaması sıfır” yaklaşımına kıyasla zayıf alternatiflerin dağılım üzerindeki etkisini azaltmayı amaçlar. Hansen bu iki değişikliğin test gücünü artırıp zayıf ve ilgisiz adaylara duyarlılığı düşürebileceğini gösterir (Hansen, 2005). Ancak SPA, her koşulda RC'ye üstün değildir.
Adayların zaman vektörünü ortak biçimde yeniden örnekleyin
Aynı tarihteki kurallar ortak piyasa hareketlerine maruz kalır; dolayısıyla aday getirileri eşzamanlı olarak ilişkili olabilir. Her adayın zaman serisinde dönemler arası bağımlılık da bulunabilir. Her aday sütununu bağımsız örneklemek bu eşzamanlı kovaryansı bozar ve maksimumun dağılımını değiştirir. Bunun yerine her tarih için d_t=(d(1,t),…,d(K,t)) vektörünü birlikte ele alın ve bütün sütunlara aynı zaman indekslerini ya da blok sırasını uygulayın.
Zaman blokları, gözlenen dizinin bir bölümünü koruyarak örnekleme yapar. Örneğin durağan bootstrap, uzunlukları geometrik dağılıma göre değişen blokları birleştirir; Politis ve Romano yöntemi zayıf bağımlı durağan gözlemlere yönelik çıkarımı inceler (Politis ve Romano, 1994). Blok kullanmak her türlü bağımlılık yapısına uygunluk sağlamaz. Sürecin yeterince kararlı ve bağımlılığın uygun anlamda zayıf olması gibi varsayımlar gerekir. Yapısal kırılma ya da rejim değişimi, tek bir sabit sürecin parçalarını yeniden çekerek ortadan kalkmaz. Blok bootstrap rehberi, sabit bir istatistiğin belirsizliği için blok tasarımını ayrıca açıklar.

240 kurallı örnek yalnızca varsayımsal aritmetiktir
Sadece aday sayısını göstermek için varsayımsal bir tarama düşünün: 12 lookback aralığı, 4 giriş filtresi ve 5 çıkış ayarı. Tam çarpım 12×4×5=240 kural verir. Hepsinin aynı tarihlerde, aynı maliyet yaklaşımıyla değerlendirildiğini ve kıstasın önceden sabitlenmiş bir al-tut stratejisi olduğunu varsayalım. Her aday için net getiri farkı hesaplanır; aile istatistiğinde 240 adayın tamamındaki maksimum kullanılır.
Bu örnek yalnızca sayıların çarpımını ve aile kapsamını gösterir. Herhangi bir gerçek getiri, p değeri, test sonucu veya kazanan strateji iddiası yoktur. Gerçek araştırmada farklı varlıklar, tutma süreleri, filtreler, örneklem dönemleri, kıstaslar veya işlem maliyeti varsayımları da denenmiş olabilir. Bunlar nihai seçimi etkilediyse, sadece sonradan raporlanan düzenli parametre ızgarasını göstermenin aramanın tamamını anlattığı varsayılamaz.
“Daha iyi” ölçütü de önceden sabitlenmelidir. Ortalama net getiri farkı kullanılıyorsa, test doğrudan volatilite, maksimum düşüş veya sermaye kullanımını da ölçüyor değildir. Komisyon, fonlama, borçlanma ve kayma maliyetleri bütün adaylara karşılaştırılabilir biçimde uygulanmalıdır; farklı işlem varsayımları strateji üstünlüğü gibi görünebilir.
FDR ve sabit istatistik güven aralığı farklı sorulara yanıt verir
Benjamini–Hochberg gibi yanlış keşif oranı (FDR) yöntemleri birden çok bireysel hipotezin p değerlerini birlikte ele alır ve varsayımlar altında reddedilenler içindeki yanlış keşif oranının beklenen değerini kontrol eder. RC ve SPA ise kıstasa göre aile maksimumu için tek bir küresel sınama yapar. İkisi çoklu testlerle ilgili olsa da birbirinin yerine kullanılamaz. FDR ve çoklu test rehberi, bireysel hipotezler ve yanlış keşif oranı üzerinde durur.
Blok bootstrap ile oluşturulan sıradan güven aralığı da RC veya SPA değildir. Önceden sabitlenmiş bir stratejinin ortalama getirisi ya da Sharpe oranı gibi tek bir istatistik için örnekleme belirsizliğini hesaplayabilir. Ancak o strateji çok sayıda aday denendikten sonra seçildiyse, aramayı ve kazanan seçimini kendiliğinden düzeltmez. RC ile SPA'nın her tekrarında aday ailesinin maksimumu hesaplanır ve sıfır hipotezine göre bir dağılımla karşılaştırılır. Blok bootstrap zamansal bağımlılığı modelleme araçlarından biridir; “bootstrap” kelimesi tek başına arama düzeltmesi yapıldığı anlamına gelmez.
Purged çapraz doğrulama farklı bir sorunu ele alır: zaman sıralı verilerde eğitim ve test gözlemleri arasındaki zamansal bilgi sızıntısını azaltmayı amaçlar. Kural ailesinin maksimumunun kıstası aşıp aşmadığını sınamaz; bu, RC/SPA’nın küresel sorusudur. Purged çapraz doğrulama ve embargo rehberi bu zaman ayrımını açıklar.
Sıfır hipotezini reddetmek kazananı veya gelecekteki kârı belirlemez
RC ya da SPA sıfır hipotezini reddederse çıkarım, belirtilen aday ailesi, kıstas, değerlendirme dönemi, ölçüt, sıfır dağılımı ve varsayımlarla sınırlıdır: Ailede en az bir adayın seçilen ölçüte göre kıstası aşmış olabileceğine dair kanıt vardır. Hangi kuralın gerçekten üstün olduğunu belirlemez, seçilmiş kuralın bireysel anlamlılığını kanıtlamaz veya her kuralın kazandığını göstermez. Reddedememek de bütün stratejilerin eşit ya da yararsız olduğunun kanıtı değildir; mevcut veri ve tasarım yeterli kanıt sağlamamış olabilir.
Test, gelecekteki getiriyi tahmin etmez ve işlemler başladıktan sonra kâr garantisi vermez. Kaydedilmemiş denemeler, ileriye dönük bilgi sızıntısı, hayatta kalma yanlılığı, maliyetlerin düşük tahmin edilmesi, piyasa etkisi ve durağan olmama ayrıca incelenmelidir. Sonuç görüldükten sonra aileyi değiştirmek de testin biçimsel olarak sorduğu soruyu değiştirir. Seçilen kurala dair ayrı bir çıkarım gerekiyorsa, uygun aday düzeyi yöntemi kullanın ve seçime katılmamış bir dönemde doğrulayın; bu doğrulama da geleceğin garantisi değildir.
Yeniden üretilebilirlik için test ayarlarını raporlayın
Rapor; kıstası, aday ailesinin tamamını ve nasıl oluştuğunu, tarih aralığını, gözlem sıklığını, getiri veya kayıp farkının tanımını, maliyetleri, seçilen ölçütü ve test adını belirtmelidir. SPA için uygulama sürümünü ve hangi p değeri çeşidinin raporlandığını da yazın. Yeniden örnekleme yöntemi, blok uzunluğu ya da ortalaması, tekrar sayısı, zaman dizisinin nasıl eşlendiği ve sıfır dağılımının nasıl kurulduğu açıklanmalıdır.
Kazananı seçmeden önce denenen ek parametreleri, filtreleri, piyasaları, tutma sürelerini ve maliyet varsayımlarını da kaydedin. Sadece daraltılmış bir aile sınandıysa, bu ailenin nasıl seçildiğini ve seçime hangi verilerin katıldığını açıklayın. Böylece okuyucu yapılan düzeltmenin gerçek arama sürecini kapsayıp kapsamadığını anlayabilir. RC veya SPA sonucu, tanımlanmış veriye ve varsayımlara bağlı aile düzeyinde istatistiksel kanıttır; uygulama kalitesini ve canlı performansı izleme gereğini ortadan kaldırmaz.
Sık sorulan sorular
Q1SPA her zaman Reality Check'ten daha mı güçlüdür?
Hayır. SPA'nın studentizasyonu ve örnekleme bağlı sıfır dağılımı zayıf adayların etkisini azaltıp test gücünü artırabilir. Ancak veriye ve varsayımlara göre sonuç değişir; yöntemlerin birinde genel ve koşulsuz üstünlük yoktur.
Q2SPA'da anlamlı sonuç hangi kuralı kullanmam gerektiğini söyler mi?
Hayır. Sonuç, belirlenen ölçüte göre ailede en az bir adayın üstün olduğuna dair genel kanıt sunar. Belirli bir kuralı seçmek için aday düzeyinde uygun yöntem ve seçime katılmamış verilerle doğrulama gerekir.
Q3Kötü performans gösteren denemeleri aday ailesinden çıkarabilir miyim?
Kazananı seçmeden önce bu denemeler yapıldıysa, onları çıkarmak arama kapsamını olduğundan küçük gösterebilir. Düzeltilmiş sonucu yorumlamadan önce seçimi etkileyen tam aday ailesini tanımlayıp kaydedin. Başlıca araştırmalar - White, “A Reality Check for Data Snooping” (2000) - Hansen, “A Test for Superior Predictive Ability” (2005) - Sullivan, Timmermann, and White, “Data-Snooping, Technical Trading Rule Performance, and the Bootstrap” (1999) - Politis and Romano, “The Stationary Bootstrap” (1994)
Kaynaklar ve daha fazla okuma
Sorun bildir
Bu makalenin bağlantısını içeren bir e-posta hazırlayacağız. Mark bildirimi yalnızca gönderdiğinizde alır
Hızlı kontrol
Rehberi okudunuz mu? 3 soruyla kendinizi kontrol edin
Soru 01
RC ve SPA'nın küresel sıfır hipotezi ne söyler?
Açıklamayı görmek için bir yanıt seçin
Opsiyon sözlüğü
The probability of falsely rejecting at least one true null hypothesis within a predefined family of tests.
Ayrıntılı rehberi okuopsiyon atamasıKullanım bildiriminden sonra sözleşmeyi yerine getirme yükümlülüğünün opsiyon satıcısına dağıtılması ve hisse teslimi veya alımı oluşturabilmesi sürecidir.
Ayrıntılı rehberi oku