Skip to content
Tüm opsiyon ve vadeli işlem rehberleri
Strateji aramasının kazananı neden tüm aday ailesi düzeyinde sınanmalı?13 dk okuma

Strateji backtestlerinde data snooping için White’s Reality Check

White’s Reality Check’in aramayla bulunan en iyi stratejiyi benchmark ile nasıl karşılaştırdığını ve bağımlılığı koruyan bootstrap maksimumunu nasıl kullandığını öğrenin

Bu rehberdeTest, aramanın kazananının seçilen benchmark’ı aşıp aşmadığını sorar

Kısa özet

White’s Reality Check, tanımlı bir arama ailesindeki en iyi adayın, maksimum olarak seçildiği gerçeği hesaba katıldığında, belirlenen benchmark’ı aşıp aşmadığını inceler. Birlikte ve zamana bağlı performans farklarını bootstrap ile yeniden örnekler; gözlenen maksimumu bootstrap maksimumlarından oluşan sıfır dağılımıyla karşılaştırır. Düzeltilmiş p-değerinin küçük olması, bu aday ailesi ve benchmark için ortak üstünlük-yokluğu sıfır hipotezine karşı kanıttır; canlı işlem kârlılığı tahmini değildir.

Test, aramanın kazananının seçilen benchmark’ı aşıp aşmadığını sorar

Bir araştırmacı hareketli ortalama pencerelerinin, kırılım kurallarının, elde tutma sürelerinin, piyasaların ve filtrelerin onlarca birleşimini deneyip en yüksek backtest puanına sahip stratejiyi yayımlayabilir. Bu kazanan sıradan, tek başına belirlenmiş bir aday değildir: arama süreci ona olağanüstü iyi görünmesi için birçok fırsat vermiştir. Verileri görmeden önce seçilmiş gibi yalnızca kazananı test etmek, seçim adımını göz ardı eder.

White’s Reality Check seçimi testin içine alır. İncelenen ailede tanımlı benchmark’tan daha yüksek beklenen performansa sahip bir aday bulunup bulunmadığını sorar. White sıfır hipotezini tek yönlü karşılaştırmaların kesişimi olarak kurar: her adayın benchmark’a göre beklenen performansı sıfırdan büyük değildir. Alternatif hipotez, en az bir adayın pozitif beklenen avantaja sahip olmasıdır. Benchmark al-tut, basit bir tahmin kuralı ya da başka bir karşılaştırma kuralı olabilir; ancak araştırma sorusuna uymalı ve test sonucu görülmeden belirlenmelidir. Biçimsel çerçeve için White’ın özgün makalesine bakın.

Bu, tesadüfen kazanan stratejiye ilişkin güvence değil, ailenin tamamı hakkında bir sorudur. Sıfır hipotezinin reddi, kayıtlı ailede seçilen istatistik ve varsayımlar altında üstünlük kanıtı bulunduğunu gösterir. Bütün adayların işe yaradığını, kazananın en iyi kalacağını ya da avantajın yeni bir piyasa rejiminde süreceğini kanıtlamaz.

Her adayı karşılaştırılabilir performans farkı olarak ifade edin

d[k,t], aynı t döneminde k adayının performansı eksi benchmark performansı olsun; yüksek değer her zaman aday lehine olmalıdır. Getiri karşılaştırmasında adayın net getirisinden benchmark’ın net getirisini çıkarabilirsiniz. Tahmin kaybında ise benchmark kaybı eksi aday kaybı olarak yönü tersine çevirin. İşaret kuralı, pozitif değerin adaya avantaj sağladığını her durumda korumalıdır.

Her satır tüm adaylar için aynı zaman aralığını göstermelidir. Tek para birimi, getiri tanımı, finansman yaklaşımı ve maliyet politikası kullanın. İddia uygulanabilir strateji getirileriyle ilgiliyse d[k,t] hesaplanmadan önce uygun komisyon, spread, kayma, fonlama ve borçlanma maliyetlerini düşürün. Brüt getirileri test edip maliyetlerden yalnızca dipnotta söz etmek farklı bir soruyu yanıtlar.

k adayı için örneklem ortalaması d̄[k] = (1/T) Σ_t d[k,t] olur. Ortak sıfır hipotezi H0: max_k E[d[k,t]] ≤ 0, alternatif ise H1: max_k E[d[k,t]] > 0 şeklindedir. Ailenin tamamında aynı benchmark ve değerlendirme ölçütü kullanılır. Eksik tarihler veya gözlem sıklıkları farklıysa farkları hesaplamadan önce savunulabilir ortak bir örneklem tanımlayın; herhangi bir adaya sessizce daha elverişli bir dönem vermeyin.

Araştırma iddiasına aday ailesinin tamamını katın

Aile, raporlanan kazananı etkileyebilecek kuralları içerir: denenen geriye bakış pencereleri, giriş eşikleri, sinyal bileşimleri, varlık evrenleri, elde tutma süreleri, portföy kısıtları ve uygulama varsayımları. Sonuçları gördükten sonra denenip elenen elle oluşturulmuş varyantlar da buna dahildir. White, 2000 tarihli makalesinde “specification search” terimini geniş kullanır: seçime yol açan süreç, yalnızca nihai tablo değil, seçim sorununu yaratır.

Birbirine zıt iki hata vardır. Raporlanan stratejiyi seçmeye katkı sağlayan denemeleri dışarıda bırakmak düzeltilmiş testi gereğinden iyimser yapar; bootstrap gerçekte yapılmış olandan daha küçük bir arama görür. Sonradan çok sayıda keyfî ve ilgisiz kural eklemek ise testi gereksiz ölçüde tutucu kılabilir ve işe yarar bir adayı bulma gücünü düşürebilir. Aileyi gerçek seçim sürecine göre tanımlayın ve sınırını denetlenebilir kılan bir araştırma kaydı tutun.

Test, kaydedilmemiş deneyleri çıkaramaz. Yalnızca kazanan parametreleri içeren bir not defteri aramayı yeniden kurmaya yetmez. Aday listesini, veri sürümünü, değerlendirme tarihlerini, hedefi, maliyet varsayımlarını ve seçim kararlarını birlikte saklayın. Aile sonuçlar incelendikten sonra değiştiyse neyin ve neden değiştiğini belirtin; sonradan kurulan aileyi önceden belirlenmiş gibi sunmayın.

Maksimum istatistiği seçim adımını sıfır dağılımına taşır

Her adayın ortalama göreli performansını hesaplayıp en büyük değeri alın. Yaygın, studentize edilmemiş bir istatistik Vobs = √T × max_k d̄[k] şeklindedir. Maksimum önemlidir: görünürdeki kazananı üreten “en iyiyi seç” işlemini temsil eder. Yalnızca kazanan sütunu test etmek, seçimi referans dağılımından çıkarır.

Bootstrap, ortak üstünlük-yokluğu sıfır hipotezi doğruysa örnekleme değişkenliğiyle ne kadar büyük bir maksimum oluşabileceğini yaklaşık hesaplar. Her b bootstrap tekrarında bütün adayların zaman indeksli fark vektörünü yeniden örnekleyip V*b = √T × max_k(d̄*[k,b] − d̄[k]) gibi merkezlenmiş bir istatistik hesaplayın. Merkezleme, aday ortalamalarını beklenen avantajın sıfır olduğu ve sıfır hipotezi açısından en elverişsiz sınıra taşır; maksimum ise adaylar arasındaki seçimi korur. White’ın makalesi maksimumun bootstrap dağılımını geliştirip gözlenen istatistikle karşılaştırır.

İşlemi birçok kez yineleyin. Düzeltilmiş p-değeri, Vobs değerine eşit veya daha büyük bootstrap maksimumlarının oranıdır. B tekrar için yaygın Monte Carlo tahmini (1 + count{V*b ≥ Vobs})/(B + 1) şeklindedir. Studentizasyon ve tahmin edilmiş modellerin ayrıntıları uygulamaya göre değişebilir; bu nedenle istatistiği ve sıfır hipotezi altındaki merkezleme kuralını belgeleyin. Temel nokta, yalnızca gözlenen kazananı değil, her tekrarda tüm aile maksimumunu yeniden hesaplamaktır.

Aday geçmişini yeniden örneklerken bağımlılığı koruyun

Finansal gözlemler zaman sırasına sahiptir. Bağımsız karıştırma seri bağımlılığı, volatilite kümelenmesini ve korelasyonlu kazanç-kayıp dizilerini yok edebilir. Aynı piyasa günlerine tepki veren stratejiler arasındaki ilişkiyi de bozabilir. Bu özellikler maksimum istatistiğinin kuyruğunu etkiler; her adayı ayrı örneklemek veya tek tek günleri iadeli çekmek hatalı bir referans dağılımı üretebilir.

White, moving-block bootstrap gibi bağımlı veriye uygun yöntemleri açıklar ve Politis ile Romano’nun stationary bootstrap yöntemini inceler. Bu yöntemde çekilen blok çoğunlukla bir sonraki zaman gözlemine devam eder; rastgele yeniden başlatmada başka bir çekilmiş tarihten başlar. Böylece blok uzunlukları seçilen ortalamaya sahip geometrik bir dağılım izler. Yöntemin varsayımları ve ayarları uygun olduğunda, kısa dizileri i.i.d. örneklemeden daha iyi korur. Politis ve Romano’nun stationary bootstrap makalesine bakın.

Strateji ailesi için ortak bir zaman indeksi dizisi çekip tüm satır vektörüne (d[1,t], …, d[K,t]) uygulayın. Bu yaklaşım hem blok içindeki zaman sırasını hem de adaylar arasındaki eşzamanlı bağımlılığı korur. Blok uzunluğunu strateji ufkunu ve bağımlılık tanılamalarını dikkate alarak seçin; makul alternatiflere karşı duyarlılığı da raporlayın. Araştırma süreci parametreleri yeniden tahmin ediyorsa bu adımın çıkarım hedefinde olup olmadığına karar verin ve gerekiyorsa her yeniden örneklemede tekrarlayın. Yalnızca önceden sabitlenmiş uyumlu getirileri örneklemek, sürecin bir bölümünü koşullayıp dışarıda bırakabilir.

Varsayımsal bir bootstrap örneği yorumu değiştirir

Bir araştırmacının T = 252 işlem günü boyunca üç stratejiyi bir benchmark ile karşılaştırdığını varsayalım. Maliyet sonrası ortalama günlük performans farkları +2.0, +1.0 ve −0.5 baz puandır. Kazananın ortalaması 2.0 baz puan, gözlenen istatistik ise √252 × 2.0 bp ≈ 31.75 bp·√işlem günü olur. Bu ölçekleme test istatistiğinin parçasıdır; tahmin edilmiş standart hataya bölünmediği için t-istatistiği değildir.

Şimdi üç aday için aynı örneklenmiş tarihleri kullanan 9.999 stationary-bootstrap tekrarı olduğunu varsayın. Bu varsayımsal sonuçta 1.199 tekrar maksimumu 31.75’e eşit veya daha büyüktür. +1 düzeltmeli Monte Carlo tahmini (1 + 1,199)/(9,999 + 1) = 0.12 olur. Yalnızca kazananı test eden ayrı bir test varsayımsal olarak 0.03 verebilir, ancak üç aday arasındaki aramayı dışarıda bırakır. Reality Check p-değeri tüm aileyi karşılaştırır; bu örnekte ortak sıfır hipotezi %5 düzeyinde reddedilmez.

Bu sayılar hesabı göstermek için uydurulmuştur; ölçülmüş piyasa performansı veya White’ın makalesinden bir sonuç değildir. 0.12 p-değeri stratejinin zarar etme olasılığının %12 olduğu anlamına gelmez. Belirtilen bootstrap ve sıfır kurgusu altında en az bu büyüklükte bir maksimum, seçilen düzeyde reddetmeyi sağlayacak kadar nadir değildir. Örneklem ortalamaları da risk, kapasite ve uygulama etkilerinden sonra getirinin ekonomik olarak anlamlı olup olmadığını göstermez.

Düzeltilmiş p-değerini tanımlı aileye ilişkin kanıt olarak yorumlayın

Küçük Reality Check p-değeri, test varsayımları altında, dahil edilen aileden hiçbir adayın seçilen benchmark’ı beklenen performansta aşmadığı iddiasına karşı kanıttır. Sıfır hipotezi ortak olduğundan, reddedilmesi kalıcı üstünlüğe sahip adayı otomatik olarak belirlemez. Örneklemler arasında kazanan değişebilir; aile düzeyindeki sıfır reddedilse bile tek bir strateji için kanıt zayıf kalabilir.

Büyük p-değeri sıfır hipotezini reddetmek için yeterli kanıt olmadığını gösterir; tüm stratejilerin benchmark’a eşdeğer olduğunu kanıtlamaz. Kısa örneklem, gürültülü performans, çok geniş aile, zayıf ölçüm veya düşük güç sonucu açıklayabilir. p-değeri sıfır hipotezinin doğru olma olasılığı da değildir. Aday kümesine, performans ölçüsüne, benchmark’a, bootstrap tasarımına ve gözlenen verilere bağlı bir referans dağılımının kuyruk olasılığıdır.

White’ın sorusu görecelidir. Bir kural zayıf benchmark’ı yenip yine de para kaybedebilir; güçlü benchmark’ı geçemeyen başka bir kural pozitif getiri sağlayabilir. Mutlak ve benchmark’a göre sonuçları belirsizlik, devir hızı, düşüş, kapasite ve gerçekçi maliyetlerle birlikte raporlayın. Göreli tahmin üstünlüğüne ilişkin istatistiksel kanıt ile yatırımın ekonomik gerekçesi ayrı değerlendirmelerdir.

Sonuca güvenmeden önce varsayımları ve sınırları kontrol edin

Özgün teori, performans farkı süreci ve limit dağılımı için düzenlilik koşullarına dayanır. White’ın çerçevesinde durağan ve güçlü karışımlı zaman serileri bulunur; bağımlı bootstrap da uygun bir blok uzunluğu dizisi gerektirir. Sonlu örneklemlerde rejim değişimleri, yapısal kırılmalar, uzun hafıza, seyrek sıçramalar ve istikrarsız volatilite durağan yeniden örnekleme yaklaşımını şüpheli kılabilir. Blok bootstrap yerel bağımlılığın bir bölümünü korur; bilinmeyen bir gelecek rejimi yeniden üretmez.

Test, veri ve strateji değerlendirme hatalarını da devralır. Geleceğe bakış sızıntısı, hayatta kalma yanlılığı, revize edilmiş veri, gerçekçi olmayan gerçekleşmeler, atlanan maliyetler, kurumsal işlemlerin yanlış ele alınması ve sonuçlar görüldükten sonra seçilen benchmark performans farklarını geçersiz kılabilir. Elde tutma dönemleri çakışıyorsa getiriler yapı gereği bağımlı olabilir; örnekleme birimi ve blok uzunluğu bu bağımlılığı yansıtmalıdır. Son ölçüt Sharpe oranı gibi doğrusal değilse, ortalama getiri bootstrap’ının bunu otomatik olarak test ettiğini varsaymayın; ölçütü her tekrarda yeniden hesaplayın.

Reality Check uygulamaları tutucu olabilir; özellikle büyük bir aday kümesinde açıkça zayıf çok sayıda alternatif varsa. Geniş maksimum dağılımı, iyi bir aday bulunsa bile reddetmeyi zorlaştırabilir. Hansen’in Superior Predictive Ability testi, zayıf alternatifleri farklı ele alan ilişkili bir bootstrap yöntemidir; evrensel bir ikame değildir ve varsayımları da incelenmelidir. İstenen sonucu üreten yöntemi seçmek yerine yöntemleri araştırma sorusuna göre karşılaştırın ve duyarlılıkları raporlayın.

Kronolojik doğrulama ve diğer seçim araçlarıyla birlikte kullanın

White’s Reality Check, seçim etkisini dikkate aldıktan sonra kayıtlı arama ailesinin benchmark’a göre üstün bir aday içerip içermediğini ele alır. Sabitlenmiş bir stratejinin kronolojik holdout veya walk-forward değerlendirmesinin yerini tutmaz. Etiket örtüşmesini ya da veri sızıntısını da tek başına çözmez. PBO farklıdır: kombinatoryal bölümlerde in-sample kazananın aday medyanının altında sıralandığı sıklığı özetler; PBO’nun özgün makalesi bu seçim riski tanısını tanımlar. False-discovery yöntemleri, birden çok ret içindeki beklenen yanlış sonuç payını hedefler. Deflated Sharpe Ratio ise Sharpe temelli anlamlılık değerlendirmesini seçim ve normal dağılmayan getiriler için düzeltir. Finansta çoklu test ve false discovery rate, PBO ve CSCV, walk-forward doğrulaması ve purged cross-validation ile embargo rehberlerine de bakın.

Pratik bir incelemede benchmark’ı ve performans tanımını sabitleyin, fiilen kullanılan aday ailesini yeniden kurun, dönem dönem eşleştirilmiş farkları hesaplayın, bağımlılığı koruyan bir yeniden örnekleme tasarımı seçip gerekçelendirin ve maksimum istatistiği ile bootstrap kuyruk olasılığını raporlayın. Ardından sabitlenmiş seçim sürecini daha sonraki kronolojik verilerde test edin; maliyetleri ve uygulanabilirliği ayrıca değerlendirin. Sullivan, Timmermann ve White’ın teknik işlem kurallarına uygulaması, kural evreninin önemini gösterir: çıkarıma yalnızca bildirilen kazanan değil, aramanın tamamı girdiğinde sonuç değişebilir. Reality Check belirli bir seçim sorununu düzeltir; backtest’in canlı işlemlerde başarılı olacağını belgeleyen bir sertifika değildir.

Sık sorulan sorular

Q1White’s Reality Check neyi test eder?

Tanımlı bir arama ailesindeki en iyi adayın, adaylar arasından seçilme hesaba katıldığında, seçilen benchmark’tan daha yüksek beklenen performansa sahip olup olmadığını test eder.

Q2Küçük bir Reality Check p-değeri stratejinin kârlı olacağını kanıtlar mı?

Hayır. Seçilen benchmark, ölçüt, veri ve bootstrap varsayımları altında aile düzeyindeki üstünlük-yokluğu hipotezine karşı kanıttır. Gelecekteki getiriyi veya net kârı garanti etmez.

Q3Günleri bağımsız örneklemek yerine neden block bootstrap kullanılır?

Bloklar yerel seri bağımlılığın bir kısmını koruyabilir; tüm adaylara ortak tarihler uygulamak eşzamanlı ilişkilerini de korur. Blok tasarımı yine de veri ve araştırma sorusuna uymalıdır.

Kaynaklar ve daha fazla okuma

Sorun bildir

Bu makalenin bağlantısını içeren bir e-posta hazırlayacağız. Mark bildirimi yalnızca gönderdiğinizde alır

Hızlı kontrol

Rehberi okudunuz mu? 3 soruyla kendinizi kontrol edin

Soru 1 / 3

Soru 01

White’ın ortak sıfır hipotezi ne söyler?

Açıklamayı görmek için bir yanıt seçin

Opsiyon sözlüğü

Alım, satım ve opsiyon zincirinden zımni volatiliteye, Yunanlara ve alış-satış farkına uzanan temel terimlerin açık tanımları

Opsiyon sözlüğünü inceleyin
Backtest birincisi grubun medyanının altına ne sıklıkta düşer?Backtest aşırı uyum olasılığı (PBO) ve CSCV açıklamasıKombinatoryal simetrik çapraz doğrulamanın PBO’yu nasıl tahmin ettiğini, OOS sıralarını logit’e nasıl dönüştürdüğünü ve bunun neden gelecekteki kayıpların tahmini olmadığını öğreninNicel araştırmaDeflated Sharpe Ratio: Çoklu testler ve backtest seçimiDeflated Sharpe Ratio'nun, bir strateji seçildikten sonra Sharpe kanıtını çoklu testleri ve normal olmayan getirileri dikkate alarak nasıl düzelttiğini varsayımsal bir örnek ve açık sınırlarla öğrenin.Finansal modelin hangi geçmişten öğreneceğini seçinWalk-forward model doğrulamasında genişleyen ve kayan pencerelerFinansal modeller için genişleyen ve sabit uzunluklu kayan eğitim pencerelerini karşılaştırın, doğrulamayı son testten ayırın ve gelecek sonuçlarını kullanmadan kural seçin.Finansal zaman serilerinde model doğrulamaPurged cross-validation ve embargo nedir? Finansal modellerde etiket sızıntısını önlemeİleriye dönük getiri etiketleri çakıştığında purging ve embargo kullanmayı; walk-forward, TimeSeriesSplit ve CPCV ile farklarını öğrenin.Yön tahminlerinin değerlendirilmesiPesaran–Timmermann Testi: Yön Tahmini Bilgi Katıyor mu?Pesaran–Timmermann testinin yön isabetlerini gerçekleşen ve tahmin edilen yükseliş oranlarına dayalı bir temel değerle nasıl karşılaştırdığını ve seri bağımlılığın çıkarımı neden değiştirdiğini öğrenin.