Olasılıksal tahminlerde Brier score ve log loss karşılaştırması
İkili olasılık tahminleri için Brier score ile log loss'u karşılaştırın, hesaplamayı öğrenin ve proper scoring, kalibrasyon ve tahmin başarısını anlayın
Bu rehberdeİsabet oranı tahmin ettiğiniz olasılığı göz ardı eder
Kısa özet
Olasılıksal tahmin, yalnızca hangi sonucun daha olası olduğunu değil, bir olayın gerçekleşme olasılığını da ifade eder. Brier score ve log loss bu olasılıkları gerçekleşmiş sonuçlarla karşılaştırır. İkisi de proper scoring rules olsa da hataları farklı biçimlerde cezalandırır. Bu nedenle daha düşük bir score, ancak olay, örneklem, hesaplama kuralı ve karşılaştırma ölçütü önceden sabitlendiğinde anlamlıdır.
İsabet oranı tahmin ettiğiniz olasılığı göz ardı eder
Bir modelin “yükseliş” ya da “düşüş” tahminini doğru yapıp yapmadığını kaydettiğinizi düşünün. İsabet oranı, doğru çıkan %51 olasılıklı tahminle doğru çıkan %99 olasılıklı tahmini aynı sayar. Hatalı %49 ve %1 tahminleri de birbirinden ayırmaz. Böylece tahminin ifade ettiği güven düzeyi kaybolur; oysa kararların getirileri veya riskleri farklıysa bu bilgi önemli olabilir.
İkili olasılık tahmini, \(t\) tahmin başlangıcında açıkça tanımlanmış bir olaya sıfır ile bir arasında \(p_t\) değeri atar. Olay gerçekleşirse sonuç \(y_t=1\), gerçekleşmezse \(y_t=0\) olarak kaydedilir. Scoring rule tahmini ve sonucu birlikte değerlendirir. Brier score olasılık hatasının karesini kullanır; log loss ise gerçekten gerçekleşen sonuca atanmış olasılığın negatif logaritmasını alır.
Bu score'lar, bir trading modelinin olay olasılıkları da dâhil olmak üzere olasılıksal tahminleri karşılaştırmaya yarar. Ancak tek başlarına tahminin kalibre olduğunu, makul bir referansı geçtiğini veya bu tahmine göre işlem yapmanın kâr getireceğini göstermezler. Mincer–Zarnowitz rehberi, sayısal nokta tahminleri için farklı bir doğrusal kalibrasyon regresyonunu açıklar.
Bir olayı tanımlayın ve her tahmini sonucuyla eşleştirin
Score hesaplamadan önce olayı, sonucu tutarlı biçimde belirlenebilecek şekilde tanımlayın. “Varlık yükselecek mi?” sorusu; varlık, fiyat kaynağı, başlangıç ve bitiş zamanı, para birimi, getiri kuralı ve eksik ya da düzeltilmiş kayıtların nasıl ele alınacağı belirtilmeden tamamlanmış sayılmaz. Ekonomik bir olay için sonucu belirlemede kullanılan açıklamayı ve veri sürümünü kaydedin. Farklı tanımlara veya tarih kümelerine göre puanlanmış tahminleri karşılaştırmayın.
Her tahmini, başlangıç anında erişilebilir olduğu biçimiyle saklayın. \(t\) anında yayımlanan bir olasılık yalnızca belirlenen cutoff'a kadar mevcut bilgileri kullanmalı ve aynı horizon'daki sonuçla eşleştirilmelidir. Sonradan revize edilmiş bir veri serisi, daha sonraki bir borsa kapanış fiyatı veya sonuç görüldükten sonra seçilen sınıflandırma kuralı target'ı fark ettirmeden değiştirebilir ya da geleceğe ait bilgi ekleyebilir.
Rolling forecast'ler için model sürümünü, girdi verisinin sürümünü, timestamp'i, olasılığı ve sonuç belirleme kuralını saklayın. Modelleri karşılaştırırken aynı forecast origin'leri kullanın. Bir olasılık eksikse dışlama nedenini belgeleyin ve tüm adaylara aynı örneklem kuralını uygulayın. Bu kayıtlar score'u, sürekli değişen bir spreadsheet özeti olmaktan çıkarıp yeniden üretilebilir hâle getirir.
Brier score'u karesel olasılık hatalarından hesaplayın
Tek bir ikili olay için \(t\) vakasındaki Brier loss şöyledir:
BSₜ = (pₜ − yₜ)²
\(n\) tahminin ortalama Brier score'u şöyledir:
BS = (1/n) Σₜ (pₜ − yₜ)²
Daha düşük daha iyidir, sıfır kusursuz tahmindir ve tek olay konvansiyonundaki aralık sıfır ile birdir. Örneğin tahmin \(p=0.70\) ve olay gerçekleşmişse loss \((0.70-1)^2=0.09\) olur. Aynı tahminden sonra olay gerçekleşmezse loss \((0.70-0)^2=0.49\) olur. Yüksek güvenle yapılan bir hata, ölçülü bir hatadan daha pahalıdır; ancak cezanın üst sınırı vardır.
Yayımlanmış sayıları karşılaştırırken formülü kontrol edin. Bazı konvansiyonlar, çok sonuçlu bir tahmindeki tüm kategorilerin karesel hatalarını toplar; ikili durumda bu vektör toplamı, yukarıdaki tek olay loss'unun iki katı olabilir. Aynı olay için tüm score'ları ikiyle çarpmak sıralamayı değiştirmez; ancak ölçek belirtilmedikçe farklı konvansiyonların sayısal değerleri karşılaştırılamaz.
Log loss'u hesaplayın ve uç hataların neden öne çıktığını görün
İkili bir olay için log loss şöyledir:
LLₜ = −[yₜ log(pₜ) + (1 − yₜ) log(1 − pₜ)]
Olay gerçekleşirse loss \(-\log(p_t)\), gerçekleşmezse \(-\log(1-p_t)\) olur. Bu nedenle doğru bir %70 tahmini \(-\log(0.70)\approx0.357\) alırken, aynı tahmin yanlış çıkarsa \(-\log(0.30)\approx1.204\) alır. Ortalama log loss, vaka bazındaki cezaların ortalamasıdır ve tahmin gerçekleşen olaya sıfıra çok yakın bir olasılık verdiğinde sabit bir üst sınırı yoktur.
\(p=0\) veya \(p=1\) olduğunda, yüksek güvenle verilmiş yanlış bir tahmin sonsuz log loss üretir. Yazılım sonsuzluğu önlemek için olasılıkları \(\varepsilon\) gibi küçük bir alt sınıra kırpıyorsa bu sınırı açıklayın ve sonuçları görmeden önce tutarlı biçimde uygulayın. Clipping sayısal değerlendirme kuralını değiştirir; veri temizliğinin önemsiz bir ayrıntısı gibi gizlenmemelidir.
Brier score ile log loss'un ceza eğrileri farklı olduğundan, aynı tahminleri farklı sıraya koyabilirler. Log loss, gerçekleşen bir olaya neredeyse sıfır olasılık verilmesini özellikle ağır cezalandırır; ikili Brier loss ise en fazla birdir. Hangi score'un kullanılacağını önceden belirleyin. Kararlar uç olasılıklara bağlıysa, sonradan daha iyi görünen sonucu seçmek yerine ikisini de raporlamayı düşünün.
<!-- learn:illustration -->

Proper scoring, beklenti düzeyinde dürüst olasılık bildirimini teşvik eder
Tahminci gerçekten inandığı olasılığı bildirerek beklenen ödülünü en üst düzeye çıkarıyor veya beklenen kaybını en aza indiriyorsa score proper'dır. Bu dürüst olasılık tek optimumsa score strictly proper'dır. Yaygın tanımlara göre Brier ve logarithmic score'lar ikili olasılık tahminleri için strictly proper'dır (Gneiting ve Raftery, 2007). Bu özellik, olasılıkları önce kesin etiketlere çevirmek yerine doğrudan değerlendirmenin kuramsal gerekçesidir.
“Proper” özelliği beklentiye ilişkindir; gözlenen her örneklemde iyi sonuç alınacağına dair söz vermez. Dürüstçe %70 olasılık bildiren tahminci tek bir vakada yanılabilir ve sonlu örneklemde score'u tahmin yürüten birinden daha kötü olabilir. Ortalama performansı öğrenmek için tekrarlanan ve karşılaştırılabilir tahminler gerekir. Teşvikler de önemlidir: kişi ayrı bir payoff kuralıyla karşı karşıyaysa score, bildirilen olasılığın inancını yansıttığını tek başına garanti etmez.
Bu score'ların hiçbiri yalnızca kalibrasyonu ölçmez. Toplam bir değer; olasılıkların gözlenen frekanslara yakınlığını ve farklı sonuçlanan vakaları ayırma becerisini birlikte yansıtabilir. Bir model belirgin biçimde farklı tahminler üretirken sistematik olarak kalibrasyonsuz olabilir; her zaman base rate bildiren bir model genel olarak kalibre görünse de her vaka hakkında az bilgi verebilir.
Brier ayrıştırmasını reliability, resolution ve uncertainty olarak okuyun
Murphy ayrıştırması ortalama Brier score'u üç terime böler (Murphy, 1973012%3C0595%3AANVPOT%3E2.0.CO%3B2)):
BS = reliability − resolution + uncertainty
Benzer olasılıklara sahip tahmin grupları \(k\) için \(w_k\) her grubun örneklem payı, \(\bar p_k\) ortalama tahmin olasılığı, \(\bar y_k\) gözlenen olay frekansı ve \(\bar y\) genel olay frekansı olsun. Bin'lere göre bileşenler şöyledir:
reliability = Σₖ wₖ(̅pₖ − ̅yₖ)² resolution = Σₖ wₖ(̅yₖ − ̅y)² uncertainty = ̅y(1 − ̅y)
Daha düşük reliability error daha iyidir: aynı gruptaki tahminler o grubun gözlenen frekansına uymalıdır. Daha yüksek resolution daha iyidir: grupların olay frekansları genel base rate'ten farklı olmalıdır. Uncertainty olayın örneklemde ne sıklıkta gerçekleştiğini yansıtır ve tahmin modelinin başarısı değildir. Bu ayrıştırma, iki modelin aynı Brier score'a sahip olup farklı güçlü yanlar taşıyabileceğini açıklar.
Aynı yayımlanmış olasılığa sahip vakalar birlikte gruplandığında ampirik ayrıştırma exact'tir. Sürekli olasılıklar bin'lere ayrılırsa ayrıştırma, gruplanmış tahmin için exact olur; bin içinde kaybolan özgün olasılık farkları için olmaz. Gruplama, bin sınırı seçmeyi gerektirir. Eşit genişlikte on bin kullanan bir reliability diagram, özellikle küçük örneklemde veya olasılık uçlarında quantile bin kullanan bir diyagramdan farklı görünebilir. Her bin'in vaka sayısını ve uncertainty'sini gösterin; gruplu ayrıştırmayı örnekleme hatasını silme yöntemi değil, tanı aracı olarak kullanın. Calibration plot'lar gelecekteki reliability için bağımsız kanıt değildir.
Bir score'a skill demeden önce referans seçin
Başka bir modelden daha düşük raw score, bir karşılaştırmadır; yararlı bir baseline'a göre iyileşme olduğu anlamına henüz gelmez. Brier skill score, tahmin sistemini adı belirtilmiş bir reference forecast ile karşılaştırır:
BSS = 1 − BS_model / BS_reference
Bu tanıma göre sıfır reference ile aynı sonucu, pozitif değer iyileşmeyi, negatif değer daha kötü sonucu gösterir. Reference loss pozitifken modelin Brier loss'u sıfırsa değer birdir. Karara ve bilgi kümesine uygun bir referans seçin. Göreve göre sabit geçmiş base rate, eğitim penceresindeki olay frekansı veya mevcut tahmin prosedürü uygun olabilir.
Tahmin yapıldığı sırada mevcut olmayacak gelecek değerlendirme sonuçlarıyla reference hesaplamayın. Zaman serilerinde expanding veya rolling geçmiş frekansı, tüm örneklem olay oranından daha temiz bir operasyonel baseline olabilir. Reference score sıfırsa oran tanımsızdır; benchmark'ın nasıl oluşturulduğunu açıklayın ve model ile reference'ın raw score'larını da raporlayın.
Brier skill score, reference'a ve olay frekansına bağlıdır. Koşulsuz base-rate tahminine göre score, mevcut production model'e göre score'dan farklı bir soruyu yanıtlar. Çalışmalar arasındaki BSS değerlerini karşılaştırmadan önce olay tanımlarını, reference forecast'leri, örneklem dönemlerini ve ikili ya da çok kategorili konvansiyonları kontrol edin.
Modelleri eşleştirilmiş out-of-sample sonuçlarda karşılaştırın
Olasılıkları kronolojik sırayla üretin ve model ayarlama, özellik seçimi veya threshold belirleme için kullanılmamış bir değerlendirme dönemi ayırın. Tüm modelleri aynı kesinleşmiş sonuçlarda ve origin'lerde puanlayın. Seçilen loss için eşleştirilmiş farkı şöyle tanımlayın:
dₜ = Lₐ,ₜ − Lᵦ,ₜ
Bu işaret konvansiyonuna göre pozitif ortalama, model B'nin ortalama loss'unun daha düşük olduğu anlamına gelir. Diebold–Mariano çerçevesi, forecast karşılaştırma varsayımları ve varyans tahmini tasarıma uygunsa ortalama loss farkını test edebilir. Soru, göreli score'un tahmin anında bilinen koşullarla değişip değişmediğiyse Giacomini–White rehberi koşullu karşılaştırmayı ele alır. Tekrarlanan origin'ler, çakışan olay pencereleri ve model araması farkları bağımlı veya seçilmiş hâle getirebilir; naif bir standard error ya da düzeltmesiz tek bir p-value kanıtı abartabilir.
Sonuçlara bakmadan önce olayı, horizon'ı, örneklemi, temel score'u, benchmark'ı ve karşılaştırma yönünü belirleyin. Ortalama Brier ve log loss'u, örneklem büyüklüklerini, model ve reference tanımlarını, olasılık clipping kuralını ve bağımlılık ya da arama için yapılan düzeltmeleri raporlayın. Reliability plot ve eşleştirilmiş score farklarını toplam değerlerle birlikte göstermek değişimi açıklamaya yardımcı olur. Forecast combination yöntemleri tahminleri birleştirebilir; ancak son kombinasyon da seçiminde kullanılmamış bir değerlendirme döneminde test edilmelidir.
Score'ların birimleri aynı değildir. Brier'daki 0.01 fark, log loss'taki 0.01 farkla doğrudan aynı büyüklükte sayılamaz. Daha düşük score, alttaki olasılık modelinin doğru olduğunu da kanıtlamaz; yalnızca belirtilen sonuçlarda değerlendirilen tahminler hakkında kanıttır.
Tahmin kalitesini trading kârlılığından ayrı tutun
Bir olasılık, ancak onu eyleme dönüştüren bir kural aracılığıyla trading kararını destekler. Karar; payoff büyüklüğüne, yanlış tahmindeki kayba, gerçekleşme fiyatlarına, spread'lere, komisyonlara, slippage'a, funding'e, borrow maliyetlerine, sermaye sınırlarına ve tahminin ne zaman işlem yapılabilir hâle geldiğine de bağlıdır. Proper score bir olasılık tahminini değerlendirir; bu maliyetleri içermez ve pozisyon büyüklüğü belirlemez.
Bir modelin ortalama log loss'u iyileşirken belirli bir trading kuralı iyileşmeyebilir; çünkü kural yalnızca belli bir olasılık aralığında işlem yapıyor veya farklı bir horizon'a tepki veriyor olabilir. Tersine, yararlı bir karar sinyali az sayıda vakada yoğunlaşıp genel score'a çok az katkıda bulunabilir. Tahmini değerlendirdikten sonra, önceden belirlenmiş karar kuralını seçmekte kullanılmamış tarihlerde ayrıca değerlendirin; gerçekçi net getiriler ve uncertainty tahminleri kullanın.
Yeterli bir rapor, başka bir araştırmacının olayı, olasılığı, sonucu, score formülü ve konvansiyonunu, reference'ı, örneklemi ve değerlendirme zamanını yeniden oluşturmasını sağlar. Olasılıkların out-of-sample olup olmadığını, sonuçların çakışıp çakışmadığını, eksik vakaların nasıl ele alındığını ve kaç alternatif model ya da score seçiminin denendiğini belirtin. Bu disiplin, tahmin score'unu gelecekteki kâr iddiasına dönüştürmeden bilgilendirici kılar.
Sık sorulan sorular
Q1Daha düşük bir Brier score her zaman daha mı iyidir?
Olay tanımı, örneklem, scoring konvansiyonu ve sonuç kodlaması aynıysa daha düşüğü daha iyidir. Farklı olayların veya çok kategorili konvansiyonların score'ları doğrudan karşılaştırılamayabilir.
Q2İyi bir Brier score olasılıkların kalibre olduğunu kanıtlar mı?
Hayır. Aggregate Brier score reliability, resolution ve olay uncertainty'sini bir araya getirir. Kalibrasyon tanılarını ve örneklem belirsizliğini de inceleyin.
Q3Brier score mu, log loss mu kullanmalıyım?
Sonuçları değerlendirmeden önce seçin. Brier loss sınırlıdır ve karesel olasılık hatası kullanır; log loss, yüksek güvenle bildirilen yanlış olasılıkları daha ağır cezalandırır. Seçim, görevin sonuçlarına ve istenen duyarlılığa bağlıdır.
Q4Daha iyi bir olasılık score'u trading stratejisinin kârlı olduğu anlamına gelir mi?
Hayır. Score tahminleri değerlendirir; payoff, işlem maliyetleri, finansman, pozisyon büyüklüğü ve model seçimi sonrasındaki kararları değil. Birincil araştırmalar - Brier, “Verification of Forecasts Expressed in Terms of Probability” (1950)078%3C0001%3AVOFEIT%3E2.0.CO%3B2) - Murphy, “A New Vector Partition of the Probability Score” (1973)012%3C0595%3AANVPOT%3E2.0.CO%3B2) - Gneiting and Raftery, “Strictly Proper Scoring Rules, Prediction, and Estimation” (2007) - Diebold and Mariano, “Comparing Predictive Accuracy” (1995)
Kaynaklar ve daha fazla okuma
Sorun bildir
Bu makalenin bağlantısını içeren bir e-posta hazırlayacağız. Mark bildirimi yalnızca gönderdiğinizde alır
Hızlı kontrol
Rehberi okudunuz mu? 3 soruyla kendinizi kontrol edin
Soru 01
Bir ikili olay, %70 olasılıklı tahminden sonra gerçekleşiyor. Tek olay konvansiyonuna göre Brier loss nedir?
Açıklamayı görmek için bir yanıt seçin