Brier score vs. log loss untuk prakiraan probabilitas
Bandingkan Brier score dan log loss untuk prakiraan probabilitas biner, pelajari perhitungannya, serta pahami proper scoring, kalibrasi, dan skill prakiraan
Dalam panduan iniHit rate mengabaikan probabilitas yang Anda prakirakan
Ringkasan singkat
Prakiraan probabilitas menyatakan seberapa mungkin suatu peristiwa terjadi, bukan hanya hasil mana yang paling mungkin. Brier score dan log loss membandingkan probabilitas tersebut dengan hasil yang telah diketahui. Keduanya adalah proper scoring rules, tetapi memberi penalti kesalahan dengan cara berbeda. Karena itu, score yang lebih rendah baru bermakna setelah peristiwa, sampel, konvensi score, dan acuan ditetapkan.
Hit rate mengabaikan probabilitas yang Anda prakirakan
Bayangkan Anda mencatat apakah model berhasil memprediksi “naik” atau “turun”. Hit rate menganggap prakiraan benar sebesar 51% dan 99% sama saja. Hit rate juga menyamakan prakiraan 49% dan 1% yang sama-sama keliru. Ini menghilangkan informasi keyakinan, padahal keyakinan dapat berpengaruh ketika keputusan memiliki payoff atau risiko yang berbeda.
Prakiraan probabilitas biner memberikan nilai \(p_t\) antara nol dan satu untuk suatu peristiwa yang didefinisikan dengan jelas pada waktu prakiraan \(t\). Peristiwa itu kemudian dicatat sebagai \(y_t=1\) jika terjadi dan \(y_t=0\) jika tidak. Scoring rule mengevaluasi prakiraan bersama hasilnya. Brier score memakai kuadrat kesalahan probabilitas; log loss memakai negatif logaritma dari probabilitas untuk hasil yang benar-benar terjadi.
Score ini berguna untuk membandingkan prakiraan probabilitas, termasuk probabilitas peristiwa dari model trading. Score tersebut tidak dengan sendirinya menunjukkan bahwa prakiraan terkalibrasi, mengungguli acuan yang masuk akal, atau akan menghasilkan keuntungan jika digunakan untuk trading. Panduan Mincer–Zarnowitz membahas regresi kalibrasi linear yang berbeda untuk prakiraan titik numerik.
Definisikan satu peristiwa dan cocokkan tiap prakiraan dengan hasilnya
Sebelum menghitung score, rumuskan peristiwa agar hasilnya dapat ditentukan secara konsisten. “Apakah aset akan naik?” belum lengkap sebelum aset, sumber harga, waktu mulai dan akhir, mata uang, konvensi return, serta penanganan catatan yang hilang atau dikoreksi ditentukan. Untuk peristiwa ekonomi, catat rilis dan versi data yang digunakan untuk menentukan hasil. Jangan membandingkan prakiraan yang dinilai dengan definisi atau kumpulan tanggal yang berbeda.
Simpan tiap prakiraan sebagaimana tersedia pada waktu asalnya. Probabilitas yang diterbitkan pada waktu \(t\) harus memakai informasi yang tersedia sampai cutoff yang ditentukan dan dipasangkan dengan hasil pada horizon yang sama. Seri data yang direvisi, penutupan bursa yang terjadi kemudian, atau aturan klasifikasi yang dipilih setelah melihat hasil dapat diam-diam mengubah target atau memasukkan informasi masa depan.
Untuk prakiraan bergulir, simpan versi model, versi data input, timestamp, probabilitas, dan aturan penyelesaian peristiwa. Gunakan origin yang sama saat membandingkan model. Jika probabilitas hilang, dokumentasikan pengecualiannya dan terapkan aturan sampel yang sama pada semua kandidat. Catatan tersebut membuat score dapat direproduksi, bukan hanya ringkasan spreadsheet yang terus berubah.
Hitung Brier score dari kuadrat kesalahan probabilitas
Untuk satu peristiwa biner, Brier loss pada kasus \(t\) adalah:
BSₜ = (pₜ − yₜ)²
Brier score rata-rata dari \(n\) prakiraan adalah:
BS = (1/n) Σₜ (pₜ − yₜ)²
Lebih rendah berarti lebih baik, nol berarti sempurna, dan konvensi satu-peristiwa ini berkisar dari nol sampai satu. Misalnya, jika prakiraannya \(p=0.70\) dan peristiwa terjadi, loss-nya \((0.70-1)^2=0.09\). Jika prakiraan yang sama diikuti oleh peristiwa yang tidak terjadi, loss-nya \((0.70-0)^2=0.49\). Kesalahan yang dibuat dengan sangat yakin mendapat penalti lebih besar, tetapi penalti ini tetap terbatas.
Periksa rumus saat membandingkan angka yang dipublikasikan. Beberapa konvensi menjumlahkan kuadrat kesalahan untuk semua kategori dalam prakiraan multikelas; vector sum biner dapat bernilai dua kali loss satu-peristiwa di atas. Mengalikan semua score dengan dua tidak mengubah peringkat untuk satu peristiwa yang sama, tetapi tingkat numeriknya tidak dapat dibandingkan antar-konvensi jika skalanya tidak dijelaskan.
Hitung log loss dan lihat mengapa kesalahan ekstrem menonjol
Untuk peristiwa biner, log loss adalah:
LLₜ = −[yₜ log(pₜ) + (1 − yₜ) log(1 − pₜ)]
Jika peristiwa terjadi, loss-nya \(-\log(p_t)\); jika tidak terjadi, loss-nya \(-\log(1-p_t)\). Jadi prakiraan benar sebesar 70% menghasilkan \(-\log(0.70)\approx0.357\), sedangkan prakiraan 70% yang salah menghasilkan \(-\log(0.30)\approx1.204\). Rata-rata log loss merata-ratakan penalti per kasus ini dan tidak memiliki batas atas tetap ketika prakiraan memberi probabilitas yang nyaris nol pada peristiwa yang benar-benar terjadi.
Pada \(p=0\) atau \(p=1\), prakiraan yang sangat yakin tetapi keliru menghasilkan log loss tak terhingga. Jika software melakukan clipping probabilitas ke batas bawah kecil seperti \(\varepsilon\) agar nilainya tidak tak terhingga, laporkan batas tersebut dan terapkan secara konsisten sebelum hasil dilihat. Clipping mengubah aturan evaluasi numerik dan tidak boleh disembunyikan sebagai detail pembersihan data.
Brier score dan log loss dapat memberi peringkat berbeda pada prakiraan yang sama karena kurva penalti keduanya berbeda. Log loss memberi biaya sangat tinggi saat probabilitas yang diberikan pada peristiwa yang terjadi hampir nol; Brier loss biner dibatasi sampai satu. Tentukan score yang akan dipakai sebelum evaluasi. Jika keputusan bergantung pada probabilitas ekstrem, pertimbangkan untuk menampilkan keduanya alih-alih memilih hasil yang tampak lebih baik setelah melihat data.
<!-- learn:illustration -->

Proper scoring memberi insentif pada probabilitas yang jujur dalam ekspektasi
Score bersifat proper jika pembuat prakiraan memaksimalkan reward ekspektasian atau meminimalkan loss ekspektasian dengan melaporkan probabilitas yang benar-benar mereka yakini. Jika nilai jujur itu merupakan satu-satunya optimum, score tersebut strictly proper. Menurut definisi yang lazim, Brier dan logarithmic score strictly proper untuk prakiraan probabilitas biner (Gneiting dan Raftery, 2007). Ini memberi alasan yang berlandaskan teori untuk mengevaluasi probabilitas, bukan lebih dahulu mengubahnya menjadi label tegas.
“Proper” adalah pernyataan tentang ekspektasi, bukan jaminan untuk setiap sampel yang teramati. Orang yang jujur melaporkan probabilitas 70% tetap dapat keliru pada satu kasus dan mendapat finite-sample score yang lebih buruk daripada orang yang menebak. Prakiraan berulang yang dapat dibandingkan diperlukan untuk mempelajari kinerja rata-rata. Insentif juga penting: jika seseorang menghadapi aturan payoff lain, score saja tidak menjamin bahwa probabilitas yang dilaporkan mencerminkan keyakinannya.
Kedua score ini tidak hanya mengukur kalibrasi. Nilai agregat dapat menggabungkan kedekatan probabilitas dengan frekuensi hasil yang teramati dan kemampuan memisahkan kasus yang hasilnya berbeda. Model dapat menghasilkan prakiraan yang tajam tetapi tetap salah kalibrasi secara sistematis; model yang selalu melaporkan base rate dapat terkalibrasi secara agregat, tetapi hanya memberi sedikit informasi untuk masing-masing kasus.
Baca dekomposisi Brier sebagai reliability, resolution, dan uncertainty
Dekomposisi Murphy membagi Brier score rata-rata menjadi tiga komponen (Murphy, 1973012%3C0595%3AANVPOT%3E2.0.CO%3B2)):
BS = reliability − resolution + uncertainty
Untuk kelompok \(k\) prakiraan dengan probabilitas serupa, \(w_k\) adalah proporsi sampel tiap kelompok, \(\bar p_k\) probabilitas prakiraan rata-ratanya, \(\bar y_k\) frekuensi kejadian yang teramati, dan \(\bar y\) frekuensi kejadian keseluruhan. Komponen berbasis bin adalah:
reliability = Σₖ wₖ(̅pₖ − ̅yₖ)² resolution = Σₖ wₖ(̅yₖ − ̅y)² uncertainty = ̅y(1 − ̅y)
Kesalahan reliability yang lebih rendah lebih baik: prakiraan dalam satu kelompok seharusnya sesuai dengan frekuensi teramati dalam kelompok itu. Resolution yang lebih tinggi lebih baik: frekuensi kejadian tiap kelompok seharusnya berbeda dari base rate keseluruhan. Uncertainty mencerminkan seberapa sering peristiwa terjadi dalam sampel dan bukan jasa model prakiraan. Dekomposisi ini menjelaskan mengapa dua model bisa memiliki Brier score sama tetapi keunggulan yang berbeda.
Dekomposisi empiris bersifat exact jika kasus dengan probabilitas prakiraan yang identik dikelompokkan bersama. Jika probabilitas kontinu dibagi ke dalam bin, dekomposisinya exact untuk prakiraan yang telah dikelompokkan, bukan untuk perbedaan antarprobabilitas asli yang hilang di dalam bin. Pengelompokan memerlukan pilihan bin. Reliability diagram dengan sepuluh bin berlebar sama dapat memberi gambaran berbeda dari bin kuantil, terutama dalam sampel kecil atau dekat nilai probabilitas ekstrem. Tampilkan jumlah kasus dan uncertainty per bin, serta gunakan dekomposisi sebagai diagnostik, bukan cara untuk menghapus sampling error. Plot kalibrasi bukan bukti independen bahwa prakiraan akan tetap andal di masa depan.
Gunakan acuan sebelum menyebut score sebagai skill
Raw score yang lebih rendah daripada model lain adalah sebuah perbandingan, tetapi belum menyatakan perbaikan dari baseline yang berguna. Brier skill score membandingkan sistem prakiraan dengan prakiraan acuan yang disebutkan secara jelas:
BSS = 1 − BS_model / BS_reference
Dengan definisi ini, nilai nol sama dengan acuan, nilai positif menunjukkan peningkatan, dan nilai negatif menunjukkan hasil yang lebih buruk. Nilai satu berarti Brier loss model nol ketika loss acuan positif. Pilih acuan yang sesuai dengan keputusan dan information set. Base rate historis tetap, frekuensi kejadian dalam jendela training, atau prosedur prakiraan yang sudah digunakan dapat menjadi pilihan yang masuk akal untuk tugas berbeda.
Jangan menghitung acuan dari hasil evaluasi masa depan jika hasil itu belum tersedia saat prakiraan dibuat. Untuk deret waktu, frekuensi historis yang mengembang atau bergulir dapat menjadi baseline operasional yang lebih bersih daripada frekuensi seluruh sampel. Jika score acuan nol, rasionya tidak terdefinisi; jelaskan cara membentuk benchmark dan laporkan raw score model serta acuannya.
Brier skill score bergantung pada acuan dan frekuensi kejadian. Score terhadap prakiraan base rate tanpa syarat menjawab pertanyaan berbeda dari score terhadap model produksi yang sedang digunakan. Jangan membandingkan nilai BSS antarstudi sebelum memeriksa definisi peristiwa, prakiraan acuan, periode sampel, dan konvensi biner atau multikategori.
Bandingkan model pada hasil out-of-sample yang berpasangan
Buat prakiraan probabilitas secara kronologis dan sisihkan periode evaluasi yang tidak digunakan untuk tuning model, memilih fitur, atau menentukan threshold. Nilai semua model menggunakan hasil dan origin yang sama. Untuk loss yang dipilih, definisikan selisih berpasangan sebagai:
dₜ = Lₐ,ₜ − Lᵦ,ₜ
Dengan konvensi tanda ini, rata-rata positif berarti model B memiliki rata-rata loss yang lebih rendah. Kerangka Diebold–Mariano dapat menguji perbedaan rata-rata loss jika asumsi perbandingan prakiraan dan estimasi variansnya sesuai dengan desain. Jika pertanyaannya adalah apakah score relatif berubah menurut kondisi yang diketahui saat prakiraan dibuat, panduan Giacomini–White membahas perbandingan bersyarat tersebut. Origin berulang, jendela peristiwa yang tumpang tindih, dan pencarian model dapat membuat selisih saling bergantung atau terpilih; standard error naif atau satu p-value tanpa koreksi dapat melebih-lebihkan bukti.
Tentukan peristiwa, horizon, sampel, score utama, benchmark, dan arah perbandingan sebelum melihat hasil. Laporkan rata-rata Brier dan log loss, ukuran sampel, definisi model dan acuan, aturan clipping probabilitas, serta penyesuaian untuk dependensi atau pencarian model. Reliability plot dan selisih score berpasangan di samping nilai agregat membantu menjelaskan apa yang berubah. Metode forecast combination dapat menggabungkan prakiraan, tetapi kombinasi akhir juga perlu dievaluasi pada data yang tidak dipakai untuk memilihnya.
Score ini tidak memiliki satuan yang sama. Selisih Brier 0.01 tidak secara langsung setara dengan selisih log loss 0.01. Score yang lebih rendah juga tidak membuktikan bahwa model probabilitas yang mendasarinya benar; score hanya memberi bukti tentang prakiraan yang dievaluasi pada hasil yang dinyatakan.
Pisahkan kualitas prakiraan dari profitabilitas trading
Probabilitas hanya dapat mendukung keputusan trading melalui aturan yang mengubahnya menjadi tindakan. Keputusan juga bergantung pada besarnya payoff, kerugian saat salah, harga eksekusi, spread, komisi, slippage, funding, biaya pinjam, batas modal, dan waktu ketika prakiraan dapat diperdagangkan. Proper score mengevaluasi prakiraan probabilitas; score ini tidak mencakup biaya tersebut atau memilih ukuran posisi.
Model dapat memperbaiki rata-rata log loss tanpa memperbaiki aturan trading tertentu, karena aturan itu mungkin hanya trading pada rentang probabilitas tertentu atau merespons horizon berbeda. Sebaliknya, sinyal keputusan yang berguna dapat terkonsentrasi pada sedikit kasus sehingga kontribusinya kecil terhadap score keseluruhan. Setelah mengevaluasi prakiraan, nilai aturan keputusan yang telah ditetapkan sebelumnya secara terpisah pada tanggal yang tidak dipakai untuk memilihnya, menggunakan net return realistis dan estimasi uncertainty.
Laporan yang memadai memungkinkan peneliti lain mereproduksi peristiwa, probabilitas, hasil, rumus dan konvensi score, acuan, sampel, serta waktu evaluasi. Nyatakan apakah probabilitas berasal dari out-of-sample, apakah hasil saling tumpang tindih, bagaimana kasus yang hilang ditangani, dan berapa banyak model alternatif atau pilihan score yang dicoba. Disiplin ini membuat score prakiraan informatif tanpa mengubahnya menjadi klaim profit masa depan.
Pertanyaan umum
Q1Apakah Brier score yang lebih rendah selalu lebih baik?
Lebih rendah berarti lebih baik jika definisi peristiwa, sampel, konvensi scoring, dan pengodean hasilnya sama. Score dari peristiwa atau konvensi multikategori yang berbeda mungkin tidak dapat dibandingkan langsung.
Q2Apakah Brier score yang baik membuktikan bahwa probabilitas sudah terkalibrasi?
Tidak. Brier score agregat menggabungkan reliability, resolution, dan uncertainty peristiwa. Periksa juga diagnostik kalibrasi serta uncertainty sampel.
Q3Sebaiknya gunakan Brier score atau log loss?
Pilih sebelum mengevaluasi hasil. Brier loss terbatas dan menggunakan kuadrat kesalahan probabilitas; log loss menghukum lebih berat probabilitas salah yang disampaikan dengan keyakinan tinggi. Pilihan bergantung pada konsekuensi tugas dan sensitivitas yang dibutuhkan.
Q4Apakah score probabilitas yang lebih baik berarti strategi trading menguntungkan?
Tidak. Score mengevaluasi prakiraan, bukan keputusan setelah mempertimbangkan payoff, biaya eksekusi, pembiayaan, ukuran posisi, dan pemilihan model. Riset primer - Brier, “Verification of Forecasts Expressed in Terms of Probability” (1950)078%3C0001%3AVOFEIT%3E2.0.CO%3B2) - Murphy, “A New Vector Partition of the Probability Score” (1973)012%3C0595%3AANVPOT%3E2.0.CO%3B2) - Gneiting and Raftery, “Strictly Proper Scoring Rules, Prediction, and Estimation” (2007) - Diebold and Mariano, “Comparing Predictive Accuracy” (1995)
Sumber dan bacaan lanjutan
Laporkan masalah
Kami akan menyiapkan email berisi tautan artikel ini. Mark menerima laporan setelah Anda mengirimkannya
Cek cepat
Sudah membaca panduannya? Uji diri dengan 3 pertanyaan
Pertanyaan 01
Suatu peristiwa biner terjadi setelah prakiraan 70%. Berapa Brier loss dengan konvensi satu-peristiwa?
Pilih jawaban untuk melihat penjelasannya