Skip to content
Semua panduan opsyen
Penilaian ramalan kebarangkalian12 minit bacaan

Brier score berbanding log loss untuk ramalan kebarangkalian

Bandingkan Brier score dan log loss bagi ramalan kebarangkalian binari, pelajari cara mengiranya serta fahami proper scoring, kalibrasi dan kemahiran ramalan

Dalam panduan iniKadar kejayaan mengabaikan kebarangkalian yang diramal

Ringkasan ringkas

Ramalan kebarangkalian menyatakan kemungkinan sesuatu peristiwa berlaku, bukan sekadar hasil yang paling mungkin. Brier score dan log loss membandingkan kebarangkalian itu dengan hasil yang telah diketahui. Kedua-duanya ialah proper scoring rules, tetapi mengenakan penalti terhadap kesilapan dengan cara yang berbeza. Oleh itu, score yang lebih rendah hanya bermakna selepas peristiwa, sampel, kaedah pengiraan dan penanda aras ditetapkan.

Kadar kejayaan mengabaikan kebarangkalian yang diramal

Bayangkan anda merekod sama ada model berjaya meramal “naik” atau “turun”. Kadar kejayaan menganggap ramalan betul pada 51% dan 99% sebagai sama. Ia juga menyamakan ramalan salah pada 49% dengan ramalan salah pada 1%. Maklumat tentang tahap keyakinan pun hilang, sedangkan keyakinan boleh penting apabila keputusan melibatkan pulangan atau risiko yang berlainan.

Ramalan kebarangkalian binari memberikan nilai \(p_t\) antara sifar dengan satu kepada peristiwa yang ditakrifkan dengan jelas pada asal ramalan \(t\). Peristiwa itu kemudian direkod sebagai \(y_t=1\) jika berlaku dan \(y_t=0\) jika tidak. Scoring rule menilai ramalan bersama hasilnya. Brier score menggunakan ralat kebarangkalian kuasa dua; log loss menggunakan logaritma negatif bagi kebarangkalian yang diberikan kepada hasil yang benar-benar berlaku.

Score ini berguna untuk membandingkan ramalan kebarangkalian, termasuk kebarangkalian peristiwa daripada model dagangan. Score sahaja tidak menunjukkan bahawa ramalan telah dikalibrasi, mengatasi penanda aras yang munasabah atau akan menjana keuntungan jika digunakan untuk berdagang. Panduan Mincer–Zarnowitz menerangkan regresi kalibrasi linear yang berbeza untuk ramalan titik berangka.

Takrifkan satu peristiwa dan padankan setiap ramalan dengan hasilnya

Sebelum memberikan score, takrifkan peristiwa supaya hasilnya boleh ditentukan secara konsisten. “Adakah aset akan naik?” belum lengkap sehingga aset, sumber harga, masa mula dan tamat, mata wang, kaedah pengiraan pulangan serta cara menangani rekod yang hilang atau dibetulkan dinyatakan. Bagi peristiwa ekonomi, rekodkan pengumuman dan versi data yang digunakan untuk menentukan hasil. Jangan bandingkan ramalan yang dinilai menggunakan takrif atau set tarikh yang berbeza.

Simpan setiap ramalan seperti yang tersedia pada asalnya. Kebarangkalian yang dikeluarkan pada masa \(t\) hendaklah menggunakan maklumat yang tersedia sehingga cutoff yang ditetapkan dan dipadankan dengan hasil bagi horizon yang sama. Siri data yang telah disemak semula, harga penutup bursa yang diterbitkan kemudian atau kaedah pengelasan yang dipilih selepas melihat hasil boleh mengubah sasaran secara senyap atau memasukkan maklumat masa hadapan.

Untuk ramalan rolling, simpan versi model, versi data input, timestamp, kebarangkalian dan kaedah penentuan hasil. Gunakan origin yang sama untuk membandingkan model. Jika kebarangkalian tiada, dokumentasikan pengecualian itu dan gunakan peraturan sampel yang sama untuk setiap calon. Rekod ini menjadikan score boleh dihasilkan semula, bukan sekadar ringkasan spreadsheet yang berubah-ubah.

Kira Brier score daripada ralat kebarangkalian kuasa dua

Bagi satu peristiwa binari, Brier loss untuk kes \(t\) ialah:

BSₜ = (pₜ − yₜ)²

Purata Brier score bagi \(n\) ramalan ialah:

BS = (1/n) Σₜ (pₜ − yₜ)²

Lebih rendah lebih baik, sifar sempurna, dan konvensyen peristiwa tunggal ini berjulat dari sifar hingga satu. Contohnya, jika ramalan ialah \(p=0.70\) dan peristiwa berlaku, loss ialah \((0.70-1)^2=0.09\). Jika peristiwa tidak berlaku selepas ramalan yang sama, loss ialah \((0.70-0)^2=0.49\). Kesilapan dengan keyakinan tinggi mendapat penalti lebih besar daripada kesilapan sederhana, tetapi penalti itu tetap terbatas.

Semak formulanya apabila membandingkan angka yang diterbitkan. Sesetengah konvensyen menjumlahkan ralat kuasa dua bagi semua kategori dalam ramalan berbilang hasil; bagi ramalan binari, jumlah vektor ini boleh menjadi dua kali ganda loss peristiwa tunggal di atas. Menggandakan semua score tidak mengubah kedudukan model bagi peristiwa yang sama, tetapi nilai berangkanya tidak boleh dibandingkan antara konvensyen jika skalanya tidak dinyatakan.

Kira log loss dan lihat sebab kesilapan ekstrem lebih ketara

Untuk peristiwa binari, log loss ialah:

LLₜ = −[yₜ log(pₜ) + (1 − yₜ) log(1 − pₜ)]

Jika peristiwa berlaku, loss ialah \(-\log(p_t)\); jika tidak berlaku, loss ialah \(-\log(1-p_t)\). Maka ramalan 70% yang betul mendapat \(-\log(0.70)\approx0.357\), manakala ramalan 70% yang salah mendapat \(-\log(0.30)\approx1.204\). Purata log loss mengambil purata penalti bagi setiap kes dan tiada had atas tetap apabila ramalan memberikan kebarangkalian hampir sifar kepada peristiwa yang berlaku.

Pada \(p=0\) atau \(p=1\), ramalan yang sangat yakin tetapi salah menghasilkan log loss tidak terhingga. Jika perisian mengehadkan kebarangkalian kepada nilai minimum kecil seperti \(\varepsilon\) bagi mengelakkan nilai tidak terhingga, nyatakan had tersebut dan gunakan secara konsisten sebelum melihat hasil. Clipping mengubah peraturan penilaian berangka dan tidak sepatutnya disembunyikan sebagai butiran pembersihan data.

Brier score dan log loss boleh menyusun ramalan yang sama dengan cara berlainan kerana lengkung penalti kedua-duanya berbeza. Log loss memberi kos yang sangat tinggi apabila kebarangkalian hampir sifar diberikan kepada peristiwa yang berlaku; Brier loss binari dihadkan pada satu. Tentukan score yang hendak digunakan sebelum penilaian. Jika keputusan bergantung pada kebarangkalian ekstrem, pertimbangkan untuk melaporkan kedua-duanya dan bukannya memilih hasil yang kelihatan lebih baik selepas itu.

<!-- learn:illustration -->

Titisan kaca biru berhadapan dengan batu ambar sebagai hasil peristiwa; satu ramalan yang sangat yakin tersasar jauh
Ilustrasi konsep kebarangkalian dan hasil sebenar dengan penalti berbeza bagi kesilapan yang sangat yakin; bukan data pasaran, keputusan ujian atau isyarat dagangan

Proper scoring menggalakkan kebarangkalian yang jujur secara jangkaan

Score bersifat proper jika peramal memaksimumkan ganjaran jangkaan atau meminimumkan kerugian jangkaan dengan melaporkan kebarangkalian yang benar-benar dipercayainya. Score itu strictly proper jika nilai jujur tersebut satu-satunya nilai optimum. Mengikut takrif lazim, Brier score dan logarithmic score strictly proper untuk ramalan kebarangkalian binari (Gneiting dan Raftery, 2007). Ini memberikan asas untuk menilai kebarangkalian dan bukannya menukarkannya kepada label keras terlebih dahulu.

“Proper” ialah pernyataan tentang jangkaan, bukannya jaminan bagi setiap sampel yang diperhatikan. Peramal yang jujur melaporkan kebarangkalian 70% masih boleh tersilap dalam satu kes dan mendapat score sampel terhingga yang lebih buruk daripada orang yang meneka. Ramalan berulang yang boleh dibandingkan diperlukan untuk mengetahui prestasi purata. Insentif juga penting: jika seseorang tertakluk pada peraturan pulangan yang berasingan, score sahaja tidak menjamin kebarangkalian yang dilaporkan mencerminkan kepercayaannya.

Kedua-dua score ini tidak mengukur kalibrasi sahaja. Nilai agregat boleh menggabungkan sejauh mana kebarangkalian hampir dengan frekuensi hasil yang diperhatikan dan keupayaan untuk membezakan kes yang menghasilkan keputusan berlainan. Model boleh mengeluarkan ramalan yang jelas berbeza tetapi masih tersalah kalibrasi secara sistematik; model yang sentiasa melaporkan kadar asas mungkin terkalibrasi secara agregat tetapi memberikan sedikit maklumat khusus bagi setiap kes.

Tafsirkan penguraian Brier sebagai reliability, resolution dan uncertainty

Penguraian Murphy memecahkan purata Brier score kepada tiga sebutan (Murphy, 1973012%3C0595%3AANVPOT%3E2.0.CO%3B2)):

BS = reliability − resolution + uncertainty

Bagi kumpulan \(k\) ramalan yang mempunyai kebarangkalian serupa, \(w_k\) ialah bahagian sampel kumpulan itu, \(\bar p_k\) purata kebarangkalian ramalannya, \(\bar y_k\) frekuensi peristiwa yang diperhatikan dan \(\bar y\) frekuensi keseluruhan. Komponen berasaskan bin ialah:

reliability = Σₖ wₖ(̅pₖ − ̅yₖ)² resolution = Σₖ wₖ(̅yₖ − ̅y)² uncertainty = ̅y(1 − ̅y)

Ralat reliability yang lebih rendah lebih baik: ramalan dalam kumpulan sepatutnya sepadan dengan frekuensi yang diperhatikan dalam kumpulan itu. Resolution yang lebih tinggi lebih baik: frekuensi peristiwa bagi kumpulan sepatutnya berbeza daripada kadar asas keseluruhan. Uncertainty mencerminkan kekerapan peristiwa dalam sampel dan bukan pencapaian model ramalan. Penguraian ini menjelaskan bagaimana dua model boleh mempunyai Brier score yang sama tetapi kekuatan yang berbeza.

Penguraian empirikal adalah tepat apabila kes dengan kebarangkalian ramalan yang sama dikelompokkan bersama. Jika kebarangkalian berterusan dibahagikan kepada bin, penguraian tepat untuk ramalan yang telah dikasarkan itu, bukan untuk perbezaan antara kebarangkalian asal yang hilang dalam bin. Pengelompokan memerlukan pilihan sempadan bin. Reliability diagram dengan sepuluh bin lebar sama boleh menunjukkan gambaran berlainan daripada bin kuantil, khususnya dalam sampel kecil atau berhampiran nilai ekstrem. Paparkan bilangan kes dan uncertainty bagi setiap bin; anggap penguraian berbin sebagai diagnostik, bukan cara menghapuskan ralat pensampelan. Plot kalibrasi bukan bukti bebas tentang reliability pada masa hadapan.

Pilih rujukan sebelum menamakan score sebagai skill

Raw score yang lebih rendah berbanding model lain ialah satu perbandingan, tetapi belum menyatakan peningkatan berbanding baseline yang berguna. Brier skill score membandingkan sistem ramalan dengan ramalan rujukan yang dinyatakan dengan jelas:

BSS = 1 − BS_model / BS_reference

Mengikut takrif ini, sifar menyamai rujukan, nilai positif menunjukkan peningkatan dan nilai negatif menunjukkan hasil yang lebih buruk. Nilai satu bermaksud Brier loss model sifar apabila loss rujukan positif. Pilih rujukan yang sesuai dengan keputusan dan set maklumat. Kadar asas sejarah yang tetap, frekuensi peristiwa dalam tetingkap latihan atau prosedur ramalan sedia ada mungkin sesuai untuk tugasan yang berlainan.

Jangan kira rujukan menggunakan hasil penilaian masa hadapan jika hasil tersebut belum tersedia semasa ramalan dibuat. Bagi siri masa, frekuensi sejarah yang berkembang atau rolling boleh menjadi baseline operasi yang lebih bersih daripada kadar keseluruhan sampel. Jika score rujukan sifar, nisbah itu tidak ditakrifkan; nyatakan cara benchmark dibentuk dan laporkan raw score model serta rujukan.

Brier skill score bergantung pada rujukan dan frekuensi peristiwa. Score berbanding ramalan kadar asas tanpa syarat menjawab soalan yang berlainan daripada score berbanding model produksi semasa. Jangan bandingkan BSS antara kajian tanpa menyemak definisi peristiwa, ramalan rujukan, tempoh sampel serta konvensyen binari atau berbilang kategori.

Bandingkan model menggunakan hasil out-of-sample yang berpasangan

Jana kebarangkalian mengikut kronologi dan asingkan tempoh penilaian yang tidak digunakan untuk melaras model, memilih ciri atau menentukan threshold. Berikan score kepada semua model berdasarkan hasil dan origin yang sama. Bagi loss yang dipilih, takrifkan perbezaan berpasangan seperti berikut:

dₜ = Lₐ,ₜ − Lᵦ,ₜ

Dengan konvensyen tanda ini, purata positif bermaksud model B mempunyai purata loss yang lebih rendah. Kerangka Diebold–Mariano boleh menguji perbezaan purata loss jika andaian perbandingan ramalan dan anggaran variansnya sesuai dengan reka bentuk. Jika persoalannya sama ada score relatif berubah mengikut keadaan yang diketahui pada masa ramalan, panduan Giacomini–White membincangkan perbandingan bersyarat itu. Origin berulang, tetingkap peristiwa bertindih dan pencarian model boleh menyebabkan perbezaan saling bergantung atau terpilih; standard error naif atau satu p-value tanpa pelarasan boleh membesar-besarkan bukti.

Tetapkan peristiwa, horizon, sampel, score utama, benchmark dan arah perbandingan sebelum melihat hasil. Laporkan purata Brier dan log loss, saiz sampel, takrif model dan rujukan, peraturan clipping serta pelarasan bagi kebergantungan atau pencarian. Reliability plot dan perbezaan score berpasangan bersama nilai agregat membantu menerangkan perubahan. Kaedah forecast combination boleh menggabungkan ramalan, tetapi kombinasi akhir juga perlu dinilai pada tempoh yang tidak digunakan untuk memilihnya.

Unit score ini tidak sama. Perbezaan Brier sebanyak 0.01 tidak secara langsung setara dengan perbezaan log loss sebanyak 0.01. Score yang lebih rendah juga tidak membuktikan model kebarangkalian asas itu betul; ia hanya memberikan bukti tentang ramalan yang dinilai pada hasil yang dinyatakan.

Asingkan kualiti ramalan daripada keuntungan dagangan

Kebarangkalian hanya menyokong keputusan dagangan melalui peraturan yang menukarkannya kepada tindakan. Keputusan turut bergantung pada saiz pulangan, kerugian apabila ramalan salah, harga pelaksanaan, spread, komisen, slippage, funding, kos pinjaman, had modal dan masa ramalan boleh didagangkan. Proper score menilai ramalan kebarangkalian; ia tidak merangkumi kos tersebut atau menentukan saiz posisi.

Model boleh memperbaik purata log loss tanpa memperbaik peraturan dagangan tertentu kerana peraturan itu mungkin hanya berdagang dalam julat kebarangkalian tertentu atau bertindak balas terhadap horizon yang berlainan. Sebaliknya, isyarat keputusan yang berguna mungkin tertumpu pada sebilangan kecil kes dan hanya menyumbang sedikit kepada score keseluruhan. Selepas menilai ramalan, nilai peraturan keputusan yang telah ditetapkan terlebih dahulu secara berasingan pada tarikh yang tidak digunakan untuk memilihnya, menggunakan pulangan bersih yang realistik dan anggaran uncertainty.

Laporan yang mencukupi membolehkan penyelidik lain menghasilkan semula peristiwa, kebarangkalian, hasil, formula dan konvensyen score, rujukan, sampel serta masa penilaian. Nyatakan sama ada kebarangkalian out-of-sample, sama ada hasil bertindih, cara kes yang hilang dikendalikan dan bilangan model alternatif atau pilihan score yang dicuba. Disiplin ini menjadikan score ramalan berguna tanpa menukarkannya kepada dakwaan keuntungan masa hadapan.

Soalan lazim

Q1Adakah Brier score yang lebih rendah sentiasa lebih baik?

Lebih rendah lebih baik apabila definisi peristiwa, sampel, konvensyen scoring dan pengekodan hasil adalah sama. Score daripada peristiwa atau konvensyen berbilang kategori yang berbeza mungkin tidak boleh dibandingkan secara langsung.

Q2Adakah Brier score yang baik membuktikan kebarangkalian telah dikalibrasi?

Tidak. Brier score agregat menggabungkan reliability, resolution dan uncertainty peristiwa. Periksa juga diagnostik kalibrasi dan uncertainty sampel.

Q3Patutkah saya menggunakan Brier score atau log loss?

Pilih sebelum menilai hasil. Brier loss terbatas dan menggunakan ralat kebarangkalian kuasa dua; log loss mengenakan penalti lebih besar pada kebarangkalian salah yang dinyatakan dengan yakin. Pilihan bergantung pada akibat tugasan dan sensitiviti yang dikehendaki.

Q4Adakah score kebarangkalian yang lebih baik bermaksud strategi dagangan menguntungkan?

Tidak. Score menilai ramalan, bukan keputusan selepas mengambil kira pulangan, kos pelaksanaan, pembiayaan, saiz posisi dan pemilihan model. Penyelidikan primer - Brier, “Verification of Forecasts Expressed in Terms of Probability” (1950)078%3C0001%3AVOFEIT%3E2.0.CO%3B2) - Murphy, “A New Vector Partition of the Probability Score” (1973)012%3C0595%3AANVPOT%3E2.0.CO%3B2) - Gneiting and Raftery, “Strictly Proper Scoring Rules, Prediction, and Estimation” (2007) - Diebold and Mariano, “Comparing Predictive Accuracy” (1995)

Sumber dan bacaan lanjut

Laporkan masalah

Kami akan menyediakan e-mel dengan pautan artikel ini. Mark menerima laporan hanya selepas anda menghantarnya

Semakan pantas

Sudah membaca panduan? Uji diri dengan 3 soalan

Soalan 1 / 3

Soalan 01

Satu peristiwa binari berlaku selepas ramalan 70%. Berapakah Brier loss mengikut konvensyen peristiwa tunggal?

Pilih jawapan untuk melihat penjelasan

Glosari opsyen