Skip to content
Tất cả hướng dẫn quyền chọn
Đánh giá dự báo xác suất12 phút đọc

So sánh Brier score và log loss trong dự báo xác suất

So sánh Brier score và log loss cho dự báo xác suất nhị phân, tìm hiểu cách tính và ý nghĩa của proper scoring, hiệu chỉnh xác suất và năng lực dự báo

Trong hướng dẫn nàyTỷ lệ dự báo đúng bỏ qua xác suất bạn đã đưa ra

Tóm tắt ngắn

Dự báo xác suất cho biết một sự kiện có khả năng xảy ra đến đâu, chứ không chỉ kết quả nào có khả năng cao nhất. Brier score và log loss so sánh xác suất dự báo với kết quả đã được xác định. Cả hai đều là proper scoring rules nhưng phạt sai số theo cách khác nhau. Vì vậy, score thấp hơn chỉ có ý nghĩa khi sự kiện, mẫu, quy ước tính điểm và mốc tham chiếu đã được xác định trước.

Tỷ lệ dự báo đúng bỏ qua xác suất bạn đã đưa ra

Hãy hình dung bạn ghi lại liệu mô hình có dự báo đúng “tăng” hay “giảm” hay không. Tỷ lệ dự báo đúng xem dự báo chính xác 51% và chính xác 99% là như nhau. Nó cũng đánh đồng dự báo sai 49% với dự báo sai 1%. Cách đo này bỏ mất mức độ tin cậy được thể hiện trong dự báo, dù thông tin đó có thể quan trọng khi quyết định dẫn đến mức lợi ích hoặc rủi ro khác nhau.

Dự báo xác suất nhị phân gán giá trị \(p_t\) từ 0 đến 1 cho một sự kiện được định nghĩa rõ tại thời điểm dự báo \(t\). Sau đó, ghi \(y_t=1\) nếu sự kiện xảy ra và \(y_t=0\) nếu không. Scoring rule đánh giá đồng thời dự báo và kết quả. Brier score dùng bình phương sai số xác suất; log loss dùng logarit âm của xác suất được gán cho kết quả thực sự đã xảy ra.

Các score này hữu ích khi so sánh dự báo xác suất, kể cả xác suất sự kiện do mô hình trading tạo ra. Tự chúng không cho biết dự báo có được hiệu chỉnh tốt hay không, có vượt một mốc tham chiếu hợp lý hay không, hoặc giao dịch dựa trên dự báo có sinh lời hay không. Hướng dẫn Mincer–Zarnowitz trình bày một hồi quy hiệu chỉnh tuyến tính khác dành cho dự báo điểm dạng số.

Định nghĩa một sự kiện và ghép mỗi dự báo với kết quả tương ứng

Trước khi tính score, hãy định nghĩa sự kiện sao cho kết quả có thể được xác định nhất quán. Câu hỏi “Tài sản có tăng không?” chưa đầy đủ nếu chưa nêu tài sản, nguồn giá, thời điểm bắt đầu và kết thúc, tiền tệ, quy ước lợi suất và cách xử lý dữ liệu bị thiếu hoặc đã sửa. Với sự kiện kinh tế, hãy ghi lại thông báo và phiên bản dữ liệu dùng để xác định kết quả. Không so sánh các dự báo được chấm trên định nghĩa sự kiện hoặc tập ngày khác nhau.

Lưu mỗi dự báo đúng như thông tin có sẵn tại thời điểm phát hành. Xác suất đưa ra ở thời điểm \(t\) chỉ được dùng dữ liệu sẵn có đến cutoff đã nêu và phải được ghép với kết quả ở cùng horizon. Chuỗi dữ liệu đã được sửa đổi, giá đóng cửa xuất hiện sau đó hoặc quy tắc phân loại được chọn sau khi xem kết quả có thể âm thầm thay đổi target hoặc đưa thông tin tương lai vào phép đánh giá.

Với rolling forecast, hãy lưu phiên bản mô hình, phiên bản dữ liệu đầu vào, timestamp, xác suất và quy tắc xác định kết quả. Dùng cùng các origin khi so sánh mô hình. Nếu thiếu xác suất, ghi rõ lý do loại bỏ và áp dụng cùng quy tắc lấy mẫu cho mọi phương án. Những bản ghi này giúp tái tạo score thay vì chỉ tạo ra bản tóm tắt từ một spreadsheet luôn thay đổi.

Tính Brier score từ bình phương sai số xác suất

Với một sự kiện nhị phân, Brier loss của trường hợp \(t\) là:

BSₜ = (pₜ − yₜ)²

Brier score trung bình của \(n\) dự báo là:

BS = (1/n) Σₜ (pₜ − yₜ)²

Score thấp hơn tốt hơn, 0 là hoàn hảo; theo quy ước cho một sự kiện này, score nằm trong khoảng từ 0 đến 1. Ví dụ, nếu dự báo là \(p=0.70\) và sự kiện xảy ra, loss là \((0.70-1)^2=0.09\). Nếu sự kiện không xảy ra sau cùng dự báo đó, loss là \((0.70-0)^2=0.49\). Dự báo sai với độ tin cậy cao bị phạt nặng hơn sai số vừa phải, nhưng mức phạt vẫn có giới hạn.

Hãy kiểm tra công thức khi đối chiếu các số liệu đã công bố. Một số quy ước cộng bình phương sai số trên mọi danh mục của dự báo đa kết quả; với dự báo nhị phân, tổng vector này có thể gấp đôi loss cho một sự kiện ở trên. Nhân mọi score trong cùng một sự kiện với hai không làm đổi thứ hạng, nhưng nếu không nêu thang đo thì giá trị số giữa các quy ước không thể so sánh trực tiếp.

Tính log loss và hiểu vì sao sai số cực đoan bị phạt nặng

Với một sự kiện nhị phân, log loss là:

LLₜ = −[yₜ log(pₜ) + (1 − yₜ) log(1 − pₜ)]

Nếu sự kiện xảy ra, loss là \(-\log(p_t)\); nếu không xảy ra, loss là \(-\log(1-p_t)\). Vì vậy, dự báo đúng với xác suất 70% nhận \(-\log(0.70)\approx0.357\), còn dự báo 70% đó nếu sai sẽ nhận \(-\log(0.30)\approx1.204\). Log loss trung bình lấy trung bình mức phạt theo từng trường hợp và không có giới hạn trên cố định khi dự báo gán xác suất gần bằng 0 cho sự kiện thực sự xảy ra.

Khi \(p=0\) hoặc \(p=1\), dự báo sai với độ tin cậy tuyệt đối tạo ra log loss vô hạn. Nếu phần mềm clipping xác suất về một mức sàn nhỏ như \(\varepsilon\) để tránh giá trị vô hạn, hãy công bố mức sàn đó và áp dụng nhất quán trước khi xem kết quả. Clipping thay đổi quy tắc đánh giá bằng số nên không được giấu như một chi tiết làm sạch dữ liệu.

Brier score và log loss có thể xếp hạng cùng một tập dự báo theo thứ tự khác nhau vì đường cong phạt của chúng khác nhau. Log loss đặc biệt phạt nặng khi xác suất gần bằng 0 được gán cho một sự kiện đã xảy ra; Brier loss nhị phân bị chặn ở mức 1. Hãy chọn trước score sẽ dùng. Nếu quyết định phụ thuộc vào các xác suất cực đoan, hãy cân nhắc báo cáo cả hai thay vì chọn kết quả có lợi hơn sau khi đã xem dữ liệu.

<!-- learn:illustration -->

Những giọt thủy tinh xanh đối diện các viên đá hổ phách tượng trưng cho kết quả; một dự báo rất chắc chắn cách xa sự kiện đã xảy ra
Hình khái niệm về xác suất và kết quả thực tế, với mức phạt lớn hơn cho dự báo sai nhưng quá tự tin; không phải dữ liệu thị trường, kết quả kiểm định hay tín hiệu giao dịch

Proper scoring khuyến khích báo cáo xác suất trung thực theo kỳ vọng

Một score là proper nếu người dự báo tối đa hóa phần thưởng kỳ vọng hoặc tối thiểu hóa tổn thất kỳ vọng bằng cách báo cáo xác suất mà họ thực sự tin tưởng. Nếu xác suất trung thực đó là giá trị tối ưu duy nhất thì score là strictly proper. Theo các định nghĩa thông dụng, Brier score và logarithmic score strictly proper cho dự báo xác suất nhị phân (Gneiting và Raftery, 2007). Đây là cơ sở nguyên tắc để đánh giá xác suất thay vì chuyển chúng thành nhãn cứng trước.

“Proper” là một tính chất về kỳ vọng, không phải cam kết cho mọi mẫu quan sát được. Người báo cáo trung thực xác suất 70% vẫn có thể sai ở một trường hợp và nhận score trên mẫu hữu hạn tệ hơn người đoán. Cần có các dự báo lặp lại và có thể so sánh để đánh giá hiệu suất trung bình. Động cơ cũng quan trọng: nếu cá nhân chịu một quy tắc payoff riêng, bản thân score không đảm bảo xác suất họ báo cáo phản ánh niềm tin thực sự.

Không score nào trong hai loại chỉ đo hiệu chỉnh. Giá trị tổng hợp có thể kết hợp mức độ gần nhau giữa xác suất và tần suất quan sát được với khả năng phân biệt các trường hợp có kết quả khác nhau. Mô hình có thể đưa ra dự báo sắc nét nhưng vẫn lệch hiệu chỉnh một cách có hệ thống; mô hình luôn báo cáo base rate có thể được hiệu chỉnh ở mức tổng thể nhưng cung cấp ít thông tin riêng cho từng trường hợp.

Đọc phân rã Brier qua reliability, resolution và uncertainty

Phân rã Murphy chia Brier score trung bình thành ba thành phần (Murphy, 1973012%3C0595%3AANVPOT%3E2.0.CO%3B2)):

BS = reliability − resolution + uncertainty

Với các nhóm \(k\) dự báo có xác suất tương tự, \(w_k\) là tỷ trọng mẫu của mỗi nhóm, \(\bar p_k\) là xác suất dự báo trung bình, \(\bar y_k\) là tần suất sự kiện quan sát được và \(\bar y\) là tần suất chung. Các thành phần theo bin là:

reliability = Σₖ wₖ(̅pₖ − ̅yₖ)² resolution = Σₖ wₖ(̅yₖ − ̅y)² uncertainty = ̅y(1 − ̅y)

Reliability error thấp hơn là tốt: xác suất dự báo trong nhóm nên khớp với tần suất quan sát được của nhóm đó. Resolution cao hơn là tốt: tần suất sự kiện của các nhóm nên khác base rate chung. Uncertainty phản ánh mức độ thường xuyên sự kiện xuất hiện trong mẫu và không phải công lao của mô hình dự báo. Phân rã này giải thích vì sao hai mô hình có thể đạt cùng Brier score nhưng có thế mạnh khác nhau.

Phân rã thực nghiệm chính xác khi gom các trường hợp có cùng xác suất đã phát hành. Nếu chia xác suất liên tục thành các bin, phân rã chính xác đối với dự báo đã được gộp thành nhóm, chứ không chính xác với những khác biệt giữa các xác suất ban đầu bị mất bên trong từng bin. Việc phân nhóm đòi hỏi chọn ranh giới bin. Reliability diagram với mười bin có độ rộng bằng nhau có thể cho hình ảnh khác diagram dùng bin theo quantile, đặc biệt khi mẫu nhỏ hoặc gần hai đầu dải xác suất. Hãy trình bày số trường hợp và uncertainty của từng bin; xem phân rã theo bin là công cụ chẩn đoán, không phải cách xóa bỏ sai số lấy mẫu. Calibration plot không phải bằng chứng độc lập về reliability trong tương lai.

Chọn mốc tham chiếu trước khi gọi score là skill

Raw score thấp hơn mô hình khác là một phép so sánh, nhưng chưa phải bằng chứng cải thiện so với một baseline hữu ích. Brier skill score so sánh hệ thống dự báo với một dự báo tham chiếu được nêu rõ:

BSS = 1 − BS_model / BS_reference

Theo định nghĩa này, 0 bằng với reference, giá trị dương cho thấy cải thiện và giá trị âm cho kết quả kém hơn. Giá trị 1 nghĩa là Brier loss của mô hình bằng 0 khi loss của reference là số dương. Chọn reference phù hợp với quyết định và tập thông tin. Tùy nhiệm vụ, có thể dùng base rate lịch sử cố định, tần suất sự kiện trong training window hoặc quy trình dự báo hiện có.

Đừng tính reference từ kết quả đánh giá tương lai nếu chúng chưa có sẵn ở thời điểm đưa ra dự báo. Với chuỗi thời gian, tần suất lịch sử expanding hoặc rolling có thể là baseline vận hành phù hợp hơn tần suất của toàn bộ mẫu. Nếu reference score bằng 0 thì tỷ lệ không được xác định; hãy nêu cách xây dựng benchmark và báo cáo cả raw score của mô hình lẫn reference.

Brier skill score phụ thuộc vào reference và tần suất sự kiện. Score so với dự báo base rate vô điều kiện trả lời câu hỏi khác với score so với mô hình production hiện tại. Không so sánh BSS giữa các nghiên cứu khi chưa kiểm tra định nghĩa sự kiện, dự báo tham chiếu, giai đoạn mẫu và quy ước nhị phân hay đa danh mục.

So sánh mô hình trên kết quả out-of-sample được ghép cặp

Tạo xác suất theo trình tự thời gian và dành riêng một giai đoạn đánh giá không được dùng để điều chỉnh mô hình, chọn feature hay chọn threshold. Chấm tất cả mô hình trên cùng kết quả đã được xác định và cùng origin. Với loss đã chọn, định nghĩa paired difference như sau:

dₜ = Lₐ,ₜ − Lᵦ,ₜ

Theo quy ước dấu này, trung bình dương có nghĩa model B có loss trung bình thấp hơn. Khuôn khổ Diebold–Mariano có thể kiểm định chênh lệch loss trung bình khi các giả định so sánh forecast và ước lượng phương sai phù hợp với thiết kế. Nếu câu hỏi là score tương đối có thay đổi theo điều kiện đã biết tại thời điểm dự báo hay không, hướng dẫn Giacomini–White trình bày phép so sánh có điều kiện đó. Origin lặp lại, cửa sổ sự kiện chồng lấn và quá trình tìm kiếm mô hình có thể làm các chênh lệch phụ thuộc hoặc bị chọn lọc; standard error ngây thơ hoặc một p-value chưa điều chỉnh có thể phóng đại bằng chứng.

Trước khi xem kết quả, hãy xác định sự kiện, horizon, mẫu, score chính, benchmark và chiều so sánh. Báo cáo Brier và log loss trung bình, kích thước mẫu, định nghĩa model và reference, quy tắc clipping xác suất, cùng mọi điều chỉnh cho dependence hoặc model search. Reliability plot và paired score differences bên cạnh giá trị tổng hợp giúp giải thích điều gì đã thay đổi. Các phương pháp forecast combination có thể kết hợp dự báo, nhưng combination cuối cùng cũng cần được đánh giá trên giai đoạn không dùng để lựa chọn nó.

Các score không cùng đơn vị. Chênh lệch Brier 0.01 không tương đương trực tiếp với chênh lệch log loss 0.01. Score thấp hơn cũng không chứng minh mô hình xác suất nền tảng là đúng; đó là bằng chứng về các dự báo được đánh giá trên những kết quả đã xác định.

Tách chất lượng dự báo khỏi lợi nhuận giao dịch

Xác suất chỉ hỗ trợ quyết định giao dịch thông qua quy tắc chuyển nó thành hành động. Quyết định còn phụ thuộc vào quy mô payoff, mức lỗ khi sai, giá khớp lệnh, spread, commission, slippage, funding, chi phí vay, giới hạn vốn và thời điểm có thể giao dịch dựa trên dự báo. Proper score đánh giá dự báo xác suất; nó không tính những chi phí này hoặc chọn quy mô vị thế.

Mô hình có thể cải thiện log loss trung bình mà không cải thiện một quy tắc giao dịch cụ thể, vì quy tắc đó chỉ giao dịch trong một khoảng xác suất hoặc phản ứng với horizon khác. Ngược lại, tín hiệu hữu ích cho quyết định có thể tập trung trong một nhóm trường hợp nhỏ nên đóng góp ít vào score tổng thể. Sau khi đánh giá forecast, hãy đánh giá riêng quy tắc quyết định đã định trước trên các ngày không dùng để lựa chọn nó, với net return thực tế và ước lượng uncertainty.

Một báo cáo đầy đủ cho phép nhà nghiên cứu khác tái tạo sự kiện, xác suất, kết quả, công thức và quy ước score, reference, mẫu và thời điểm đánh giá. Báo cáo cần nêu xác suất có phải out-of-sample không, kết quả có chồng lấn không, các trường hợp thiếu được xử lý ra sao và đã thử bao nhiêu mô hình hoặc cách chọn score khác. Quy trình này giúp score dự báo có ích mà không biến nó thành tuyên bố về lợi nhuận tương lai.

Câu hỏi thường gặp

Q1Brier score thấp hơn có phải lúc nào cũng tốt hơn không?

Tốt hơn khi định nghĩa sự kiện, mẫu, quy ước scoring và cách mã hóa kết quả giống nhau. Score từ các sự kiện hoặc quy ước đa danh mục khác nhau có thể không so sánh trực tiếp được.

Q2Brier score tốt có chứng minh xác suất đã được hiệu chỉnh không?

Không. Brier score tổng hợp kết hợp reliability, resolution và uncertainty của sự kiện. Hãy xem thêm chẩn đoán hiệu chỉnh và uncertainty của mẫu.

Q3Nên dùng Brier score hay log loss?

Hãy chọn trước khi đánh giá kết quả. Brier loss có giới hạn và dùng bình phương sai số xác suất; log loss phạt nặng hơn những xác suất sai được đưa ra với độ tin cậy cao. Lựa chọn phụ thuộc vào hệ quả của nhiệm vụ và độ nhạy mong muốn.

Q4Score xác suất tốt hơn có nghĩa chiến lược giao dịch sinh lời không?

Không. Score đánh giá dự báo, không đánh giá quyết định sau khi tính payoff, chi phí thực hiện, tài trợ, quy mô vị thế và việc lựa chọn mô hình. Nghiên cứu gốc - Brier, “Verification of Forecasts Expressed in Terms of Probability” (1950)078%3C0001%3AVOFEIT%3E2.0.CO%3B2) - Murphy, “A New Vector Partition of the Probability Score” (1973)012%3C0595%3AANVPOT%3E2.0.CO%3B2) - Gneiting and Raftery, “Strictly Proper Scoring Rules, Prediction, and Estimation” (2007) - Diebold and Mariano, “Comparing Predictive Accuracy” (1995)

Nguồn và tài liệu đọc thêm

Báo lỗi

Chúng tôi sẽ soạn email kèm liên kết bài viết này. Mark chỉ nhận được báo cáo sau khi bạn gửi email

Kiểm tra nhanh

Đọc xong hướng dẫn? Hãy kiểm tra với 3 câu hỏi

Câu hỏi 1 / 3

Câu hỏi 01

Một sự kiện nhị phân xảy ra sau dự báo 70%. Brier loss theo quy ước một sự kiện là bao nhiêu?

Chọn một đáp án để xem giải thích

Bảng thuật ngữ quyền chọn

Đánh giá dự báoHồi quy Mincer–Zarnowitz: Kiểm định độ chệch và hiệu chỉnh dự báoTìm hiểu hồi quy Mincer–Zarnowitz kiểm tra hệ số chặn và thang đo của dự báo ra sao, vì sao sai số trung bình bằng không không đồng nghĩa với hiệu chỉnh tốt, và phép kiểm định này không thể chứng minh điều gì.Đánh giá dự báoKiểm định Diebold–Mariano: Cách so sánh độ chính xác của dự báoTìm hiểu cách kiểm định Diebold–Mariano so sánh tổn thất dự báo theo cặp, xử lý các chân trời dự báo chồng lấn và vì sao p-value thấp không chứng minh được kỹ năng giao dịch.Kiểm định dự báoKiểm định Giacomini–White: Độ chính xác dự báo có điều kiệnTìm hiểu cách kiểm định Giacomini–White đánh giá liệu độ chính xác dự báo có thay đổi theo các điều kiện đã biết hay không, cách chọn biến công cụ và cách diễn giải kết quảSo sánh mô hình dự báoModel Confidence Set (MCS): so sánh mô hình dự báo mà không ép chọn một bên thắngTìm hiểu cách Model Confidence Set dùng các kiểm định tuần tự và bootstrap có xét phụ thuộc để giữ lại những mô hình dự báo mà bằng chứng chưa phân biệt được.Nền tảng quyền chọnTrong giá, tại giá và ngoài giá nghĩa là gì?Tìm hiểu cách các nhãn trong giá, tại giá và ngoài giá hoạt động với quyền chọn mua và bán, kèm ví dụ về giá trị nội tại và hòa vốn