Skip to content
Tất cả hướng dẫn quyền chọn
Đánh giá dự báo mật độ13 min read

Biến đổi tích phân xác suất: hiệu chỉnh dự báo mật độ

Tìm hiểu PIT đánh giá dự báo mật độ liên tục và rời rạc ra sao, biểu đồ histogram cho biết gì và vì sao tính đều không đủ

Trong hướng dẫn nàyVì sao dự báo mật độ cần nhiều hơn sai số điểm

Tóm tắt ngắn

Dự báo mật độ gán xác suất cho một dải kết quả có thể xảy ra. Biến đổi tích phân xác suất (PIT) đổi mỗi kết quả quan sát thành xác suất tích lũy theo dự báo. PIT có phân phối đều là chẩn đoán hữu ích dưới các giả định nhất định, nhưng histogram phẳng tự nó không chứng minh hiệu chỉnh có điều kiện hay tính độc lập theo thời gian.

Vì sao dự báo mật độ cần nhiều hơn sai số điểm

Dự báo điểm có thể nói lợi suất ngày mai là 0,2%. Dự báo mật độ gán xác suất cho toàn bộ dải lợi suất, từ biến động thường gặp đến sự kiện cực đoan. Việc đánh giá hỏi liệu phân phối được đưa ra trước khi biết kết quả có phù hợp với những gì xảy ra sau đó hay không. Hướng dẫn Mincer–Zarnowitz nói về hiệu chỉnh tuyến tính của dự báo điểm dạng số, một câu hỏi khác.

PIT đo xác suất tích lũy mà dự báo gán cho các giá trị không lớn hơn kết quả thực tế. Đây là thứ hạng xác suất, không phải lợi suất, tín hiệu giao dịch hay thước đo lợi nhuận. Hướng dẫn Diebold–Mariano so sánh tổn thất dự báo trung bình theo một điểm số chọn trước; nó không kiểm tra cùng câu hỏi với hiệu chỉnh mật độ.

Biến đổi dự báo liên tục qua hàm phân phối tích lũy

Gọi kết quả sau thời điểm gốc dự báo (t) là (Y_{t+1}), và hàm phân phối tích lũy (CDF) dự báo (F_{t+1}(y\mid\mathcal I_t)) dựa trên thông tin (\mathcal I_t) có sẵn tại thời điểm đó. Với phân phối liên tục, tính

Uₜ₊₁ = Fₜ₊₁(Yₜ₊₁ | 𝓘ₜ)

CDF là xác suất của giá trị không vượt quá (y). Nếu CDF dự báo là phân phối có điều kiện thực sự, định lý PIT cho biết

Pr(Uₜ₊₁ ≤ u | 𝓘ₜ) = u, for 0 ≤ u ≤ 1

Do đó, dự báo liên tục một bước lý tưởng tạo ra PIT đều có điều kiện theo thông tin dự báo. Trong chuỗi mà tập thông tin gồm quá khứ, PIT lý tưởng còn độc lập giữa các thời điểm gốc theo những giả định phù hợp. Rosenblatt nghiên cứu phép biến đổi này; Diebold, Gunther và Tay áp dụng chuỗi PIT để đánh giá dự báo mật độ (1952; 1998).

Ví dụ có thể tính tay: dự báo (N(0,1)), quan sát (y=1), PIT là (Phi(1)\approx0.8413). Dự báo gán khoảng 84,13% xác suất cho giá trị đến 1. Một quan sát không cho biết mô hình có hiệu chỉnh hay không; cần một chuỗi.

Ngẫu nhiên hóa phép biến đổi cho kết quả rời rạc

CDF rời rạc có bước nhảy tại các kết quả có thể xảy ra. Vì vậy, (F(Y)) thông thường chỉ nhận một số mức và thường không đều ngay cả khi dự báo đúng. PIT ngẫu nhiên lấp đầy từng khoảng nhảy:

Uₜ₊₁ = Fₜ₊₁(Yₜ₊₁⁻ | 𝓘ₜ) + Vₜ₊₁ [Fₜ₊₁(Yₜ₊₁ | 𝓘ₜ) − Fₜ₊₁(Yₜ₊₁⁻ | 𝓘ₜ)]

(F(y^-)) là giới hạn trái, tức xác suất của giá trị nhỏ hơn nghiêm ngặt (y); (V) là biến Uniform(0,1) độc lập chỉ dùng cho đánh giá. Với phân phối liên tục, bước nhảy bằng 0 nên công thức còn (F(Y)). Brockwell chứng minh phép biến đổi ngẫu nhiên cho phân phối tổng quát, bao gồm trường hợp rời rạc và hỗn hợp (2007). Với dữ liệu đếm có thứ tự, Czado, Gneiting và Held cũng bàn về PIT không ngẫu nhiên và biểu đồ hiệu chỉnh biên; không nên coi (F(Y)) rời rạc như PIT liên tục-uniform (2009).

Ví dụ Bernoulli giả định: (P(Y=1)=0.20), (P(Y=0)=0.80). PIT thông thường bằng 0,80 khi (Y=0) và 1,00 khi (Y=1), nên không đều. Khi ngẫu nhiên hóa, (Y=0) cho (0.80V) trong ([0,0.80]); (Y=1) cho (0.80+0.20V) trong ([0.80,1]). Có trọng số theo xác suất sự kiện, mật độ tổng thể đều trên ([0,1]). Phép rút thăm phục vụ đánh giá, không thuộc dự báo.

Phân biệt tính đều biên, tính độc lập và hiệu chỉnh có điều kiện

Phân phối PIT biên đều là điều kiện cần cho dự báo liên tục lý tưởng, nhưng chưa đủ. Sai số trái chiều giữa các chế độ có thể triệt tiêu khi gộp dữ liệu, khiến histogram trông phẳng. Gneiting, Balabdaoui và Raftery cho thấy PIT gần đều có thể cùng tồn tại với dự báo cá thể bị lệch (2007).

Thứ tự cũng quan trọng: chuỗi có thể có histogram đều nhưng vẫn phụ thuộc nối tiếp, chẳng hạn cụm hoặc chuỗi dài các giá trị giống nhau. Dự báo có điều kiện lý tưởng đòi hỏi nhiều hơn tính đều khi gộp. Với chân trời dự báo chồng lấn, phân phối tham chiếu phải xét phần chồng lấn; kiểm định iid không mặc nhiên phù hợp.

Hãy kiểm tra phân phối PIT và mối liên hệ với thời gian, độ trễ, biến tại thời điểm gốc và chế độ được xác định trước. Biểu đồ nhóm hoặc kiểm định có điều kiện có thể tìm ra mẫu ẩn, nhưng lựa chọn nhóm và giới hạn cỡ mẫu vẫn quan trọng. Không tập hợp hữu hạn nào chứng minh hiệu chỉnh cho mọi biến điều kiện có thể có.

Xem histogram PIT là gợi ý, không phải kết luận

Dạng chữ U thường phù hợp với dự báo quá tập trung hoặc thiếu phân tán; phần phình ở giữa thường phù hợp với dự báo quá rộng. Mất cân đối trái-phải có thể gợi ý sai lệch vị trí. Đây là quy tắc kinh nghiệm, không phải chẩn đoán duy nhất: phụ thuộc, hỗn hợp chế độ, tính rời rạc, cách chia bin và mẫu nhỏ có thể gây hiểu lầm.

Histogram bỏ mất thứ tự thời gian. Nó không cho biết lỗi bắt đầu lúc nào, giá trị lớn có tụ lại không, hay một nhóm con có bị hiệu chỉnh sai không. Bin rộng có thể làm dữ liệu ít trông phẳng; bin hẹp có thể lởm chởm vì nhiễu mẫu. Báo cáo số dự báo, biên bin và độ bất định khi có thể. Phương pháp Diebold–Gunther–Tay và kiểm định Berkowitz là ví dụ có giả định phải phù hợp thiết kế. Berkowitz đổi PIT bên trong thành (Z_t=\Phi^{-1}(U_t)) rồi kiểm định giả thuyết không chung về các giá trị chuẩn tắc độc lập so với một đối thuyết động xác định, chẳng hạn AR(1). Đây không phải chứng nhận toàn diện (2001).

<!-- learn:illustration -->

Đường cong mật độ không chữ nối các dấu giá trị quan sát với những điểm cách đều trên một dải phân phối đều
Hình khái niệm về phép biến đổi kết quả quan sát qua hàm phân phối tích lũy dự báo; không có dữ liệu thực nghiệm hay kết quả chẩn đoán.

Tính đến việc ước lượng và đánh giá ngoài mẫu

Kết quả về tính đều giả định CDF là quy luật có điều kiện thực sự. Trong thực tế, ta ước lượng tham số, chọn họ phân phối và điều chỉnh ngưỡng hoặc đặc trưng. Vì thế, dự báo (F_{t+1}(\cdot;\hat\theta_t)) là một phần của quy trình. Nếu dùng kết quả trong giai đoạn đánh giá để khớp mô hình rồi gọi PIT là bằng chứng ngoài mẫu chưa bị đụng đến, đó là rò rỉ thông tin.

Trong đánh giá cuốn chiếu, chỉ dùng thông tin có sẵn tại từng thời điểm gốc. Ghi lại cửa sổ ước lượng, tần suất ước lượng lại, phiên bản dữ liệu/mô hình và các bước chọn mô hình. Cửa sổ liền kề thường chia sẻ quan sát; kết quả chồng lấn tạo thêm phụ thuộc.

Kích thước và lực kiểm định phụ thuộc bộ ước lượng, mẫu và quy trình. Histogram PIT không tính đến bất định tham số; mốc iid trong sách giáo khoa không phù hợp với mọi thiết kế đã ước lượng hoặc chồng lấn. Nếu suy luận quan trọng, dùng kiểm định phù hợp hoặc mô phỏng/bootstrap giả thuyết không bằng cách lặp lại toàn bộ quy trình ước lượng và dự báo. Khi cần, giữ riêng mẫu đánh giá cuối cùng khỏi việc chọn mô hình.

Phân biệt hiệu chỉnh với độ sắc nét

Hiệu chỉnh nói về quan hệ giữa dự báo và kết quả: sự kiện được gán một xác suất có xảy ra đúng tần suất đó không? Độ sắc nét mô tả mức tập trung của phân phối dự báo mà không nhìn kết quả. Gneiting, Balabdaoui và Raftery coi độ sắc nét là điều đáng mong muốn khi có hiệu chỉnh, chứ không phải vật thay thế.

Dự báo rộng có thể được hiệu chỉnh nhưng ít thông tin. Dự báo hẹp có thể trông chính xác nhưng hiệu chỉnh kém nếu kết quả thường nằm ngoài khối xác suất. PIT xem xét tính nhất quán phân phối; tóm tắt độ sắc nét mô tả độ phân tán hoặc độ rộng. Chỉ báo cáo một bên sẽ bỏ sót một phần đánh giá.

PIT tổng hợp phẳng có thể che lỗi theo chế độ biến động hoặc chân trời. Hãy xác định điều kiện quan trọng từ trước. Chủ đề này liên quan nhưng khác hồi quy dự báo điểm và kiểm định năng lực dự báo có điều kiện Giacomini–White, vốn so sánh tổn thất có điều kiện theo thông tin đã chọn.

So sánh dự báo đầy đủ bằng proper score trên cùng kết quả

PIT chủ yếu là chẩn đoán, không tự xếp hạng dự báo mật độ. Log score và continuous ranked probability score (CRPS) gán tổn thất vô hướng cho mỗi cặp dự báo-kết quả; theo định nghĩa, tổn thất kỳ vọng nhỏ nhất khi báo đúng phân phối dự báo. Trung bình quan sát được trong một mẫu không chứng minh mô hình đúng. Hướng dẫn Model Confidence Set nói về so sánh theo tập hợp. Hãy dùng score được định nghĩa cho phân phối đầy đủ trên các kết quả giống nhau.

Nêu rõ mục tiêu, chân trời, ngày chung, quy ước tổn thất và benchmark. Log score đặc biệt nhạy với mật độ rất thấp tại điểm quan sát; CRPS so sánh CDF với mức nhạy khác. Độ bất định của chênh lệch score cần tính đến phụ thuộc nối tiếp, ước lượng và tìm kiếm mô hình. Biểu đồ PIT và score phục vụ các mục đích khác nhau.

Hiệu chỉnh hay score tốt hơn không chứng minh khả năng sinh lời. Tuyên bố về giao dịch cần quy tắc ra quyết định, thời điểm thông tin, quy mô vị thế, phí giao dịch/vốn và đánh giá lợi suất ngoài mẫu riêng. Thống kê đánh giá dự báo không phải lợi suất backtest.

Dùng quy trình PIT có thể tái lập

Chốt mục tiêu, chân trời, giờ gốc, phiên bản kết quả và loại phân phối liên tục, rời rạc hay hỗn hợp. Lưu mọi CDF dự báo hoặc dữ liệu đủ để tái tạo, cùng kết quả và tập thông tin. Tính (F_t(Y_t)) với phân phối liên tục; ở chỗ có bước nhảy, ghi rõ PIT ngẫu nhiên hoặc chẩn đoán rời rạc phù hợp.

Kiểm tra phân phối biên và thứ tự thời gian. Nêu bin, cỡ mẫu, xử lý giá trị bằng nhau và seed hoặc cách lặp randomization. Bổ sung kiểm tra độc lập/có điều kiện cho câu hỏi đã xác định trước và suy luận phù hợp với thiết kế cuốn chiếu, chồng lấn hoặc ước lượng. So sánh riêng các mô hình bằng proper score trên cùng kết quả giữ lại. Kết luận chỉ áp dụng cho dự báo và điều kiện đã nêu, không bảo đảm hiệu chỉnh tương lai hay lợi nhuận.

Câu hỏi thường gặp

Q1PIT đều có chứng minh dự báo mật độ đúng không?

Không. Đây là điều kiện chẩn đoán cần thiết dưới dự báo liên tục đúng, nhưng PIT tổng hợp đều không chứng minh độc lập hay hiệu chỉnh có điều kiện. Hãy kiểm tra phụ thuộc thời gian và biến điều kiện liên quan.

Q2Có nên dùng PIT ngẫu nhiên cho dự báo rời rạc không?

Có, nếu cần chuẩn tham chiếu liên tục-đều dưới phân phối rời rạc đúng. Lần rút thêm phân tán kết quả trong bước nhảy CDF. Ghi phương pháp và seed; cân nhắc chẩn đoán rời rạc nếu muốn tránh ngẫu nhiên hóa.

Q3Histogram PIT hình chữ U nghĩa là gì?

Thường phù hợp với dự báo quá tập trung; phần phình ở giữa thường phù hợp với dự báo quá phân tán. Hãy coi đó là gợi ý và kiểm tra phụ thuộc, chế độ, cỡ mẫu cùng bin.

Q4Histogram PIT tốt hơn có nghĩa score dự báo tốt hơn không?

Không. PIT chẩn đoán hành vi phân phối; proper score so sánh dự báo theo tổn thất và mục tiêu cụ thể. Báo cáo cả hai trên cùng kết quả ngoài mẫu, không diễn giải chúng thành lợi nhuận giao dịch. Nghiên cứu gốc - Rosenblatt, “Remarks on a Multivariate Transformation” (1952) - Diebold, Gunther, and Tay, “Evaluating Density Forecasts with Applications to Financial Risk Management” (1998) - Berkowitz, “Testing Density Forecasts, with Applications to Risk Management” (2001) - Gneiting, Balabdaoui, and Raftery, “Probabilistic Forecasts, Calibration and Sharpness” (2007) - Brockwell, “Universal Residuals: A Multivariate Transformation” (2007) - Czado, Gneiting, and Held, “Predictive Model Assessment for Count Data” (2009)

Nguồn và tài liệu đọc thêm

Báo lỗi

Chúng tôi sẽ soạn email kèm liên kết bài viết này. Mark chỉ nhận được báo cáo sau khi bạn gửi email

Kiểm tra nhanh

Đọc xong hướng dẫn? Hãy kiểm tra với 3 câu hỏi

Câu hỏi 1 / 3

Câu hỏi 01

Định lý PIT hàm ý gì với dự báo có điều kiện liên tục đúng cho một bước?

Chọn một đáp án để xem giải thích

Bảng thuật ngữ quyền chọn

Đánh giá dự báoHồi quy Mincer–Zarnowitz: Kiểm định độ chệch và hiệu chỉnh dự báoTìm hiểu hồi quy Mincer–Zarnowitz kiểm tra hệ số chặn và thang đo của dự báo ra sao, vì sao sai số trung bình bằng không không đồng nghĩa với hiệu chỉnh tốt, và phép kiểm định này không thể chứng minh điều gì.Đánh giá dự báoKiểm định Diebold–Mariano: Cách so sánh độ chính xác của dự báoTìm hiểu cách kiểm định Diebold–Mariano so sánh tổn thất dự báo theo cặp, xử lý các chân trời dự báo chồng lấn và vì sao p-value thấp không chứng minh được kỹ năng giao dịch.Kiểm định dự báoKiểm định Giacomini–White: Độ chính xác dự báo có điều kiệnTìm hiểu cách kiểm định Giacomini–White đánh giá liệu độ chính xác dự báo có thay đổi theo các điều kiện đã biết hay không, cách chọn biến công cụ và cách diễn giải kết quảSo sánh mô hình dự báoModel Confidence Set (MCS): so sánh mô hình dự báo mà không ép chọn một bên thắngTìm hiểu cách Model Confidence Set dùng các kiểm định tuần tự và bootstrap có xét phụ thuộc để giữ lại những mô hình dự báo mà bằng chứng chưa phân biệt được.Cơ chế quyền chọnGiao quyền chọn là gì?Hiểu cách việc giao quyền chọn biến một call hoặc put bán thành nghĩa vụ đối với cổ phiếu, khi nào điều đó có thể xảy ra và cách chuẩn bị tiền mặt và cổ phiếu