Kiểm định Diebold–Mariano: Cách so sánh độ chính xác của dự báo
Tìm hiểu cách kiểm định Diebold–Mariano so sánh tổn thất dự báo theo cặp, xử lý các chân trời dự báo chồng lấn và vì sao p-value thấp không chứng minh được kỹ năng giao dịch.
Trong hướng dẫn nàySai số kiểm định quá khứ thấp hơn chưa chứng minh dự báo tốt hơn
Tóm tắt ngắn
Kiểm định Diebold–Mariano so sánh hai dự báo bằng cách xét chênh lệch tổn thất của chúng trên cùng các kết quả thực tế. Kết quả phụ thuộc vào hàm tổn thất, mẫu đánh giá, chân trời dự báo và cách ước lượng độ bất định. Sai số mẫu thấp hơn tự nó chưa phải bằng chứng rằng độ chính xác kỳ vọng cao hơn; dự báo chính xác hơn cũng không đồng nghĩa với chiến lược giao dịch có lãi.
Sai số kiểm định quá khứ thấp hơn chưa chứng minh dự báo tốt hơn
Giả sử hai mô hình dự báo cùng một mức lợi suất, độ biến động hoặc đại lượng kinh tế trong cùng các ngày. Trong mẫu đánh giá, sai số trung bình của mô hình A thấp hơn mô hình B. Điều đó mô tả những gì đã thấy trong mẫu, nhưng không cho biết A có đáng tin cậy và chính xác hơn hay không, hoặc khoảng cách quan sát được có thể chỉ phản ánh biến động thông thường do những ngày được chọn để kiểm định.
Kiểm định Diebold–Mariano (DM) chuyển phép so sánh thành một chuỗi thời gian theo cặp. Tại mỗi thời điểm phát hành dự báo, hai dự báo được đối chiếu với cùng một giá trị thực hiện, chấm bằng hàm tổn thất đã chọn trước, rồi xem xét chuỗi chênh lệch tổn thất. Việc ghép cặp rất quan trọng: vào một ngày thị trường biến động, tổn thất của cả hai mô hình có thể cùng tăng; phép so sánh hỏi liệu một mô hình có thường tổn thất ít hơn đúng trong những ngày đó hay không.
Khuôn khổ ban đầu không chỉ giới hạn ở sai số bình phương hoặc sai số dự báo phân phối chuẩn. Có thể so sánh nhiều hàm tổn thất, kể cả hàm bất đối xứng, nếu điểm số phù hợp với câu hỏi dự báo. Tuy vậy, cần có thiết kế đánh giá hợp lý và ước lượng độ bất định của chênh lệch tổn thất trung bình. Diebold và Mariano (1995) trình bày kiểm định độ chính xác dự báo bằng nhau; Harvey, Leybourne và Newbold (1997)00719-4) nghiên cứu một hiệu chỉnh cho mẫu nhỏ.
Ghép các dự báo cùng điều kiện trước khi tính thống kê
Mỗi hàng nên đại diện cho một thời điểm phát hành dự báo có thể so sánh được. Cả hai mô hình phải dự báo cùng mục tiêu, cùng chân trời và chỉ dùng thông tin có sẵn tại thời điểm đó. Trước khi so sánh tổn thất, hãy căn chỉnh kết quả thực tế, dấu thời gian, tiền tệ hoặc đơn vị đo, phiên bản dữ liệu và quy tắc xử lý quan sát thiếu. Nếu một mô hình dự báo giá đóng cửa ngày mai còn mô hình kia dự báo mức trung bình năm ngày, sai số của chúng trả lời hai câu hỏi khác nhau.
Hãy dùng các dự báo được tạo ra mà không nhìn trước tương lai. Tập giữ lại theo trình tự thời gian hoặc thiết kế giả ngoài mẫu cuốn chiếu có thể giúp làm điều này, nhưng chỉ chia mẫu là chưa đủ nếu cùng tập giữ lại đó liên tục được dùng để điều chỉnh đặc trưng, ngưỡng hoặc biến thể mô hình. Lưu lại dự báo được tạo tại mỗi thời điểm lịch sử, gồm cả dữ liệu và phiên bản mô hình đã tạo ra nó. Nếu không, dữ liệu kinh tế vĩ mô được sửa đổi, bộ lọc tránh sai lệch sống sót hoặc điều chỉnh doanh nghiệp dựa trên thông tin tương lai có thể làm thay đổi đánh giá sau khi sự việc đã xảy ra.
Đánh giá hai mô hình trên cùng tập thời điểm phát hành dự báo. Loại bỏ ngày khó chỉ cho một mô hình sẽ phá vỡ phép so sánh theo cặp. Nếu thiếu dự báo, hãy dùng mẫu chung hoặc nêu cơ sở cho cách xử lý dự báo thiếu; đừng âm thầm để hai mô hình đối mặt với các chế độ thị trường khác nhau. Chọn ngày bắt đầu và kết thúc trước khi xem mẫu nào cho kết quả thuận lợi.
Hàm tổn thất xác định “chính xác hơn” có nghĩa là gì
Gọi giá trị thực hiện tại thời điểm t là yₜ và các dự báo của mô hình A, B lần lượt là ŷA,ₜ và ŷB,ₜ. Sai số là eA,ₜ = yₜ − ŷA,ₜ và eB,ₜ = yₜ − ŷB,ₜ. Hàm tổn thất L biến mỗi sai số thành một điểm số, trong đó thấp hơn là tốt hơn. Tổn thất bình phương L(e) = e² phạt sai số lớn nặng hơn. Tổn thất tuyệt đối L(e) = |e| tăng tuyến tính theo độ lớn sai số. Dự báo phân vị có thể dùng tổn thất pinball bất đối xứng vì chi phí dự báo thấp hơn và cao hơn thực tế khác nhau.
Điểm số được chọn có thể làm thay đổi mô hình nào trông tốt hơn. Xét hai cặp sai số giả định, cùng đơn vị: A có sai số 0 và 2; B có sai số 1 và 1. Với tổn thất bình phương, tổn thất trung bình lần lượt là 2 và 1 nên B có điểm tốt hơn. Với tổn thất tuyệt đối, cả hai đều có trung bình bằng 1. Không phép tính nào luôn đúng cho mọi mục đích; mỗi phép trả lời một câu hỏi khác nhau về loại sai số cần quan tâm.
Với dự báo lợi suất, sai số bình phương có thể hữu ích cho dự báo trung bình có điều kiện; dự báo độ biến động cần điểm số phù hợp với mục tiêu đó, còn dự báo Value-at-Risk cần điểm số phân vị hoặc phép kiểm định rủi ro chuyên biệt. Chọn hàm tổn thất sau khi biết mô hình nào thắng sẽ biến kiểm định thành một bước tìm kiếm khác. Hãy xác định tổn thất và chiều nào được xem là “tốt hơn” trước khi xem phép so sánh.
Dự báo VaR nhắm đến phân vị ở đuôi phân phối thay vì một dự báo điểm thông thường. Hướng dẫn kiểm định VaR giải thích cách dùng tần suất và trình tự các lần vượt ngưỡng để đánh giá loại dự báo rủi ro riêng biệt đó.
Tạo chênh lệch tổn thất theo cặp và nêu giả thuyết không
Với hàm tổn thất trong đó thấp hơn là tốt hơn, định nghĩa chênh lệch tại kỳ t như sau:
dₜ = L(eA,ₜ) − L(eB,ₜ)
Theo quy ước dấu này, dₜ dương nghĩa là tổn thất của A cao hơn và B có lợi thế tại thời điểm đó; giá trị âm nghiêng về A. Trung bình mẫu là d̄ = (1/n) Σ dₜ. Giả thuyết không về độ chính xác vô điều kiện bằng nhau là E[dₜ] = 0. Giả thuyết đối hai phía hỏi tổn thất kỳ vọng có khác nhau theo hướng nào hay không. Giả thuyết đối một phía được xác định trước có thể hỏi một mô hình cụ thể có tổn thất kỳ vọng thấp hơn hay không.
Thống kê cơ bản là
DM = d̄ / √(Ŝd / n)
Ở đây, Ŝd ước lượng phương sai dài hạn của chuỗi chênh lệch tổn thất, chứ không chỉ phương sai sai số dự báo riêng của từng mô hình. Dưới giả thuyết không và các điều kiện chính quy thích hợp, thống kê này tiệm cận phân phối chuẩn tắc. Giá trị dương lớn nghiêng về B theo quy ước dấu trên; giá trị âm lớn nghiêng về A. p-value đo mức độ dữ liệu tương thích với giả thuyết không và các giả định lấy mẫu đã nêu, chứ không phải xác suất một trong hai mô hình là đúng.
Việc ghép cặp loại bỏ một phần khác biệt không liên quan về thang đo sai số tổng thể của hai mô hình, trong phạm vi chênh lệch theo từng thời điểm phản ánh được điều đó. Nó không làm chuỗi tổn thất độc lập, không tự động loại bỏ bất định do ước lượng tham số, cũng không hiệu chỉnh việc tìm kiếm qua nhiều mục tiêu và đặc tả. Những lựa chọn ấy cần được xử lý trong thiết kế và phép tính độ bất định.
Ví dụ dự báo một bước tách khoảng cách mẫu khỏi bằng chứng
Giả sử có 100 cặp dự báo một bước giả định đã được ghép. Tổn thất bình phương trung bình của A là 0.26, của B là 0.23, tính bằng bình phương điểm phần trăm. Chênh lệch trung bình là d̄ = 0.26 − 0.23 = 0.03, nghiêng về B trong mẫu. RMSE tương ứng xấp xỉ 0.510 và 0.480 điểm phần trăm, tạo ra khoảng cách mô tả khoảng 0.030. Tuy nhiên, thống kê DM kiểm định chênh lệch tổn thất bình phương theo cặp, chứ không kiểm định trực tiếp chênh lệch giữa hai căn bậc hai. Để ví dụ minh họa đơn giản, giả sử phương sai dài hạn ước lượng của dₜ là 0.04 và không có hiệp phương sai chuỗi giữa các thời điểm.
Sai số chuẩn ước lượng của chênh lệch trung bình là √(0.04 / 100) = 0.02. Thống kê chưa hiệu chỉnh là 0.03 / 0.02 = 1.50. Với chân trời h = 1 và T = 100, hệ số hiệu chỉnh mẫu nhỏ Harvey–Leybourne–Newbold là √[(T + 1 − 2h + h(h − 1)/T) / T] = √0.99 ≈ 0.995. Nhân hệ số này cho kết quả thống kê đã hiệu chỉnh xấp xỉ 1.49; p-value hai phía xấp xỉ theo phân phối t₉₉ vào khoảng 0.14.
B có sai số bình phương trung bình quan sát thấp hơn, nhưng ví dụ này không cung cấp bằng chứng mạnh để bác bỏ giả thuyết độ chính xác kỳ vọng bằng nhau ở các ngưỡng ý nghĩa thông thường. Không bác bỏ không chứng minh hai mô hình chính xác như nhau; ngay cả khi bác bỏ, kết luận vẫn phụ thuộc vào điểm số, các thời điểm và giả định đã chọn. Giá trị phương sai và mọi tổn thất ở đây là đầu vào giả định để minh họa, không phải kết quả thực nghiệm.

Chân trời chồng lấn khiến chênh lệch tổn thất phụ thuộc lẫn nhau
Nếu phát hành dự báo trước năm ngày mỗi ngày, các dự báo liền kề sẽ dùng chung bốn trong năm ngày mục tiêu. Vì vậy sai số, tổn thất và chênh lệch tổn thất có thể cùng biến động. Coi 100 thời điểm phát hành dự báo hằng ngày là 100 phép so sánh độc lập có thể đánh giá thấp độ bất định và khiến thống kê trông lớn hơn thực tế.
Phương sai dài hạn tính đến hiệp phương sai chuỗi của dₜ. Một ước lượng nhất quán khi có phương sai thay đổi và tự tương quan (HAC) thường dùng có dạng
Ŝd = γ̂₀ + 2 Σₖ₌₁ᵐ wₖ γ̂ₖ
trong đó γ̂ₖ là tự hiệp phương sai mẫu của d tại độ trễ k, wₖ là trọng số hạt nhân và m là băng thông được chọn. Newey và West (1987) đưa ra ước lượng hiệp phương sai HAC nửa xác định dương. Với sai số dự báo h bước lý tưởng dưới các giả định phù hợp, chồng lấn thường tạo ra sự phụ thuộc ít nhất đến độ trễ h − 1; khuôn khổ DM ban đầu thảo luận một ước lượng cắt cụt cho trường hợp này. Dữ liệu thực có thể phụ thuộc lâu hơn do mục tiêu dai dẳng, ước lượng cuốn chiếu hoặc cách xây dựng chiến lược, vì vậy h − 1 không phải quy tắc băng thông dùng được cho mọi trường hợp.
Hãy nêu chân trời, hạt nhân, băng thông và mọi hiệu chỉnh mẫu nhỏ. Cho biết kết luận có thay đổi dưới các thiết lập phụ thuộc hợp lý hay không thay vì chọn băng thông chỉ để có p-value mong muốn. Nếu giãn cách thời điểm phát hành dự báo để tránh chồng lấn, hãy nói rõ và giải thích phải đánh đổi thông tin hoặc cỡ mẫu nào. Ước lượng độ bất định có tính đến phụ thuộc là một phần của kiểm định, không phải tùy chọn hiển thị.
Mô hình lồng nhau và kỹ năng dự báo thay đổi cần câu hỏi khác
Phép so sánh DM thông thường dễ diễn giải nhất với các dự báo không lồng nhau dưới giả thuyết không độ chính xác bằng nhau. Nếu mô hình lớn chứa mô hình chuẩn nhỏ hơn, các hệ số ước lượng bổ sung có thể làm tăng nhiễu dự báo ngay cả khi giá trị thật của chúng bằng không. Dưới giả thuyết không đó, chênh lệch sai số bình phương trung bình thông thường có thể tuân theo phân phối không chuẩn. Với phép so sánh MSPE ngoài mẫu của mô hình lồng nhau, phương pháp như hiệu chỉnh Clark–West tính đến ảnh hưởng nhiễu do ước lượng; đây không phải cách thay DM tổng quát cho mọi thiết kế mô hình. Xem Clark và West (2007).
Giả thuyết không DM thông thường xét tổn thất vô điều kiện trung bình trên toàn mẫu đánh giá. Nó có thể che khuất thay đổi theo thời gian: A có thể tốt hơn trong giai đoạn yên ắng và B trong giai đoạn biến động, trong khi trung bình tổng thể tương tự nhau. Nếu câu hỏi là độ chính xác tương đối có phụ thuộc vào thông tin biết được tại ngày dự báo hay không, kiểm định khả năng dự báo có điều kiện dùng chênh lệch tổn thất cùng với các biến công cụ xác định trước. Giacomini và White (2006) phát triển khuôn khổ đó. Giả định và thiết kế cửa sổ đánh giá vẫn quan trọng; thêm các chỉ báo tùy ý sau khi xem kết quả không phải lối tắt hợp lệ.
Việc chọn kiểm định nên theo cấu trúc so sánh: dự báo độc lập, mô hình lồng nhau, kỹ năng có điều kiện thay đổi hoặc một họ mô hình được chọn từ nhiều ứng viên là những trường hợp không thể hoán đổi. Với trường hợp cuối, hướng dẫn White’s Reality Check và Hansen’s SPA giải thích hiệu chỉnh ở cấp toàn bộ họ sau khi tìm kiếm nhiều quy tắc giao dịch.
Tổn thất dự báo thấp hơn không chứng minh chiến lược có lãi
Dự báo chính xác hơn về mặt thống kê vẫn có thể không cải thiện kết quả giao dịch ròng. Chiến lược phải chuyển dự báo thành vị thế, chọn thời điểm giao dịch và chịu chênh lệch giá mua bán, hoa hồng, trượt giá, tác động thị trường, phí vốn, chi phí vay và giới hạn rủi ro. Cải thiện nhỏ về sai số bình phương trung bình của lợi suất có thể không hữu ích cho quyết định; ngược lại, mô hình có sai số trung bình cao hơn một chút có thể nhận diện tốt hơn một biến cố đuôi quan trọng đối với quy tắc cụ thể.
Hãy tách đánh giá dự báo khỏi đánh giá danh mục thành các bước riêng. Trước tiên kiểm định dự báo với mục tiêu và tổn thất phù hợp nhiệm vụ đã nêu. Sau đó đánh giá một quy tắc giao dịch được mô tả đầy đủ trên dữ liệu chưa dùng để chọn dự báo, với giả định thực hiện lệnh và tài trợ thực tế. p-value của kiểm định dự báo không phải lợi nhuận kiểm định quá khứ, tỷ lệ Sharpe hay xác suất có lãi trong tương lai.
Thử đi thử lại mô hình, mục tiêu, chân trời, hàm tổn thất và cửa sổ mẫu tạo ra thiên lệch lựa chọn ngay cả khi từng phép tính DM riêng lẻ đúng. Ghi lại toàn bộ quá trình tìm kiếm và dùng phương pháp hiệu chỉnh theo họ nếu câu hỏi nghiên cứu là có ứng viên nào vượt qua quá trình đó hay không. Hướng dẫn block bootstrap trình bày cách ước lượng độ bất định cho thống kê đã chọn trước mà vẫn giữ phụ thuộc theo thời gian; bản thân nó không hiệu chỉnh một quá trình tìm kiếm mô hình không được ghi lại.
Báo cáo đủ chi tiết để nhà nghiên cứu khác tái lập
Nêu tên hai mô hình dự báo, quan hệ của chúng với mô hình chuẩn, mục tiêu, chân trời, lịch các thời điểm phát hành dự báo, ngày đánh giá, tập thông tin, phiên bản dữ liệu và quy tắc dùng mẫu chung. Định nghĩa hàm tổn thất bằng công thức và nêu dₜ dương có lợi cho A hay B. Báo cáo n, tổn thất trung bình của từng mô hình, d̄, ước lượng phương sai dài hạn, hạt nhân và băng thông HAC, hiệu chỉnh mẫu nhỏ, phân phối tham chiếu, hướng kiểm định và p-value.
Cũng cần nêu các mô hình có lồng nhau hay không, tham số được ước lượng thế nào, phép so sánh được chọn trước hay sau khi xem kết quả và đã thử những biến thể nào khác. Nếu mẫu được dùng để chọn mô hình, hãy ghi rõ kiểm định là một phần của quá trình tìm kiếm thay vì gọi đó là bằng chứng ngoài mẫu chưa từng được đụng đến. Báo cáo rõ ràng giúp người đọc thấy chính xác kiểm định so sánh điều gì và những vấn đề về độ bất định hay lựa chọn nào còn nằm ngoài phạm vi.
Câu hỏi thường gặp
Q1Kiểm định Diebold–Mariano có yêu cầu sai số dự báo phân phối chuẩn không?
Không. Khuôn khổ này có thể xử lý sai số dự báo không phân phối chuẩn. Tuy vậy, vẫn cần ước lượng phương sai chênh lệch tổn thất phù hợp và các điều kiện chính quy cho phân phối tham chiếu.
Q2Tôi có thể so sánh hai mô hình dự báo các chân trời khác nhau không?
Không nên diễn giải đó là phép so sánh độ chính xác trên cùng cơ sở. Hãy căn chỉnh mục tiêu và chân trời trước; nếu không, mỗi mô hình trả lời một câu hỏi dự báo khác nhau.
Q3Kết quả DM có ý nghĩa thống kê có đủ để chọn mô hình giao dịch không?
Không. Đó là bằng chứng về tổn thất dự báo kỳ vọng trong phép so sánh cụ thể. Bạn vẫn cần tính đến quá trình tìm kiếm mô hình, quy tắc ra quyết định, chi phí thực hiện và tài trợ, cùng hiệu suất chiến lược ngoài mẫu. Nghiên cứu nền tảng - Diebold và Mariano, “Comparing Predictive Accuracy” (1995) - Harvey, Leybourne và Newbold, “Testing the Equality of Prediction Mean Squared Errors” (1997)00719-4) - Giacomini và White, “Tests of Conditional Predictive Ability” (2006) - Clark và West, “Approximately Normal Tests for Equal Predictive Accuracy in Nested Models” (2007) - Newey và West, “A Simple, Positive Semi-Definite, Heteroskedasticity and Autocorrelation Consistent Covariance Matrix” (1987)
Nguồn và tài liệu đọc thêm
Báo lỗi
Chúng tôi sẽ soạn email kèm liên kết bài viết này. Mark chỉ nhận được báo cáo sau khi bạn gửi email
Kiểm tra nhanh
Đọc xong hướng dẫn? Hãy kiểm tra với 3 câu hỏi
Câu hỏi 01
Với dₜ = L(eA,ₜ) − L(eB,ₜ), trung bình mẫu dương nghiêng về mô hình nào?
Chọn một đáp án để xem giải thích
Bảng thuật ngữ quyền chọn
Định nghĩa rõ ràng về các thuật ngữ cốt lõi, từ call, put và chuỗi quyền chọn đến IV, Greeks, lãi suất mở và max pain
Xem bảng thuật ngữ quyền chọn