Kiểm định Diebold–Mariano: so sánh độ chính xác dự báo
Tìm hiểu kiểm định Diebold–Mariano so sánh điều gì, chênh lệch tổn thất và tương quan chuỗi ảnh hưởng thế nào, và vì sao dự báo chính xác không đồng nghĩa giao dịch có lãi.
Trong hướng dẫn nàyKiểm định so sánh tổn thất kỳ vọng của dự báo
Tóm tắt ngắn
Kiểm định Diebold–Mariano (DM) đánh giá liệu hai quy trình dự báo có cùng tổn thất kỳ vọng trên các kết quả được ghép cặp hay không. Kiểm định dùng chuỗi chênh lệch tổn thất, nên hàm tổn thất, chân trời và sự phụ thuộc giữa các ngày đều ảnh hưởng đến kết quả. Bác bỏ giả thuyết không chỉ hỗ trợ rằng có khác biệt trong thiết kế đánh giá đã nêu; điều đó không chứng minh một mô hình sẽ luôn vượt trội hoặc chiến lược giao dịch có lãi sau chi phí.
Kiểm định so sánh tổn thất kỳ vọng của dự báo
Kiểm định Diebold–Mariano so sánh hai dự báo cho cùng mục tiêu trong cùng các ngày đánh giá. Ở mỗi thời điểm lập dự báo, cả hai quy trình phải dùng cùng kết quả thực tế, chân trời dự báo và thời điểm chốt thông tin. Sau đó kiểm định xem tổn thất trung bình của quy trình này có khác một cách có hệ thống so với quy trình kia không, trong khi vẫn cho phép chênh lệch thay đổi theo thời gian.
Diebold và Mariano xây dựng kiểm định cho hàm tổn thất tổng quát, không chỉ cho sai số bình phương trung bình. Bài báo gốc kiểm định giả thuyết không rằng các dự báo cạnh tranh có độ chính xác dự báo ngang nhau (Diebold and Mariano, 1995). Ở đây, “độ chính xác” nghĩa là tổn thất kỳ vọng thấp hơn theo hàm đã chọn. Không có nghĩa dự báo là sự thật, giải thích quan hệ nhân quả, được hiệu chỉnh tốt ở mọi phần phân phối hoặc hữu ích cho mọi quyết định.
Giả sử A và B cùng dự báo một lợi suất tương lai tại cùng thời điểm. DM không kiểm tra hệ số mô hình có bằng không hay giá trị khớp trong mẫu ước lượng có giống nhau không. Kiểm định so sánh cách sai số dự báo chuyển thành tổn thất đã chọn trong mẫu đánh giá.
Hãy xác định thiết kế trước khi diễn giải thống kê: mục tiêu, thời điểm dự báo, chân trời, hàm tổn thất, xử lý kết quả thiếu, lịch ước lượng lại và giả thuyết một hay hai phía cùng định nghĩa câu hỏi. Nếu các lựa chọn khác nhau giữa mô hình, chênh lệch tổn thất không còn là so sánh đồng điều kiện.
Xác định dự báo ghép cặp và chênh lệch tổn thất
Gọi $y_t$ là giá trị mục tiêu thực tế tại thời điểm dự báo $t$; $\hat y_{A,t}$ và $\hat y_{B,t}$ là dự báo của A và B. Sai số là $e_{A,t}=y_t-\hat y_{A,t}$ và $e_{B,t}=y_t-\hat y_{B,t}$. Với hàm tổn thất $L$, chênh lệch tại ngày $t$ là:
$$ d_t=L(e_{A,t})-L(e_{B,t}) $$
Theo quy ước dấu này, trung bình $d_t$ âm nghĩa là A có tổn thất quan sát thấp hơn; trung bình dương nghĩa là B thấp hơn. Giả thuyết không tổng thể là $E[d_t]=0$. Kiểm định hai phía tìm khác biệt theo cả hai hướng; kiểm định một phía xét hướng đã chọn trước. Không chọn hướng sau khi thấy mô hình nào thắng.
Với tổn thất bình phương $L(e)=e^2$, sai số lớn có ảnh hưởng vượt trội. Tổn thất tuyệt đối $L(e)=|e|$ ít bị một sai số lớn chi phối hơn. Tổn thất phân vị có thể phù hợp với mục tiêu bất đối xứng. Thay hàm có thể đảo thứ hạng, nên “dự báo tốt nhất” chưa có nghĩa rõ ràng nếu chưa nêu hàm tổn thất. Tổng quan của Tashman về kiểm định ngoài mẫu cũng nhấn mạnh phương pháp đánh giá phải hợp với bài toán (Tashman, 200000065-0)).
Dùng cùng thời điểm dự báo và kết quả cho cả hai mô hình. Nếu một mô hình thiếu dự báo ở ngày khó, bỏ ngày đó chỉ ở mô hình ấy sẽ đổi mẫu so sánh. Nếu khi triển khai mô hình được ước lượng lại mỗi tháng bằng dữ liệu mới, hãy dùng cùng quy tắc khi tạo dự báo đánh giá; tham số cố định trả lời câu hỏi khác. Xác thực walk-forward giải thích cách dự báo tuần tự mà không dùng dữ liệu tương lai.
Ví dụ bốn thời điểm dự báo cho thấy ý nghĩa của chênh lệch trung bình
Xét bốn thời điểm dự báo giả định; mục tiêu và sai số tính theo điểm phần trăm. A có sai số $[1,2,0,1]$, B có $[2,1,1,1]$. Mỗi cặp cùng ứng với một lợi suất thực tế và khoảng dự báo. Các số chỉ nhằm minh họa phép tính.
Với tổn thất bình phương, tổn thất của A là $[1,4,0,1]$ và MSE bằng $(1+4+0+1)/4=1.50$ điểm phần trăm bình phương. B có tổn thất $[4,1,1,1]$, MSE $(4+1+1+1)/4=1.75$. Trong bốn kết quả này, MSE của A thấp hơn 0.25 điểm phần trăm bình phương.
Chênh lệch tổn thất theo ngày $d_t=L(e_{A,t})-L(e_{B,t})$ là $[-3,3,-1,0]$. Trung bình $(-3+3-1+0)/4=-0.25$, bằng MSE trung bình của A trừ MSE của B. Dấu âm nghiêng về A, nhưng chưa cho biết chênh lệch có lớn hơn nhiễu lấy mẫu hay không. Bốn cặp dự báo chưa đủ làm bằng chứng thống kê thuyết phục.
Hàm tổn thất cũng đổi nghĩa của “tốt hơn”. Trong ví dụ khác, sai số tuyệt đối của C là $[0,0,0,3]$, của D là $[1,1,1,1]$. Với tổn thất tuyệt đối, trung bình lần lượt là 0.75 và 1 nên C tốt hơn. Với tổn thất bình phương, trung bình là 2.25 và 1 nên D tốt hơn. Kiểm định không giải quyết được điều này nếu chưa quyết định sai số nào đáng quan tâm hơn.
<!-- Illustration placement: after this section; text-free conceptual scene showing two forecast paths against one realized path, with visibly different miss distances and no labels or numerical claims. -->
Thống kê DM chuẩn hóa chênh lệch trung bình theo độ bất định
Chênh lệch trung bình mẫu là $\bar d=T^{-1}\sum_{t=1}^{T}d_t$, với $T$ là số kết quả ghép cặp. Sai số chuẩn phụ thuộc vào phương sai dài hạn của $d_t$, không chỉ phương sai tại một ngày. Dạng tổng quát:
$$ DM=\frac{\bar d}{\sqrt{\widehat{\Omega}/T}} $$
$\widehat{\Omega}$ ước lượng phương sai dài hạn của chuỗi chênh lệch tổn thất. Nếu các ngày độc lập, nó gần với phương sai của $d_t$. Nhưng tổn thất dự báo thường tụ thành cụm: lúc biến động cao, sai số hai mô hình có thể cùng tăng; mục tiêu trước $h$ kỳ khiến cửa sổ liền nhau chia sẻ lợi suất thực tế. Bỏ qua phụ thuộc dương có thể làm sai số chuẩn nhỏ đi và bằng chứng trông mạnh hơn.
Một cách HAC phổ biến ước lượng tự hiệp phương sai $\hat\gamma_k$ của chênh lệch đã trừ trung bình, rồi tính $\widehat{\Omega}=\hat\gamma_0+2\sum_{k=1}^{q}w_k\hat\gamma_k$. Với trọng số Bartlett đến băng thông $q$, $w_k=1-k/(q+1)$. Newey và West phát triển ước lượng hiệp phương sai nửa xác định dương, nhất quán khi có phương sai thay đổi và tự tương quan (Newey and West). Kernel và băng thông là lựa chọn triển khai: công bố chúng và chọn theo thiết kế dự báo, không nhằm đạt p-value mong muốn. Hướng dẫn sai số chuẩn HAC trình bày bài toán hiệp phương sai rộng hơn.
Trong điều kiện chính quy, thống kê DM tiêu chuẩn được so với phân phối chuẩn tắc tiệm cận. Giá trị tuyệt đối lớn nghĩa là chênh lệch trung bình quan sát lớn so với độ bất định ước lượng. Dấu cho biết mô hình nào có tổn thất thấp hơn theo quy ước; p-value không đo độ lớn hay ý nghĩa kinh tế, cũng không phải xác suất giả thuyết không đúng hoặc dự báo thành công trong tương lai.
Dự báo nhiều bước bị chồng lấp nên xử lý mẫu hữu hạn cũng quan trọng
Khi mỗi kỳ dự báo một mục tiêu ở vài kỳ sau, cửa sổ đánh giá chồng lấp. Dự báo hàng tháng về lợi suất tích lũy ba tháng tới chia sẻ hai trong ba lợi suất tháng với dự báo được lập một tháng sau. Vì vậy, ngay cả lợi suất tháng độc lập cũng có thể tạo tương quan chuỗi trong sai số và chênh lệch tổn thất.
Trong thiết kế cơ bản dự báo trước $h$ bước, phương sai thường cần tính đến phụ thuộc ít nhất đến độ trễ $h-1$. Đây không phải quy tắc băng thông chung: ước lượng cuốn chiếu, mục tiêu dai dẳng, cụm biến động và hàm tổn thất có thể tạo phụ thuộc dài hơn. Ghi lại chân trời, khoảng cách giữa các thời điểm dự báo và lý do chọn độ trễ cắt HAC hay phương pháp khác. Số dòng dự báo không tự động là số bằng chứng độc lập.
Kiểm định tiệm cận ban đầu có thể sai mức ý nghĩa thực tế trong mẫu vừa phải. Harvey, Leybourne và Newbold đề xuất hiệu chỉnh mẫu hữu hạn khi so sánh MSE dự báo (HLN, 199700719-4)). Dạng thường dùng cho chân trời $h$ và $T$ dự báo nhân DM với:
$$ DM_{HLN}=DM\sqrt{\frac{T+1-2h+h(h-1)/T}{T}} $$
Thống kê đã hiệu chỉnh thường so với phân phối $t$ có $T-1$ bậc tự do. Với $T=60$, $h=5$, hệ số xấp xỉ $0.925$. Ví dụ chỉ minh họa phép tính; không hàm ý 60 quan sát là đủ cho mô hình cụ thể hoặc giả định được đáp ứng. Hiệu chỉnh xử lý một vấn đề mẫu hữu hạn cụ thể, không sửa rò rỉ dữ liệu, mục tiêu sai, phụ thuộc chưa mô hình hóa, chọn mô hình lặp lại hay hàm tổn thất sai đặc tả.
Mô hình lồng nhau cần lập luận so sánh dự báo khác
Mô hình A có thể là phiên bản ràng buộc của B, chẳng hạn B bổ sung biến dự báo. Ngay cả khi biến thêm không có giá trị dự báo trong tổng thể theo giả thuyết không, hệ số ước lượng vẫn có thể thêm nhiễu vào dự báo B. Vì vậy, MSE quan sát của mô hình lớn có thể cao hơn dù biến bổ sung không cải thiện quá trình dự báo nền tảng. Không thể áp dụng nguyên trạng lập luận về độ chính xác bằng nhau dành cho mô hình không lồng nhau.
Clark và West đề xuất kiểm định xấp xỉ chuẩn về độ chính xác dự báo bằng nhau trong mô hình lồng nhau, điều chỉnh so sánh sai số bình phương để tính đến nhiễu ước lượng từ mô hình lớn hơn (Clark and West, 2007). Đây không phải phương pháp thay thế mọi kiểm định DM: nó nhắm đến một câu hỏi lồng nhau, hàm tổn thất và thiết lập tiệm cận cụ thể. Hãy xác định quan hệ lồng nhau rồi chọn kiểm định có phân phối không phù hợp thiết kế. Đừng cho rằng p-value DM tiêu chuẩn trong phần mềm xử lý được mọi quan hệ mô hình.
MSE thấp hơn cũng chưa chắc cải thiện độ bao phủ khoảng, hiệu chỉnh xác suất, độ chính xác chiều hướng hay quyết định tiếp theo. So sánh ngoài mẫu có thể vẫn không đáng tin nếu tập kiểm tra đã được xem nhiều lần khi phát triển mô hình. Hãy nêu quan hệ mô hình, cách ước lượng, chân trời và dữ liệu dùng cho mỗi dự báo.
Độ chính xác dự báo không đồng nghĩa lợi thế giao dịch
DM đánh giá tổn thất dự báo; quyết định giao dịch đánh giá lợi nhuận và rủi ro. MSE thấp hơn cho lợi suất kỳ tới không đảm bảo tín hiệu thường xuyên chọn đúng hướng, đặt quy mô vị thế phù hợp hoặc chịu được vòng quay, chênh lệch mua bán, tác động thị trường, phí, chi phí vay, funding và trễ khớp lệnh. Dự báo hơi kém hơn theo MSE vẫn có thể cải thiện quyết định nếu chính xác hơn lúc chiến lược có phơi nhiễm cao. Khi đó, hàm tổn thất có thể cần phản ánh quyết định thực tế thay vì một thước đo chung tiện dụng.
Khác biệt có ý nghĩa thống kê vẫn có thể nhỏ về kinh tế. Báo cáo độ lớn chênh lệch tổn thất trung bình theo đơn vị dễ hiểu cùng độ bất định, không chỉ p-value hay nhãn thắng cuộc. Nếu tuyên bố về danh mục, hãy chạy lại toàn bộ quy tắc quyết định cố định trên dữ liệu tương lai phù hợp với giả định giao dịch thực tế, rồi báo cáo riêng kết quả ròng. DM không tính lợi nhuận hay chi phí trừ khi hàm tổn thất được thiết kế rõ ràng cho việc đó.
Kiểm định cũng không xử lý việc tìm nhiều mô hình, mục tiêu, chân trời, hàm tổn thất, khoảng ngày hay quy tắc giao dịch rồi chỉ công bố kết quả thuận lợi nhất. Kiểm định từng cặp lặp lại tạo vấn đề chọn mẫu. Hãy lưu lịch sử tìm kiếm và dùng phương pháp kiểm định nhiều giả thuyết phù hợp. Hướng dẫn kiểm định nhiều lần và tỷ lệ phát hiện sai giải thích vì sao ngưỡng thông thường có thể gây hiểu nhầm sau tìm kiếm rộng. DM là công cụ đánh giá, không phải hiệu chỉnh dò tìm dữ liệu.
Báo cáo đủ chi tiết để tái lập phép so sánh
Báo cáo nêu mục tiêu và đơn vị, thời điểm chốt thông tin, thời điểm dự báo, chân trời, lịch ước lượng lại và mẫu đánh giá chung. Báo cáo hàm tổn thất, dấu $d_t$, tổn thất trung bình của mỗi mô hình và chênh lệch, giả thuyết một hay hai phía đã chọn trước, ước lượng phương sai, kernel, băng thông, thống kê, phân phối tham chiếu, p-value và khoảng tin cậy hoặc độ bất định phù hợp.
Đồng thời công bố quan hệ lồng nhau, cách xử lý kết quả thiếu và giá trị cực đoan, số đặc tả thay thế đã xem xét, và việc giai đoạn đánh giá có ảnh hưởng đến lựa chọn mô hình không. Trình bày độ lớn khác biệt thay vì chỉ cho biết đã vượt ngưỡng chưa. Chuỗi $d_t$ hoặc đồ thị chênh lệch tích lũy có thể cho thấy thay đổi chế độ bị trung bình che khuất, nhưng không thay thế suy luận tính đến phụ thuộc.
Trong giao dịch định lượng, mô tả cả cách chuyển dự báo thành hành động: ngưỡng tín hiệu, quy mô vị thế, thời điểm tái cân bằng, kiểm soát rủi ro, giá khớp và giả định chi phí. DM chỉ so sánh chuỗi tổn thất dự báo được đưa vào; không xác nhận quy trình dữ liệu, làm cho mẫu đánh giá khác nhau trở nên tương đương, chứng minh nhân quả hay hứa hẹn thứ hạng lịch sử sẽ duy trì. Hãy dùng như một phần minh bạch trong đánh giá mô hình, cùng thiết kế dự báo tôn trọng thứ tự thời gian và đánh giá rõ ở cấp quyết định.
Câu hỏi thường gặp
Q1Kiểm định Diebold–Mariano có so sánh hệ số mô hình không?
Không. Kiểm định so sánh tổn thất kỳ vọng của lỗi do hai quy trình dự báo tạo ra trên các kết quả ghép cặp. Kiểm định hệ số trả lời câu hỏi khác về tham số mô hình.
Q2Có thể dùng kiểm định cho dự báo trước nhiều kỳ không?
Có, nhưng cửa sổ mục tiêu chồng lấp có thể khiến các chênh lệch tổn thất liên tiếp phụ thuộc theo chuỗi. Dùng ước lượng phương sai và khi thích hợp là hiệu chỉnh mẫu hữu hạn phù hợp với chân trời và thiết kế; ghi lại lựa chọn.
Q3Kết quả có ý nghĩa thống kê có nghĩa dự báo tốt hơn sẽ kiếm được tiền không?
Không. Nó hỗ trợ có khác biệt về tổn thất dự báo đã chọn trong thiết kế đánh giá. Khả năng sinh lời còn tùy cách chuyển dự báo thành vị thế, rủi ro nhận vào, khớp lệnh và chi phí thực tế.
Nguồn và tài liệu đọc thêm
Báo lỗi
Chúng tôi sẽ soạn email kèm liên kết bài viết này. Mark chỉ nhận được báo cáo sau khi bạn gửi email
Kiểm tra nhanh
Đọc xong hướng dẫn? Hãy kiểm tra với 3 câu hỏi
Câu hỏi 01
Giả thuyết không của phép so sánh Diebold–Mariano cơ bản là gì?
Chọn một đáp án để xem giải thích
Bảng thuật ngữ quyền chọn
Variation in the conditional error variance across regressor values or states, invalidating an equal-variance covariance formula.
Đọc hướng dẫn chuyên sâuFamily-wise error rateThe probability of falsely rejecting at least one true null hypothesis within a predefined family of tests.
Đọc hướng dẫn chuyên sâu