Skip to content
Tất cả hướng dẫn quyền chọn
So sánh mô hình dự báo14 phút đọc

Model Confidence Set (MCS): so sánh mô hình dự báo mà không ép chọn một bên thắng

Tìm hiểu cách Model Confidence Set dùng các kiểm định tuần tự và bootstrap có xét phụ thuộc để giữ lại những mô hình dự báo mà bằng chứng chưa phân biệt được.

Trong hướng dẫn nàyModel Confidence Set trả lời câu hỏi nào?

Tóm tắt ngắn

Model Confidence Set (MCS) so sánh một nhóm quy trình dự báo đã xác định và trả về các ứng viên chưa bị chứng minh là kém hơn theo hàm tổn thất đã chọn. Nếu mẫu dữ liệu không phân biệt được các ứng viên, nhiều mô hình có thể cùng được giữ lại; kết quả phụ thuộc vào nhóm ứng viên, thiết kế dự báo, tổn thất và thủ tục suy luận.

Model Confidence Set trả lời câu hỏi nào?

Giả sử có nhiều quy trình dự báo biến động ngày kế tiếp. Sai số của chúng khác nhau, nhưng mẫu có thể quá ngắn hoặc nhiễu để xác định quy trình nào có tổn thất kỳ vọng thấp nhất. Chọn quy trình có tổn thất trung bình nhỏ nhất sẽ buộc phải có một bên thắng, ngay cả khi chênh lệch chỉ do biến động lấy mẫu. MCS đưa ra câu trả lời dạng tập hợp: ứng viên nào còn tương thích về mặt thống kê với việc tốt nhất theo tiêu chí hiệu suất đã định?

MCS bắt đầu từ tập ứng viên \(\mathcal M_0\), một hàm tổn thất hoặc tiêu chí khác và mức tin cậy. Phương pháp lần lượt kiểm định xem các ứng viên còn được xét có năng lực dự báo ngang nhau hay không. Nếu bác bỏ giả thuyết, quy tắc loại bỏ sẽ gỡ một ứng viên bị đánh giá tương đối yếu, rồi kiểm định tiếp trên tập nhỏ hơn. Các ứng viên còn lại tạo thành MCS. Hansen, Lunde và Nason giới thiệu thủ tục này như một tập tin cậy cho mô hình tốt nhất trong nhóm được nêu, tương tự khoảng tin cậy tham số có thể giữ nhiều giá trị khi dữ liệu chưa chính xác (bài báo năm 2011).

“Tốt nhất” chỉ có ý nghĩa trong phạm vi so sánh: so với các ứng viên được đưa vào, mục tiêu, chân trời dự báo, thông tin có tại từng thời điểm dự báo và tiêu chí chấm điểm. MCS không đòi hỏi một ứng viên phải là quá trình sinh dữ liệu thực sự, và có thể giữ lại nhiều ứng viên cùng có hiệu suất kỳ vọng tốt nhất. Đây không phải xác suất hậu nghiệm cho biết mô hình còn lại là đúng.

Cố định nhóm ứng viên và câu hỏi dự báo

Trước khi tính tổn thất, hãy xác định \(\mathcal M_0\). Một ứng viên có thể là mô hình đã ước lượng cùng quy tắc ước lượng và cập nhật dự báo, hoặc một quy trình dự báo không được mô tả bằng mô hình thống kê. Chỉ nói “GARCH” là chưa đủ nếu phân phối biến động, cửa sổ rolling, cách cập nhật tham số và chân trời dự báo có thể thay đổi; mỗi lựa chọn có thể tạo thành ứng viên riêng.

Mỗi ứng viên phải dự báo cùng mục tiêu, tại cùng thời điểm bắt đầu và cùng chân trời, chỉ dùng thông tin thực sự có sẵn lúc đó. Không thể so sánh tổn thất thô một cách công bằng nếu một mô hình dự báo phương sai một ngày còn mô hình kia dự báo biến động năm ngày. Dùng chung mẫu đánh giá, căn chỉnh rõ các quan sát bị thiếu, đồng thời ghi lại phiên bản dữ liệu, cửa sổ ước lượng ban đầu, lịch recursive hay rolling và cách xử lý đầu vào được sửa đổi. Các dự báo chồng lấn theo thời gian có thể khiến tổn thất ở những thời điểm gần nhau dùng chung quan sát.

Chọn tiêu chí trước khi xem kết quả. Sai số bình phương, sai số tuyệt đối hoặc tổn thất theo quyết định có thể xếp hạng dự báo điểm khác nhau. Dự báo phương sai có thể cần hàm tổn thất biến động phù hợp với proxy nhiễu; dự báo phân vị cần quantile score thay vì mean squared error. MCS tốt theo hàm tổn thất này không nhất thiết tốt theo hàm khác. Nếu danh sách ứng viên được thu hẹp sau khi xem chính kết quả đánh giá đó, tập chính thức sẽ có điều kiện theo bước sàng lọc không được báo cáo và không phản ánh toàn bộ quá trình tìm kiếm.

Chuyển dự báo chung thành chênh lệch tổn thất theo cặp

Gọi \(y_{t+h}\) là mục tiêu thực tế ứng với dự báo tại thời điểm \(t\), và \(\hat y_{i,t+h|t}\) là dự báo của ứng viên \(i\). Với hàm tổn thất \(L\) đã chọn trước, tính một mức tổn thất cho mỗi ứng viên tại mỗi thời điểm chung:

\[ L_{i,t}=L(y_{t+h},\hat y_{i,t+h|t}) \]

Giả sử tổn thất thấp hơn là tốt hơn. Với hai ứng viên \(i\) và \(j\), định nghĩa chênh lệch theo cặp:

\[ d_{ij,t}=L_{i,t}-L_{j,t}, \qquad \bar d_{ij}=\frac{1}{P}\sum_{t=1}^{P}d_{ij,t} \]

Ở đây, \(P\) là số thời điểm dự báo chung. Theo quy ước dấu này, \(\bar d_{ij}\) dương nghĩa là ứng viên \(i\) có tổn thất trung bình mẫu cao hơn \(j\); giá trị âm có lợi cho \(i\). Ghép cặp quan trọng vì hai ứng viên cùng dự báo các kết quả thực tế. Cú sốc thị trường chung có thể làm tăng cả hai mức tổn thất, trong khi chênh lệch giúp tách hiệu suất tương đối.

Giả thuyết không về năng lực dự báo ngang nhau cho tập hiện tại \(\mathcal M\) có thể viết:

\[ H_{0,\mathcal M}:\quad \mu_{ij}=E[d_{ij,t}]=0 \quad \text{với mọi } i,j\in\mathcal M \]

Đây là phát biểu chung về tập hiện tại, không phải một loạt kiểm định cặp không liên quan được xem xét từng cái một. Khuôn khổ MCS ban đầu dùng kiểm định tương đương chung và quy tắc loại bỏ để xử lý việc tìm kiếm giữa nhiều mô hình. Nó không hỏi liệu các dự báo có giống hệt nhau vào từng ngày hay không.

Kiểm định tập hiện tại và xác định quy tắc loại bỏ

Quy trình MCS luân phiên giữa kiểm định cấp tập hợp và bước loại bỏ. Bắt đầu với \(\mathcal M=\mathcal M_0\), rồi kiểm định năng lực dự báo ngang nhau ở mức \(\alpha\) đã chọn. Nếu không bác bỏ, dừng và báo cáo tập hiện tại. Nếu bác bỏ, dùng quy tắc loại bỏ đã định trước để bỏ một ứng viên rồi kiểm định lại tập nhỏ hơn. Theo các giả định của quy trình, tập còn lại là MCS \((1-\alpha)\).

Bài báo phát triển hai thống kê phổ biến. Thống kê range tìm chênh lệch tổn thất theo cặp đã chuẩn hóa lớn nhất:

\[ T_{R,\mathcal M}=\max_{i,j\in\mathcal M}|t_{ij}|, \qquad t_{ij}=\frac{\bar d_{ij}}{\widehat{\mathrm{se}}(\bar d_{ij})} \]

Quy tắc loại bỏ đi kèm bỏ ứng viên có bất lợi chuẩn hóa lớn nhất so với ứng viên khác. Thống kê thứ hai so sánh mỗi ứng viên với hiệu suất trung bình của tập hiện tại:

\[ T_{\max,\mathcal M}=\max_{i\in\mathcal M}t_{i\cdot}, \qquad d_{i\cdot,t}=\frac{1}{|\mathcal M|}\sum_{j\in\mathcal M}d_{ij,t} \]

Ở đây, \(t_{i\cdot}\) chuẩn hóa trung bình của \(d_{i\cdot,t}\); quy tắc tương ứng bỏ ứng viên có phần tổn thất vượt trung bình chuẩn hóa lớn nhất. Thống kê và quy tắc loại bỏ là một cặp. Hãy chọn và báo cáo chúng như một quy trình, không trộn lẫn sau khi thấy lựa chọn nào tạo tập nhỏ hơn. Bài báo MCS giải thích vì sao kiểm định bác bỏ phải nhất quán với quy tắc xác định ứng viên bị loại (Hansen, Lunde và Nason).

Bảo toàn sự phụ thuộc theo thời gian trong bootstrap

Phân phối của thống kê cực đại phụ thuộc vào biến động chung của các chênh lệch tổn thất giữa ứng viên. Xem từng mô hình hoặc ngày là quan sát độc lập có thể phá vỡ cả hai loại phụ thuộc: tổn thất liên tiếp có thể tương quan chuỗi và tổn thất của hai ứng viên trong cùng ngày có tính ghép cặp. Vì vậy bootstrap MCS cần giữ cấu trúc chuỗi thời gian chung liên quan khi xấp xỉ phân phối không của thống kê cấp tập hợp.

Một cách là lấy mẫu lại các khối thời gian đã căn chỉnh của vector tổn thất hoặc chênh lệch giữa các ứng viên. Trong stationary bootstrap, độ dài khối là ngẫu nhiên và chuỗi lấy mẫu lại có thể bắt đầu từ một ngày được chọn ngẫu nhiên. Politis và Romano giới thiệu phương pháp này cho các quan sát dừng phụ thuộc yếu (bài báo năm 1994). Các tác giả MCS mô tả triển khai block bootstrap và nêu stationary bootstrap như một lựa chọn. Lấy mẫu riêng chuỗi tổn thất của từng mô hình sẽ phá ghép cặp cùng ngày và có thể làm thay đổi phép so sánh.

Độ dài khối trung bình, biến thể bootstrap, cách căn giữa dưới giả thuyết năng lực ngang nhau, số lần lặp và chân trời dự báo đều ảnh hưởng đến ước lượng bất định. Chân trời dài có cửa sổ chồng lấn thường làm kéo dài phụ thuộc trong chênh lệch tổn thất, nhưng không có một độ dài khối phù hợp cho mọi mục tiêu và mẫu. Hãy mô tả thiết kế và kiểm tra xem kết luận có đổi với các thiết lập phụ thuộc hợp lý hay không. Bootstrap là phép xấp xỉ theo các giả định của nó; nó không sửa được look-ahead, holdout bị dùng lại, điểm số phi dừng hay nhóm ứng viên thiếu.

Tính ví dụ giả định với bốn mô hình

Giả sử bốn quy trình A, B, C và D dự báo cùng mục tiêu biến động tại 120 thời điểm bắt đầu hằng ngày chung. Tổn thất bình phương trung bình lần lượt là 1.20, 1.23, 1.45 và 1.90, theo đơn vị minh họa là bình phương điểm phần trăm. Các giá trị trung bình xếp A đầu tiên và D cuối cùng, nhưng thứ hạng không cho biết bất định lấy mẫu.

Chênh lệch tổn thất ghép cặp trung bình giữa A và B là \(1.20-1.23=-0.03\). Nếu sai số chuẩn có xét phụ thuộc là \(0.04\), thống kê theo cặp là \(-0.03/0.04=-0.75\). Chỉ riêng chênh lệch này không thể hiện khác biệt thống kê rõ ràng giữa A và B. MCS không dừng ở đó: thống kê cấp tập hợp xét các chênh lệch chung giữa cả bốn ứng viên.

Để minh họa, giả sử một lần chạy MCS với block bootstrap trên toàn bộ chuỗi tổn thất tại 120 thời điểm dùng \(T_R\), \(\alpha=0.05\), và quy tắc nhất quán loại ứng viên tệ nhất. Giả sử p-value của tập đầy đủ là 0.018, D bị loại, rồi p-value của \(\{A,B,C\}\) là 0.11. Vì 0.11 lớn hơn 0.05, quy trình dừng với \(\{A,B,C\}\) là MCS 95% giả định. C vẫn còn dù tổn thất trung bình cao hơn A: kiểm định chung giả định này chưa xác lập rằng C kém hơn.

Các p-value ở đây được đặt ra để minh họa các bước; không thể suy ra chúng từ bốn mức tổn thất trung bình hay chênh lệch A–B. Kết quả thực cần toàn bộ chuỗi tổn thất theo từng thời điểm, dự báo ứng viên, thiết kế bootstrap và thứ tự loại bỏ. Hãy lưu các đầu vào và báo cáo cả trình tự để người đọc biết ứng viên nào bị loại ở từng lần bác bỏ. <!-- learn:illustration -->

Một số đường dự báo nằm gần nhau trong dải mờ, còn các đường xa hơn nhạt dần, để lại một tập hợp thay vì một phương án thắng duy nhất
Minh họa khái niệm về phép so sánh dự báo giữ lại nhiều ứng viên không thể phân biệt về mặt thống kê; không phải dự báo quan sát được, kết quả thực nghiệm hay tín hiệu giao dịch.

Diễn giải tập còn lại mà không phóng đại

Ở mức tin cậy 95%, theo các điều kiện chính quy và giả định kiểm định, MCS được thiết kế để chứa ứng viên tốt nhất trong tập đã xác định với mức bao phủ tiệm cận ít nhất như công bố. Điều đó không có nghĩa mỗi mô hình được giữ lại có 95% xác suất là tốt nhất. Phát biểu về độ tin cậy nói về độ bao phủ của quy trình qua các mẫu lặp lại, không phải phân phối hậu nghiệm trên nhãn mô hình.

Không bác bỏ giả thuyết năng lực dự báo ngang nhau không chứng minh tổn thất kỳ vọng của các ứng viên bằng hệt nhau. Kiểm định có thể ít lực, nhất là khi giai đoạn đánh giá ngắn, chênh lệch tổn thất biến động mạnh hoặc có nhiều ứng viên gần bằng nhau. Một tập còn lại lớn có thể phản ánh trung thực rằng dữ liệu không phân biệt được các phương án. Tập đó cũng có thể chứa toàn mô hình kém xét tuyệt đối, vì MCS so sánh các ứng viên với nhau chứ không với một chuẩn bên ngoài bắt buộc.

Phạm vi của tập cũng bị giới hạn bởi những gì có trong \(\mathcal M_0\). Nếu bỏ sót một quy trình dự báo thực sự tốt hơn, MCS không thể tìm ra nó. Nếu loại một mô hình trước phân tích sau khi đã xem cùng giai đoạn đánh giá, độ bao phủ danh nghĩa không tính đến cuộc tìm kiếm không được ghi nhận đó. Hãy nêu lịch sử tạo và sàng lọc ứng viên. Nếu nhiều ứng viên có cùng tổn thất kỳ vọng tốt nhất, giữ lại hơn một ứng viên phù hợp với phương pháp, không phải thất bại trong việc chọn.

Phân biệt MCS với kiểm định theo cặp và kiểm định benchmark

Kiểm định Diebold–Mariano tập trung vào chênh lệch tổn thất ghép cặp giữa hai quy trình dự báo. MCS liên tục kiểm định cả tập và báo cáo ứng viên còn lại sau quy trình loại bỏ chung. Chạy nhiều kiểm định DM rồi giữ các cặp không có ý nghĩa thống kê không tự động tương đương MCS; bootstrap chung và quy tắc loại bỏ nhất quán mới quan trọng.

Kiểm định Clark–West xử lý phép so sánh sai số bình phương hẹp hơn khi một mô hình bao hàm benchmark bị ràng buộc và nhiễu ước lượng ảnh hưởng đến chênh lệch thô. MCS không yêu cầu ứng viên lồng nhau và có thể dùng hàm tổn thất do người dùng chọn, nhưng vẫn cần thiết kế dự báo chung.

Reality Check của White và kiểm định Superior Predictive Ability của Hansen hỏi liệu ít nhất một thành viên trong nhóm đã tìm kiếm có vượt benchmark được chỉ định hay không. MCS không phụ thuộc benchmark và mô tả một tập ứng viên tương đối tốt hơn. Các phương pháp đều cần ghi nhận đúng quá trình tìm kiếm và phụ thuộc, nhưng kiểm định những giả thuyết khác nhau. Xem hướng dẫn Reality Check và SPA và các bài gốc của White (2000), Hansen (2005).

Báo cáo thiết kế và tách thứ hạng dự báo khỏi giá trị giao dịch

Báo cáo MCS có thể tái lập nêu từng quy trình ứng viên, mục tiêu và chân trời chung, quy tắc về thời điểm dự báo và thông tin, lịch ước lượng, ngày đánh giá, cách xử lý dữ liệu thiếu, công thức tổn thất và chiều được xem là tốt hơn. Báo cáo mức ý nghĩa, thống kê và quy tắc loại bỏ, loại bootstrap, độ dài khối, cách căn giữa, số lần lặp, p-value từng bước và thành viên cuối cùng. Tổn thất trung bình chỉ bổ sung bối cảnh; không thay suy luận chung bằng bảng xếp hạng.

Trong đánh giá biến động, nêu cách tạo proxy quan sát và proxy có nhiễu hoặc được sửa đổi hay không. Với dự báo nhiều bước, công khai các cửa sổ mục tiêu chồng lấn và phương pháp xử lý phụ thuộc. Cho thấy độ nhạy với những thay đổi hợp lý của tổn thất, giai đoạn mẫu và thiết lập bootstrap khi chúng ảnh hưởng đến thành viên tập hợp. Một p-value nhỏ duy nhất không đủ tái lập nếu thiếu ứng viên bị loại và chi tiết thủ tục.

MCS xếp hạng các quy trình dự báo theo một tiêu chí. Nó không xác lập cấu trúc nhân quả, nhận diện mô hình sinh dữ liệu hay chứng minh dự báo còn lại tạo ra giao dịch có lãi. Chuyển dự báo thành vị thế cần ngưỡng, quy mô vị thế, vòng quay, thời điểm thực hiện, spread, phí, trượt giá, tài trợ, vay mượn và giới hạn rủi ro. Hãy đánh giá riêng quy tắc quyết định đã cố định trên dữ liệu về sau phù hợp và báo cáo riêng kết quả giao dịch ròng. Với điểm số biến động dùng proxy không hoàn hảo, xem hướng dẫn QLIKE và sai số bình phương.

Câu hỏi thường gặp

Q1MCS có chọn ra đúng một mô hình tốt nhất không?

Không nhất thiết. Một ứng viên có thể còn lại nếu bằng chứng phân biệt được nó, hoặc nhiều ứng viên cùng ở lại nếu mẫu chưa cho thấy ứng viên nào kém hơn. Chọn một mô hình để triển khai cần một quy tắc quyết định riêng.

Q2Một mô hình trong MCS có 95% xác suất là đúng không?

Không. Mức tin cậy mô tả độ bao phủ qua các mẫu lặp lại của ứng viên tốt nhất trong nhóm đã nêu, theo các giả định của phương pháp. Đây không phải xác suất hậu nghiệm rằng mô hình là đúng.

Q3Có thể dùng MCS cho mục tiêu ngoài dự báo biến động không?

Có. MCS có thể so sánh dự báo, mô hình kinh tế lượng hoặc ứng viên khác nếu xác định một tiêu chí chung có ý nghĩa và thiết kế lấy mẫu phù hợp. Kết quả vẫn phụ thuộc vào tập ứng viên và tổn thất đã chọn.

Q4MCS có tự động tính đến mọi mô hình tôi từng thử không?

Chỉ khi quá trình tìm kiếm thực tế được thể hiện trong nhóm ứng viên và quy trình đánh giá. Lọc ứng viên không được ghi lại hoặc dùng lặp lại dữ liệu đánh giá không được sửa chỉ bằng cách chạy MCS sau đó.

Nguồn và tài liệu đọc thêm

Báo lỗi

Chúng tôi sẽ soạn email kèm liên kết bài viết này. Mark chỉ nhận được báo cáo sau khi bạn gửi email

Kiểm tra nhanh

Đọc xong hướng dẫn? Hãy kiểm tra với 3 câu hỏi

Câu hỏi 1 / 3

Câu hỏi 01

Model Confidence Set báo cáo điều gì?

Chọn một đáp án để xem giải thích

Bảng thuật ngữ quyền chọn

Định nghĩa rõ ràng về các thuật ngữ cốt lõi, từ call, put và chuỗi quyền chọn đến IV, Greeks, lãi suất mở và max pain

Xem bảng thuật ngữ quyền chọn
So sánh hai dự báo qua tổn thất trên cùng kết quả thực tếKiểm định Diebold–Mariano: so sánh độ chính xác dự báoTìm hiểu kiểm định Diebold–Mariano so sánh điều gì, chênh lệch tổn thất và tương quan chuỗi ảnh hưởng thế nào, và vì sao dự báo chính xác không đồng nghĩa giao dịch có lãi.So sánh dự báo lồng nhauKiểm định Clark–West cho dự báo lồng nhau: Công thức, ví dụ và giới hạnTìm hiểu vì sao cần điều chỉnh MSPE khi so sánh các mô hình dự báo lồng nhau, cách tính kiểm định Clark–West và kết quả một phía không thể chứng minh điều gì.Điều chỉnh data snooping trong backtestReality Check của White và kiểm định SPA của Hansen cho quy tắc giao dịchSo sánh Reality Check và SPA cho một tập hợp quy tắc đã được tìm kiếm, từ giả thuyết toàn cục, bootstrap đến giới hạn khi diễn giải kết quả.Đánh giá dự báo biến độngQLIKE và sai số bình phương trong dự báo biến động: biến đại diện nhiễuSo sánh QLIKE với sai số bình phương cho dự báo biến động, xem ví dụ đảo thứ hạng và tìm hiểu khi nào biến đại diện phương sai thực hiện có nhiễu vẫn giữ nguyên thứ hạng dự báo kỳ vọngĐánh giá dự báo hướngKiểm định Pesaran–Timmermann: Dự báo hướng có thêm thông tin không?Tìm hiểu cách kiểm định Pesaran–Timmermann so sánh tỷ lệ dự báo đúng hướng với mức nền dựa trên tỷ lệ tăng thực tế và tỷ lệ dự báo tăng, cũng như cách phụ thuộc chuỗi làm thay đổi suy luận thống kê.