Skip to content
Tất cả hướng dẫn quyền chọn
Đánh giá dự báoĐọc trong 13 phút

Kết hợp dự báo: Trọng số bằng nhau và trọng số ước lượng

Tìm hiểu cách kết hợp dự báo của nhiều mô hình, vì sao trọng số bằng nhau có thể tốt hơn trọng số được khớp từ dữ liệu và cách kiểm tra mà không nhìn trước dữ liệu tương lai

Trong hướng dẫn nàyKết hợp dự báo là gì?

Tóm tắt ngắn

Kết hợp dự báo trộn các dự đoán cho cùng một mục tiêu và chân trời dự báo. Trọng số bằng nhau là mốc so sánh minh bạch; trọng số ước lượng từ sai số trong quá khứ có thể phản ánh khác biệt giữa các mô hình, nhưng nhiễu ước lượng có thể khiến chúng thiếu ổn định ngoài mẫu.

Kết hợp dự báo là gì?

Kết hợp dự báo lấy hai dự đoán trở lên về cùng một đại lượng để tạo thành một dự báo duy nhất. Nếu các mô hình A, B và C cùng dự báo phương sai thực tế ngày mai, ta có thể lấy trung bình các giá trị hoặc gán trọng số khác nhau. Con số kết hợp là một dự báo mới, không phải cuộc bỏ phiếu xem mô hình nào đúng.

Các đầu vào phải thống nhất về mục tiêu, thời điểm phát hành dự báo, chân trời, đơn vị và mốc thông tin. Không thể trực tiếp lấy trung bình một dự báo phương sai một ngày với dự báo biến động một tháng chỉ vì cả hai đều được gọi là biến động. Trước tiên hãy xác định đại lượng và khoảng thời gian chung, rồi căn chỉnh dự báo.

Kết hợp hữu ích khi nhiều mô hình hợp lý phản ánh những đặc điểm khác nhau của chuỗi dữ liệu, hoặc chưa rõ mô hình nào sẽ tiếp tục tốt nhất. Các mô hình không nhất thiết phải dùng thuật toán hoàn toàn khác nhau. Điều quan trọng là sai số của chúng cùng biến động ra sao, chứ không phải tên gọi khác nhau đến mức nào.

Ứng dụng ban đầu của Bates và Granger cho thấy dự báo tổng hợp có thể có sai số bình phương trung bình thấp hơn từng dự báo thành phần trong ví dụ về hành khách hàng không. Kết quả đó là lý do để kiểm tra phương pháp kết hợp, không phải bảo đảm cải thiện trên thị trường, mục tiêu, giai đoạn hay hàm mất mát khác (Bates và Granger, 1969).

Bắt đầu với mốc trọng số bằng nhau

Với (K) dự báo, tổ hợp trọng số bằng nhau là

\[ \widehat{y}_{t+h\mid t}^{\,EW} = \frac{1}{K}\sum_{k=1}^{K}\widehat{y}_{k,t+h\mid t} \]

Mỗi thành phần đóng góp như nhau. Quy tắc này không cần mẫu huấn luyện để ước lượng trọng số và dễ tái lập. Đây là mốc hữu ích ngay cả khi phương pháp cuối cùng sẽ ước lượng hoặc ràng buộc trọng số.

Trọng số bằng nhau không có nghĩa mọi dự báo chính xác như nhau, độc lập hay có tầm quan trọng kinh tế ngang nhau. Điều đó chỉ có nghĩa quy trình kết hợp không ước lượng trọng số riêng từ hiệu quả trong quá khứ. Nếu mọi đầu vào cùng bỏ sót một đặc điểm, dự báo trung bình vẫn có thể giữ thiên lệch chung đó.

Số lượng tên mô hình không đo được mức đa dạng thông tin. Ba mô hình biến động có thể dùng cùng chuỗi lợi suất, ranh giới phiên và khoảng lấy mẫu, rồi cùng bỏ sót biến động qua đêm. Lấy trung bình chúng không tự sửa được thiếu sót đó. Hãy kiểm tra xem sai số ngoài mẫu được lưu trữ có khác nhau theo cách hữu ích hay không; đừng cho rằng nhãn khác nhau tạo ra bằng chứng độc lập.

Giả sử ba mô hình dự báo biến động của phiên kế tiếp lần lượt là 12, 15 và 20 điểm cơ bản. Dự báo trọng số bằng nhau là \((12+15+20)/3=15.67\) điểm cơ bản. Phép tính này chỉ cho thấy cách tạo tổ hợp; một thời điểm dự báo không cho biết quy tắc có chính xác hay sinh lời hay không.

Với biến động, hãy kiểm tra đầu vào là phương sai hay độ lệch chuẩn. Lấy trung bình ba dự báo phương sai rồi căn bậc hai thường không giống với lấy trung bình các dự báo độ lệch chuẩn. Hãy dùng đúng định nghĩa mục tiêu và đơn vị sẽ được chấm điểm sau này.

Ước lượng trọng số từ sai số dự báo trong quá khứ

Một tổ hợp tuyến tính có trọng số ước lượng có thể viết là

\[ \widehat{y}_{t+h\mid t}^{\,C} = \sum_{k=1}^{K} w_k \widehat{y}_{k,t+h\mid t} \]

Một kết quả lý thuyết phổ biến giả định sai số của mỗi dự báo có trung bình bằng không, các dự báo cùng mục tiêu và tổng trọng số bằng một. Gọi \(\Sigma_e\) là ma trận hiệp phương sai của sai số dự báo thành phần. Nếu biết và khả nghịch, trọng số phương sai tối thiểu dưới các ràng buộc đó là

\[ w^{*} = \frac{\Sigma_e^{-1}\mathbf{1}}{\mathbf{1}'\Sigma_e^{-1}\mathbf{1}} \]

Công thức này là điểm tham chiếu, không phải chỉ dẫn đảo ngược một ma trận hiệp phương sai mẫu nhiễu. Trong thực tế, \(\Sigma_e\) được ước lượng từ kho lưu trữ hữu hạn các sai số dự báo. Các đầu vào tương quan cao có thể làm ma trận gần suy biến, khiến thay đổi nhỏ của dữ liệu tạo ra thay đổi lớn về trọng số.

Với hai dự báo có phương sai sai số bằng nhau \(\sigma^2\), phương sai của trung bình trọng số bằng nhau là \(\sigma^2(1+\rho)/2\), trong đó \(\rho\) là tương quan giữa các sai số. Nếu phương sai mỗi sai số là 4 và tương quan bằng 0, phương sai trung bình là 2. Nếu tương quan là 0.90, phương sai là 3.8. Khả năng giảm phương sai phụ thuộc vào cách sai số cùng biến động, không phải tên mô hình. Phép tính này nói về phương sai sai số; nếu dự báo thành phần bị chệch, sai số bình phương trung bình còn bao gồm bình phương độ chệch.

Một cách khác là hồi quy mục tiêu quan sát được lên các dự báo thành phần đã lưu, thường có hệ số chặn. Granger và Ramanathan trình bày các phương pháp hồi quy tuyến tính không yêu cầu tổng trọng số bằng một. Hệ số chặn và trọng số tự do có thể điều chỉnh độ chệch trung bình trong mẫu huấn luyện, nhưng cách diễn giải thay đổi: hệ số là điều chỉnh dự báo được khớp từ dữ liệu, không nhất thiết là tỷ trọng kiểu danh mục đầu tư (Granger và Ramanathan, 1984).

Hãy đặt ràng buộc trước khi đánh giá. Trọng số không âm có tổng bằng một tạo ra trung bình lồi nằm giữa dự báo thành phần nhỏ nhất và lớn nhất. Cho phép trọng số âm hoặc hệ số chặn có thể đưa kết quả ra ngoài khoảng đó. Cách này đôi khi phù hợp với dự báo đã hiệu chỉnh, nhưng có thể không phù hợp với mục tiêu không âm như phương sai.

Tính thử một tổ hợp

Giả sử ba mô hình đưa ra dự báo 12, 15 và 20 điểm cơ bản cho cùng mục tiêu ở phiên kế tiếp. Một quy tắc trọng số chỉ ước lượng từ các thời điểm dự báo trước đó gán lần lượt 0.50, 0.30 và 0.20. Khi đó

\[ 0.50(12) + 0.30(15) + 0.20(20) = 14.5\ \text{điểm cơ bản} \]

Các trọng số không âm và có tổng bằng một nên đây là tổ hợp lồi, nằm giữa các dự báo thành phần. Chênh lệch so với kết quả trọng số bằng nhau 15.67 điểm cơ bản phản ánh trọng số được chọn; không chứng minh dự báo có trọng số tốt hơn.

Tại thời điểm \(t\), chỉ được ước lượng trọng số từ sai số dự báo đã biết kết quả. Trong kiểm định lịch sử, dự báo 14.5 điểm cơ bản tại thời điểm gốc \(t\) có thể dùng thông tin sẵn có đến \(t\), chứ không được dùng mục tiêu thực tế tại \(t+1\) hoặc dữ liệu về sau.

Sau khi quan sát được mục tiêu, hãy ghi lại dự báo thành phần, dự báo kết hợp, giá trị thực tế hoặc biến đại diện và hàm mất mát. Lặp lại quy trình ở các thời điểm sau giúp so sánh quy tắc trên cùng ngày. Dù vậy, một phép tính minh họa không phải bằng chứng về lợi thế bền vững.

Vì sao trọng số được khớp có thể gây thất vọng

Trọng số tốt nhất khi biết hiệp phương sai sai số của tổng thể không giống với trọng số ước lượng từ mẫu ngắn. Ước lượng tạo thêm bất định. Khi các dự báo thành phần gần nhau, sai số có thể tương quan mạnh và tối ưu hóa có thể khai thác những khác biệt nhỏ trong lịch sử nhưng không duy trì về sau.

Các mô phỏng và ứng dụng dự báo kinh tế vĩ mô của Kang cho thấy trọng số kết hợp có thể thiếu ổn định và trung bình đơn giản có thể hoạt động tốt hơn trong thực tế dưới các điều kiện được xét (Kang, 1986). Bài tổng quan của Timmermann mô tả tác động của sai số ước lượng, sự bất ổn định của mô hình và phụ thuộc giữa các sai số (Timmermann, 200601004-9)).

Phân tích sau này về nghịch lý kết hợp dự báo nêu cùng vấn đề mẫu hữu hạn: kết quả suy ra cho trọng số “tối ưu” cố định có thể không còn nguyên vẹn khi chính trọng số được ước lượng (Claeskens và cộng sự, 2016). Những kết quả này không chứng minh trọng số bằng nhau luôn thắng. Chúng giải thích vì sao quy tắc phức tạp hơn phải chứng minh được lợi ích trong so sánh ngoài mẫu.

<!-- learn:illustration -->

Một số cách ứng phó là bắt đầu với trọng số bằng nhau, giới hạn số đầu vào, kéo trọng số ước lượng về tỷ trọng bằng nhau hoặc áp đặt ràng buộc đơn giản. Mỗi lựa chọn đánh đổi giữa tính linh hoạt và nhiễu ước lượng. Hãy chọn bằng dữ liệu huấn luyện và báo cáo quy tắc; đừng chọn phiên bản trông hấp dẫn nhất sau khi xem giai đoạn kiểm tra cuối cùng.

Ba đường thủy tinh trong suốt màu xanh lam, hổ phách và trắng gặp nhau tại lăng kính pha lê, rồi một đường duy nhất tiếp tục đi ra
Hình khái niệm về việc kết hợp nhiều dự báo thành một dự báo chung; không phải dữ liệu thị trường đã đo, trọng số ước lượng hay tín hiệu giao dịch

Tạo kho lưu trữ dự báo theo thời gian thực

Mỗi dự báo thành phần trong kho phải là dự báo có thể tạo ra tại thời điểm gốc đã nêu. Tái tạo từng mô hình chỉ bằng dữ liệu có sẵn khi đó, đồng thời lưu dấu thời gian dự báo, phiên bản mô hình và định nghĩa mục tiêu. Giá trị khớp trong mẫu không thay thế được dự báo lịch sử thực vì mô hình có thể đã dùng dữ liệu chưa được biết vào thời điểm đó.

Căn chỉnh kho theo mục tiêu và thời điểm gốc. Trong mỗi hàng, dự báo thành phần phải cùng nhắm tới một khoảng tương lai và thông tin huấn luyện phải dừng ở cùng một thời điểm ra quyết định. Hãy xử lý hoặc nêu rõ cách xử lý dự báo bị thiếu trước khi ước lượng tổ hợp; âm thầm thay đổi tập đầu vào có thể làm ý nghĩa của trọng số khác nhau theo ngày.

Tách việc ước lượng trọng số khỏi đánh giá cuối cùng. Quy trình cuốn chiếu theo thời điểm gốc có thể ước lượng trọng số từ các dự báo có kết quả được biết trước \(t\), tạo tổ hợp tại \(t\), rồi chấm điểm khi quan sát được mục tiêu. Cửa sổ mở rộng dùng mọi thời điểm quá khứ đủ điều kiện; cửa sổ cuốn chiếu loại bỏ thời điểm cũ theo độ dài định trước. Hai lựa chọn phản ứng khác nhau khi hiệu quả thay đổi.

Nếu chọn mô hình thành phần, phép biến đổi, chân trời dự báo, ràng buộc trọng số hoặc hàm mất mát sau khi xem giai đoạn giữ lại, giai đoạn đó đã trở thành một phần của quá trình phát triển mô hình. Hãy dành một giai đoạn kiểm tra mới hoặc dùng đánh giá lồng nhau, giữ mọi bước lựa chọn bên trong dữ liệu huấn luyện.

So sánh các tổ hợp bằng cùng một hàm mất mát

So sánh quy tắc trọng số bằng nhau, quy tắc ước lượng hoặc co rút trọng số và các dự báo riêng lẻ trên cùng thời điểm gốc, đối chiếu với cùng mục tiêu thực tế. Báo cáo hàm mất mát và mẫu chung. Nếu không, một phương pháp có thể trông tốt hơn chỉ vì được chấm điểm trên ngày dễ hơn hoặc theo định nghĩa mục tiêu khác.

Hàm mất mát cần phù hợp với mục tiêu và câu hỏi. Sai số bình phương phạt mạnh hơn những lỗi lớn; sai số tuyệt đối gán trọng số khác cho chúng. Khi chấm dự báo biến động so với thước đo thực tế nhiễu, điều kiện của biến đại diện và hàm mất mát đều quan trọng; hướng dẫn QLIKE và sai số bình phương giải thích khác biệt. Đừng chọn hàm mất mát sau khi biết nó có lợi cho phương pháp nào.

Một kiểm định so sánh dự báo có thể giúp đánh giá liệu chênh lệch mất mát quan sát được có phù hợp với biến thiên lấy mẫu hay không. Hướng dẫn Diebold–Mariano trình bày so sánh mất mát theo cặp và các giả định cần thiết khi sai số dự báo chồng lấn hoặc phụ thuộc. Kết quả kiểm định không sửa được thiên lệch nhìn trước và không chứng minh giá trị kinh tế.

Nếu đã thử nhiều tập hợp mô hình, ràng buộc trọng số hoặc quy tắc mất mát rồi giữ lại phiên bản tốt nhất trên cùng giai đoạn đánh giá, kết quả báo cáo cũng phản ánh quá trình tìm kiếm đó. Hướng dẫn White Reality Check và hướng dẫn xác suất quá khớp kiểm định chiến lược bàn về việc lựa chọn giữa nhiều quy tắc giao dịch. Cả hai đều không thay thế kho dự báo sạch hoặc đánh giá được định trước.

Thiết kế kiểm định cần phản ánh chân trời sử dụng. Nếu dự báo phát hành hằng ngày nhắm đến mục tiêu nhiều ngày bị chồng lấn, các khoản mất mát liên tiếp có thể phụ thuộc nhau. Hãy tính đến phụ thuộc đó khi ước lượng độ bất định, và đừng xem nhiều hàng chồng lấn như số thí nghiệm độc lập tương ứng.

Ghép tổ hợp với quyết định

Trước khi kết hợp, hãy kiểm tra mỗi mô hình dự báo điều gì. Trung bình có điều kiện, phương sai, phân vị và toàn bộ phân phối xác suất là các đối tượng dự báo khác nhau. Trung bình tuyến tính các dự báo điểm không tự tạo ra dự báo mật độ đã hiệu chỉnh hay ước lượng rủi ro đuôi đáng tin cậy.

Với đại lượng bắt buộc không âm như phương sai, hãy kiểm tra giá trị tổ hợp trước khi sử dụng. Trung bình lồi của các dự báo không âm vẫn không âm; hồi quy khớp có trọng số âm hoặc hệ số chặn thì có thể không như vậy. Cắt giá trị âm về 0 làm thay đổi quy tắc dự báo và cần được xác định trước khi đánh giá.

Số lượng dự báo cũng quan trọng. Thêm đầu vào yếu hoặc gần như trùng lặp có thể làm tăng số trọng số cần khớp mà không bổ sung nhiều thông tin mới. Nếu kho lịch sử ngắn so với \(K\), hãy ưu tiên quy tắc ít chiều, minh bạch và cho thấy kết luận không phụ thuộc vào một thành phần duy nhất.

Kết hợp dự báo mô hình khác với kết hợp vị thế giao dịch. Mức mất mát thống kê thấp hơn không chứng minh chiến lược dùng dự báo sẽ sinh lời sau phí, chênh lệch mua bán, trượt giá, tác động thị trường và giới hạn rủi ro. Việc tạo dự báo và quy tắc giao dịch sử dụng nó cần bằng chứng ngoài mẫu riêng.

Báo cáo đủ thông tin để tái lập kết quả

Một báo cáo hữu ích nêu mục tiêu dự báo, chân trời, đơn vị, mô hình thành phần, dấu thời gian gốc, giai đoạn lưu trữ và quy tắc dữ liệu thiếu. Báo cáo cần nói rõ trọng số bằng nhau, được ước lượng, bị ràng buộc, co rút hay thay đổi theo thời gian, cũng như cách chọn từng tham số.

Trình bày kết quả của mốc trọng số bằng nhau, tổ hợp được chọn và dự báo đơn lẻ mạnh nhất trên cùng ngày đánh giá. Nêu hàm mất mát, phương pháp ước lượng độ bất định và cách xử lý mục tiêu chồng lấn. Nếu trọng số thay đổi mạnh giữa các cửa sổ, hãy cho thấy sự thiếu ổn định thay vì chỉ đưa giá trị cuối.

Cuối cùng, phân biệt nhận định thực nghiệm với nhận định về quyết định. “Tổ hợp này có mức mất mát trung bình thấp hơn trong mẫu này theo hàm mất mát này” cụ thể và dễ tái lập hơn “kết hợp dự báo giúp giao dịch tốt hơn”. Có thể kiểm tra câu thứ nhất từ kho lưu trữ; câu thứ hai cần chiến lược, giả định khớp lệnh và bằng chứng đánh giá riêng.

Câu hỏi thường gặp

Q1Tổ hợp trọng số bằng nhau luôn tốt hơn một mô hình riêng lẻ sao?

Không. Đây là mốc hữu ích không cần khớp trọng số, nhưng độ chính xác phụ thuộc vào các dự báo thành phần và mục tiêu. Hãy so sánh với từng dự báo riêng lẻ trên cùng ngày ngoài mẫu.

Q2Tổng trọng số dự báo có luôn phải bằng một không?

Không. Trung bình có trọng số bị ràng buộc thường áp dụng điều kiện đó để kết quả được hiểu là tổ hợp lồi. Hồi quy có hệ số chặn ước lượng dạng điều chỉnh dự báo khác; hãy nêu đặc tả và hệ quả của nó.

Q3Có thể ước lượng trọng số kết hợp từ giá trị khớp trong mẫu không?

Cách đó có thể tạo kho dữ liệu thiếu thực tế vì các mô hình nền có thể đã dùng thông tin chưa có tại mỗi thời điểm gốc lịch sử. Hãy ưu tiên dự báo lịch sử thực theo quy trình cuốn chiếu, chỉ dùng dữ liệu sẵn có khi đó.

Q4Dự báo kết hợp chính xác hơn có chứng minh lợi thế giao dịch không?

Không. Độ chính xác dự báo là kết quả thống kê theo mục tiêu, biến đại diện, mẫu và hàm mất mát đã xác định. Khẳng định về giao dịch còn cần chiến lược cụ thể, chi phí thực hiện, giới hạn rủi ro và đánh giá ngoài mẫu riêng. Nghiên cứu chính - Bates and Granger (1969), “The Combination of Forecasts,” *Journal of the Operational Research Society*, 20(4), 451–468. - Granger and Ramanathan (1984), “Improved Methods of Combining Forecasts,” *Journal of Forecasting*, 3(2), 197–204. - Kang (1986), “Unstable Weights in the Combination of Forecasts,” *Management Science*, 32(6), 683–695. - Timmermann (2006), “Forecast Combinations,” *Handbook of Economic Forecasting*, 1, 135–196.01004-9) - Claeskens, Magnus, Vasnev, and Wang (2016), “The Forecast Combination Puzzle: A Simple Theoretical Explanation,” *International Journal of Forecasting*, 32(3), 754–762.

Nguồn và tài liệu đọc thêm

Báo lỗi

Chúng tôi sẽ soạn email kèm liên kết bài viết này. Mark chỉ nhận được báo cáo sau khi bạn gửi email

Kiểm tra nhanh

Đọc xong hướng dẫn? Hãy kiểm tra với 3 câu hỏi

Câu hỏi 1 / 3

Câu hỏi 01

Cần căn chỉnh điều gì trước khi kết hợp hai dự báo mô hình?

Chọn một đáp án để xem giải thích

Bảng thuật ngữ quyền chọn

Định nghĩa rõ ràng về các thuật ngữ cốt lõi, từ call, put và chuỗi quyền chọn đến IV, Greeks, lãi suất mở và max pain

Xem bảng thuật ngữ quyền chọn
Đánh giá dự báo biến độngQLIKE và sai số bình phương trong dự báo biến động: biến đại diện nhiễuSo sánh QLIKE với sai số bình phương cho dự báo biến động, xem ví dụ đảo thứ hạng và tìm hiểu khi nào biến đại diện phương sai thực hiện có nhiễu vẫn giữ nguyên thứ hạng dự báo kỳ vọngĐánh giá dự báoKiểm định Diebold–Mariano: Cách so sánh độ chính xác của dự báoTìm hiểu cách kiểm định Diebold–Mariano so sánh tổn thất dự báo theo cặp, xử lý các chân trời dự báo chồng lấn và vì sao p-value thấp không chứng minh được kỹ năng giao dịch.Vì sao chiến lược thắng cuộc trong quá trình tìm kiếm cần được kiểm định ở cấp toàn bộ nhómWhite’s Reality Check về data snooping trong backtest chiến lượcTìm hiểu cách White’s Reality Check so sánh chiến lược tốt nhất được tìm ra với benchmark bằng cực đại bootstrap có xét đến sự phụ thuộcTần suất người thắng backtest tụt dưới trung vị của nhómGiải thích xác suất overfit backtest (PBO) và CSCVTìm hiểu cách kiểm định chéo đối xứng tổ hợp ước tính PBO, chuyển thứ hạng OOS thành logit và vì sao chỉ số này không dự báo khoản lỗ tương laiSo sánh dự báo kinh tế lượngGiải thích kiểm định tính bao hàm dự báo (forecast encompassing): Dự báo nào chứa thông tin của dự báo kia?Tìm hiểu kiểm định forecast encompassing phát hiện thông tin dự báo bổ sung ra sao, khác gì với kiểm định độ chính xác và kiểm định mô hình lồng nhau, cùng những giới hạn khi diễn giải.