Reality Check của White và kiểm định SPA của Hansen cho quy tắc giao dịch
So sánh Reality Check và SPA cho một tập hợp quy tắc đã được tìm kiếm, từ giả thuyết toàn cục, bootstrap đến giới hạn khi diễn giải kết quả.
Trong hướng dẫn nàyVì sao không thể kiểm định người thắng backtest như một ứng viên đơn lẻ?
Tóm tắt ngắn
Reality Check (RC) của White và kiểm định SPA (Superior Predictive Ability) của Hansen đặt câu hỏi liệu có ít nhất một quy tắc trong tập hợp đã tìm kiếm vượt qua chuẩn so sánh được xác định trước hay không. Cả hai đều tính đến việc chọn ứng viên tốt nhất trên cùng mẫu dữ liệu, nhưng không chứng nhận một quy tắc riêng lẻ hoặc bảo đảm lợi nhuận trong tương lai.
Vì sao không thể kiểm định người thắng backtest như một ứng viên đơn lẻ?
Nếu bạn xác định đúng một chiến lược trước khi xem dữ liệu, một phép so sánh đơn lẻ có thể phù hợp với câu hỏi. Nhưng sau khi thử nhiều quy tắc, xem kết quả rồi chỉ kiểm định quy tắc đứng đầu như thể nó là lựa chọn duy nhất từ đầu, phép kiểm định sẽ bỏ qua quá trình tìm kiếm. Ngay cả khi không quy tắc nào có lợi thế thật, giá trị lớn nhất trong nhiều ước lượng nhiễu vẫn có thể dương chỉ vì đó là giá trị lớn nhất. Một p-value dành cho ứng viên được định trước không phản ánh việc cùng mẫu dữ liệu đã được dùng để chọn người thắng.
RC và SPA trả lời câu hỏi ở cấp toàn bộ tập hợp: sau khi tính đến các lựa chọn đã thử, có bằng chứng rằng ít nhất một ứng viên có hiệu quả kỳ vọng cao hơn chuẩn so sánh theo một tiêu chí đã chọn hay không? Tập hợp có thể gồm quy tắc kỹ thuật, mô hình dự báo hoặc các chiến lược khác. White đề xuất khung kiểm định việc mô hình tốt nhất trong quá trình tìm đặc tả có vượt chuẩn dự báo hay không (White, 2000). Sullivan, Timmermann và White áp dụng ý tưởng đó cho một tập lớn quy tắc giao dịch kỹ thuật (nghiên cứu năm 1999). Phạm vi cần hiệu chỉnh là tập ứng viên đã góp phần tạo ra lựa chọn, chứ không chỉ quy tắc cuối cùng còn lại. Hướng dẫn về FDR và kiểm định nhiều giả thuyết bàn về một câu hỏi liên quan nhưng khác.
Cố định chuẩn so sánh, tập ứng viên và cách đo chênh lệch
Gọi k là một quy tắc trong tập K cần kiểm định, còn t là ngày chung để đánh giá mọi ứng viên và chuẩn so sánh. Với so sánh lợi suất, định nghĩa chênh lệch từng kỳ như sau:
d(k,t) = lợi suất ròng của ứng viên k − lợi suất ròng của chuẩn so sánh
Giá trị dương có lợi cho ứng viên. Nếu so sánh tổn thất dự báo, hãy đảo thứ tự bằng cách lấy tổn thất của chuẩn trừ tổn thất của ứng viên, để giá trị dương vẫn biểu thị ứng viên tốt hơn. Đừng thay đổi quy ước dấu giữa các quy tắc hoặc các ngày. Cần thống nhất trước về tập ứng viên, chuẩn so sánh, ngày đánh giá, cách tính chi phí và định nghĩa “tốt hơn”. Chênh lệch lợi suất ròng trung bình không tự động là phép đo lợi suất đã điều chỉnh rủi ro hoặc mức sụt giảm.
Gọi μ(k)=E[d(k,t)] là chênh lệch kỳ vọng của ứng viên k. Giả thuyết chung cho cả tập là:
H0: max(k∈K) μ(k) ≤ 0 H1: max(k∈K) μ(k) > 0
Đây là giả thuyết không toàn cục dạng yếu: không ứng viên nào có chênh lệch kỳ vọng dương, nhưng một số quy tắc vẫn có thể có chênh lệch thật âm. Phép kiểm định xem xét một thống kê chung của cả tập thay vì tạo một danh sách kết luận riêng cho từng quy tắc. Chuẩn, chỉ tiêu và tập ứng viên phải được xác định đủ rõ để biết kết quả đang trả lời câu hỏi nào.
Reality Check kiểm định giá trị lớn nhất trong cả tập
Gọi d̄(k) là chênh lệch trung bình của ứng viên k trong n ngày đánh giá. Với tiêu chí chênh lệch trung bình đơn giản, thống kê RC là:
T_RC = max(k∈K) sqrt(n) × d̄(k)
RC so sánh giá trị lớn nhất này với phân phối bootstrap được dựng dưới giả thuyết không. Cách tiếp cận của White sử dụng biên bất lợi nhất của giả thuyết không hợp thành: khi tạo phân phối không, đặt chênh lệch kỳ vọng thật của mọi ứng viên bằng 0. H0 cũng cho phép những ứng viên có chênh lệch kỳ vọng âm, nhưng biên toàn bằng 0 đặt mọi quy tắc ngang chuẩn và có thể khiến phép thử bảo thủ. Nếu có nhiều lựa chọn yếu, giá trị tới hạn có thể tăng và việc bác bỏ H0 khó hơn. Công thức RC ở đây không cắt thống kê ở mức 0; nó lấy giá trị lớn nhất của các trung bình mẫu như đã viết.
Vấn đề cốt lõi là phép tìm kiếm đã chọn mức cao nhất. Câu hỏi không phải là “quy tắc đứng đầu có lạ nếu xem riêng không?”, mà là “nếu thực hiện cùng cuộc tìm kiếm trên cả tập, việc thấy một mức cao nhất như vậy có hiếm không?”. So người thắng với phân phối tham chiếu cho một quy tắc được định trước sẽ bỏ qua bước lựa chọn từ nhiều kết quả.
SPA chuẩn hóa thống kê và điều chỉnh phân phối không theo mẫu
SPA của Hansen giữ nguyên giả thuyết toàn cục và chênh lệch so với chuẩn, nhưng thay đổi thống kê và cách tạo phân phối không. Thống kê thường được viết như sau:
T_SPA = max(0, max(k∈K) sqrt(n) × d̄(k) / ω̂(k))
ω̂(k) ước lượng độ lệch chuẩn dài hạn của √n d̄(k). Việc chuẩn hóa đưa các ứng viên có mức biến động khác nhau về đơn vị liên quan đến độ bất định của trung bình, thay vì so sánh trực tiếp các chênh lệch thô. Phép lấy lớn hơn giữa 0 và giá trị lớn nhất bên trong bảo đảm thống kê SPA không âm. Điều này khác với công thức RC phía trên, vốn không có bước cắt ở mức 0.
Điểm khác biệt nữa là phân phối không phụ thuộc vào mẫu. Trong một phiên bản nhất quán, các ứng viên có trung bình quan sát đủ âm tiếp tục được giữ ở mức âm khi tạo phân phối không; các ứng viên hợp lý có thể nằm gần biên thì được căn giữa tại 0. SPA không đơn giản xóa các quy tắc yếu ra khỏi tập đã kiểm định. Cách làm này nhằm giảm ảnh hưởng của lựa chọn kém so với biên RC vốn đặt mọi chênh lệch kỳ vọng bằng 0. Hansen cho thấy chuẩn hóa và phân phối không theo mẫu có thể cải thiện lực kiểm định và giảm độ nhạy với ứng viên kém (Hansen, 2005). Tuy nhiên, SPA không luôn vượt trội RC trong mọi điều kiện.
Bootstrap đồng thời các vector ứng viên theo thời gian
Các quy tắc khác nhau thường chịu cùng biến động thị trường trong một ngày, nên chênh lệch giữa chúng có thể đồng biến. Chuỗi của từng quy tắc cũng có thể phụ thuộc vào các ngày lân cận. Nếu lấy mẫu lại từng cột ứng viên một cách độc lập, quan hệ đồng thời này bị phá vỡ và phân phối của giá trị lớn nhất thay đổi. Thay vào đó, ở mỗi ngày ta xét toàn bộ vector d_t=(d(1,t),…,d(K,t)) và áp dụng cùng chỉ số ngày hoặc cùng chuỗi khối cho mọi cột.
Lấy mẫu theo khối giúp giữ một phần trật tự thời gian. Chẳng hạn, bootstrap dừng ghép các khối có độ dài ngẫu nhiên theo phân phối hình học; bài báo của Politis và Romano nghiên cứu suy luận với quan sát dừng và phụ thuộc yếu (Politis và Romano, 1994). Không phương pháp nào bảo đảm mô tả chính xác mọi dạng phụ thuộc. Cần các điều kiện như quá trình đủ ổn định và phụ thuộc đủ yếu theo nghĩa thích hợp. Điểm gãy cấu trúc hay đổi chế độ thị trường không biến mất chỉ vì dữ liệu được lấy lại theo khối. Hướng dẫn block bootstrap giải thích thêm về thiết kế khối cho một thống kê đã cố định.

Ví dụ 240 quy tắc chỉ minh họa phép nhân giả định
Chỉ để minh họa cách đếm, giả sử một nhà nghiên cứu xem xét 12 khoảng lookback, 4 bộ lọc vào lệnh và 5 cách thoát lệnh. Lưới đầy đủ có 12×4×5=240 tổ hợp. Nếu mọi cấu hình được đánh giá trên cùng ngày với cùng cách tính chi phí, và chuẩn so sánh cố định là mua rồi nắm giữ, có thể tính lợi suất ròng của mỗi quy tắc trừ lợi suất ròng của chuẩn. Thống kê toàn cục sẽ dùng mức lớn nhất trên toàn bộ 240 ứng viên nếu tất cả đều tham gia quá trình tìm kiếm.
Con số 240 chỉ là phép tính minh họa; không có lợi suất, p-value hoặc kết quả nào được tạo ra hay ngụ ý ở đây. Trong nghiên cứu thật, tập thử có thể còn bao gồm thị trường, kỳ nắm giữ, bộ lọc, giai đoạn kiểm định, chuẩn hoặc giả định chi phí khác. Nếu việc chọn người thắng dựa vào các lựa chọn bổ sung đó, chỉ báo cáo lưới tham số cuối cùng sẽ làm phạm vi hiệu chỉnh nhỏ hơn thực tế.
Cũng phải định nghĩa trước tiêu chí “tốt hơn”. Nếu dùng chênh lệch lợi suất ròng trung bình, đó không phải đánh giá đồng thời biến động, sụt giảm tối đa hoặc mức sử dụng vốn. Lịch giao dịch, phí, chi phí vay, funding và trượt giá cần được xử lý nhất quán giữa các ứng viên; khác biệt trong giả định khớp lệnh có thể bị nhầm thành ưu thế của quy tắc.
FDR và khoảng tin cậy bootstrap cho một chỉ tiêu là câu hỏi khác
Các phương pháp FDR như Benjamini–Hochberg xử lý một tập p-value của những giả thuyết riêng lẻ và, dưới các giả định phù hợp, kiểm soát kỳ vọng tỷ lệ phát hiện sai trong số các kết quả bị bác bỏ. RC và SPA là một phép thử toàn cục cho giá trị lớn nhất của cả tập so với một chuẩn. Chúng liên quan đến kiểm định nhiều lần nhưng không thể thay thế nhau. Hướng dẫn FDR và kiểm định nhiều giả thuyết giải thích riêng mục tiêu của FDR.
Khoảng tin cậy từ block bootstrap thông thường cũng không phải RC hay SPA. Khoảng có thể mô tả bất định lấy mẫu của một chỉ tiêu đã cố định trước, như lợi suất trung bình hoặc Sharpe của một chiến lược. Nếu chiến lược được chọn sau khi xem nhiều ứng viên, khoảng đơn lẻ đó không tự điều chỉnh cho việc chọn người thắng. Trong RC và SPA, thống kê lớn nhất được tính lại trên cả tập theo cấu trúc giả thuyết không phù hợp. Lấy mẫu theo khối là một công cụ để xử lý phụ thuộc thời gian khi tạo phân phối; bản thân từ “bootstrap” không có nghĩa là đã sửa sai lệch do tìm kiếm.
Purged cross-validation giải quyết một vấn đề khác: giảm rò rỉ thông tin theo thời gian giữa các quan sát huấn luyện và kiểm tra trong dữ liệu có thứ tự thời gian. Phương pháp này không kiểm định giá trị lớn nhất của cả tập quy tắc có vượt chuẩn hay không; đó là câu hỏi toàn cục của RC/SPA. Hướng dẫn Purged CV và embargo giải thích cách tách thời gian này.
Bác bỏ giả thuyết không không xác định người thắng hoặc lợi nhuận tương lai
Nếu RC hoặc SPA bác bỏ H0, kết luận chỉ áp dụng với tập ứng viên, chuẩn so sánh, giai đoạn dữ liệu, tiêu chí, cách dựng phân phối không và các giả định đã nêu. Có bằng chứng ở cấp tập hợp rằng ít nhất một ứng viên vượt chuẩn theo tiêu chí đó. Kết quả không xác định quy tắc nào thực sự ưu việt, không chứng nhận mức ý nghĩa riêng cho ứng viên được chọn và không nói rằng mọi quy tắc đều thắng. Không bác bỏ H0 cũng không chứng minh các quy tắc bằng nhau hoặc vô ích; dữ liệu và thiết kế có thể chưa cung cấp đủ bằng chứng.
Kiểm định không dự báo lợi nhuận tương lai, cũng không bảo đảm backtest sẽ lặp lại khi giao dịch thật. Các lần thử không được ghi nhận, rò rỉ dữ liệu, thiên lệch sống sót, chi phí bị đánh giá thấp, tác động thị trường và tính không dừng vẫn cần được xem xét riêng. Nếu thay đổi tập ứng viên sau khi thấy kết quả, câu hỏi đã được kiểm định cũng thay đổi. Muốn đánh giá một quy tắc cụ thể, cần dùng thủ tục suy luận phù hợp cho từng ứng viên và kiểm tra trên dữ liệu chưa tham gia quá trình chọn; việc xác nhận đó vẫn không bảo đảm chế độ thị trường tương lai.
Báo cáo thiết kế để người khác có thể tái lập
Báo cáo nên nêu chuẩn so sánh, toàn bộ tập ứng viên và cách hình thành, ngày và tần suất đánh giá, định nghĩa chênh lệch lợi suất ròng hoặc tổn thất, chi phí, tiêu chí, tên kiểm định và p-value. Với SPA, hãy ghi rõ phiên bản triển khai và loại p-value được báo cáo. Cũng cần nêu phương pháp bootstrap, độ dài khối hoặc độ dài trung bình, số lần lặp, cách lấy mẫu chung vector thời gian và cách xây dựng phân phối không.
Hãy lưu lại các thị trường, khoảng tham số, bộ lọc, thời hạn nắm giữ và giả định chi phí đã được xem xét trước khi chọn người thắng. Nếu chỉ kiểm định một tập đã thu hẹp, cần giải thích cách thu hẹp và dữ liệu nào đã góp phần vào việc đó. Những thông tin này giúp người đọc xác định hiệu chỉnh có bao trùm quá trình tìm kiếm thực tế không. Kết quả RC hoặc SPA vẫn là bằng chứng thống kê có điều kiện theo mẫu và giả định đã nêu, không thay thế việc đánh giá thực thi và theo dõi chiến lược.
Câu hỏi thường gặp
Q1SPA có phải lúc nào cũng mạnh hơn Reality Check không?
Không. Studentization và phân phối không theo mẫu của SPA có thể giảm ảnh hưởng của ứng viên kém và tăng lực kiểm định. Nhưng kết quả phụ thuộc dữ liệu và giả định; không có ưu thế đồng đều trong mọi trường hợp.
Q2Kết quả SPA có ý nghĩa cho biết nên chọn quy tắc nào không?
Không. Nó đưa ra bằng chứng toàn cục rằng ít nhất một ứng viên trong tập có thể vượt chuẩn theo tiêu chí đã chọn. Việc chọn một quy tắc riêng cần quy trình phù hợp ở cấp ứng viên và dữ liệu xác nhận chưa dùng để lựa chọn.
Q3Có thể bỏ các lần thử cho kết quả kém khỏi tập kiểm định không?
Nếu chúng đã được thử trước khi chọn người thắng, loại chúng có thể làm nhỏ phạm vi tìm kiếm trên giấy. Hãy xác định và ghi lại tập ứng viên liên quan đến quá trình chọn trước khi diễn giải kết quả đã hiệu chỉnh. Nghiên cứu chính - White, “A Reality Check for Data Snooping” (2000) - Hansen, “A Test for Superior Predictive Ability” (2005) - Sullivan, Timmermann, and White, “Data-Snooping, Technical Trading Rule Performance, and the Bootstrap” (1999) - Politis and Romano, “The Stationary Bootstrap” (1994)
Nguồn và tài liệu đọc thêm
Báo lỗi
Chúng tôi sẽ soạn email kèm liên kết bài viết này. Mark chỉ nhận được báo cáo sau khi bạn gửi email
Kiểm tra nhanh
Đọc xong hướng dẫn? Hãy kiểm tra với 3 câu hỏi
Câu hỏi 01
Giả thuyết không toàn cục của RC và SPA nói lên điều gì?
Chọn một đáp án để xem giải thích
Bảng thuật ngữ quyền chọn
The probability of falsely rejecting at least one true null hypothesis within a predefined family of tests.
Đọc hướng dẫn chuyên sâuAssignmentThe process that requires an option writer to fulfill the contract after an exercise notice is allocated; it can create or remove an underlying position.
Đọc hướng dẫn chuyên sâu