Skip to content
Tất cả hướng dẫn quyền chọn
Vì sao chiến lược thắng cuộc trong quá trình tìm kiếm cần được kiểm định ở cấp toàn bộ nhóm13 phút đọc

White’s Reality Check về data snooping trong backtest chiến lược

Tìm hiểu cách White’s Reality Check so sánh chiến lược tốt nhất được tìm ra với benchmark bằng cực đại bootstrap có xét đến sự phụ thuộc

Trong hướng dẫn nàyPhép kiểm định hỏi liệu ứng viên thắng cuộc có vượt benchmark đã chọn hay không

Tóm tắt ngắn

White’s Reality Check hỏi liệu ứng viên có hiệu quả cao nhất trong một nhóm tìm kiếm được xác định có vượt benchmark đã chọn hay không, đồng thời tính đến việc ứng viên được chọn vì nó là giá trị lớn nhất. Phương pháp bootstrap các chênh lệch hiệu quả chung và phụ thuộc theo thời gian, rồi so sánh giá trị cực đại quan sát được với phân phối không có giả thuyết của các cực đại bootstrap. p-value đã điều chỉnh nhỏ là bằng chứng chống lại giả thuyết không chung rằng không ứng viên nào trong nhóm đó vượt benchmark; nó không dự báo khả năng sinh lời khi giao dịch thực tế.

Phép kiểm định hỏi liệu ứng viên thắng cuộc có vượt benchmark đã chọn hay không

Nhà nghiên cứu có thể thử hàng chục cửa sổ trung bình động, quy tắc phá vỡ, thời gian nắm giữ, thị trường và bộ lọc, rồi công bố chiến lược có điểm backtest cao nhất. Đây không phải một ứng viên đơn lẻ thông thường: quá trình tìm kiếm cho nó nhiều cơ hội để trông có vẻ vượt trội. Kiểm định riêng ứng viên thắng cuộc như thể đã chọn trước khi xem dữ liệu sẽ bỏ qua bước lựa chọn đó.

White’s Reality Check đưa lựa chọn vào chính phép kiểm định. Phương pháp hỏi liệu trong nhóm được khảo sát có ứng viên nào đạt hiệu quả kỳ vọng cao hơn benchmark xác định hay không. White xây dựng giả thuyết không như giao của các phép so sánh một phía: hiệu quả kỳ vọng của từng ứng viên so với benchmark không lớn hơn 0. Giả thuyết đối nói rằng ít nhất một ứng viên có lợi thế kỳ vọng dương. Benchmark có thể là mua và nắm giữ, một quy tắc dự báo đơn giản hoặc một chuẩn so sánh khác; chuẩn đó phải phù hợp với câu hỏi nghiên cứu và được xác định trước khi xem kết quả. Xem thiết lập chính thức trong bài báo gốc của White.

Đây là câu hỏi về toàn bộ nhóm, không phải lời đảm bảo cho chiến lược tình cờ đứng đầu. Bác bỏ giả thuyết không cho thấy nhóm đã ghi nhận có bằng chứng về tính vượt trội theo thống kê và giả định đã chọn. Điều đó không chứng minh mọi ứng viên đều hữu ích, ứng viên thắng cuộc sẽ tiếp tục tốt nhất hay lợi thế tồn tại qua một chế độ thị trường mới.

Biểu diễn từng ứng viên bằng chênh lệch hiệu quả có thể so sánh

Gọi d[k,t] là hiệu quả của ứng viên k trừ hiệu quả của benchmark trong cùng kỳ t; giá trị cao hơn phải luôn có lợi cho ứng viên. Khi so sánh lợi suất, có thể định nghĩa bằng lợi suất ròng của ứng viên trừ lợi suất ròng của benchmark. Nếu so sánh tổn thất dự báo, đảo chiều thành tổn thất benchmark trừ tổn thất ứng viên. Quy ước dấu cần bảo đảm giá trị dương luôn biểu thị lợi thế của ứng viên.

Mỗi hàng cần ứng với cùng khoảng thời gian ở mọi ứng viên. Dùng nhất quán một loại tiền tệ, quy ước lợi suất, cách tính tài trợ và chính sách chi phí. Nếu tuyên bố nói về lợi suất chiến lược có thể thực thi, hãy khấu trừ hoa hồng, spread, trượt giá, funding và chi phí vay liên quan trước khi tính d[k,t]. Kiểm định lợi suất gộp nhưng chỉ đề cập chi phí trong chú thích sẽ trả lời một câu hỏi khác.

Trung bình mẫu của ứng viên k là d̄[k] = (1/T) Σ_t d[k,t]. Giả thuyết không chung là H0: max_k E[d[k,t]] ≤ 0, còn giả thuyết đối là H1: max_k E[d[k,t]] > 0. Toàn bộ nhóm dùng chung một benchmark và cùng tiêu chí đánh giá. Nếu các ứng viên có ngày thiếu hoặc tần suất quan sát khác nhau, hãy xác định mẫu so sánh chung có thể bảo vệ được trước khi tính chênh lệch; đừng âm thầm cho một ứng viên khoảng thời gian thuận lợi hơn.

Đưa toàn bộ nhóm ứng viên vào tuyên bố nghiên cứu

Nhóm bao gồm các quy tắc ứng viên có thể ảnh hưởng đến việc chọn người thắng được công bố: lookback đã thử, ngưỡng vào lệnh, tổ hợp tín hiệu, tập tài sản, thời gian nắm giữ, giới hạn danh mục và giả định khớp lệnh. Những biến thể thủ công từng thử rồi loại sau khi xem kết quả cũng thuộc nhóm này. Trong bài báo năm 2000, White dùng “specification search” theo nghĩa rộng: chính quá trình lựa chọn, chứ không chỉ bảng kết quả cuối, tạo ra vấn đề chọn lọc.

Có hai sai lầm trái ngược. Bỏ các thử nghiệm đã giúp chọn chiến lược được báo cáo khiến phép điều chỉnh quá lạc quan vì bootstrap thấy một quá trình tìm kiếm nhỏ hơn thực tế. Ngược lại, thêm nhiều quy tắc tùy tiện không liên quan sau đó có thể khiến kiểm định bảo thủ không cần thiết và giảm khả năng phát hiện ứng viên hữu ích. Hãy xác định nhóm dựa trên quy trình chọn thực tế và lưu nhật ký nghiên cứu để có thể kiểm tra ranh giới của nhóm.

Phép kiểm định không thể suy ra những thử nghiệm chưa được ghi lại. Sổ ghi chép chỉ có bộ tham số thắng cuộc không đủ để tái dựng quá trình tìm kiếm. Lưu cùng nhau danh sách ứng viên, phiên bản dữ liệu, ngày đánh giá, mục tiêu, giả định chi phí và quyết định chọn lọc. Nếu nhóm thay đổi sau khi xem kết quả, hãy nêu rõ thay đổi gì và vì sao; đừng trình bày nhóm được lập sau sự kiện như thể đã cố định từ đầu.

Thống kê cực đại đưa bước chọn lọc vào phân phối không

Tính hiệu quả tương đối trung bình của mỗi ứng viên rồi lấy giá trị lớn nhất. Một thống kê phổ biến không studentize là Vobs = √T × max_k d̄[k]. Giá trị cực đại rất quan trọng: nó mô phỏng chính thao tác “chọn cái tốt nhất” tạo ra người thắng có vẻ vượt trội. Nếu chỉ kiểm định cột thắng cuộc, thao tác chọn lọc đó sẽ biến mất khỏi phân phối tham chiếu.

Bootstrap ước lượng mức cực đại có thể xuất hiện chỉ do biến động lấy mẫu nếu giả thuyết không chung về việc không có ứng viên vượt trội là đúng. Trong lần lặp bootstrap b, lấy mẫu lại vector chênh lệch theo thời gian của tất cả ứng viên và tính thống kê đã định tâm như V*b = √T × max_k(d̄*[k,b] − d̄[k]). Định tâm đặt trung bình của ứng viên tại biên bất lợi nhất của giả thuyết không, nơi lợi thế kỳ vọng bằng 0; phép lấy cực đại vẫn giữ bước lựa chọn giữa các ứng viên. Bài báo của White xây dựng phân phối bootstrap của cực đại và so sánh với thống kê quan sát được.

Lặp lại quy trình nhiều lần. p-value đã điều chỉnh là tỷ lệ cực đại bootstrap lớn hơn hoặc bằng Vobs. Với B lần lặp, một ước lượng Monte Carlo phổ biến là (1 + count{V*b ≥ Vobs})/(B + 1). Các cách triển khai có thể khác nhau về studentization hoặc chi tiết mô hình được ước lượng; hãy ghi lại thống kê và quy ước định tâm dưới giả thuyết không. Điểm cốt yếu là tính lại cực đại của toàn bộ nhóm trong mỗi lần lặp, không chỉ đánh giá ứng viên thắng cuộc đã quan sát.

Giữ lại sự phụ thuộc khi lấy mẫu lại lịch sử ứng viên

Quan sát tài chính có thứ tự thời gian. Xáo trộn độc lập có thể xóa phụ thuộc chuỗi, cụm biến động và các chuỗi lãi lỗ có tương quan. Việc đó cũng có thể làm sai lệch mối quan hệ giữa các chiến lược thường phản ứng trước cùng ngày thị trường. Những đặc điểm này ảnh hưởng đến đuôi của thống kê cực đại; lấy mẫu riêng từng ứng viên hoặc rút từng ngày độc lập có hoàn lại có thể tạo phân phối tham chiếu sai.

White mô tả các phương pháp cho dữ liệu phụ thuộc như moving-block bootstrap và phân tích stationary bootstrap của Politis và Romano. Trong phương pháp này, một khối được lấy mẫu thường tiếp tục sang quan sát thời gian kế tiếp; khi khởi động lại ngẫu nhiên, khối bắt đầu từ một ngày được chọn khác. Vì vậy độ dài khối có phân phối hình học với giá trị trung bình được chọn. Với giả định và cách tinh chỉnh phù hợp, phương pháp giữ các chuỗi ngắn hạn tốt hơn lấy mẫu i.i.d. Xem bài báo về stationary bootstrap của Politis và Romano.

Với một nhóm chiến lược, lấy một chuỗi chỉ số thời gian dùng chung rồi áp dụng cho toàn bộ vector hàng (d[1,t], …, d[K,t]). Cách này giữ cả thứ tự thời gian bên trong khối lẫn quan hệ đồng thời giữa các ứng viên. Chọn độ dài khối dựa trên thời hạn chiến lược và chẩn đoán phụ thuộc, đồng thời báo cáo độ nhạy với những lựa chọn hợp lý khác. Nếu quy trình nghiên cứu có ước lượng lại tham số, hãy quyết định bước đó có thuộc mục tiêu suy luận hay không và lặp lại trong từng mẫu nếu cần. Chỉ lấy mẫu lại lợi suất đã fit và cố định có thể điều kiện hóa rồi bỏ mất một phần quy trình.

Ví dụ bootstrap giả định làm thay đổi cách diễn giải

Giả sử nhà nghiên cứu so sánh ba chiến lược với benchmark trong T = 252 ngày giao dịch. Chênh lệch hiệu quả trung bình mỗi ngày sau chi phí là +2.0, +1.0 và −0.5 điểm cơ bản. Trung bình của chiến lược thắng là 2.0 điểm cơ bản, nên thống kê quan sát là √252 × 2.0 bp ≈ 31.75 bp·√ngày giao dịch. Hệ số quy mô này thuộc thống kê kiểm định; đây không phải t-statistic vì không chia cho sai số chuẩn ước lượng.

Giả sử tiếp tục có 9.999 lần lặp stationary bootstrap dùng cùng các ngày được chọn cho cả ba ứng viên. Trong kết quả giả định này, 1.199 giá trị cực đại lặp lại bằng hoặc vượt 31.75. Ước lượng Monte Carlo cộng một là (1 + 1,199)/(9,999 + 1) = 0.12. Một phép kiểm định riêng chỉ cho người thắng có thể giả định cho ra 0.03, nhưng bỏ qua việc tìm kiếm giữa ba ứng viên. p-value Reality Check so sánh cả nhóm và trong ví dụ này không bác bỏ giả thuyết không chung ở ngưỡng 5%.

Các con số được tạo ra để minh họa phép tính, không phải kết quả đo lường thị trường hay kết quả trong bài báo của White. p-value 0.12 không có nghĩa chiến lược có 12% khả năng thua lỗ. Nó cho biết theo bootstrap và cách xây dựng giả thuyết không đã nêu, một giá trị cực đại lớn ít nhất như vậy không đủ hiếm để bác bỏ ở mức đã chọn. Trung bình mẫu cũng không cho biết lợi suất có ý nghĩa kinh tế sau khi tính đến rủi ro, quy mô vốn và tác động khớp lệnh.

Diễn giải p-value đã điều chỉnh là bằng chứng về một nhóm xác định

p-value Reality Check nhỏ là bằng chứng chống lại tuyên bố rằng không thành viên nào trong nhóm được đưa vào vượt benchmark đã chọn về hiệu quả kỳ vọng, theo các giả định kiểm định. Vì giả thuyết không mang tính chung, việc bác bỏ không tự động xác định ứng viên nào có lợi thế bền vững. Người thắng có thể đổi giữa các mẫu, và bằng chứng cho một chiến lược riêng có thể yếu ngay cả khi giả thuyết ở cấp nhóm bị bác bỏ.

p-value lớn có nghĩa chưa thể bác bỏ giả thuyết không, chứ không chứng minh mọi chiến lược tương đương benchmark. Mẫu ngắn, hiệu quả nhiễu, nhóm quá rộng, đo lường kém hoặc công suất thấp có thể giải thích kết quả. p-value cũng không phải xác suất giả thuyết không đúng. Đó là xác suất đuôi theo phân phối tham chiếu phụ thuộc vào tập ứng viên, thước đo hiệu quả, benchmark, thiết kế bootstrap và dữ liệu quan sát.

Câu hỏi của White là so sánh tương đối. Một quy tắc có thể thắng benchmark yếu nhưng vẫn lỗ; quy tắc khác có thể không thắng benchmark mạnh mà vẫn sinh lợi dương. Hãy báo cáo kết quả tuyệt đối và tương đối cùng với độ bất định, vòng quay, drawdown, sức chứa và chi phí thực tế. Bằng chứng thống kê về ưu thế dự báo tương đối và tính khả thi kinh tế của đầu tư là hai đánh giá riêng.

Kiểm tra giả định và giới hạn trước khi tin vào kết quả

Lý thuyết gốc dựa trên các điều kiện chính quy cho quá trình chênh lệch hiệu quả và phân phối giới hạn của nó. Khung của White bao gồm chuỗi thời gian dừng và trộn mạnh; bootstrap phụ thuộc cũng cần chuỗi độ dài khối thích hợp. Trong mẫu hữu hạn, thay đổi chế độ thị trường, đứt gãy cấu trúc, phụ thuộc dài hạn, cú nhảy hiếm và biến động không ổn định có thể khiến phép xấp xỉ stationary đáng nghi ngờ. Block bootstrap giữ được một phần phụ thuộc cục bộ, nhưng không tái tạo chế độ tương lai chưa biết.

Phép kiểm định còn kế thừa sai sót trong dữ liệu và đánh giá chiến lược. Rò rỉ thông tin tương lai, thiên lệch sống sót, dữ liệu được điều chỉnh lại, khớp lệnh phi thực tế, bỏ sót chi phí, xử lý sai sự kiện doanh nghiệp và chọn benchmark sau khi xem kết quả đều có thể làm vô hiệu các chênh lệch. Khi thời gian nắm giữ chồng lấn, lợi suất có thể phụ thuộc ngay từ cấu trúc; đơn vị lấy mẫu và độ dài khối phải thể hiện được điều này. Nếu thước đo cuối cùng phi tuyến như Sharpe ratio, hãy tính lại nó ở mỗi lần lặp thay vì cho rằng bootstrap lợi suất trung bình tự động kiểm định được thước đo đó.

Các cách triển khai Reality Check có thể bảo thủ, nhất là khi một nhóm lớn chứa nhiều lựa chọn thay thế rõ ràng kém. Phân phối cực đại rộng có thể khiến khó bác bỏ ngay cả khi có ứng viên tốt. Kiểm định Superior Predictive Ability của Hansen là phương pháp bootstrap liên quan, xử lý lựa chọn kém theo cách khác; đây không phải phương án thay thế phổ quát và vẫn cần xem xét giả định. Hãy so sánh phương pháp theo câu hỏi nghiên cứu và báo cáo độ nhạy, thay vì chọn cách cho ra kết quả mong muốn.

Dùng cùng kiểm định theo thời gian và các công cụ chọn lọc khác

White’s Reality Check giải quyết câu hỏi liệu một nhóm tìm kiếm đã ghi nhận có chứa ứng viên vượt benchmark sau khi tính đến lựa chọn hay không. Nó không thay thế holdout theo thứ tự thời gian hoặc đánh giá walk-forward của chiến lược đã cố định; cũng không tự xử lý việc chồng lấn nhãn hay rò rỉ. PBO khác ở chỗ tóm tắt tần suất người thắng in-sample xếp dưới trung vị ứng viên trong các phân chia tổ hợp; bài báo PBO gốc định nghĩa phép chẩn đoán rủi ro lựa chọn này. Quy trình false discovery nhắm đến tỷ lệ sai dự kiến trong nhiều kết quả bị bác bỏ. Deflated Sharpe Ratio điều chỉnh đánh giá ý nghĩa dựa trên Sharpe để tính đến lựa chọn và lợi suất không chuẩn. Đọc thêm hướng dẫn về multiple testing và false discovery rate trong tài chính, PBO và CSCV, xác thực walk-forward và purged cross-validation cùng embargo.

Trong một đợt rà soát thực tế, hãy cố định benchmark và định nghĩa hiệu quả, tái dựng nhóm ứng viên thực sự đã dùng, tính chênh lệch ghép cặp theo từng kỳ, chọn và giải thích thiết kế lấy mẫu bảo toàn phụ thuộc, rồi báo cáo thống kê cực đại và xác suất đuôi bootstrap. Sau đó kiểm định quy trình lựa chọn đã cố định trên dữ liệu thời gian về sau, đồng thời đánh giá riêng chi phí và khả năng triển khai. Ứng dụng của Sullivan, Timmermann và White vào quy tắc giao dịch kỹ thuật cho thấy toàn bộ tập quy tắc quan trọng thế nào: kết luận có thể đổi khi suy luận bao gồm toàn bộ quá trình tìm kiếm thay vì chỉ người thắng được báo cáo. Reality Check điều chỉnh một vấn đề chọn lọc cụ thể; nó không chứng nhận backtest sẽ đứng vững khi giao dịch thực tế.

Câu hỏi thường gặp

Q1White’s Reality Check kiểm định điều gì?

Nó kiểm tra liệu ứng viên tốt nhất trong một nhóm tìm kiếm xác định có hiệu quả kỳ vọng cao hơn benchmark được chọn hay không, đồng thời tính đến việc lựa chọn giữa các ứng viên.

Q2p-value Reality Check nhỏ có chứng minh chiến lược sẽ sinh lời không?

Không. Đó là bằng chứng chống lại giả thuyết không chung về việc không có ưu thế trong nhóm, theo benchmark, thước đo, dữ liệu và giả định bootstrap đã chọn. Nó không bảo đảm lợi suất tương lai hoặc lợi nhuận ròng.

Q3Vì sao dùng block bootstrap thay vì lấy mẫu các ngày độc lập?

Các khối có thể giữ lại một phần phụ thuộc chuỗi cục bộ; dùng chung ngày được lấy mẫu cho mọi ứng viên cũng giữ quan hệ đồng thời. Thiết kế khối vẫn phải phù hợp với dữ liệu và câu hỏi nghiên cứu.

Nguồn và tài liệu đọc thêm

Báo lỗi

Chúng tôi sẽ soạn email kèm liên kết bài viết này. Mark chỉ nhận được báo cáo sau khi bạn gửi email

Kiểm tra nhanh

Đọc xong hướng dẫn? Hãy kiểm tra với 3 câu hỏi

Câu hỏi 1 / 3

Câu hỏi 01

Giả thuyết không chung của White có ý nghĩa gì?

Chọn một đáp án để xem giải thích

Bảng thuật ngữ quyền chọn

Định nghĩa rõ ràng về các thuật ngữ cốt lõi, từ call, put và chuỗi quyền chọn đến IV, Greeks, lãi suất mở và max pain

Xem bảng thuật ngữ quyền chọn
Tần suất người thắng backtest tụt dưới trung vị của nhómGiải thích xác suất overfit backtest (PBO) và CSCVTìm hiểu cách kiểm định chéo đối xứng tổ hợp ước tính PBO, chuyển thứ hạng OOS thành logit và vì sao chỉ số này không dự báo khoản lỗ tương laiNghiên cứu định lượngDeflated Sharpe Ratio: kiểm định nhiều lần và lựa chọn backtestTìm hiểu cách Deflated Sharpe Ratio điều chỉnh bằng chứng thống kê của Sharpe sau khi chọn chiến lược, xét đến kiểm định nhiều lần và lợi suất phi chuẩn, qua ví dụ giả định cùng các giới hạn rõ ràng.Chọn phần lịch sử mà mô hình tài chính dùng để họcCửa sổ mở rộng và cửa sổ trượt trong kiểm định walk-forwardSo sánh cửa sổ huấn luyện mở rộng và cửa sổ trượt có độ dài cố định, tách kiểm định khỏi tập kiểm tra cuối và chọn quy tắc mà không dùng kết quả tương lai.Kiểm định mô hình chuỗi thời gian tài chínhPurged cross-validation và embargo: ngăn rò rỉ nhãn trong mô hình giao dịchTìm hiểu cách xử lý các khoảng nhãn lợi suất tương lai bị chồng lấn trong chuỗi thời gian tài chính, và phân biệt purging, embargo, walk-forward, TimeSeriesSplit cùng CPCV.Đánh giá dự báo hướngKiểm định Pesaran–Timmermann: Dự báo hướng có thêm thông tin không?Tìm hiểu cách kiểm định Pesaran–Timmermann so sánh tỷ lệ dự báo đúng hướng với mức nền dựa trên tỷ lệ tăng thực tế và tỷ lệ dự báo tăng, cũng như cách phụ thuộc chuỗi làm thay đổi suy luận thống kê.