Giải thích xác suất overfit backtest (PBO) và CSCV
Tìm hiểu cách kiểm định chéo đối xứng tổ hợp ước tính PBO, chuyển thứ hạng OOS thành logit và vì sao chỉ số này không dự báo khoản lỗ tương lai
Trong hướng dẫn nàyPBO đo quy trình lựa chọn, không đo riêng một chiến lược
Tóm tắt ngắn
Xác suất overfit backtest (PBO) cho biết chiến lược được chọn là tốt nhất trong mẫu (IS) xếp dưới trung vị của nhóm ứng viên ngoài mẫu (OOS) thường xuyên đến mức nào. Kiểm định chéo đối xứng tổ hợp (CSCV) ước tính tần suất này bằng cách liên tục dùng một nửa số khối thời gian bằng nhau để chọn và nửa còn lại để đánh giá. PBO là phép chẩn đoán phụ thuộc vào một quy trình tìm kiếm, thước đo và ma trận hiệu suất lịch sử cụ thể; đây không phải xác suất một chiến lược đang giao dịch sẽ thua lỗ.
PBO đo quy trình lựa chọn, không đo riêng một chiến lược
Nhóm nghiên cứu có thể thử nhiều cửa sổ nhìn lại, ngưỡng vào lệnh, thời gian nắm giữ, universe, giả định chi phí và ràng buộc danh mục, rồi giữ biến thể có điểm backtest cao nhất. Kết quả được chọn đã có nhiều cơ hội để khớp với đặc điểm riêng của mẫu. PBO tóm tắt một hệ quả của quá trình tìm kiếm: trong các cách chia IS/OOS đã định, người thắng IS nằm dưới trung vị OOS của cùng nhóm ứng viên thường xuyên đến mức nào?
Bailey, Borwein, López de Prado và Zhu đề xuất PBO làm khuôn khổ đánh giá rủi ro chọn chiến lược, đồng thời đưa ra CSCV như một cách ước tính. Định nghĩa tập trung vào quy trình chọn giữa các cấu hình đã thử, chứ không chỉ hỏi một phương trình dự báo đơn lẻ có quá nhiều tham số hay không. Trong mỗi lần chia, IS là tập con dùng để chọn ứng viên; giai đoạn này không nhất thiết trùng với giai đoạn ước lượng mọi mô hình nền. Xem thiết lập chính thức trong bài báo PBO gốc.
Một chiến lược có thể có Sharpe cao trên toàn bộ mẫu mà vẫn chỉ là ứng viên may mắn nhất trong một nhóm nghiên cứu yếu. Ngược lại, quy trình chọn có thể thường tìm ra ứng viên xếp trên trung vị OOS dù lợi suất của cả nhóm đều âm. PBO so sánh thứ hạng tương đối trong nhóm được cung cấp; bản thân nó không kiểm định lợi suất kỳ vọng có dương hay không.
PBO trả lời câu hỏi khác với các công cụ kiểm định khác
Holdout theo thời gian hoặc kiểm định walk-forward xem quy trình nghiên cứu đã xác định hoạt động ra sao trên dữ liệu ở thời điểm sau mà các quyết định trước đó chưa sử dụng. Purged cross-validation xử lý phần chồng lấn giữa khoảng thời gian của nhãn huấn luyện và kết quả kiểm tra; embargo có thể thêm khoảng đệm riêng nếu có căn cứ. Chỉ riêng các biện pháp đó không đo được người thắng của một cuộc tìm kiếm chiến lược rộng thường xuyên rơi dưới trung vị ứng viên OOS đến mức nào. Xem hướng dẫn về purged cross-validation và embargo.
PBO cũng khác với điều chỉnh kiểm định nhiều lần. White’s Reality Check dùng bootstrap để kiểm tra quy tắc tốt nhất trong một nhóm có vượt chuẩn đối chiếu sau khi tính đến data snooping hay không. Deflated Sharpe Ratio điều chỉnh phép tính ý nghĩa dựa trên Sharpe để xét ảnh hưởng của lựa chọn và lợi suất không chuẩn. PBO thay vào đó tóm tắt thứ hạng OOS của ứng viên được chọn trong IS qua nhiều lần chia. Các phương pháp dùng thống kê và giả định khác nhau nên không tự động thay thế nhau. Xem bài báo Reality Check gốc của White và nghiên cứu của Bailey cùng López de Prado về Deflated Sharpe Ratio.
Bắt đầu với ma trận hiệu suất đầy đủ và đồng bộ
Gọi M là ma trận T nhân N. Mỗi cột trong N cột đại diện cho một chiến lược hoặc cấu hình ứng viên; mỗi hàng trong T hàng là cùng một khoảng quan sát cho mọi ứng viên. Một hàng có thể chứa lợi suất ngày sau các chi phí giao dịch liên quan. Nếu tần suất giao dịch khác nhau, hãy xác định chỉ số thời gian chung trước rồi tổng hợp hiệu suất nhất quán. So sánh lợi suất ngày của chiến lược này với tổng lợi suất tháng của chiến lược khác theo từng hàng không tạo ra ma trận có ý nghĩa.
Tập ứng viên phải phản ánh cơ hội lựa chọn thực tế: biến thể bị loại trong grid search, chỉnh sửa thủ công sau khi xem kết quả, universe thay thế và các quy tắc ảnh hưởng đến lựa chọn cuối. PBO chỉ đánh giá được ứng viên và lịch sử hiệu suất được cung cấp. Nếu nhóm chỉ lưu các phương án cuối cùng sau một cuộc tìm kiếm rộng hơn nhiều, ước tính sẽ đánh giá thấp quy mô tìm kiếm thật.
Dùng cùng quy ước lợi suất, tiền tệ, cách xử lý đòn bẩy và tiêu chí hiệu suất cho mọi ứng viên. Nếu chọn theo Sharpe ròng, hãy đưa phí, spread, chi phí tài trợ, funding, chi phí vay và giả định khớp lệnh phù hợp vào từng cột trước khi tính. Thước đo cũng phải tính được trên các tập con ở bước sau. Bài báo gốc yêu cầu các hàng được đồng bộ và thước đo ước tính được trên mỗi mẫu con; nếu tần suất giao dịch khác nhau, bài báo khuyến nghị căn chỉnh chuỗi theo chỉ số chung.
CSCV ghép mỗi nửa mẫu với phần bù của nó
Chọn số chẵn S khối thời gian rời nhau, có cùng kích thước và giữ thứ tự thời gian bên trong mỗi khối. Với mỗi cách chọn S/2 khối, ghép chúng thành tập trong mẫu (IS), còn S/2 khối kia là tập ngoài mẫu (OOS). Với thước đo phụ thuộc đường đi, giữ thứ tự gốc của các khối đã chọn và ghi rõ việc nối khối có ý nghĩa gì đối với thước đo.
Số cách gán IS là C(S,S/2). Với bốn khối A, B, C và D, có sáu cách: AB, AC, AD, BC, BD và CD; mỗi phần bù cũng được tính thành một cách riêng. Khi S = 16, C(16,8) = 12.870. Đây là các tổ hợp xác định từ cùng một lịch sử, không phải 12.870 thí nghiệm thị trường độc lập.
“Đối xứng” nghĩa là phần bù của một tổ hợp được tái sử dụng làm tập chọn trong tổ hợp khác: ở một lần chia AB là IS và CD là OOS, ở lần khác thì ngược lại. “Tổ hợp” nghĩa là liệt kê mọi cách chọn một nửa số khối thay vì rút một lần chia ngẫu nhiên. Quy trình này không phát lại theo thứ tự thời gian. Tập được chọn có thể gồm khối đầu và cuối, còn phần bù có khối ở giữa; do đó OOS không có nghĩa là “tương lai sau giai đoạn huấn luyện”.

Chuyển thứ hạng OOS của ứng viên được chọn thành logit
Với lần chia c, áp dụng quy tắc chọn của nghiên cứu trên tập con IS và chọn ứng viên tốt nhất n*(c). Sau đó chấm điểm cả N ứng viên trên tập con OOS bổ sung bằng cùng thước đo. Gọi r(c) là thứ hạng OOS của ứng viên được chọn: 1 là thấp nhất, N là cao nhất. Hãy định trước cách xử lý đồng hạng và dùng thống nhất trong mọi lần chia.
Chuyển thứ hạng thành thứ hạng tương đối: ω(c) = r(c)/(N+1). Mẫu số N+1 giữ giá trị nằm giữa 0 và 1 ngay cả ở thứ hạng thấp nhất hoặc cao nhất. Logit là λ(c) = ln(ω(c)/(1−ω(c))). Giá trị âm khi ứng viên được chọn xếp dưới trung vị OOS, bằng 0 tại trung vị và dương ở phía trên. PBO ước tính là tỷ lệ các cách gán CSCV có λ(c) ≤ 0.
Một giá trị PBO tóm tắt tần suất người thắng IS đạt nhiều nhất là trung vị OOS. Toàn bộ phân phối logit còn cho biết các ứng viên được chọn thường ở gần giữa, hay thường tụt xuống thấp, hoặc có xu hướng xếp trên trung vị. Logit là phép biến đổi thứ hạng tương đối, không phải xác suất của một giao dịch thực tế hay dự báo lợi suất tương lai đã hiệu chỉnh.
Ví dụ giả định với bốn khối cho PBO là 66,7%
Giả sử có bốn khối lịch sử bằng nhau và bốn quy tắc ứng viên R1 đến R4. Bảng liệt kê sáu cách gán IS. Cột thứ hạng OOS cho biết quy tắc được chọn trong IS đứng ở đâu trong bốn quy tắc trên các khối phần bù. Tất cả giá trị đều giả định, chỉ nhằm minh họa phép tính.
| Khối IS | Người thắng IS | Thứ hạng OOS r | Thứ hạng tương đối ω = r/5 | Logit ln(ω/(1−ω)) | Bằng hoặc dưới trung vị? |
|---|---|---|---|---|---|
| AB | R1 | 1 | 0,20 | −1,386 | Có |
| AC | R3 | 4 | 0,80 | +1,386 | Không |
| AD | R2 | 2 | 0,40 | −0,405 | Có |
| BC | R1 | 1 | 0,20 | −1,386 | Có |
| BD | R4 | 3 | 0,60 | +0,405 | Không |
| CD | R3 | 2 | 0,40 | −0,405 | Có |
Bốn trong sáu quy tắc được chọn có thứ hạng tương đối OOS không lớn hơn một nửa. Vì vậy PBO thực nghiệm là 4/6 ≈ 0,667, tức khoảng 66,7%. Chẳng hạn, hạng 2 cho ω = 2/(4+1) = 0,4 và λ = ln(0,4/0,6) ≈ −0,405. Hạng 3 cho ω = 0,6 và logit ngược dấu, khoảng +0,405.
Điều này không có nghĩa xác suất mất tiền tháng tới là 66,7%. Trong ma trận giả định và quy ước thứ hạng này, người thắng IS nằm ở hoặc dưới trung vị ứng viên OOS trong bốn trên sáu lần chia. Hai phương án thắng còn lại vẫn có thể có lợi suất OOS tuyệt đối âm dù xếp trên các phương án cùng nhóm.
Xem PBO là phép chẩn đoán có điều kiện và có giới hạn
PBO phụ thuộc vào nhóm ứng viên, ma trận hiệu suất quan sát được, thước đo chọn, các khối thời gian và quy tắc xử lý đồng hạng. Thử nghiệm không được ghi lại nằm ngoài phạm vi đánh giá. “Không phụ thuộc mô hình” nghĩa là có thể tính từ lịch sử hiệu suất của ứng viên mà không cần biết phương trình dự báo; không có nghĩa là không phụ thuộc lựa chọn thiết kế, chất lượng dữ liệu hay giả định.
CSCV kết hợp các khối thành tập con đối xứng cùng kích thước, nhưng tập OOS thường không phải một giai đoạn liên tục ở phía sau theo thời gian. Ghép lại khối có thể làm gián đoạn phụ thuộc dài hạn, mùa vụ hoặc thứ tự các chế độ kinh tế. S quyết định cả số tổ hợp lẫn thời lượng mỗi khối đại diện; hãy chọn và ghi rõ S theo các chân trời cùng cấu trúc liên quan của chiến lược. Nhiều tổ hợp không tạo ra số lượng quan sát độc lập tương ứng vì các khối được dùng lại.
Thống kê này kế thừa thiên lệch trong lợi suất nguồn: survivorship bias, dữ liệu đã sửa đổi, đặc trưng chưa có tại thời điểm đó, khớp lệnh phi thực tế, chi phí bị bỏ qua hoặc universe được chọn sau khi biết kết quả đều có thể làm sai lệch lịch sử mọi ứng viên. CSCV không tự động loại bỏ khoảng nhãn chồng lấn, không nhất thiết ước lượng lại toàn bộ pipeline mô hình ở mỗi lần chia và không ngăn rò rỉ thông tin qua tiền xử lý. Hãy chủ động triển khai các bước này theo câu hỏi nghiên cứu. Để xem biện pháp theo trình tự thời gian, đọc tài liệu chính thức về TimeSeriesSplit và hướng dẫn purged validation.
Các thước đo phụ thuộc đường đi như drawdown tối đa cần được xử lý cẩn thận hơn: nối các khối không liền kề làm thay đổi đường đi và có thể đổi cả thước đo. Bài báo PBO lưu ý thứ tự quan sát quan trọng với một số thước đo, dù không như vậy với Sharpe. Trước khi diễn giải thứ hạng, hãy nêu cách xử lý thứ tự, khoảng trống, quan sát thiếu và lãi kép.
Báo cáo PBO cùng bằng chứng theo thời gian và nhật ký tìm kiếm đầy đủ
Trước khi tính, lưu danh mục ứng viên, mọi điều chỉnh sau khi xem kết quả, ma trận hiệu suất, thước đo lựa chọn và quy tắc đồng hạng. Báo cáo T, N, S, cách tạo khối, C(S,S/2), quy ước thứ hạng OOS, PBO ước tính và phân phối logit. Bổ sung hiệu suất OOS tuyệt đối, chi phí, turnover, drawdown và số ứng viên thua lỗ: chỉ thứ hạng không cho biết toàn bộ ứng viên có yếu hay không.
Dùng walk-forward hoặc holdout theo thời gian thực sự để đánh giá quy trình nghiên cứu đã cố định trên dữ liệu sau đó. Giữ kín giai đoạn cuối khi chọn mô hình và ngưỡng; xem đi xem lại sẽ biến nó thành một tập chọn khác. Công cụ theo thứ tự thời gian như TimeSeriesSplit tạo các fold theo giả định đã công bố, trong khi PBO đo một đặc tính thứ hạng khác của nhóm ứng viên đã tìm kiếm.
Vì thế, PBO bổ trợ chứ không thay thế kiểm soát nhãn chồng lấn, phân tích kiểm định nhiều lần, mô hình khớp lệnh thực tế, đánh giá tiến cứu và giám sát giao dịch thật. Đọc thêm kiểm định nhiều lần và tỷ lệ phát hiện sai trong tài chính và điều chỉnh Sharpe khi có tự tương quan chuỗi. Không thống kê đơn lẻ nào biến thứ hạng lịch sử thành bằng chứng về lợi thế giao dịch bền vững.
Câu hỏi thường gặp
Q1PBO có nghĩa chiến lược có đúng xác suất đó sẽ mất tiền không?
Không. PBO ước tính tần suất ứng viên được chọn trong IS xếp ở hoặc dưới trung vị OOS trong các lần chia xác định. Đây không phải xác suất lỗ trong tương lai hay dự báo lợi suất thực tế đã hiệu chỉnh.
Q2CSCV có giống kiểm định walk-forward không?
Không. CSCV ghép mỗi nửa khối với phần bù nên OOS có thể chứa cả khối sớm lẫn muộn. Walk-forward giữ dữ liệu huấn luyện ở trước từng giai đoạn kiểm tra sau đó để xem xét một đường đi theo thời gian gần với triển khai.
Q3PBO thấp có chứng minh chiến lược được chọn có lợi thế không?
Không. Phương án thắng có thể vượt một nhóm yếu nhưng vẫn lỗ nếu xét tuyệt đối. Hãy đánh giá riêng lợi suất ròng, độ bất định, chi phí, rò rỉ và hiệu suất trên dữ liệu thực sự ở thời điểm sau.
Nguồn và tài liệu đọc thêm
Báo lỗi
Chúng tôi sẽ soạn email kèm liên kết bài viết này. Mark chỉ nhận được báo cáo sau khi bạn gửi email
Kiểm tra nhanh
Đọc xong hướng dẫn? Hãy kiểm tra với 3 câu hỏi
Câu hỏi 01
Sự kiện nào góp phần vào ước tính PBO?
Chọn một đáp án để xem giải thích