Quy trình quant tiêu chuẩn dừng ở train/test/walk-forward. Ba thứ đó không phát hiện được loại sai lầm phổ biến nhất: bạn thử nhiều cấu hình rồi chọn cái may nhất.
Người ta dò tham số xong xoá hết dấu vết, rồi
khai n_trials = 1 cho Deflated Sharpe. Đó là cách một
backtest tầm thường trở thành "DSR 0.99".
Mỗi bộ tham số, mỗi khung thời gian, mỗi bộ lọc bật/tắt, mỗi symbol đã thử rồi bỏ. Thuật toán di truyền thì mỗi thế hệ là hàng trăm lần thử.
Xác suất Sharpe không phải do may mắn, sau khi phạt vì số lần thử và độ lệch/nhọn của đuôi. Trên 0.95 mới đủ tin; khoảng 0.5 là không phân biệt được với tung xu.
Tỉ lệ số lần cấu hình thắng in-sample lại xếp dưới trung vị ngoài mẫu. Nó kiểm định chính quy trình chọn tham số của bạn, không phải chiến lược.
Purged cross-validation với embargo, và test tự động: sửa mọi nến sau thời điểm t thì đặc trưng tại t phải không đổi.