Machine Learning — Học máy
Mọi chỉ số phân loại từ bốn con số. Mặc định ở đây là một bài toán mất cân bằng để thấy ngay vì sao accuracy gây hiểu nhầm.
Cùng một ma trận, tám cách đọc. Khoảng cách giữa cột Accuracy và cột Baseline mới là phần mô hình thực sự đóng góp; MCC là cột duy nhất dùng cả bốn ô.
Mô hình đang THUA quy tắc 'luôn trả lời số đông' trên chính chỉ số mà nhiều báo cáo đem đi khoe.
Đây là con số người vận hành cảm nhận được, vì mỗi lần báo sai là một lần mất công kiểm tra. Nâng ngưỡng sẽ tăng precision và hạ recall — không có cách nào tăng cả hai.
Chi phí của một ca bỏ sót và của một báo động giả gần như không bao giờ bằng nhau. Ngưỡng phải chọn theo tỷ lệ chi phí đó, không phải theo F1 tối ưu.
MCC dùng cả bốn ô nên nó không thể được nâng bằng cách đoán số đông. Đây là chỉ số nên đưa vào báo cáo khi dữ liệu mất cân bằng, thay cho accuracy và cả F1 (F1 bỏ qua ô TN).
| Accuracy | 0.9934 — gây hiểu nhầm |
| Balanced accuracy | 0.9060 |
| Specificity | 0.9938 |
| Tỷ lệ dương tính thật | 0.22% |
| Baseline luôn đoán số đông | 0.9978 accuracy |
Cùng một ma trận, tám cách đọc. Khoảng cách giữa cột Accuracy và cột Baseline mới là phần mô hình thực sự đóng góp; MCC là cột duy nhất dùng cả bốn ô.
Cùng tổng hàng và tổng cột, chỉ bỏ liên hệ giữa dự đoán và sự thật. Ô TN bị bỏ khỏi hình vì thang đo (99,160 thực tế so với 98,982 kỳ vọng) làm ba cột kia biến mất — và chính nó là thứ thổi phồng accuracy.
0 nghĩa là dự đoán không liên quan gì tới sự thật, kể cả khi accuracy trông rất đẹp. Các mốc 0,3 và 0,6 là quy ước đọc chứ không phải kiểm định.
| Dự đoán dương | Dự đoán âm | Tổng | |
|---|---|---|---|
| Thực tế dương | 180 (TP) | 40 (FN) | 220 |
| Thực tế âm | 620 (FP) | 99,160 (TN) | 99,780 |
| Tổng | 800 | 99,200 | 100,000 |
| Accuracy | 0.9934 — gây hiểu nhầm |
| Balanced accuracy | 0.9060 |
| Specificity | 0.9938 |
| Tỷ lệ dương tính thật | 0.22% |
| Baseline luôn đoán số đông | 0.9978 accuracy |
MCC = (TP·TN − FP·FN)/√((TP+FP)(TP+FN)(TN+FP)(TN+FN))
Đây là công thức thật mà mã nguồn chạy, không phải mô tả gần đúng.
API tại /api/v1/tools/confusion gọi đúng hàm
này, nên kết quả trên trang và qua API không thể lệch nhau.
Machine learning tìm hàm ánh xạ từ đặc trưng sang mục tiêu bằng cách tối ưu trên dữ liệu. Điều quyết định thành bại hiếm khi là thuật toán — nó là chất lượng nhãn, tính đại diện của dữ liệu, và việc quy trình đánh giá có mô phỏng đúng điều kiện triển khai hay không.
| Chỉ số phù hợp bài toán | AUC, RMSE, F1 — chọn theo chi phí sai lầm |
| Chênh lệch train/test | khoảng cách lớn là overfit |
| Hiệu suất theo phân nhóm | kiểm tra công bằng và điểm yếu |
Phần quan trọng nhất của trang này. Một phương pháp được mô tả mà không nói chỗ nó hỏng là phiên bản quảng cáo của phương pháp đó.
Chưa có mô hình nào gắn riêng cho chủ đề này. Đây là những mô hình của cả ngành — liên quan ở cấp ngành, không phải cấp chủ đề.
Cơ chế attention, nắm quan hệ xa.
Tích chập nhân quả với receptive field kiểm soát được.
Sharpe sau khi phạt vì số lần thử và độ lệch/nhọn của đuôi.
Tỉ lệ cấu hình thắng in-sample lại xếp dưới trung vị ngoài mẫu.
Machine learning tìm hàm ánh xạ từ đặc trưng sang mục tiêu bằng cách tối ưu trên dữ liệu. Điều quyết định thành bại hiếm khi là thuật toán — nó là chất lượng nhãn, tính đại diện của dữ liệu, và việc quy trình đánh giá có mô phỏng đúng điều kiện triển khai hay không.
1. Định nghĩa bài toán và chỉ số thành công gắn với quyết định kinh doanh. 2. Xây baseline đơn giản trước — thường đã đủ tốt. 3. Chia dữ liệu theo cách phản ánh cách mô hình sẽ được dùng. 4. Điều chỉnh siêu tham số trên tập validation, chỉ chạm tập test một lần. 5. Theo dõi trôi dữ liệu sau khi triển khai.
Rò rỉ dữ liệu là lỗi phổ biến và nguy hiểm nhất; nó luôn làm kết quả đẹp lên nên hiếm khi bị nghi ngờ. Chọn mô hình theo tập test rồi báo cáo chính con số đó — tập test đã trở thành tập validation. Tối ưu chỉ số kỹ thuật không gắn với giá trị kinh doanh.
Chỉ số phù hợp bài toán — AUC, RMSE, F1 — chọn theo chi phí sai lầm; Chênh lệch train/test — khoảng cách lớn là overfit; Hiệu suất theo phân nhóm — kiểm tra công bằng và điểm yếu.
Đang thử nghiệm: chạy được nhưng phương pháp chưa kiểm định đầu-cuối, nên đừng dựa vào nó để ra quyết định tiền thật.