Fraud Detection — Phát hiện gian lận
Tải log giao dịch, số đo hay chỉ số vận hành lên và nhận danh sách bản ghi lệch khỏi phần còn lại, kèm số dòng để tra ngược.
Quy tắc đang dùng: |z hiệu chỉnh| > 3.5 quanh trung vị 134.5000. Điểm bị gắn cờ nằm rải rác hay tụm lại theo thời gian là hai câu chuyện khác nhau — tụm lại thường là sự cố đo đạc.
Trên 5% thường nghĩa là ngưỡng quá nhạy hoặc dữ liệu vốn không có một tâm duy nhất, chứ không phải có thật nhiều lỗi.
Z-score dùng trung bình và độ lệch chuẩn — cả hai đều bị chính ngoại lai kéo đi, nên nó bỏ sót khi có nhiều ngoại lai cùng lúc. MAD bền hơn vì dựa trên trung vị.
Kiểm tra thủ công vài dòng này trước khi loại bất cứ thứ gì. Bất thường có thể là biến cố thật, và loại nó đi là làm hỏng dữ liệu chứ không phải làm sạch.
| Quy tắc | |z hiệu chỉnh| > 3.5 quanh trung vị 134.5000 |
| Các giá trị lệch nhất | dòng 15: 2,450.0000 · dòng 7: 1,890.0000 |
| Trung vị | 134.5000 |
| Gợi ý ngưỡng | z: 3 · MAD: 3.5 · IQR: 1.5 (chuẩn) hoặc 3 (chặt) |
| Nếu tỷ lệ > 5% | ngưỡng đang quá nhạy, hoặc dữ liệu vốn đa đỉnh |
Quy tắc đang dùng: |z hiệu chỉnh| > 3.5 quanh trung vị 134.5000. Điểm bị gắn cờ nằm rải rác hay tụm lại theo thời gian là hai câu chuyện khác nhau — tụm lại thường là sự cố đo đạc.
Dữ liệu hai đỉnh sẽ khiến mọi phương pháp dựa trên một tâm duy nhất gắn cờ nhầm cả một cụm hợp lệ.
| Quy tắc | |z hiệu chỉnh| > 3.5 quanh trung vị 134.5000 |
| Các giá trị lệch nhất | dòng 15: 2,450.0000 · dòng 7: 1,890.0000 |
| Trung vị | 134.5000 |
| Gợi ý ngưỡng | z: 3 · MAD: 3.5 · IQR: 1.5 (chuẩn) hoặc 3 (chặt) |
| Nếu tỷ lệ > 5% | ngưỡng đang quá nhạy, hoặc dữ liệu vốn đa đỉnh |
z hiệu chỉnh = 0.6745·(x − trung vị)/MAD
Đây là công thức thật mà mã nguồn chạy, không phải mô tả gần đúng.
API tại /api/v1/tools/outlier-scan gọi đúng hàm
này, nên kết quả trên trang và qua API không thể lệch nhau.
1.234.567 lẫn 1.234,56.Phát hiện gian lận giao dịch là bài toán mất cân bằng cực đoan: gian lận thường dưới 0.1% số giao dịch. Chỉ số accuracy hoàn toàn vô nghĩa ở đây — một mô hình luôn nói 'không gian lận' đạt 99.9%.
| Precision @ k | trong k cảnh báo hàng đầu có bao nhiêu là thật |
| Recall trên giá trị tiền | bắt được bao nhiêu phần trăm tổng thiệt hại, quan trọng hơn số vụ |
| Tỷ lệ báo động giả | chi phí thật là khách hàng bị chặn nhầm |
Phần quan trọng nhất của trang này. Một phương pháp được mô tả mà không nói chỗ nó hỏng là phiên bản quảng cáo của phương pháp đó.
Chưa có mô hình nào gắn riêng cho chủ đề này. Đây là những mô hình của cả ngành — liên quan ở cấp ngành, không phải cấp chủ đề.
Phát hiện gian lận giao dịch là bài toán mất cân bằng cực đoan: gian lận thường dưới 0.1% số giao dịch. Chỉ số accuracy hoàn toàn vô nghĩa ở đây — một mô hình luôn nói 'không gian lận' đạt 99.9%.
1. Xây đặc trưng theo cửa sổ thời gian: số giao dịch 1 giờ qua, độ lệch so với hành vi thường ngày, khoảng cách địa lý so với giao dịch trước. 2. Kết hợp luật cứng (chặn ngay) với mô hình xác suất (xếp hạng để con người rà). 3. Chọn ngưỡng theo năng lực đội rà soát, không theo F1 tối ưu. 4. Cập nhật liên tục — kẻ gian thích nghi nhanh hơn mọi ngành khác.
Tối ưu theo số vụ thay vì theo giá trị tiền. Một vụ 500 triệu quan trọng hơn năm vụ 2 triệu. Bỏ qua độ trễ nhãn: một giao dịch chỉ được xác nhận là gian lận sau vài tuần, nên nhãn của tháng gần nhất luôn thiếu. Concept drift nhanh — mô hình huấn luyện sáu tháng trước có thể đã lỗi thời hoàn toàn.
Precision @ k — trong k cảnh báo hàng đầu có bao nhiêu là thật; Recall trên giá trị tiền — bắt được bao nhiêu phần trăm tổng thiệt hại, quan trọng hơn số vụ; Tỷ lệ báo động giả — chi phí thật là khách hàng bị chặn nhầm.
Chưa xây dựng. Mục này hiện là điều hướng và tài liệu tham chiếu; chúng tôi không gắn nhãn 'live' cho thứ chưa chạy.