Banking hoạt động

Phát hiện gian lận giao dịch

Fraud Detection — Phát hiện gian lận

Đã chạy được. Mục này có công cụ tính toán thật trên nền tảng, không phải mô tả lộ trình.

Quét bất thường từ file z-score, MAD bền vững hoặc IQR

Tải log giao dịch, số đo hay chỉ số vận hành lên và nhận danh sách bản ghi lệch khỏi phần còn lại, kèm số dòng để tra ngược.

Đang chạy trên dữ liệu mẫu, không phải dữ liệu của bạn. Các ô còn nguyên mẫu dựng sẵn: Dữ liệu (dán hoặc tải CSV). Chọn nguồn dữ liệu khác ở cột bên trái rồi chạy lại để có kết quả của riêng bạn.
Số bất thường 2
Tỷ lệ 10.00%
Trên tổng 20 bản ghi
Phương pháp |z hiệu chỉnh| > 3.5 quanh trung vị 134.5000
① Nguồn dữ liệu

Nhận dấu phẩy, chấm phẩy hoặc tab; tự nhận dòng tiêu đề; hiểu cả 1.234.567 lẫn 1.234,56.

Chỉ tải http/https tới địa chỉ công khai; địa chỉ nội bộ bị từ chối.

② Tham số
1.06.0

Giá trị mặc định là ví dụ chạy được — bấm Tính ngay để xem kết quả, rồi thay dữ liệu của bạn vào.

Chuỗi dữ liệu và các điểm bị gắn cờ

Giá trịBất thường
Chuỗi dữ liệu và các điểm bị gắn cờ2,7301,767803.5-159.6135791113151719

Quy tắc đang dùng: |z hiệu chỉnh| > 3.5 quanh trung vị 134.5000. Điểm bị gắn cờ nằm rải rác hay tụm lại theo thời gian là hai câu chuyện khác nhau — tụm lại thường là sự cố đo đạc.

Diễn giải nhanh

2 bất thường trên 20 bản ghi (10.00%)

Trên 5% thường nghĩa là ngưỡng quá nhạy hoặc dữ liệu vốn không có một tâm duy nhất, chứ không phải có thật nhiều lỗi.

Quy tắc: |z hiệu chỉnh| > 3.5 quanh trung vị 134.5000

Z-score dùng trung bình và độ lệch chuẩn — cả hai đều bị chính ngoại lai kéo đi, nên nó bỏ sót khi có nhiều ngoại lai cùng lúc. MAD bền hơn vì dựa trên trung vị.

Lệch nhất: dòng 15, dòng 7

Kiểm tra thủ công vài dòng này trước khi loại bất cứ thứ gì. Bất thường có thể là biến cố thật, và loại nó đi là làm hỏng dữ liệu chứ không phải làm sạch.

Khi nào con số này sai: 'Bất thường' không đồng nghĩa 'có vấn đề'. Z-score dùng trung bình và độ lệch chuẩn, mà cả hai đều bị chính ngoại lai kéo đi — với dữ liệu bẩn hãy dùng phương pháp MAD, nó bền hơn nhiều.

Chi tiết

Quy tắc |z hiệu chỉnh| > 3.5 quanh trung vị 134.5000
Các giá trị lệch nhất dòng 15: 2,450.0000 · dòng 7: 1,890.0000
Trung vị 134.5000
Gợi ý ngưỡng z: 3 · MAD: 3.5 · IQR: 1.5 (chuẩn) hoặc 3 (chặt)
Nếu tỷ lệ > 5% ngưỡng đang quá nhạy, hoặc dữ liệu vốn đa đỉnh

Chuỗi dữ liệu và các điểm bị gắn cờ

Giá trịBất thường
Chuỗi dữ liệu và các điểm bị gắn cờ2,7301,767803.5-159.6135791113151719

Quy tắc đang dùng: |z hiệu chỉnh| > 3.5 quanh trung vị 134.5000. Điểm bị gắn cờ nằm rải rác hay tụm lại theo thời gian là hai câu chuyện khác nhau — tụm lại thường là sự cố đo đạc.

Phân phối giá trị

Phân phối giá trị20.1613.446.720173: 18279: 0385: 0491: 0597: 0702: 0808: 0914: 01.02e+03: 01.13e+03: 01.23e+03: 01.34e+03: 01.44e+03: 01.55e+03: 01.66e+03: 01.76e+03: 01.87e+03: 11.97e+03: 02.08e+03: 02.19e+03: 02.29e+03: 02.4e+03: 11734918081.13e+031.44e+031.76e+032.08e+032.4e+03

Dữ liệu hai đỉnh sẽ khiến mọi phương pháp dựa trên một tâm duy nhất gắn cờ nhầm cả một cụm hợp lệ.

Toàn bộ chỉ số

Quy tắc |z hiệu chỉnh| > 3.5 quanh trung vị 134.5000
Các giá trị lệch nhất dòng 15: 2,450.0000 · dòng 7: 1,890.0000
Trung vị 134.5000
Gợi ý ngưỡng z: 3 · MAD: 3.5 · IQR: 1.5 (chuẩn) hoặc 3 (chặt)
Nếu tỷ lệ > 5% ngưỡng đang quá nhạy, hoặc dữ liệu vốn đa đỉnh

Công thức đang dùng

z hiệu chỉnh = 0.6745·(x − trung vị)/MAD

Đây là công thức thật mà mã nguồn chạy, không phải mô tả gần đúng. API tại /api/v1/tools/outlier-scan gọi đúng hàm này, nên kết quả trên trang và qua API không thể lệch nhau.

Cách dùng

  1. Điền tham số ở cột trái. Mọi ô đã có sẵn giá trị ví dụ chạy được, nên bạn có thể bấm Tính ngay trước rồi sửa sau.
  2. Với ô dữ liệu: dán vài chục dòng để thử, hoặc tải file CSV/TXT lên để chạy thật. File tối đa 32 MB, 200.000 dòng; bộ đọc nhận dấu phẩy, chấm phẩy hoặc tab, tự nhận dòng tiêu đề, và hiểu cả 1.234.567 lẫn 1.234,56.
  3. Đọc thẻ số ở trên cùng, rồi mục Diễn giải nhanh để biết con số đó nói gì.
  4. Đọc dòng “Khi nào con số này sai” trước khi dùng kết quả để quyết định — đó là giả định vỡ đầu tiên.
Giới hạn chung. Công cụ này tính đúng công thức của nó trên dữ liệu bạn đưa vào. Nó không kiểm tra dữ liệu của bạn có phù hợp với giả định của phương pháp hay không — phần đó vẫn là việc của người dùng, và mục “sai ở đâu” bên dưới trang liệt kê các chỗ hỏng thường gặp.

Phát hiện gian lận giao dịch là gì

Phát hiện gian lận giao dịch là bài toán mất cân bằng cực đoan: gian lận thường dưới 0.1% số giao dịch. Chỉ số accuracy hoàn toàn vô nghĩa ở đây — một mô hình luôn nói 'không gian lận' đạt 99.9%.

Làm thế nào

  1. Xây đặc trưng theo cửa sổ thời gian: số giao dịch 1 giờ qua, độ lệch so với hành vi thường ngày, khoảng cách địa lý so với giao dịch trước.
  2. Kết hợp luật cứng (chặn ngay) với mô hình xác suất (xếp hạng để con người rà).
  3. Chọn ngưỡng theo năng lực đội rà soát, không theo F1 tối ưu.
  4. Cập nhật liên tục — kẻ gian thích nghi nhanh hơn mọi ngành khác.

Cần dữ liệu gì

Log giao dịch có timestamp chính xác tới giâyNhãn gian lận đã xác nhận, kèm ngày xác nhận

Đo bằng chỉ số nào

Precision @ k trong k cảnh báo hàng đầu có bao nhiêu là thật
Recall trên giá trị tiền bắt được bao nhiêu phần trăm tổng thiệt hại, quan trọng hơn số vụ
Tỷ lệ báo động giả chi phí thật là khách hàng bị chặn nhầm

Sai ở đâu

Phần quan trọng nhất của trang này. Một phương pháp được mô tả mà không nói chỗ nó hỏng là phiên bản quảng cáo của phương pháp đó.

! Tối ưu theo số vụ thay vì theo giá trị tiền. Một vụ 500 triệu quan trọng hơn năm vụ 2 triệu.
! Bỏ qua độ trễ nhãn: một giao dịch chỉ được xác nhận là gian lận sau vài tuần, nên nhãn của tháng gần nhất luôn thiếu.
! Concept drift nhanh — mô hình huấn luyện sáu tháng trước có thể đã lỗi thời hoàn toàn.

Mô hình định lượng dùng trong Banking

Chưa có mô hình nào gắn riêng cho chủ đề này. Đây là những mô hình của cả ngành — liên quan ở cấp ngành, không phải cấp chủ đề.

Tất cả mô hình →
Bayesian Inferencebeta

Cập nhật niềm tin khi có dữ liệu mới.

GARCHbeta

Mô hình hoá biến động thay đổi theo thời gian.

Random Forestbeta

Tập hợp cây quyết định, giảm phương sai bằng bagging.

XGBoostbeta

Gradient boosting trên cây, tối ưu hoá mạnh.

Câu hỏi thường gặp

Phát hiện gian lận giao dịch là gì?

Phát hiện gian lận giao dịch là bài toán mất cân bằng cực đoan: gian lận thường dưới 0.1% số giao dịch. Chỉ số accuracy hoàn toàn vô nghĩa ở đây — một mô hình luôn nói 'không gian lận' đạt 99.9%.

Phát hiện gian lận giao dịch được làm như thế nào?

1. Xây đặc trưng theo cửa sổ thời gian: số giao dịch 1 giờ qua, độ lệch so với hành vi thường ngày, khoảng cách địa lý so với giao dịch trước. 2. Kết hợp luật cứng (chặn ngay) với mô hình xác suất (xếp hạng để con người rà). 3. Chọn ngưỡng theo năng lực đội rà soát, không theo F1 tối ưu. 4. Cập nhật liên tục — kẻ gian thích nghi nhanh hơn mọi ngành khác.

Phát hiện gian lận giao dịch hay sai ở đâu?

Tối ưu theo số vụ thay vì theo giá trị tiền. Một vụ 500 triệu quan trọng hơn năm vụ 2 triệu. Bỏ qua độ trễ nhãn: một giao dịch chỉ được xác nhận là gian lận sau vài tuần, nên nhãn của tháng gần nhất luôn thiếu. Concept drift nhanh — mô hình huấn luyện sáu tháng trước có thể đã lỗi thời hoàn toàn.

Đo phát hiện gian lận giao dịch bằng chỉ số nào?

Precision @ k — trong k cảnh báo hàng đầu có bao nhiêu là thật; Recall trên giá trị tiền — bắt được bao nhiêu phần trăm tổng thiệt hại, quan trọng hơn số vụ; Tỷ lệ báo động giả — chi phí thật là khách hàng bị chặn nhầm.

Phát hiện gian lận giao dịch trên QuantHub đã dùng được chưa?

Chưa xây dựng. Mục này hiện là điều hướng và tài liệu tham chiếu; chúng tôi không gắn nhãn 'live' cho thứ chưa chạy.

Chủ đề khác trong Banking

Toàn bộ Banking
Credit Scoring AML Basel III Credit Risk Loan Pricing Customer Analytics Forecast Reports