Data Science & AI hoạt động

Deep learning

Deep Learning — Học sâu

Đã chạy được. Mục này có công cụ tính toán thật trên nền tảng, không phải mô tả lộ trình.

Ma trận tương quan từ file Tương quan từng cặp và cảnh báo đa cộng tuyến

Tải lợi suất nhiều chiến lược, nhiều tài sản hay nhiều chỉ số lên và xem chúng thực sự độc lập tới đâu. Đây là phép đo phải làm trước khi cộng rủi ro của nhiều vị thế.

Đang chạy trên dữ liệu mẫu, không phải dữ liệu của bạn. Các ô còn nguyên mẫu dựng sẵn: Bảng nhiều cột. Chọn nguồn dữ liệu khác ở cột bên trái rồi chạy lại để có kết quả của riêng bạn.
Số cột 3
Số dòng 12
Cặp tương quan mạnh nhất +0.9490
Cặp |r| > 0.8 1
① Nguồn dữ liệu

Nhận dấu phẩy, chấm phẩy hoặc tab; tự nhận dòng tiêu đề; hiểu cả 1.234.567 lẫn 1.234,56.

Chỉ tải http/https tới địa chỉ công khai; địa chỉ nội bộ bị từ chối.

Giá trị mặc định là ví dụ chạy được — bấm Tính ngay để xem kết quả, rồi thay dữ liệu của bạn vào.

Tương quan từng cặp, xếp theo độ mạnh

Tương quan từng cặp, xếp theo độ mạnh1.0630.467-0.1288-0.7247A↔B: +0.949B↔C: -0.647A↔C: -0.639A↔BB↔CA↔C

Cột âm vẽ màu đỏ. Ngưỡng |r| > 0,8 là mức thường gây đa cộng tuyến đủ để làm hệ số hồi quy mất ổn định.

Diễn giải nhanh

Cặp mạnh nhất: A ↔ B = +0.9490

Dấu cho biết chiều, độ lớn cho biết mức chặt của quan hệ TUYẾN TÍNH. Không nói gì về nhân quả và không bắt được quan hệ cong.

1 cặp có |r| > 0,8

Các cặp này gây đa cộng tuyến nếu cùng đưa vào một mô hình hồi quy: hệ số sẽ đổi dấu và nhảy mạnh khi thêm bớt dữ liệu.

12 dòng · 3 cột

Với 12 quan sát, |r| khoảng 0.591 trở lên mới khác 0 có ý nghĩa ở mức 5%. Cỡ mẫu nhỏ khiến tương quan lớn xuất hiện hoàn toàn do ngẫu nhiên.

Khi nào con số này sai: Tương quan chỉ đo quan hệ TUYẾN TÍNH. Hai biến có quan hệ chữ U rõ ràng vẫn cho r gần 0. Và tương quan cao giữa các biến độc lập gây đa cộng tuyến, làm hệ số hồi quy mất ổn định.

Chi tiết

A ↔ B +0.9490
B ↔ C -0.6471
A ↔ C -0.6388
Ma trận
            A       B       C
A       1.000   0.949  -0.639
B       0.949   1.000  -0.647
C      -0.639  -0.647   1.000
Cảnh báo đa cộng tuyến A↔B

Tương quan từng cặp, xếp theo độ mạnh

Tương quan từng cặp, xếp theo độ mạnh1.0630.467-0.1288-0.7247A↔B: +0.949B↔C: -0.647A↔C: -0.639A↔BB↔CA↔C

Cột âm vẽ màu đỏ. Ngưỡng |r| > 0,8 là mức thường gây đa cộng tuyến đủ để làm hệ số hồi quy mất ổn định.

A và B

A và B0.02320.008733-0.005733-0.0202(0.012, 0.008)(-0.006, 0.002)(0.021, 0.019)(0.004, -0.003)(-0.015, -0.012)(0.009, 0.011)(0.017, 0.014)(-0.008, -0.005)(0.003, 0.006)(0.011, 0.009)(-0.019, -0.016)(0.007, 0.004)trục ngang A · trục dọc B

r = +0.9490. Nhìn hình trước khi tin con số: quan hệ chữ U rõ ràng vẫn cho r gần 0.

Toàn bộ chỉ số

A ↔ B +0.9490
B ↔ C -0.6471
A ↔ C -0.6388
Ma trận
            A       B       C
A       1.000   0.949  -0.639
B       0.949   1.000  -0.647
C      -0.639  -0.647   1.000
Cảnh báo đa cộng tuyến A↔B

Cách dùng

  1. Điền tham số ở cột trái. Mọi ô đã có sẵn giá trị ví dụ chạy được, nên bạn có thể bấm Tính ngay trước rồi sửa sau.
  2. Với ô dữ liệu: dán vài chục dòng để thử, hoặc tải file CSV/TXT lên để chạy thật. File tối đa 32 MB, 200.000 dòng; bộ đọc nhận dấu phẩy, chấm phẩy hoặc tab, tự nhận dòng tiêu đề, và hiểu cả 1.234.567 lẫn 1.234,56.
  3. Đọc thẻ số ở trên cùng, rồi mục Diễn giải nhanh để biết con số đó nói gì.
  4. Đọc dòng “Khi nào con số này sai” trước khi dùng kết quả để quyết định — đó là giả định vỡ đầu tiên.
Giới hạn chung. Công cụ này tính đúng công thức của nó trên dữ liệu bạn đưa vào. Nó không kiểm tra dữ liệu của bạn có phù hợp với giả định của phương pháp hay không — phần đó vẫn là việc của người dùng, và mục “sai ở đâu” bên dưới trang liệt kê các chỗ hỏng thường gặp.

Deep learning là gì

Deep learning dùng mạng nơ ron nhiều lớp để tự học biểu diễn từ dữ liệu thô. Nó vượt trội rõ rệt với ảnh, âm thanh và văn bản; với dữ liệu bảng, gradient boosting vẫn thường thắng và rẻ hơn nhiều.

Làm thế nào

  1. Xác định dữ liệu có đủ lớn không — deep learning cần nhiều dữ liệu hơn hẳn.
  2. Bắt đầu từ mô hình đã huấn luyện sẵn và tinh chỉnh, thay vì huấn luyện từ đầu.
  3. Dùng regularisation: dropout, weight decay, early stopping.
  4. Theo dõi đường cong học để phân biệt underfit và overfit.

Đo bằng chỉ số nào

Loss trên train và validation khoảng cách cho biết overfit
Chi phí suy luận quyết định khả năng triển khai

Sai ở đâu

Phần quan trọng nhất của trang này. Một phương pháp được mô tả mà không nói chỗ nó hỏng là phiên bản quảng cáo của phương pháp đó.

! Dùng deep learning cho dữ liệu bảng nhỏ — trong dự án này, LightGBM thua hồi quy tuyến tính trên cả 5 thị trường ở bài toán dự báo biến động; mô hình phức tạp hơn không tự động tốt hơn.
! Kích thước mô hình vượt hạ tầng triển khai, nên không bao giờ ra được production.

Mô hình định lượng dùng trong Data Science

Chưa có mô hình nào gắn riêng cho chủ đề này. Đây là những mô hình của cả ngành — liên quan ở cấp ngành, không phải cấp chủ đề.

Tất cả mô hình →
Transformersắp có

Cơ chế attention, nắm quan hệ xa.

Temporal Convolutional Networksắp có

Tích chập nhân quả với receptive field kiểm soát được.

Deflated Sharpe Ratiohoạt động

Sharpe sau khi phạt vì số lần thử và độ lệch/nhọn của đuôi.

Probability of Backtest Overfittinghoạt động

Tỉ lệ cấu hình thắng in-sample lại xếp dưới trung vị ngoài mẫu.

Câu hỏi thường gặp

Deep learning là gì?

Deep learning dùng mạng nơ ron nhiều lớp để tự học biểu diễn từ dữ liệu thô. Nó vượt trội rõ rệt với ảnh, âm thanh và văn bản; với dữ liệu bảng, gradient boosting vẫn thường thắng và rẻ hơn nhiều.

Deep learning được làm như thế nào?

1. Xác định dữ liệu có đủ lớn không — deep learning cần nhiều dữ liệu hơn hẳn. 2. Bắt đầu từ mô hình đã huấn luyện sẵn và tinh chỉnh, thay vì huấn luyện từ đầu. 3. Dùng regularisation: dropout, weight decay, early stopping. 4. Theo dõi đường cong học để phân biệt underfit và overfit.

Deep learning hay sai ở đâu?

Dùng deep learning cho dữ liệu bảng nhỏ — trong dự án này, LightGBM thua hồi quy tuyến tính trên cả 5 thị trường ở bài toán dự báo biến động; mô hình phức tạp hơn không tự động tốt hơn. Kích thước mô hình vượt hạ tầng triển khai, nên không bao giờ ra được production.

Đo deep learning bằng chỉ số nào?

Loss trên train và validation — khoảng cách cho biết overfit; Chi phí suy luận — quyết định khả năng triển khai.

Deep learning trên QuantHub đã dùng được chưa?

Chưa xây dựng. Mục này hiện là điều hướng và tài liệu tham chiếu; chúng tôi không gắn nhãn 'live' cho thứ chưa chạy.

Chủ đề khác trong Data Science

Toàn bộ Data Science
Time Series Machine Learning NLP Computer Vision AutoML Feature Engineering Anomaly Detection Optimization