Học chính sách hành động qua thử và phần thưởng.
Môi trường mô phỏng được và phần thưởng định nghĩa đúng.
Thị trường thật không mô phỏng lại được — chính sách học trong backtest không đối mặt với tác động thị trường của chính nó.
Mạng hồi tiếp có cổng nhớ dài hạn.
Bản gọn của LSTM, ít tham số hơn.
Cơ chế attention, nắm quan hệ xa.
Tích chập nhân quả với receptive field kiểm soát được.
Tích chập cho dữ liệu có cấu trúc không gian.