NPC AI — Trí tuệ NPC
Bài toán nền của mọi hệ thống chọn nội dung động: khám phá lựa chọn mới hay khai thác lựa chọn đang tốt. Hai chính sách chạy trên cùng dữ liệu để so regret.
Regret là phần thắng bị mất so với việc biết trước lựa chọn tốt nhất. Đường cong dần phẳng nghĩa là chính sách đã học xong; đường vẫn dốc thẳng nghĩa là nó còn trả giá cho khám phá ở mọi lượt.
Cùng bộ tỷ lệ thật, cùng số lượt. Chênh lệch ở đây là phần thắng mua được chỉ bằng cách đổi quy tắc chọn, không cần thêm dữ liệu nào.
Đây là toàn bộ khác biệt giữa hai chính sách: UCB1 thu hẹp khám phá khi khoảng tin cậy đã đủ hẹp, epsilon-greedy thì không.
Phần này không giảm theo thời gian, nên regret của epsilon-greedy tăng tuyến tính mãi mãi. Muốn hết thì phải cho epsilon giảm dần theo số lượt.
Khoảng cách càng nhỏ thì càng cần nhiều lượt để phân biệt, và mọi kết luận từ vài trăm lượt đầu đều là nhiễu. Bandit cũng chỉ đúng khi tỷ lệ thật KHÔNG trôi theo thời gian.
| Regret epsilon-greedy | 22 (0.8%) |
| Phân bổ lượt UCB1 | #1: 354 · #2: 1,459 · #3: 901 · #4: 1,977 · #5: 309 |
| Phân bổ lượt epsilon | #1: 183 · #2: 115 · #3: 88 · #4: 4,521 · #5: 93 |
| Tỷ lệ thật | 45.0% · 52.0% · 48.0% · 55.0% · 41.0% |
| Người thắng | Epsilon-greedy |
| Vì sao | UCB1 tự giảm khám phá khi đã đủ tự tin; epsilon-greedy khám phá mãi ở tỷ lệ cố định |
Regret là phần thắng bị mất so với việc biết trước lựa chọn tốt nhất. Đường cong dần phẳng nghĩa là chính sách đã học xong; đường vẫn dốc thẳng nghĩa là nó còn trả giá cho khám phá ở mọi lượt.
Lựa chọn tốt nhất là #4 với tỷ lệ thật 55.0%. Epsilon-greedy vẫn chia đều 100 lượt cho mỗi lựa chọn kém vì nó khám phá mãi ở tỷ lệ cố định.
| Lựa chọn | Tỷ lệ thật | Lượt UCB1 | % UCB1 | Lượt epsilon | % epsilon |
|---|---|---|---|---|---|
| #1 | 45.0% | 354 | 7.1% | 183 | 3.7% |
| #2 | 52.0% | 1,459 | 29.2% | 115 | 2.3% |
| #3 | 48.0% | 901 | 18.0% | 88 | 1.8% |
| #4 ← tốt nhất | 55.0% | 1,977 | 39.5% | 4,521 | 90.4% |
| #5 | 41.0% | 309 | 6.2% | 93 | 1.9% |
| Regret epsilon-greedy | 22 (0.8%) |
| Phân bổ lượt UCB1 | #1: 354 · #2: 1,459 · #3: 901 · #4: 1,977 · #5: 309 |
| Phân bổ lượt epsilon | #1: 183 · #2: 115 · #3: 88 · #4: 4,521 · #5: 93 |
| Tỷ lệ thật | 45.0% · 52.0% · 48.0% · 55.0% · 41.0% |
| Người thắng | Epsilon-greedy |
| Vì sao | UCB1 tự giảm khám phá khi đã đủ tự tin; epsilon-greedy khám phá mãi ở tỷ lệ cố định |
AI cho NPC tạo hành vi cho nhân vật không do người điều khiển. Tiêu chí thành công không phải mạnh nhất mà là thú vị nhất: một NPC bắn bách phát bách trúng dễ lập trình và không ai muốn chơi cùng.
| Tỷ lệ thắng của người chơi | mục tiêu thường quanh 50–60% |
| Chi phí CPU mỗi NPC | ràng buộc cứng trong game thời gian thực |
| Đánh giá chủ quan của người chơi | chỉ số cuối cùng |
Phần quan trọng nhất của trang này. Một phương pháp được mô tả mà không nói chỗ nó hỏng là phiên bản quảng cáo của phương pháp đó.
Chưa có mô hình nào gắn riêng cho chủ đề này. Đây là những mô hình của cả ngành — liên quan ở cấp ngành, không phải cấp chủ đề.
AI cho NPC tạo hành vi cho nhân vật không do người điều khiển. Tiêu chí thành công không phải mạnh nhất mà là thú vị nhất: một NPC bắn bách phát bách trúng dễ lập trình và không ai muốn chơi cùng.
1. Chọn kiến trúc theo độ phức tạp: máy trạng thái cho hành vi đơn giản, cây hành vi cho hành vi phân cấp, utility AI cho quyết định có nhiều yếu tố cạnh tranh. 2. Thiết kế độ khó thích ứng theo kỹ năng người chơi. 3. Đưa vào sai sót có chủ đích để hành vi trông tự nhiên. 4. Kiểm thử bằng người chơi thật, không chỉ bằng chỉ số thắng thua.
Học tăng cường tạo ra NPC rất mạnh nhưng hành vi kỳ dị và không dự đoán được, làm hỏng cảm giác chơi. Ngân sách tính toán cho AI trong game rất chặt; mô hình lớn không chạy nổi cùng hàng chục NPC.
Tỷ lệ thắng của người chơi — mục tiêu thường quanh 50–60%; Chi phí CPU mỗi NPC — ràng buộc cứng trong game thời gian thực; Đánh giá chủ quan của người chơi — chỉ số cuối cùng.
Chưa xây dựng. Mục này hiện là điều hướng và tài liệu tham chiếu; chúng tôi không gắn nhãn 'live' cho thứ chưa chạy.