Gaming Analytics hoạt động

AI cho NPC trong game

NPC AI — Trí tuệ NPC

Đã chạy được. Mục này có công cụ tính toán thật trên nền tảng, không phải mô tả lộ trình.

Bandit: epsilon-greedy vs UCB1 Mô phỏng khám phá và khai thác

Bài toán nền của mọi hệ thống chọn nội dung động: khám phá lựa chọn mới hay khai thác lựa chọn đang tốt. Hai chính sách chạy trên cùng dữ liệu để so regret.

Epsilon-greedy 2,728 thắng
UCB1 2,536 thắng
Tối ưu biết trước 2,750
Regret UCB1 214 (7.8%)
Kết luận Epsilon-greedy thắng
① Tham số

Regret tích luỹ theo số lượt

UCB1Epsilon-greedy
Regret tích luỹ theo số lượt245.1154.563.86-26.7606251,2501,8752,5003,1253,7504,375

Regret là phần thắng bị mất so với việc biết trước lựa chọn tốt nhất. Đường cong dần phẳng nghĩa là chính sách đã học xong; đường vẫn dốc thẳng nghĩa là nó còn trả giá cho khám phá ở mọi lượt.

Diễn giải nhanh

UCB1 regret 214 (7.8%) so với epsilon-greedy 22 (0.8%)

Cùng bộ tỷ lệ thật, cùng số lượt. Chênh lệch ở đây là phần thắng mua được chỉ bằng cách đổi quy tắc chọn, không cần thêm dữ liệu nào.

UCB1 dồn 39.5% số lượt vào lựa chọn tốt nhất, epsilon-greedy 90.4%

Đây là toàn bộ khác biệt giữa hai chính sách: UCB1 thu hẹp khám phá khi khoảng tin cậy đã đủ hẹp, epsilon-greedy thì không.

Epsilon 10% giữ lại tối thiểu 100 lượt cho MỖI lựa chọn kém

Phần này không giảm theo thời gian, nên regret của epsilon-greedy tăng tuyến tính mãi mãi. Muốn hết thì phải cho epsilon giảm dần theo số lượt.

Chênh giữa lựa chọn tốt nhất và kém nhất chỉ 14.0%

Khoảng cách càng nhỏ thì càng cần nhiều lượt để phân biệt, và mọi kết luận từ vài trăm lượt đầu đều là nhiễu. Bandit cũng chỉ đúng khi tỷ lệ thật KHÔNG trôi theo thời gian.

Khi nào con số này sai: Bandit chỉ đúng khi tỷ lệ thắng KHÔNG đổi theo thời gian. Nội dung game, quảng cáo hay giao diện đều bị chán dần, nên tỷ lệ thật trôi — khi đó cần biến thể có chiết khấu quá khứ, không dùng bản gốc.

Chi tiết

Regret epsilon-greedy 22 (0.8%)
Phân bổ lượt UCB1 #1: 354 · #2: 1,459 · #3: 901 · #4: 1,977 · #5: 309
Phân bổ lượt epsilon #1: 183 · #2: 115 · #3: 88 · #4: 4,521 · #5: 93
Tỷ lệ thật 45.0% · 52.0% · 48.0% · 55.0% · 41.0%
Người thắng Epsilon-greedy
Vì sao UCB1 tự giảm khám phá khi đã đủ tự tin; epsilon-greedy khám phá mãi ở tỷ lệ cố định

Regret tích luỹ theo số lượt

UCB1Epsilon-greedy
Regret tích luỹ theo số lượt245.1154.563.86-26.7606251,2501,8752,5003,1253,7504,375

Regret là phần thắng bị mất so với việc biết trước lựa chọn tốt nhất. Đường cong dần phẳng nghĩa là chính sách đã học xong; đường vẫn dốc thẳng nghĩa là nó còn trả giá cho khám phá ở mọi lượt.

Phân bổ lượt cho từng lựa chọn

UCB1epsilon-greedy
Phân bổ lượt cho từng lựa chọn5,1543,4361,7180#1 (45%) — epsilon-greedy: 183#1 (45%) — UCB1: 354#2 (52%) — epsilon-greedy: 115#2 (52%) — UCB1: 1,459#3 (48%) — epsilon-greedy: 88#3 (48%) — UCB1: 901#4 (55%) — epsilon-greedy: 4,521#4 (55%) — UCB1: 1,977#5 (41%) — epsilon-greedy: 93#5 (41%) — UCB1: 309#1 (45%)#2 (52%)#3 (48%)#4 (55%)#5 (41%)

Lựa chọn tốt nhất là #4 với tỷ lệ thật 55.0%. Epsilon-greedy vẫn chia đều 100 lượt cho mỗi lựa chọn kém vì nó khám phá mãi ở tỷ lệ cố định.

Phân bổ lượt và kết quả từng lựa chọn

Lựa chọnTỷ lệ thậtLượt UCB1% UCB1Lượt epsilon% epsilon
#145.0%3547.1%1833.7%
#252.0%1,45929.2%1152.3%
#348.0%90118.0%881.8%
#4 ← tốt nhất55.0%1,97739.5%4,52190.4%
#541.0%3096.2%931.9%

Toàn bộ chỉ số

Regret epsilon-greedy 22 (0.8%)
Phân bổ lượt UCB1 #1: 354 · #2: 1,459 · #3: 901 · #4: 1,977 · #5: 309
Phân bổ lượt epsilon #1: 183 · #2: 115 · #3: 88 · #4: 4,521 · #5: 93
Tỷ lệ thật 45.0% · 52.0% · 48.0% · 55.0% · 41.0%
Người thắng Epsilon-greedy
Vì sao UCB1 tự giảm khám phá khi đã đủ tự tin; epsilon-greedy khám phá mãi ở tỷ lệ cố định

Cách dùng

  1. Điền tham số ở cột trái. Mọi ô đã có sẵn giá trị ví dụ chạy được, nên bạn có thể bấm Tính ngay trước rồi sửa sau.
  2. Đọc thẻ số ở trên cùng, rồi mục Diễn giải nhanh để biết con số đó nói gì.
  3. Đọc dòng “Khi nào con số này sai” trước khi dùng kết quả để quyết định — đó là giả định vỡ đầu tiên.
Giới hạn chung. Công cụ này tính đúng công thức của nó trên dữ liệu bạn đưa vào. Nó không kiểm tra dữ liệu của bạn có phù hợp với giả định của phương pháp hay không — phần đó vẫn là việc của người dùng, và mục “sai ở đâu” bên dưới trang liệt kê các chỗ hỏng thường gặp.

AI cho NPC trong game là gì

AI cho NPC tạo hành vi cho nhân vật không do người điều khiển. Tiêu chí thành công không phải mạnh nhất mà là thú vị nhất: một NPC bắn bách phát bách trúng dễ lập trình và không ai muốn chơi cùng.

Làm thế nào

  1. Chọn kiến trúc theo độ phức tạp: máy trạng thái cho hành vi đơn giản, cây hành vi cho hành vi phân cấp, utility AI cho quyết định có nhiều yếu tố cạnh tranh.
  2. Thiết kế độ khó thích ứng theo kỹ năng người chơi.
  3. Đưa vào sai sót có chủ đích để hành vi trông tự nhiên.
  4. Kiểm thử bằng người chơi thật, không chỉ bằng chỉ số thắng thua.

Đo bằng chỉ số nào

Tỷ lệ thắng của người chơi mục tiêu thường quanh 50–60%
Chi phí CPU mỗi NPC ràng buộc cứng trong game thời gian thực
Đánh giá chủ quan của người chơi chỉ số cuối cùng

Sai ở đâu

Phần quan trọng nhất của trang này. Một phương pháp được mô tả mà không nói chỗ nó hỏng là phiên bản quảng cáo của phương pháp đó.

! Học tăng cường tạo ra NPC rất mạnh nhưng hành vi kỳ dị và không dự đoán được, làm hỏng cảm giác chơi.
! Ngân sách tính toán cho AI trong game rất chặt; mô hình lớn không chạy nổi cùng hàng chục NPC.

Mô hình định lượng dùng trong Gaming

Chưa có mô hình nào gắn riêng cho chủ đề này. Đây là những mô hình của cả ngành — liên quan ở cấp ngành, không phải cấp chủ đề.

Tất cả mô hình →
Markov Chainsắp có

Trạng thái kế tiếp chỉ phụ thuộc trạng thái hiện tại.

K-Nearest Neighborssắp có

Dự đoán theo các điểm giống nhất trong quá khứ.

Reinforcement Learningsắp có

Học chính sách hành động qua thử và phần thưởng.

Agent-Based Modelsắp có

Mô phỏng hành vi tương tác của nhiều tác nhân.

Câu hỏi thường gặp

AI cho NPC trong game là gì?

AI cho NPC tạo hành vi cho nhân vật không do người điều khiển. Tiêu chí thành công không phải mạnh nhất mà là thú vị nhất: một NPC bắn bách phát bách trúng dễ lập trình và không ai muốn chơi cùng.

AI cho NPC trong game được làm như thế nào?

1. Chọn kiến trúc theo độ phức tạp: máy trạng thái cho hành vi đơn giản, cây hành vi cho hành vi phân cấp, utility AI cho quyết định có nhiều yếu tố cạnh tranh. 2. Thiết kế độ khó thích ứng theo kỹ năng người chơi. 3. Đưa vào sai sót có chủ đích để hành vi trông tự nhiên. 4. Kiểm thử bằng người chơi thật, không chỉ bằng chỉ số thắng thua.

AI cho NPC trong game hay sai ở đâu?

Học tăng cường tạo ra NPC rất mạnh nhưng hành vi kỳ dị và không dự đoán được, làm hỏng cảm giác chơi. Ngân sách tính toán cho AI trong game rất chặt; mô hình lớn không chạy nổi cùng hàng chục NPC.

Đo ai cho npc trong game bằng chỉ số nào?

Tỷ lệ thắng của người chơi — mục tiêu thường quanh 50–60%; Chi phí CPU mỗi NPC — ràng buộc cứng trong game thời gian thực; Đánh giá chủ quan của người chơi — chỉ số cuối cùng.

AI cho NPC trong game trên QuantHub đã dùng được chưa?

Chưa xây dựng. Mục này hiện là điều hướng và tài liệu tham chiếu; chúng tôi không gắn nhãn 'live' cho thứ chưa chạy.

Chủ đề khác trong Gaming

Toàn bộ Gaming
Matchmaking Economy Simulation Player Analytics Fraud Detection Recommendation Reports API Documentation