Data Science & AI hoạt động

NLP — xử lý ngôn ngữ tự nhiên

NLP — Xử lý ngôn ngữ

Đã chạy được. Mục này có công cụ tính toán thật trên nền tảng, không phải mô tả lộ trình.

Phân tích văn bản Tần suất từ, cụm hai từ, độ đa dạng

Bước khảo sát đầu tiên với bất kỳ tập văn bản nào, kèm cảnh báo thẳng về giới hạn của việc tách từ tiếng Việt theo khoảng trắng.

Đang chạy trên dữ liệu mẫu, không phải dữ liệu của bạn. Các ô còn nguyên mẫu dựng sẵn: Văn bản cần phân tích. Chọn nguồn dữ liệu khác ở cột bên trái rồi chạy lại để có kết quả của riêng bạn.
Số từ 61
Từ khác nhau 32
Độ đa dạng từ vựng 0.525
Số câu 4
① Nguồn dữ liệu

Nhận dấu phẩy, chấm phẩy hoặc tab; tự nhận dòng tiêu đề; hiểu cả 1.234.567 lẫn 1.234,56.

Chỉ tải http/https tới địa chỉ công khai; địa chỉ nội bộ bị từ chối.

② Tham số

Giá trị mặc định là ví dụ chạy được — bấm Tính ngay để xem kết quả, rồi thay dữ liệu của bạn vào.

Từ xuất hiện nhiều nhất

Từ xuất hiện nhiều nhất7.845.2272.6130mô: 7hình: 7dữ: 4liệu: 4sạch: 3hơn: 3cần: 2phức: 2tạp: 2định: 2trên: 2nền: 1dữsạchcầntạptrên

Đã loại stopword. Trên 61 từ, từ đứng đầu chiếm 11.5% toàn văn bản — tỷ trọng càng cao thì văn bản càng xoay quanh một chủ đề hẹp.

Diễn giải nhanh

Độ đa dạng từ vựng 0.525 (32 từ khác nhau trên 61 từ)

Chỉ số này giảm tự nhiên khi văn bản dài ra, nên chỉ so sánh được giữa các văn bản có độ dài tương đương. So một bài 200 từ với một bài 20.000 từ là so sai.

21 từ chỉ xuất hiện một lần (65.6%)

Tỷ lệ hapax cao nghĩa là văn bản trải rộng chủ đề hoặc quá ngắn để có mẫu lặp. Đây cũng là phần mà mọi mô hình thống kê văn bản gặp khó nhất.

Câu dài trung bình 15.2 từ (4 câu)

Văn bản kỹ thuật tiếng Việt thường 15–25 từ mỗi câu. Trên 30 là dấu hiệu câu nhiều mệnh đề, khó đọc và cũng khó tách máy.

Tách 61 từ bằng khoảng trắng

Sai về ngôn ngữ học với tiếng Việt: 'học sinh' là một từ ghép, không phải hai từ. Kết quả dùng được để so sánh tương đối giữa các văn bản, không dùng được như phân tích hình thái.

Khi nào con số này sai: Tách từ tiếng Việt bằng khoảng trắng là SAI về ngôn ngữ học: 'học sinh' là một từ ghép, không phải hai từ. Kết quả ở đây dùng được để so sánh tương đối giữa các văn bản, nhưng đừng coi là phân tích hình thái chuẩn.

Chi tiết

Từ xuất hiện nhiều nhất mô (7) · hình (7) · dữ (4) · liệu (4) · sạch (3) · hơn (3) · cần (2) · phức (2) · tạp (2) · định (2) · trên (2) · nền (1)
Cụm hai từ nổi bật mô hình (7) · dữ liệu (4) · liệu sạch (3) · hình phức (2) · phức tạp (2) · trên dữ (2) · nền tảng (1) · tảng quant (1)
Độ dài câu trung bình 15.2 từ
Từ chỉ xuất hiện 1 lần 21 (65.6%)
Ghi chú Đã loại stopword tiếng Việt và tiếng Anh cơ bản

Từ xuất hiện nhiều nhất

Từ xuất hiện nhiều nhất7.845.2272.6130mô: 7hình: 7dữ: 4liệu: 4sạch: 3hơn: 3cần: 2phức: 2tạp: 2định: 2trên: 2nền: 1dữsạchcầntạptrên

Đã loại stopword. Trên 61 từ, từ đứng đầu chiếm 11.5% toàn văn bản — tỷ trọng càng cao thì văn bản càng xoay quanh một chủ đề hẹp.

Phân bố Zipf (log hạng – log tần suất)

Phân bố Zipf (log hạng – log tần suất)2.1791.3750.5708-0.2335(0.000, 1.946)(0.693, 1.946)(1.099, 1.386)(1.386, 1.386)(1.609, 1.099)(1.792, 1.099)(1.946, 0.693)(2.079, 0.693)(2.197, 0.693)(2.303, 0.693)(2.398, 0.693)(2.485, 0.000)(2.565, 0.000)(2.639, 0.000)(2.708, 0.000)(2.773, 0.000)(2.833, 0.000)(2.890, 0.000)(2.944, 0.000)(2.996, 0.000)(3.045, 0.000)(3.091, 0.000)(3.135, 0.000)(3.178, 0.000)(3.219, 0.000)(3.258, 0.000)(3.296, 0.000)(3.332, 0.000)(3.367, 0.000)(3.401, 0.000)(3.434, 0.000)(3.466, 0.000)trục ngang ln(hạng) · trục dọc ln(số lần)

Ngôn ngữ tự nhiên rơi gần một đường thẳng dốc khoảng −1. Đám mây phẳng nghĩa là văn bản không phải văn xuôi mà là danh sách hoặc mẫu lặp.

Cụm hai từ nổi bật

Cụm hai từ nổi bật7.845.2272.6130mô hình: 7dữ liệu: 4liệu sạch: 3hình phức: 2phức tạp: 2trên dữ: 2nền tảng: 1tảng quant: 1mô hìnhdữ liệuliệu sạchhình phứcphức tạptrên dữnền tảngtảng quant

Cụm hai từ liền nhau, đã bỏ cụm chứa stopword. Với tiếng Việt, phần lớn cụm ở đây thực chất là MỘT từ ghép bị tách nhầm bởi khoảng trắng.

Từ khoá theo tần suất

HạngTừSố lầnTỷ lệ trên tổng từLuỹ kế
1711.48%11.48%
2hình711.48%22.95%
3dữ46.56%29.51%
4liệu46.56%36.07%
5sạch34.92%40.98%
6hơn34.92%45.90%
7cần23.28%49.18%
8phức23.28%52.46%
9tạp23.28%55.74%
10định23.28%59.02%
11trên23.28%62.30%
12nền11.64%63.93%

Toàn bộ chỉ số

Từ xuất hiện nhiều nhất mô (7) · hình (7) · dữ (4) · liệu (4) · sạch (3) · hơn (3) · cần (2) · phức (2) · tạp (2) · định (2) · trên (2) · nền (1)
Cụm hai từ nổi bật mô hình (7) · dữ liệu (4) · liệu sạch (3) · hình phức (2) · phức tạp (2) · trên dữ (2) · nền tảng (1) · tảng quant (1)
Độ dài câu trung bình 15.2 từ
Từ chỉ xuất hiện 1 lần 21 (65.6%)
Ghi chú Đã loại stopword tiếng Việt và tiếng Anh cơ bản

Cách dùng

  1. Điền tham số ở cột trái. Mọi ô đã có sẵn giá trị ví dụ chạy được, nên bạn có thể bấm Tính ngay trước rồi sửa sau.
  2. Với ô dữ liệu: dán vài chục dòng để thử, hoặc tải file CSV/TXT lên để chạy thật. File tối đa 32 MB, 200.000 dòng; bộ đọc nhận dấu phẩy, chấm phẩy hoặc tab, tự nhận dòng tiêu đề, và hiểu cả 1.234.567 lẫn 1.234,56.
  3. Đọc thẻ số ở trên cùng, rồi mục Diễn giải nhanh để biết con số đó nói gì.
  4. Đọc dòng “Khi nào con số này sai” trước khi dùng kết quả để quyết định — đó là giả định vỡ đầu tiên.
Giới hạn chung. Công cụ này tính đúng công thức của nó trên dữ liệu bạn đưa vào. Nó không kiểm tra dữ liệu của bạn có phù hợp với giả định của phương pháp hay không — phần đó vẫn là việc của người dùng, và mục “sai ở đâu” bên dưới trang liệt kê các chỗ hỏng thường gặp.

NLP — xử lý ngôn ngữ tự nhiên là gì

Xử lý ngôn ngữ tự nhiên trích thông tin từ văn bản. Với tiếng Việt có hai đặc thù kỹ thuật: tách từ không hiển nhiên vì âm tiết viết rời, và dấu thanh thường bị lược bỏ trong dữ liệu người dùng sinh ra.

Làm thế nào

  1. Chuẩn hoá văn bản: Unicode, dấu thanh, viết tắt, teencode.
  2. Tách từ bằng công cụ dành riêng cho tiếng Việt.
  3. Dùng mô hình đã huấn luyện sẵn cho tiếng Việt thay vì mô hình đa ngữ chung khi có thể.
  4. Đánh giá trên dữ liệu thật của bạn, không trên benchmark chung.

Đo bằng chỉ số nào

F1 theo nhãn trung bình chung che mất nhãn hiếm
Độ đồng thuận người gán nhãn trần hiệu suất thực tế

Sai ở đâu

Phần quan trọng nhất của trang này. Một phương pháp được mô tả mà không nói chỗ nó hỏng là phiên bản quảng cáo của phương pháp đó.

! Tách từ sai làm mọi bước sau sai theo; 'học sinh' và 'học sinh học' cần xử lý khác nhau.
! Văn bản không dấu là bài toán riêng, không phải nhiễu nhỏ.

Mô hình định lượng dùng trong Data Science

Chưa có mô hình nào gắn riêng cho chủ đề này. Đây là những mô hình của cả ngành — liên quan ở cấp ngành, không phải cấp chủ đề.

Tất cả mô hình →
Transformersắp có

Cơ chế attention, nắm quan hệ xa.

Temporal Convolutional Networksắp có

Tích chập nhân quả với receptive field kiểm soát được.

Deflated Sharpe Ratiohoạt động

Sharpe sau khi phạt vì số lần thử và độ lệch/nhọn của đuôi.

Probability of Backtest Overfittinghoạt động

Tỉ lệ cấu hình thắng in-sample lại xếp dưới trung vị ngoài mẫu.

Câu hỏi thường gặp

NLP — xử lý ngôn ngữ tự nhiên là gì?

Xử lý ngôn ngữ tự nhiên trích thông tin từ văn bản. Với tiếng Việt có hai đặc thù kỹ thuật: tách từ không hiển nhiên vì âm tiết viết rời, và dấu thanh thường bị lược bỏ trong dữ liệu người dùng sinh ra.

NLP — xử lý ngôn ngữ tự nhiên được làm như thế nào?

1. Chuẩn hoá văn bản: Unicode, dấu thanh, viết tắt, teencode. 2. Tách từ bằng công cụ dành riêng cho tiếng Việt. 3. Dùng mô hình đã huấn luyện sẵn cho tiếng Việt thay vì mô hình đa ngữ chung khi có thể. 4. Đánh giá trên dữ liệu thật của bạn, không trên benchmark chung.

NLP — xử lý ngôn ngữ tự nhiên hay sai ở đâu?

Tách từ sai làm mọi bước sau sai theo; 'học sinh' và 'học sinh học' cần xử lý khác nhau. Văn bản không dấu là bài toán riêng, không phải nhiễu nhỏ.

Đo nlp — xử lý ngôn ngữ tự nhiên bằng chỉ số nào?

F1 theo nhãn — trung bình chung che mất nhãn hiếm; Độ đồng thuận người gán nhãn — trần hiệu suất thực tế.

NLP — xử lý ngôn ngữ tự nhiên trên QuantHub đã dùng được chưa?

Chưa xây dựng. Mục này hiện là điều hướng và tài liệu tham chiếu; chúng tôi không gắn nhãn 'live' cho thứ chưa chạy.

Chủ đề khác trong Data Science

Toàn bộ Data Science
Time Series Machine Learning Deep Learning Computer Vision AutoML Feature Engineering Anomaly Detection Optimization