Luận án: Tích hợp đặc trưng ngôn ngữ vào học thống kê phân tích tình cảm tiếng Việt
Tích hợp đặc trưng ngôn ngữ vào mô hình học thống kê tình cảm, cải thiện độ chính xác nhận diện cảm xúc.
Số trang
140
Thời gian đọc
21 phút
Lượt xem
0
Lượt tải
0
Phí lưu trữ
40 Point
Mục lục chi tiết
Tóm tắt nội dung
I. Tích hợp đặc trưng ngôn ngữ cho phân tích tình cảm
Việc tích hợp các đặc trưng ngôn ngữ vào mô hình học thống kê là rất quan trọng trong phân tích tình cảm. Điều này giúp cải thiện độ chính xác của các mô hình học máy. Các đặc trưng như từ điển tình cảm, gán nhãn từ loại và phân tích cú pháp đều góp phần vào quá trình này. Hệ thống cần phải xử lý dữ liệu ngôn ngữ một cách hiệu quả để đạt được kết quả tối ưu.
1.1. Đặc trưng ngôn ngữ ảnh hưởng đến kết quả
Các đặc trưng ngôn ngữ như từ điển tình cảm có thể cung cấp thông tin quý giá cho các thuật toán học máy. Việc nhận diện cảm xúc trong văn bản sẽ chính xác hơn nếu các đặc trưng này được khai thác đúng cách.
1.2. Sự cần thiết của xử lý ngôn ngữ tự nhiên
Xử lý ngôn ngữ tự nhiên (NLP) giúp cải thiện khả năng hiểu biết của máy tính về ngôn ngữ con người. Nhiều công cụ NLP hiện tại hỗ trợ phân tích tình cảm một cách hiệu quả hơn.
1.3. Vai trò của học máy thống kê
Học máy thống kê cung cấp các kỹ thuật mạnh mẽ để phân tích tình cảm. Những mô hình này có khả năng học từ dữ liệu và cải thiện theo thời gian.
II. Các phương pháp phân tích tình cảm hiện đại
Phân tích tình cảm hiện đại sử dụng nhiều phương pháp khác nhau. Một số phương pháp bao gồm mô hình học máy cổ điển và mạng nơ-ron sâu. Những phương pháp này cho phép phân tích tình cảm mức câu và mức thực thể một cách hiệu quả.
2.1. Mô hình học máy cổ điển
Mô hình học máy cổ điển như hồi quy logistic và cây quyết định vẫn được sử dụng rộng rãi trong phân tích tình cảm. Chúng thường đơn giản và dễ hiểu.
2.2. Mạng nơ ron sâu cho phân tích tình cảm
Mạng nơ-ron sâu, đặc biệt là CNN, đã chứng minh được hiệu quả trong việc phân tích tình cảm. Chúng có khả năng học các đặc trưng phức tạp từ dữ liệu.
2.3. Khai thác ý kiến từ dữ liệu
Khai thác ý kiến giúp phát hiện các xu hướng và tâm trạng từ dữ liệu lớn. Điều này mang lại cái nhìn sâu sắc về cảm xúc của người dùng.
III. Tiền xử lý dữ liệu cho phân tích tình cảm
Tiền xử lý dữ liệu là bước quan trọng trong phân tích tình cảm. Nó giúp chuẩn bị dữ liệu cho các thuật toán học máy. Quá trình này bao gồm kiểm tra chính tả, tách từ và giảm thiểu nhiễu.
3.1. Kiểm tra chính tả cho dữ liệu tình cảm
Kiểm tra chính tả giúp làm sạch dữ liệu bằng cách phát hiện và sửa lỗi. Việc này rất quan trọng đối với dữ liệu không cấu trúc như Microblog.
3.2. Phương pháp tách từ hiệu quả
Phương pháp tách từ đóng vai trò quan trọng trong việc xử lý ngôn ngữ tự nhiên. Tách từ chính xác giúp nâng cao chất lượng phân tích.
3.3. Giảm thiểu nhiễu trong dữ liệu
Giảm thiểu nhiễu là cần thiết để cải thiện độ chính xác của mô hình. Các kỹ thuật như lọc bỏ các ký tự không cần thiết có thể được áp dụng.
IV. Đánh giá hiệu năng mô hình phân tích tình cảm
Đánh giá hiệu năng của mô hình phân tích tình cảm là rất quan trọng. Các chỉ số như độ chính xác, độ nhạy và độ đặc hiệu cần được xem xét. Việc so sánh mô hình với các phương pháp khác cũng giúp cải thiện kết quả.
4.1. Các chỉ số đánh giá hiệu năng
Các chỉ số như độ chính xác và độ nhạy phản ánh khả năng của mô hình trong việc phân loại chính xác tình cảm. Những chỉ số này cần được theo dõi liên tục.
4.2. So sánh giữa các mô hình
So sánh giữa các mô hình học máy giúp xác định mô hình nào hiệu quả nhất cho dữ liệu cụ thể. Việc này rất cần thiết để chọn lựa mô hình tốt nhất.
4.3. Thực nghiệm và kết quả
Thực nghiệm với dữ liệu thực tế cho thấy các mô hình học máy hiện đại có thể đạt được hiệu suất cao. Kết quả này khẳng định tính khả thi trong việc ứng dụng vào phân tích tình cảm.
V. Hướng nghiên cứu tương lai trong phân tích tình cảm
Các nghiên cứu tương lai trong phân tích tình cảm có thể tập trung vào việc cải thiện các mô hình hiện tại. Công nghệ mới và phương pháp mới sẽ được áp dụng để nâng cao hiệu quả phân tích. Việc áp dụng các kỹ thuật học sâu và khai thác dữ liệu lớn sẽ mở ra nhiều cơ hội.
5.1. Áp dụng học sâu trong phân tích tình cảm
Học sâu có thể giúp mô hình học được các đặc trưng phức tạp hơn từ dữ liệu. Điều này có thể dẫn đến những tiến bộ đáng kể trong phân tích tình cảm.
5.2. Khai thác dữ liệu lớn
Khai thác dữ liệu lớn sẽ cho phép phân tích trên quy mô rộng hơn. Việc này có thể giúp thu thập nhiều thông tin hơn về cảm xúc của người dùng.
5.3. Nghiên cứu đa ngôn ngữ
Nghiên cứu đa ngôn ngữ trong phân tích tình cảm sẽ mở rộng khả năng áp dụng của các mô hình. Điều này rất quan trọng trong bối cảnh toàn cầu hóa.
Tải xuống file đầy đủ để xem toàn bộ nội dung
Tải đầy đủ (140 trang)Trích đoạn nội dung luận án
Tải xuống để đọc toàn bộĐẠI HỌC —————————————– TÍCH HỢP ĐẶC TRƯNG NGÔN NGỮ VÀO MÔ HÌNH HỌC THỐNG KÊ CHO PHÂN TÍCH TÌNH CẢM LUẬN ÁN TIẾN SĨ KHOA HỌC MÁY TÍNH Chuyên ngành: Khoa học máy tính Mã số: 9480101.01 NGƯỜI HƯỚNG DẪN KHOA HỌC: 1.TS Lê Anh Cường 2.TS Nguyễn Lê Minh Mục lục Trang Lời cam đoan. Mục tiêu, đối tượng, phương pháp nghiên cứu của luận án. Các đóng góp chính của luận án. Bố cục của luận án.
TỔNG QUAN VỀ CÁC KỸ THUẬT PHÂN TÍCH TÌNH CẢM. Phân tích tình cảm và khai phá quan điểm. Nghiên cứu về phân tích tình cảm, khai phá quan điểm trên thế giới và trong nước. Các miền ứng dụng của phân tích tình cảm.
Công cụ và kỹ thuật phân tích dữ liệu. Các bài toán nghiên cứu trong phân tích tình cảm. Phân tích tình cảm mức tài liệu/câu. Phân tích tình cảm mức thực thể/khía cạnh.
Phân tích nội dung nghiên cứu. Dữ liệu nghiên cứu. Phân loại tính chủ quan. Phân tích tình cảm/quan điểm theo khía cạnh.
Các phương pháp biểu diễn văn bản. Phương pháp đánh giá hiệu năng. Kết luận chương. KỸ THUẬT CHUẨN HÓA DỮ LIỆU TIẾNG VIỆT TRONG PHÂN TÍCH TÌNH CẢM.
Phương pháp kiểm tra chính tả cho dữ liệu tình cảm tiếng Việt dạng Microblog sử dụng n-gram lớn. Động cơ nghiên cứu. Một số lỗi chính tả thường gặp. Phương pháp kiểm tra chính tả đề xuất.
Tiền xử lý dữ liệu. Thuật toán kiểm tra chính tả mở rộng ngữ cảnh ở cả hai phía. Mô hình ngôn ngữ n-gram lớn và nén n-gram. Thực nghiệm và đánh giá kết quả.
Phương pháp tách từ cho dữ liệu tình cảm tiếng Việt dạng Microblog. Động cơ nghiên cứu. Hiện tượng nhập nhằng trong tách từ tiếng Việt. Phương pháp tách từ dữ liệu tình cảm tiếng Việt dạng Microblog.
Phương pháp tách từ sử dụng kiểm tra chính tả. Thực nghiệm và đánh giá kết quả. Kết luận chương. PHÂN LOẠI CÂU CHỦ QUAN DỰA TRÊN TRÍCH CHỌN CÁC ĐẶC TRƯNG TỪ CÁC MẪU NGỮ PHÁP.
Phát biểu bài toán. Phương pháp trích xuất đặc trưng ngôn ngữ dựa trên các mẫu ngữ pháp cho phân loại câu chủ quan áp dụng cho dữ liệu tiếng Anh. Động cơ nghiên cứu. Mô hình phân loại câu chủ quan tiếng Anh.
Trích xuất đặc trưng. Thực hiện phân loại tính chủ quan. Thực nghiệm và đánh giá kết quả. Phương pháp học tự động các mẫu cho bài toán xác định câu chủ quan tiếng Việt.
Động cơ nghiên cứu. Quá trình học các mẫu từ loại. Dữ liệu huấn luyện. Định nghĩa các mẫu.
Trích xuất và đánh giá các mẫu. Thực hiện phân loại tính chủ quan. Thực nghiệm và đánh giá kết quả. Kết luận chương.
101 ii Chương 4. PHÂN TÍCH TÌNH CẢM/QUAN ĐIỂM THEO KHÍA CẠNH VỚI MÔ HÌNH CNN. Phát biểu bài toán. Động cơ nghiên cứu.
Mô hình hóa bài toán. Mô hình đề xuất. Mô hình CNN hai pha cho phân tích tình cảm/quan điểm theo khía cạnh. Mô hình CNN với các đặc trưng ngoài.
Thực nghiệm và đánh giá kết quả. Dữ liệu và Công cụ, môi trường thực nghiệm. Tiền xử lý dữ liệu. Các mô hình và các kết quả.
Đánh giá các kết quả. Kết luận chương. 116 Các kết quả và đóng góp của luận án. 116 Những hạn chế và hướng nghiên cứu tiếp theo.
118 iii Danh sách hình vẽ 2.1 Kiến trúc của phương pháp kiểm tra chính tả .2 Thuật toán kiểm tra và sửa lỗi chính tả .3 Ảnh hưởng của kích thước ngữ liệu đến hiệu năng của phương pháp .4 Sơ đồ thuật toán phát hiện nhập nhằng chồng chéo - ghép cặp lớn nhất từ bên trái .5 Sơ đồ thuật toán phát hiện nhập nhằng chồng chéo - ghép cặp lớn nhất từ bên phải .6 Thuật toán phát hiện nhập nhằng liên kết .7 Phương pháp tách từ sử dụng kiểm tra chính tả .8 Thuật toán kiểm tra lỗi viết tắt .1 Quá trình thực hiện trích chọn các đặc trưng ngôn ngữ cho phân loại câu chủ quan tiếng Anh .2 Sơ đồ thuật toán trích xuất các cụm từ sử dụng các mẫu ngữ pháp cho một câu vào đang xét .3 Quá trình học các mẫu từ loại .4 Sơ đồ thuật toán trích xuất các mẫu kiểu 1 .5 Sơ đồ thuật toán trích xuất các mẫu kiểu 2 .6 Kết quả phân loại sử dụng 1-gram và 2-gram .1 Mô hình CNN cho phân tích tình cảm/quan điểm theo khía cạnh.2 Hai pha của phân tích tình cảm/quan điểm theo khía cạnh.3 Mô hình CNN với các đặc trưng ngoài. 111 iv Danh sách bảng 1.1 Ma trận nhầm lẫn .1 Các kết quả nén n-gram .2 Ảnh hưởng của ngữ cảnh đến hiệu năng của phương pháp .3 So sánh độ chính xác phương pháp đề xuất và phương pháp kiểm tra chính tả Copcon .4 Phát hiện các nhập nhằng chồng chéo .5 Phát hiện các nhập nhằng liên kết .6 Từ điển các từ viết tắt .7 Dữ liệu huấn luyện của phương pháp kiểm tra chính tả .8 Dữ liệu đánh giá .9 Tách từ cho dữ liệu chuẩn và dữ liệu dạng Microblog .10 Một số lỗi kiểm tra chính tả và lỗi viết tắt ảnh hưởng đến hiệu năng của tách từ .11 Tách từ trên dữ liệu Microblog sau khi kiểm tra chính tả .12 Các trường hợp kiểm tra chính tả sai .1 Các mẫu ngữ pháp chứa các tính từ .2 Các mẫu ngữ pháp chứa các trạng từ .3 Các mẫu ngữ pháp chứa các động từ .4 Các mẫu ngữ pháp chứa các danh từ .5 Thống kê số lượng các mẫu ngữ pháp được trích xuất từ các câu chủ quan và khách quan.6 Bảng so sánh độ chính xác của các phương pháp .7 Bảng ví dụ gán nhãn chủ quan và khách quan cho dữ liệu Mi- croblog tiếng Việt .8 Các mẫu của kiểu 1 .9 Các mẫu của kiểu 2 .10 Các kết quả phân loại của 1-gram and 2-gram .11 Các kết quả phân loại của 1-gram và 2-gram (%) .12 Các kết quả phân loại của học các mẫu kiểu 1 .13 Các kết quả phân loại của học các mẫu loại 2 .14 Các mẫu được học từ kiểu 1 .15 Các mẫu được học từ kiểu 2 .16 Các kết quả phân lớp trên dữ liệu đánh giá .1 Các kết quả đánh giá. 114 vi Thuật ngữ và từ viết tắt Từ viết tắt Từ gốc Giải nghĩa - Tạm dịch NLP Natural Language Processing Xử lý ngôn ngự tự nhiêm SA Sentiment Analysis Phân tích tình cảm OM Opinion Mining khai phá quan điểm ML Machine Learning Học máy TF term frequency Tần suất xuất hiện TF-IDF term frequency – inverse docu- Tần suất xuất hiện trong tài ment frequency liệu VS.TF Normalized term frequency as Chuẩn hóa tần suất xuất in vector space model hiện như mô hình không gian vector BM25.TF normalized term frequency as Chuẩn hóa tần suất xuất in BM25 hiện như trong các mô hình xác suất (BM25) VS.IDF normalized IDF as in VS Chuẩn hóa tần xuất xuất hiên trong tài liệu như mô hình không gian vector BM25.IDF normalized IDF as in BM25 Chuẩn hóa tần xuất xuất hiên trong tài liệu như trong các mô hình xác suất (BM25) POS part-of-speech Nhãn từ loại LDA Latent Dirichlet Allocation Phân bố Dirichlet ẩn CRF Conditional Random Fields Các trường ngẫu nhiên có điều kiện HMM Hidden Markov Model Mô hình Markov ẩn KNN k-nearest neighbors K-láng giềng gần nhất CNN Convolutional Neural Network Mạng nơ-ron tích chập ABSA Aspect Based Sentiment Anal- Phân tích tình cảm theo ysis khía cạnh LSTM Long Short Term Memory Mô hình bộ nhớ dài ngắn VLSP Vietnamese Language and Xử lý tiếng nói và xử lý ngôn Speech Processing ngữ tiếng Việt CBOW Continuous Bag of Words Véc-tơ từ dựa trên tập các từ DB Double propagation Phương pháp lan truyền kép PCA Principal Component Analysis Phân tích thành phần chính vii SOM Self Organizing Maps Mạng nơ-ron nhân tạo tự tổ chức RNN Recurrent Neural Network Mạng hổi quy ME Maximum Entropy Phân loại dựa vào Entropy SVM Suport Vector Machine Máy véc-tơ hỗ trợ CC Coordinating conjunction Từ nối CD Cardinal number Số đếm DT Determiner Mạo từ IN Preposition or subordinating Giới từ hoặc từ kết nối phụ conjunction thuộc JJ Adjective Tính từ JJR Adjective, comparative Tính từ so sánh JJS Adjective, superlative Tính từ so sánh hơn MD Modal Trợ động từ NN Noun, singular or mass Danh từ đếm được và không đếm được NNS Noun, plural Danh từ số nhiều NNP Proper noun, singular Danh từ riêng số ít NNPS Proper noun, plural Danh từ riêng số nhiều PDT Predeterminer Từ chỉ định PRP Personal pronoun Đại từ nhân xưng PRP$ Possessive pronoun Đại từ sở hữu RB Adverb Trạng từ RBR Adverb, comparative Trạng từ so sánh RBS Adverb, superlative Trạng từ so sánh hơn TO to Giới từ VB Verb, base form Động từ VBD Verb, past tense Động từ thì quá khứ VBG Verb, gerund or present par- Danh động từ và hiện tại ticiple phân từ VBN Verb, past participle Quá khứ phân từ VBP Verb, non-3rd person singular Động từ hiện tại không phải present ngôi thứ 3 số ít VBZ Verb, 3rd person singular Động từ hiện tại ngôi thứ 3 present số ít viii Lời cam đoan Tôi xin cam đoan luận án “Tích hợp đặc trưng ngôn ngữ vào mô hình học thống kê cho phân tích tình cảm” là công trình nghiên cứu do tôi thực hiện dưới sự hướng dẫn của PGS. Lê Anh Cường và GS.
Nguyễn Lê Minh tại Bộ môn Khoa học Máy tính, Khoa Công nghệ Thông tin, Trường Đại học Công nghệ, Đại học Quốc gia Hà Nội. Các số liệu và kết quả trình bày trong luận án là trung thực, chưa được công bố bởi bất kỳ tác giả nào hay ở bất kỳ công trình nào khác. Tác giả 1 Lời cảm ơn Lời đầu tiên tôi xin gửi lời cảm ơn chân thành và sâu sắc đến thầy giáo, PGS. Lê Anh Cường và thầy giáo, GS.
Nguyễn Lê Minh, những người đã hướng dẫn, khuyến khích, truyền cảm hứng, chỉ bảo và tạo cho tôi những điều kiện tốt nhất từ khi bắt đầu làm nghiên cứu sinh đến khi hoàn thành luận án này. Tôi xin chân thành cảm ơn các Thầy/Cô giáo trong khoa Công nghệ Thông tin, trường Đại học Công nghệ, Đại học Quốc gia Hà Nội, đặc biệt là các Thầy/Cô trong Bộ môn Khoa học Máy tính đã luôn tâm huyết trong quá trình tình đào tạo, cung cấp cho tôi những kiến thức vô cùng quý giá, tạo điều kiện tốt nhất cho tôi về môi trường làm việc trong suốt quá trình học tập, nghiên cứu tại Trường. Tôi cũng xin trân trọng gửi lời cảm ơn tới GS. Akira Shimazu và Viện Khoa học và Công nghệ Tiên tiến Nhật bản; GS.
Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ
Câu hỏi thường gặp
Luận án "Tích hợp đặc trưng ngôn ngữ vào mô hình học thống kê tình cảm" nghiên cứu về vấn đề gì?
Tích hợp đặc trưng ngôn ngữ vào mô hình học thống kê tình cảm, cải thiện độ chính xác nhận diện cảm xúc.
Luận án "Tích hợp đặc trưng ngôn ngữ vào mô hình học thống kê tình cảm" thuộc chuyên ngành gì?
Luận án "Tích hợp đặc trưng ngôn ngữ vào mô hình học thống kê tình cảm" thuộc chuyên ngành Khoa học máy tính. Danh mục: Trí Tuệ Nhân Tạo.
Luận án "Tích hợp đặc trưng ngôn ngữ vào mô hình học thống kê tình cảm" có bao nhiêu trang?
Luận án "Tích hợp đặc trưng ngôn ngữ vào mô hình học thống kê tình cảm" có 140 trang. Bạn có thể xem trước một phần tài liệu ngay trên trang web trước khi tải về.
Cách tải luận án "Tích hợp đặc trưng ngôn ngữ vào mô hình học thống kê tình cảm" về máy như thế nào?
Để tải luận án về máy, bạn nhấn nút "Tải xuống ngay" trên trang này, sau đó hoàn tất thanh toán phí lưu trữ. File sẽ được tải xuống ngay sau khi thanh toán thành công. Hỗ trợ qua Zalo: 0559 297 239.