Luận án Tiến sĩ: Nghiên cứu nâng cao hiệu quả phân tích cú pháp tiếng Việt theo tiếp cận học máy thống kê - Đại học Quốc gia Hà Nội

Nghiên cứu ứng dụng học máy thống kê nâng cao hiệu quả phân tích cú pháp tiếng Việt. Đề xuất mô hình cải tiến độ chính xác đáng kể.

Tác giả

Luan An

Thể loại

Luận án tiến sĩ

Năm xuất bản

Số trang

193

Thời gian đọc

29 phút

Lượt xem

1

Lượt tải

0

Phí lưu trữ

50 Point

Tổng quan nhanh

Chủ đề:
Nâng cấp phân tích cú pháp tiếng Việt học máy
Số trang:
193 trang
Trường:
Trường Đại học Khoa học Tự nhiên, Đại học Quốc gia Hà Nội
Chuyên ngành:
Cơ sở toán cho tin học
Năm:

Tóm tắt nội dung luận án

I.Nâng cấp phân tích cú pháp tiếng Việt học máy

Phân tích cú pháp tiếng Việt đối mặt nhiều thách thức. Cấu trúc ngữ pháp phức tạp đòi hỏi phương pháp tiếp cận mới. Xử lý ngôn ngữ tự nhiên (NLP) tiếng Việt gặp khó khăn lớn. Tài liệu này tập trung nâng cao hiệu quả phân tích cú pháp. Nó sử dụng học máy thống kê (Statistical Machine Learning). Mục tiêu là cải thiện độ chính xác cho các hệ thống NLP. Việc này đặt nền móng cho nhiều ứng dụng thông minh. Các hệ thống hiện có còn nhiều hạn chế. Nghiên cứu đề xuất giải pháp toàn diện. Học máy thống kê khai thác dữ liệu lớn. Nó giúp mô hình hóa ngôn ngữ một cách hiệu quả.

1.1. Thách thức phân tích cú pháp tiếng Việt

Tiếng Việt có cấu trúc phức tạp. Xử lý ngôn ngữ tự nhiên (NLP) tiếng Việt đối mặt nhiều khó khăn. Tính đơn lập, thiếu hình thái làm tăng thách thức. Phân tích cú pháp tiếng Việt là một khâu quan trọng. Nó đặt nền móng cho các ứng dụng NLP cao cấp. Độ chính xác phân tích cú pháp cần được cải thiện. Các hệ thống hiện tại chưa đạt hiệu quả tối ưu. Cần có phương pháp tiếp cận mới.

1.2. Giải pháp học máy thống kê tiên tiến

Nghiên cứu áp dụng học máy thống kê. Mục tiêu là nâng cao hiệu quả phân tích cú pháp. Phương pháp này tận dụng sức mạnh dữ liệu. Các mô hình xác suất (Probabilistic Models) được sử dụng. Chúng học từ ngữ liệu lớn, có gắn nhãn. Đây là hướng tiếp cận chủ đạo trong NLP hiện đại. Học máy thống kê giúp giải quyết tính mơ hồ ngôn ngữ. Nó cung cấp cơ sở vững chắc để phát triển các hệ thống.

1.3. Tổng quan các phương pháp NLP liên quan

Tài liệu khảo sát nhiều phương pháp NLP. Phân tích cú pháp thành phần được xem xét. Phân tích cú pháp phụ thuộc (Dependency Parsing) cũng là trọng tâm. Gắn nhãn từ loại (POS Tagging) tiếng Việt là bước tiền xử lý quan trọng. Biểu diễn phân bố từ là kỹ thuật nền tảng. Các mô hình này giúp máy tính hiểu ngữ nghĩa từ. Chúng làm tăng khả năng học của các thuật toán.

II.Phát triển ngữ liệu tiếng Việt chuẩn cho NLP

Ngữ liệu tiếng Việt (Vietnamese Corpus) là tài nguyên cốt lõi. Tài liệu này mô tả chi tiết quá trình xây dựng. Hai kho ngữ liệu chính được phát triển. Đó là ngữ liệu cú pháp phụ thuộc và ngữ liệu gán nhãn vai nghĩa. Các kho này là nền tảng cho việc huấn luyện mô hình. Chúng đảm bảo tính chính xác và đồng bộ. Quy trình gán nhãn được thực hiện nghiêm ngặt. Việc hiệu chỉnh dữ liệu cũng rất quan trọng. Ngữ liệu chất lượng cao thúc đẩy nghiên cứu NLP tiếng Việt.

2.1. Xây dựng kho ngữ liệu cú pháp phụ thuộc

Kho ngữ liệu tiếng Việt là tài nguyên thiết yếu. Nghiên cứu đã xây dựng Treebank. Kho này gán nhãn cú pháp phụ thuộc. Tập nhãn quan hệ phụ thuộc tiếng Việt được định nghĩa. Việc xác định cụm từ trung tâm là bước quan trọng. Các nhãn phụ thuộc được gán một cách tỉ mỉ. Ngữ liệu này cung cấp dữ liệu huấn luyện. Nó giúp phát triển các mô hình phân tích cú pháp phụ thuộc.

2.2. Kho ngữ liệu gán nhãn vai nghĩa tiếng Việt

Kho ngữ liệu gán nhãn vai nghĩa được phát triển. Đây là tài nguyên quý giá cho học máy thống kê. Bộ nhãn vai nghĩa cho tiếng Việt được thiết lập. Các luật gán nhãn vai nghĩa được xây dựng. Một trang web hiệu chỉnh được tạo ra. Nó giúp kiểm tra và tinh chỉnh nhãn thô. Ngữ liệu này hỗ trợ bài toán gán nhãn vai nghĩa.

2.3. Quy trình gán nhãn và hiệu chỉnh dữ liệu

Quá trình xây dựng ngữ liệu rất công phu. Nó bao gồm nhiều bước chi tiết. Thuật toán chuyển từ câu cú pháp thành phần được phát triển. Nó tạo ra cú pháp phụ thuộc. Sau đó là đánh giá và hiệu chỉnh kết quả. Đảm bảo chất lượng ngữ liệu là ưu tiên hàng đầu. Ngữ liệu chất lượng cao cải thiện đáng kể hiệu suất mô hình.

III.Cải thiện phân tích cú pháp phụ thuộc tiếng Việt

Phân tích cú pháp phụ thuộc (Dependency Parsing) tiếng Việt là một trọng tâm chính. Nghiên cứu khám phá và tối ưu hóa các phương pháp hiện có. Nó tích hợp học sâu (Deep Learning) để đạt hiệu suất cao hơn. Cụ thể, mô hình Mạng nơ-ron (Neural Networks) BiLSTM được ứng dụng. Điều này giúp nắm bắt ngữ cảnh hiệu quả. Độ chính xác phân tích cú pháp được cải thiện rõ rệt. Kết quả được đánh giá kỹ lưỡng trên ngữ liệu chuẩn. So sánh với các hệ thống khác cho thấy sự vượt trội.

3.1. Các phương pháp phân tích cú pháp phụ thuộc

Phân tích cú pháp phụ thuộc (Dependency Parsing) là trọng tâm. Nghiên cứu khảo sát hai phương pháp chính. Đó là phân tích cú pháp dựa trên bước chuyển. Và phân tích cú pháp dựa trên đồ thị. Mỗi phương pháp có ưu nhược điểm riêng. Mục tiêu là tìm ra cách tiếp cận tối ưu cho tiếng Việt.

3.2. Sử dụng BiLSTM trong phân tích cú pháp

Học sâu (Deep Learning) được tích hợp. Mạng nơ-ron (Neural Networks) BiLSTM được ứng dụng. BiLSTM (Bi-directional Long Short-Term Memory) xử lý tốt chuỗi tuần tự. Nó giúp nắm bắt ngữ cảnh tốt hơn. Điều này cải thiện đáng kể độ chính xác. Đây là một bước tiến quan trọng trong NLP tiếng Việt.

3.3. Đánh giá hiệu suất phân tích cú pháp

Các mô hình được đánh giá kỹ lưỡng. Độ chính xác phân tích cú pháp là tiêu chí chính. Kết quả so sánh với các hệ thống khác. Nghiên cứu chứng minh sự vượt trội của phương pháp đề xuất. Cải thiện hiệu suất được ghi nhận rõ rệt. Đặc biệt là với các câu có cấu trúc phức tạp.

IV.Tối ưu gán nhãn vai nghĩa tiếng Việt hiệu quả

Bài toán gán nhãn vai nghĩa (Semantic Role Labeling - SRL) được giải quyết. Đây là một khía cạnh quan trọng của xử lý ngôn ngữ tự nhiên (NLP) tiếng Việt. Tài liệu đề xuất một phương pháp mới. Đó là quy hoạch tuyến tính nguyên (ILP). ILP giúp đảm bảo tính nhất quán của các nhãn. Nó tối ưu hóa kết quả gán nhãn toàn cục. Nghiên cứu cũng tập trung vào việc xây dựng đặc trưng. Biểu diễn phân bố từ đóng vai trò thiết yếu. Chúng cung cấp thông tin ngữ nghĩa phong phú cho mô hình.

4.1. Khảo sát phương pháp gán nhãn vai nghĩa

Bài toán gán nhãn vai nghĩa (Semantic Role Labeling - SRL) được nghiên cứu. Các công trình liên quan được khảo sát chi tiết. Các phương pháp hiện có được phân tích. Nhằm tìm ra những hạn chế và cơ hội cải tiến. SRL là một bước tiến tới hiểu ngôn ngữ tự nhiên sâu hơn.

4.2. Phương pháp quy hoạch tuyến tính nguyên đề xuất

Một phương pháp mới được đề xuất. Đó là quy hoạch tuyến tính nguyên (ILP). ILP giúp giải quyết các ràng buộc toàn cục. Nó đảm bảo tính nhất quán của các nhãn vai nghĩa. Cách tiếp cận này giúp tối ưu hóa kết quả gán nhãn. Độ chính xác gán nhãn vai nghĩa được cải thiện đáng kể.

4.3. Đặc trưng và biểu diễn từ trong SRL

Nghiên cứu sử dụng tập đặc trưng phong phú. Các đặc trưng cơ bản và đặc trưng mới được kết hợp. Biểu diễn phân bố từ đóng vai trò quan trọng. Các mô hình như Skip-gram, Continuous Bag of Words (CBOW), GloVe được ứng dụng. Biểu diễn từ dựa vào ngữ cảnh sâu cũng được khám phá. Chúng giúp nắm bắt ngữ nghĩa từ chính xác hơn.

V.Ứng dụng học sâu nâng cao hiệu quả NLP tiếng Việt

Học sâu (Deep Learning) là một công cụ mạnh mẽ trong NLP tiếng Việt. Nghiên cứu tích hợp các mô hình mạng nơ-ron (Neural Networks). Cụ thể là BiLSTM và self-attention. Các kỹ thuật này tự động trích xuất đặc trưng phức tạp. Chúng giảm thiểu sự phụ thuộc vào kỹ thuật thủ công. Biểu diễn phân bố từ dựa vào ngữ cảnh sâu cũng được ứng dụng. Điều này cải thiện đáng kể khả năng hiểu ngôn ngữ. Học sâu mở ra nhiều tiềm năng cho các ứng dụng NLP tiên tiến.

5.1. Mô hình mạng nơ ron trong phân tích cú pháp

Mạng nơ-ron (Neural Networks) là trọng tâm. Chúng mang lại đột phá cho NLP tiếng Việt. Mô hình BiLSTM được sử dụng cho phân tích cú pháp. Phương pháp self-attention cũng được khảo sát. Các mô hình học sâu này tự động trích xuất đặc trưng. Giảm thiểu sự phụ thuộc vào đặc trưng thủ công.

5.2. Biểu diễn phân bố từ dựa vào ngữ cảnh sâu

Kỹ thuật biểu diễn từ đã phát triển vượt bậc. Các mô hình như Word2Vec, GloVe cung cấp biểu diễn tĩnh. Nghiên cứu khám phá biểu diễn từ dựa vào ngữ cảnh sâu. Điều này cho phép từ có nhiều ý nghĩa khác nhau. Ví dụ về ngữ cảnh sâu có thể kể đến ELMo hay BERT. Chúng cải thiện khả năng hiểu ngữ nghĩa của mô hình.

5.3. Tiềm năng của học sâu cho NLP tiếng Việt

Học sâu (Deep Learning) mở ra nhiều tiềm năng. Nó thúc đẩy các ứng dụng NLP tiếng Việt. Từ dịch máy đến hỏi đáp tự động. Các hệ thống có thể đạt độ chính xác cao hơn. Đây là hướng nghiên cứu hứa hẹn. Học sâu tiếp tục định hình tương lai NLP.

VI.Độ chính xác phân tích cú pháp tiếng Việt vượt trội

Nghiên cứu đạt được những cải tiến đáng kể. Độ chính xác phân tích cú pháp tiếng Việt được nâng cao. Các kết quả được đánh giá trên các tập dữ liệu chuẩn. Nó thể hiện hiệu suất vượt trội so với hệ thống hiện có. Đặc biệt là trong phân tích cú pháp phụ thuộc. Nghiên cứu đóng góp quan trọng vào NLP tiếng Việt. Nó cung cấp các kho ngữ liệu và phương pháp tiên tiến. Đây là nền tảng vững chắc cho các nghiên cứu và ứng dụng tương lai.

6.1. Đánh giá kết quả trên các tập dữ liệu chuẩn

Kết quả nghiên cứu được đánh giá nghiêm ngặt. Sử dụng các tập dữ liệu chuẩn cho tiếng Việt. Các chỉ số như độ chính xác (accuracy) được đo lường. Phân tích cú pháp thành phần và phụ thuộc đều được đánh giá. Kho ngữ liệu tự xây dựng là cơ sở đánh giá.

6.2. So sánh với các hệ thống phân tích cú pháp hiện có

Hiệu suất được so sánh với các hệ thống tiên tiến. Bao gồm cả các nghiên cứu quốc tế. Phương pháp đề xuất cho thấy sự cải thiện rõ rệt. Đặc biệt là với tiếng Việt. Nó thể hiện tính hiệu quả và ứng dụng cao.

6.3. Đóng góp và ý nghĩa của nghiên cứu

Nghiên cứu tạo ra các kho ngữ liệu quan trọng. Nó đề xuất các phương pháp mới. Các phương pháp này nâng cao độ chính xác phân tích cú pháp. Đây là đóng góp lớn cho NLP tiếng Việt. Nó cung cấp nền tảng cho nghiên cứu và phát triển tiếp theo. Các ứng dụng thực tế sẽ được hưởng lợi.

Mục lục chi tiết luận án

Danh sách bảng
Danh sách hình vẽ
MỞ ĐẦU
1. CHƯƠNG 1: Cơ sở lý thuyết
1.1. Khái niệm cơ bản trong tiếng Việt
1.2. Cú pháp thành phần
1.2.1. Bài toán phân tích cú pháp thành phần
1.2.2. Phương pháp phân tích cú pháp thành phần
1.2.3. Khảo sát nghiên cứu cho phân tích cú pháp thành phần
1.3. Cú pháp phụ thuộc
1.3.1. Bài toán phân tích cú pháp phụ thuộc
1.3.2. Biểu diễn cú pháp phụ thuộc
1.3.3. Các thuật toán phân tích cú pháp phụ thuộc
1.3.4. Khảo sát nghiên cứu cho phân tích cú pháp phụ thuộc
1.4. Gán nhãn vai nghĩa
1.4.1. Bài toán gán nhãn vai nghĩa
1.4.2. Các công trình liên quan
1.4.3. Khảo sát nghiên cứu cho gán nhãn vai nghĩa
1.5. Biểu diễn phân bố từ
1.5.1. Mô hình Skip-gram
1.5.2. Mô hình túi từ liên tục
1.5.3. Mô hình GloVe
1.5.4. Biểu diễn từ dựa vào ngữ cảnh sâu
2. CHƯƠNG 2: Xây dựng kho ngữ liệu gán nhãn cú pháp phụ thuộc và vai nghĩa tiếng Việt
2.1. Kho ngữ liệu Treebank
2.2. Xây dựng kho ngữ liệu gán nhãn cú pháp phụ thuộc
2.2.1. Tập nhãn quan hệ phụ thuộc tiếng Việt
2.2.2. Xác định cụm từ trung tâm
2.2.3. Xác định nhãn phụ thuộc
2.2.4. Thuật toán chuyển từ câu cú pháp thành phần thành cú pháp phụ thuộc
2.3. Xây dựng kho ngữ liệu gán nhãn vai nghĩa tiếng Việt
2.3.1. Bộ nhãn vai nghĩa cho tiếng Việt
2.3.2. Tập luật gán nhãn nhãn vai nghĩa
2.3.3. Xây dựng trang web hiệu chỉnh nhãn vai nghĩa thô
2.3.4. Đánh giá kết quả
3. CHƯƠNG 3: Nâng cao hiệu quả phân tích cú pháp tiếng Việt
3.1. Phân tích cú pháp thành phần
3.1.1. Một số văn phạm phổ biến
3.1.2. Phương pháp phân tích Shift-Reduce
3.1.3. Phương pháp self-attention
3.1.4. Đánh giá kết quả
3.1.5. Kết luận phân tích cú pháp thành phần
3.2. Phân tích cú pháp phụ thuộc tiếng Việt
3.2.1. Phân tích cú pháp phụ thuộc dựa trên bước chuyển
3.2.2. Phân tích cú pháp dựa trên đồ thị
3.2.3. Sử dụng BiLSTM trong phân tích cú pháp phụ thuộc
3.2.4. Đánh giá kết quả
3.2.5. Kết luận phân tích cú pháp phụ thuộc
4. CHƯƠNG 4: Phương pháp quy hoạch tuyến tính nguyên gán nhãn vai nghĩa tiếng Việt
4.1. Mô tả thuật toán
4.1.1. Khảo sát một số phương pháp
4.1.2. Phương pháp đề xuất
4.2. Quy hoạch tuyến tính nguyên
4.3. Tập đặc trưng sử dụng
4.3.1. Đặc trưng cơ bản
4.3.2. Đặc trưng mới
4.4. Đánh giá kết quả
4.4.1. Phương pháp đánh giá
4.4.2. Hệ thống cơ bản
4.4.3. Chiến lược gán nhãn
4.4.4. Phân tích đặc trưng
4.4.5. Cải tiến dựa vào ILP
4.7. Sử dụng biểu diễn phân bố từ trong SRL
Kết luận
Các công trình công bố của luận án
Tài liệu tham khảo
Phụ lục
Xem trước tài liệu
Tải đầy đủ để xem toàn bộ nội dung
Luận án tiến sĩ hus nghiên cứu nâng cao hiệu quả phân tích cú pháp tiếng việt theo tiếp cận học máy thống kê

Tải xuống file đầy đủ để xem toàn bộ nội dung

Tải đầy đủ (193 trang)

Trích đoạn nội dung luận án

Tải xuống để đọc toàn bộ

ĐẠI HỌC QUỐC GIA HÀ NỘI TRƯỜNG ĐẠI HỌC KHOA HỌC TỰ NHIÊN _______________________ Nguyễn Thị Lương NGHIÊN CỨU NÂNG CAO HIỆU QUẢ PHÂN TÍCH CÚ PHÁP TIẾNG VIỆT THEO TIẾP CẬN HỌC MÁY THỐNG KÊ LUẬN ÁN TIẾN SĨ TOÁN HỌC Hà Nội - 2020 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com ĐẠI HỌC QUỐC GIA HÀ NỘI TRƯỜNG ĐẠI HỌC KHOA HỌC TỰ NHIÊN _______________________ Nguyễn Thị Lương NGHIÊN CỨU NÂNG CAO HIỆU QUẢ PHÂN TÍCH CÚ PHÁP TIẾNG VIỆT THEO TIẾP CẬN HỌC MÁY THỐNG KÊ Chuyên ngành: Cơ sở toán cho tin học Mã số: 9460117.02 LUẬN ÁN TIẾN SĨ TOÁN HỌC NGƯỜI HƯỚNG DẪN KHOA HỌC: TS. Lê Hồng Phương PGS. Đỗ Trung Tuấn XÁC NHẬN NCS ĐÃ CHỈNH SỬA THEO QUYẾT NGHỊ CỦA HỘI ĐỒNG ĐÁNH GIÁ LUẬN ÁN Chủ tịch hội đồng đánh giá Người hướng dẫn khoa học Luận án Tiến sĩ PGS. Phan Xuân Hiếu TS.

Lê Hồng Phương Hà Nội - 2020 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Lời cam đoan Tôi xin cam đoan đây là công trình nghiên cứu khoa học của tôi. Các số liệu sử dụng phân tích trong luận án có nguồn gốc rõ ràng, đã công bố theo đúng quy định. Các kết quả này chưa từng được công bố trong bất kỳ nghiên cứu nào khác. Hà Nội, ngày 10 tháng 3 năm 2020 Nghiên cứu sinh Nguyễn Thị Lương LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Lời cảm ơn Trong quá trình thực hiện đề tài “Nghiên cứu nâng cao hiệu quả phân tích cú pháp tiếng Việt theo tiếp cận học máy thống kê”, tôi đã nhận được rất nhiều sự giúp đỡ, tạo điều kiện của Ban Giám hiệu, thầy cô trong khoa Sau Đại học và khoa Toán - Cơ - Tin học của trường Đại học Khoa học Tự nhiên, Đại học Quốc gia Hà Nội.

Tôi xin bày tỏ lòng cảm ơn chân thành về sự giúp đỡ đó. Tôi xin bày tỏ lòng biết ơn sâu sắc tới TS. Lê Hồng Phương, PGS. Đỗ Trung Tuấn - những người thầy đã tận tình hướng dẫn trực tiếp cho tôi hoàn thành luận án này.

Tôi xin chân thành cảm ơn Ban Giám hiệu, thầy cô trong khoa Công nghệ Thông tin, trường Đại học Đà Lạt nơi tôi đang công tác và gia đình, bạn bè đã động viên, khích lệ, tạo điều kiện và giúp đỡ tôi trong suốt quá trình thực hiện và hoàn thành luận án này. Hà Nội, ngày 10 tháng 3 năm 2020 Nghiên cứu sinh Nguyễn Thị Lương LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Mục lục Danh sách bảng iv Danh sách hình vẽ vii Mở đầu 1 1 Cơ sở lý thuyết 7 1.1 Khái niệm cơ bản trong tiếng Việt .2 Cú pháp thành phần .1 Bài toán phân tích cú pháp thành phần .2 Phương pháp phân tích cú pháp thành phần .3 Khảo sát nghiên cứu cho phân tích cú pháp thành phần 25 1.3 Cú pháp phụ thuộc .1 Bài toán phân tích cú pháp phụ thuộc .2 Biểu diễn cú pháp phụ thuộc .3 Các thuật toán phân tích cú pháp phụ thuộc .4 Khảo sát nghiên cứu cho phân tích cú pháp phụ thuộc .4 Gán nhãn vai nghĩa .1 Bài toán gán nhãn vai nghĩa .2 Các công trình liên quan .3 Khảo sát nghiên cứu cho gán nhãn vai nghĩa .5 Biểu diễn phân bố từ .1 Mô hình Skip-gram .2 Mô hình túi từ liên tục .3 Mô hình GloVe .4 Biểu diễn từ dựa vào ngữ cảnh sâu. 54 i LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com 2 Xây dựng kho ngữ liệu gán nhãn cú pháp phụ thuộc và vai nghĩa tiếng Việt 55 2.1 Kho ngữ liệu Treebank .2 Xây dựng kho ngữ liệu gán nhãn cú pháp phụ thuộc .1 Tập nhãn quan hệ phụ thuộc tiếng Việt .2 Xác định cụm từ trung tâm .3 Xác định nhãn phụ thuộc .4 Thuật toán chuyển từ câu cú pháp thành phần thành cú pháp phụ thuộc .3 Xây dựng kho ngữ liệu gán nhãn vai nghĩa tiếng Việt .1 Bộ nhãn vai nghĩa cho tiếng Việt .2 Tập luật gán nhãn nhãn vai nghĩa .3 Xây dựng trang web hiệu chỉnh nhãn vai nghĩa thô .4 Đánh giá kết quả. 83 3 Nâng cao hiệu quả phân tích cú pháp tiếng Việt 86 3.1 Phân tích cú pháp thành phần .1 Một số văn phạm phổ biến .2 Phương pháp phân tích Shift-Reduce .3 Phương pháp self-attention .4 Đánh giá kết quả .5 Kết luận phân tích cú pháp thành phần .2 Phân tích cú pháp phụ thuộc tiếng Việt .1 Phân tích cú pháp phụ thuộc dựa trên bước chuyển .2 Phân tích cú pháp dựa trên đồ thị .3 Sử dụng BiLSTM trong phân tích cú pháp phụ thuộc .4 Đánh giá kết quả .5 Kết luận phân tích cú pháp phụ thuộc.

129 4 Phương pháp quy hoạch tuyến tính nguyên gán nhãn vai nghĩa tiếng Việt 130 4.1 Mô tả thuật toán .1 Khảo sát một số phương pháp .2 Phương pháp đề xuất. 132 ii LUAN VAN CHAT LUONG download : add luanvanchat@agmail.2 Quy hoạch tuyến tính nguyên .3 Tập đặc trưng sử dụng .1 Đặc trưng cơ bản .2 Đặc trưng mới .4 Đánh giá kết quả .1 Phương pháp đánh giá .2 Hệ thống cơ bản .3 Chiến lược gán nhãn .4 Phân tích đặc trưng .5 Cải tiến dựa vào ILP .7 Sử dụng biểu diễn phân bố từ trong SRL. 145 Kết luận 146 Các công trình công bố của luận án 148 Tài liệu tham khảo 150 Phụ lục 159 iii LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Danh sách bảng 1.1 Tập nhãn từ loại tiếng Việt.2 Tập nhãn cụm từ tiếng Việt.3 Tổ chức câu trong tiếng Việt.4 Tập nhãn mệnh đề tiếng Việt.5 Tập nhãn chức năng cú pháp tiếng Việt.6 Các đặc trưng dùng trong MSTParser .7 Các đặc trưng dùng trong MaltParser .8 Ví dụ về phân tích cú pháp dựa vào các bước chuyển.9 Kết quả một số nghiên cứu phân tích cú pháp phụ thuộc trên tiếng Anh và tiếng Trung .10 Kết quả một số nghiên cứu phân tích cú pháp phụ thuộc trên tiếng Việt .11 Một số nghiên cứu vai nghĩa đánh giá OntoNotes .1 Thống kê nhãn thành phần trong kho viettreebank .2 Một số kho ngữ liệu gán nhãn phụ thuộc tiếng Việt .3 So sánh tập nhãn phụ thuộc tiếng Việt với tập nhãn phụ thuộc đa ngôn ngữ (UD) và tập nhãn phụ thuộc tiếng Anh (SD).4 Tập quy tắc xác định phần tử trung tâm.5 Một số luật sử dụng để xác định nhãn phụ thuộc .6 Câu tiếng Việt theo định dạng CoNLL-X chưa được phân tích.7 Câu tiếng Việt theo định dạng CoNLL-X đã được phân tích phụ thuộc.8 Tập nhãn phụ thuộc nhóm Nguyễn Quốc Đạt[28] .9 Tập nhãn phụ thuộc của Nguyễn Kiêm Hiếu[28] .10 Tập nhãn phụ trợ tiếng Việt .11 Một số luật xác định gán nhãn vai nghĩa thô .12 Một số câu tiếng Việt gán nhãn vai nghĩa dạng thô .13 Một số nhãn vai nghĩa phổ biến .14 Một số câu tiếng Việt gán nhãn vai nghĩa .1 Tập luật sinh ra dữ liệu huấn luyện trong Shift-Reduce .2 Luật suy diễn trong phân tích cú pháp Shift-reduce mở rộng. 95 iv LUAN VAN CHAT LUONG download : add luanvanchat@agmail.3 Tập mẫu đặc trưng mở rộng .4 Dãy bước chuyển phân tích câu “Mảnh đất của đạn bom không còn người nghèo.5 Tập đặc trưng cơ bản .6 Đặc trưng cho phân tích cú pháp thành phần tiếng Việt .7 Kết quả với tập dữ liệu có số từ ≤ 10 .8 Kết quả với tập dữ liệu có số từ ≤ 35 .9 Một số kết quả phân tích theo mô hình tích hợp đặc trưng phân bố từ .10 So sánh F1 sử dụng đặc trưng CharLSTM và EMLo .11 Kết quả F1 khi độ dài của câu thay đổi sử dụng đặc trưng CharL- STM .12 Kết quả F1 khi độ dài của câu thay đổi sử dụng đặc trưng ELMo 106 3.13 Lỗi phân cụm trong phân tích cú pháp thành phần tiếng Việt .14 Kết quả của MaltParser.15 Kết quả của MSTParser.16 Đặc trưng MaltParser cho tiếng Việt .17 Đặc trưng MSTParser cho tiếng Việt .18 Đặc trưng Bist-parser phân tích cú pháp phụ thuộc dựa trên các bước chuyển .19 Kết quả phân tích cú pháp phụ thuộc với VTB_U trên MaltParser126 3.20 Kết quả phân tích cú pháp phụ thuộc với VTB_U trên MSTParser126 3.21 Kết quả phân tích cú pháp phụ thuộc với VTB_U trên Bist-Parser127 3.22 Kết quả phân tích cú pháp phụ thuộc với VTB trên Bist-Parser 127 3.23 Kết quả so sánh các phương pháp phân tích cú pháp phụ thuộc trên VTB_UD .24 Độ chính xác ASL của một số nhãn phụ thuộc trên VTB_UD .1 Độ chính xác của 3 thuật toán rút trích .2 Độ chính xác của hệ thống cơ bản .3 Độ chính xác của 2 chiến lược gán nhãn .4 Tập đặc trưng .5 Độ chính xác của tập đặc trưng trong bảng 4.6 Tập đặc trưng .7 Độ chính xác của tập đặc trưng trong bảng 4.8 Ảnh hưởng của ILP .9 Độ chính xác của mỗi loại đối số.

143 v LUAN VAN CHAT LUONG download : add luanvanchat@agmail.10 Độ chính xác của 2 thuật toán rút trích .11 Độ chính xác của hệ thống .12 Ảnh hưởng véctơ từ của vị tự .13 Ảnh hưởng véctơ từ của từ chính. 145 vi LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Danh sách hình vẽ 1 Các bước cơ bản trong xử lý ngôn ngữ tự nhiên. 1 2 Mô hình tổng quát phân tích cú pháp và gán nhãn vai nghĩa. 2 3 Biểu diễn cú pháp thành phần và cú pháp phụ thuộc của câu Nam đá bóng .1 Phân loại từ trong tiếng Việt.2 Cây cú pháp thành phần trong tiếng Việt.3 Quá trình phân tích cú pháp thành phần .4 Cấu trúc phụ thuộc.5 Đồ thị phụ thuộc của một câu tiếng Việt.6 Ví dụ về phân tích cú pháp dựa trên đồ thị.7 Câu tiếng Anh được gán nhãn vai nghĩa.8 Khung vị từ Communication trong FrameNet .9 Khung vị từ Cognition trong FrameNet .10 Mô hình CBOW .1 Cây cú pháp thành phần “Tôi mong_mỏi sự công_bằng được thực_hiện và trả lại cho họ.2 Cú pháp phụ thuộc câu “Tôi mong_mỏi sự công_bằng được thực_hiện và trả lại cho họ.3 Câu tiếng Việt được gán nhãn vai nghĩa.1 Toán tử thay thế .2 Toán tử nối .3 Quá trình phân tích cú pháp thành phần .4 Cây cú pháp thành phần “Mảnh đất của đạn bom không còn người nghèo.5 Mô hình phân tích cú pháp thành phần sử dụng phương pháp self-attention[53] .6 Bước mã hóa tổng quát[53] .7 Bước mã hóa tổng quát[53] .8 Minh họa gán nhãn thành phần lỗi giữa cụm động từ với mệnh đề trong tiếng Việt .9 Minh họa gán nhãn thành phần lỗi giữa cụm danh từ trong tiếng Việt.

108 vii LUAN VAN CHAT LUONG download : add luanvanchat@agmail.10 Minh họa gán nhãn thành phần lỗi cụm giới từ trong tiếng Việt 109 3.11 Minh họa gán nhãn thành phần lỗi cụm liên từ trong tiếng Việt 110 3.12 Minh họa lỗi gán nhãn thành phần giữa thành phần con và cấu trúc ngang cấp trong tiếng Việt.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Trích dẫn luận án này

Nguyễn Thị Lương (2020). Nâng cao hiệu quả phân tích cú pháp tiếng Việt theo học máy thống kê [Luận án tiến sĩ, Trường Đại học Khoa học Tự nhiên, Đại học Quốc gia Hà Nội]. LuanAn.net. https://luanan.net/ngon-ngu-hoc/ngon-ngu-hoc-ung-dung/nang-cao-hieu-qua-phan-tich-cua-phap-tieng-viet-theo-hoc-may-thong-ke

Câu hỏi thường gặp

Luận án "Nâng cao hiệu quả phân tích cú pháp tiếng Việt theo học máy thống kê" nghiên cứu về vấn đề gì?

Nghiên cứu ứng dụng học máy thống kê nâng cao hiệu quả phân tích cú pháp tiếng Việt. Đề xuất mô hình cải tiến độ chính xác đáng kể.

Luận án "Nâng cao hiệu quả phân tích cú pháp tiếng Việt theo học máy thống kê" được bảo vệ tại trường nào?

Luận án này được bảo vệ tại Trường Đại học Khoa học Tự nhiên, Đại học Quốc gia Hà Nội. Năm bảo vệ: 2020.

Luận án "Nâng cao hiệu quả phân tích cú pháp tiếng Việt theo học máy thống kê" thuộc chuyên ngành gì?

Luận án "Nâng cao hiệu quả phân tích cú pháp tiếng Việt theo học máy thống kê" thuộc chuyên ngành Cơ sở toán cho tin học. Danh mục: Ngôn Ngữ Học Ứng Dụng.

Luận án "Nâng cao hiệu quả phân tích cú pháp tiếng Việt theo học máy thống kê" có bao nhiêu trang?

Luận án "Nâng cao hiệu quả phân tích cú pháp tiếng Việt theo học máy thống kê" có 193 trang. Bạn có thể xem trước một phần tài liệu ngay trên trang web trước khi tải về.

Cách tải luận án "Nâng cao hiệu quả phân tích cú pháp tiếng Việt theo học máy thống kê" về máy như thế nào?

Để tải luận án về máy, bạn nhấn nút "Tải xuống ngay" trên trang này, sau đó hoàn tất thanh toán phí lưu trữ. File sẽ được tải xuống ngay sau khi thanh toán thành công. Hỗ trợ qua Zalo: 0559 297 239.

Luận án liên quan

Chia sẻ tài liệu: Facebook Twitter