Luận Án Tiến Sĩ Cải Tiến Chất Lượng Dịch Máy Thống Kê Anh-Việt Dựa Vào Đảo Trật Từ Theo Cây Cú Pháp Phụ Thụ

Nghiên cứu cải tiến dịch máy thống kê Anh-Việt bằng học máy. Đề xuất phương pháp mới nâng cao độ chính xác và hiệu quả dịch thuật.

Tác giả

Luan An

Thể loại

Luận án tiến sĩ

Năm xuất bản

Số trang

146

Thời gian đọc

22 phút

Lượt xem

0

Lượt tải

0

Phí lưu trữ

40 Point

Tổng quan nhanh

Chủ đề:
Cải tiến chất lượng dịch máy Anh-Việt hiệu quả
Số trang:
146 trang
Trường:
Trường Đại học Công nghệ, Đại học Quốc gia Hà Nội
Chuyên ngành:
Khoa học máy tính
Tác giả:
Năm:

Tóm tắt nội dung luận án

I.Cải tiến chất lượng dịch máy Anh Việt hiệu quả

Luận án tập trung nghiên cứu 'Cải tiến chất lượng dịch máy thống kê Anh-Việt dựa vào đảo trật tự từ theo cây cú pháp phụ thuộc'. Đảo trật tự từ là một vấn đề quan trọng trong dịch máy, liên quan đến việc tạo ra thứ tự các từ (cụm từ) chính xác trong ngôn ngữ đích. Các ngôn ngữ có đặc điểm khác nhau, đặc biệt là sự khác biệt về thứ tự từ, khiến việc mô hình hóa chính xác trong quá trình dịch trở nên khó khăn. Điều này ảnh hưởng trực tiếp đến chất lượng dịch máy Anh-Việt. Mục tiêu là sắp xếp lại các từ của câu nguồn theo thứ tự gần nhất với câu đích. Các đề xuất thực hiện như bước tiền xử lý, sử dụng cây cú pháp phụ thuộc cho ngôn ngữ nguồn, nhằm nâng cao chất lượng dịch máy của hệ thống dịch thống kê dựa trên cụm từ.

1.1. Thách thức đảo trật tự từ trong dịch máy

Đảo trật tự từ là thách thức cốt lõi của dịch máy. Việc sinh ra thứ tự từ chính xác trong ngôn ngữ đích rất phức tạp. Nhiều ngôn ngữ, đặc biệt Anh và Việt, có trật tự từ khác biệt. Điều này cản trở việc mô hình hóa chính xác trong quá trình dịch. Vấn đề này làm giảm nghiêm trọng chất lượng dịch máy Anh-Việt đầu ra, khiến bản dịch trở nên thiếu tự nhiên và khó hiểu.

1.2. Hạn chế của mô hình dịch máy thống kê truyền thống

Mô hình dịch máy thống kê (SMT) dựa trên cụm từ (PBSMT) đơn giản hóa việc đảo cụm từ. Sự đơn giản này thường dẫn đến chất lượng dịch thấp. Các hệ thống PBSMT hiện tại gặp khó khăn với việc đảo trật tự phức tạp, đặc biệt với các cặp ngôn ngữ có cấu trúc khác biệt lớn. Cần có cơ chế tốt hơn để nâng cao chất lượng dịch máy, đồng thời tối ưu hóa dịch máy thống kê để đạt hiệu suất cao hơn.

II.Vấn đề đảo trật tự từ trong dịch máy thống kê

Việc đảo trật tự từ vẫn còn là một hạn chế lớn trong mô hình dịch máy thống kê (SMT) dựa trên cụm từ (PBSMT). Mặc dù có nhiều nghiên cứu giải quyết vấn đề sắp xếp lại trật tự từ, nhưng việc tìm ra giải pháp tối ưu vẫn là một thách thức. Đặc biệt, sự khác biệt lớn về cấu trúc và thứ tự từ giữa tiếng Anh và tiếng Việt yêu cầu một cách tiếp cận chuyên biệt. Luận án tập trung vào việc cải thiện điều này thông qua các kỹ thuật tiền xử lý sử dụng cú pháp phụ thuộc để đảm bảo dịch máy Anh-Việt chất lượng cao hơn.

2.1. Sự khác biệt thứ tự từ Anh Việt

Tiếng Anh và tiếng Việt có sự khác biệt cấu trúc cơ bản. Thứ tự từ thay đổi đáng kể giữa hai ngôn ngữ này. Dịch trực tiếp thường tạo ra câu sai ngữ pháp, làm mất đi sự tự nhiên của văn bản. Giải quyết sự khác biệt này rất quan trọng cho dịch máy Anh-Việt chất lượng và đảm bảo ngữ pháp bản dịch chính xác.

2.2. Ảnh hưởng đến tối ưu hóa dịch máy SMT

Đảo trật tự từ không chính xác làm giảm chất lượng đầu ra của SMT. Nó dẫn đến các câu không tự nhiên, khó hiểu và đôi khi sai nghĩa. Điều này khiến mô hình dịch máy thống kê (SMT) kém hiệu quả, mặc dù đã được huấn luyện mô hình dịch máy với lượng dữ liệu lớn. Vấn đề này ảnh hưởng trực tiếp đến tối ưu hóa dịch máy thống kê và đòi hỏi các giải pháp tiền xử lý mạnh mẽ.

2.3. Giải pháp tiền xử lý cho dịch máy chất lượng

Các phương pháp tiếp cận tiền xử lý cho vấn đề sắp xếp lại trật tự từ đã cho kết quả tốt. Sắp xếp lại từ trong ngôn ngữ nguồn trước khi dịch cải thiện kết quả đáng kể. Điều này cân bằng giữa chất lượng dịch và thời gian giải mã. Các phương pháp này nâng cao chất lượng dịch máy và đảm bảo dịch máy Anh-Việt chất lượng hơn, đặc biệt khi sử dụng các cấu trúc cú pháp phụ thuộc.

III.Phương pháp nâng cao chất lượng dịch máy SMT

Luận án đề xuất hai phương pháp chính để giải quyết vấn đề đảo trật tự từ và nâng cao chất lượng dịch máy. Một là xây dựng các luật đảo trật tự từ thủ công dựa trên đặc trưng ngôn ngữ. Hai là phát triển phương pháp xây dựng luật tự động bằng học máy. Cả hai phương pháp đều tận dụng ưu điểm của cây cú pháp phụ thuộc để đưa vào mô hình dịch máy thống kê (SMT) dưới dạng tiền xử lý. Việc này giúp cải thiện đáng kể dịch máy Anh-Việt chất lượng so với các hệ thống truyền thống.

3.1. Xây dựng luật đảo trật tự từ thủ công

Luận án đề xuất các luật đảo trật tự từ thủ công. Các luật này được hình thành từ việc lựa chọn các đặc trưng về ngôn ngữ trên cây cú pháp phụ thuộc. Phương pháp này áp dụng đảo trật tự từ như bước tiền xử lý. Nó nhằm nâng cao chất lượng dịch máy cho hệ thống Anh-Việt, bằng cách điều chỉnh cấu trúc câu nguồn gần với cấu trúc câu đích hơn.

3.2. Phát triển luật đảo trật tự từ tự động

Luận án cũng đề xuất phương pháp xây dựng luật đảo trật tự từ tự động. Việc xây dựng luật đảo trật tự từ được coi là bài toán học máy. Mục tiêu là dự đoán chính xác vị trí các thành phần luật, để đoán đúng thứ tự câu nguồn tương ứng với thứ tự câu đích. Đây là bước then chốt để tối ưu hóa dịch máy thống kê và giảm thiểu sự can thiệp thủ công.

3.3. Ứng dụng cây cú pháp phụ thuộc

Cấu trúc cây cú pháp phụ thuộc có nhiều ưu điểm. Nó kết nối tất cả các từ trong câu. Nó nắm bắt phụ thuộc giữa các từ xa nhau và các cấu trúc phụ thuộc địa phương. Nó có sự tương ứng chặt chẽ với ngữ nghĩa. Cấu trúc này được dùng trong tiền xử lý để huấn luyện mô hình dịch máy hiệu quả. Nó cải tiến chất lượng dịch máy Anh-Việt khi đưa vào mô hình dịch máy thống kê (SMT).

IV.Đề xuất mô hình tối ưu hóa dịch máy thống kê

Luận án tập trung giải quyết bài toán sắp xếp lại các từ của câu cần dịch trong ngôn ngữ nguồn theo thứ tự gần nhất có thể với câu được dịch trong ngôn ngữ đích. Các đề xuất này thực hiện như bước tiền xử lý, sử dụng cây cú pháp phụ thuộc đối với ngôn ngữ nguồn. Mục tiêu là đưa vào hệ dịch thống kê dựa trên cụm từ nhằm cải tiến chất lượng dịch máy. Hai phương pháp chính được đề xuất là khai thác đặc trưng ngôn ngữ bằng bộ phân lớp và sử dụng mạng nơ-ron để tối ưu hóa dịch máy thống kê dựa trên quan hệ cặp từ.

4.1. Khai thác đặc trưng ngôn ngữ bằng bộ phân lớp

Phương pháp khai thác các đặc trưng về ngôn ngữ. Sử dụng các bộ phân lớp để giải quyết bài toán đảo trật tự từ. Cụ thể, xác định thứ tự đúng của các phân lớp quan hệ cha-con. Các phân lớp này nằm trên cây phân tích phụ thuộc biểu diễn câu đầu vào. Điều này cải thiện dữ liệu đầu vào cho mô hình dịch máy thống kê (SMT) và góp phần nâng cao chất lượng dịch máy một cách có hệ thống.

4.2. Sử dụng mạng nơ ron cho đảo trật tự từ

Luận án khai thác quan hệ các cặp từ trên cây phân tích phụ thuộc và ưu điểm của việc biểu diễn dưới dạng word embedding. Mạng nơ-ron được đề xuất để giải quyết bài toán đảo trật tự từ. Câu nguồn được sắp xếp lại theo thứ tự từ câu đích trước khi đưa vào hệ dịch. Điều này giúp huấn luyện mô hình dịch máy hiệu quả hơn và nâng cao chất lượng dịch máy tổng thể. Đây cũng là bước tiến gần đến việc tích hợp các ý tưởng của dịch máy thần kinh (NMT) vào tiền xử lý SMT.

V.Kết quả đóng góp cải tiến chất lượng dịch máy

Các đề xuất trong luận án đã được triển khai và đánh giá chất lượng dịch máy thông qua các thử nghiệm thực tế. Kết quả cho thấy sự cải thiện đáng kể về chất lượng dịch máy Anh-Việt, vượt trội so với các hệ thống dịch phổ biến hiện nay. Điều này khẳng định hiệu quả của việc áp dụng các phương pháp tiền xử lý dựa trên cú pháp phụ thuộc để nâng cao chất lượng dịch máy thống kê và đưa ra những đóng góp cụ thể cho lĩnh vực dịch máy.

5.1. Hiệu suất dịch máy Anh Việt nâng cao

Kết quả dịch từ tiếng Anh sang tiếng Việt với bộ dữ liệu IWSLT 2015 trên hệ thống đã cải thiện. Hệ thống của luận án đạt chất lượng tốt hơn đáng kể. Điều này chứng minh hiệu quả trong việc nâng cao chất lượng dịch máy. Tập dữ liệu song ngữ Anh-Việt lớn đã giúp huấn luyện mô hình dịch máy mạnh mẽ và đánh giá chất lượng dịch máy một cách khách quan.

5.2. So sánh với NMT và PBSMT

Hệ thống dịch máy đề xuất của luận án tốt hơn hai hệ thống dịch phổ biến nhất hiện nay: dịch máy thần kinh (NMT)mô hình dịch máy thống kê (SMT) dựa trên cụm từ (PBSMT). Sự vượt trội này khẳng định giá trị của phương pháp tiền xử lý. Chỉ số BLEU thường được sử dụng để định lượng mức độ cải thiện này, cho thấy sự tiến bộ rõ rệt trong tối ưu hóa dịch máy thống kê.

VI.Phân tích lỗi cú pháp dịch máy Anh Việt chất lượng

Luận án cũng tiến hành phân tích sâu về ảnh hưởng của các lỗi phân tích cú pháp đến chất lượng dịch. Việc này mang lại cái nhìn quan trọng, giúp cải tiến chất lượng dịch máy trong tương lai. Các phân tích này hỗ trợ phát triển các phương pháp đảo trật tự từ dựa trên cú pháp và cải thiện quá trình phân tích cú pháp phụ thuộc, đặc biệt đối với ngôn ngữ tiếng Việt. Hướng nghiên cứu này cũng mở ra tiềm năng cho dịch máy thần kinh (NMT) chất lượng cao hơn.

6.1. Đánh giá ảnh hưởng lỗi phân tích cú pháp

Luận án đưa ra phân tích ảnh hưởng của các lỗi phân tích cú pháp. Các lỗi này phát sinh khi áp dụng các luật đảo trật tự từ đối với câu nguồn. Sự phân tích này mang lại lợi ích cho việc cải tiến các phương pháp đảo trật tự từ dựa trên cú pháp. Đây là bước quan trọng để huấn luyện mô hình dịch máy mạnh mẽ hơn và bền vững hơn trước các dữ liệu không hoàn hảo.

6.2. Hướng phát triển cho dịch máy thần kinh NMT

Các phân tích lỗi cú pháp mang lại lợi ích cho việc phát triển và cải tiến các phương pháp. Nó hỗ trợ phát triển việc phân tích cú pháp phụ thuộc, đặc biệt với ngôn ngữ tiếng Việt. Điều này góp phần vào việc tạo ra dịch máy Anh-Việt chất lượng cao hơn. Nó cũng mở đường cho dịch máy thần kinh (NMT) tiên tiến hơn. Cuối cùng, có thể giảm thiểu nhu cầu xử lý hậu chỉnh sửa (post-editing) trong các ứng dụng thực tế.

Mục lục chi tiết luận án

Lời cảm ơn
Danh mục các chữ viết tắt
Danh sách hình vẽ
Danh sách bảng
Lời mở đầu
1. CHƯƠNG 1: TỔNG QUAN CÁC VẤN ĐỀ LIÊN QUAN LUẬN ÁN
1.1. Tổng quan về dịch máy
1.2. Dịch máy thống kê
1.2.1. Cơ sở toán học
1.2.2. Cấu trúc hệ thống dịch máy
1.2.3. Dịch máy mạng nơ-ron
1.2.4. Phân tích cú pháp phụ thuộc
1.2.5. Vấn đề đảo trật tự từ trong dịch máy
1.2.5.1. Sự khác nhau về thứ tự từ giữa các ngôn ngữ
1.2.5.2. Đảo trật tự từ trong dịch máy
1.6. Bài toán đảo trật tự từ trong mô hình dịch máy dựa trên cụm từ
1.6.1. Mô hình dịch máy dựa trên cụm từ
1.6.2. Bài toán đảo trật từ tự dựa trên tiền xử lý
1.7. Các nghiên cứu liên quan
1.7.1. Sử dụng các luật thủ công cho vấn đề tiền xử lý
1.7.2. Sử dụng các luật tự động cho vấn đề tiền xử lý
1.8. Kết luận chương
2. CHƯƠNG 2: PHƯƠNG PHÁP DỰA VÀO LUẬT THỦ CÔNG CHO BÀI TOÁN ĐẢO TRẬT TỰ TỪ TRONG DỊCH MÁY THỐNG KÊ
2.1. Phương pháp tiền xử lý cho bài toán đảo trật tự từ trong dịch máy
2.2. Các nghiên cứu liên quan
2.3. Tiền xử lý cú pháp phụ thuộc cho dịch máy thống kê
2.3.1. Phân tích hiện tượng ngôn ngữ và vấn đề sắp xếp lại
2.3.2. Luật chuyển đổi trật tự từ
2.3.3. Tập các luật đảo trật tự từ thủ công
2.3.4. Tập dữ liệu và cài đặt thực nghiệm
2.3.5. Kết quả thực nghiệm
2.4. Kết luận chương
3. CHƯƠNG 3: PHƯƠNG PHÁP SỬ DỤNG LUẬT TRÍCH XUẤT TỰ ĐỘNG BẰNG CÁC BỘ PHÂN LỚP QUAN HỆ
3.1. Tiền xử lý dựa trên phân lớp cho dịch máy dựa trên cụm từ
3.1.1. Vấn đề tiền xử lý dựa trên phân lớp
3.1.2. Đặc trưng
3.1.3. Mô hình phân lớp
3.1.3.1. Tập dữ liệu và cấu hình thực nghiệm
3.1.3.2. Kết quả thực nghiệm
3.2. Kết luận chương
4. CHƯƠNG 4: PHƯƠNG PHÁP SỬ DỤNG MẠNG NƠ-RON KẾT HỢP CÁC THÔNG TIN NGỮ CẢNH
4.1. Thông tin ngữ cảnh từ word embedding
4.2. Mô hình đảo dựa trên mạng nơ-ron sử dụng cây cú pháp phụ thuộc cho dịch máy thống kê
4.2.1. Đặc trưng cho phân lớp và huấn luyện mô hình
4.2.2. Khung làm việc cho đảo trật tự từ
4.2.3. Thực nghiệm về phương pháp sử dụng mạng nơ-ron kết hợp thông tin ngữ cảnh
4.2.4. Phân tích và thảo luận
4.5. Kết luận chương
5. CHƯƠNG 5: ẢNH HƯỞNG CỦA CÂY CÚ PHÁP PHỤ THUỘC ĐẾN CHẤT LƯỢNG DỊCH MÁY ANH-VIỆT
5.2. Phân tích cú pháp phụ thuộc
5.2.1. Bài toán phân tích cú pháp phụ thuộc
5.2.2. Định dạng dữ liệu theo chuẩn CoNLL
5.2.3. Sử dụng tập nhãn cho cú pháp phụ thuộc
5.3. Ảnh hưởng của lỗi phân tích cú pháp phụ thuộc tới chất lượng dịch máy
5.3.1. Phương pháp phân tích lỗi
5.3.3. Phân tích nguyên nhân gây lỗi đảo trật tự từ
5.3.4. Đánh giá kết quả dịch và độ chính xác cây cú pháp phụ thuộc
5.5. Kết luận chương
Kết luận
Danh mục công trình khoa học của tác giả liên quan đến luận án
Tài liệu tham khảo
Xem trước tài liệu
Tải đầy đủ để xem toàn bộ nội dung
Luận án tiến sĩ cải tiến chất lượng dịch máy thống kê anh việt dựa vào đảo trật tự từ theo cây cú pháp phụ thuộc

Tải xuống file đầy đủ để xem toàn bộ nội dung

Tải đầy đủ (146 trang)

Trích đoạn nội dung luận án

Tải xuống để đọc toàn bộ

ĐẠI HỌC QUỐC GIA HÀ NỘI TRƯỜNG ĐẠI HỌC CÔNG NGHỆ ——————— TRẦN HỒNG VIỆT CẢI TIẾN CHẤT LƯỢNG DỊCH MÁY THỐNG KÊ ANH-VIỆT DỰA VÀO ĐẢO TRẬT TỰ TỪ THEO CÂY CÚ PHÁP PHỤ THUỘC LUẬN ÁN TIẾN SĨ KHOA HỌC MÁY TÍNH Hà Nội - 2019 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com ĐẠI HỌC QUỐC GIA HÀ NỘI TRƯỜNG ĐẠI HỌC CÔNG NGHỆ ——————— TRẦN HỒNG VIỆT CẢI TIẾN CHẤT LƯỢNG DỊCH MÁY THỐNG KÊ ANH-VIỆT DỰA VÀO ĐẢO TRẬT TỰ TỪ THEO CÂY CÚ PHÁP PHỤ THUỘC Chuyên ngành: Khoa học máy tính Mã số: 9 48 01 01 01 LUẬN ÁN TIẾN SĨ KHOA HỌC MÁY TÍNH NGƯỜI HƯỚNG DẪN KHOA HỌC: 1. Nguyễn Lê Minh Hà Nội - 2019 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Lời cam đoan Tôi xin cam đoan luận án này là kết quả nghiên cứu của tôi, được thực hiện dưới sự hướng dẫn của TS. Nguyễn Văn Vinh và PGS. Nguyễn Lê Minh.

Các nội dung trích dẫn từ các nghiên cứu của các tác giả khác trình bày trong luận án này được ghi rõ nguồn trong phần tài liệu tham khảo. Trần Hồng Việt LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com TÓM TẮT Đảo trật tự từ là một trong các vấn đề quan trọng của dịch máy liên quan đến việc làm thế nào để sinh ra thứ tự các từ (cụm từ) chính xác trong ngôn ngữ đích. Trong hệ dịch máy thống kê dựa trên cụm từ (Phrase-Based Statistical Machine Translation - PBSMT)(Koehn và cộng sự, 2003; Och và Ney, 2004) [59, 89], việc đảo cụm từ vẫn còn đơn giản và chất lượng chưa cao. Bên cạnh đó, do các ngôn ngữ có nhiều đặc điểm khác nhau (đặc biệt sự khác nhau về thứ tự từ trong các ngôn ngữ) dẫn tới không thể mô hình hóa chính xác trong quá trình dịch [89].

Nhiều hướng nghiên cứu giải quyết vấn đề sắp xếp lại trật tự từ bên trong hệ thống dịch máy thống kê dựa trên cụm từ. Một số nghiên cứu theo hướng tiếp cận tiền xử lý cho vấn đề sắp xếp lại trật tự từ cho kết quả tốt, đảm bảo cân bằng giữa chất lượng dịch và thời gian giải mã qua thực hiện tiền xử lý quá trình sắp xếp lại. Với ưu điểm của cấu trúc cây cú pháp phụ thuộc: kết nối tất cả các từ trong một câu với khả năng nắm bắt phụ thuộc giữa các từ xa nhau với các cấu trúc phụ thuộc địa phương cũng như sự tương ứng chặt chẽ với ngữ nghĩa, luận án tập trung nghiên cứu đề tài: "Cải tiến chất lượng dịch máy thống kê Anh-Việt dựa vào đảo trật tự từ theo cây cú pháp phụ thuộc". Luận án tập trung giải quyết các tồn tại đã nêu thông qua bài toán: sắp xếp lại các từ của câu cần dịch trong ngôn ngữ nguồn theo thứ tự gần nhất có thể với câu được dịch trong ngôn ngữ đích.

Các đề xuất này thực hiện như bước tiền xử lý sử dụng cây cú pháp phụ thuộc đối với ngôn ngữ nguồn để đưa vào hệ dịch thống kê dựa trên cụm từ nhằm cải tiến chất lượng dịch máy. Kết quả dịch từ tiếng Anh sang tiếng Việt với bộ dữ liệu IWSLT 2015 trên hệ thống của chúng tôi tốt hơn hai hệ thống dịch phổ biến nhất hiện nay là NMT và PBSMT. Đóng góp của luận án cụ thể như sau: 2 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com • Thứ nhất, luận án đề xuất các luật đảo trật tự từ thủ công từ việc lựa chọn các đặc trưng về ngôn ngữ trên cây cú pháp phụ thuộc. Từ đó áp dụng phương pháp đảo trật tự từ để nâng cao chất lượng hệ thống dịch máy Anh-Việt.

• Thứ hai, luận án đề xuất phương pháp xây dựng luật đảo trật tự từ tự động. Chúng tôi coi việc xây dựng luật đảo trật tự từ như vấn đề học máy trong việc dự đoán chính xác vị trí các thành phần của luật để đoán thứ tự đúng các câu trong ngôn ngữ nguồn tương ứng với thứ tự câu ở ngôn ngữ đích. Với hai đề xuất gồm: – Khai thác các đặc trưng về ngôn ngữ và đề xuất phương pháp sử dụng các bộ phân lớp để giải quyết bài toán đảo trật tự từ. Cụ thể là xác định thứ tự đúng của các phân lớp quan hệ giữa cụm cha-con trên cây phân tích phụ thuộc biểu diễn câu đầu vào.

– Bằng việc khai thác quan hệ các cặp từ trên cây phân tích phụ thuộc và ưu điểm của việc biểu diễn dưới dạng word embedding, luận án đề xuất phương pháp sử dụng mạng nơ-ron để giải quyết bài toán đảo trật tự từ câu nguồn theo thứ tự từ câu đích trước khi đưa vào hệ dịch để nâng cao chất lượng dịch. • Thứ ba, luận án đưa ra phân tích ảnh hưởng của các lỗi phân tích cú pháp đến chất lượng dịch qua việc áp dụng các luật đảo trật tự từ đối với câu nguồn. Các phân tích này mang lại lợi ích cho việc cải tiến các phương pháp đảo trật tự từ dựa trên cú pháp và phát triển việc phân tích cú pháp phụ thuộc, đặc biệt với ngôn ngữ tiếng Việt. Từ khóa: dịch máy, dịch máy thống kê, tiền xử lý cú pháp, cú pháp phụ thuộc, dịch máy thống kê dựa trên cụm từ.

3 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Mục lục Lời cảm ơn 8 Danh mục các chữ viết tắt 9 Danh sách hình vẽ 10 Danh sách bảng 13 Lời mở đầu 16 1 Tổng quan các vấn đề liên quan luận án 22 1.1 Tổng quan về dịch máy .2 Dịch máy thống kê .1 Cơ sở toán học .2 Cấu trúc hệ thống dịch máy .3 Dịch máy mạng nơ-ron .4 Phân tích cú pháp phụ thuộc .5 Vấn đề đảo trật tự từ trong dịch máy .1 Sự khác nhau về thứ tự từ giữa các ngôn ngữ .2 Đảo trật tự từ trong dịch máy .6 Bài toán đảo trật tự từ trong mô hình dịch máy dựa trên cụm từ 37 1.1 Mô hình dịch máy dựa trên cụm từ .2 Bài toán đảo trật từ tự dựa trên tiền xử lý. 39 4 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.7 Các nghiên cứu liên quan .1 Sử dụng các luật thủ công cho vấn đề tiền xử lý .2 Sử dụng các luật tự động cho vấn đề tiền xử lý .8 Kết luận chương. 46 2 Phương pháp dựa vào luật thủ công cho bài toán đảo trật tự từ trong dịch máy thống kê 48 2.1 Phương pháp tiền xử lý cho bài toán đảo trật tự từ trong dịch máy .2 Các nghiên cứu liên quan .3 Tiền xử lý cú pháp phụ thuộc cho dịch máy thống kê .1 Phân tích hiện tượng ngôn ngữ và vấn đề sắp xếp lại .2 Luật chuyển đổi trật tự từ .3 Tập các luật đảo trật tự từ thủ công .4 Tập dữ liệu và cài đặt thực nghiệm .5 Kết quả thực nghiệm .4 Kết luận chương. 63 3 Phương pháp sử dụng luật trích xuất tự động bằng các bộ phân lớp quan hệ 65 3.1 Tiền xử lý dựa trên phân lớp cho dịch máy dựa trên cụm từ .1 Vấn đề tiền xử lý dựa trên phân lớp .2 Đặc trưng .3 Mô hình phân lớp .1 Tập dữ liệu và cấu hình thực nghiệm .2 Kết quả thực nghiệm .3 Kết luận chương.

76 5 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com 4 Phương pháp sử dụng mạng nơ-ron kết hợp các thông tin ngữ cảnh 79 4.1 Thông tin ngữ cảnh từ word embedding .2 Mô hình đảo dựa trên mạng nơ-ron sử dụng cây cú pháp phụ thuộc cho dịch máy thống kê .1 Đặc trưng cho phân lớp và huấn luyện mô hình .2 Khung làm việc cho đảo trật tự từ .3 Thực nghiệm về phương pháp sử dụng mạng nơ-ron kết hợp thông tin ngữ cảnh .4 Phân tích và thảo luận .5 Kết luận chương. 94 5 Ảnh hưởng của cây cú pháp phụ thuộc đến chất lượng dịch máy Anh-Việt 96 5.2 Phân tích cú pháp phụ thuộc .1 Bài toán phân tích cú pháp phụ thuộc .2 Định dạng dữ liệu theo chuẩn CoNLL .3 Sử dụng tập nhãn cho cú pháp phụ thuộc .3 Ảnh hưởng của lỗi phân tích cú pháp phụ thuộc tới chất lượng dịch máy .1 Phương pháp phân tích lỗi .3 Phân tích nguyên nhân gây lỗi đảo trật tự từ .4 Đánh giá kết quả dịch và độ chính xác cây cú pháp phụ thuộc .5 Kết luận chương. 112 Kết luận 114 6 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com Danh mục công trình khoa học của tác giả liên quan đến luận án117 Tài liệu tham khảo 119 7 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com LỜI CẢM ƠN Tôi xin gửi lời cảm ơn sâu sắc đến TS. Nguyễn Văn Vinh và PGS.

Nguyễn Lê Minh, hai Thầy đã trực tiếp hướng dẫn, chỉ bảo tận tình, luôn hỗ trợ và tạo những điều kiện tốt nhất cho tôi trong quá trình học tập và nghiên cứu. Tôi xin gửi lời cảm ơn đến các Thầy/Cô giáo ở Khoa Công nghệ thông tin, Trường Đại học Công nghệ, Đại học Quốc gia Hà Nội, đặc biệt là các Thầy/Cô giáo ở Bộ môn Khoa học máy tính, những người đã trực tiếp giảng dạy và giúp đỡ tôi trong quá trình học tập và nghiên cứu ở trường. Tôi xin gửi cảm ơn đến GS. Nguyễn Thanh Thủy, PGS.

Lê Sỹ Vinh, PGS. Nguyễn Phương Thái, PGS. Phan Xuân Hiếu, TS. Trần Quốc Long, TS.

Bùi Ngọc Thăng (Trường Đại học Công nghệ, Đại học Quốc gia Hà Nội), PGS. Lê Thanh Hương (Trường Đại học Bách khoa Hà Nội), TS. Nguyễn Thị Minh Huyền (Trường Đại học Khoa học Tự nhiên, Đại học Quốc gia Hà Nội), TS. Ngô Xuân Bách (Học viện Công nghệ Bưu chính Viễn thông), TS.

Nguyễn Việt Anh (Viện Công nghệ thông tin, Viện Hàn lâm Khoa học và Công nghệ Việt Nam) các Thầy/Cô đã có những góp ý chỉnh sửa để tôi hoàn thiện luận án. Tôi xin gửi lời cảm ơn đến tất cả anh, chị, em và bạn bè đồng nghiệp ở Bộ môn Khoa học máy tính (Khoa Công nghệ thông tin, Trường Đại học Công nghệ, Đại học Quốc gia Hà Nội) đã giúp đỡ tôi trong thời gian làm nghiên cứu sinh. Cuối cùng, tôi xin gửi lời cảm ơn đến tất cả các thành viên trong gia đình đã luôn ủng hộ, chia sẻ, động viên và khích lệ tôi học tập, nghiên cứu. 8 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Trích dẫn luận án này

Trần Hồng Việt (2019). Cải Tiến Chất Lượng Dịch Máy Thống Kê Anh-Việt [Luận án tiến sĩ, Trường Đại học Công nghệ, Đại học Quốc gia Hà Nội]. LuanAn.net. https://luanan.net/cong-nghe-thong-tin/khoa-hoc-may-tinh/cai-tien-chat-luong-dich-may-thong-ke-anh-viet

Câu hỏi thường gặp

Luận án "Cải Tiến Chất Lượng Dịch Máy Thống Kê Anh-Việt" nghiên cứu về vấn đề gì?

Nghiên cứu cải tiến dịch máy thống kê Anh-Việt bằng học máy. Đề xuất phương pháp mới nâng cao độ chính xác và hiệu quả dịch thuật.

Luận án "Cải Tiến Chất Lượng Dịch Máy Thống Kê Anh-Việt" được bảo vệ tại trường nào?

Luận án này được bảo vệ tại Trường Đại học Công nghệ, Đại học Quốc gia Hà Nội. Năm bảo vệ: 2019.

Luận án "Cải Tiến Chất Lượng Dịch Máy Thống Kê Anh-Việt" thuộc chuyên ngành gì?

Luận án "Cải Tiến Chất Lượng Dịch Máy Thống Kê Anh-Việt" thuộc chuyên ngành Khoa học máy tính. Danh mục: Khoa Học Máy Tính.

Luận án "Cải Tiến Chất Lượng Dịch Máy Thống Kê Anh-Việt" có bao nhiêu trang?

Luận án "Cải Tiến Chất Lượng Dịch Máy Thống Kê Anh-Việt" có 146 trang. Bạn có thể xem trước một phần tài liệu ngay trên trang web trước khi tải về.

Cách tải luận án "Cải Tiến Chất Lượng Dịch Máy Thống Kê Anh-Việt" về máy như thế nào?

Để tải luận án về máy, bạn nhấn nút "Tải xuống ngay" trên trang này, sau đó hoàn tất thanh toán phí lưu trữ. File sẽ được tải xuống ngay sau khi thanh toán thành công. Hỗ trợ qua Zalo: 0559 297 239.

Luận án liên quan

Chia sẻ tài liệu: Facebook Twitter