Luận án: Cải tiến dịch máy thống kê Anh-Việt dựa vào đảo trật tự từ theo cây cú pháp
"Luận án tiến sĩ khoa học máy tính đề xuất phương pháp cải tiến chất lượng dịch Anh Việt dựa trên đảo trật tự từ theo cây cú pháp phụ thuộc."
Năm xuất bản
Số trang
146
Thời gian đọc
22 phút
Lượt xem
1
Lượt tải
0
Phí lưu trữ
40 Point
Tổng quan nhanh
- Chủ đề:
- 1. Cải thiện Dịch máy Anh-Việt: Vấn đề Đảo Trật Tự Từ
- Số trang:
- 146 trang
- Trường:
- Trường Đại học Công nghệ, Đại học Quốc gia Hà Nội
- Chuyên ngành:
- Khoa học máy tính
- Tác giả:
- Trần Hồng Việt
- Năm:
- 2019
Tóm tắt nội dung luận án
I. Cải thiện Dịch máy Anh Việt Vấn đề Đảo Trật Tự Từ
Dịch máy Anh-Việt đối mặt với thách thức lớn về trật tự từ. Sự khác biệt cấu trúc giữa hai ngôn ngữ đòi hỏi việc tái sắp xếp từ chính xác. Hệ thống dịch máy thống kê dựa trên cụm từ (PBSMT) thường gặp khó khăn trong việc mô hình hóa sự đảo trật tự từ phức tạp. Các phương pháp đảo cụm từ truyền thống còn đơn giản, dẫn đến chất lượng dịch chưa cao. Thứ tự từ không chính xác làm giảm đáng kể khả năng hiểu và độ tự nhiên của câu dịch. Việc cải thiện chất lượng dịch máy Anh-Việt phụ thuộc vào giải pháp hiệu quả cho bài toán này. Nâng cao khả năng xử lý cấu trúc câu Anh-Việt là trọng tâm nghiên cứu.
1.1. Thách thức Trật tự từ trong Dịch máy
Các ngôn ngữ có cấu trúc câu đa dạng. Tiếng Anh và tiếng Việt có sự khác biệt rõ rệt về cấu trúc ngữ pháp. Ví dụ, vị trí của tính từ, trạng từ hoặc các thành phần bổ ngữ khác nhau. Điều này gây khó khăn cho hệ thống dịch máy. Việc sinh ra thứ tự từ đúng trong ngôn ngữ đích là một vấn đề cốt lõi. Trật tự từ trong dịch máy cần được xử lý một cách hiệu quả để đảm bảo sự mạch lạc của câu. Giải quyết thách thức này sẽ cải thiện tổng thể chất lượng dịch.
1.2. Hạn chế của Dịch máy Thống kê hiện tại
Dịch máy thống kê dựa trên cụm từ (PBSMT) là một phương pháp phổ biến. Tuy nhiên, khả năng đảo trật tự từ của PBSMT còn hạn chế. Nó thường thực hiện việc đảo trật tự ở cấp độ cụm từ, chưa đủ linh hoạt để xử lý các phụ thuộc từ xa. Sự thiếu hụt mô hình hóa chính xác các khác biệt ngữ pháp giữa Anh và Việt làm giảm chất lượng bản dịch. Cần có các phương pháp tiên tiến hơn để giải quyết vấn đề này. Phương pháp này cũng cần tích hợp xử lý ngôn ngữ tự nhiên (NLP) sâu hơn.
1.3. Mục tiêu Cải thiện Chất lượng dịch
Mục tiêu chính là cải thiện chất lượng dịch máy Anh-Việt. Điều này được thực hiện thông qua việc giải quyết bài toán sắp xếp lại trật tự từ. Các từ trong câu nguồn cần được sắp xếp theo thứ tự gần nhất với câu đích. Phương pháp tiền xử lý được đề xuất. Nó sử dụng cây cú pháp phụ thuộc. Việc này nhằm nâng cao hiệu suất của hệ thống dịch máy thống kê dựa trên cụm từ. Kết quả mong đợi là một bản dịch với cấu trúc câu Anh-Việt tự nhiên hơn.
II. Giải pháp Đảo Trật Tự Từ bằng Cây Cú Pháp Phụ Thuộc
Cây cú pháp phụ thuộc mang lại giải pháp tiềm năng cho vấn đề đảo trật tự từ. Cấu trúc này kết nối tất cả các từ trong một câu, biểu diễn mối quan hệ ngữ pháp giữa chúng. Ưu điểm nổi bật của cây cú pháp phụ thuộc là khả năng nắm bắt các phụ thuộc giữa các từ xa nhau, cũng như các cấu trúc phụ thuộc địa phương. Điều này rất quan trọng trong việc hiểu cấu trúc câu nguồn. Việc tái sắp xếp từ dựa trên cấu trúc này có thể mang lại độ chính xác cao hơn. Đây là một hướng tiếp cận hiệu quả trong xử lý ngôn ngữ tự nhiên để tối ưu hóa trật tự từ trong dịch máy.
2.1. Vai trò của Cây cú pháp phụ thuộc
Cây cú pháp phụ thuộc cung cấp một biểu diễn ngữ pháp sâu sắc cho câu. Mỗi từ trong câu được gán một "đầu" (head) và các "phụ thuộc" (dependents). Mối quan hệ này giúp xác định chức năng ngữ pháp của từng từ. Với tiếng Anh, cây cú pháp phụ thuộc giúp phân tích cấu trúc phức tạp. Biểu diễn này tương ứng chặt chẽ với ngữ nghĩa. Nó cho phép phân tích mối quan hệ giữa các thành phần câu một cách rõ ràng. Việc này là nền tảng cho việc tái sắp xếp từ hiệu quả.
2.2. Tiền xử lý cho Tái sắp xếp từ
Phương pháp tiền xử lý sử dụng cây cú pháp phụ thuộc. Quá trình này diễn ra trước khi câu nguồn được đưa vào hệ dịch máy. Mục đích là điều chỉnh thứ tự từ trong câu nguồn để gần giống với thứ tự từ trong tiếng Việt. Các luật đảo trật tự được áp dụng trên cây cú pháp. Điều này giúp hệ thống dịch máy thống kê dựa trên cụm từ xử lý hiệu quả hơn. Kết quả là việc cải thiện chất lượng dịch máy. Đây là một bước quan trọng trong xử lý ngôn ngữ tự nhiên để tối ưu hóa trật tự từ trong dịch máy.
2.3. Ngữ pháp so sánh Anh Việt trong reordering
Việc nghiên cứu ngữ pháp so sánh Anh-Việt là cần thiết. Sự khác biệt về cấu trúc câu giữa hai ngôn ngữ đòi hỏi các luật đảo trật tự đặc thù. Cây cú pháp phụ thuộc giúp xác định các điểm khác biệt này. Ví dụ, vị trí của trạng từ, cụm giới từ, hay các mệnh đề phụ thuộc. Bằng cách ánh xạ các cấu trúc phụ thuộc của tiếng Anh sang tiếng Việt, việc tái sắp xếp từ trở nên chính xác hơn. Điều này giúp cải thiện đáng kể cấu trúc câu Anh-Việt được dịch. Nó là một yếu tố quan trọng để cải thiện chất lượng dịch.
III. Xây dựng Luật Đảo Trật Tự Từ Tự động với Học máy
Việc xây dựng luật đảo trật tự từ thủ công tốn thời gian và công sức. Do đó, luận án đề xuất phương pháp tự động hóa quá trình này. Việc tự động tạo luật đảo trật tự từ được coi là một bài toán học máy. Hệ thống dự đoán vị trí chính xác của các thành phần luật. Mục tiêu là đoán được thứ tự đúng của các câu trong ngôn ngữ nguồn. Thứ tự này phải tương ứng với thứ tự câu trong ngôn ngữ đích. Cách tiếp cận này giúp nâng cao chất lượng dịch máy Anh-Việt bằng cách tối ưu hóa quá trình tái sắp xếp từ.
3.1. Phương pháp Học máy trong dịch thuật
Học máy đóng vai trò quan trọng trong việc tự động hóa. Các thuật toán học máy có khả năng phân tích dữ liệu lớn. Chúng tìm ra các mẫu (patterns) trong các cặp câu song ngữ. Các bộ phân lớp (classifiers) được sử dụng để xác định thứ tự đúng của các quan hệ cha-con trên cây phân tích phụ thuộc. Việc này giúp hệ thống tự động học cách đảo trật tự từ một cách hiệu quả. Đây là một bước tiến lớn trong cải thiện chất lượng dịch máy và xử lý ngôn ngữ tự nhiên.
3.2. Khai thác đặc trưng ngôn ngữ
Luận án khai thác các đặc trưng ngôn ngữ sâu sắc. Các đặc trưng này được trích xuất từ cây phân tích phụ thuộc. Chúng bao gồm loại quan hệ phụ thuộc, POS tag, hoặc thông tin ngữ nghĩa. Việc sử dụng các đặc trưng này giúp các bộ phân lớp đưa ra quyết định chính xác hơn. Mục tiêu là xác định thứ tự đúng của các phân lớp quan hệ. Điều này cải thiện khả năng dự đoán thứ tự từ. Phương pháp này đóng góp vào việc xử lý ngôn ngữ tự nhiên hiệu quả, đặc biệt cho việc tái sắp xếp từ.
3.3. Ứng dụng Neural Machine Translation
Bên cạnh các bộ phân lớp truyền thống, luận án còn đề xuất phương pháp sử dụng mạng nơ-ron. Phương pháp này khai thác quan hệ giữa các cặp từ trên cây phân tích phụ thuộc. Việc biểu diễn dưới dạng word embedding mang lại ưu điểm lớn. Word embedding giúp mô hình hiểu được ngữ cảnh và mối quan hệ ngữ nghĩa giữa các từ. Mạng nơ-ron được huấn luyện để giải quyết bài toán đảo trật tự từ. Điều này xảy ra trước khi câu nguồn được đưa vào hệ dịch máy, nâng cao đáng kể chất lượng dịch. Kỹ thuật này, thường thấy trong Neural Machine Translation (NMT), được áp dụng để tối ưu hóa quá trình tiền xử lý cú pháp cho dịch máy Anh-Việt.
IV. Tối ưu Dịch máy Anh Việt Phương pháp Tiền xử lý Cú pháp
Việc tối ưu hóa dịch máy Anh-Việt đòi hỏi các phương pháp tiền xử lý hiệu quả. Đặc biệt, việc xử lý cú pháp trước khi dịch giúp cải thiện đáng kể kết quả. Luận án đã đề xuất hai cách tiếp cận chính: sử dụng luật thủ công và xây dựng luật tự động. Cả hai phương pháp đều dựa trên cây cú pháp phụ thuộc. Chúng nhằm mục đích sắp xếp lại trật tự từ trong câu nguồn để phù hợp hơn với cấu trúc tiếng Việt. Việc này giúp giảm thiểu lỗi do khác biệt về ngữ pháp so sánh Anh-Việt, từ đó nâng cao chất lượng dịch.
4.1. Luật đảo trật tự thủ công
Luật đảo trật tự thủ công được xây dựng dựa trên việc phân tích sâu các đặc trưng ngôn ngữ. Các nhà nghiên cứu lựa chọn những đặc trưng quan trọng trên cây cú pháp phụ thuộc. Ví dụ, xác định các mẫu cấu trúc cụ thể cần được đảo vị trí. Việc này đòi hỏi sự hiểu biết về ngữ pháp so sánh Anh-Việt. Áp dụng các luật này giúp nâng cao chất lượng hệ thống dịch máy Anh-Việt. Đây là một bước cơ bản nhưng hiệu quả để định hình cấu trúc câu, cải thiện trật tự từ trong dịch máy.
4.2. Luật đảo trật tự tự động
Để vượt qua giới hạn của luật thủ công, luận án phát triển phương pháp xây dựng luật đảo trật tự tự động. Đây là một vấn đề học máy, nơi hệ thống tự động dự đoán thứ tự từ chính xác. Các mô hình học máy được huấn luyện để nhận diện các mẫu đảo trật tự. Chúng sử dụng các đặc trưng từ cây phân tích phụ thuộc và biểu diễn word embedding. Phương pháp này cho phép hệ thống linh hoạt hơn, thích ứng với nhiều cấu trúc câu khác nhau. Nó cũng giảm bớt gánh nặng về việc thiết kế luật thủ công, hỗ trợ tái sắp xếp từ hiệu quả.
4.3. Ảnh hưởng lỗi phân tích cú pháp
Phân tích cú pháp không hoàn hảo có thể ảnh hưởng đến chất lượng dịch. Luận án đã tiến hành phân tích sâu sắc về tác động của các lỗi phân tích cú pháp. Việc áp dụng các luật đảo trật tự từ lên câu nguồn có thể bị sai lệch nếu cây cú pháp không chính xác. Các phân tích này mang lại cái nhìn quan trọng. Chúng giúp cải tiến các phương pháp đảo trật tự từ dựa trên cú pháp. Đồng thời, chúng thúc đẩy sự phát triển của công cụ phân tích cú pháp phụ thuộc, đặc biệt cho tiếng Việt. Điều này là rất quan trọng cho Xử lý ngôn ngữ tự nhiên.
V. Đánh giá và Nâng cao Chất lượng Dịch máy Anh Việt
Việc đánh giá chất lượng dịch máy là bước cuối cùng để xác định hiệu quả của các phương pháp đề xuất. Luận án đã thực hiện các thử nghiệm dịch từ tiếng Anh sang tiếng Việt. Kết quả được so sánh với các hệ thống dịch máy phổ biến. Mục tiêu là chứng minh sự vượt trội của phương pháp đảo trật tự từ dựa trên cây cú pháp phụ thuộc. Điều này khẳng định tiềm năng cải thiện chất lượng dịch. Đánh giá chất lượng dịch máy là yếu tố then chốt để xác nhận đóng góp của nghiên cứu.
5.1. Kết quả thử nghiệm dịch máy
Các thử nghiệm được thực hiện trên bộ dữ liệu IWSLT 2015. Đây là một bộ dữ liệu tiêu chuẩn trong nghiên cứu dịch máy. Hệ thống dịch được phát triển cho thấy sự cải thiện đáng kể. Các bản dịch có trật tự từ tự nhiên hơn và ngữ pháp chính xác hơn. Điều này chứng tỏ hiệu quả của việc tiền xử lý cú pháp. Kết quả xác nhận việc đảo trật tự từ là yếu tố then chốt. Việc này góp phần trực tiếp vào cải thiện chất lượng dịch máy Anh-Việt.
5.2. So sánh với hệ thống hiện có
Hệ thống dịch mới được so sánh với hai hệ thống phổ biến nhất hiện nay: Neural Machine Translation (NMT) và Phrase-Based Statistical Machine Translation (PBSMT). Kết quả cho thấy hệ thống của luận án đạt chất lượng dịch tốt hơn. Điều này đặc biệt ấn tượng khi so sánh với NMT, một công nghệ dịch máy tiên tiến. Sự vượt trội này nhấn mạnh tầm quan trọng của việc xử lý trật tự từ cụ thể cho cặp ngôn ngữ Anh-Việt. Đây là một đóng góp quan trọng cho lĩnh vực dịch máy, đặc biệt trong việc cải thiện chất lượng dịch.
5.3. Phát triển Xử lý ngôn ngữ tự nhiên
Các phân tích và kết quả không chỉ cải thiện chất lượng dịch. Chúng còn đóng góp vào sự phát triển của xử lý ngôn ngữ tự nhiên (NLP) nói chung. Việc hiểu rõ hơn về ảnh hưởng của lỗi phân tích cú pháp là rất giá trị. Nó mở ra hướng nghiên cứu mới để cải tiến các bộ phân tích cú pháp phụ thuộc, đặc biệt cho tiếng Việt. Điều này có ý nghĩa lớn đối với ngữ pháp so sánh Anh-Việt và cấu trúc câu Anh-Việt. Nó giúp tối ưu hóa các quy trình tái sắp xếp từ trong tương lai. Các nghiên cứu này cũng cung cấp cơ sở để phát triển các hệ thống học máy trong dịch thuật.
Mục lục chi tiết luận án
Tải xuống file đầy đủ để xem toàn bộ nội dung
Tải đầy đủ (146 trang)Trích đoạn nội dung luận án
Tải xuống để đọc toàn bộĐẠI HỌC QUỐC GIA HÀ NỘI TRƯỜNG ĐẠI HỌC CÔNG NGHỆ ——————— TRẦN HỒNG VIỆT CẢI TIẾN CHẤT LƯỢNG DỊCH MÁY THỐNG KÊ ANH-VIỆT DỰA VÀO ĐẢO TRẬT TỰ TỪ THEO CÂY CÚ PHÁP PHỤ THUỘC LUẬN ÁN TIẾN SĨ KHOA HỌC MÁY TÍNH Hà Nội - 2019 ĐẠI HỌC QUỐC GIA HÀ NỘI TRƯỜNG ĐẠI HỌC CÔNG NGHỆ ——————— TRẦN HỒNG VIỆT CẢI TIẾN CHẤT LƯỢNG DỊCH MÁY THỐNG KÊ ANH-VIỆT DỰA VÀO ĐẢO TRẬT TỰ TỪ THEO CÂY CÚ PHÁP PHỤ THUỘC Chuyên ngành: Khoa học máy tính Mã số: 9 48 01 01 01 LUẬN ÁN TIẾN SĨ KHOA HỌC MÁY TÍNH NGƯỜI HƯỚNG DẪN KHOA HỌC: 1. Nguyễn Lê Minh Hà Nội - 2019 Lời cam đoan Tôi xin cam đoan luận án này là kết quả nghiên cứu của tôi, được thực hiện dưới sự hướng dẫn của TS. Nguyễn Văn Vinh và PGS. Nguyễn Lê Minh.
Các nội dung trích dẫn từ các nghiên cứu của các tác giả khác trình bày trong luận án này được ghi rõ nguồn trong phần tài liệu tham khảo. Trần Hồng Việt TÓM TẮT Đảo trật tự từ là một trong các vấn đề quan trọng của dịch máy liên quan đến việc làm thế nào để sinh ra thứ tự các từ (cụm từ) chính xác trong ngôn ngữ đích. Trong hệ dịch máy thống kê dựa trên cụm từ (Phrase-Based Statistical Machine Translation - PBSMT)(Koehn và cộng sự, 2003; Och và Ney, 2004) [59, 89], việc đảo cụm từ vẫn còn đơn giản và chất lượng chưa cao. Bên cạnh đó, do các ngôn ngữ có nhiều đặc điểm khác nhau (đặc biệt sự khác nhau về thứ tự từ trong các ngôn ngữ) dẫn tới không thể mô hình hóa chính xác trong quá trình dịch [89].
Nhiều hướng nghiên cứu giải quyết vấn đề sắp xếp lại trật tự từ bên trong hệ thống dịch máy thống kê dựa trên cụm từ. Một số nghiên cứu theo hướng tiếp cận tiền xử lý cho vấn đề sắp xếp lại trật tự từ cho kết quả tốt, đảm bảo cân bằng giữa chất lượng dịch và thời gian giải mã qua thực hiện tiền xử lý quá trình sắp xếp lại. Với ưu điểm của cấu trúc cây cú pháp phụ thuộc: kết nối tất cả các từ trong một câu với khả năng nắm bắt phụ thuộc giữa các từ xa nhau với các cấu trúc phụ thuộc địa phương cũng như sự tương ứng chặt chẽ với ngữ nghĩa, luận án tập trung nghiên cứu đề tài: "Cải tiến chất lượng dịch máy thống kê Anh-Việt dựa vào đảo trật tự từ theo cây cú pháp phụ thuộc". Luận án tập trung giải quyết các tồn tại đã nêu thông qua bài toán: sắp xếp lại các từ của câu cần dịch trong ngôn ngữ nguồn theo thứ tự gần nhất có thể với câu được dịch trong ngôn ngữ đích.
Các đề xuất này thực hiện như bước tiền xử lý sử dụng cây cú pháp phụ thuộc đối với ngôn ngữ nguồn để đưa vào hệ dịch thống kê dựa trên cụm từ nhằm cải tiến chất lượng dịch máy. Kết quả dịch từ tiếng Anh sang tiếng Việt với bộ dữ liệu IWSLT 2015 trên hệ thống của chúng tôi tốt hơn hai hệ thống dịch phổ biến nhất hiện nay là NMT và PBSMT. Đóng góp của luận án cụ thể như sau: 2 • Thứ nhất, luận án đề xuất các luật đảo trật tự từ thủ công từ việc lựa chọn các đặc trưng về ngôn ngữ trên cây cú pháp phụ thuộc. Từ đó áp dụng phương pháp đảo trật tự từ để nâng cao chất lượng hệ thống dịch máy Anh-Việt.
• Thứ hai, luận án đề xuất phương pháp xây dựng luật đảo trật tự từ tự động. Chúng tôi coi việc xây dựng luật đảo trật tự từ như vấn đề học máy trong việc dự đoán chính xác vị trí các thành phần của luật để đoán thứ tự đúng các câu trong ngôn ngữ nguồn tương ứng với thứ tự câu ở ngôn ngữ đích. Với hai đề xuất gồm: – Khai thác các đặc trưng về ngôn ngữ và đề xuất phương pháp sử dụng các bộ phân lớp để giải quyết bài toán đảo trật tự từ. Cụ thể là xác định thứ tự đúng của các phân lớp quan hệ giữa cụm cha-con trên cây phân tích phụ thuộc biểu diễn câu đầu vào.
– Bằng việc khai thác quan hệ các cặp từ trên cây phân tích phụ thuộc và ưu điểm của việc biểu diễn dưới dạng word embedding, luận án đề xuất phương pháp sử dụng mạng nơ-ron để giải quyết bài toán đảo trật tự từ câu nguồn theo thứ tự từ câu đích trước khi đưa vào hệ dịch để nâng cao chất lượng dịch. • Thứ ba, luận án đưa ra phân tích ảnh hưởng của các lỗi phân tích cú pháp đến chất lượng dịch qua việc áp dụng các luật đảo trật tự từ đối với câu nguồn. Các phân tích này mang lại lợi ích cho việc cải tiến các phương pháp đảo trật tự từ dựa trên cú pháp và phát triển việc phân tích cú pháp phụ thuộc, đặc biệt với ngôn ngữ tiếng Việt. Từ khóa: dịch máy, dịch máy thống kê, tiền xử lý cú pháp, cú pháp phụ thuộc, dịch máy thống kê dựa trên cụm từ.
3 Mục lục Lời cảm ơn 8 Danh mục các chữ viết tắt 9 Danh sách hình vẽ 10 Danh sách bảng 13 Lời mở đầu 16 1 Tổng quan các vấn đề liên quan luận án 22 1.1 Tổng quan về dịch máy .2 Dịch máy thống kê .1 Cơ sở toán học .2 Cấu trúc hệ thống dịch máy .3 Dịch máy mạng nơ-ron .4 Phân tích cú pháp phụ thuộc .5 Vấn đề đảo trật tự từ trong dịch máy .1 Sự khác nhau về thứ tự từ giữa các ngôn ngữ .2 Đảo trật tự từ trong dịch máy .6 Bài toán đảo trật tự từ trong mô hình dịch máy dựa trên cụm từ 37 1.1 Mô hình dịch máy dựa trên cụm từ .2 Bài toán đảo trật từ tự dựa trên tiền xử lý .7 Các nghiên cứu liên quan .1 Sử dụng các luật thủ công cho vấn đề tiền xử lý .2 Sử dụng các luật tự động cho vấn đề tiền xử lý .8 Kết luận chương. 46 2 Phương pháp dựa vào luật thủ công cho bài toán đảo trật tự từ trong dịch máy thống kê 48 2.1 Phương pháp tiền xử lý cho bài toán đảo trật tự từ trong dịch máy .2 Các nghiên cứu liên quan .3 Tiền xử lý cú pháp phụ thuộc cho dịch máy thống kê .1 Phân tích hiện tượng ngôn ngữ và vấn đề sắp xếp lại .2 Luật chuyển đổi trật tự từ .3 Tập các luật đảo trật tự từ thủ công .4 Tập dữ liệu và cài đặt thực nghiệm .5 Kết quả thực nghiệm .4 Kết luận chương. 63 3 Phương pháp sử dụng luật trích xuất tự động bằng các bộ phân lớp quan hệ 65 3.1 Tiền xử lý dựa trên phân lớp cho dịch máy dựa trên cụm từ .1 Vấn đề tiền xử lý dựa trên phân lớp .2 Đặc trưng .3 Mô hình phân lớp .1 Tập dữ liệu và cấu hình thực nghiệm .2 Kết quả thực nghiệm .3 Kết luận chương. 76 5 4 Phương pháp sử dụng mạng nơ-ron kết hợp các thông tin ngữ cảnh 79 4.1 Thông tin ngữ cảnh từ word embedding .2 Mô hình đảo dựa trên mạng nơ-ron sử dụng cây cú pháp phụ thuộc cho dịch máy thống kê .1 Đặc trưng cho phân lớp và huấn luyện mô hình .2 Khung làm việc cho đảo trật tự từ .3 Thực nghiệm về phương pháp sử dụng mạng nơ-ron kết hợp thông tin ngữ cảnh .4 Phân tích và thảo luận .5 Kết luận chương.
94 5 Ảnh hưởng của cây cú pháp phụ thuộc đến chất lượng dịch máy Anh-Việt 96 5.2 Phân tích cú pháp phụ thuộc .1 Bài toán phân tích cú pháp phụ thuộc .2 Định dạng dữ liệu theo chuẩn CoNLL .3 Sử dụng tập nhãn cho cú pháp phụ thuộc .3 Ảnh hưởng của lỗi phân tích cú pháp phụ thuộc tới chất lượng dịch máy .1 Phương pháp phân tích lỗi .3 Phân tích nguyên nhân gây lỗi đảo trật tự từ .4 Đánh giá kết quả dịch và độ chính xác cây cú pháp phụ thuộc .5 Kết luận chương. 112 Kết luận 114 6 Danh mục công trình khoa học của tác giả liên quan đến luận án117 Tài liệu tham khảo 119 7 LỜI CẢM ƠN Tôi xin gửi lời cảm ơn sâu sắc đến TS. Nguyễn Văn Vinh và PGS. Nguyễn Lê Minh, hai Thầy đã trực tiếp hướng dẫn, chỉ bảo tận tình, luôn hỗ trợ và tạo những điều kiện tốt nhất cho tôi trong quá trình học tập và nghiên cứu.
Tôi xin gửi lời cảm ơn đến các Thầy/Cô giáo ở Khoa Công nghệ thông tin, Trường Đại học Công nghệ, Đại học Quốc gia Hà Nội, đặc biệt là các Thầy/Cô giáo ở Bộ môn Khoa học máy tính, những người đã trực tiếp giảng dạy và giúp đỡ tôi trong quá trình học tập và nghiên cứu ở trường. Tôi xin gửi cảm ơn đến GS. Nguyễn Thanh Thủy, PGS. Lê Sỹ Vinh, PGS.
Nguyễn Phương Thái, PGS. Phan Xuân Hiếu, TS. Trần Quốc Long, TS. Bùi Ngọc Thăng (Trường Đại học Công nghệ, Đại học Quốc gia Hà Nội), PGS.
Lê Thanh Hương (Trường Đại học Bách khoa Hà Nội), TS. Nguyễn Thị Minh Huyền (Trường Đại học Khoa học Tự nhiên, Đại học Quốc gia Hà Nội), TS. Ngô Xuân Bách (Học viện Công nghệ Bưu chính Viễn thông), TS. Nguyễn Việt Anh (Viện Công nghệ thông tin, Viện Hàn lâm Khoa học và Công nghệ Việt Nam) các Thầy/Cô đã có những góp ý chỉnh sửa để tôi hoàn thiện luận án.
Tôi xin gửi lời cảm ơn đến tất cả anh, chị, em và bạn bè đồng nghiệp ở Bộ môn Khoa học máy tính (Khoa Công nghệ thông tin, Trường Đại học Công nghệ, Đại học Quốc gia Hà Nội) đã giúp đỡ tôi trong thời gian làm nghiên cứu sinh. Cuối cùng, tôi xin gửi lời cảm ơn đến tất cả các thành viên trong gia đình đã luôn ủng hộ, chia sẻ, động viên và khích lệ tôi học tập, nghiên cứu. 8 Danh mục các chữ viết tắt MT Machine Translation (Dịch máy) NLP Natural Language Processing (Xử lý ngôn ngữ tự nhiên) POS-tags Part Of Speech tags (Nhãn từ loại) SMT Statistical Machine Translation (Dịch máy thống kê) PBSMT Phrase-Based Statistical Machine Translation (Dịch máy dựa trên cụm từ) NMT Neural Machine Translation (Dịch máy mạng nơ-ron) BLEU BiLingual Evaluation Understudy (Đánh giá độ hiểu ngữ liệu) SVM Support Vector Machine (Máy véc-tơ hỗ trợ) ME Maximum Entropy (Độ hỗn loạn cực đại) WEKA Waikato Environment for Knowledge Analysis (Môi trường Waikato cho phân tích tri thức) 9 Danh sách hình vẽ 1.1 Sơ đồ hình tháp thể hiện các hệ thống dịch máy khác nhau.2 Kiến trúc cơ bản của hệ thống dịch máy thống kê .3 Các bước xây dựng hệ thống dịch máy thống kê dựa trên cụm từ 28 1.4 Hệ thống dịch máy mạng nơ-ron .5 Biểu diễn đồ thị cây phân tích phụ thuộc với các nhãn quan hệ.6 Biểu diễn dạng cây với dữ liệu phụ thuộc định dạng CoNLL.
Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ
Trích dẫn luận án này
Trần Hồng Việt (2019). Cải tiến dịch máy Anh-Việt: Đảo trật tự từ [Luận án tiến sĩ, Trường Đại học Công nghệ - Đại học Quốc gia Hà Nội]. LuanAn.net. https://luanan.net/tai-lieu-khac/cai-tien-dich-may-thong-ke-anh-viet-dao-trat-tu-tu-cay-cu-phap
Câu hỏi thường gặp
Luận án "Cải tiến dịch máy Anh-Việt: Đảo trật tự từ" nghiên cứu về vấn đề gì?
"Luận án tiến sĩ khoa học máy tính đề xuất phương pháp cải tiến chất lượng dịch Anh Việt dựa trên đảo trật tự từ theo cây cú pháp phụ thuộc."
Luận án "Cải tiến dịch máy Anh-Việt: Đảo trật tự từ" được bảo vệ tại trường nào?
Luận án này được bảo vệ tại Trường Đại học Công nghệ - Đại học Quốc gia Hà Nội. Năm bảo vệ: 2019.
Luận án "Cải tiến dịch máy Anh-Việt: Đảo trật tự từ" thuộc chuyên ngành gì?
Luận án "Cải tiến dịch máy Anh-Việt: Đảo trật tự từ" thuộc chuyên ngành Khoa học máy tính. Danh mục: Tài liệu khác.
Luận án "Cải tiến dịch máy Anh-Việt: Đảo trật tự từ" có bao nhiêu trang?
Luận án "Cải tiến dịch máy Anh-Việt: Đảo trật tự từ" có 146 trang. Bạn có thể xem trước một phần tài liệu ngay trên trang web trước khi tải về.
Cách tải luận án "Cải tiến dịch máy Anh-Việt: Đảo trật tự từ" về máy như thế nào?
Để tải luận án về máy, bạn nhấn nút "Tải xuống ngay" trên trang này, sau đó hoàn tất thanh toán phí lưu trữ. File sẽ được tải xuống ngay sau khi thanh toán thành công. Hỗ trợ qua Zalo: 0559 297 239.