Luận án máy dịch cho ngôn ngữ ít nguồn - Nghiên cứu của Triệu, Long Hải
Nghiên cứu mô hình dịch máy hiệu quả cho ngôn ngữ ít nguồn. Đề xuất phương pháp cải tiến dựa trên học sâu.
Japan Advanced Institute of Science and Technology
Information Science
Luan An
Luận án tiến sĩ
Năm xuất bản
Số trang
115
Thời gian đọc
18 phút
Lượt xem
1
Lượt tải
0
Phí lưu trữ
40 Point
Tổng quan nhanh
- Chủ đề:
- 1. Tổng quan nghiên cứu máy dịch cho các ngôn ngữ ít nguồn
- Số trang:
- 115 trang
- Trường:
- Japan Advanced Institute of Science and Technology
- Chuyên ngành:
- Information Science
- Tác giả:
- Trieu, Long Hai
- Năm:
- 2017
Tóm tắt nội dung luận án
I. Tổng quan nghiên cứu máy dịch cho các ngôn ngữ ít nguồn
Nghiên cứu máy dịch đóng vai trò then chốt trong kỷ nguyên số hóa. Đa số các hệ thống dịch tự động phụ thuộc vào kho dữ liệu quy mô lớn. Các mô hình truyền thống yêu cầu lượng văn bản tương ứng khổng lồ để học quy tắc. Nhiều thứ tiếng trên thế giới lại thiếu thốn dữ liệu nghiêm trọng. Tình trạng này tạo ra điểm nghẽn kỹ thuật lớn. Các ngôn ngữ ít tài nguyên không có đủ tài liệu để huấn luyện thuật toán. Khoảng cách kỹ thuật giữa các ngôn ngữ ngày càng nới rộng. Việc phát triển công nghệ dịch thuật cho nhóm ngôn ngữ này là nhiệm vụ cấp bách. Mục tiêu chính là mở rộng khả năng tiếp cận thông tin toàn cầu. Công nghệ cần hỗ trợ giao tiếp đa văn hóa liền mạch. Các giải pháp mới giúp bảo tồn tri thức bản địa quý giá. Sự phát triển này thúc đẩy bình đẳng trong tiếp cận công nghệ thông tin.
1.1. Thách thức cốt lõi từ sự thiếu hụt dữ liệu huấn luyện
Hầu hết hệ thống dịch thuật dựa trên ngữ liệu song ngữ để tự động trích xuất quy luật. Dữ liệu song ngữ chất lượng cao phân bố không đồng đều. Phần lớn kho ngữ liệu tập trung vào các thứ tiếng phổ biến như tiếng Anh, tiếng Pháp hoặc tiếng Trung. Các ngôn ngữ ít tài nguyên chịu thiệt thòi lớn do thiếu văn bản số hóa. Việc thu thập tài liệu dịch chuẩn tốn nhiều thời gian và chi phí. Độ bao phủ từ vựng trong các tập dữ liệu nhỏ thường rất thấp. Hiện tượng từ hiếm và cấu trúc câu phức tạp gây khó khăn cho việc huấn luyện. Mô hình dịch máy nơ-ron dễ gặp hiện tượng quá khớp khi thiếu mẫu câu. Khả năng khái quát hóa của hệ thống bị suy giảm nghiêm trọng. Hiệu năng dịch thực tế vì vậy sụt giảm rõ rệt. Vấn đề khan hiếm ngữ liệu trở thành rào cản kỹ thuật hàng đầu.
1.2. Tầm quan trọng của giải pháp dịch thuật hiện đại
Việc nghiên cứu máy dịch cho các ngôn ngữ ít nguồn mang lại giá trị thực tiễn cao. Hàng triệu người sử dụng ngôn ngữ thiểu số cần tiếp cận tri thức giáo dục và y tế. Dịch tự động giúp xóa bỏ rào cản ngôn ngữ trong thương mại và giao lưu văn hóa. Phát triển công cụ dịch thuật còn góp phần lưu trữ di sản văn hóa phi vật thể. Các phương pháp mới tập trung vào việc tận dụng tối đa dữ liệu đơn ngữ sẵn có. Thuật toán hiện đại khai thác mối quan hệ tương đồng giữa các ngữ hệ. Công nghệ tiên tiến mở ra cơ hội xây dựng mô hình dịch thuật với chi phí thấp. Khả năng tự động hóa quy trình dịch thuật giúp nâng cao năng suất xã hội. Kết quả nghiên cứu tạo nền tảng vững chắc cho các ứng dụng trí tuệ nhân tạo tương lai.
II. Xây dựng ngữ liệu song ngữ cho ngôn ngữ ít tài nguyên
Mở rộng tập dữ liệu huấn luyện là chiến lược nền tảng trong dịch máy. Chiến lược đầu tiên tập trung xây dựng ngữ liệu song ngữ quy mô lớn. Việc thu thập dữ liệu thô từ internet đòi hỏi quy trình lọc rửa nghiêm ngặt. Khâu dóng hàng câu đóng vai trò quyết định chất lượng ngữ liệu. Các thuật toán truyền thống thường thất bại khi xử lý cặp ngôn ngữ khác biệt cấu trúc. Phương pháp mới kết hợp thông tin tương đồng từ vựng để tăng độ chính xác. Quá trình trích xuất câu song song diễn ra hoàn toàn tự động. Nguồn tài nguyên mở rộng trực tiếp nâng cao độ chính xác của hệ thống dịch. Dữ liệu sạch giúp mô hình học các mẫu câu chuẩn xác hơn. Hiệu suất dịch thuật cải thiện rõ rệt trên các bộ kiểm thử tiêu chuẩn.
2.1. Cải tiến dóng hàng câu dựa trên ngữ nghĩa đơn ngữ
Dóng hàng câu song ngữ là bước kỹ thuật then chốt khi khai thác tài liệu đa ngữ. Phương pháp cải tiến tận dụng tri thức học từ dữ liệu đơn ngữ dồi dào. Không gian nhúng từ vựng được huấn luyện trên kho văn bản đơn ngữ của từng tiếng. Thuật toán tính toán độ tương đồng ngữ nghĩa giữa các từ không cùng ngôn ngữ. Cơ chế này giúp nhận diện chính xác các cặp câu tương ứng trong văn bản dịch rời rạc. Kỹ thuật giảm thiểu đáng kể sự phụ thuộc vào từ điển song ngữ thủ công. Quá trình xử lý tự động loại bỏ các đoạn văn bản sai lệch hoặc nhiễu loạn. Tỷ lệ dóng hàng chính xác tăng cao ngay cả trên văn bản phi cấu trúc. Phương pháp mang lại giải pháp khai thác dữ liệu web hiệu quả cho ngôn ngữ ít tài nguyên.
2.2. Khai thác kho ngữ liệu song ngữ khu vực Đông Nam Á
Nghiên cứu tập trung thu thập và xây dựng ngữ liệu cho các ngôn ngữ Đông Nam Á. Tập dữ liệu bao gồm tiếng Việt, tiếng Indonesia, tiếng Mã Lai và tiếng Filipino. Đây là những ngôn ngữ có lượng tài nguyên số còn hạn chế so với quy mô dân số. Phương pháp dóng hàng đề xuất được áp dụng trực tiếp trên kho dữ liệu thực tế. Quá trình xử lý tạo ra kho ngữ liệu song ngữ đa chiều chất lượng cao. Các cặp ngôn ngữ được chuẩn hóa để phục vụ huấn luyện máy dịch. Dữ liệu trích xuất bao gồm nhiều chủ đề phong phú từ tin tức đến văn bản pháp bản. Kết quả thực nghiệm chứng minh kho dữ liệu mới giúp tăng điểm BLEU đáng kể. Bộ ngữ liệu đóng góp tài nguyên giá trị cho cộng đồng nghiên cứu xử lý ngôn ngữ tự nhiên.
III. Phương pháp ngôn ngữ cầu nối cho ngôn ngữ ít tài nguyên
Khai thác ngữ liệu song ngữ gián tiếp là giải pháp đột phá cho bài toán thiếu dữ liệu. Phương pháp ngôn ngữ cầu nối sử dụng ngôn ngữ trung gian để kết nối hai ngôn ngữ đích. Khi cặp ngôn ngữ nguồn - đích thiếu dữ liệu, một ngôn ngữ thứ ba giàu tài nguyên sẽ làm cầu nối. Tiếng Anh hoặc một ngôn ngữ phổ biến cùng khu vực thường được chọn làm trung gian. Kỹ thuật này tạo ra bảng dịch cụm từ mới mà không cần ngữ liệu song ngữ trực tiếp. Việc ghép nối hai mô hình dịch riêng lẻ thường gây ra lỗi tích lũy. Các thuật toán cải tiến giúp lọc bỏ các bản dịch sai nghĩa. Phương pháp nâng cao tính mạch lạc cho văn bản đầu ra.
3.1. Cơ chế dịch bắc cầu qua ngôn ngữ trung gian
Cơ chế bắc cầu kết hợp hai bảng tịnh tiến cụm từ nguồn - cầu nối và cầu nối - đích. Quá trình tích hợp nhân ma trận xác suất dịch giữa hai hệ thống thành phần. Bảng dịch trực tiếp nguồn - đích được tổng hợp tự động từ không gian trung gian. Kỹ thuật loại bỏ sự cần thiết của kho văn bản song ngữ gốc quy mô lớn. Tuy nhiên, hiện tượng đa nghĩa của ngôn ngữ trung gian dễ tạo ra các cụm từ sai lệch. Thuật toán lọc thông minh được thiết lập để loại bỏ các ứng viên dịch kém chất lượng. Cơ chế chọn lọc giữ lại những cụm từ có độ tin cậy toán học cao nhất. Hệ thống dịch bắc cầu duy trì cấu trúc câu tự nhiên và mạch lạc. Giải pháp mang lại bước tiến vượt bậc cho các cặp ngôn ngữ hiếm.
3.2. Tích hợp tri thức ngữ pháp và độ tương đồng ngữ nghĩa
Để nâng cao chất lượng dịch bắc cầu, nghiên cứu tích hợp tri thức ngữ pháp và hình thái học. Phân tích ngữ pháp giúp hệ thống hiểu rõ vai trò cú pháp của từng thành phần trong câu. Độ tương đồng ngữ nghĩa được đo lường thông qua biểu diễn vectơ từ vựng hiện đại. Sự kết hợp này ngăn chặn việc ghép nối các từ mang nghĩa không tương thích qua cầu nối. Kỹ thuật áp dụng thử nghiệm thành công trên các cặp dịch từ tiếng Nhật, Mã Lai, Indonesia sang tiếng Việt. Kết quả dịch thể hiện sự chính xác cao về ngữ nghĩa và chuẩn xác về mặt ngữ pháp. Hệ thống giảm thiểu rõ rệt các lỗi dịch ngô nghê thường gặp ở mô hình bắc cầu cổ điển. Phương pháp chứng minh tính hữu dụng của tri thức ngôn ngữ học trong máy dịch.
IV. Ứng dụng dịch máy nơ ron và mô hình kết hợp đa ngôn ngữ
Dịch máy nơ-ron là bước đột phá công nghệ lớn trong lĩnh vực dịch tự động. Mô hình mạng nơ-ron sâu có khả năng nắm bắt ngữ cảnh toàn câu vượt trội. Tuy nhiên, mạng nơ-ron đòi hỏi dữ liệu huấn luyện khổng lồ để hội tụ chuẩn xác. Nghiên cứu tiến hành đánh giá chi tiết dịch máy nơ-ron trong điều kiện thiếu tài nguyên. Mô hình lai ghép kết hợp sức mạnh của dịch nơ-ron và phương pháp dựa trên cụm từ. Kiến trúc đa ngôn ngữ cho phép chia sẻ tham số giữa nhiều thứ tiếng khác nhau. Hệ thống tận dụng thông tin liên ngôn ngữ để bù đắp lượng dữ liệu thiếu hụt. Phương pháp kết hợp nâng cao tính ổn định và độ chính xác dịch thuật tổng thể.
4.1. So sánh hiệu năng giữa dịch nơ ron và thống kê
Nghiên cứu so sánh chi tiết giữa dịch máy nơ-ron và dịch máy thống kê truyền thống. Khi ngữ liệu song ngữ dồi dào, mạng nơ-ron vượt trội hoàn toàn về chất lượng câu dịch. Ngược lại, trong điều kiện khan hiếm dữ liệu, mô hình thống kê dạng cụm từ thường ổn định hơn. Mạng nơ-ron dễ sinh ra hiện tượng lặp từ hoặc dịch sót khi dữ liệu huấn luyện quá ít. Phân tích thực nghiệm chỉ ra ranh giới lượng dữ liệu cần thiết để mạng nơ-ron phát huy ưu thế. Các phát hiện này định hướng cấu hình mô hình phù hợp cho từng mức độ tài nguyên sẵn có. Việc hiểu rõ điểm mạnh yếu của từng kỹ thuật giúp tối ưu hóa tài nguyên tính toán. Kết quả thử nghiệm cung cấp cơ sở khoa học quan trọng cho việc thiết kế kiến trúc hệ thống dịch.
4.2. Xây dựng mô hình lai ghép đa ngôn ngữ tối ưu hóa
Mô hình lai ghép kết hợp chiến lược mở rộng dữ liệu và dịch bắc cầu cải tiến. Hệ thống tích hợp đồng thời kho ngữ liệu mới trích xuất và cơ chế dịch trung gian. Mô hình đa ngôn ngữ được huấn luyện trên nhiều cặp ngôn ngữ đồng thời. Thử nghiệm tiến hành trên các cặp Nhật - Việt, Indonesia - Việt, Mã Lai - Việt và Thổ Nhĩ Kỳ - Anh. Kết quả thực nghiệm ghi nhận sự cải thiện điểm số BLEU vượt bậc so với các mô hình đơn lẻ. Sự chia sẻ trọng số trong mạng nơ-ron giúp các ngôn ngữ nghèo dữ liệu học hỏi từ ngôn ngữ phong phú hơn. Hệ thống duy trì độ trôi chảy cao cùng tính chính xác ngữ nghĩa đồng nhất. Mô hình lai khẳng định tính khả thi vượt trội trong xử lý dịch thuật đa ngữ phức tạp.
V. Kỹ thuật tăng cường dữ liệu và học chuyển giao hiệu quả
Mở rộng dữ liệu huấn luyện là chìa khóa then chốt cho máy dịch hiện đại. Các phương pháp tăng cường dữ liệu giúp nhân bản quy mô mẫu câu nhanh chóng. Kỹ thuật học chuyển giao cho phép tái sử dụng tri thức từ các mô hình quy mô lớn. Quá trình huấn luyện tinh chỉnh mô hình tổng quát trên tập dữ liệu nhỏ của ngôn ngữ đích. Cách tiếp cận này giảm thiểu đáng kể thời gian và chi phí huấn luyện từ đầu. Sự kết hợp giữa dữ liệu nhân tạo và mô hình học sâu mang lại bước tiến nhảy vọt. Các ngôn ngữ ít tài nguyên hưởng lợi trực tiếp từ công nghệ tiên tiến này. Độ chính xác và tự nhiên của bản dịch được cải thiện toàn diện.
5.1. Áp dụng kỹ thuật dịch ngược tạo dữ liệu tổng hợp
Kỹ thuật dịch ngược là giải pháp tăng cường dữ liệu hàng đầu cho các ngôn ngữ ít tài nguyên. Phương pháp sử dụng mô hình dịch chiều ngược lại để dịch văn bản đơn ngữ đích sang tiếng nguồn. Các cặp câu song ngữ nhân tạo được tạo ra tự động với số lượng lớn. Dữ liệu tổng hợp sau đó được gộp chung với ngữ liệu song ngữ gốc để huấn luyện mô hình chính. Quá trình này giúp mạng nơ-ron làm quen với nhiều dạng cấu trúc từ vựng phong phú. Độ trôi chảy ở phía ngôn ngữ đích tăng lên rõ rệt. Dịch ngược tận dụng triệt để nguồn văn bản đơn ngữ khổng lồ miễn phí trên mạng internet. Hiệu suất của hệ thống dịch tăng đều đặn theo quy mô dữ liệu dịch ngược được bổ sung.
5.2. Tận dụng học chuyển giao từ ngôn ngữ giàu tài nguyên
Học chuyển giao là kỹ thuật cốt lõi giúp giải quyết bài toán thiếu dữ liệu. Mô hình dịch máy nơ-ron ban đầu được huấn luyện trên cặp ngôn ngữ giàu tài nguyên. Sau đó, các trọng số mạng được chuyển giao để huấn luyện tiếp cho ngôn ngữ ít tài nguyên. Mạng nơ-ron kế thừa khả năng biểu diễn ngữ nghĩa và cấu trúc câu phổ quát. Quá trình tinh chỉnh chỉ cần một lượng nhỏ ngữ liệu song ngữ để đạt độ chính xác cao. Kỹ thuật đặc biệt hiệu quả khi hai ngôn ngữ nguồn có chung nguồn gốc hoặc đặc điểm ngữ pháp. Thời gian huấn luyện giảm mạnh trong khi chất lượng dịch thuật tăng lên đáng kể. Phương pháp mở đường cho việc xây dựng hệ thống dịch chi phí thấp cho mọi ngôn ngữ.
VI. Định hướng dịch máy không giám sát cho ngôn ngữ thiểu số
Dịch máy không giám sát mở ra chân trời mới cho việc xử lý ngôn ngữ bản địa. Phương pháp này hoàn toàn không phụ thuộc vào ngữ liệu song ngữ trong quá trình huấn luyện. Thuật toán chỉ sử dụng các tập dữ liệu đơn ngữ độc lập của từng ngôn ngữ. Sự phát triển của các mô hình ngôn ngữ lớn thúc đẩy bước tiến này. Các ngôn ngữ thiểu số vốn thiếu văn bản song hành nay có cơ hội tiếp cận công nghệ dịch thuật. Quá trình tự ánh xạ không gian từ vựng giúp hệ thống tìm ra quy luật chuyển ngữ. Nghiên cứu định hình xu hướng phát triển bền vững cho cộng đồng ngôn ngữ nhỏ. Công nghệ góp phần thu hẹp khoảng cách số trên toàn cầu.
6.1. Tiền huấn luyện đa ngữ với dữ liệu đơn ngữ quy mô lớn
Tiền huấn luyện đa ngữ tạo ra không gian biểu diễn ngữ nghĩa thống nhất cho nhiều ngôn ngữ. Mô hình nơ-ron học cách dự đoán từ bị che trên hàng triệu đoạn văn bản đơn ngữ. Quá trình huấn luyện không cần bất kỳ sự can thiệp dịch thuật thủ công nào. Không gian vectơ chung cho phép các từ mang nghĩa tương đồng nằm gần nhau. Cơ chế này đặt nền móng vững chắc cho việc suy luận bản dịch giữa các ngôn ngữ bất kỳ. Khi áp dụng cho ngôn ngữ thiểu số, mô hình tận dụng được cấu trúc học từ các ngôn ngữ lớn. Khả năng hiểu ngữ cảnh sâu sắc giúp cải thiện chất lượng dịch vượt bậc. Tiền huấn luyện trở thành bước tiêu chuẩn không thể thiếu trong các hệ thống dịch hiện đại.
6.2. Triển vọng dịch máy không giám sát cho ngôn ngữ bản địa
Dịch máy không giám sát là giải pháp lý tưởng cho các ngôn ngữ bản địa và thổ ngữ. Nhiều cộng đồng dân tộc không có điều kiện xuất bản tài liệu dịch thuật song ngữ. Việc áp dụng mô hình không giám sát giúp xây dựng hệ thống dịch chỉ từ các câu chuyện hay văn bản thu thập tại chỗ. Thuật toán lặp đi lặp lại việc tạo bản dịch giả và huấn luyện ngược để tự hoàn thiện. Chất lượng câu dịch ngày càng mượt mà và bám sát ngữ cảnh thực tế. Công nghệ mở ra hy vọng to lớn trong việc số hóa và bảo tồn ngôn ngữ đang có nguy cơ mai một. Tương lai của dịch máy sẽ tiếp tục chứng kiến sự phát triển vượt bậc của các phương pháp tự học tiên tiến.
Mục lục chi tiết luận án
Tải xuống file đầy đủ để xem toàn bộ nội dung
Tải đầy đủ (115 trang)Trích đoạn nội dung luận án
Tải xuống để đọc toàn bộA STUDY ON MACHINE TRANSLATION FOR LOW-RESOURCE LANGUAGES By TRIEU, LONG HAI submitted to Japan Advanced Institute of Science and Technology, in partial fulfillment of the requirements for the degree of Doctor of Philosophy Written under the direction of Associate Professor Nguyen Minh Le September, 2017 A STUDY ON MACHINE TRANSLATION FOR LOW-RESOURCE LANGUAGES By TRIEU, LONG HAI (1420211) A thesis submitted to School of Information Science, Japan Advanced Institute of Science and Technology, in partial fulfillment of the requirements for the degree of Doctor of Information Science Graduate Program in Information Science Written under the direction of Associate Professor Nguyen Minh Le and approved by Associate Professor Nguyen Minh Le Professor Satoshi Tojo Professor Hiroyuki Iida Associate Professor Kiyoaki Shirai Associate Professor Ittoo Ashwin July, 2017 (Submitted) Copyright c 2017 by TRIEU, LONG HAI Acknowledgements Abstract Current state-of-the-art machine translation methods are neural machine translation and statistical machine translation, which based on translated texts (bilingual corpora) to learn translation rules automatically. Nevertheless, large bilingual corpora are unavailable for most languages in the world, called low-resource languages, that cause a bottleneck for machine translation (MT). Therefore, improving MT on low-resource languages becomes one of the essential tasks in MT currently. In this dissertation, I present my proposed methods to improve MT on low-resource languages by two strategies: building bilingual corpora to enlarge training data for MT systems and exploiting existing bilingual corpora by using pivot methods.
For the first strategy, I proposed a method to improve sentence alignment based on word similarity learnt from monolingual data to build bilingual corpora. Then, a multilingual parallel corpus was built using the proposed method to improve MT on several Southeast Asian low-resource languages. Experimental results showed the effectiveness of the proposed alignment method to improve sentence alignment and the contribution of the extracted corpus to improve MT performance. For the second strategy, I proposed two methods based on semantic similarity and using grammatical and morphological knowledge to im- prove conventional pivot methods, which generate source-target phrase translation using pivot language(s) as the bridge from source-pivot and pivot-target bilingual corpora.
I con- ducted experiments on low-resource language pairs such as the translation from Japanese, Malay, Indonesian, and Filipino to Vietnamese and achieved promising results and im- provement. Additionally, a hybrid model was introduced that combines the two strategies to further exploit additional data to improve MT performance. Experiments were con- ducted on several language pairs: Japanese-Vietnamese, Indonesian-Vietnamese, Malay- Vietnamese, and Turkish-English, and achieved a significant improvement. In addition, I utilized and investigated neural machine translation (NMT), the state-of-the-art method in machine translation that has been proposed currently, for low-resource languages.
I compared NMT with phrase-based methods on low-resource settings, and investigated how the low-resource data affects the two methods. The results are useful for further de- velopment of NMT on low-resource languages. I conclude with how my work contributes to current MT research especially for low-resource languages and enhances the development of MT on such languages in the future. Keywords: machine translation, phrase-based machine translation, neural-based ma- chine translation, low-resource languages, bilingual corpora, pivot translation, sentence alignment 2 Acknowledgements For three years working on this topic, it is my first long journey that attract me to the academic area.
It is also one of the biggest challenges that I have ever dealt with. This work gives me a lot of interesting knowledge and experiences as well as difficulties that require me with the best efforts. At the moment of writing this dissertation as a summary for the PhD journey, it reminds me a lot of support from many people. This work cannot be completed without their support.
First of all, I would like to thank my supervisor, Associate Professor Nguyen Minh Le. Professor Nguyen gives me a lot of comments, advices, discussions in my whole three-year journey from the starting point when I approached this topic without any prior knowledge about machine translation until my last tasks to complete my dissertation and research. Doing PhD is one of the most interesting things in studying, but it is also one of the most challenge things for everyone in the academic career. Thanks to the useful and interesting discussions with professor Nguyen, I have overcome the most difficult periods in doing this research.
Not only teach me some first lessons and skills in doing research, professor Nguyen also has interesting and useful discussions that help me a lot in both studying and the life. I would like to thank the committee: Professor Satoshi Tojo, Professor Hiroyuki Iida, Associate Professor Ittoo Ashwin, Associate Professor Kiyoaki Shirai for their comments. This can be one of the first work in my academic career, that cannot avoid a lot of mistakes and weaknesses. By discussing with the professors in the committee, and receiving their valuable comments, they help me a lot in improving this dissertation.
I also would like to thank my collaborators: Associate Professor Nguyen Phuong Thai for his comments, advices, and experience in sentence alignment and machine translation. I would like to thank Vu Tran, Tin Pham, Viet-Anh Phan for their interesting discussions and collaborations in doing some topics in this research. Thanks so much to Vu Tran, Chien Tran for their technical support. I would like to thank my colleagues and friends, Truong Nguyen, Huy Nguyen, for their support and encourage.
I also would like to give a special thank to professor Jean- Christophe Terrillon Georges for his advices and comments on the writing skills and En- glish manuscripts of my papers, special thank to professor Ho Tu Bao for valuable advices in research. Thanks so much to Danilo S. Carvalho, Tien Nguyen for their comments. Last but not least, I would like to thank my parents, Thi Trieu, Phuong Hoang, my sister Ly Trieu, and my wife Xuan Dam for their support and encouragement in all time not only in this work but in my life.
3 4 Table of Contents Abstract 1 Acknowledgements 1 Table of Contents 3 List of Figures 4 List of Tables 6 1 Introduction 7 1.2 MT for Low-Resource Languages .1 Statistical Machine Translation .1 Phrase-based SMT .1 Length-Based Methods .2 Word-Based Methods .3 Triangulation: The Representative Approach in Pivot Methods .4 Neural Machine Translation. 19 3 Building Bilingual Corpora 21 3.1 Dealing with Out-Of-Vocabulary Problem .1 Word Similarity Models. 22 1 TABLE OF CONTENTS 3.2 Improving Sentence Alignment Using Word Similarity .2 Building A Multilingual Parallel Corpus .5 Experiments on Machine Translation. 40 4 Pivoting Bilingual Corpora 41 4.1 Semantic Similarity for Pivot Translation .1 Semantic Similarity Models .2 Semantic Similarity for Triangulation .3 Experiments on Japanese-Vietnamese .4 Experiments on Southeast Asian Languages .2 Grammatical and Morphological Knowledge for Pivot Translation .1 Grammatical and Morphological Knowledge .2 Combining Features to Pivot Translation .1 Using Other Languages for Pivot .2 Rectangulation for Phrase Pivot Translation.
70 5 Combining Additional Resources to Enhance SMT for Low-Resource Languages 72 5.1 Enhancing Low-Resource SMT by Combining Additional Resources .2 Experiments on Japanese-Vietnamese .3 Experiments on Southeast Asian Languages .4 Experiments on Turkish-English .1 Exploiting Informative Vocabulary. 82 2 TABLE OF CONTENTS 5. 86 6 Neural Machine Translation for Low-Resource Languages 88 6.1 Neural Machine Translation .2 Byte-pair Encoding .2 Phrase-based versus Neural-based Machine Translation on Low-Resource Languages. NMT on Low-Resource Settings .3 Improving SMT and NMT Using Comparable Data .3 A Discussion on Transfer Learning for Low- Resource Neural Machine Translation.
95 7 Conclusion 96 3 List of Figures 2.1 Pivot alignment induction .2 Recurrent architecture in neural machine translation .1 Word similarity for sentence alignment .2 Experimental results on the development and test sets .3 SMT vs NMT in using the Wikipedia corpus .1 Semantic similarity for pivot translation .2 Pivoting using syntactic information .3 Pivoting using morphological information .1 A combined model for SMT on low-resource languages. 73 4 List of Tables 3.1 English-Vietnamese sentence alignment test data set .2 IWSLT15 corpus for training word alignment .3 English-Vietnamese alignment results .4 Sample English word similarity .5 Sample Vietnamese word similarity .6 OOV ratio in sentence alignment .7 Sample English-Vietnamese alignment .8 English word similarity .9 Sample IBM Model 1 .10 Induced word alignment .11 Wikipedia database dumps’ resources used to extract parallel titles .12 Extracted and processed data from parallel titles .13 Sentence alignment output .14 Extracted Southeast Asian multilingual parallel corpus .15 Monolingual data sets .16 Experimental results on the development and test sets .17 Data sets on the IWSLT 2015 experiments .18 Experimental results using phrase-based statistical machine translation .19 Experimental results on neural machine translation .20 Comparison with other systems participated in the IWSLT 2015 shared task 40 4.1 Bilingual corpora for Japanese-Vietnamese pivot translation .2 Japanese-Vietnamese development and test sets .3 Monolingual data sets of Japanese, English, Vietnamese .4 Japanese-Vietnamese pivot translation results .5 Bilingual corpora of Southeast Asian language pairs .6 Bilingual corpora for pivot translation of Southeast Asian language pairs .7 Monolingual data sets of Indonesian, Malay, and Filipino .8 Pivot translation results of Southeast Asian language pairs .9 Examples of grammatical information for pivot translation .10 Southeast Asian bilingual corpora for training factored models .11 Results of using POS and lemma forms .12 Indonesian-Vietnamese results .13 Filipino-Vietnamese results. 55 5 LIST OF TABLES 4.14 Input factored phrase tables .15 Extracted phrase pairs by triangulation .16 Out-Of-Vocabulary ratio .17 Results of statistical significance tests .18 Experimental results on different metrics: BLEU, TER, METEOR .19 Ranks on different metrics .20 Spearman rank correlation between metrics .21 Wilcoxon on Malay-Vietnamese .22 Wilcoxon on Indonesian-Vietnamese .23 Wilcoxon on Filipino-Vietnamese .24 Wilcoxon on Malay-Vietnamese .25 Wilcoxon on Indonesian-Vietnamese .26 Wilcoxon on Filipino-Vietnamese .27 Sample translations: POS and lemma factors for pivot translation .28 Sample translation: Indonesian-Vietnamese .29 Sample translation: Filipino-Vietnamese .30 Using other languages for pivot .31 Using rectangulation for phrase pivot translation .1 Japanese-Vietnamese results on the direct model .2 Japanese-Vietnamese results on the combined models .3 Results of Japanese-Vietnamese on the big test set .4 Results of statistical significance tests on Japanese-Vietnamese .5 Southeast Asian results on the direct models .6 Southeast Asian results on the combined model .7 Bilingual corpora for Turkish-English pivot translation .8 Experimental results on the Turkish-English .9 Experimental results on the English-Turkish translation .10 Building a bilingual corpus of Turkish-English from Wikipedia .11 Dealing with out of vocabulary problem using the combined model .12 Sample translations: using the combined model (Japanese-Vietnamese) .14 Sample translations: using the combined model (Filipino-Vietnamese) .1 Bilingual data set of Japanese-English .2 Experimental results in Japanese-English translation .3 Bilingual data sets of Indonesian-Vietnamese .4 Experimental results on Indonesian-Vietnamese translation .5 Experimental results English-Vietnamese .6 English-Vietnamese results using the Wikipedia corpus .1 Machine Translation Translation between languages is an important demand of humanity. With the advent of digital computers, it provided a basis for the dream of building machines to translate languages automatically.
Almost as soon as electronic computers appeared, people made efforts to build automatic systems for translation, which also opened a new field: machine translation. As defined in Hutchins and Somers, 1992 [33], machine translation (MT) is "computerized systems responsible for the production of translation from one natural language to another, with or without human assistance". Machine translation has a long history in its development. Various approaches were explored such as: direct translation (using rules to map input to output), transfer methods (analyzing syntactic and morphological information), and interlingual methods (using representations of abstract meaning).
The field attracted a lot of interest from community like: a study of realities of machine translation from US funding agencies in 1966 (ALPAC report), commercial systems from the past (Systran in 1968, Météo in 1976, Logos and METAL in 1980s) to current development by large companies (IBM, Microsoft, Google), and many projects in universities and academic institutes. Dominated approaches of current machine translation are statistical machine translation (SMT) and neural machine translation (NMT), which are based on resources of translated texts, a trend of data-driven methods.
Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ
Trích dẫn luận án này
Trieu, Long Hai (2017). Nghiên cứu máy dịch cho các ngôn ngữ ít nguồn [Luận án tiến sĩ, Japan Advanced Institute of Science and Technology]. LuanAn.net. https://luanan.net/ngon-ngu-hoc/ngon-ngu-hoc-ung-dung/nghien-cuu-may-dich-cho-ngon-ngu-it-nguon
Câu hỏi thường gặp
Luận án "Nghiên cứu máy dịch cho các ngôn ngữ ít nguồn" nghiên cứu về vấn đề gì?
Nghiên cứu mô hình dịch máy hiệu quả cho ngôn ngữ ít nguồn. Đề xuất phương pháp cải tiến dựa trên học sâu.
Luận án "Nghiên cứu máy dịch cho các ngôn ngữ ít nguồn" được bảo vệ tại trường nào?
Luận án này được bảo vệ tại Japan Advanced Institute of Science and Technology. Năm bảo vệ: 2017.
Luận án "Nghiên cứu máy dịch cho các ngôn ngữ ít nguồn" thuộc chuyên ngành gì?
Luận án "Nghiên cứu máy dịch cho các ngôn ngữ ít nguồn" thuộc chuyên ngành Information Science. Danh mục: Ngôn Ngữ Học Ứng Dụng.
Luận án "Nghiên cứu máy dịch cho các ngôn ngữ ít nguồn" có bao nhiêu trang?
Luận án "Nghiên cứu máy dịch cho các ngôn ngữ ít nguồn" có 115 trang. Bạn có thể xem trước một phần tài liệu ngay trên trang web trước khi tải về.
Cách tải luận án "Nghiên cứu máy dịch cho các ngôn ngữ ít nguồn" về máy như thế nào?
Để tải luận án về máy, bạn nhấn nút "Tải xuống ngay" trên trang này, sau đó hoàn tất thanh toán phí lưu trữ. File sẽ được tải xuống ngay sau khi thanh toán thành công. Hỗ trợ qua Zalo: 0559 297 239.