Cải tiến chất lượng dịch máy dựa vào mạng nơron cho các ngôn ngữ tài nguyên hạn

Luận án: Cải tiến chất lượng dịch máy dựa vào mạng nơron cho các ngôn ngữ tài nguyên hạn chế. Xem tóm tắt và tải về tại LuanAn.net

Tác giả

Luan An

Thể loại

luận án tiến sĩ

Năm xuất bản

Số trang

163

Thời gian đọc

25 phút

Lượt xem

0

Lượt tải

0

Phí lưu trữ

50 Point

Tổng quan nhanh

Chủ đề:
Cải thiện chất lượng dịch máy dựa vào mạng nơron
Số trang:
163 trang
Trường:
Trường Đại học Công nghệ, Đại học Quốc gia Hà Nội
Chuyên ngành:
Khoa học máy tính
Tác giả:
Năm:

Tóm tắt nội dung luận án

I.Cải thiện chất lượng dịch máy dựa vào mạng nơron

Dịch máy tự động là một lĩnh vực nghiên cứu trọng tâm trong khoa học máy tính và xử lý ngôn ngữ tự nhiên. Mục tiêu chính là chuyển đổi văn bản từ ngôn ngữ nguồn sang ngôn ngữ đích một cách tự động và chính xác. Lịch sử dịch máy đã trải qua nhiều giai đoạn phát triển. Ban đầu, các hệ thống dựa trên luật và từ điển chiếm ưu thế. Tiếp theo, dịch máy thống kê (SMT) ra đời, cải thiện đáng kể chất lượng bằng cách học từ các kho ngữ liệu song ngữ. Gần đây nhất, dịch máy mạng nơron (NMT) đã tạo ra một cuộc cách mạng. NMT sử dụng các mô hình học sâu phức tạp để học ánh xạ ngôn ngữ. Sự tiến bộ này đã đẩy chất lượng dịch máy lên một tầm cao mới. Các hệ thống NMT hiện đại cung cấp bản dịch tự nhiên và trôi chảy hơn nhiều, hỗ trợ hiệu quả giao tiếp toàn cầu.

1.1. Giới thiệu bài toán dịch máy và phát triển chính

Dịch máy tự động là một lĩnh vực nghiên cứu trọng tâm trong khoa học máy tính và xử lý ngôn ngữ tự nhiên. Mục tiêu chính là chuyển đổi văn bản từ ngôn ngữ nguồn sang ngôn ngữ đích một cách tự động và chính xác. Lịch sử dịch máy đã trải qua nhiều giai đoạn phát triển. Ban đầu, các hệ thống dựa trên luật và từ điển chiếm ưu thế. Tiếp theo, dịch máy thống kê (SMT) ra đời, cải thiện đáng kể chất lượng bằng cách học từ các kho ngữ liệu song ngữ. Gần đây nhất, dịch máy mạng nơron (NMT) đã tạo ra một cuộc cách mạng. NMT sử dụng các mô hình học sâu phức tạp để học ánh xạ ngôn ngữ. Sự tiến bộ này đã đẩy chất lượng dịch máy lên một tầm cao mới. Các hệ thống NMT hiện đại cung cấp bản dịch tự nhiên và trôi chảy hơn nhiều, hỗ trợ hiệu quả giao tiếp toàn cầu.

1.2. Khái niệm cốt lõi trong dịch máy mạng nơron

Kiến trúc dịch máy mạng nơron thường được xây dựng trên mô hình mã hóa-giải mã (encoder-decoder). Bộ mã hóa tiếp nhận câu nguồn, chuyển đổi nó thành một biểu diễn ngữ nghĩa dạng vector. Bộ giải mã sau đó sử dụng biểu diễn này để tạo ra câu đích. Một thành phần thiết yếu là cơ chế chú ý (attention mechanism). Cơ chế chú ý cho phép mô hình tập trung vào các phần liên quan của câu nguồn khi dịch từng từ của câu đích. Điều này giải quyết hiệu quả vấn đề phụ thuộc xa trong câu dài. NMT học các mối quan hệ phức tạp giữa các từ và cụm từ. Nó nắm bắt ngữ cảnh và cấu trúc ngữ pháp tốt hơn các phương pháp truyền thống. Việc liên tục cải tiến các kiến trúc và kỹ thuật huấn luyện tiếp tục nâng cao hiệu suất và độ chính xác của NMT.

II.Dịch máy cho ngôn ngữ tài nguyên hạn chế Thách thức

Việc phát triển dịch máy cho các ngôn ngữ tài nguyên hạn chế đối mặt với nhiều rào cản lớn. Thách thức chính là sự thiếu hụt dữ liệu song ngữ chất lượng cao. Các cặp câu song ngữ là nền tảng để huấn luyện các mô hình NMT mạnh mẽ. Ngoài ra, dữ liệu đơn ngữ lớn cũng có thể khan hiếm. Điều này gây khó khăn nghiêm trọng cho việc huấn luyện các mô hình học sâu. Mạng nơron yêu cầu lượng dữ liệu khổng lồ để học các mẫu phức tạp. Không đủ dữ liệu thường dẫn đến hiện tượng overfitting, khi mô hình học thuộc lòng dữ liệu huấn luyện nhưng hoạt động kém trên dữ liệu mới. Hậu quả là chất lượng dịch máy cho các ngôn ngữ này thường thấp. Chi phí và công sức để xây dựng các kho ngữ liệu lớn là rất đáng kể. Các ngôn ngữ có số lượng người dùng nhỏ thường không nhận được đủ đầu tư cho việc này.

2.1. Các hạn chế dữ liệu và ảnh hưởng đến mô hình

Việc phát triển dịch máy cho các ngôn ngữ tài nguyên hạn chế đối mặt với nhiều rào cản lớn. Thách thức chính là sự thiếu hụt dữ liệu song ngữ chất lượng cao. Các cặp câu song ngữ là nền tảng để huấn luyện các mô hình NMT mạnh mẽ. Ngoài ra, dữ liệu đơn ngữ lớn cũng có thể khan hiếm. Điều này gây khó khăn nghiêm trọng cho việc huấn luyện các mô hình học sâu. Mạng nơron yêu cầu lượng dữ liệu khổng lồ để học các mẫu phức tạp. Không đủ dữ liệu thường dẫn đến hiện tượng overfitting, khi mô hình học thuộc lòng dữ liệu huấn luyện nhưng hoạt động kém trên dữ liệu mới. Hậu quả là chất lượng dịch máy cho các ngôn ngữ này thường thấp. Chi phí và công sức để xây dựng các kho ngữ liệu lớn là rất đáng kể. Các ngôn ngữ có số lượng người dùng nhỏ thường không nhận được đủ đầu tư cho việc này.

2.2. Phương pháp nghiên cứu chính để giải quyết vấn đề

Để khắc phục hạn chế về dữ liệu, cộng đồng nghiên cứu đã đề xuất nhiều phương pháp tiếp cận. Một hướng là tìm cách thu thập thêm dữ liệu, dù khó khăn. Một hướng khác tập trung vào việc tận dụng hiệu quả dữ liệu đơn ngữ sẵn có. Các kỹ thuật học bán giám sát hoặc học không giám sát đã được áp dụng. Kỹ thuật dịch ngược (back-translation) là một trong những phương pháp thành công nhất. Kỹ thuật này sử dụng một mô hình NMT để dịch văn bản đơn ngữ từ ngôn ngữ đích sang ngôn ngữ nguồn, tạo ra các cặp dữ liệu song ngữ tổng hợp. Những cặp dữ liệu giả này sau đó được bổ sung vào tập huấn luyện chính. Ngoài ra, việc sử dụng các tài nguyên đa ngữ hoặc kỹ thuật học chuyển giao (transfer learning) cũng giúp chia sẻ kiến thức giữa các ngôn ngữ. Thay đổi kiến trúc mô hình hoặc tinh chỉnh tham số cũng là những cách tiếp cận tiềm năng. Các phương pháp này đều hướng tới cải thiện chất lượng dịch máy cho ngôn ngữ tài nguyên thấp.

III.Ảnh hưởng của phân đoạn từ lên dịch máy nơron

Phân đoạn từ là một bước tiền xử lý cực kỳ quan trọng đối với nhiều ngôn ngữ. Đặc biệt là những ngôn ngữ không sử dụng khoảng trắng để phân tách từ một cách rõ ràng, ví dụ như tiếng Việt, tiếng Trung, hoặc tiếng Thái. Sự không rõ ràng này có thể làm giảm hiệu quả của các mô hình dịch máy. Phân đoạn từ không giám sát cung cấp một giải pháp mạnh mẽ. Phương pháp này không yêu cầu dữ liệu đã được gán nhãn thủ công. Thay vào đó, nó sử dụng các thuật toán thống kê hoặc học máy để tự động học ranh giới từ. Việc phân đoạn từ chính xác tạo ra đầu vào có cấu trúc tốt hơn cho mô hình NMT. Nó giúp mô hình hiểu đúng các đơn vị từ vựng và cấu trúc ngữ pháp của câu. Một đầu vào chuẩn hóa tốt sẽ dẫn đến chất lượng dịch máy được cải thiện đáng kể, đặc biệt khi xử lý các câu phức tạp hoặc dài.

3.1. Ứng dụng học không giám sát trong phân đoạn từ tiếng Việt

Phân đoạn từ là một bước tiền xử lý cực kỳ quan trọng đối với nhiều ngôn ngữ. Đặc biệt là những ngôn ngữ không sử dụng khoảng trắng để phân tách từ một cách rõ ràng, ví dụ như tiếng Việt, tiếng Trung, hoặc tiếng Thái. Sự không rõ ràng này có thể làm giảm hiệu quả của các mô hình dịch máy. Phân đoạn từ không giám sát cung cấp một giải pháp mạnh mẽ. Phương pháp này không yêu cầu dữ liệu đã được gán nhãn thủ công. Thay vào đó, nó sử dụng các thuật toán thống kê hoặc học máy để tự động học ranh giới từ. Việc phân đoạn từ chính xác tạo ra đầu vào có cấu trúc tốt hơn cho mô hình NMT. Nó giúp mô hình hiểu đúng các đơn vị từ vựng và cấu trúc ngữ pháp của câu. Một đầu vào chuẩn hóa tốt sẽ dẫn đến chất lượng dịch máy được cải thiện đáng kể, đặc biệt khi xử lý các câu phức tạp hoặc dài.

3.2. Thực nghiệm và kết quả trên các mức phân đoạn từ

Các thực nghiệm đã được tiến hành để đánh giá chi tiết ảnh hưởng của phân đoạn từ lên hiệu suất của hệ thống dịch máy. Các mức độ phân đoạn khác nhau đã được thử nghiệm, từ việc phân đoạn ở cấp độ ký tự (character-level) đến cấp độ từ (word-level) hoặc các đơn vị con từ (subword-level) như BPE (Byte-pair Encoding). Kết quả thực nghiệm cho thấy phân đoạn từ có ảnh hưởng rõ rệt đến chất lượng dịch. Một chiến lược phân đoạn từ phù hợp giúp mô hình NMT học hiệu quả hơn các mối quan hệ ngôn ngữ. Đặc biệt, đối với tiếng Việt, việc phân đoạn từ chính xác giúp giảm độ dài câu trong khi vẫn giữ được đầy đủ thông tin ngữ nghĩa. Các mô hình dựa trên kiến trúc Transformer thường rất nhạy cảm với cách thức phân đoạn đầu vào. Nghiên cứu khẳng định tầm quan trọng của việc lựa chọn phương pháp phân đoạn từ tối ưu để đạt được chất lượng dịch cao nhất.

IV.Tăng cường dữ liệu để nâng cao hiệu suất dịch máy

Tăng cường dữ liệu là một kỹ thuật mạnh mẽ được sử dụng để mở rộng tập dữ liệu huấn luyện. Kỹ thuật này đặc biệt hữu ích khi đối mặt với các ngôn ngữ tài nguyên thấp, nơi dữ liệu song ngữ khan hiếm. Một trong những chiến lược phổ biến nhất là dịch ngược (back-translation). Phương pháp này sử dụng một mô hình NMT đã được huấn luyện để dịch văn bản đơn ngữ từ ngôn ngữ đích sang ngôn ngữ nguồn, tạo ra các cặp dữ liệu song ngữ tổng hợp. Những cặp dữ liệu giả này sau đó được bổ sung vào tập huấn luyện chính. Các kỹ thuật khác bao gồm xáo trộn thứ tự từ trong câu (word shuffling), thay thế từ bằng các từ đồng nghĩa (synonym replacement), hoặc chèn/xóa ngẫu nhiên các từ. Mục tiêu chung là tạo ra sự đa dạng hơn cho dữ liệu huấn luyện. Điều này giúp mô hình học được các biểu diễn mạnh mẽ hơn và tổng quát hóa tốt hơn trên dữ liệu mới. Dữ liệu tăng cường cải thiện đáng kể độ bền và khả năng thích ứng của hệ thống NMT.

4.1. Chiến lược tăng cường dữ liệu cho dịch máy mạng nơron

Tăng cường dữ liệu là một kỹ thuật mạnh mẽ được sử dụng để mở rộng tập dữ liệu huấn luyện. Kỹ thuật này đặc biệt hữu ích khi đối mặt với các ngôn ngữ tài nguyên thấp, nơi dữ liệu song ngữ khan hiếm. Một trong những chiến lược phổ biến nhất là dịch ngược (back-translation). Phương pháp này sử dụng một mô hình NMT đã được huấn luyện để dịch văn bản đơn ngữ từ ngôn ngữ đích sang ngôn ngữ nguồn, tạo ra các cặp dữ liệu song ngữ tổng hợp. Những cặp dữ liệu giả này sau đó được bổ sung vào tập huấn luyện chính. Các kỹ thuật khác bao gồm xáo trộn thứ tự từ trong câu (word shuffling), thay thế từ bằng các từ đồng nghĩa (synonym replacement), hoặc chèn/xóa ngẫu nhiên các từ. Mục tiêu chung là tạo ra sự đa dạng hơn cho dữ liệu huấn luyện. Điều này giúp mô hình học được các biểu diễn mạnh mẽ hơn và tổng quát hóa tốt hơn trên dữ liệu mới. Dữ liệu tăng cường cải thiện đáng kể độ bền và khả năng thích ứng của hệ thống NMT.

4.2. Hiệu quả của các phương pháp tăng cường dữ liệu

Nhiều nghiên cứu và thực nghiệm đã chứng minh hiệu quả vượt trội của các kỹ thuật tăng cường dữ liệu. Việc bổ sung dữ liệu tăng cường giúp cải thiện đáng kể chất lượng dịch máy, đặc biệt trong các thiết lập tài nguyên thấp. Kỹ thuật dịch ngược (back-translation) đã được chứng minh là một trong những phương pháp thành công nhất, mang lại những cải tiến đáng kể. Nó tạo ra các cặp câu song ngữ bổ sung, giúp mô hình NMT tiếp xúc với nhiều ví dụ hơn về cách các câu được dịch. Các mô hình NMT được huấn luyện với dữ liệu tăng cường thường đạt điểm BLEU (Bilingual Evaluation Understudy) cao hơn đáng kể so với các mô hình chỉ sử dụng dữ liệu thực tế. Điều này giảm bớt sự phụ thuộc vào việc thu thập dữ liệu song ngữ tốn kém. Đồng thời, nó mở rộng khả năng áp dụng công nghệ NMT cho những ngôn ngữ trước đây được coi là khó khăn do thiếu tài nguyên.

V.Kiến trúc mạng nơron và phương pháp đánh giá dịch

Kiến trúc mạng nơron là yếu tố cốt lõi quyết định hiệu suất của hệ thống dịch máy. Trước đây, RNN (Recurrent Neural Network) và các biến thể như LSTM (Long Short-Term Memory) hay GRU (Gated Recurrent Unit) là các kiến trúc tiêu chuẩn. Chúng xử lý thông tin tuần tự, duy trì trạng thái ẩn để ghi nhớ ngữ cảnh. Tuy nhiên, RNN thường gặp khó khăn với các phụ thuộc xa trong câu dài. Sự ra đời của kiến trúc Transformer đã đánh marks một bước ngoặt lớn. Transformer hoàn toàn dựa vào cơ chế tự chú ý (self-attention), cho phép mô hình xử lý tất cả các từ trong câu song song. Điều này giúp Transformer nắm bắt các mối quan hệ phụ thuộc dài tốt hơn nhiều so với RNN. Hiện tại, Transformer là kiến trúc ưu việt và được sử dụng rộng rãi nhất trong dịch máy mạng nơron, mang lại hiệu suất vượt trội.

5.1. So sánh kiến trúc Transformer và RNN trong dịch máy

Kiến trúc mạng nơron là yếu tố cốt lõi quyết định hiệu suất của hệ thống dịch máy. Trước đây, RNN (Recurrent Neural Network) và các biến thể như LSTM (Long Short-Term Memory) hay GRU (Gated Recurrent Unit) là các kiến trúc tiêu chuẩn. Chúng xử lý thông tin tuần tự, duy trì trạng thái ẩn để ghi nhớ ngữ cảnh. Tuy nhiên, RNN thường gặp khó khăn với các phụ thuộc xa trong câu dài. Sự ra đời của kiến trúc Transformer đã đánh dấu một bước ngoặt lớn. Transformer hoàn toàn dựa vào cơ chế tự chú ý (self-attention), cho phép mô hình xử lý tất cả các từ trong câu song song. Điều này giúp Transformer nắm bắt các mối quan hệ phụ thuộc dài tốt hơn nhiều so với RNN. Hiện tại, Transformer là kiến trúc ưu việt và được sử dụng rộng rãi nhất trong dịch máy mạng nơron, mang lại hiệu suất vượt trội.

5.2. Đánh giá chất lượng dịch máy bằng các độ đo chuẩn

Đánh giá chất lượng của bản dịch máy là một bước không thể thiếu trong quá trình nghiên cứu và phát triển. Các độ đo tự động được sử dụng rộng rãi để đo lường hiệu suất. BLEU (Bilingual Evaluation Understudy) là một trong những độ đo phổ biến nhất và được chấp nhận rộng rãi. BLEU so sánh bản dịch máy với một hoặc nhiều bản dịch tham chiếu do con người thực hiện, dựa trên sự trùng lặp của các n-gram. Ngoài BLEU, các độ đo khác như METEOR, TER (Translation Edit Rate) cũng được sử dụng để cung cấp cái nhìn đa chiều hơn. Tuy nhiên, đánh giá của con người vẫn được coi là "tiêu chuẩn vàng". Những người dịch chuyên nghiệp đánh giá tính lưu loát, ngữ pháp, và độ chính xác ngữ nghĩa của bản dịch. Kết quả từ các phương pháp đánh giá này là cơ sở quan trọng để cải tiến liên tục các hệ thống dịch máy, hướng tới mục tiêu đạt được chất lượng tiệm cận với bản dịch của con người.

Xem trước tài liệu
Tải đầy đủ để xem toàn bộ nội dung
Cải tiến chất lượng dịch máy dựa vào mạng nơron cho các ngôn ngữ tài nguyên hạn chế

Tải xuống file đầy đủ để xem toàn bộ nội dung

Tải đầy đủ (163 trang)

Trích đoạn nội dung luận án

Tải xuống để đọc toàn bộ

ĐẠI HỌC HÀ NỘI TRƯỜNG ĐẠI HỌC CÔNG NGHỆ − − − − − − −⋆ − − − − − −− CẢI TIẾN CHẤT LƯỢNG DỊCH MÁY DỰA VÀO MẠNG NƠRON CHO CÁC NGÔN NGỮ TÀI NGUYÊN HẠN CHẾ LUẬN ÁN TIẾN SĨ KHOA HỌC MÁY TÍNH Hà Nội - 2024 ĐẠI HỌC HÀ NỘI TRƯỜNG ĐẠI HỌC CÔNG NGHỆ − − − − − − −⋆ − − − − − −− CẢI TIẾN CHẤT LƯỢNG DỊCH MÁY DỰA VÀO MẠNG NƠRON CHO CÁC NGÔN NGỮ TÀI NGUYÊN HẠN CHẾ LUẬN ÁN TIẾN SĨ Chuyên ngành: Khoa học máy tính Mã số: 9480101.01 CÁN BỘ HƯỚNG DẪN KHOA HỌC: 1.TS Nguyễn Phương Thái 2.TS Nguyễn Lê Minh Hà Nội - 2024 LỜI CAM ĐOAN Tôi xin cam đoan các nội dung trong luận án là kết quả nghiên cứu của tôi, được thực hiện dưới sự hướng dẫn của các thầy. Các kết quả và số liệu trình bày trong luận án là hoàn toàn trung thực và chưa từng được công bố trong bất kỳ công trình của ai khác. Các nội dung trích dẫn từ các nghiên cứu của các tác giả khác mà tôi trình bày trong luận án đã được ghi rõ nguồn trong phần tài liệu tham khảo. Tác giả: Hà Nội: i LỜI CẢM ƠN Trước hết, tôi muốn bày tỏ sự biết ơn sâu sắc đến PGS.

TS Nguyễn Phương Thái, Trường Đại học Công nghệ, Đại học Quốc Gia Hà Nội và GS. TS Nguyễn Lê Minh, Viện công nghệ tiên tiến Nhật Bản, các thầy đã trực tiếp hướng dẫn, định hướng, hỗ trợ và động viên tôi trong suốt thời gian thực hiện luận án. Tôi cũng xin bày tỏ lời cảm ơn sâu sắc đến TS Hà Thành Lê, Viện công nghệ Karlsruhe, hiện công tác tại Công ty Zoom, chi nhánh CHLB Đức và TS Nguyễn Văn Vinh, Trường Đại học Công nghệ, Đại học Quốc gia Hà Nội, các thầy đã dành nhiều thời chia sẻ kinh nghiệm, tạo động lực và giúp đỡ tôi trong suốt quá trình học tập và nghiên cứu. Tôi cũng xin trân trọng biết ơn chủ nhiệm các đề tài TC.12/19-25 và các thành viên đã chia sẻ kinh nghiệm và hỗ trợ kinh phí trong quá trình tôi thực hiện luận án.

Tôi xin trân trọng cảm ơn GS.TS Nguyễn Thanh Thuỷ, PGS.TS Lê Sỹ Vinh, TS Trần Quốc Long, TS Lê Đức Trọng, TS Hoàng Thị Điệp, TS Triệu Hải Long, TS Trần Hồng Việt, PGS.TS Nguyễn Việt Anh, PGS.TS Nguyễn Thị Nhật Thanh - Trường Đại học Công nghệ, Đại học Quốc Gia Hà Nội, PGS.TS Lê Thanh Hương - Đại học Bách khoa Hà Nội, PGS.TS Lê Hồng Phương, TS. Nguyễn Thị Minh Huyền - Trường Đại học Khoa học tự nhiên, Đại học Quốc Gia Hà Nội, PGS.TS Nguyễn Đức Dũng - Viện Công nghệ thông tin, Viện Hàn lân Khoa học và Công nghệ Việt Nam, PGS.TS Bùi Thu Lâm - Học viện Kỹ thuật mật mã, PGS. TS Phạm Văn Cường - Học viện Công nghệ Bưu chính - Viễn thông, TS Nguyễn Chí Thành - Viện Khoa học và Công nghệ Quân sự, TS Trần Hữu Anh - Trường Đại học Thái Bình, TS Nguyễn Tiến Hà - Đại học Hùng Vương đã dành nhiều thời gian đọc và góp ý cho luận án. Đồng thời, tôi cũng xin gửi lời cảm ơn đến các thầy, cô trong Bộ môn Khoa học máy tính, Khoa Công nghệ thông tin, Trường Đại học Công nghệ, Đại học Quốc Gia Hà Nội đã tận tình chỉ bảo, cung cấp cho tôi những kiến thức nền tảng quý giá, tạo điều kiện tốt nhất cho tôi về môi trường làm việc trong suốt quá trình học tập, nghiên cứu tại Trường.

Tôi xin trân trọng cảm ơn các thầy, cô, các nhà khoa học đã dành thời gian quý báu của mình để đọc luận án và đưa ra các góp ý xác đáng để luận án ngày càng được hoàn thiện. Tôi xin chân thành cảm ơn Lãnh đạo Trường, Khoa, Bộ môn và đồng nghiệp tại Trường Đại học Công nghệ thông tin và Truyền thông Thái Nguyên, nơi tôi ii công tác đã giúp đỡ, tạo mọi điều kiện, sắp xếp, bố trí thời gian cho tôi trong suốt quá trình làm nghiên cứu sinh. Cuối cùng, tôi vô cùng biết ơn cha, mẹ, chồng, con, cùng toàn thể anh, chị, em trong gia đình và bạn bè đã luôn ủng hộ, chia sẻ, giúp đỡ và động viên tôi vượt qua những khó khăn trong suốt quá trình học tập và nghiên cứu. NCS Ngô Thị Vinh iii Mục lục Lời cam đoan i Lời cảm ơn ii Mục lục iv Danh mục các từ viết tắt vii Danh mục các bảng x Danh mục các hình vẽ xiv Danh mục các thuật toán xv MỞ ĐẦU 1 Chương 1.

TỔNG QUAN VỀ DỊCH MÁY CHO CẶP NGÔN NGỮ TÀI NGUYÊN HẠN CHẾ 9 1.1 Giới thiệu về bài toán dịch máy .1 Dịch máy và các bước ngoặt chính trong quá trình phát triển 9 1.2 Một số khái niệm được sử dụng trong luận án .3 Phạm vi của luận án .4 Những thách thức trong mô hình dịch máy hiện nay .2 Các hướng nghiên cứu chính về bài toán dịch máy tài nguyên hạn chế .1 Các phương pháp thu thập dữ liệu .2 Các phương pháp dựa vào dữ liệu đơn ngữ .3 Các phương pháp dựa vào dịch máy đa ngữ .4 Các phương pháp dịch máy dựa vào các tài nguyên khác .5 Các phương pháp thay đổi mô hình .3 Một số công cụ và phương pháp sử dụng trong luận án .1 Kiến trúc hệ thống dịch máy dựa trên mạng nơron .2 Đánh giá chất lượng dịch máy .3 Hệ thống máy tính toán .4 Phương pháp lựa chọn dữ liệu dựa vào độ đo TF-IDF .5 Phương pháp tách từ không giám sát .4 Tóm tắt chương. ẢNH HƯỞNG CỦA PHÂN ĐOẠN TỪ LÊN CHẤT LƯỢNG CỦA HỆ THỐNG DỊCH MÁY 37 2.2 Phân đoạn từ cho văn bản tiếng Việt sử dụng học không giám sát 39 2.2 Thực nghiệm và kết quả .3 Hệ thống dịch máy dựa trên các mức phân đoạn từ khác nhau .2 Sự khác biệt giữa kiến trúc Transformer và kiến trúc RNN khi dịch dựa trên các ký tự .3 Thực nghiệm và kết quả .4 Tóm tắt chương. TĂNG CƯỜNG DỮ LIỆU 51 3.2 Phương pháp đề xuất .3 Thực nghiệm và kết quả .1 Tập dữ liệu và tiền xử lý .2 Thiết lập hệ thống và huấn luyện .3 Kết quả và phân tích .4 Thảo luận thêm .4 Tóm tắt chương. XỬ LÝ TỪ HIẾM 72 4.2 Cải tiến quá trình giải mã .2 Thực nghiệm và kết quả .3 Kết hợp vectơ nhúng từ, tách hình thái từ có giám sát và sử dụng cơ sở dữ liệu WordNet khi dịch từ hiếm .1 Kết hợp vectơ nhúng từ (word embedding) trong câu nguồn 85 4.2 Tách hình thái theo cách tiếp cận học có giám sát cho văn bản tiếng Anh .3 Sử dụng quan hệ đồng nghĩa trong cơ sở dữ liệu WordNet .4 Thực nghiệm và kết quả .4 Tóm tắt chương .2 Hệ thống dịch máy từ tiếng Trung, Nhật sang tiếng Việt .1 Sử dụng các phương pháp phân đoạn từ khác nhau .2 Cải tiến hệ dịch đa ngữ sử dụng nhãn nhân tạo .3 Hệ thống dịch máy từ tiếng Anh, Pháp sang tiếng Việt .1 Phương pháp đề xuất .2 Thử nghiệm và kết quả .4 Tóm tắt chương.

119 KẾT LUẬN VÀ HƯỚNG PHÁT TRIỂN 120 DANH MỤC CÁC CÔNG TRÌNH KHOA HỌC 126 TÀI LIỆU THAM KHẢO 127 vi DANH MỤC CÁC TỪ VIẾT TẮT Từ viết tắt Dạng đầy đủ Diễn giải Adam SGD Adam Stochastic Gradient Bộ tối ưu Adam sử dụng Descent phương pháp cắt giảm gra- dient ngẫu nhiên ALPAC Automatic Language Proces- Ủy ban cố vấn về xử lý ngôn sing Advisory Committee ngữ tự động của chính phủ Mỹ ALT Asian Language Treebank Tập dữ liệu đa ngữ giữa một số ngôn ngữ Châu Á BLEU Bilingual Evaluation Un- Độ đo tự động giữa các văn derstudy bản song ngữ BPE Byte Pair Encoding Kỹ thuật tách từ thành các đơn vị dịch nhỏ hơn IWSLT 16th International Workshop Hội nghị quốc tế về dịch máy on Spoken Language Trans- cho ngôn ngữ dạng văn nói lation KSE The International Confe- Hội thảo khoa học quốc tế rence on Knowledge And về Kỹ nghệ Tri thức và Hệ System Engineering thống LoResMT The Workshop on Technolo- Hội nghị các kỹ thuật dịch gies for MT of Low Resource máy cho ngôn ngữ hạn chế Languages tài nguyên vii LSTM Long Short-Term Memory Một dạng đơn vị nhớ trong mạng nơron với các cổng khác nhau cho phép bắt ngữ cảnh dài của các chuỗi đầu vào GRU Gated Recurrent Unit Một dạng đơn vị nhớ trong mạng nơron có chức năng tương tự như LSTM nhưng các tính toán có sự thay đổi NMT Neural Machine Translation Dịch máy dựa trên mạng nơ- ron RNN Recurrent Neural Network Mạng nơron hồi quy VLSP The seventh international Hội nghị xử lý ngôn ngữ và workshop on Vietnamese tiếng nói tiếng Việt Language and Speech Processing VNICT The Vietnam Conference of Hội thảo quốc gia về "Một số Selected ICT Problems vấn đề chọn lọc về công nghệ thông tin và Truyền thông SMT Statistical Machine Transla- Dịch máy thống kê tion SWR The Student Research Work- Hội nghị xử lý ngôn ngữ AACL- shop: The Conference of the tự nhiên khu vực Châu Á: IJCNLP Asia-Pacific Chapter of the Phiên dành cho sinh viên Association for Computatio- nal Linguistics and Interna- tional Joint Conference on Natural Language Proces- sing viii TF-IDF Term Frequency - Inverse Một phương pháp lựa chọn Document Frequency dữ liệu dựa vào tần số xuất hiện của các từ trong tập dữ liệu TER Translation Error Rate Tỷ lệ lỗi dịch WAT The Workshop on Asian Hội nghị dịch máy cho các Translation ngôn ngữ châu Á WER Word Error Rate Tỷ lệ lỗi từ độc lập với vị trí WMT Workshop on Statistical Ma- Hội nghị chuyên về dịch máy chine Translation của thế giới ix DANH MỤC CÁC BẢNG 1.1 Ảnh hưởng của miền dữ liệu trong dịch máy trong nghiên cứu [61] dựa trên điểm BLEU.2 Các tham số cơ bản của các hệ thống dịch dựa trên mạng hồi quy RNN.3 Các tham số cơ bản của các hệ thống dịch dựa trên mạng Transformer.1 Ví dụ về cách phân đoạn câu tiếng Nhật khi sử dụng ba phương pháp phân đoạn từ Kytea, mecab, spacy .2 Kết quả thực nghiệm trên hệ thống dịch NMT giữa tiếng Việt và tiếng Nhật trong phương pháp phân đoạn từ không giám sát cho văn bản tiếng Việt.3 Một số ví dụ về sự ánh xạ giữa các ký tự kanji trong tiếng Nhật với các từ trong tiếng Việt.4 So sánh kết quả thực nghiệm trên các hệ thống dịch giữa tiếng Nhật và tiếng Việt.1 Minh hoạ phương pháp sinh ra dữ liệu tổng hợp trong cách tiếp cận của [40, 115] cho hệ thống dịch từ tiếng Anh sang tiếng Việt.2 Minh hoạ phương pháp sinh ra dữ liệu như trong cách tiếp cận của [40, 115] trong hệ thống dịch từ tiếng Nhật sang tiếng Việt.3 Ví dụ về các kỹ thuật sinh dữ liệu tổng hợp trong nghiên cứu của [115], các từ bị thay đổi được in đậm .

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Trích dẫn luận án này

Ngo Thi Vinh (2024). Cải tiến chất lượng dịch máy dựa vào mạng nơron cho các ngôn [Luận án tiến sĩ, Trường Đại học Công nghệ, Đại học Quốc gia Hà Nội]. LuanAn.net. https://luanan.net/tai-lieu-khac/cai-tien-chat-luong-dich-may-dua-vao-mang-noron-cho-cac-ngon-ngu-tai-nguyen-han

Câu hỏi thường gặp

Luận án "Cải tiến chất lượng dịch máy dựa vào mạng nơron cho các ngôn" nghiên cứu về vấn đề gì?

Luận án: Cải tiến chất lượng dịch máy dựa vào mạng nơron cho các ngôn ngữ tài nguyên hạn chế. Xem tóm tắt và tải về tại LuanAn.net

Luận án "Cải tiến chất lượng dịch máy dựa vào mạng nơron cho các ngôn" được bảo vệ tại trường nào?

Luận án này được bảo vệ tại Trường Đại học Công nghệ, Đại học Quốc gia Hà Nội. Năm bảo vệ: 2024.

Luận án "Cải tiến chất lượng dịch máy dựa vào mạng nơron cho các ngôn" thuộc chuyên ngành gì?

Luận án "Cải tiến chất lượng dịch máy dựa vào mạng nơron cho các ngôn" thuộc chuyên ngành Khoa học máy tính. Danh mục: Tài liệu khác.

Luận án "Cải tiến chất lượng dịch máy dựa vào mạng nơron cho các ngôn" có bao nhiêu trang?

Luận án "Cải tiến chất lượng dịch máy dựa vào mạng nơron cho các ngôn" có 163 trang. Bạn có thể xem trước một phần tài liệu ngay trên trang web trước khi tải về.

Cách tải luận án "Cải tiến chất lượng dịch máy dựa vào mạng nơron cho các ngôn" về máy như thế nào?

Để tải luận án về máy, bạn nhấn nút "Tải xuống ngay" trên trang này, sau đó hoàn tất thanh toán phí lưu trữ. File sẽ được tải xuống ngay sau khi thanh toán thành công. Hỗ trợ qua Zalo: 0559 297 239.

Luận án liên quan

Chia sẻ tài liệu: Facebook Twitter