Luận văn thạc sĩ khai phá tri thức song ngữ và ứng dụng trong dịch máy anh việt

Luận án: Luận văn thạc sĩ khai phá tri thức song ngữ và ứng dụng trong dịch máy anh việt luận án ts công nghệ thông tin 62 48 01 01. Xem tóm tắt và tải về tại L

Tác giả

Luan An

Thể loại

Luận án tiến sĩ

Năm xuất bản

Số trang

129

Thời gian đọc

20 phút

Lượt xem

0

Lượt tải

0

Phí lưu trữ

40 Point

Tổng quan nhanh

Chủ đề:
Khai phá tri thức song ngữ: Giải pháp dịch máy Anh-Việt
Số trang:
129 trang
Trường:
Trường Đại học Công nghệ, Đại học Quốc gia Hà Nội
Chuyên ngành:
Khoa học máy tính
Tác giả:
Năm:

Tóm tắt nội dung luận án

I.Khai phá tri thức song ngữ Giải pháp dịch máy Anh Việt

Nghiên cứu này tập trung vào nhiệm vụ dịch máy tự động. Hệ thống dịch máy cần chuyển đổi văn bản giữa các ngôn ngữ. Chất lượng dịch quyết định tính hữu ích. Ứng dụng dịch máy đa dạng, từ tài liệu đến giao tiếp. Dịch máy thống kê là một hướng phát triển tiềm năng. Nó tự động xây dựng từ điển và quy luật từ ngữ liệu. Tuy nhiên, ngữ liệu song ngữ còn hạn chế. Cả về kích thước và chất lượng. Đặc biệt, cặp ngôn ngữ Anh-Việt có khác biệt lớn về cấu trúc. Đây là một thách thức lớn. Việc bổ sung ngữ liệu và phát triển phương pháp mới là cần thiết. Luận án giải quyết các vấn đề này. Nó tìm cách nâng cao chất lượng dịch máy thống kê.

1.1. Thách thức trong dịch máy thống kê hiện tại

Dịch máy tự động là một công nghệ quan trọng. Chất lượng dịch cần được cải thiện liên tục. Nó ảnh hưởng đến các ứng dụng thực tế. Từ dịch tài liệu để hiểu nội dung. Đến dịch văn bản để xuất bản. Hoặc giao tiếp qua email, chat. Dịch máy thống kê là phương pháp hiệu quả. Nó tự động học các quy luật từ ngữ liệu. Không cần xây dựng từ điển thủ công. Nhưng ngữ liệu song ngữ sẵn có còn hạn chế. Vấn đề nằm ở kích thước và chất lượng. Đặc biệt với các cặp ngôn ngữ cấu trúc khác biệt. Như tiếng Anh và tiếng Việt. Đây là thách thức lớn. Các nhà nghiên cứu cần giải pháp mới.

1.2. Mục tiêu nghiên cứu Cải thiện chất lượng dịch

Nghiên cứu này đặt ra mục tiêu rõ ràng. Nó nhằm giải quyết các tồn tại của dịch máy. Chất lượng dịch cho cặp Anh-Việt cần được nâng cao. Ba bài toán chính được tập trung. Thứ nhất, phát triển phương pháp xây dựng ngữ liệu song ngữ. Thứ hai, cải tiến phương pháp gióng hàng từ. Thứ ba, xác định cụm từ song ngữ cho dịch máy thống kê. Các giải pháp này hướng đến tăng cường hiệu quả. Chúng giúp cải thiện đáng kể chất lượng hệ thống dịch.

1.3. Vai trò của tri thức song ngữ trong Dịch máy NLP

Tri thức song ngữ là nền tảng cốt lõi. Nó quyết định chất lượng của dịch máy thống kê. Ngữ liệu song ngữ lớn và chuẩn xác là cần thiết. Nó cung cấp dữ liệu để xây dựng mô hình. Các quy luật ngôn ngữ được học tự động. Khai phá tri thức song ngữ giúp hiểu mối quan hệ. Nó nhận diện các cấu trúc tương đương giữa hai ngôn ngữ. Lĩnh vực Xử lý ngôn ngữ tự nhiên (NLP) phụ thuộc vào tri thức này. Việc cải thiện tri thức song ngữ là chìa khóa. Nó giúp nâng cao chất lượng hệ thống đa ngôn ngữ.

II.Xây dựng ngữ liệu song ngữ Tăng cường hệ thống NLP

Việc xây dựng ngữ liệu song ngữ chất lượng cao là trọng tâm. Nghiên cứu khai thác hai nguồn chính. Đó là Web và sách điện tử song ngữ. Từ Web, các văn bản song ngữ được rút trích. Phương pháp thiết kế đặc trưng dựa trên nội dung. Nó sử dụng từ bất biến (cognate) và phân đoạn dịch. Đặc trưng nội dung được kết hợp với đặc trưng cấu trúc web. Học máy được ứng dụng để rút trích hiệu quả. Từ sách điện tử, phương pháp dựa trên nội dung được đề xuất. Các mẫu liên kết giữa khối văn bản được dùng. Điều này giúp rút trích các câu song ngữ. Các phương pháp này làm giàu nguồn ngữ liệu. Chúng hỗ trợ mạnh mẽ cho các hệ thống đa ngôn ngữ và Xử lý ngôn ngữ tự nhiên (NLP).

2.1. Trích xuất văn bản song ngữ từ Web bằng Học máy

Xây dựng ngữ liệu song ngữ là một bước quan trọng. Nguồn tài nguyên từ Web được khai thác rộng rãi. Văn bản song ngữ được rút trích từ các website chuyên biệt. Phương pháp thiết kế đặc trưng dựa trên nội dung được đề xuất. Các từ bất biến giữa hai ngôn ngữ được sử dụng. Các phân đoạn dịch cũng đóng vai trò quan trọng. Ngoài ra, phương pháp học máy được áp dụng. Nó kết hợp đặc trưng nội dung với đặc trưng cấu trúc trang web. Quá trình này giúp trích xuất thông tin song ngữ hiệu quả. Nó tạo ra ngữ liệu chất lượng cao cho dịch máy.

2.2. Khai thác sách điện tử song ngữ cho ngữ liệu

Sách điện tử song ngữ là một nguồn tài nguyên quý giá khác. Nghiên cứu đề xuất phương pháp dựa trên nội dung. Phương pháp này sử dụng các mẫu liên kết cụ thể. Các khối văn bản tương ứng trong hai ngôn ngữ được nối với nhau. Điều này cho phép rút trích các câu song ngữ một cách chính xác. Việc khai thác sách điện tử bổ sung đáng kể cho ngữ liệu. Ngữ liệu lớn hơn và đa dạng hơn được tạo ra. Nó cung cấp dữ liệu phong phú. Dữ liệu này cần thiết cho huấn luyện các mô hình dịch máy. Qua đó, chất lượng của các hệ thống đa ngôn ngữ được cải thiện.

2.3. Các phương pháp thu thập và làm giàu dữ liệu

Thu thập ngữ liệu bao gồm các kỹ thuật tự động. Điều này giúp giảm thiểu công sức thủ công. Quá trình làm giàu dữ liệu cũng rất quan trọng. Nó bao gồm kiểm tra chất lượng dữ liệu. Đồng thời, bổ sung các thông tin liên quan và làm sạch ngữ liệu. Mục tiêu là tạo ra một ngữ liệu sạch và phong phú. Ngữ liệu này là đầu vào thiết yếu. Nó hỗ trợ các mô hình Học máy. Đồng thời, nó là nền tảng cho việc trích xuất thông tin song ngữ. Điều này góp phần vào sự phát triển của Xử lý ngôn ngữ tự nhiên (NLP).

III.Cải tiến gióng hàng từ và cụm từ Nâng cao dịch máy

Gióng hàng từ và cụm từ là các bước then chốt. Chúng ảnh hưởng trực tiếp đến chất lượng dịch máy thống kê. Nghiên cứu đề xuất cải tiến mô hình IBM 1. Cách tiếp cận dựa trên ràng buộc được áp dụng. Các ràng buộc bao gồm neo, vị trí của từ, từ loại và cụm từ. Phương pháp tổng quát tích hợp các ràng buộc này. Nó sử dụng thuật toán cực đại kỳ vọng để ước lượng tham số. Điều này giúp nâng cao độ chính xác của gióng hàng. Ngoài ra, phương pháp xác định cụm từ song ngữ cũng được phát triển. Nó dùng mẫu cú pháp kết hợp với gióng hàng cụm từ. Các cụm từ này được ứng dụng. Chúng cải thiện đáng kể chất lượng dịch cho hệ thống Anh-Việt. Các cải tiến này góp phần tối ưu hóa hiệu suất của dịch máy.

3.1. Nâng cấp mô hình gióng hàng từ IBM 1 có ràng buộc

Gióng hàng từ là một thành phần quan trọng. Nó có trong hệ thống dịch máy thống kê. Mô hình IBM 1 được nâng cấp. Cách tiếp cận dựa trên ràng buộc được áp dụng. Nhiều loại ràng buộc được tích hợp. Bao gồm ràng buộc neo. Ràng buộc về vị trí của từ cũng được sử dụng. Cùng với ràng buộc về từ loại. Và ràng buộc về cụm từ. Phương pháp tổng quát được đề xuất. Nó tích hợp các ràng buộc vào thuật toán cực đại kỳ vọng (EM). Điều này giúp ước lượng tham số mô hình chính xác hơn. Kết quả là gióng hàng từ hiệu quả hơn.

3.2. Xác định cụm từ song ngữ dùng mẫu cú pháp

Bài toán xác định cụm từ song ngữ được giải quyết. Đây là yếu tố quan trọng cho dịch máy thống kê. Phương pháp rút trích cụm từ được đề xuất. Nó sử dụng ngữ liệu song ngữ làm cơ sở. Các mẫu cú pháp được kết hợp hiệu quả. Gióng hàng cụm từ cũng là một phần của quy trình. Các cụm từ song ngữ được tạo ra là tài nguyên quý giá. Chúng được ứng dụng trực tiếp vào hệ thống. Việc này giúp nâng cao chất lượng dịch. Đặc biệt cho cặp ngôn ngữ Anh-Việt. Chất lượng của các hệ thống đa ngôn ngữ được cải thiện.

3.3. Tối ưu hóa chất lượng dịch máy Anh Việt

Các cải tiến trong gióng hàng từ và cụm từ mang lại hiệu quả rõ rệt. Chất lượng dịch của hệ thống Anh-Việt được tối ưu hóa. Các phương pháp này được tích hợp vào hệ thống dịch máy. Chúng giúp giải quyết các vấn đề cấu trúc ngôn ngữ. Đặc biệt với sự khác biệt giữa Anh và Việt. Luận án đã đưa ra các giải pháp cụ thể. Các giải pháp này đã được kiểm chứng. Kết quả thực nghiệm cho thấy sự cải thiện đáng kể. Điều này đóng góp vào sự phát triển của lĩnh vực dịch máy. Đồng thời, nó hỗ trợ khai phá tri thức song ngữ.

IV.Ứng dụng Học máy và Biểu diễn tri thức hiệu quả

Nghiên cứu ứng dụng Học máy một cách mạnh mẽ. Nó được dùng trong nhiều khía cạnh của dịch máy. Việc thiết kế đặc trưng dựa trên nội dung và cấu trúc là một ví dụ. Các từ bất biến và phân đoạn dịch được sử dụng. Sự kết hợp này tối ưu hóa trích xuất văn bản song ngữ. Học máy cũng đóng vai trò trong việc tích hợp ràng buộc. Nó dùng trong thuật toán cực đại kỳ vọng (EM). Các ràng buộc cung cấp thông tin bổ sung. Chúng hướng dẫn quá trình học. Điều này giúp cải thiện độ tin cậy của mô hình. Nghiên cứu này có nhiều đóng góp quan trọng. Nó cung cấp các phương pháp mới cho khai phá tri thức song ngữ. Đồng thời, nó hỗ trợ lĩnh vực Xử lý ngôn ngữ tự nhiên (NLP).

4.1. Thiết kế đặc trưng dựa trên nội dung và cấu trúc

Học máy là công cụ trung tâm. Nó được dùng để nâng cao hiệu quả. Đặc trưng dựa trên nội dung được thiết kế cẩn thận. Bao gồm việc sử dụng các từ bất biến (cognate). Phân đoạn dịch cũng là một đặc trưng quan trọng. Đồng thời, đặc trưng dựa trên cấu trúc trang web được kết hợp. Sự kết hợp này tối ưu hóa việc trích xuất văn bản song ngữ. Nó giúp hệ thống trích xuất thông tin song ngữ hiệu quả hơn. Đây là một ứng dụng điển hình của Học máy. Nó giúp làm giàu ngữ liệu cho dịch máy.

4.2. Tích hợp ràng buộc trong thuật toán cực đại kỳ vọng

Việc tích hợp các ràng buộc là một kỹ thuật tiên tiến. Nó được áp dụng trong thuật toán cực đại kỳ vọng (EM). Thuật toán này dùng để ước lượng tham số mô hình. Các ràng buộc cung cấp thông tin bổ sung có giá trị. Chúng giúp hướng dẫn quá trình học một cách chính xác hơn. Điều này cải thiện độ tin cậy của mô hình. Chất lượng của các mô hình gióng hàng từ được nâng cao đáng kể. Đây là một đóng góp quan trọng. Nó thể hiện khả năng biểu diễn tri thức một cách hiệu quả.

4.3. Đóng góp cho lĩnh vực Xử lý ngôn ngữ tự nhiên

Nghiên cứu này có nhiều đóng góp quan trọng. Nó cung cấp các phương pháp mới cho khai phá tri thức song ngữ. Đặc biệt, các giải pháp cho dịch máy Anh-Việt được đề xuất. Chúng bao gồm xây dựng ngữ liệu và gióng hàng từ. Các ứng dụng của Học máy được trình bày cụ thể. Nghiên cứu mở ra những hướng đi mới. Nó thúc đẩy sự phát triển của Xử lý ngôn ngữ tự nhiên (NLP). Các hệ thống đa ngôn ngữ được hưởng lợi. Chất lượng dịch của các hệ thống này được nâng cao.

Mục lục chi tiết luận án

Lời cam đoan
Tóm tắt
Lời cảm ơn
Danh mục các chữ viết tắt
Danh mục các hình vẽ
Danh mục các bảng
MỞ ĐẦU
1. 1 Tổng quan
1.1. 1.1 Khai phá tri thức song ngữ
1.1.1. Xây dựng ngữ liệu song ngữ
1.1.2. Gióng hàng văn bản
1.1.2.1. Gióng hàng đoạn/câu
1.1.2.2. Gióng hàng từ
1.1.3. Xác định cụm từ song ngữ
2. 2 Sơ lược về dịch máy
2.1. Mô hình hóa bài toán
2.2. Mô hình ngôn ngữ
2.3. Mô hình dịch
2.3.1. Mô hình dịch dựa trên từ
2.3.2. Mô hình dịch dựa trên cụm từ
2.3.3. Mô hình dịch dựa trên cú pháp
2.4. Đánh giá chất lượng dịch
3. 3 Dịch máy thống kê
3.1. Mô hình hóa bài toán
3.2. Mô hình ngôn ngữ
3.3. Mô hình dịch
3.3.1. Mô hình dịch dựa trên từ
3.3.2. Mô hình dịch dựa trên cụm từ
3.3.3. Mô hình dịch dựa trên cú pháp
3.4. Đánh giá chất lượng dịch
2. 2 Xây dựng ngữ liệu song ngữ cho dịch máy thống kê
2.1. 2.1 Rút trích văn bản song ngữ từ Web
2.1.1. Thu thập dữ liệu
2.1.2. Thiết kế các đặc trưng dựa vào nội dung
2.1.2.1. Sử dụng cognate
2.1.2.2. Sử dụng các phân đoạn dịch
2.1.3. Thiết kế các đặc trưng dựa vào cấu trúc
2.1.4. Mô hình hóa bài toán phân loại
2.2. 2.2 Rút trích câu song ngữ từ sách điện tử
2.3. 2.3 Gióng hàng đoạn
2.4. 2.4 Gióng hàng câu
2.4.1. Thực nghiệm về rút trích văn bản song ngữ từ Web
2.4.1.1. Cài đặt thực nghiệm
2.4.1.2. Kết quả thực nghiệm
2.4.2. Thực nghiệm về rút trích câu song ngữ từ sách điện tử
2.4.2.1. Cài đặt thực nghiệm
2.4.2.2. Kết quả thực nghiệm
2.4.3. Thực nghiệm về bổ sung ngữ liệu song ngữ cho dịch máy
2.4.4. Kết luận chương
3. 3 Gióng hàng từ cho dịch máy thống kê
3.1. 3.1 Định nghĩa từ
3.2. 3.2 Định nghĩa bài toán gióng hàng từ
3.3. 3.3 Các mô hình IBM
3.4. 3.4 Thuật toán cực đại kỳ vọng cho mô hình IBM 1
3.5. 3.5 Một số cải tiến mô hình IBM 1 theo cách tiếp cận dựa trên ràng buộc
3.5.1. 3.1 Cải tiến mô hình IBM 1 sử dụng ràng buộc neo
3.5.2. 3.2 Cải tiến mô hình IBM 1 sử dụng ràng buộc về vị trí của từ
3.5.3. 3.3 Cải tiến mô hình IBM 1 sử dụng ràng buộc về từ loại
3.5.3.1. Quan hệ về từ loại
3.5.3.2. Ràng buộc về từ loại
3.5.4. 3.4 Cải tiến mô hình IBM 1 sử dụng ràng buộc về cụm từ
3.5.4.1. Mẫu cú pháp song ngữ
3.5.4.2. Ràng buộc về cụm từ
3.5.5. 3.5 Kết hợp các ràng buộc
3.5.5.1. Cài đặt thực nghiệm
3.5.5.2. 2 Kết quả thực nghiệm với ràng buộc neo và ràng buộc về vị trí của từ
3.5.5.3. 3 Kết quả thực nghiệm với ràng buộc từ loại
3.5.5.4. 4 Kết quả thực nghiệm với ràng buộc cụm từ
3.5.5.5. 5 Kết quả thực nghiệm về kết hợp ràng buộc
3.6. 4 Kết luận chương
4. 4 Xác định cụm từ song ngữ cho dịch máy thống kê
4.1. 4.1 Bài toán rút trích cụm từ song ngữ
4.2. 4.2 Phương pháp rút trích cụm từ song ngữ
4.2.1. Tìm cụm từ đích
4.2.2. Rút trích cụm từ
4.3. 4.3 Tích hợp cụm từ song ngữ vào dịch máy
4.3.1. Thực nghiệm về rút trích cụm từ song ngữ
4.3.1.1. Cài đặt thực nghiệm
4.3.1.2. Kết quả thực nghiệm
4.3.2. Thực nghiệm về tích hợp cụm từ song ngữ vào dịch máy
4.3.2.1. Cài đặt thực nghiệm
4.3.2.2. Kết quả thực nghiệm
4.4. 4.5 Kết luận chương
KẾT LUẬN
Danh mục công trình khoa học của tác giả liên quan đến luận án
Tài liệu tham khảo
Xem trước tài liệu
Tải đầy đủ để xem toàn bộ nội dung
Luận văn thạc sĩ khai phá tri thức song ngữ và ứng dụng trong dịch máy anh việt luận án ts công nghệ thông tin 62 48 01 01

Tải xuống file đầy đủ để xem toàn bộ nội dung

Tải đầy đủ (129 trang)

Trích đoạn nội dung luận án

Tải xuống để đọc toàn bộ

ĐẠI HỌC QUỐC GIA HÀ NỘI TRƯỜNG ĐẠI HỌC CÔNG NGHỆ LÊ QUANG HÙNG KHAI PHÁ TRI THỨC SONG NGỮ VÀ ỨNG DỤNG TRONG DỊCH MÁY ANH – VIỆT LUẬN ÁN TIẾN SĨ KHOA HỌC MÁY TÍNH Hà Nội – 2016 TIEU LUAN MOI download : skknchat@gmail.com ĐẠI HỌC QUỐC GIA HÀ NỘI TRƯỜNG ĐẠI HỌC CÔNG NGHỆ LÊ QUANG HÙNG KHAI PHÁ TRI THỨC SONG NGỮ VÀ ỨNG DỤNG TRONG DỊCH MÁY ANH – VIỆT Chuyên ngành: Khoa học máy tính Mã số: 62 48 01 01 LUẬN ÁN TIẾN SĨ KHOA HỌC MÁY TÍNH NGƯỜI HƯỚNG DẪN KHOA HỌC: 1. Lê Anh Cường 2. Huỳnh Văn Nam Hà Nội – 2016 TIEU LUAN MOI download : skknchat@gmail.com Lời cam đoan Tôi xin cam đoan luận án này là kết quả nghiên cứu của tôi, được thực hiện dưới sự hướng dẫn của PGS. Lê Anh Cường và PGS.

Các nội dung trích dẫn từ các nghiên cứu của các tác giả khác mà tôi trình bày trong luận án này đã được ghi rõ nguồn trong phần tài liệu tham khảo. Lê Quang Hùng i TIEU LUAN MOI download : skknchat@gmail.com Tóm tắt Nhiệm vụ của một hệ thống dịch máy là tự động dịch một văn bản từ ngôn ngữ này (ví dụ, tiếng Anh) sang một văn bản tương đương ở ngôn ngữ khác (ví dụ, tiếng Việt). Tính hữu ích của công nghệ dịch máy tăng lên cùng với chất lượng của nó. Dịch máy có nhiều ứng dụng như: (i) dịch tài liệu tiếng nước ngoài cho mục đích hiểu nội dung, (ii) dịch văn bản để xuất bản ở các ngôn ngữ khác và (iii) thông tin liên lạc, chẳng hạn như dịch email, chat, vv.

Có một số cách tiếp cận cho bài toán dịch máy như dịch trực tiếp (direct translation), dịch dựa trên chuyển đổi (transfer - based translation), dịch liên ngữ (interlingua translation), dịch dựa trên ví dụ (example - based translation) và dịch thống kê (statistical translation). Hiện tại, dịch máy dựa trên cách tiếp cận thống kê đang là một hướng phát triển đầy tiềm năng bởi những ưu điểm vượt trội so với các cách tiếp cận khác. Thay vì xây dựng các từ điển, các quy luật chuyển đổi bằng tay, dịch máy thống kê tự động xây dựng các từ điển, các quy luật dựa trên kết quả thống kê có được từ ngữ liệu. Đối với một hệ thống dịch máy thống kê, hiệu quả (chất lượng dịch) của nó tỷ lệ thuận với số lượng (kích thước) và chất lượng của ngữ liệu song ngữ được sử dụng để xây dựng hệ thống dịch.

Tuy nhiên, ngữ liệu song ngữ sẵn có hiện vẫn còn hạn chế cả về kích thước lẫn chất lượng, ngay cả đối với các cặp ngôn ngữ chính. Ngoài ra, đối với các cặp ngôn ngữ có nhiều khác biệt về cấu trúc ngữ pháp (ví dụ, Anh - Việt), vấn đề về chất lượng dịch đang là thách thức đối với các nhà nghiên cứu về dịch máy trong nhiều năm qua. Vì vậy, việc bổ sung thêm ngữ liệu song ngữ và phát triển các phương pháp hiệu quả hơn dựa trên ngữ liệu hiện có là những giải pháp quan trọng để tăng chất lượng dịch cho dịch máy thống kê. Luận án của chúng tôi tập trung giải quyết các tồn tại đã nêu thông qua ba bài toán: phát triển phương pháp xây dựng ngữ liệu song ngữ, cải tiến các phương pháp gióng hàng từ và xác định cụm từ song ngữ cho dịch máy thống kê, cụ thể như sau: Thứ nhất, đối với bài toán xây dựng ngữ liệu song ngữ, chúng tôi khai thác từ hai nguồn: Web và sách điện tử song ngữ.

Đối với nguồn từ Web, chúng tôi tập trung vào rút trích các văn bản song ngữ từ các web-site song ngữ. Chúng tôi đề xuất hai phương pháp thiết kế các đặc trưng dựa trên nội dung: sử dụng các từ bất biến giữa hai ngôn ngữ (cognate) và sử dụng các phân đoạn dịch. Ngoài ra, TIEU LUAN MOI download : skknchat@gmail.com chúng tôi kết hợp các đặc trưng dựa trên nội dung với các đặc trưng dựa trên cấu trúc của trang web để rút trích các văn bản song ngữ, bằng cách sử dụng phương pháp học máy. Đối với nguồn từ sách điện tử, chúng tôi đề xuất phương pháp dựa trên nội dung, sử dụng một số mẫu liên kết giữa các khối văn bản trong hai ngôn ngữ để rút trích các câu song ngữ.

Thứ hai, với bài toán gióng hàng từ, chúng tôi đề xuất một số cải tiến đối với mô hình IBM 1 theo cách tiếp cận dựa trên ràng buộc, bao gồm: ràng buộc neo, ràng buộc về vị trí của từ, ràng buộc về từ loại và ràng buộc về cụm từ. Với mỗi ràng buộc, chúng tôi đưa ra phương pháp tổng quát để tích hợp nó vào thuật toán cực đại kỳ vọng trong quá trình ước lượng tham số của mô hình. Ngoài ra, chúng tôi đưa ra một phương pháp để kết hợp các ràng buộc. Những cải tiến này đã giúp nâng cao chất lượng dịch cho hệ thống dịch máy thống kê Anh - Việt.

Thứ ba, đối với bài toán xác định cụm từ song ngữ cho dịch máy thống kê, chúng tôi đề xuất phương pháp rút trích cụm từ song ngữ từ ngữ liệu song ngữ, sử dụng các mẫu cú pháp kết hợp với gióng hàng cụm từ. Các cụm từ song ngữ này đã được ứng dụng vào việc nâng cao chất lượng dịch cho hệ thống dịch máy thống kê Anh - Việt. Từ khóa: dịch máy, dịch máy thống kê, tri thức song ngữ, ngữ liệu song ngữ, văn bản song ngữ, gióng hàng từ. iii TIEU LUAN MOI download : skknchat@gmail.com Lời cảm ơn Trước hết, tôi xin gửi lời cảm ơn sâu sắc đến PGS.

Lê Anh Cường và PGS. Huỳnh Văn Nam, hai Thầy đã trực tiếp hướng dẫn, chỉ bảo tận tình, luôn hỗ trợ và tạo những điều kiện tốt nhất cho tôi học tập và nghiên cứu. Tôi xin gửi lời cảm ơn đến các Thầy/Cô giáo ở Khoa Công nghệ thông tin, Trường Đại học Công nghệ, Đại học Quốc gia Hà Nội, đặc biệt là PGS. Phạm Bảo Sơn và các Thầy/Cô giáo ở Bộ môn Khoa học máy tính, những người đã trực tiếp giảng dạy và giúp đỡ tôi trong quá trình học tập và nghiên cứu ở trường.

Tôi xin gửi lời cảm ơn đến các đồng nghiệp ở Khoa Công nghệ thông tin, Trường Đại học Quy Nhơn, đặc biệt là TS. Trần Thiên Thành và TS. Lê Xuân Việt đã quan tâm, giúp đỡ và tạo điều kiện cho tôi trong thời gian làm nghiên cứu sinh. Tôi xin gửi cảm ơn đến PGS.

Nguyễn Phương Thái, TS. Nguyễn Văn Vinh, TS. Phan Xuân Hiếu (Trường Đại học Công nghệ, Đại học Quốc gia Hà Nội), PGS. Lê Thanh Hương (Trường Đại học Bách khoa Hà Nội), TS.

Nguyễn Thị Minh Huyền, TS. Lê Hồng Phương (Trường Đại học Khoa học Tự nhiên, Đại học Quốc gia Hà Nội), TS. Nguyễn Đức Dũng (Viện Công nghệ thông tin, Viện Hàn lâm Khoa học và Công nghệ Việt Nam), các Thầy/Cô đã có những góp ý chỉnh sửa để tôi hoàn thiện luận án. Tôi xin gửi lời cảm ơn đến tất cả anh, chị, em và bạn đồng học ở Bộ môn Khoa học máy tính (Khoa Công nghệ thông tin, Trường Đại học Công nghệ, Đại học Quốc gia Hà Nội), đặc biệt là chị Nguyễn Thị Xuân Hương (Khoa Công nghệ thông tin, Trường Đại học Dân lập Hải Phòng), nghiên cứu sinh Hoàng Thị Điệp (Khoa Công nghệ thông tin, Trường Đại học Công nghệ) đã giúp đỡ tôi trong thời gian làm nghiên cứu sinh.

Cuối cùng, tôi xin gửi lời cảm ơn đến tất cả các thành viên trong gia đình tôi, đặc biệt là vợ tôi - người đã luôn ủng hộ, chia sẽ, động viên và gánh vác công việc gia đình để tôi yên tâm học tập, nghiên cứu. iv TIEU LUAN MOI download : skknchat@gmail.com Mục lục Lời cam đoan i Tóm tắt ii Lời cảm ơn iv Danh mục các chữ viết tắt viii Danh mục các hình vẽ ix Danh mục các bảng xi Mở đầu 1 1 Tổng quan 5 1.1 Khai phá tri thức song ngữ .1 Xây dựng ngữ liệu song ngữ .2 Gióng hàng văn bản .1 Gióng hàng đoạn/câu .2 Gióng hàng từ .3 Xác định cụm từ song ngữ .2 Sơ lược về dịch máy .3 Dịch máy thống kê .1 Mô hình hóa bài toán .2 Mô hình ngôn ngữ .3 Mô hình dịch .1 Mô hình dịch dựa trên từ .2 Mô hình dịch dựa trên cụm từ .3 Mô hình dịch dựa trên cú pháp .5 Đánh giá chất lượng dịch. 27 v TIEU LUAN MOI download : skknchat@gmail. 29 2 Xây dựng ngữ liệu song ngữ cho dịch máy thống kê 32 2.1 Rút trích văn bản song ngữ từ Web .1 Thu thập dữ liệu .2 Thiết kế các đặc trưng dựa vào nội dung .1 Sử dụng cognate .2 Sử dụng các phân đoạn dịch .3 Thiết kế các đặc trưng dựa vào cấu trúc .4 Mô hình hóa bài toán phân loại .2 Rút trích câu song ngữ từ sách điện tử .3 Gióng hàng đoạn .4 Gióng hàng câu .1 Thực nghiệm về rút trích văn bản song ngữ từ Web .1 Cài đặt thực nghiệm .2 Kết quả thực nghiệm .2 Thực nghiệm về rút trích câu song ngữ từ sách điện tử .1 Cài đặt thực nghiệm .2 Kết quả thực nghiệm .3 Thực nghiệm về bổ sung ngữ liệu song ngữ cho dịch máy .4 Kết luận chương.

57 3 Gióng hàng từ cho dịch máy thống kê 59 3.1 Định nghĩa từ .2 Định nghĩa bài toán gióng hàng từ .3 Các mô hình IBM .4 Thuật toán cực đại kỳ vọng cho mô hình IBM 1 .2 Một số cải tiến mô hình IBM 1 theo cách tiếp cận dựa trên ràng buộc 65 3.1 Cải tiến mô hình IBM 1 sử dụng ràng buộc neo .2 Cải tiến mô hình IBM 1 sử dụng ràng buộc về vị trí của từ .3 Cải tiến mô hình IBM 1 sử dụng ràng buộc về từ loại .1 Quan hệ về từ loại .2 Ràng buộc về từ loại .4 Cải tiến mô hình IBM 1 sử dụng ràng buộc về cụm từ .1 Mẫu cú pháp song ngữ .2 Ràng buộc về cụm từ .5 Kết hợp các ràng buộc .1 Cài đặt thực nghiệm. 78 vi TIEU LUAN MOI download : skknchat@gmail.2 Kết quả thực nghiệm với ràng buộc neo và ràng buộc về vị trí của từ .3 Kết quả thực nghiệm với ràng buộc từ loại .4 Kết quả thực nghiệm với ràng buộc cụm từ .5 Kết quả thực nghiệm về kết hợp ràng buộc .4 Kết luận chương. 85 4 Xác định cụm từ song ngữ cho dịch máy thống kê 87 4.1 Bài toán rút trích cụm từ song ngữ .2 Phương pháp rút trích cụm từ song ngữ .2 Tìm cụm từ đích .3 Rút trích cụm từ .3 Tích hợp cụm từ song ngữ vào dịch máy .1 Thực nghiệm về rút trích cụm từ song ngữ .1 Cài đặt thực nghiệm .2 Kết quả thực nghiệm .2 Thực nghiệm về tích hợp cụm từ song ngữ vào dịch máy .

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Trích dẫn luận án này

Lê Quang Hùng (2016). Luận văn thạc sĩ khai phá tri thức song ngữ và ứng dụng tron [Luận án tiến sĩ, Trường Đại học Công nghệ, Đại học Quốc gia Hà Nội]. LuanAn.net. https://luanan.net/tai-lieu-khac/luan-van-thac-si-khai-pha-tri-thuc-song-ngu-va-ung-dung-trong-dich-may-anh-viet

Câu hỏi thường gặp

Luận án "Luận văn thạc sĩ khai phá tri thức song ngữ và ứng dụng tron" nghiên cứu về vấn đề gì?

Luận án: Luận văn thạc sĩ khai phá tri thức song ngữ và ứng dụng trong dịch máy anh việt luận án ts công nghệ thông tin 62 48 01 01. Xem tóm tắt và tải về tại L

Luận án "Luận văn thạc sĩ khai phá tri thức song ngữ và ứng dụng tron" được bảo vệ tại trường nào?

Luận án này được bảo vệ tại Trường Đại học Công nghệ, Đại học Quốc gia Hà Nội. Năm bảo vệ: 2016.

Luận án "Luận văn thạc sĩ khai phá tri thức song ngữ và ứng dụng tron" thuộc chuyên ngành gì?

Luận án "Luận văn thạc sĩ khai phá tri thức song ngữ và ứng dụng tron" thuộc chuyên ngành Khoa học máy tính. Danh mục: Tài liệu khác.

Luận án "Luận văn thạc sĩ khai phá tri thức song ngữ và ứng dụng tron" có bao nhiêu trang?

Luận án "Luận văn thạc sĩ khai phá tri thức song ngữ và ứng dụng tron" có 129 trang. Bạn có thể xem trước một phần tài liệu ngay trên trang web trước khi tải về.

Cách tải luận án "Luận văn thạc sĩ khai phá tri thức song ngữ và ứng dụng tron" về máy như thế nào?

Để tải luận án về máy, bạn nhấn nút "Tải xuống ngay" trên trang này, sau đó hoàn tất thanh toán phí lưu trữ. File sẽ được tải xuống ngay sau khi thanh toán thành công. Hỗ trợ qua Zalo: 0559 297 239.

Luận án liên quan

Chia sẻ tài liệu: Facebook Twitter