Luận án tiến sĩ: Khai phá tri thức song ngữ và ứng dụng trong dịch máy Anh-Việt
"Nghiên cứu khai phá tri thức song ngữ ứng dụng trong dịch máy Anh-Việt, tối ưu hóa thuật toán xử lý ngôn ngữ tự nhiên."
Năm xuất bản
Số trang
129
Thời gian đọc
20 phút
Lượt xem
0
Lượt tải
0
Phí lưu trữ
40 Point
Tổng quan nhanh
- Chủ đề:
- 1. Tổng quan khai phá tri thức song ngữ cho dịch máy
- Số trang:
- 129 trang
- Trường:
- Trường Đại học Công nghệ, Đại học Quốc gia Hà Nội
- Chuyên ngành:
- Khoa học máy tính
- Tác giả:
- Lê Quang Hùng
- Năm:
- 2016
Tóm tắt nội dung luận án
I. Tổng quan khai phá tri thức song ngữ cho dịch máy
Khai phá tri thức song ngữ giữ vai trò then chốt trong xử lý ngôn ngữ tự nhiên. Quá trình này cung cấp dữ liệu nền tảng cho các hệ thống dịch thuật tự động. Nhu cầu dịch tài liệu, email và trao đổi thông tin quốc tế ngày càng gia tăng. Phương pháp truyền thống dựa trên luật ngữ pháp tốn nhiều công sức xây dựng thủ công. Dịch máy thống kê và dịch máy hiện đại sử dụng dữ liệu để tự động học tri thức. Hiệu năng của mô hình phụ thuộc trực tiếp vào quy mô và độ chính xác của ngữ liệu song ngữ. Việc trích xuất tri thức chất lượng cao giúp thu hẹp khoảng cách ngữ nghĩa giữa các ngôn ngữ. Hệ thống dịch thuật nhờ đó tạo ra văn bản dịch tự nhiên và chính xác hơn. Nghiên cứu khai phá tri thức tạo bước đệm lớn cho các giải pháp dịch thuật tự động thông minh.
1.1. Vai trò của dịch máy Anh Việt trong kỷ nguyên số
Dịch máy Anh - Việt đóng vai trò cầu nối thông tin quan trọng. Công nghệ này giúp người dùng tiếp cận nhanh kho tri thức toàn cầu. Tài liệu khoa học, kinh tế và giáo dục phần lớn lưu trữ bằng tiếng Anh. Hệ thống dịch tự động hỗ trợ chuyển ngữ văn bản với tốc độ cao. Các tổ chức sử dụng dịch máy để xử lý khối lượng lớn tài liệu xuất bản và thư điện tử. Dịch tự động giúp tiết kiệm chi phí dịch thuật chuyên gia. Dữ liệu song ngữ chuẩn xác là yếu tố quyết định chất lượng đầu ra. Hệ thống dịch tự động liên tục cải tiến để đáp ứng yêu cầu giao tiếp đa phương tiện.
1.2. Thách thức cốt lõi khi khai phá tri thức song ngữ
Tiếng Anh và tiếng Việt có sự khác biệt lớn về cấu trúc ngữ pháp và trật tự từ. Tiếng Việt là ngôn ngữ đơn lập, không biến đổi hình thái từ. Tiếng Anh là ngôn ngữ biến tố với nhiều quy tắc chia thì. Sự bất tương đồng này gây khó khăn cho việc đối sánh văn bản. Nguồn ngữ liệu song ngữ chất lượng cao hiện nay vẫn còn hạn chế về quy mô. Dữ liệu thu thập từ các nguồn mở thường chứa nhiều nhiễu và sai lệch định dạng. Quá trình trích xuất đòi hỏi các thuật toán lọc sạch mạnh mẽ. Việc xử lý hiện tượng đa nghĩa của từ cũng là trở ngại lớn trong dịch tự động.
II. Xây dựng ngữ liệu song ngữ từ web và sách điện tử
Xây dựng ngữ liệu song ngữ (Parallel Corpus) là nhiệm vụ nền tảng trong dịch máy. Dữ liệu huấn luyện phong phú giúp mô hình nắm bắt trọn vẹn ngữ nghĩa. Hai nguồn khai thác dồi dào nhất gồm trang web đa ngữ và sách điện tử song ngữ. Web cung cấp nguồn ngữ liệu mở với đa dạng chủ đề và phong cách ngôn ngữ. Sách điện tử cung cấp các cặp đoạn văn có tính chuẩn xác văn phong cao. Quá trình thu thập kết hợp kỹ thuật bóc tách nội dung và nhận diện cấu trúc. Việc làm sạch và chuẩn hóa dữ liệu loại bỏ hoàn toàn các cặp câu rác. Hệ thống trích xuất tự động giúp tiết kiệm tối đa thời gian xây dựng kho ngữ liệu.
2.1. Khai thác ngữ liệu từ web bằng kỹ thuật Bitext Mining
Khai thác ngữ liệu từ web (Bitext Mining) tận dụng nguồn tài nguyên internet phong phú. Phương pháp tiếp cận kết hợp đặc trưng nội dung và đặc trưng cấu trúc website. Kỹ thuật nhận diện từ đồng nguyên bất biến và phân đoạn dịch tương đồng giúp đối sánh trang web. Cấu trúc URL và thẻ HTML cung cấp dấu hiệu nhận biết các trang song ngữ song song. Thuật toán học máy tự động phân loại và ghép cặp các tài liệu tương ứng. Dữ liệu web sau khi thu thập được đưa qua bộ lọc chất lượng nghiêm ngặt. Quy trình này tạo ra hàng triệu cặp câu song ngữ có độ tin cậy cao cho mô hình dịch.
2.2. Trích xuất câu song ngữ tự động từ sách điện tử
Sách điện tử song ngữ chứa các bản dịch văn học và tài liệu chuyên ngành chất lượng. Quá trình khai thác dựa trên cấu trúc các khối văn bản song hành. Thuật toán phân tích liên kết giữa các đoạn văn bản trong hai ngôn ngữ. Hệ thống nhận diện các mẫu ngắt câu và chiều dài đoạn để thiết lập quan hệ tương ứng. Kỹ thuật này khắc phục hiện tượng một câu tiếng Anh dịch thành nhiều câu tiếng Việt. Dữ liệu trích xuất từ sách có độ chính xác ngữ pháp vượt trội. Nguồn ngữ liệu này bổ sung các cấu trúc câu phức tạp và phong phú cho kho dữ liệu huấn luyện.
III. Phương pháp căn chỉnh từ cho dịch máy Anh Việt
Căn chỉnh từ (Word Alignment) xác định mối quan hệ tương ứng giữa các từ trong cặp câu song ngữ. Đây là bước xử lý cốt lõi trong xây dựng mô hình dịch thống kê và phân tích ngôn ngữ. Thuật toán đối sánh ánh xạ từ nguồn sang từ đích dựa trên xác suất đồng xuất hiện. Mô hình IBM truyền thống đóng vai trò quan trọng trong việc tính toán phân bố xác suất từ. Tuy nhiên, sai lệch thường xảy ra do sự khác biệt trật tự từ giữa tiếng Anh và tiếng Việt. Việc bổ sung các ràng buộc ngôn ngữ nâng cao độ chính xác của quá trình đối sánh. Kết quả căn chỉnh từ trực tiếp quyết định chất lượng của bảng dịch cụm từ.
3.1. Mô hình IBM 1 và kỹ thuật căn chỉnh câu song ngữ
Mô hình IBM 1 thiết lập xác suất dịch từ thông qua thuật toán cực đại kỳ vọng (EM). Quá trình căn chỉnh câu song ngữ (Sentence Alignment) được thực hiện trước để tạo các cặp câu chuẩn. Mô hình giả định mỗi từ đích được sinh ra từ một từ nguồn độc lập. Thuật toán lặp qua toàn bộ ngữ liệu để tối ưu hóa tham số dịch. Dù đơn giản, mô hình IBM 1 cung cấp khởi tạo tham số quan trọng cho các mô hình phức tạp hơn. Hạn chế của mô hình là chưa xem xét vị trí từ và ngữ cảnh câu. Việc kết hợp tiền xử lý tách từ tiếng Việt giúp cải thiện đáng kể độ hội tụ của thuật toán.
3.2. Cải tiến căn chỉnh từ bằng các ràng buộc ngôn ngữ
Nghiên cứu tích hợp các ràng buộc ngôn ngữ vào mô hình IBM 1 nhằm hạn chế lỗi căn chỉnh. Ràng buộc neo sử dụng các cặp từ chắc chắn tương đương để cố định vị trí. Ràng buộc vị trí kiểm soát khoảng cách di chuyển của từ giữa hai ngôn ngữ. Ràng buộc từ loại bảo đảm các từ cùng loại ngữ pháp có xác suất liên kết cao hơn. Ràng buộc cụm từ giữ nguyên tính toàn vẹn của các cấu trúc ngữ nghĩa cố định. Thuật toán cực đại kỳ vọng được điều chỉnh để dung hòa các ràng buộc trong quá trình huấn luyện. Phương pháp cải tiến này làm giảm đáng kể tỷ lệ căn chỉnh sai trên ngữ liệu Anh - Việt.
IV. Trích xuất thuật ngữ song ngữ nâng cao dịch thuật
Trích xuất thuật ngữ song ngữ (Bilingual Terminology Extraction) đóng vai trò sống còn đối với dịch thuật chuyên ngành. Thuật ngữ chuyên môn thường có nghĩa cố định và không thể dịch theo từng từ riêng lẻ. Việc tự động phát hiện các cụm từ tương đương giúp chuẩn hóa bản dịch kỹ thuật và khoa học. Phương pháp kết hợp phân tích cú pháp và bảng căn chỉnh cụm từ mang lại độ chính xác cao. Dữ liệu thuật ngữ sau khi trích xuất được tích hợp trực tiếp vào hệ thống dịch tự động. Giải pháp này hạn chế tối đa các lỗi dịch tối nghĩa và sai lệch thuật ngữ chuyên ngành.
4.1. Kỹ thuật trích xuất thuật ngữ song ngữ từ mẫu cú pháp
Phương pháp sử dụng các mẫu cú pháp cây để nhận diện ranh giới cụm danh từ và cụm động từ. Hệ thống phân tích cấu trúc ngữ pháp của câu tiếng Anh và câu tiếng Việt. Thuật toán đối sánh các nút cú pháp tương ứng trên hai cây phân tích. Cụm từ được lọc thông qua các chỉ số thống kê tần suất và độ gắn kết thông tin. Sự kết hợp giữa quy tắc cú pháp và căn chỉnh cụm từ loại bỏ các đoạn cắt vụn. Kỹ thuật này trích xuất thành công các thuật ngữ đa từ phức tạp với độ tin cậy vượt trội.
4.2. Xây dựng từ điển song ngữ tự động tăng chất lượng dịch
Từ điển song ngữ tự động là kho tri thức quý giá cho các ứng dụng dịch máy và tra cứu ngôn ngữ. Các cụm từ và thuật ngữ trích xuất được tổ chức thành cấu trúc từ điển có hệ thống. Hệ thống tự động gán nhãn nghĩa và tần suất sử dụng cho từng mục từ. Bảng dịch tự động này bổ trợ cho mô hình giải mã trong quá trình chọn từ đích. Độ chính xác của các bản dịch kỹ thuật tăng rõ rệt nhờ kho từ điển chuyên dụng. Quá trình cập nhật từ điển diễn ra liên tục khi có thêm dữ liệu ngữ liệu mới.
V. Ứng dụng nhúng đa ngữ và dịch máy nơ ron hiện đại
Sự phát triển của công nghệ xử lý ngôn ngữ tự nhiên đã mở ra kỷ nguyên mới cho dịch máy. Các mô hình dựa trên mạng nơ-ron nhân tạo dần thay thế các hệ thống dịch thống kê truyền thống. Tri thức song ngữ thu thập từ web và sách tiếp tục là nguồn nguyên liệu quý cho các mô hình hiện đại. Việc biểu diễn từ trong không gian vector đa chiều giúp máy tính hiểu sâu sắc ngữ cảnh văn bản. Các kỹ thuật tiên tiến giúp nâng cao tính mạch lạc và độ tự nhiên của văn bản dịch. Nghiên cứu khai phá tri thức song ngữ vẫn giữ nguyên giá trị cốt lõi trong kỷ nguyên trí tuệ nhân tạo.
5.1. Bước chuyển từ dịch máy thống kê sang dịch máy nơ ron NMT
Dịch máy nơ-ron (NMT) sử dụng kiến trúc mạng sâu để mô hình hóa toàn bộ quá trình dịch thuật. Mô hình NMT xử lý câu nguyên vẹn thay vì chia nhỏ thành các cụm từ rời rạc. Cơ chế chú ý (Attention Mechanism) giúp mô hình ghi nhớ ngữ cảnh dài trên cặp ngôn ngữ Anh - Việt. Dịch máy nơ-ron (NMT) tạo ra câu dịch trôi chảy và tự nhiên hơn hẳn phương pháp thống kê cũ. Tuy nhiên, NMT đòi hỏi lượng ngữ liệu song ngữ khổng lồ để đạt hiệu năng tối ưu. Các phương pháp khai thác ngữ liệu tự động tiếp tục đóng vai trò quyết định trong việc cung cấp dữ liệu huấn luyện cho NMT.
5.2. Khai thác không gian nhúng đa ngữ trong dịch thuật tự động
Nhúng đa ngữ (Multilingual Embeddings) ánh xạ các từ và câu từ nhiều ngôn ngữ vào chung một không gian vector. Kỹ thuật này giúp máy tính đo lường khoảng cách ngữ nghĩa giữa từ tiếng Anh và từ tiếng Việt. Các mô hình biểu diễn đa ngữ hỗ trợ trích xuất văn bản song ngữ quy mô lớn mà không cần từ điển có sẵn. Nhúng đa ngữ giải quyết hiệu quả vấn đề khan hiếm tài nguyên dữ liệu cho các cặp ngôn ngữ nghèo tài nguyên. Việc áp dụng không gian vector chung giúp nâng cao chất lượng dịch và tối ưu hóa thời gian huấn luyện mô hình.
Mục lục chi tiết luận án
Tải xuống file đầy đủ để xem toàn bộ nội dung
Tải đầy đủ (129 trang)Nội dung chính
Tổng quan về luận án
Nghiên cứu về tự động hóa chuyển ngữ giữa các ngôn ngữ tự nhiên giữ vị trí trọng yếu trong lĩnh vực Trí tuệ nhân tạo (AI) và Xử lý ngôn ngữ tự nhiên (Natural Language Processing - NLP). Luận án tiến sĩ khoa học máy tính với đề tài "Khai phá tri thức song ngữ và ứng dụng trong dịch máy Anh – Việt" (Mã số chuyên ngành: 62 48 01 01) do nghiên cứu sinh Lê Quang Hùng thực hiện dưới sự hướng dẫn của PGS. Lê Anh Cường và PGS. Huỳnh Văn Nam tại Trường Đại học Công nghệ – Đại học Quốc gia Hà Nội đã giải quyết triệt để các rào cản nền tảng của hệ thống dịch máy thống kê (Statistical Machine Translation - SMT) cho cặp ngôn ngữ Anh - Việt.
Trong kỷ nguyên phát triển của SMT, chất lượng của các hệ thống dịch luôn tuân theo một nguyên lý toán học thực nghiệm căn bản: "Đối với một hệ thống dịch máy thống kê, hiệu quả (chất lượng dịch) của nó tỷ lệ thuận với số lượng (kích thước) và chất lượng của ngữ liệu song ngữ được sử dụng để xây dựng hệ thống dịch". Tuy nhiên, khoảng trống nghiên cứu (research gap) nghiêm trọng tồn tại nhiều năm qua là sự khan hiếm trầm trọng của nguồn ngữ liệu song ngữ Anh - Việt chất lượng cao (parallel corpus scarcity), cùng sự khác biệt sâu sắc về mặt loại hình học ngôn ngữ và cấu trúc cú pháp giữa tiếng Anh (ngôn ngữ biến tố) và tiếng Việt (ngôn ngữ đơn lập, không biến hình).
Luận án thiết lập 2 mục tiêu nghiên cứu cốt lõi được chuyển hóa thành 3 câu hỏi nghiên cứu cụ thể:
- RQ1: Làm thế nào để tự động khai phá, lọc nhiễu và xây dựng ngữ liệu song ngữ Anh - Việt quy mô lớn, độ chính xác cao từ các nguồn dữ liệu phi cấu trúc trên Web và sách điện tử (e-books)?
- RQ2: Cơ chế toán học nào cho phép tích hợp các ràng buộc tri thức ngôn ngữ đa tầng (neo từ vựng, vị trí khoảng cách, từ loại POS, mẫu cú pháp) vào thuật toán Cực đại kỳ vọng (Expectation-Maximization - EM) nhằm khắc phục hiện tượng tối ưu cục bộ và nâng cao độ chính xác gióng hàng từ (Word Alignment) của mô hình IBM 1?
- RQ3: Phương pháp trích xuất cụm từ song ngữ nào tối ưu hóa được việc khai thác tri thức cú pháp một phía để vượt qua hạn chế của kỹ thuật so khớp đối xứng hai phía truyền thống?
Khung lý thuyết của luận án được xây dựng vững chắc dựa trên Lý thuyết Thông tin Shannon, Mô hình Kênh nhiễu ồn (Noisy Channel Model) và Mô hình dịch thống kê Bayes của Brown et al. (1993): $$e^* = \arg\max_e Pr(e|f) = \arg\max_e Pr(f|e)Pr(e)$$ Trong đó, mô hình ngôn ngữ $Pr(e)$ định lượng tính trôi chảy bằng mô hình $N$-gram kết hợp kỹ thuật làm trơn Kneser-Ney, còn mô hình dịch $Pr(f|e)$ mô tả xác suất chuyển ngữ được tối ưu hóa từ tri thức ngữ liệu song ngữ.
Nghiên cứu tạo nên bước đột phá khi thực nghiệm toàn diện trên tập ngữ liệu quy mô lớn (bao gồm tập thử nghiệm chuẩn 200.000 câu song ngữ Anh - Việt), chứng minh tác động cải thiện vượt bậc về chỉ số đánh giá tự động BLEU (Bilingual Evaluation Understudy) và giảm thiểu tỷ lệ lỗi gióng hàng (Alignment Error Rate - AER).
Literature Review và Positioning
Lịch sử dịch máy đã trải qua nhiều bước chuyển dịch mô hình (paradigm shifts), được trực quan hóa qua Kim tự tháp Dịch máy (Vauquois Triangle): từ dịch trực tiếp (Direct MT), dịch dựa trên chuyển đổi (Transfer-based MT), dịch liên ngữ (Interlingua MT), dịch dựa trên ví dụ (Example-based MT - EBMT của Nagao, 1984) đến dịch máy thống kê (SMT của Brown et al., 1993; Koehn et al., 2003).
Tại Việt Nam, các hướng tiếp cận trước đây chủ yếu tập trung vào các hệ thống dựa trên luật chuyển đổi thủ công như phần mềm EVTRAN hay công trình của Đinh Điền (2005) về học luật chuyển đổi tự động. Tuy nhiên, các hệ thống dựa trên luật bộc lộ điểm nghẽn nghiêm trọng khi mở rộng quy mô vì chi phí xây dựng từ điển chuyên gia quá lớn và không bao quát được sự nhập nhằng ngữ nghĩa ngữ cảnh.
Trong hướng nghiên cứu khai phá ngữ liệu từ Web, tồn tại sự tranh luận học thuật sâu sắc giữa hai trường phái:
- Trường phái tiếp cận cấu trúc HTML (Structure-based): Tiêu biểu là hệ thống STRAND của Resnik (1999) và Ma & Liberman (2002), giả định rằng các trang web song ngữ có cấu trúc thẻ DOM tương đồng. Hạn chế cốt tử của hướng này là sụp đổ khi hai trang web sử dụng chung template giao diện (cùng cấu trúc HTML) nhưng chứa nội dung hoàn toàn khác nhau, hoặc ngược lại khi cùng nội dung nhưng khác cấu trúc hiển thị.
- Trường phái tiếp cận nội dung (Content-based): Sử dụng từ điển song ngữ để dịch từng từ rồi tính độ đo tương tự Cosine/Jaccard (Dang & Ho, 2008). Điểm yếu là gây bùng nổ nhập nhằng từ vựng khi một từ nguồn có quá nhiều nghĩa đích.
Luận án định vị bản thân ở vị trí tiên phong khi đề xuất mô hình lai (Hybrid Content-Structural Framework) thông qua việc phân loại bằng Máy véc-tơ hỗ trợ (Support Vector Machine - SVM). So sánh với nghiên cứu quốc tế của Resnik (1999) và Ma & Liberman (2002), phương pháp của luận án vượt trội về độ chính xác (Precision) và độ phủ (Recall) nhờ bổ sung đặc trưng phân đoạn dịch (Translation Segments) và đặc trưng từ cùng nguồn gốc bất biến (Cognates).
Đối với bài toán gióng hàng từ, các mô hình sinh kinh điển IBM 1-5 (Brown et al., 1993) và công cụ GIZA++ (Och & Ney, 2003) vận hành hoàn toàn không giám sát (unsupervised). Các nghiên cứu quốc tế của Moore (2004) hay Lin & Cherry (2003) đã chứng minh rằng việc thiếu tri thức cú pháp khiến mô hình sinh dễ rơi vào cực trị địa phương sai lệch khi huấn luyện trên các cặp ngôn ngữ dị biệt cấu trúc. Luận án giải quyết triệt để vấn đề này bằng cách tái cấu trúc thuật toán EM với không gian ràng buộc toán học chặt chẽ.
Đóng góp lý thuyết và khung phân tích
Đóng góp cho lý thuyết
Luận án đã mở rộng nền tảng lý thuyết dịch máy thống kê cổ điển của Brown et al. (1993) và mô hình dịch dựa trên cụm từ của Koehn et al. (2003) qua các đóng góp lý thuyết chuẩn xác:
- Mở rộng lý thuyết tối ưu hóa có ràng buộc trong thuật toán EM: Luận án chứng minh rằng việc áp đặt trực tiếp các hàm phạt và không gian xác suất có điều kiện vào bước E (Expectation step) và bước M (Maximization step) cho phép hội tụ nhanh hơn về điểm cực đại toàn cục (Global Optima), triệt tiêu các liên kết rác (spurious alignments).
- Lý thuyết tương quan cấu trúc bất đối xứng trong trích xuất cụm từ: Luận án thách thức giả định truyền thống của Bouamor et al. (2012) vốn đòi hỏi so khớp mẫu cú pháp song song ở cả hai ngôn ngữ nguồn và đích. Luận án chứng minh mệnh đề: Chỉ cần áp đặt mẫu cú pháp chặt chẽ trên ngôn ngữ nguồn giàu tài nguyên (tiếng Anh) kết hợp với thuật toán gióng hàng cụm từ dựa trên độ tin cậy thống kê $\theta$, ta có thể trích xuất chính xác cụm từ song ngữ mà không chịu tổn thất thông tin do lỗi từ bộ phân tích cú pháp (Parser) của ngôn ngữ đích.
- Mô hình hóa bài toán khai phá văn bản song ngữ dưới dạng bài toán phân loại nhị phân siêu phẳng tối ưu (Hyperplane Optimization): Luận án chuyển đổi bài toán tìm kiếm trang web song ngữ thành bài toán phân loại học máy có giám sát với véc-tơ đặc trưng đa chiều kết hợp cấu trúc - nội dung.
Khung phân tích độc đáo
Khung phân tích của luận án tích hợp liền mạch 3 trụ cột lý thuyết: (1) Lý thuyết Mô hình sinh thống kê (Generative Models), (2) Lý thuyết Học máy Phân biệt (Discriminative Learning - SVM), và (3) Ngữ pháp Cấu trúc Cụm từ (Phrase Structure Grammar).
[Nguồn Dữ liệu Thô]
(Web HTML Crawling & E-books)
│
▼
┌───────────────────────────────────────────────────┐
│ Chương 2: Khai phá & Xây dựng Ngữ liệu Song ngữ │
│ - Trích xuất Web: Phân loại SVM (Cognate, │
│ Translation Segments, Cấu trúc HTML) │
│ - Trích xuất E-book: Gióng hàng Đoạn & Câu │
└───────────────────────────────────────────────────┘
│
▼
[Ngữ liệu Song ngữ Sạch]
│
▼
┌───────────────────────────────────────────────────┐
│ Chương 3: Gióng hàng Từ Đa Ràng buộc (IBM 1 + EM) │
│ - Ràng buộc Điểm neo (Anchor Constraints) │
│ - Ràng buộc Cửa sổ Vị trí (Position Window δ) │
│ - Ràng buộc Từ loại (POS Mapping Constraints) │
│ - Ràng buộc Cú pháp (13 Mẫu Cú pháp Cụm từ) │
└───────────────────────────────────────────────────┘
│
▼
[Bảng Gióng hàng Từ]
│
▼
┌───────────────────────────────────────────────────┐
│ Chương 4: Xác định Cụm từ Song ngữ Cú pháp │
│ - 10 Mẫu Cú pháp tiếng Anh Phía Nguồn │
│ - Thuật toán Tìm Cụm từ Đích & Ngưỡng Lọc θ │
└───────────────────────────────────────────────────┘
│
▼
┌───────────────────────────────────────────────────┐
│ Hệ thống Dịch máy Thống kê SMT Anh - Việt │
│ (Nâng cao chất lượng dịch & Điểm BLEU) │
└───────────────────────────────────────────────────┘
Điều kiện biên (Boundary conditions) của khung phân tích được xác định rõ: Phương pháp đạt hiệu năng tối ưu trên các cặp ngôn ngữ có độ bất đối xứng hình thái cao (như Anh - Việt), nơi ngôn ngữ nguồn có sẵn các công cụ tiền xử lý ngôn ngữ học đạt độ chính xác cao (Stanford POS Tagger, Stanford Parser).
Phương pháp nghiên cứu tiên tiến
Thiết kế nghiên cứu
Luận án tuân thủ triệt để thế giới quan thực chứng (Positivism) kết hợp phương pháp luận thực nghiệm định lượng (Quantitative Experimental Paradigm). Thiết kế nghiên cứu bao gồm thiết kế đa tầng (Multi-level experimental design) tương ứng với chuỗi xử lý dữ liệu của hệ thống SMT: tầng văn bản $\rightarrow$ tầng đoạn $\rightarrow$ tầng câu $\rightarrow$ tầng cụm từ $\rightarrow$ tầng từ.
Dữ liệu thực nghiệm được thu thập từ các nguồn uy tín:
- Dữ liệu Web: Thu thập từ 3 cơ quan báo chí lớn: BBC (
bbc.co.uk), VOA News (voanews.com), và VietnamPlus (vietnamplus.vn) thông qua công cụ Web crawler chuyên dụng Teleport-Pro. - Dữ liệu Sách điện tử: Tuyển chọn từ các tác phẩm văn học và tài liệu song ngữ Anh - Việt đối chiếu, định dạng PDF/Text.
- Ngữ liệu chuẩn hóa dịch máy: Tập dữ liệu quy mô 200.000 cặp câu song ngữ Anh - Việt được xử lý tiền kỳ nghiêm ngặt để huấn luyện và đánh giá mô hình giải mã Moses.
Quy trình nghiên cứu rigorous
Quy trình nghiên cứu được chuẩn hóa qua các giao thức kiểm soát sai số chặt chẽ:
[Web / E-book Raw Data] ──► [Tiền xử lý & Trích xuất] ──► [Gióng hàng Câu] ──► [Ước lượng Tham số EM] ──► [Đánh giá BLEU / AER]
- Giao thức Trích xuất Web: Công thức đo độ tương tự từ cùng nguồn gốc (Cognate similarity) giữa văn bản tiếng Anh ($E_{text}$) và tiếng Việt ($V_{text}$): $$\mathrm{sim}{cognate}(E{text}, V_{text}) = \frac{|T_E \cap T_V|}{|T_E|}$$ Trong đó, $T_E$ và $T_V$ lần lượt là tập các cognate (từ viết tắt, số liệu, tên riêng địa danh/quốc tế không biến dịch) trong $E_{text}$ và $V_{text}$. Kết hợp với độ đo phân đoạn dịch qua hệ thống dịch thử nghiệm, véc-tơ đặc trưng được nạp vào bộ phân loại LIBSVM với hàm nhân RBF (Radial Basis Function).
- Giao thức Gióng hàng Đoạn và Câu từ E-books: Áp dụng mô hình kết hợp độ dài văn bản (dựa trên thuật toán quy hoạch động của Gale & Church, 1993) và đối chiếu điểm neo từ vựng qua thuật toán mở rộng Fast-Champollion (Li et al., 2010), giải quyết thành công các liên kết $1-1, 1-2, 2-1$ và hiện tượng mất ranh giới đoạn do lỗi chuyển đổi PDF.
- Giao thức Tích hợp Ràng buộc vào thuật toán EM trong Gióng hàng từ:
Mô hình IBM 1 chuẩn ước lượng xác suất liên kết từ thông qua công thức kỳ vọng:
$$P(f|e) = \frac{1}{(l+1)^m} \prod_{j=1}^m \sum_{i=0}^l t(f_j|e_i)$$
Luận án thiết kế 4 tầng ràng buộc can thiệp trực tiếp vào ma trận xác suất dịch $t(f_j|e_i)$:
- Ràng buộc Điểm neo (Anchor constraint): Khóa xác suất $t(f_j|e_i) = 1$ cho các cặp từ đồng nhất (tên riêng, số, từ điển chuẩn) và triệt tiêu $t(f_j|e_{i'}) = 0$ với mọi $i' \neq i$.
- Ràng buộc Vị trí từ (Positional constraint): Giới hạn khoảng cách gióng hàng trong cửa sổ $\delta$ ($|i - j| \leq \delta$, với $\delta = 2$).
- Ràng buộc Từ loại (POS constraint): Sử dụng ma trận xác suất tương ứng nhãn từ loại $P(POS_v|POS_e)$, loại bỏ các liên kết vi phạm quy tắc ngữ pháp.
- Ràng buộc Cụm từ cú pháp: Áp dụng 13 mẫu cú pháp song ngữ Anh - Việt đã được thẩm định.
Data và phân tích
Toàn bộ dữ liệu thực nghiệm được xử lý bằng các công cụ học máy và phân tích ngôn ngữ tiêu chuẩn công nghiệp: LIBSVM, GIZA++, Stanford POS Tagger, Moses Decoder.
Các bảng thống kê thực nghiệm trong luận án cung cấp các thông số định lượng chính xác:
- Trong bài toán phân loại trang web song ngữ, phương pháp đề xuất đạt độ chính xác F1-measure vượt bậc so với phương pháp gốc của Resnik (1999) và Ma & Liberman (2002).
- Tỷ lệ gióng hàng chính xác ở mức đoạn trên tập mẫu sách điện tử đạt trên $94%$, tạo tiền đề cho gióng hàng câu đạt độ chính xác $91.5%$.
- Đánh giá kiểm tra độ bền vững (Robustness checks) được thực hiện bằng cách thay đổi ngưỡng lọc $\theta$ trong trích xuất cụm từ, khảo sát sự biến thiên của số lượng cụm từ trích xuất và tương quan trực tiếp đến điểm BLEU.
Phát hiện đột phá và implications
Những phát hiện then chốt
- Sự vượt trội của mô hình phân loại đa đặc trưng trong khai phá Web: Kết hợp đặc trưng phân đoạn dịch và cognate cùng cấu trúc thẻ HTML giải quyết triệt để bài toán đồng dạng giao diện nhưng dị biệt nội dung, nâng cao hiệu suất phân loại nhị phân trên SVM với độ chính xác đạt trên $92%$.
- Triệt tiêu hiện tượng "kẹt cực trị địa phương" của thuật toán EM: Khi tích hợp 4 ràng buộc ngôn ngữ học vào mô hình IBM 1, tỷ lệ lỗi gióng hàng từ (AER) giảm đáng kể so với mô hình IBM 1 gốc và mô hình GIZA++ tiêu chuẩn, đặc biệt ở các câu có độ dài trên 25 từ.
- Hiệu ứng cộng hưởng khi kết hợp ràng buộc: Kết hợp ràng buộc vị trí ($\delta = 2$) với ràng buộc từ loại (POS) mang lại bước nhảy vọt về chất lượng gióng hàng so với việc chỉ áp dụng từng ràng buộc đơn lẻ.
- Tính ưu việt của so khớp cú pháp bất đối xứng một phía: Trích xuất cụm từ dựa trên 10 mẫu cú pháp tiếng Anh kết hợp bộ lọc thống kê $\theta$ sản sinh ra tập cụm từ song ngữ có độ bao phủ rộng hơn gấp 2.4 lần so với phương pháp so khớp cú pháp hai phía truyền thống.
- Cải thiện điểm số BLEU có ý nghĩa thống kê: Tích hợp tập tri thức cụm từ song ngữ và bảng gióng hàng từ cải tiến vào hệ thống dịch máy thống kê Moses trên ngữ liệu 200.000 câu Anh - Việt đã giúp điểm BLEU tăng từ 1.2 đến 2.15 điểm so với hệ thống nền tảng (baseline).
Implications đa chiều
- Về mặt Lý thuyết: Luận án mở ra hướng tiếp cận kết hợp hài hòa giữa mô hình thống kê hình thức (Empirical SMT) và tri thức ngôn ngữ học sâu (Deep Linguistic Knowledge), đặt tiền đề cho các mô hình dịch máy tăng cường tri thức (Knowledge-enhanced MT).
- Về mặt Phương pháp luận: Cung cấp khung phương pháp luận hoàn chỉnh, có thể tái lập (reproducible) cho bài toán xử lý ngôn ngữ nghèo tài nguyên (low-resource languages), có thể áp dụng nguyên vẹn cho các cặp ngôn ngữ khác như Nhật - Việt, Hàn - Việt, Pháp - Việt.
- Về mặt Ứng dụng Thực tiễn: Cung cấp giải pháp công nghệ trực tiếp để xây dựng các kho ngữ liệu song ngữ quy mô hàng triệu câu cho các viện nghiên cứu, doanh nghiệp phát triển phần mềm dịch thuật tự động tại Việt Nam.
- Về mặt Chính sách Khoa học: Đóng góp luận cứ khoa học thực chứng thúc đẩy chiến lược chuyển đổi số quốc gia trong việc xây dựng tài nguyên số ngôn ngữ tiếng Việt mở và tự chủ công nghệ xử lý ngôn ngữ tự nhiên.
Limitations và Future Research
Luận án thừa nhận một cách khách quan các giới hạn nghiên cứu:
- Sự phụ thuộc vào chất lượng bộ gán nhãn POS nguồn: Hiệu quả của ràng buộc từ loại và mẫu cú pháp phụ thuộc vào độ chính xác của Stanford Parser trên văn bản tiếng Anh; các văn bản chứa lỗi chính tả hoặc văn phong mạng xã hội sẽ làm suy giảm độ chính xác gióng hàng.
- Độ phức tạp tính toán của thuật toán EM có ràng buộc: Việc tính toán ma trận ràng buộc làm tăng thời gian huấn luyện ban đầu khoảng $15-20%$ so với mô hình IBM 1 thuần túy.
- Giới hạn phạm vi cấu trúc cú pháp: Luận án mới chỉ khảo sát 13 mẫu cú pháp song ngữ và 10 mẫu cú pháp cụm từ nguồn tiêu biểu (Noun Phrases, Verb Phrases, Prepositional Phrases), chưa bao phủ toàn bộ các cấu trúc ngữ pháp phức hợp (như mệnh đề quan hệ lồng nhau, đảo ngữ sâu).
Chương trình nghiên cứu tương lai (Future Research Agenda):
- Mở rộng tự động hóa việc sinh mẫu cú pháp thay vì chọn lọc mẫu cố định.
- Nghiên cứu cơ chế chuyển giao tri thức từ SMT sang mô hình dịch máy nơ-ron (Neural Machine Translation - NMT), đặc biệt là tích hợp ma trận ràng buộc vào cơ chế Attention của kiến trúc Transformer.
- Ứng dụng khung khai phá ngữ liệu song ngữ cho các cặp ngôn ngữ dân tộc thiểu số tại Việt Nam.
Tác động và ảnh hưởng
- Ảnh hưởng Học thuật: Các công trình của luận án đã được công bố trên các diễn đàn khoa học uy tín cao: 1 bài báo trên tạp chí quốc tế thuộc hệ thống IGI Global (International Journal of Knowledge and Systems Science), 4 bài báo tại kỷ yếu hội nghị quốc tế do IEEE và Springer xuất bản (KSE 2010, IALP 2012, RIVF 2013, KSE 2013), cùng 3 công trình trên các tạp chí và hội nghị quốc gia.
- Chuyển dịch Công nghiệp: Cung cấp nền tảng thuật toán cho các công ty công nghệ tại Việt Nam (như Lạc Việt, Viettel, FPT) nhằm nâng cấp chất lượng các công cụ hỗ trợ dịch thuật chuyên ngành và hệ thống tra cứu thuật ngữ song ngữ tự động.
- Lợi ích Xã hội: Hạ thấp rào cản ngôn ngữ trong việc tiếp cận tri thức khoa học kỹ thuật quốc tế cho cộng đồng học thuật và người dân Việt Nam.
Đối tượng hưởng lợi
- Nghiên cứu sinh & Nhà nghiên cứu NLP: Kế thừa khung toán học tích hợp ràng buộc vào thuật toán EM và bộ dữ liệu ngữ liệu song ngữ đã được làm sạch chuẩn mực.
- Giảng viên & Chuyên gia Học thuật: Nguồn tham khảo kinh điển về phương pháp luận nghiên cứu thực nghiệm kết hợp giữa mô hình học máy phân biệt (SVM) và mô hình sinh xác suất (IBM Models).
- Kỹ sư R&D Doanh nghiệp Công nghệ: Ứng dụng trực tiếp mã nguồn và thuật toán trích xuất văn bản từ Web để xây dựng các sản phẩm xử lý dữ liệu lớn (Big Data).
- Cơ quan Quản lý & Hoạch định Chính sách: Sở hữu luận cứ khoa học để định hình các chương trình trọng điểm quốc gia về phát triển Trí tuệ nhân tạo và Ngôn ngữ học tính toán cho tiếng Việt.
Câu hỏi chuyên sâu
-
Đâu là đóng góp lý thuyết độc đáo nhất của luận án? Trả lời: Đó là việc chính quy hóa toán học không gian tìm kiếm của thuật toán EM trong mô hình IBM 1 bằng cách tích hợp đồng thời 4 tầng ràng buộc (neo từ vựng, vị trí cửa sổ $\delta$, phân bố từ loại POS và mẫu cú pháp), khắc phục triệt để nhược điểm gán xác suất dịch phân tán của mô hình thống kê thuần túy Brown et al. (1993).
-
Cải tiến phương pháp luận trong trích xuất ngữ liệu Web so với các nghiên cứu quốc tế trước đây như thế nào? Trả lời: Khác với Resnik (1999) chỉ dựa vào thẻ HTML hoặc Ma & Liberman (2002) chỉ dựa vào cấu trúc URL, luận án đã xây dựng mô hình phân loại SVM đa chiều kết hợp giữa đặc trưng hình thái học (Cognate similarity), phân đoạn dịch giả lập và cấu trúc phân cấp HTML, đạt độ chính xác F1 vượt trội trên các trang web tin tức phức tạp.
-
Phát hiện thực nghiệm bất ngờ nhất được hỗ trợ bởi dữ liệu là gì? Trả lời: Việc so khớp mẫu cú pháp một phía (chỉ trên câu tiếng Anh) kết hợp bộ lọc thống kê $\theta$ mang lại hiệu quả dịch máy (điểm BLEU) cao hơn và tập cụm từ phong phú hơn đáng kể so với việc cố gắng phân tích và so khớp cú pháp trên cả hai phía câu Anh - Việt, do bộ phân tích cú pháp tiếng Việt thời điểm đó có độ sai số tích lũy cao.
-
Luận án có cung cấp giao thức tái lập (Replication Protocol) rõ ràng không? Trả lời: Toàn bộ quy trình từ cấu hình công cụ thu thập dữ liệu (Teleport-Pro), tiền xử lý, định dạng dữ liệu chuẩn cho LIBSVM, các công thức toán học tường minh cho xác suất ràng buộc, 13 mẫu cú pháp song ngữ, danh mục tham số dòng lệnh cho Moses và GIZA++ đều được cung cấp chi tiết trong các chương 2, 3 và 4.
-
Chương trình nghiên cứu 10 năm được định hình như thế nào? Trả lời: Định hướng mở rộng việc tự động hóa trích xuất tri thức song ngữ từ văn bản đa phương tiện (multimodal parallel mining), tích hợp tri thức cú pháp cấu trúc vào các mạng nơ-ron sâu và mô hình ngôn ngữ lớn (LLMs), giải quyết bài toán dịch máy tự động cho toàn bộ hệ thống ngôn ngữ khu vực Đông Nam Á.
Kết luận
Luận án tiến sĩ của tác giả Lê Quang Hùng là một công trình nghiên cứu khoa học mẫu mực, toàn diện và có tính đột phá cao trong lĩnh vực Xử lý ngôn ngữ tự nhiên tại Việt Nam.
6 đóng góp cụ thể của công trình:
- Đề xuất quy trình trích xuất văn bản song ngữ tự động từ Web dựa trên học máy SVM đa đặc trưng (Cognates, Phân đoạn dịch, DOM HTML).
- Xây dựng phương pháp gióng hàng đoạn và câu chính xác cao cho sách điện tử song ngữ dựa trên mô hình kết hợp độ dài và điểm neo.
- Hoàn thiện khung toán học tích hợp 4 ràng buộc ngôn ngữ học (neo, vị trí $\delta$, từ loại POS, cú pháp) vào thuật toán EM cho mô hình IBM 1.
- Đề xuất thuật toán kết hợp đa ràng buộc giúp giảm thiểu tỷ lệ lỗi gióng hàng từ (AER) và giải quyết hiện tượng từ tần suất thấp.
- Phát triển kỹ thuật trích xuất cụm từ song ngữ cú pháp bất đối xứng một phía kết hợp ngưỡng lọc thống kê $\theta$.
- Thực nghiệm thành công việc tích hợp toàn bộ kho tri thức song ngữ khai phá được vào hệ thống dịch máy SMT Anh - Việt, nâng cao vượt bậc điểm chất lượng dịch BLEU trên tập dữ liệu chuẩn 200.000 câu.
Công trình đã tạo bước tiến vững chắc về mặt lý thuyết, mở ra các nhánh nghiên cứu chuyên sâu về dịch máy tăng cường tri thức cú pháp và để lại giá trị ứng dụng thực tiễn lâu dài cho nền khoa học tính toán nước nhà.
Trích đoạn nội dung luận án
Tải xuống để đọc toàn bộĐẠI HỌC QUỐC GIA HÀ NỘI TRƯỜNG ĐẠI HỌC CÔNG NGHỆ LÊ QUANG HÙNG KHAI PHÁ TRI THỨC SONG NGỮ VÀ ỨNG DỤNG TRONG DỊCH MÁY ANH – VIỆT LUẬN ÁN TIẾN SĨ KHOA HỌC MÁY TÍNH Hà Nội – 2016 ĐẠI HỌC QUỐC GIA HÀ NỘI TRƯỜNG ĐẠI HỌC CÔNG NGHỆ LÊ QUANG HÙNG KHAI PHÁ TRI THỨC SONG NGỮ VÀ ỨNG DỤNG TRONG DỊCH MÁY ANH – VIỆT Chuyên ngành: Khoa học máy tính Mã số: 62 48 01 01 LUẬN ÁN TIẾN SĨ KHOA HỌC MÁY TÍNH NGƯỜI HƯỚNG DẪN KHOA HỌC: 1. Lê Anh Cường 2. Huỳnh Văn Nam Hà Nội – 2016 Lời cam đoan Tôi xin cam đoan luận án này là kết quả nghiên cứu của tôi, được thực hiện dưới sự hướng dẫn của PGS. Lê Anh Cường và PGS.
Các nội dung trích dẫn từ các nghiên cứu của các tác giả khác mà tôi trình bày trong luận án này đã được ghi rõ nguồn trong phần tài liệu tham khảo. Lê Quang Hùng i Tóm tắt Nhiệm vụ của một hệ thống dịch máy là tự động dịch một văn bản từ ngôn ngữ này (ví dụ, tiếng Anh) sang một văn bản tương đương ở ngôn ngữ khác (ví dụ, tiếng Việt). Tính hữu ích của công nghệ dịch máy tăng lên cùng với chất lượng của nó. Dịch máy có nhiều ứng dụng như: (i) dịch tài liệu tiếng nước ngoài cho mục đích hiểu nội dung, (ii) dịch văn bản để xuất bản ở các ngôn ngữ khác và (iii) thông tin liên lạc, chẳng hạn như dịch email, chat, vv.
Có một số cách tiếp cận cho bài toán dịch máy như dịch trực tiếp (direct translation), dịch dựa trên chuyển đổi (transfer - based translation), dịch liên ngữ (interlingua translation), dịch dựa trên ví dụ (example - based translation) và dịch thống kê (statistical translation). Hiện tại, dịch máy dựa trên cách tiếp cận thống kê đang là một hướng phát triển đầy tiềm năng bởi những ưu điểm vượt trội so với các cách tiếp cận khác. Thay vì xây dựng các từ điển, các quy luật chuyển đổi bằng tay, dịch máy thống kê tự động xây dựng các từ điển, các quy luật dựa trên kết quả thống kê có được từ ngữ liệu. Đối với một hệ thống dịch máy thống kê, hiệu quả (chất lượng dịch) của nó tỷ lệ thuận với số lượng (kích thước) và chất lượng của ngữ liệu song ngữ được sử dụng để xây dựng hệ thống dịch.
Tuy nhiên, ngữ liệu song ngữ sẵn có hiện vẫn còn hạn chế cả về kích thước lẫn chất lượng, ngay cả đối với các cặp ngôn ngữ chính. Ngoài ra, đối với các cặp ngôn ngữ có nhiều khác biệt về cấu trúc ngữ pháp (ví dụ, Anh - Việt), vấn đề về chất lượng dịch đang là thách thức đối với các nhà nghiên cứu về dịch máy trong nhiều năm qua. Vì vậy, việc bổ sung thêm ngữ liệu song ngữ và phát triển các phương pháp hiệu quả hơn dựa trên ngữ liệu hiện có là những giải pháp quan trọng để tăng chất lượng dịch cho dịch máy thống kê. Luận án của chúng tôi tập trung giải quyết các tồn tại đã nêu thông qua ba bài toán: phát triển phương pháp xây dựng ngữ liệu song ngữ, cải tiến các phương pháp gióng hàng từ và xác định cụm từ song ngữ cho dịch máy thống kê, cụ thể như sau: Thứ nhất, đối với bài toán xây dựng ngữ liệu song ngữ, chúng tôi khai thác từ hai nguồn: Web và sách điện tử song ngữ.
Đối với nguồn từ Web, chúng tôi tập trung vào rút trích các văn bản song ngữ từ các web-site song ngữ. Chúng tôi đề xuất hai phương pháp thiết kế các đặc trưng dựa trên nội dung: sử dụng các từ bất biến giữa hai ngôn ngữ (cognate) và sử dụng các phân đoạn dịch. Ngoài ra, chúng tôi kết hợp các đặc trưng dựa trên nội dung với các đặc trưng dựa trên cấu trúc của trang web để rút trích các văn bản song ngữ, bằng cách sử dụng phương pháp học máy. Đối với nguồn từ sách điện tử, chúng tôi đề xuất phương pháp dựa trên nội dung, sử dụng một số mẫu liên kết giữa các khối văn bản trong hai ngôn ngữ để rút trích các câu song ngữ.
Thứ hai, với bài toán gióng hàng từ, chúng tôi đề xuất một số cải tiến đối với mô hình IBM 1 theo cách tiếp cận dựa trên ràng buộc, bao gồm: ràng buộc neo, ràng buộc về vị trí của từ, ràng buộc về từ loại và ràng buộc về cụm từ. Với mỗi ràng buộc, chúng tôi đưa ra phương pháp tổng quát để tích hợp nó vào thuật toán cực đại kỳ vọng trong quá trình ước lượng tham số của mô hình. Ngoài ra, chúng tôi đưa ra một phương pháp để kết hợp các ràng buộc. Những cải tiến này đã giúp nâng cao chất lượng dịch cho hệ thống dịch máy thống kê Anh - Việt.
Thứ ba, đối với bài toán xác định cụm từ song ngữ cho dịch máy thống kê, chúng tôi đề xuất phương pháp rút trích cụm từ song ngữ từ ngữ liệu song ngữ, sử dụng các mẫu cú pháp kết hợp với gióng hàng cụm từ. Các cụm từ song ngữ này đã được ứng dụng vào việc nâng cao chất lượng dịch cho hệ thống dịch máy thống kê Anh - Việt. Từ khóa: dịch máy, dịch máy thống kê, tri thức song ngữ, ngữ liệu song ngữ, văn bản song ngữ, gióng hàng từ. iii Lời cảm ơn Trước hết, tôi xin gửi lời cảm ơn sâu sắc đến PGS.
Lê Anh Cường và PGS. Huỳnh Văn Nam, hai Thầy đã trực tiếp hướng dẫn, chỉ bảo tận tình, luôn hỗ trợ và tạo những điều kiện tốt nhất cho tôi học tập và nghiên cứu. Tôi xin gửi lời cảm ơn đến các Thầy/Cô giáo ở Khoa Công nghệ thông tin, Trường Đại học Công nghệ, Đại học Quốc gia Hà Nội, đặc biệt là PGS. Phạm Bảo Sơn và các Thầy/Cô giáo ở Bộ môn Khoa học máy tính, những người đã trực tiếp giảng dạy và giúp đỡ tôi trong quá trình học tập và nghiên cứu ở trường.
Tôi xin gửi lời cảm ơn đến các đồng nghiệp ở Khoa Công nghệ thông tin, Trường Đại học Quy Nhơn, đặc biệt là TS. Trần Thiên Thành và TS. Lê Xuân Việt đã quan tâm, giúp đỡ và tạo điều kiện cho tôi trong thời gian làm nghiên cứu sinh. Tôi xin gửi cảm ơn đến PGS.
Nguyễn Phương Thái, TS. Nguyễn Văn Vinh, TS. Phan Xuân Hiếu (Trường Đại học Công nghệ, Đại học Quốc gia Hà Nội), PGS. Lê Thanh Hương (Trường Đại học Bách khoa Hà Nội), TS.
Nguyễn Thị Minh Huyền, TS. Lê Hồng Phương (Trường Đại học Khoa học Tự nhiên, Đại học Quốc gia Hà Nội), TS. Nguyễn Đức Dũng (Viện Công nghệ thông tin, Viện Hàn lâm Khoa học và Công nghệ Việt Nam), các Thầy/Cô đã có những góp ý chỉnh sửa để tôi hoàn thiện luận án. Tôi xin gửi lời cảm ơn đến tất cả anh, chị, em và bạn đồng học ở Bộ môn Khoa học máy tính (Khoa Công nghệ thông tin, Trường Đại học Công nghệ, Đại học Quốc gia Hà Nội), đặc biệt là chị Nguyễn Thị Xuân Hương (Khoa Công nghệ thông tin, Trường Đại học Dân lập Hải Phòng), nghiên cứu sinh Hoàng Thị Điệp (Khoa Công nghệ thông tin, Trường Đại học Công nghệ) đã giúp đỡ tôi trong thời gian làm nghiên cứu sinh.
Cuối cùng, tôi xin gửi lời cảm ơn đến tất cả các thành viên trong gia đình tôi, đặc biệt là vợ tôi - người đã luôn ủng hộ, chia sẽ, động viên và gánh vác công việc gia đình để tôi yên tâm học tập, nghiên cứu. iv Mục lục Lời cam đoan i Tóm tắt ii Lời cảm ơn iv Danh mục các chữ viết tắt viii Danh mục các hình vẽ ix Danh mục các bảng xi Mở đầu 1 1 Tổng quan 5 1.1 Khai phá tri thức song ngữ .1 Xây dựng ngữ liệu song ngữ .2 Gióng hàng văn bản .1 Gióng hàng đoạn/câu .2 Gióng hàng từ .3 Xác định cụm từ song ngữ .2 Sơ lược về dịch máy .3 Dịch máy thống kê .1 Mô hình hóa bài toán .2 Mô hình ngôn ngữ .3 Mô hình dịch .1 Mô hình dịch dựa trên từ .2 Mô hình dịch dựa trên cụm từ .3 Mô hình dịch dựa trên cú pháp .5 Đánh giá chất lượng dịch. 29 2 Xây dựng ngữ liệu song ngữ cho dịch máy thống kê 32 2.1 Rút trích văn bản song ngữ từ Web .1 Thu thập dữ liệu .2 Thiết kế các đặc trưng dựa vào nội dung .1 Sử dụng cognate .2 Sử dụng các phân đoạn dịch .3 Thiết kế các đặc trưng dựa vào cấu trúc .4 Mô hình hóa bài toán phân loại .2 Rút trích câu song ngữ từ sách điện tử .3 Gióng hàng đoạn .4 Gióng hàng câu .1 Thực nghiệm về rút trích văn bản song ngữ từ Web .1 Cài đặt thực nghiệm .2 Kết quả thực nghiệm .2 Thực nghiệm về rút trích câu song ngữ từ sách điện tử .1 Cài đặt thực nghiệm .2 Kết quả thực nghiệm .3 Thực nghiệm về bổ sung ngữ liệu song ngữ cho dịch máy .4 Kết luận chương. 57 3 Gióng hàng từ cho dịch máy thống kê 59 3.1 Định nghĩa từ .2 Định nghĩa bài toán gióng hàng từ .3 Các mô hình IBM .4 Thuật toán cực đại kỳ vọng cho mô hình IBM 1 .2 Một số cải tiến mô hình IBM 1 theo cách tiếp cận dựa trên ràng buộc 65 3.1 Cải tiến mô hình IBM 1 sử dụng ràng buộc neo .2 Cải tiến mô hình IBM 1 sử dụng ràng buộc về vị trí của từ .3 Cải tiến mô hình IBM 1 sử dụng ràng buộc về từ loại .1 Quan hệ về từ loại .2 Ràng buộc về từ loại .4 Cải tiến mô hình IBM 1 sử dụng ràng buộc về cụm từ .1 Mẫu cú pháp song ngữ .2 Ràng buộc về cụm từ .5 Kết hợp các ràng buộc .1 Cài đặt thực nghiệm .2 Kết quả thực nghiệm với ràng buộc neo và ràng buộc về vị trí của từ .3 Kết quả thực nghiệm với ràng buộc từ loại .4 Kết quả thực nghiệm với ràng buộc cụm từ .5 Kết quả thực nghiệm về kết hợp ràng buộc .4 Kết luận chương.
85 4 Xác định cụm từ song ngữ cho dịch máy thống kê 87 4.1 Bài toán rút trích cụm từ song ngữ .2 Phương pháp rút trích cụm từ song ngữ .2 Tìm cụm từ đích .3 Rút trích cụm từ .3 Tích hợp cụm từ song ngữ vào dịch máy .1 Thực nghiệm về rút trích cụm từ song ngữ .1 Cài đặt thực nghiệm .2 Kết quả thực nghiệm .2 Thực nghiệm về tích hợp cụm từ song ngữ vào dịch máy .1 Cài đặt thực nghiệm .2 Kết quả thực nghiệm .5 Kết luận chương .
Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ
Trích dẫn luận án này
Lê Quang Hùng (2016). Khai phá tri thức song ngữ và ứng dụng dịch máy Anh-Việt [Luận án tiến sĩ, Trường Đại học Công nghệ, Đại học Quốc gia Hà Nội]. LuanAn.net. https://luanan.net/ngon-ngu-hoc/ngon-ngu-hoc-ung-dung/khai-pha-tri-thuc-song-ngu-va-ung-dung-trong-dich-may-anh-viet
Câu hỏi thường gặp
Luận án "Khai phá tri thức song ngữ và ứng dụng dịch máy Anh-Việt" nghiên cứu về vấn đề gì?
"Nghiên cứu khai phá tri thức song ngữ ứng dụng trong dịch máy Anh-Việt, tối ưu hóa thuật toán xử lý ngôn ngữ tự nhiên."
Luận án "Khai phá tri thức song ngữ và ứng dụng dịch máy Anh-Việt" được bảo vệ tại trường nào?
Luận án này được bảo vệ tại Trường Đại học Công nghệ, Đại học Quốc gia Hà Nội. Năm bảo vệ: 2016.
Luận án "Khai phá tri thức song ngữ và ứng dụng dịch máy Anh-Việt" thuộc chuyên ngành gì?
Luận án "Khai phá tri thức song ngữ và ứng dụng dịch máy Anh-Việt" thuộc chuyên ngành Khoa học máy tính. Danh mục: Ngôn Ngữ Học Ứng Dụng.
Luận án "Khai phá tri thức song ngữ và ứng dụng dịch máy Anh-Việt" có bao nhiêu trang?
Luận án "Khai phá tri thức song ngữ và ứng dụng dịch máy Anh-Việt" có 129 trang. Bạn có thể xem trước một phần tài liệu ngay trên trang web trước khi tải về.
Cách tải luận án "Khai phá tri thức song ngữ và ứng dụng dịch máy Anh-Việt" về máy như thế nào?
Để tải luận án về máy, bạn nhấn nút "Tải xuống ngay" trên trang này, sau đó hoàn tất thanh toán phí lưu trữ. File sẽ được tải xuống ngay sau khi thanh toán thành công. Hỗ trợ qua Zalo: 0559 297 239.