Luận án tiến sĩ cải tiến chất lượng dịch tự động tiếng Việt - Nguyễn Văn Bình, ĐH Bách Khoa Đà Nẵng

"Luận án tiến sĩ nghiên cứu cải tiến chất lượng dịch tự động tiếng Việt bằng phương pháp machine learning tiên tiến."

Tác giả

Luan An

Thể loại

Luận án tiến sĩ kỹ thuật

Năm xuất bản

Số trang

140

Thời gian đọc

21 phút

Lượt xem

0

Lượt tải

0

Phí lưu trữ

40 Point

Tổng quan nhanh

Chủ đề:
1. Thực trạng nghiên cứu dịch tự động tiếng Việt hiện nay
Số trang:
140 trang
Trường:
Trường Đại học Bách khoa, Đại học Đà Nẵng
Chuyên ngành:
Khoa học máy tính
Tác giả:
Năm:

Tóm tắt nội dung luận án

I. Thực trạng nghiên cứu dịch tự động tiếng Việt hiện nay

Dịch tự động là phân ngành trọng điểm trong xử lý ngôn ngữ tự nhiên tiếng Việt. Công nghệ này giúp xóa bỏ rào cản ngôn ngữ. Quá trình dịch thuật chuyển đổi văn bản nguồn sang văn bản đích một cách tự động. Chất lượng dịch tiếng Việt phụ thuộc vào đặc trưng ngôn ngữ học phức tạp. Tiếng Việt là ngôn ngữ đơn lập, không biến hình từ. Ngữ cảnh quyết định trực tiếp đến ngữ nghĩa của từ ngữ. Các hệ thống dịch trước đây gặp nhiều hạn chế về tính trôi chảy. Sự phát triển của dịch máy nơ-ron tiếng Việt mở ra bước đột phá mới. Hệ thống hiện đại học biểu diễn ngữ nghĩa liên tục qua mạng nơ-ron sâu. Nghiên cứu thực trạng giúp xác định các điểm nghẽn kỹ thuật cần giải quyết. Mục tiêu trọng tâm là nâng cao độ chính xác cho các cặp câu dịch tự động.

1.1. Lịch sử phát triển các công nghệ dịch máy tiếng Việt

Lịch sử dịch tự động trải qua ba giai đoạn công nghệ chính. Giai đoạn đầu sử dụng phương pháp dịch dựa trên tập luật ngữ pháp. Phương pháp này đòi hỏi sự tham gia trực tiếp của chuyên gia ngôn ngữ. Chi phí xây dựng luật rất cao nhưng phạm vi áp dụng hẹp. Giai đoạn tiếp theo là kỷ nguyên dịch máy thống kê SMT. Các công cụ tiêu biểu như Moses phân tích xác suất xuất hiện của các cụm từ. Dịch máy thống kê tạo bước chuyển lớn nhưng câu văn còn rời rạc. Giai đoạn hiện nay thuộc về dịch máy nơ-ron tiếng Việt. Mạng nơ-ron nhân tạo cho phép mô hình hóa toàn bộ câu cùng lúc. Bản dịch có độ tự nhiên vượt trội. Khả năng liên kết ngữ cảnh xa được cải thiện đáng kể.

1.2. Thách thức ngôn ngữ trong xử lý tiếng Việt chuyên ngành

Xử lý ngôn ngữ tự nhiên tiếng Việt gặp nhiều thách thức đặc thù. Khác với tiếng Anh, ranh giới từ trong tiếng Việt không xác định bằng dấu cách. Kỹ thuật tách từ tiếng Việt đóng vai trò tiền xử lý quyết định. Hiện tượng đa nghĩa và từ đồng âm xuất hiện dày đặc. Trong các văn bản pháp luật, thuật ngữ chuyên ngành có tính đơn nghĩa chặt chẽ. Hệ thống dịch thông thường thường chọn sai từ đồng nghĩa trong ngữ cảnh cụ thể. Cấu trúc ngữ pháp tiếng Việt linh hoạt, dễ gây nhập nhằng cú pháp. Việc thiếu kho ngữ liệu chuẩn hóa làm giảm độ chính xác của mô hình học sâu. Cần có giải pháp kết hợp tri thức ngữ nghĩa để xử lý triệt để bài toán dịch chuyên ngành.

II. Xây dựng ngữ liệu cải tiến chất lượng dịch tiếng Việt

Ngữ liệu song ngữ đóng vai trò cốt lõi trong xây dựng mô hình dịch thuật. Chất lượng và số lượng ngữ liệu quyết định trực tiếp hiệu năng của hệ thống. Luận án tập trung xây dựng tập ngữ liệu song ngữ Anh - Việt quy mô lớn. Dữ liệu được thu thập từ nhiều nguồn uy tín, đặc biệt là văn bản pháp luật. Quá trình xử lý dữ liệu trải qua các bước sàng lọc nghiêm ngặt. Việc loại bỏ các cặp câu sai lệch giúp hạn chế tình trạng sinh ảo giác trong mạng nơ-ron. Áp dụng các kỹ thuật tăng cường dữ liệu song ngữ giúp mở rộng đáng kể không gian dữ liệu huấn luyện. Dữ liệu chuẩn hóa tạo nền tảng vững chắc cho việc cải tiến chất lượng dịch thuật.

2.1. Quy trình chuẩn hóa và làm sạch tập ngữ liệu song ngữ

Quy trình chuẩn hóa dữ liệu bắt đầu bằng việc chuyển đổi định dạng và lọc nhiễu. Hệ thống loại bỏ các ký tự lạ, liên kết web và thẻ định dạng html. Tiếp theo, các thuật toán gióng hàng câu tự động xác định các cặp câu tương đương. Các cặp câu có độ dài chênh lệch quá lớn sẽ bị loại trừ. Quá trình tiền xử lý bao gồm bước tách từ tiếng Việt và phân loại từ vựng POS. Dữ liệu tiếng Anh được chuẩn hóa chữ thường và tách từ theo chuẩn quốc tế. Hệ thống kiểm tra ngữ pháp tự động nhằm bảo đảm tính trọn vẹn ngữ nghĩa. Việc chuẩn hóa giúp tập ngữ liệu song ngữ Anh - Việt đạt độ đồng nhất cao, giảm thiểu nhiễu trong quá trình huấn luyện mô hình.

2.2. Kỹ thuật tăng cường dữ liệu và mở rộng kho ngữ liệu

Sự khan hiếm dữ liệu song ngữ chuyên ngành là rào cản lớn đối với mô hình dịch. Kỹ thuật dịch ngược là giải pháp hàng đầu để mở rộng ngữ liệu đơn ngữ. Hệ thống huấn luyện một mô hình dịch phụ để chuyển đổi văn bản đơn ngữ tiếng Việt sang tiếng Anh. Dữ liệu tổng hợp được ghép nối với tập dữ liệu gốc để tăng cường dữ liệu song ngữ. Phương pháp này giúp mô hình làm quen với nhiều biến thể ngữ pháp phong phú. Ngoài ra, việc bổ sung từ điển thuật ngữ chuyên ngành nâng cao độ phủ từ vựng hiếm. Các giải pháp tăng cường ngữ liệu giúp giảm thiểu hiện tượng quá khớp (overfitting) và tăng cường độ vững chắc cho hệ thống dịch nơ-ron.

III. Mô hình nơ ron giúp cải tiến chất lượng dịch tiếng Việt

Các kiến trúc mạng nơ-ron sâu đã thay đổi hoàn toàn cục diện công nghệ dịch tự động. Luận án nghiên cứu các mô hình học máy hiện đại nhất để nâng cao chất lượng bản dịch. Mô hình Transformer trở thành lựa chọn chủ đạo nhờ cơ chế tự chú ý (self-attention). Kiến trúc này xử lý song song toàn bộ chuỗi ký tự mà không bị giới hạn độ dài câu. Nghiên cứu thực hiện tối ưu hóa cấu hình siêu tham số phù hợp với đặc thù tiếng Việt. Kết quả chứng minh dịch máy nơ-ron tiếng Việt vượt trội hoàn toàn so với mô hình dịch thống kê truyền thống. Các câu dịch có cấu trúc tự nhiên, bảo toàn tốt ngữ nghĩa của văn bản gốc.

3.1. Ứng dụng kiến trúc Transformer trong dịch máy nơ ron

Mô hình Transformer loại bỏ hoàn toàn mạng tái phát RNN nhằm tăng tốc độ huấn luyện. Cơ chế Multi-Head Attention cho phép mô hình học thông tin từ nhiều vị trí khác nhau trong câu. Mô hình nắm bắt mối quan hệ ngữ pháp phức tạp giữa tiếng Anh và tiếng Việt một cách hiệu quả. Khả năng ghi nhớ thông tin ngữ cảnh dài hạn giúp hạn chế tối đa tình trạng mất ngữ nghĩa. Quá trình huấn luyện sử dụng kỹ thuật Regularization và Label Smoothing để ổn định hàm mất mát. Kết quả thực nghiệm cho thấy kiến trúc Transformer xử lý rất tốt các cấu trúc câu đảo ngữ và câu ghép phức tạp. Thời gian hội tụ của mô hình được rút ngắn đáng kể so với các mạng nơ-ron tuần tự.

3.2. Kết hợp tri thức ngữ nghĩa và ontology trong dịch thuật

Để nâng cao độ chính xác trong các lĩnh vực đặc thù, nghiên cứu tích hợp mạng tri thức ngữ nghĩa. Hệ thống xây dựng kho ngữ liệu ontology chuyên ngành luật. Tri thức ontology định nghĩa rõ ràng mối quan hệ thứ bậc giữa các khái niệm pháp lý. Khi gặp thuật ngữ có nhiều nghĩa, mô hình dựa vào ontology để truy xuất ngữ cảnh phù hợp nhất. Giải pháp này khắc phục nhược điểm dịch máy móc theo nghĩa đen của các mạng nơ-ron thuần túy. Việc kết hợp ontology giúp định hướng bộ giải mã chọn đúng từ ngữ chuyên ngành. Bản dịch cuối cùng đạt độ chuẩn xác cao về mặt thuật ngữ và tuân thủ chặt chẽ văn phong văn bản quy phạm pháp luật.

IV. Phương pháp đánh giá chất lượng dịch tự động tiếng Việt

Đánh giá chất lượng bản dịch là khâu thiết yếu để kiểm định hiệu quả của hệ thống. Nghiên cứu kết hợp cả hai phương pháp đánh giá tự động và đánh giá chủ quan bởi con người. Các thang đo định lượng giúp đo lường mức độ tương đồng giữa bản dịch máy và bản dịch tham chiếu. Đánh giá điểm BLEU và NIST cung cấp bức tranh tổng quan về độ chính xác từ vựng. Đánh giá bởi chuyên gia ngôn ngữ tập trung vào hai tiêu chí: mức độ đầy đủ và tính trôi chảy. Luận án đề xuất quy trình đánh giá dựa trên thời gian và khối lượng công việc hiệu đính bản dịch. Sự kết hợp này mang lại cái nhìn khách quan và toàn diện về chất lượng dịch.

4.1. Thang đo tự động BLEU NIST và tỷ lệ lỗi bản dịch TER

Thang đo BLEU đo lường độ trùng lặp của các chuỗi n-gram giữa bản dịch máy và bản dịch chuẩn. Thang đo NIST cải tiến từ BLEU bằng cách gán trọng số cao hơn cho các n-gram hiếm gặp. Chỉ số TER và HTER đo lường tỷ lệ chỉnh sửa tối thiểu mà con người cần thực hiện để chuẩn hóa bản dịch. Điểm BLEU cao cùng với tỷ lệ lỗi TER thấp phản ánh hệ thống hoạt động ổn định. Thực nghiệm trên tập dữ liệu chuẩn cho thấy mô hình đề xuất đạt điểm số BLEU ấn tượng. Các phép kiểm tra thống kê khẳng định sự cải thiện chất lượng có ý nghĩa thực tiễn rõ rệt so với các hệ thống cơ sở.

4.2. Giải pháp ước lượng chất lượng dịch và hậu chỉnh sửa

Trong thực tế, bản dịch tham chiếu chuẩn không phải lúc nào cũng có sẵn. Luận án áp dụng phương pháp ước lượng chất lượng dịch trực tiếp trên câu nguồn và câu đích. Hệ thống dự đoán trước các phân đoạn dịch có nguy cơ mắc lỗi cao. Từ kết quả ước lượng chất lượng, mô đun hậu chỉnh sửa tự động tiến hành khắc phục các lỗi ngữ pháp và lỗi dùng từ. Hậu chỉnh sửa tự động dựa trên mô hình nơ-ron giúp giảm tải đáng kể công sức cho người hiệu đính. Quy trình khép kín này tăng cường năng suất dịch thuật tổng thể. Chất lượng bản dịch sau khi tự động hiệu chỉnh tiệm cận với tiêu chuẩn dịch thuật chuyên nghiệp.

V. Hệ thống VIKI Translator dịch tự động văn bản tiếng Việt

VIKI Translator là ứng dụng dịch tự động Anh - Việt được phát triển trên cơ sở các nghiên cứu của luận án. Hệ thống được thiết kế chuyên biệt cho việc xử lý các văn bản pháp luật phức tạp. VIKI Translator tích hợp toàn bộ các giải pháp về ngữ liệu lớn, mạng nơ-ron sâu và tri thức ontology. Ứng dụng cung cấp giao diện trực quan, thân thiện cho người dùng cuối. Hệ thống hỗ trợ dịch thuật nhanh chóng với độ trễ thấp và độ chính xác cao. Dịch máy nơ-ron tiếng Việt trong VIKI Translator chứng minh tính khả thi và hiệu quả vượt trội trong môi trường thực tiễn. Ứng dụng đóng góp giá trị thiết thực cho hoạt động tra cứu văn bản pháp quy.

5.1. Kiến trúc mô đun và tổ chức huấn luyện mô hình VIKI

Hệ thống VIKI Translator bao gồm nhiều mô-đun chức năng được liên kết chặt chẽ. Mô-đun tiền xử lý đảm nhận việc làm sạch văn bản và tách từ tiếng Việt. Mô-đun dịch thuật cốt lõi sử dụng mạng nơ-ron tối ưu hóa trên tập ngữ liệu song ngữ Anh - Việt chuyên ngành luật. Mô-đun ontology hỗ trợ chuẩn hóa các thuật ngữ pháp lý khó. Quá trình huấn luyện mô hình diễn ra trên hạ tầng tính toán song song hiệu năng cao. Các siêu tham số được tinh chỉnh cẩn thận thông qua nhiều vòng thử nghiệm. Kiến trúc hướng dịch vụ giúp hệ thống dễ dàng mở rộng và tích hợp vào các nền tảng ứng dụng văn phòng khác nhau.

5.2. Kết quả thực nghiệm và phản hồi từ người dùng thực tế

Thực nghiệm trên tập kiểm thử văn bản pháp luật cho thấy VIKI Translator đạt điểm BLEU vượt trội so với các hệ thống thương mại. Tỷ lệ lỗi ngữ pháp và sai lệch ngữ nghĩa giảm rõ rệt. Đánh giá thực tế từ nhóm chuyên gia luật và dịch thuật ghi nhận bản dịch có độ mạch lạc và chuẩn xác cao. Người dùng tiết kiệm hơn 40% thời gian hiệu đính so với việc dịch từ đầu. Ứng dụng vận hành ổn định dưới tải lượng truy cập lớn. Phản hồi tích cực khẳng định giải pháp của luận án đã giải quyết hiệu quả bài toán tự động hóa dịch thuật cho ngôn ngữ tiếng Việt.

Xem trước tài liệu
Tải đầy đủ để xem toàn bộ nội dung
Luận án tiến sĩ nghiên cứu giải pháp cải tiến chất lượng dịch tự động tiếng việt

Tải xuống file đầy đủ để xem toàn bộ nội dung

Tải đầy đủ (140 trang)

Trích đoạn nội dung luận án

Tải xuống để đọc toàn bộ

ĐẠI HỌC ĐÀ NẴNG TRƯỜNG ĐẠI HỌC BÁCH KHOA  NGUYỄN VĂN BÌNH NGHIÊN CỨU GIẢI PHÁP CẢI TIẾN CHẤT LƯỢNG DỊCH TỰ ĐỘNG TIẾNG VIỆT LUẬN ÁN TIẾN SĨ KỸ THUẬT Đà Nẵng, 12/2021 ĐẠI HỌC ĐÀ NẴNG TRƯỜNG ĐẠI HỌC BÁCH KHOA  NGUYỄN VĂN BÌNH NGHIÊN CỨU GIẢI PHÁP CẢI TIẾN CHẤT LƯỢNG DỊCH TỰ ĐỘNG TIẾNG VIỆT Chuyên ngành: Khoa học máy tính Mã số: 9480101 LUẬN ÁN TIẾN SĨ KỸ THUẬT Người hướng dẫn khoa học: 1. Huỳnh Công Pháp 2. Vincent Berment Đà Nẵng, 12/2021 3 LỜI CAM ĐOAN Tôi tên là Nguyễn Văn Bình. Tôi xin cam đoan đây là công trình nghiên cứu do tôi thực hiện.

Các nội dung và kết quả nghiên cứu được trình bày trong Luận án là trung thực và mọi tham khảo đều được trích dẫn, chỉ rõ nguồn tham khảo theo đúng quy định. Tác giả Nguyễn Văn Bình 4 MỤC LỤC LỜI CAM ĐOAN.4 DANH MỤC CÁC TỪ VIẾT TẮT.7 DANH MỤC BẢNG BIỂU. 8 DANH MỤC HÌNH VẼ. Mục tiêu nghiên cứu.

Đối tượng và phạm vi nghiên cứu. Phương pháp nghiên cứu. Bố cục của luận án. Đóng góp chính của luận án.16 TỔNG QUAN VỀ DỊCH TỰ ĐỘNG VÀ CHẤT LƯỢNG DỊCH TỰ ĐỘNG TIẾNG VIỆT HIỆN NAY.

Nghiên cứu tổng quan về dịch tự động, kho ngữ liệu, các phương pháp cải tiến và đánh giá chất lượng dịch tự động.21 Các phương pháp dịch tự động.21 Kho ngữ liệu trong dịch tự động.28 Đánh giá chất lượng hệ thống dịch tự động. Các nghiên cứu liên quan đến xây dựng và cải tiến chất lượng dịch tự động tiếng Việt.43 Nghiên cứu xây dựng hệ thống dịch và đánh giá chất lượng dịch. 43 Nghiên cứu xây dựng và cải tiến kho ngữ liệu tiếng Việt. Thực trạng chất lượng dịch tự động tiếng Việt.

Kết luận Chương 1. 52 GIẢI PHÁP CẢI TIẾN CHẤT LƯỢNG DỊCH TỰ ĐỘNG TIẾNG VIỆT. Đánh giá chất lượng các hệ thống dịch tự động tiếng Việt.54 Tổ chức đánh giá.55 Nhận xét, đánh giá. 60 Đề xuất giải pháp đánh giá chất lượng dựa trên quá trình hiệu đính bản dịch.

Giải pháp cải tiến chất lượng dịch tiếng Việt dựa vào kho ngữ liệu lớn. 69 Các nghiên cứu liên quan đến cải tiến chất lượng kho ngữ liệu.70 Giải pháp nâng cao chất lượng kho ngữ liệu.71 Đánh giá vai trò của kho ngữ liệu đối với kết quả hệ thống dịch. Giải pháp cải tiến chất lượng dịch tiếng Việt dựa vào mô hình máy học mạng nơ ron. 91 Giải pháp cải tiến chất lượng dịch tiếng Việt bằng mô hình học máy mạng nơ ron.91 Kết quả xây dựng hệ thống dịch.102 Giải pháp xây dựng hệ thống dịch ngữ nghĩa.

Kết luận Chương 2. 109 HỆ THỐNG DỊCH TỰ ĐỘNG ANH-VIỆT VIKI TRANSLATOR. Xây dựng kho ngữ liệu.112 Quy trình các bước triển khai.112 Xây dựng kho ngữ liệu song ngữ số lượng lớn.113 6 Xây dựng công cụ hỗ trợ mở rộng ngôn ngữ và ngữ nghĩa.117 Xây dựng kho ngữ liệu ontology. Kết quả thực nghiệm xây dựng ứng dụng dịch Anh – Việt lĩnh vực văn bản pháp luật (VIKI Translator).122 Quy trình các bước triển khai.122 Tổ chức huấn luyện mô hình và điều chỉnh tham số mô hình.122 Xây dựng các mô đun của hệ thống dịch.

Đánh giá kết quả. 125 Kết quả thực nghiệm.125 Đánh giá của người dùng. Kết luận Chương 3. 130 KẾT LUẬN VÀ HƯỚNG PHÁT TRIỂN.

Hướng phát triển.132 DANH MỤC CÁC CÔNG TRÌNH KHOA HỌC ĐÃ CÔNG BỐ.133 TÀI LIỆU THAM KHẢO.135 7 DANH MỤC CÁC TỪ VIẾT TẮT Thuật ngữ Tiếng Anh Tiếng Việt Automatic Language Processing Ủy ban cố vấn xử lý ngôn ngữ ALPAC Advisory Committee tự động Chỉ số đánh giá chất lượng bản BLEU BiLingual Evaluation Understudy dịch BLEU CBOW Continuous Bag of Words Mô hình túi từ liên tục Example Based Machine Dịch máy dựa trên ví dụ EBMT Translation Google Neural Machine Hệ thống dịch tự động sử dụng GNMT Translation mạng nơ ron của Google Chỉ số lỗi khi dịch bởi con HTER Human Translation Error Rate người National Institute of Standards Chỉ số đánh giá chất lượng bản NIST and Technology dịch NIST NMT Neural Network Translation Dịch máy sử dụng mạng nơ ron POS Part of Speech Phân loại từ vựng RNN Recurrent Neural Networks Mạng nơ ron tái phát SMT Statistical Machine Translation Dịch máy thống kê TBL Transformation-Based Learning Dịch máy chuyển đổi TER Translation Edit Rate Chỉ số đo lỗi bản dịch WER Word Error Rate Chỉ số tỉ lệ lỗi theo từ Workshop on Statistical Machine Hội thảo về dịch máy thống kê WMT Translation 8 DANH MỤC BẢNG BIỂU Bảng 1. Chi tiết kho ngữ liệu EuroMatrix. Tổng hợp một số kho ngữ liệu. Bảng các thang đo tương ứng với mức độ đầy đủ và trôi chảy.

Mô phỏng kết quả đánh giá bằng hình thức xếp hạng. Đánh giá chất lượng dịch Anh – Việt từ hệ thống dịch dựa trên MOSES. So sánh kết quả dịch sử dụng MOSES và hệ thống Google, Microsoft. Kết quả đánh giá trên tập dữ liệu TED tst2015 của IWSLT 2015.

Đánh giá chất lượng hệ thống dịch sử dụng ngôn ngữ trung gian. Ví dụ về một số câu hệ thống dịch sai nghĩa. Thông tin về dữ liệu phục vụ đánh giá. Đánh giá kết quả dịch từ tiếng Anh sang tiếng Việt.

Đánh giá kết quả dịch từ tiếng Việt sang tiếng Anh. Kết quả đánh giá bằng phương pháp chủ quan. Trung bình các chỉ số trên 5 bộ dữ liệu. Kết quả sau khi hiệu chỉnh bản dịch.

Bảng tóm tắt đặc trưng các kho ngữ liệu phổ biến. Số liệu kho ngữ liệu sử dụng để đánh giá sự ảnh hưởng đến chất lượng. Chất lượng các mô hình dịch nhận được. Mô tả dữ liệu phục vụ xây dựng hệ thống dịch.

So sánh chất lượng hệ thống dịch theo các phương pháp khác nhau. Thống kê số lượng câu trong kho ngữ liệu đã được xây dựng. Tổng hợp quy mô kho ngữ liệu của một số công bố. Kết quả đánh giá và so sánh chất lượng hệ thống dịch Anh-Việt.

So sánh điểm BLEU đạt được ở một số nghiên cứu xây dựng hệ thống dịch tiếng Việt. So sánh số lượng câu dịch đúng. Ví dụ về các câu, thuật ngữ mà hệ thống VIKI Translator đã dịch đúng. 127 10 DANH MỤC HÌNH VẼ Hình 1.

Tổng quan bài toán dịch tự động. Mô hình tổng quát của phương pháp dịch dựa trên ví dụ. Mô hình hóa phương pháp dịch thống kê. Một ánh xạ giữa các factor trong ngôn ngữ nguồn và ngôn ngữ đích.

Tích hợp thêm các lớp thông tin về lemma, POS vào dữ liệu huấn luyện27 Hình 1. Giao diện của phần mềm dịch EV-Shuttle và Cồ Việt. Hai yếu tố then chốt của hệ thống dịch tự động: Dữ liệu và Phương pháp dịch. Quy trình tổ chức đánh giá chất lượng dịch tiếng Việt.

Chương trình hỗ trợ trích xuất kết quả dịch từ các hệ thống. Biểu đồ so sánh kết quả đánh giá bằng phương pháp chủ quan. Chương trình tính chỉ số Tpe và Ope thông qua quá trình hiệu đính. Sơ đồ quy trình kết hợp hậu xử lý với đánh giá chất lượng hệ thống dịch.

Sự tương đồng giữa Tpe, Ope và ED, WER. Chỉ số BLEU, NIST trước và sau khi hiệu chỉnh. Quan hệ giữa các dạng dữ liệu của các kho ngữ liệu. Định dạng chuẩn biểu diễn kho ngữ liệu.

Giải pháp chuyển đổi các kho ngữ liệu. Giải pháp mở rộng ngôn ngữ cho kho ngữ liệu. Giải pháp thêm dữ liệu vào kho ngữ liệu. Hệ thống nhận dạng và phân loại thực thể danh từ riêng từ kho ngữ liệu.

Trích nội dung tập tin từ điển khi sử dụng mô hình dịch thống kê và dịch sử dụng mạng nơ ron. Kết quả xác định ranh giới từ tiếng Việt. Quy trình đánh giá sự ảnh hưởng của số lượng kho ngữ liệu đến chất lượng bản dịch. So sánh tương quan giữa số lượng kho ngữ liệu và chất lượng hệ thống dịch.

Mô hình dịch tự động sử dụng mạng nơ ron. Nguyên tắc hoạt động của mạng RNN. Minh họa bộ mã hóa – giải mã. Minh họa mô hình seq2seq dùng attention trong bài toán dịch máy [57].

Mô hình CBOW và Skip-gram trình bày tại [63]. Kiến trúc Bộ Mã hóa và Bộ Giải mã. Quá trình mã hóa câu nguồn để tạo véc tơ ngữ nghĩa. Minh họa Bộ Giảm mã thực hiện các bước dịch một câu.

Quá trình giải mã tái tạo câu được dịch. Tích hợp cơ chế attention trong Bộ Giải mã. Mô hình hệ thống dịch ngữ nghĩa. Giao diện hệ thống dịch ngữ nghĩa.

Quy trình triển khai thực nghiệm hệ thống dịch Anh - Việt. Sơ đồ trình tự các bước xây dựng kho ngữ liệu. Môi trường cho phép mở rộng kho ngữ liệu. Phân cấp các lớp và thuộc tính các lớp.

Minh họa phân lớp dữ liệu. Mô tả ngữ nghĩa của kho ngữ liệu. Sơ đồ trình tự các bước xây dựng hệ thống dịch. Mô hình tổ chức của hệ thống website dịch tự động.

Giao diện hệ thống dịch tự động VIKI Translator. Biểu đồ số lượng người sử dụng hàng tháng (Nguồn: Google Analytics). Thống kê tổng số người dùng (Nguồn: Google Analytics). Thống kê số lượng liên kết (Nguồn: ahrefs.

Đặt vấn đề Nhu cầu trao đổi thông tin giữa các quốc gia, các nền văn hóa, giữa mỗi người trong xã hội hiện đại ngày càng tăng làm cho việc dịch thuật trở nên quan trọng và cần thiết. Dịch thuật sử dụng con người là công việc thủ công, tuy chất lượng cao nhưng tốc độ chậm, năng suất thấp và giá thành cao mà không thể tái sử dụng. Trong khi đó, một phiên dịch viên dù giỏi đến đâu cũng không thể cập nhật hết được một lượng thông tin khổng lồ trong nền kinh tế toàn cầu đang phát triển như vũ bão. Vì vậy, sử dụng hệ thống dịch tự động bằng máy tính để trợ giúp cho quá trình dịch thuật là cần thiết.

Dịch tự động bằng máy tính nếu cho kết quả dịch tốt sẽ mang lại hiệu quả với chi phí bỏ ra ít, có thể dịch nhanh với khối lượng tài liệu lớn thuộc các lĩnh vực chuyên môn khác nhau. Khi đó các hệ dịch máy sẽ trở thành công cụ giúp con người tiếp cận kho tri thức khổng lồ viết bằng các ngôn ngữ khác nhau. Những chương trình máy tính đầu tiên thực hiện công việc dịch tự động đã được các nhà khoa học trên thế giới nghiên cứu và phát triển từ giữa thế kỷ 20 [1]. Đối với dịch tự động từ tiếng Việt sang các ngôn ngữ khác, đã có nhiều nghiên cứu và các sản phẩm ứng dụng được nhiều người dùng quan tâm và sử dụng, điển hình là hệ thống dịch của Google, Microsoft, EVTran [2]… Các hệ thống này cho phép dịch tự động văn bản với một cặp ngôn ngữ đã chọn trước, ví dụ dịch từ tiếng Anh sang tiếng Việt hoặc ngược lại.

Khi sử dụng một hệ thống dịch tự động, người dùng quan tâm đến chất lượng của bản dịch.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Trích dẫn luận án này

Nguyễn Văn Bình (2021). Luận án cải tiến chất lượng dịch tự động tiếng Việt [Luận án tiến sĩ, Trường Đại học Bách khoa - Đại học Đà Nẵng]. LuanAn.net. https://luanan.net/ngon-ngu-hoc/ngon-ngu-hoc-ung-dung/luan-an-cai-tien-chat-luong-dich-tu-dong-tieng-viet

Câu hỏi thường gặp

Luận án "Luận án cải tiến chất lượng dịch tự động tiếng Việt" nghiên cứu về vấn đề gì?

"Luận án tiến sĩ nghiên cứu cải tiến chất lượng dịch tự động tiếng Việt bằng phương pháp machine learning tiên tiến."

Luận án "Luận án cải tiến chất lượng dịch tự động tiếng Việt" được bảo vệ tại trường nào?

Luận án này được bảo vệ tại Trường Đại học Bách khoa - Đại học Đà Nẵng. Năm bảo vệ: 2021.

Luận án "Luận án cải tiến chất lượng dịch tự động tiếng Việt" thuộc chuyên ngành gì?

Luận án "Luận án cải tiến chất lượng dịch tự động tiếng Việt" thuộc chuyên ngành Khoa học máy tính. Danh mục: Ngôn Ngữ Học Ứng Dụng.

Luận án "Luận án cải tiến chất lượng dịch tự động tiếng Việt" có bao nhiêu trang?

Luận án "Luận án cải tiến chất lượng dịch tự động tiếng Việt" có 140 trang. Bạn có thể xem trước một phần tài liệu ngay trên trang web trước khi tải về.

Cách tải luận án "Luận án cải tiến chất lượng dịch tự động tiếng Việt" về máy như thế nào?

Để tải luận án về máy, bạn nhấn nút "Tải xuống ngay" trên trang này, sau đó hoàn tất thanh toán phí lưu trữ. File sẽ được tải xuống ngay sau khi thanh toán thành công. Hỗ trợ qua Zalo: 0559 297 239.

Luận án liên quan

Chia sẻ tài liệu: Facebook Twitter