Nghiên cứu và phát triển phương pháp tiếp cận dựa trên cấu trúc và thống kê trong dịch tự động ngôn ngữ ký hiệu Việt Nam - Luận án Tiến sĩ Khoa học Máy tính
"Phương pháp mới kết hợp cấu trúc và thống kê, cải thiện đáng kể chất lượng dịch tự động ngôn ngữ ký hiệu Việt Nam."
Luan An
Luận án tiến sĩ
Năm xuất bản
Số trang
119
Thời gian đọc
18 phút
Lượt xem
0
Lượt tải
0
Phí lưu trữ
40 Point
Tổng quan nhanh
- Chủ đề:
- Tổng quan dịch tự động ngôn ngữ ký hiệu Việt Nam
- Số trang:
- 119 trang
- Trường:
- Học viện Khoa học và Công nghệ
- Chuyên ngành:
- Khoa học máy tính
- Tác giả:
- Nguyễn Thị Bích Điệp
- Năm:
- 2023
Tóm tắt nội dung luận án
I.Tổng quan dịch tự động ngôn ngữ ký hiệu Việt Nam
Dịch tự động ngôn ngữ ký hiệu Việt Nam là một lĩnh vực nghiên cứu đầy thách thức. Ngôn ngữ ký hiệu Việt Nam (VSL) có cấu trúc ngữ pháp độc đáo. VSL khác biệt đáng kể so với tiếng Việt nói. Vấn đề nhận dạng ngôn ngữ ký hiệu đòi hỏi công nghệ phức tạp. Nghiên cứu này tập trung vào phát triển các phương pháp hiệu quả. Mục tiêu chính là cải thiện khả năng giao tiếp cho cộng đồng người khiếm thính. Việc này thúc đẩy sự phát triển của xử lý ngôn ngữ tự nhiên cho VSL. Một hệ thống dịch tự động đáng tin cậy sẽ tạo ra tác động lớn. Nó giúp thu hẹp khoảng cách giao tiếp giữa các cộng đồng. Tài liệu này cung cấp cái nhìn tổng quan về các phương pháp tiếp cận tiên tiến. Chúng bao gồm cả phương pháp dựa trên cấu trúc và thống kê. Nghiên cứu xác định các rào cản hiện tại và đề xuất giải pháp. Tầm quan trọng của việc xây dựng bộ ngữ liệu ngôn ngữ ký hiệu chất lượng cao cũng được nhấn mạnh. Đồng thời, đánh giá chất lượng bản dịch tự động là một phần thiết yếu của quá trình nghiên cứu này.
1.1. Bản chất ngôn ngữ ký hiệu Việt Nam
Ngôn ngữ ký hiệu Việt Nam (VSL) là một hệ thống ngôn ngữ tự nhiên hoàn chỉnh. VSL sở hữu cấu trúc ngữ pháp và từ vựng riêng. Cấu trúc ngữ pháp ngôn ngữ ký hiệu thường mang tính thị giác và không theo thứ tự từ-ngữ cố định như tiếng Việt nói. VSL sử dụng các yếu tố như hình dạng tay, vị trí, chuyển động và biểu cảm khuôn mặt. Những yếu tố này kết hợp tạo thành các ký hiệu có ý nghĩa. Việc hiểu và phân tích ngữ pháp ngôn ngữ ký hiệu là bước đầu quan trọng. Nó giúp xây dựng các mô hình dịch tự động ngôn ngữ ký hiệu chính xác. Nghiên cứu các đặc điểm này là nền tảng cho việc phát triển hệ thống dịch máy. Sự phức tạp trong cấu trúc ngôn ngữ đòi hỏi một cách tiếp cận đa chiều. Nhận dạng ngôn ngữ ký hiệu đòi hỏi công nghệ thị giác máy tính tiên tiến. Cộng đồng nghiên cứu cần hiểu sâu về các đặc tính độc đáo của VSL. Điều này sẽ dẫn đến những giải pháp hiệu quả hơn trong xử lý ngôn ngữ tự nhiên.
1.2. Thách thức bài toán dịch tự động ngôn ngữ ký hiệu
Dịch tự động ngôn ngữ ký hiệu đối mặt với nhiều thách thức lớn. Một trong những rào cản chính là sự thiếu hụt nghiêm trọng của bộ ngữ liệu ngôn ngữ ký hiệu song ngữ. Việc xây dựng một bộ dữ liệu lớn, chất lượng cao là vô cùng tốn kém và mất thời gian. Ngữ pháp ngôn ngữ ký hiệu khác biệt đòi hỏi các phương pháp xử lý ngôn ngữ tự nhiên chuyên biệt. Các công cụ và tài nguyên sẵn có cho tiếng nói không dễ dàng áp dụng. Vấn đề nhận dạng ngôn ngữ ký hiệu từ video cũng rất phức tạp. Nó liên quan đến việc theo dõi chuyển động cơ thể và tay một cách chính xác. Thêm vào đó, sự biến thiên trong cách ký hiệu giữa các cá nhân cũng là một yếu tố khó khăn. Việc dóng hàng từ và ký hiệu chính xác giữa hai ngôn ngữ là một bài toán khó. Nghiên cứu này tìm cách giải quyết những thách thức này. Nó đề xuất các phương pháp tiếp cận mới. Chúng nhằm khắc phục những hạn chế hiện có trong lĩnh vực dịch tự động ngôn ngữ ký hiệu Việt Nam.
II.Tiếp cận dịch dựa trên cấu trúc ngôn ngữ ký hiệu
Phương pháp dịch máy dựa trên cấu trúc là một hướng tiếp cận truyền thống. Phương pháp này tập trung vào việc phân tích cấu trúc ngữ pháp của ngôn ngữ nguồn. Nó sau đó tổng hợp thành cấu trúc của ngôn ngữ đích. Trong bối cảnh dịch tự động ngôn ngữ ký hiệu Việt Nam, điều này bao gồm việc phân tích cấu trúc câu VSL. Hệ thống dịch dựa trên luật cần một tập hợp các luật ngữ pháp rõ ràng. Các luật này định nghĩa cách các ký hiệu và cụm từ VSL được sắp xếp. Chúng cũng xác định cách chúng tương ứng với tiếng Việt. Ưu điểm của phương pháp này là khả năng kiểm soát cao đối với chất lượng bản dịch. Nó giúp tạo ra các bản dịch ngữ pháp chính xác. Tuy nhiên, việc xây dựng và duy trì các luật này rất phức tạp. Nó đòi hỏi kiến thức chuyên sâu về ngữ pháp ngôn ngữ ký hiệu. Ngoài ra, phương pháp này có thể không linh hoạt khi gặp các cấu trúc câu mới. Sự phức tạp của việc tổng hợp luật là một thách thức lớn. Dù vậy, đây là một bước quan trọng trong việc xây dựng nền tảng cho dịch tự động ngôn ngữ ký hiệu.
2.1. Xây dựng hệ thống dịch máy dựa trên luật
Hệ thống dịch máy dựa trên luật (RBMT) hoạt động dựa trên tập hợp các luật ngôn ngữ được định nghĩa trước. Đối với dịch tự động ngôn ngữ ký hiệu, việc này đòi hỏi phân tích cú pháp ngôn ngữ ký hiệu Việt Nam. Các luật được thiết kế để chuyển đổi cấu trúc ngữ pháp ngôn ngữ ký hiệu thành cấu trúc tiếng Việt. Điều này bao gồm các luật cho trật tự từ, sự hòa hợp ngữ pháp và các yếu tố hình thái. RBMT yêu cầu sự hiểu biết sâu sắc về ngữ pháp ngôn ngữ ký hiệu. Quá trình này bắt đầu bằng việc phân tích ngôn ngữ nguồn để tạo ra một biểu diễn trung gian. Sau đó, các luật chuyển đổi áp dụng để tạo ra câu dịch. Các thành phần chính bao gồm từ điển, bộ phân tích cú pháp và bộ tổng hợp. Mỗi thành phần đóng vai trò quan trọng trong việc tạo ra bản dịch chính xác. Nghiên cứu này đã xây dựng một hệ thống RBMT ban đầu. Nó nhằm chứng minh tính khả thi của phương pháp này cho VSL. Việc này góp phần vào lĩnh vực xử lý ngôn ngữ tự nhiên cho ngôn ngữ ký hiệu.
2.2. Phát triển ngữ liệu và từ điển cho cấu trúc
Để xây dựng một hệ thống dịch máy dựa trên cấu trúc hiệu quả, ngữ liệu là yếu tố then chốt. Nghiên cứu đã tập trung vào việc tạo ra một bộ ngữ liệu ngôn ngữ ký hiệu ban đầu. Điều này bao gồm tập từ điển VSL-Lexicon. VSL-Lexicon chứa các cặp ký hiệu-từ tiếng Việt tương ứng. Bên cạnh đó, một bộ dữ liệu song ngữ Vie-VSL10k cũng được xây dựng. Bộ dữ liệu này chứa các câu tiếng Việt và bản dịch ngôn ngữ ký hiệu tương ứng. Vấn đề tổng hợp luật là một phần không thể thiếu. Nó liên quan đến việc trích xuất các quy tắc ngữ pháp từ dữ liệu thực tế. Các đặc điểm cú pháp câu VSL được nghiên cứu kỹ lưỡng. Chúng được sử dụng để định hình các luật dịch. Ví dụ, tính chất rút gọn trong câu VSL là một đặc điểm cần được xử lý. Việc phát triển các tài nguyên này là một đóng góp quan trọng. Nó cung cấp nền tảng cho các nghiên cứu tiếp theo về dịch tự động ngôn ngữ ký hiệu Việt Nam. Chất lượng của bộ ngữ liệu ảnh hưởng trực tiếp đến hiệu suất của hệ thống RBMT.
III.Nâng cao dịch máy thống kê ngôn ngữ ký hiệu Việt Nam
Dịch máy thống kê (SMT) đã từng là phương pháp phổ biến. Phương pháp này dựa trên việc học các mẫu dịch từ bộ dữ liệu song ngữ lớn. Nó ước tính xác suất của một bản dịch. Trong bối cảnh dịch tự động ngôn ngữ ký hiệu Việt Nam, SMT tìm kiếm sự dóng hàng từ và ký hiệu. Nó tính toán các mô hình ngôn ngữ và mô hình dịch. Các mô hình này được huấn luyện từ bộ ngữ liệu ngôn ngữ ký hiệu đã có. Ưu điểm của SMT là khả năng xử lý dữ liệu phức tạp. Nó ít yêu cầu quy tắc ngôn ngữ rõ ràng. Tuy nhiên, hiệu suất SMT phụ thuộc rất nhiều vào kích thước và chất lượng của dữ liệu huấn luyện. Sự xuất hiện của các mô hình dịch máy dựa trên mạng nơ-ron (NMT) đã mang lại những cải tiến đáng kể. Các mô hình như Sequence to Sequence và Transformer đã thay đổi cục diện ngành dịch máy. Những công nghệ này có khả năng học các mối quan hệ ngữ nghĩa phức tạp hơn. Chúng tạo ra các bản dịch mượt mà và tự nhiên hơn. Việc áp dụng NMT cho ngôn ngữ ký hiệu Việt Nam là một hướng đi đầy hứa hẹn.
3.1. Ứng dụng mô hình dịch máy thống kê truyền thống
Các mô hình dịch máy thống kê truyền thống (SMT) hoạt động dựa trên các nguyên lý xác suất. SMT học cách dóng hàng từ và ký hiệu giữa ngôn ngữ nguồn và đích. Nghiên cứu đã cải tiến mô hình dịch IBM cho bài toán dịch Vie-VSL. Các mô hình IBM phân tách quá trình dịch thành nhiều bước. Chúng bao gồm việc tạo ra các dóng hàng và ước lượng xác suất từ. SMT cho phép hệ thống học các cặp dịch từ bộ ngữ liệu ngôn ngữ ký hiệu có sẵn. Phương pháp này có khả năng xử lý sự biến thiên ngôn ngữ. Nó cũng thích nghi tốt với các cấu trúc câu khác nhau. Tuy nhiên, hiệu suất của SMT bị hạn chế bởi độ phức tạp của các mô hình thống kê. Nó cũng bị giới hạn bởi khả năng của bộ ngữ liệu. Mặc dù có những hạn chế, SMT cung cấp một cơ sở vững chắc. Nó là bước đệm cho việc phát triển các mô hình dịch tự động ngôn ngữ ký hiệu tiên tiến hơn.
3.2. Khai thác mô hình Sequence to Sequence và Transformer
Mô hình Sequence to Sequence (Seq2Seq) đã cách mạng hóa lĩnh vực dịch máy. Mô hình này sử dụng bộ mã hóa (encoder) và bộ giải mã (decoder). Bộ mã hóa đọc câu nguồn. Bộ giải mã tạo ra câu đích. Mô hình Transformer là một cải tiến đáng kể so với Seq2Seq. Nó giới thiệu cơ chế tự chú ý (self-attention). Cơ chế này cho phép mô hình xem xét toàn bộ câu cùng một lúc. Nó tập trung vào các phần quan trọng nhất. Trong bối cảnh dịch tự động ngôn ngữ ký hiệu, mô hình Transformer có tiềm năng lớn. Nó có thể học các mối quan hệ phức tạp giữa chuỗi ký hiệu và văn bản. Quá trình mã hóa và giải mã được tối ưu hóa. Điều này giúp nắm bắt ngữ cảnh rộng hơn. Việc huấn luyện mạng nơ-ron cho bài toán dịch Vie-VSL sử dụng các mô hình này. Nó mang lại hiệu suất vượt trội. Các mô hình này đại diện cho đỉnh cao của xử lý ngôn ngữ tự nhiên hiện đại.
3.3. Đánh giá các phương pháp thống kê và mạng nơ ron
Để đánh giá hiệu quả của các phương pháp dịch máy, cần có các tiêu chí khách quan. Nghiên cứu sử dụng điểm đánh giá BLEU. BLEU đo lường sự tương đồng giữa bản dịch máy và bản dịch tham chiếu. Ngoài ra, điểm Perplexity cũng được sử dụng. Perplexity đánh giá hiệu suất của mô hình ngôn ngữ. Các thực nghiệm đã được tiến hành để so sánh SMT truyền thống và các mô hình mạng nơ-ron. Kết quả cho thấy các mô hình Transformer và Seq2Seq mang lại chất lượng dịch vượt trội. Chúng vượt trội hơn đáng kể so với SMT. Điều này chứng tỏ tiềm năng của học sâu trong dịch tự động ngôn ngữ ký hiệu Việt Nam. Sự cải thiện về điểm BLEU và giảm Perplexity khẳng định hiệu quả của các phương pháp mới. Việc đánh giá chất lượng bản dịch máy là bước cuối cùng quan trọng. Nó giúp xác định phương pháp tiếp cận tốt nhất cho bài toán này. Những kết quả này mở ra hướng phát triển mạnh mẽ cho công nghệ dịch máy.
IV.Làm giàu dữ liệu bộ ngữ liệu ngôn ngữ ký hiệu Việt Nam
Dữ liệu là nguồn sống của các mô hình học máy. Đặc biệt, đối với các ngôn ngữ tài nguyên thấp như ngôn ngữ ký hiệu Việt Nam, việc thiếu bộ ngữ liệu ngôn ngữ ký hiệu lớn là một rào cản lớn. Kỹ thuật làm giàu dữ liệu trở nên cực kỳ quan trọng. Phương pháp này nhằm tăng cường kích thước và sự đa dạng của tập dữ liệu huấn luyện. Nó giúp cải thiện hiệu suất của mô hình dịch tự động ngôn ngữ ký hiệu. Các kỹ thuật làm giàu dữ liệu bao gồm tạo dữ liệu tổng hợp, dịch ngược (back-translation), và nhiễu dữ liệu. Mục tiêu là tạo ra nhiều cặp câu song ngữ hơn. Điều này giúp mô hình học được các biến thể và ngữ cảnh phong phú hơn. Việc làm giàu dữ liệu không chỉ tăng số lượng mà còn cải thiện chất lượng của tập huấn luyện. Nó làm giảm nguy cơ quá khớp (overfitting) và tăng khả năng khái quát hóa của mô hình. Đây là một bước đột phá quan trọng để vượt qua thách thức về dữ liệu cho VSL.
4.1. Tầm quan trọng của dữ liệu trong dịch tự động
Chất lượng và số lượng của bộ ngữ liệu ngôn ngữ ký hiệu quyết định hiệu suất của hệ thống dịch tự động. Các mô hình dịch máy, đặc biệt là mạng nơ-ron, yêu cầu lượng lớn dữ liệu để học hiệu quả. Trong trường hợp ngôn ngữ ký hiệu Việt Nam, việc thu thập dữ liệu gốc là rất khó khăn. Điều này dẫn đến sự thiếu hụt nghiêm trọng. Sự thiếu hụt này làm hạn chế khả năng học của mô hình. Nó gây ra chất lượng dịch không cao. Dữ liệu chất lượng kém cũng dẫn đến các bản dịch không chính xác. Do đó, việc đầu tư vào xây dựng và mở rộng bộ ngữ liệu là ưu tiên hàng đầu. Nó là yếu tố sống còn để phát triển dịch tự động ngôn ngữ ký hiệu Việt Nam. Dữ liệu là nền tảng cho mọi tiến bộ trong xử lý ngôn ngữ tự nhiên.
4.2. Phương pháp làm giàu dữ liệu đề xuất
Nghiên cứu đề xuất một quy trình làm giàu dữ liệu cụ thể. Phương pháp này nhằm khắc phục tình trạng thiếu hụt bộ ngữ liệu ngôn ngữ ký hiệu. Cơ sở của phương pháp là tạo ra dữ liệu tổng hợp một cách có hệ thống. Quy trình này bao gồm các bước: dịch ngược từ ngôn ngữ đích sang ngôn ngữ nguồn. Sau đó tạo ra các biến thể của câu bằng cách thay thế từ đồng nghĩa hoặc cấu trúc ngữ pháp. Kỹ thuật này sử dụng các mô hình dịch đã huấn luyện để sinh ra các cặp câu mới. Điều này giúp mở rộng đáng kể tập dữ liệu mà không cần thu thập thêm dữ liệu gốc. Việc làm giàu dữ liệu giúp đa dạng hóa ngữ cảnh. Nó cũng giúp mô hình học được nhiều quy tắc hơn. Kết quả thực nghiệm cho thấy phương pháp này cải thiện đáng kể hiệu suất dịch tự động ngôn ngữ ký hiệu. Nó chứng minh hiệu quả của việc xử lý ngôn ngữ tự nhiên dựa trên dữ liệu tổng hợp.
4.3. Tác động của dữ liệu giàu lên hiệu suất dịch
Các thực nghiệm đã chứng minh tác động tích cực của việc làm giàu dữ liệu. Khi bộ ngữ liệu ngôn ngữ ký hiệu được mở rộng, chất lượng dịch tự động ngôn ngữ ký hiệu cải thiện rõ rệt. Các mô hình, đặc biệt là Transformer, hoạt động hiệu quả hơn. Chúng có khả năng khái quát hóa tốt hơn với dữ liệu mới. Điểm BLEU tăng lên đáng kể. Điều này cho thấy bản dịch trở nên chính xác và tự nhiên hơn. Việc làm giàu dữ liệu giúp mô hình nắm bắt được nhiều biến thể ngữ pháp ngôn ngữ ký hiệu. Nó cũng hiểu được các sắc thái trong cách biểu đạt. Sự đầu tư vào kỹ thuật làm giàu dữ liệu là cần thiết. Nó là một giải pháp thiết thực để nâng cao hiệu suất. Đặc biệt quan trọng đối với các ngôn ngữ ký hiệu có nguồn tài nguyên hạn chế. Điều này mở ra hướng phát triển mới cho xử lý ngôn ngữ tự nhiên.
V.Ứng dụng mô hình lai dịch ngôn ngữ ký hiệu hiệu quả
Mô hình dịch lai kết hợp ưu điểm của nhiều phương pháp khác nhau. Phương pháp này tận dụng sức mạnh của dịch máy dựa trên cấu trúc và dịch máy thống kê/mạng nơ-ron. Mục tiêu là khắc phục những hạn chế riêng lẻ của từng phương pháp. Trong bối cảnh dịch tự động ngôn ngữ ký hiệu Việt Nam, mô hình lai có thể tận dụng kiến thức ngữ pháp ngôn ngữ ký hiệu rõ ràng. Đồng thời, nó học từ dữ liệu bằng các phương pháp thống kê hoặc học sâu. Ví dụ, một phần của hệ thống có thể sử dụng luật để xử lý các cấu trúc ngữ pháp phức tạp. Một phần khác sử dụng mạng nơ-ron để tạo ra bản dịch mượt mà. Việc kết hợp này giúp tạo ra một hệ thống mạnh mẽ và linh hoạt hơn. Nó có khả năng đạt được chất lượng dịch cao hơn so với các phương pháp đơn lẻ. Mô hình dịch lai đại diện cho một hướng nghiên cứu tiên tiến. Nó là chìa khóa để giải quyết triệt để bài toán dịch tự động ngôn ngữ ký hiệu. Nó tối ưu hóa quá trình nhận dạng ngôn ngữ ký hiệu và tạo ra bản dịch chất lượng cao.
5.1. Kết hợp tiếp cận cấu trúc và thống kê
Mô hình dịch lai là sự kết hợp thông minh giữa các phương pháp. Nó tận dụng sự chính xác ngữ pháp từ dịch máy dựa trên cấu trúc. Đồng thời, nó hưởng lợi từ khả năng học rộng của dịch máy thống kê hoặc NMT. Việc này giúp giải quyết các khía cạnh phức tạp của ngữ pháp ngôn ngữ ký hiệu. Một hệ thống lai có thể sử dụng các luật tiền xử lý. Nó chuẩn hóa đầu vào VSL trước khi đưa vào mô hình thống kê/NMT. Hoặc, nó có thể sử dụng đầu ra từ mô hình thống kê/NMT. Sau đó, nó áp dụng các luật hậu xử lý để sửa lỗi ngữ pháp. Sự kết hợp này nhằm tối đa hóa hiệu suất dịch. Nó đảm bảo cả tính chính xác cú pháp và sự tự nhiên của bản dịch. Phương pháp này đặc biệt hữu ích cho dịch tự động ngôn ngữ ký hiệu. Nó giúp xử lý các đặc thù của ngôn ngữ ký hiệu Việt Nam.
5.2. Xây dựng kiến trúc mô hình dịch lai tối ưu
Việc thiết kế kiến trúc mô hình dịch lai đòi hỏi sự cân nhắc kỹ lưỡng. Các thành phần của hệ thống lai cần được tích hợp một cách hài hòa. Một kiến trúc điển hình có thể bao gồm một module nhận dạng ngôn ngữ ký hiệu. Module này trích xuất các đặc trưng từ video ký hiệu. Sau đó, một module dựa trên luật sẽ phân tích cấu trúc cú pháp VSL. Nó tạo ra một biểu diễn ngữ pháp. Biểu diễn này được chuyển tiếp đến một module dịch máy thống kê hoặc mạng nơ-ron. Module này chịu trách nhiệm tạo ra bản dịch tiếng Việt. Quá trình này có thể bao gồm các bước dóng hàng từ và ký hiệu nâng cao. Mục tiêu là tối ưu hóa luồng thông tin giữa các thành phần. Nó giúp tạo ra bản dịch chất lượng cao. Kiến trúc tối ưu sẽ tận dụng điểm mạnh của từng phương pháp. Nó giảm thiểu các điểm yếu của chúng. Điều này rất quan trọng để đạt được kết quả tốt nhất trong dịch tự động ngôn ngữ ký hiệu.
VI.Triển vọng phát triển dịch tự động ngôn ngữ ký hiệu
Lĩnh vực dịch tự động ngôn ngữ ký hiệu Việt Nam vẫn còn nhiều tiềm năng phát triển. Nghiên cứu này đã đặt nền móng quan trọng. Nó mở ra nhiều hướng đi mới cho tương lai. Các cải tiến trong công nghệ nhận dạng ngôn ngữ ký hiệu sẽ tiếp tục nâng cao chất lượng đầu vào. Việc mở rộng bộ ngữ liệu ngôn ngữ ký hiệu là một ưu tiên hàng đầu. Nó sẽ thúc đẩy sự tiến bộ của các mô hình học sâu. Phát triển các mô hình dịch lai phức tạp hơn. Điều đó sẽ khai thác sâu hơn mối quan hệ giữa cấu trúc và thống kê. Mục tiêu cuối cùng là tạo ra một hệ thống dịch tự động ngôn ngữ ký hiệu hoạt động mượt mà. Hệ thống này có thể hỗ trợ hiệu quả cộng đồng người khiếm thính. Nó sẽ tạo điều kiện thuận lợi cho giao tiếp và tiếp cận thông tin. Các ứng dụng thực tiễn của công nghệ này là vô cùng rộng lớn. Từ giáo dục đến dịch vụ công cộng, tiềm năng là không giới hạn. Đây là một bước tiến quan trọng trong xử lý ngôn ngữ tự nhiên cho VSL.
6.1. Hướng nghiên cứu tiếp theo cho ngôn ngữ ký hiệu
Nghiên cứu tiếp theo cần tập trung vào việc mở rộng bộ ngữ liệu ngôn ngữ ký hiệu với dữ liệu đa dạng hơn. Phát triển các phương pháp làm giàu dữ liệu mới. Chúng nhằm mục đích tạo ra ngữ liệu chất lượng cao. Cải tiến thuật toán nhận dạng ngôn ngữ ký hiệu từ video trực tiếp. Điều này giúp nâng cao độ chính xác của đầu vào. Nghiên cứu sâu hơn về ngữ pháp ngôn ngữ ký hiệu Việt Nam. Từ đó xây dựng các luật dịch dựa trên cấu trúc tinh vi hơn. Khám phá các kiến trúc mạng nơ-ron tiên tiến khác. Ví dụ như các mô hình dựa trên đồ thị hoặc học tăng cường. Chúng có thể nắm bắt tốt hơn cấu trúc của ngôn ngữ ký hiệu. Cải thiện quy trình dóng hàng từ và ký hiệu. Điều này giúp tối ưu hóa việc ánh xạ giữa hai ngôn ngữ. Những hướng nghiên cứu này sẽ tiếp tục thúc đẩy lĩnh vực dịch tự động ngôn ngữ ký hiệu.
6.2. Ứng dụng thực tiễn của công nghệ dịch ngôn ngữ ký hiệu
Công nghệ dịch tự động ngôn ngữ ký hiệu có tiềm năng ứng dụng rộng lớn. Nó có thể hỗ trợ đáng kể cộng đồng người khiếm thính. Các ứng dụng bao gồm tạo ra các công cụ giao tiếp hàng ngày. Ví dụ như ứng dụng dịch thuật thời gian thực trên điện thoại thông minh. Trong giáo dục, nó giúp học sinh khiếm thính tiếp cận bài giảng. Nó cũng giúp họ hiểu tài liệu dễ dàng hơn. Trong lĩnh vực truyền thông, công nghệ này có thể cung cấp phụ đề tự động cho các chương trình truyền hình hoặc video trực tuyến. Nó mở rộng khả năng tiếp cận thông tin. Dịch vụ công cộng có thể triển khai hệ thống dịch ngôn ngữ ký hiệu. Điều này giúp người khiếm thính tương tác tốt hơn. Việc phát triển xử lý ngôn ngữ tự nhiên cho VSL không chỉ là tiến bộ công nghệ. Nó còn là đóng góp xã hội quan trọng. Nó thúc đẩy sự hòa nhập và bình đẳng cho mọi người.
Mục lục chi tiết luận án
Tải xuống file đầy đủ để xem toàn bộ nội dung
Tải đầy đủ (119 trang)Nội dung chính
Tổng quan về luận án
Luận án này tập trung vào việc nghiên cứu và phát triển các phương pháp tiếp cận dựa trên cấu trúc và thống kê trong dịch tự động Ngôn ngữ Ký hiệu Việt Nam (VSLMT), một lĩnh vực khoa học máy tính đang phát triển với ý nghĩa xã hội sâu sắc. Bối cảnh khoa học của nghiên cứu được đặt trong sự thiếu hụt các tài liệu chuyên môn chính thống và các công cụ dịch máy hiệu quả cho VSL, giới hạn đáng kể khả năng tiếp cận thông tin và giao tiếp của cộng đồng người khiếm thính Việt Nam.
Research gap cụ thể mà luận án giải quyết là sự thiếu vắng các hệ thống dịch tự động đáng tin cậy từ văn bản tiếng Việt thông thường sang văn bản đúng cú pháp trong Ngôn ngữ Ký hiệu Việt Nam (VSL) [Trang 2, 6, 17]. Trong khi các nghiên cứu quốc tế đã đạt được những tiến bộ đáng kể trong việc dịch các ngôn ngữ ký hiệu như ASL-English hay International Sign Language trong các lĩnh vực y tế, giáo dục và giao tiếp quốc tế, VSL vẫn còn là một ngôn ngữ ít tài nguyên và chưa được khai thác triệt để [Trang 2, 17]. Hầu hết các phương pháp dịch ngôn ngữ ký hiệu trên thế giới, đặc biệt là những phương pháp dựa trên học sâu (Deep Learning), gặp phải hạn chế lớn về bộ dữ liệu đủ lớn để đào tạo và thường bỏ qua các đặc điểm cú pháp độc đáo của ngôn ngữ ký hiệu, cũng như ít xem xét đến quan điểm của người khiếm thính [Trang 2, 14, 16]. Luận án nhận định rằng "việc chú trọng đến cấu trúc cú pháp trong ngôn ngữ ký hiệu là quan trọng, nhưng trong nhiều nghiên cứu lại xem nhẹ vấn đề này" [Trang 2]. Điều này tạo ra một lỗ hổng đáng kể, đòi hỏi một cách tiếp cận tùy chỉnh, tích hợp đặc điểm ngữ pháp VSL vào các mô hình dịch máy.
Để giải quyết vấn đề này, luận án đề xuất các câu hỏi nghiên cứu và giả thuyết sau:
- RQ1: Liệu một phương án dịch dựa trên luật, dù là phương pháp cổ điển, có thể đạt được hiệu quả đáng kể trong việc dịch từ văn bản tiếng Việt sang văn bản đúng cú pháp VSL, đặc biệt khi khai thác các đặc trưng giản lược và trật tự cú pháp của VSL?
- H1: Phương pháp dịch dựa trên luật sẽ cung cấp một nền tảng dịch chính xác về mặt cú pháp cho VSL do khả năng tích hợp trực tiếp các quy tắc ngữ pháp đặc thù của ngôn ngữ này.
- RQ2: Làm thế nào để giải quyết vấn đề thiếu hụt dữ liệu song ngữ cho bài toán dịch Vie-VSL, và liệu một phương pháp làm giàu dữ liệu dựa trên mạng từ có thể cải thiện đáng kể chất lượng của các bộ dữ liệu này?
- H2: Phương pháp làm giàu dữ liệu dựa trên mạng từ sẽ mở rộng hiệu quả kích thước và độ đa dạng của bộ dữ liệu song ngữ Vie-VSL, từ đó nâng cao hiệu suất của các mô hình dịch máy.
- RQ3: Các mô hình dịch máy thống kê cơ bản và các mô hình dịch hiện đại dựa trên mạng nơ-ron (Seq2Seq, Transformer) có thể được cải tiến và tối ưu hóa như thế nào để đạt được hiệu suất dịch vượt trội cho bài toán Vie-VSL, ngay cả trong bối cảnh dữ liệu hạn chế?
- H3: Việc cải tiến và điều chỉnh các mô hình SMT và NMT, kết hợp với dữ liệu được làm giàu, sẽ mang lại kết quả dịch chất lượng cao hơn so với các phương pháp dịch tự động VSL hiện có.
Khung lý thuyết của luận án được xây dựng dựa trên sự tổng hợp của nhiều lý thuyết dịch máy chính, bao gồm Dịch máy dựa trên luật (Rules Based Machine Translation - RBMT) để nắm bắt các quy tắc cú pháp đặc trưng của VSL [Trang 23], Dịch máy thống kê (Statistical Machine Translation - SMT) với các mô hình kinh điển như IBM Models để học các xác suất dịch và căn chỉnh [Trang 28], và Dịch máy dựa trên mạng nơ-ron (Neural Machine Translation - NMT) sử dụng kiến trúc Seq2Seq và Transformer để tận dụng khả năng học ngữ cảnh dài và tính toán song song [Trang 31, 35]. Luận án cũng tham chiếu đến lý thuyết về Xử lý ngôn ngữ tự nhiên (Natural Language Processing - NLP) trong các kỹ thuật tiền xử lý và đánh giá dữ liệu.
Đóng góp đột phá của luận án bao gồm việc xây dựng và công bố bộ dữ liệu VSL-Lexicon và hai bộ dữ liệu song ngữ Vie-VSL10k, Vie-VSL60k [Trang 5], đây là tài nguyên chưa từng có cho cộng đồng nghiên cứu VSL. Ngoài ra, phương pháp làm giàu dữ liệu dựa trên mạng từ được đề xuất là một đóng góp đột phá, giúp mở rộng dữ liệu huấn luyện một cách có kiểm soát và tăng cường độ tin cậy của các mô hình dịch trong một ngôn ngữ ít tài nguyên. Luận án cũng chứng minh hiệu quả của việc kết hợp các phương pháp cổ điển và hiện đại, đạt được hiệu suất dịch vượt trội hơn so với các nghiên cứu trước đây (được đo bằng điểm BLEU và Perplexity).
Phạm vi của luận án tập trung vào quá trình dịch từ văn bản tiếng Việt thông thường sang dạng văn bản đúng cú pháp trong VSL. Luận án này không đi sâu vào các mô hình diễn họa 3D hay các đầu ra cuối cùng khác của ngôn ngữ ký hiệu Việt Nam, mà coi đây là một bước trung gian quan trọng đã có phương pháp giải quyết tốt [Trang 6, 17]. Nghiên cứu này có ý nghĩa quan trọng trong việc thúc đẩy giao tiếp và tiếp cận tri thức cho cộng đồng người khiếm thính tại Việt Nam, nâng cao chất lượng cuộc sống và sự hòa nhập xã hội của họ.
Literature Review và Positioning
Nghiên cứu về dịch Ngôn ngữ Ký hiệu (SL) trên thế giới đã phát triển theo hai luồng chính: dịch từ SL sang ngôn ngữ thông thường và dịch ngược lại từ ngôn ngữ thông thường sang SL [Trang 11]. Luận án này đặc biệt chú trọng vào chiều dịch từ văn bản thông thường sang SL, coi đây là bài toán "có ý nghĩa quan trọng nhằm truyền đạt thông tin, mang lại tri thức xã hội cho người khiếm thính" [Trang 11].
Các luồng nghiên cứu chính bao gồm:
- Dịch dựa trên luật (RBMT): Các nghiên cứu ban đầu về SLMT thường sử dụng mô hình dịch dựa trên cấu trúc. Tác giả Porta và cộng sự (2007) đã nghiên cứu các cách tiếp cận dựa trên chuyển giao và thuật toán tạo thứ tự từ cho Ngôn ngữ Ký hiệu Tây Ban Nha (LSE) [12]. Một nghiên cứu khác về Ngôn ngữ Ký hiệu Bồ Đào Nha cũng sử dụng kỹ thuật trích xuất thông tin nhưng có điểm yếu là "không chú trọng cú pháp ngôn ngữ ký hiệu dẫn đến việc dịch không có nhiều ý nghĩa thực tế" [13]. Kouremenos và cộng sự (2018) đã tạo ra các mô hình ngôn ngữ cho Ngôn ngữ Ký hiệu Hy Lạp với kết quả đầu ra là văn bản đúng cú pháp [14].
- Dịch máy thống kê (SMT): Phương pháp SMT cũng đã được áp dụng cho mục tiêu dịch text-to-text trong SLMT. Một dự án dịch Tiếng Anh sang ngôn ngữ ký hiệu tiếng Hà Lan (DSL) năm 2005 của Crasborn và cộng sự [15] đã sử dụng giả thuyết đánh dấu cho phân đoạn văn bản, tuy nhiên hạn chế bởi kho ngữ liệu nhỏ. Lopez và cộng sự (2012) nghiên cứu dịch Tiếng Tây Ban Nha sang LSE bằng cách tích hợp mô-đun tiền xử lý dựa trên danh sách thẻ từ [16]. Các nghiên cứu này thường chỉ áp dụng trên dữ liệu nhỏ, ảnh hưởng đến chất lượng dịch [Trang 14].
- Dịch máy dựa trên mạng nơ-ron (NMT) và học sâu (Deep Learning): Những năm gần đây, tiến bộ trong Xử lý ngôn ngữ tự nhiên (NLP) và Dịch máy (MT) đã thúc đẩy các nghiên cứu về NMT. Tác giả Manzano và cộng sự (2013) đã đạt kết quả tốt với dịch tiếng Anh sang BSL nhưng hạn chế về số lượng từ vựng [23]. Muhammad và cộng sự (2021) nghiên cứu dịch các câu sang Ngôn ngữ Ký hiệu Pakistan (PSL) với biểu diễn trực quan, nhưng "đặc điểm về cấu trúc cú pháp của PSL chưa được xem xét cụ thể" [24]. Đặc biệt, các mô hình Transformer đã cho thấy kết quả khả thi hơn [25-33]. Galina Angelova và cộng sự (2022) đã kiểm nghiệm các phương pháp và kỹ thuật NMT trên dữ liệu Ngôn ngữ Ký hiệu Đức, đạt được sự cải thiện đáng kể cho các mô hình được đào tạo [34].
Trong bối cảnh Việt Nam, các nghiên cứu về VSLMT còn rất hạn chế. Quách Luỹ Dạ và cộng sự (2018) đã đưa ra nghiên cứu dịch dựa trên từ loại cho VSL, đạt độ chính xác cao nhưng thời gian xử lý lâu [35]. Một nghiên cứu khác của nhóm này (2019) sử dụng cây quyết định để chuyển đổi câu tiếng Việt thành dạng đúng cú pháp VSL, nhưng hạn chế bởi "cơ sở dữ liệu nhỏ dẫn đến độ chính xác thấp" [36]. Đến năm 2020, nhóm tác giả này tiếp tục đánh giá thuật toán phân loại hiệu quả cho VSL nhưng vẫn là "một thử nghiệm nhỏ và chưa có các nghiên cứu sâu sắc về cú pháp của VSL" [37].
Có thể thấy những mâu thuẫn/tranh luận chính trong tài liệu hiện có là giữa phương pháp cổ điển và hiện đại:
- Phương pháp cổ điển (RBMT, SMT): Đơn giản, hiệu quả cho ngôn ngữ ít tài nguyên và có thể chú trọng cú pháp, nhưng đòi hỏi công sức xây dựng luật thủ công và bị giới hạn bởi ngữ cảnh cục bộ [Trang 23, 27].
- Phương pháp hiện đại (NMT): Tự động học đặc trưng, độ chính xác cao, khả năng mở rộng nhanh, nhưng yêu cầu bộ dữ liệu lớn và thường xem nhẹ các đặc điểm cú pháp cụ thể, đặc biệt trong ngôn ngữ ký hiệu [Trang 2, 29, 35].
Luận án này định vị mình bằng cách giải quyết trực tiếp hai vấn đề then chốt: dữ liệu hạn chế và chú trọng cú pháp VSL. So với các nghiên cứu quốc tế, luận án tập trung vào việc xây dựng bộ dữ liệu riêng cho VSL (VSL-Lexicon, Vie-VSL10k, Vie-VSL60k), điều mà các nghiên cứu như Crasborn và cộng sự (2005) [15] hay Lopez và cộng sự (2012) [16] còn gặp khó khăn do dữ liệu nhỏ. Hơn nữa, luận án tích hợp phương pháp làm giàu dữ liệu dựa trên mạng từ để khắc phục vấn đề này, một cách tiếp cận ít được đề cập trong các nghiên cứu SLMT trước đây. Về mặt cú pháp, luận án đi sâu phân tích "tính giản lược, nhấn mạnh trọng tâm và thay đổi trật tự từ so với ngôn ngữ tiếng Việt thông thường" [Trang 17] của VSL, điều mà nhiều nghiên cứu quốc tế (ví dụ: Muhammad và cộng sự, 2021 [24]) còn bỏ ngỏ.
Nghiên cứu này thúc đẩy lĩnh vực dịch máy bằng cách cung cấp một khung làm việc toàn diện cho việc dịch ngôn ngữ ký hiệu ít tài nguyên, kết hợp điểm mạnh của cả ba hướng tiếp cận dịch máy. Cụ thể, nó đề xuất một phương pháp tiếp cận hỗn hợp, nơi RBMT đặt nền tảng cho sự chính xác cú pháp, SMT cung cấp các mô hình xác suất robust, và NMT tận dụng khả năng học sâu để cải thiện hiệu suất tổng thể, đặc biệt sau khi dữ liệu được làm giàu. Đây là một bước tiến quan trọng trong việc đưa công nghệ dịch máy đến gần hơn với nhu cầu thực tế của cộng đồng người khiếm thính Việt Nam.
Đóng góp lý thuyết và khung phân tích
Đóng góp cho lý thuyết
Luận án này đóng góp đáng kể vào lý thuyết dịch máy và Xử lý Ngôn ngữ Tự nhiên (NLP) thông qua việc mở rộng và thách thức các lý thuyết hiện có trong bối cảnh ngôn ngữ ký hiệu ít tài nguyên, cụ thể là VSL.
- Mở rộng lý thuyết Dịch máy dựa trên luật (RBMT) của Hutchins & Somers (1992): Luận án chứng minh rằng, trái với xu hướng hiện đại hóa, RBMT vẫn là một phương pháp "đơn giản và hiệu quả, phù hợp với ngôn ngữ ít tài nguyên như ngôn ngữ ký hiệu" [Trang 13]. Bằng cách phân tích sâu sắc các đặc điểm cú pháp của VSL như tính giản lược giới từ, liên từ, từ tình thái, và sự thay đổi trật tự từ (danh từ-số từ, động từ-phủ định, câu nghi vấn, câu mệnh lệnh) [Trang 9-10], luận án đã phát triển một tập hợp luật chuyển đổi cụ thể. Điều này mở rộng ứng dụng của RBMT, chứng tỏ nó không chỉ là một phương pháp "cổ điển" mà còn là một giải pháp tối ưu cho các ngôn ngữ có ngữ pháp đặc trưng và dữ liệu hạn chế, một khía cạnh mà các mô hình thống kê hoặc mạng nơ-ron đôi khi bỏ qua hoặc khó học được từ dữ liệu.
- Mở rộng lý thuyết Dịch máy thống kê (SMT) của Brown et al. (1993): Luận án cải tiến mô hình IBM, một nền tảng của SMT, bằng cách tối ưu hóa nó cho bài toán dịch Vie-VSL trong môi trường dữ liệu nhỏ [Trang 5, 29]. Việc này bao gồm xử lý vấn đề căn chỉnh từ và xác suất dịch trong bối cảnh VSL có cấu trúc cú pháp khác biệt so với tiếng Việt. Đóng góp này chứng minh rằng các mô hình SMT cơ bản vẫn có thể được điều chỉnh và nâng cao hiệu quả khi đối mặt với những thách thức cụ thể của một cặp ngôn ngữ độc đáo.
- Thách thức lý thuyết về hiệu quả của Dịch máy dựa trên mạng nơ-ron (NMT) trong môi trường dữ liệu ít: Mặc dù NMT (Seq2Seq, Transformer) của Sutskever et al. (2014) và Vaswani et al. (2017) được biết đến với khả năng học từ dữ liệu lớn, luận án đã thách thức quan điểm này bằng cách phát triển một phương pháp làm giàu dữ liệu dựa trên mạng từ để cải thiện hiệu suất NMT trên dữ liệu Vie-VSL hạn chế [Trang 5]. Điều này cho thấy rằng với các kỹ thuật tiền xử lý và tăng cường dữ liệu sáng tạo, NMT vẫn có thể được áp dụng thành công cho các ngôn ngữ ít tài nguyên, mở ra hướng nghiên cứu mới về NMT trong bối cảnh này.
- Phát triển khung lý thuyết về làm giàu dữ liệu ngôn ngữ ký hiệu: Phương pháp làm giàu dữ liệu dựa trên mạng từ là một đóng góp lý thuyết độc đáo, cung cấp một khuôn khổ để tăng cường dữ liệu song ngữ cho các ngôn ngữ ký hiệu, nơi việc thu thập dữ liệu là vô cùng khó khăn. Phương pháp này không chỉ đơn thuần là tăng số lượng dữ liệu mà còn đảm bảo tính hợp lệ về mặt ngữ nghĩa và cú pháp thông qua việc sử dụng cấu trúc phân cấp trong WordNet và tiêu chuẩn Synset [Chương 4, không chi tiết trong văn bản nhưng đề cập làm giàu dữ liệu].
Khung khái niệm của luận án được xây dựng trên ba thành phần chính: Đặc trưng cú pháp VSL, Các mô hình dịch máy, và Phương pháp làm giàu dữ liệu. Các mối quan hệ bao gồm: (1) Đặc trưng cú pháp VSL định hướng việc xây dựng luật cho RBMT và tối ưu hóa các mô hình SMT/NMT; (2) Phương pháp làm giàu dữ liệu cung cấp nền tảng dữ liệu mạnh mẽ hơn cho SMT và NMT; (3) Các mô hình dịch máy được đánh giá và cải tiến dựa trên cả sự hiểu biết cú pháp và chất lượng dữ liệu.
Mô hình lý thuyết đề xuất bao gồm các giả thuyết sau:
- P1: Việc tích hợp các luật cú pháp VSL cụ thể (ví dụ, lược bỏ giới từ/liên từ [Trang 9], trật tự câu nghi vấn [Trang 8]) vào hệ thống RBMT sẽ dẫn đến bản dịch có độ chính xác cú pháp cao hơn so với các mô hình không dựa trên luật.
- P2: Phương pháp làm giàu dữ liệu dựa trên mạng từ sẽ làm giảm chỉ số Perplexity của ngữ liệu Vie-VSL, qua đó cải thiện khả năng học của các mô hình SMT và NMT.
- P3: Các cải tiến đối với mô hình IBM (ví dụ, tối ưu hóa xác suất dịch) và kiến trúc NMT (ví dụ, điều chỉnh siêu tham số, sử dụng LSTM/Transformer) sẽ dẫn đến điểm BLEU cao hơn trên tập kiểm tra Vie-VSL.
Luận án này không chỉ mở rộng các lý thuyết dịch máy hiện có mà còn có tiềm năng tạo ra một "paradigm shift" trong cách tiếp cận dịch máy cho các ngôn ngữ ký hiệu ít tài nguyên. Bằng cách chứng minh rằng sự kết hợp linh hoạt giữa các phương pháp cổ điển (dựa trên cấu trúc) và hiện đại (dựa trên thống kê và mạng nơ-ron), cùng với các kỹ thuật làm giàu dữ liệu sáng tạo, có thể giải quyết được những thách thức tưởng chừng như không thể vượt qua, luận án mở ra một hướng mới cho nghiên cứu SLMT trên toàn thế giới.
Khung phân tích độc đáo
Khung phân tích của luận án thể hiện sự tích hợp độc đáo của các lý thuyết dịch máy để giải quyết vấn đề VSLMT. Luận án không chỉ áp dụng riêng lẻ một lý thuyết mà còn kết hợp chúng một cách chiến lược:
- Dịch dựa trên luật (RBMT) của Hutchins & Somers (1992): Được sử dụng để nắm bắt các đặc điểm cú pháp độc đáo của VSL, như đã phân tích về tính giản lược và trật tự từ [Trang 8-10]. Điều này là cần thiết để đảm bảo tính đúng cú pháp của đầu ra VSL, một khía cạnh mà các mô hình thống kê hoặc mạng nơ-ron có thể khó học được từ dữ liệu hạn chế.
- Dịch máy thống kê (SMT) của Brown et al. (1993): Cụ thể là các mô hình IBM (IBM 1, IBM 2, IBM 3) được cải tiến để xử lý các vấn đề căn chỉnh từ và xác suất dịch trong bối cảnh Vie-VSL [Trang 28-29]. SMT cung cấp một cách tiếp cận dựa trên dữ liệu để học các mối quan hệ thống kê giữa các cặp câu, bổ trợ cho sự cứng nhắc của các luật.
- Dịch máy dựa trên mạng nơ-ron (NMT) với Seq2Seq (Sutskever et al., 2014) và Transformer (Vaswani et al., 2017): Các kiến trúc này được triển khai và tối ưu hóa để học các biểu diễn ngữ cảnh phức tạp và các mối quan hệ phụ thuộc xa giữa các từ trong câu Vie-VSL, tận dụng khả năng tính toán song song và cơ chế self-attention [Trang 31, 35].
Cách tiếp cận phân tích này là mới lạ vì nó không chỉ đơn thuần là áp dụng các mô hình hiện có mà còn điều chỉnh chúng để phù hợp với đặc điểm ngôn ngữ ký hiệu ít tài nguyên và có cấu trúc riêng biệt. Ví dụ, thay vì chỉ dựa vào dữ liệu để NMT tự động học cú pháp VSL (thường thất bại với dữ liệu ít), luận án bổ sung một lớp RBMT mạnh mẽ để "cố định" các quy tắc cú pháp cơ bản. Điều này tạo ra một hệ thống dịch lai mạnh mẽ hơn.
Các đóng góp khái niệm cụ thể của luận án bao gồm:
- "Dạng văn bản đúng cú pháp trong VSL" (Syntactically Correct VSL Text): Đây là một khái niệm trung tâm, được định nghĩa là dạng văn bản VSL đã được lược bỏ các thành phần không cần thiết (giới từ, liên từ, từ tình thái) và có trật tự từ được điều chỉnh để phù hợp với đặc điểm tư duy và biểu đạt của người khiếm thính Việt Nam [Trang 2, 6, 8-10]. Định nghĩa này khác biệt so với việc chỉ dịch từng từ hoặc cụm từ mà không xem xét cấu trúc câu tổng thể.
- "Phương pháp làm giàu dữ liệu dựa trên mạng từ" (Word Network-Based Data Enrichment): Được định nghĩa là một quy trình tạo ra các cặp câu song ngữ Vie-VSL mới, hợp lệ về ngữ nghĩa và cú pháp, bằng cách khai thác mối quan hệ giữa các từ trong mạng từ điển VSL-Lexicon và WordNet để mở rộng kho ngữ liệu ban đầu.
Các điều kiện biên được nêu rõ: Luận án tập trung vào việc dịch văn bản sang văn bản và không xử lý các khía cạnh biểu diễn hình ảnh, video hay mô hình 3D của ngôn ngữ ký hiệu. Phạm vi đầu vào là các câu tiếng Việt thông thường và đầu ra là dạng văn bản đúng cú pháp trong VSL [Trang 6]. Điều này có nghĩa là các đặc điểm phi ngôn ngữ như biểu cảm khuôn mặt hay chuyển động cơ thể, dù quan trọng trong SL thực tế [Trang 8-9], không phải là trọng tâm trực tiếp của luận án mà được ngụ ý trong "dạng văn bản đúng cú pháp".
Phương pháp nghiên cứu tiên tiến
Thiết kế nghiên cứu
Luận án áp dụng một triết lý nghiên cứu thực dụng (Pragmatism), kết hợp các yếu tố từ cả chủ nghĩa hậu thực chứng (Post-positivism) và chủ nghĩa kiến tạo (Constructivism). Điều này thể hiện qua việc sử dụng các phương pháp định lượng nghiêm ngặt (đánh giá bằng BLEU, Perplexity) để kiểm định các giả thuyết về hiệu suất mô hình, đồng thời thừa nhận tính đặc thù và bản chất được cộng đồng kiến tạo của ngôn ngữ ký hiệu Việt Nam (VSL) thông qua việc tập trung vào "dạng đúng cú pháp" và sự tham gia của các chuyên gia ngôn ngữ (TS Vũ Thị Hải Hà – Viện Ngôn ngữ học) trong việc xây dựng dữ liệu [Trang ii].
Thiết kế nghiên cứu sử dụng phương pháp hỗn hợp (Mixed Methods), kết hợp các cách tiếp cận định tính (phân tích đặc điểm cú pháp VSL để xây dựng luật) với định lượng (huấn luyện và đánh giá mô hình dịch máy). Sự kết hợp này mang lại cái nhìn toàn diện: các luật dựa trên cấu trúc cung cấp tính đúng đắn ngữ pháp, trong khi các mô hình thống kê và mạng nơ-ron học các mối quan hệ phức tạp từ dữ liệu. Lý do cho sự kết hợp này là để khắc phục hạn chế của từng phương pháp khi áp dụng cho một ngôn ngữ ít tài nguyên như VSL: RBMT cứng nhắc nhưng chính xác cú pháp; SMT/NMT linh hoạt nhưng đòi hỏi dữ liệu và có thể bỏ qua các đặc tính cú pháp nếu không được huấn luyện đúng cách [Trang 2, 27, 35].
Thiết kế nghiên cứu không trực tiếp là multi-level design nhưng có thể được hiểu là multi-stage: từ phân tích ngôn ngữ học cơ bản, xây dựng dữ liệu cấp độ từ và câu, đến triển khai mô hình cấp độ hệ thống và đánh giá tổng thể.
Kích thước mẫu (sample size) bao gồm:
- VSL-Lexicon: Từ điển ngôn ngữ ký hiệu Việt Nam, chứa các từ/cụm từ và mô hình 3D biểu diễn trực quan [Trang 5, 17]. Chi tiết cụ thể về số lượng mục từ không được nêu rõ nhưng đủ để xây dựng bộ dữ liệu song ngữ.
- Vie-VSL10k: Bộ dữ liệu song ngữ tiếng Việt – VSL ban đầu, gồm 10.000 cặp câu [Trang 5].
- Vie-VSL60k: Bộ dữ liệu song ngữ tiếng Việt – VSL được làm giàu, gồm 60.000 cặp câu, được phát triển từ Vie-VSL10k [Trang 5]. Các bộ dữ liệu này được công bố cho cộng đồng nghiên cứu sử dụng. Khung thời gian nghiên cứu bao trùm giai đoạn luận án được hoàn thành (năm 2023), phản ánh các tiến bộ gần đây nhất trong MT và NLP.
Quy trình nghiên cứu rigorous
Chiến lược lấy mẫu (sampling strategy) cho việc xây dựng bộ dữ liệu Vie-VSL10k và Vie-VSL60k dựa trên việc thu thập các cặp câu hoặc văn bản tiếng Việt và tương ứng trong VSL, đảm bảo tính đa dạng về ngữ cảnh và chủ đề [Trang 4]. Quá trình này được hỗ trợ bởi chuyên gia ngôn ngữ học. Tiêu chí bao gồm:
- Inclusion criteria: Câu tiếng Việt thông thường có thể chuyển đổi sang dạng đúng cú pháp VSL, phản ánh các đặc điểm cú pháp VSL đã được phân tích.
- Exclusion criteria: Các câu quá phức tạp, đa nghĩa mà không có cách biểu đạt rõ ràng trong VSL ở cấp độ văn bản, hoặc các câu không thể căn chỉnh ngữ nghĩa/cú pháp.
Giao thức thu thập dữ liệu (data collection protocols) bao gồm:
- Xây dựng VSL-Lexicon: Thu thập các từ vựng và chú giải bằng mô hình 3D, đóng vai trò là "từ điển" cho quá trình dịch [Trang 5, 17].
- Xây dựng Vie-VSL10k: Thu thập các cặp câu song ngữ tiếng Việt - VSL ban đầu. Luận án không nêu rõ quy trình thu thập chi tiết (ví dụ: từ người khiếm thính, từ các tài liệu VSL có sẵn) nhưng khẳng định đã xây dựng bộ dữ liệu này.
- Làm giàu dữ liệu Vie-VSL60k: Áp dụng "phương pháp làm giàu dữ liệu dựa trên mạng từ" [Trang 5] trên Vie-VSL10k để tạo ra Vie-VSL60k. Phương pháp này bao gồm việc sử dụng cấu trúc phân cấp trong WordNet và tiêu chuẩn Synset để sinh dữ liệu mới, đảm bảo tính hợp lệ về ngữ nghĩa và cú pháp [Chương 4].
Tam giác hóa (Triangulation) được áp dụng qua:
- Triangulation phương pháp (Method Triangulation): Kết hợp RBMT, SMT và NMT để đánh giá cùng một bài toán dịch.
- Triangulation dữ liệu (Data Triangulation): Sử dụng các bộ dữ liệu có kích thước và nguồn gốc khác nhau (Vie-VSL10k và Vie-VSL60k) để huấn luyện và kiểm định mô hình.
Độ tin cậy và giá trị được đảm bảo:
- Giá trị xây dựng (Construct Validity): Các khái niệm như "dạng đúng cú pháp trong VSL" được định nghĩa rõ ràng và nhất quán trong toàn bộ luận án, với bằng chứng từ phân tích đặc điểm cú pháp [Trang 8-10].
- Giá trị nội bộ (Internal Validity): Các thực nghiệm được thiết kế để kiểm soát các biến ngoại lai, đảm bảo rằng các cải tiến trong mô hình thực sự là do phương pháp đề xuất (ví dụ: so sánh hiệu suất trước và sau khi làm giàu dữ liệu).
- Giá trị bên ngoài (External Validity/Generalizability): Kết quả được đánh giá trên các tập kiểm tra độc lập và so sánh với các nghiên cứu quốc tế để ước lượng khả năng khái quát hóa. Tuy nhiên, luận án cũng thận trọng thừa nhận các điều kiện biên về context/sample/time.
- Độ tin cậy (Reliability): Việc sử dụng các độ đo tự động như BLEU và Perplexity với các công thức tính toán minh bạch [Trang 39-40] cho phép các nghiên cứu khác có thể tái tạo kết quả và kiểm chứng độ tin cậy của mô hình. Giá trị α (alpha values) không được nêu cụ thể nhưng ngụ ý trong việc sử dụng các công cụ đánh giá chuẩn.
Data và phân tích
Đặc điểm mẫu dữ liệu được trình bày chi tiết:
- VSL-Lexicon: Từ điển VSL với các mục từ/cụm từ và mô hình 3D biểu diễn.
- Vie-VSL10k và Vie-VSL60k: Các bộ dữ liệu song ngữ tiếng Việt - VSL. Luận án không cung cấp số liệu thống kê chi tiết về demographics của người tạo dữ liệu hay các đặc tính ngôn ngữ cụ thể trong bộ dữ liệu (như độ dài câu trung bình, phân phối từ loại) nhưng khẳng định "phản ánh đa dạng về ngữ cảnh và chủ đề" [Trang 4]. Bảng thống kê về dữ liệu câu tiếng Việt trong Vie-VSL-10k [Bảng 2] và các từ được rút gọn [Bảng 1] đã được cung cấp.
Các kỹ thuật phân tích tiên tiến được sử dụng:
- Mô hình IBM (IBM 1, IBM 2, IBM 3): Được sử dụng và cải tiến trong SMT để học xác suất dịch và căn chỉnh từ [Trang 28].
- Mô hình Sequence to Sequence (Seq2Seq): Sử dụng kiến trúc encoder-decoder với các mạng RNN (LSTM/GRU) để học biểu diễn trình tự [Trang 31].
- Mô hình Transformer: Với cơ chế self-attention và khả năng xử lý song song, được triển khai để giải quyết vấn đề phụ thuộc xa và tốc độ huấn luyện [Trang 35].
- Các phần mềm/công cụ được sử dụng bao gồm: các framework học sâu như TensorFlow hoặc PyTorch (ngụ ý từ việc sử dụng Seq2Seq, Transformer), công cụ PARSE để phân tích cây cú pháp [Hình 3.2], và công cụ ELAN cho chú thích ngôn ngữ ký hiệu (tham khảo từ nghiên cứu khác [15]).
Các kiểm tra robustness (robustness checks) được thực hiện bằng cách so sánh hiệu suất của các mô hình khác nhau (RBMT, SMT, NMT) và trên các bộ dữ liệu khác nhau (Vie-VSL10k vs. Vie-VSL60k) để đảm bảo tính ổn định và độ tin cậy của kết quả. Các kết quả thực nghiệm được đánh giá bằng điểm BLEU và Perplexity [Trang 5, 39-40], với việc báo cáo effect sizes (thể hiện mức độ cải thiện) và confidence intervals (ngụ ý thông qua các thực nghiệm và so sánh thống kê).
Phát hiện đột phá và implications
Những phát hiện then chốt
Luận án đã đạt được 4-5 phát hiện đột phá với bằng chứng cụ thể từ dữ liệu:
- Phát hiện 1: RBMT vẫn là phương án dịch hiệu quả và phù hợp cho VSL, đặc biệt về độ chính xác cú pháp.
- Evidence: "Đề xuất một phương án dịch đơn giản và hiệu quả cho bài toán sử dụng mô hình dịch dựa trên luật. Tuy là một phương pháp cổ điển nhưng phù hợp với bài toán đặt ra." [Trang 5]. Các thực nghiệm trên RBMT đã đạt được "điểm BLEU trung bình trên các tập kiểm tra" nhất định [Bảng 3.2, Bảng 3.3, Bảng 3.4], chứng tỏ khả năng dịch chính xác các câu có cấu trúc đơn giản, nắm bắt được các đặc trưng giản lược giới từ, liên từ, từ tình thái (ví dụ: "Viết bằng bút chì" -> "Viết bút chì" [Bảng 1]). So với phương pháp thống kê cổ điển, RBMT có thể cung cấp một nền tảng dịch chính xác cú pháp ban đầu.
- Phát hiện 2: Phương pháp làm giàu dữ liệu dựa trên mạng từ cải thiện đáng kể chất lượng ngữ liệu và hiệu suất mô hình.
- Evidence: "Đề xuất một phương pháp làm giàu dữ liệu dựa trên mạng từ cho dữ liệu song ngữ câu tiếng Việt – câu đúng cú pháp trong VSL." [Trang 5]. Kết quả thực nghiệm cho thấy "chỉ số Perplexity đối với các kho ngữ liệu đã xây dựng" [Bảng 4.2] đã giảm đáng kể sau khi làm giàu, ngụ ý chất lượng ngôn ngữ học tốt hơn. Hơn nữa, "So sánh điểm BLEU trên một số mô hình dịch giữa dữ liệu gốc và dữ liệu làm giàu" [Bảng 5.4] cho thấy hiệu suất dịch được nâng cao rõ rệt khi sử dụng dữ liệu Vie-VSL60k so với Vie-VSL10k. Điều này giải quyết vấn đề "dữ liệu huấn luyện hệ thống có thể gây ảnh hưởng đến chất lượng dịch" [Trang 14].
- Phát hiện 3: Mô hình Transformer và Seq2Seq, khi được tối ưu hóa và huấn luyện trên dữ liệu làm giàu, đạt hiệu suất dịch vượt trội so với các phương pháp trước đây cho VSL.
- Evidence: "Cải tiến một mô hình dịch thống kê cơ bản và một số mô hình dịch hiện đại dựa trên mạng Noron cho bài toán." [Trang 5]. Các bảng kết quả thực nghiệm trong Chương 5 (ví dụ, "So sánh điểm BLEU trên một số mô hình dịch giữa dữ liệu gốc và dữ liệu làm giàu" [Bảng 5.4], "Tham chiếu điểm BLEU trên bài toán dịch ngôn ngữ ký hiệu khác" [Bảng 5.5]) minh chứng rằng các mô hình NMT đã cải thiện điểm BLEU lên mức cao nhất, vượt qua RBMT và SMT đơn thuần. Đặc biệt, "mô hình Transformer cho bài toán dịch" [Chương 5] đã tận dụng tốt khả năng học các mối quan hệ xa và xử lý ngữ cảnh tổng thể, điều mà "mô hình Seq2Seq có thể gặp khó khăn trong việc xử lý các chuỗi dài" [Trang 34].
- Phát hiện 4: Sự tồn tại và cần thiết của bộ dữ liệu VSL-Lexicon, Vie-VSL10k và Vie-VSL60k là yếu tố then chốt cho sự phát triển của VSLMT.
- Evidence: "Luận án đã xây dựng các bộ dữ liệu: từ điển ngôn ngữ ký hiệu Việt Nam VSL-Lexicon; dữ liệu “song ngữ” Vie-VSL10k, Vie-VSL60k công bố cho cộng đồng nghiên cứu sử dụng." [Trang 5]. Phát hiện này là trực tiếp vì "Đối với bài toán dịch VSL, hiện chưa có một cơ sở dữ liệu nào được công bố cho cộng đồng nghiên cứu" [Trang 17]. Việc xây dựng các bộ dữ liệu này là một thành tựu quan trọng, cung cấp nền tảng vật chất cho mọi nghiên cứu VSLMT trong tương lai.
Một kết quả đáng chú ý có thể là việc nhận ra rằng các mô hình NMT thuần túy ban đầu có thể không đạt hiệu suất tối ưu khi thiếu dữ liệu VSL chuyên biệt, điều này thách thức giả định về sự ưu việt tuyệt đối của Deep Learning mà không cần điều chỉnh cho ngôn ngữ ít tài nguyên. Kết quả này so sánh với các nghiên cứu trước đây như của Quách Luỹ Dạ và cộng sự (2019) [36] cho thấy rằng với việc làm giàu dữ liệu và cải tiến mô hình, độ chính xác dịch của VSL có thể được nâng cao đáng kể, vượt qua "độ chính xác thấp" đã được ghi nhận.
Implications đa chiều
- Theoretical advances:
- Contribution to RBMT theory: Chứng minh tính phù hợp và hiệu quả của RBMT cho các ngôn ngữ ký hiệu ít tài nguyên và có cấu trúc đặc thù, mở rộng phạm vi ứng dụng của lý thuyết này ngoài các ngôn ngữ nói phổ biến.
- Contribution to Data Augmentation theories: Đề xuất một phương pháp làm giàu dữ liệu dựa trên mạng từ mới, cung cấp một khuôn khổ để tạo ra dữ liệu song ngữ chất lượng cao cho các ngôn ngữ ít tài nguyên khác, vượt qua hạn chế của việc thu thập dữ liệu thủ công.
- Contribution to NMT adaptation: Cung cấp bằng chứng thực nghiệm về cách NMT (Seq2Seq, Transformer) có thể được điều chỉnh và tối ưu hóa để đạt hiệu suất cao trong môi trường dữ liệu hạn chế, thông qua chiến lược làm giàu dữ liệu tích hợp.
- Methodological innovations:
- Phương pháp làm giàu dữ liệu dựa trên mạng từ có thể được áp dụng trong các ngữ cảnh khác để giải quyết vấn đề thiếu dữ liệu trong NLP, ví dụ như dịch máy cho các ngôn ngữ bản địa, xử lý ngôn ngữ y tế chuyên biệt, hoặc bất kỳ lĩnh vực nào có dữ liệu song ngữ khan hiếm.
- Cách tiếp cận kết hợp RBMT-SMT-NMT chứng minh một khung làm việc robust để phát triển hệ thống dịch cho các ngôn ngữ phức tạp mà không cần dựa hoàn toàn vào dữ liệu khổng lồ.
- Practical applications:
- Ứng dụng thực tiễn: Hệ thống dịch VSLMT đề xuất có thể được tích hợp vào các ứng dụng di động, website hoặc thiết bị hỗ trợ để dịch nhanh chóng văn bản tiếng Việt sang VSL, tạo điều kiện giao tiếp giữa người khiếm thính và cộng đồng nói. Các khuyến nghị bao gồm phát triển API dịch VSL và tích hợp vào các nền tảng truyền thông số.
- Policy recommendations:
- Chính sách giáo dục: Kết quả nghiên cứu cung cấp bằng chứng cho việc đầu tư vào phát triển công nghệ hỗ trợ giáo dục cho người khiếm thính, khuyến khích các chương trình giảng dạy sử dụng VSL và tích hợp công nghệ dịch thuật để tiếp cận kiến thức.
- Chính sách xã hội: Thúc đẩy chính sách hỗ trợ phát triển các tài nguyên ngôn ngữ cho cộng đồng người khiếm thính, bao gồm từ điển điện tử VSL, kho ngữ liệu công cộng, và các dự án nghiên cứu liên quan đến SLP. Pathway triển khai có thể thông qua các đề án của Bộ Giáo dục và Đào tạo, Bộ Khoa học và Công nghệ.
- Generalizability conditions:
- Các phát hiện về hiệu quả của RBMT cho cú pháp đặc trưng có thể khái quát hóa cho các ngôn ngữ ký hiệu khác có tính giản lược và trật tự từ khác biệt so với ngôn ngữ nói.
- Phương pháp làm giàu dữ liệu có thể áp dụng cho các cặp ngôn ngữ nói-ký hiệu hoặc ngôn ngữ nói-nói khác có dữ liệu song ngữ hạn chế.
- Hiệu suất của NMT phụ thuộc vào chất lượng của dữ liệu làm giàu và mức độ tinh chỉnh siêu tham số, đòi hỏi sự điều chỉnh cụ thể cho từng cặp ngôn ngữ.
Limitations và Future Research
Luận án này thừa nhận một số hạn chế cụ thể:
- Hạn chế về phạm vi đầu ra: Nghiên cứu chỉ tập trung vào việc dịch từ văn bản tiếng Việt sang "dạng văn bản đúng cú pháp trong VSL" mà không mở rộng sang các biểu diễn trực quan (hình ảnh, video, mô hình 3D) [Trang 6]. Điều này bỏ qua một phần quan trọng của trải nghiệm ngôn ngữ ký hiệu thực tế, vốn bao gồm các yếu tố phi thủ công và biểu cảm khuôn mặt.
- Hạn chế về bộ dữ liệu: Mặc dù đã xây dựng và làm giàu bộ dữ liệu Vie-VSL60k, kích thước này vẫn có thể chưa đủ lớn để khai thác tối đa tiềm năng của các mô hình NMT phức tạp trong mọi ngữ cảnh và chủ đề. Các bộ dữ liệu quốc tế như PHOENIX14T (DGS) chứa 8257 trình tự [Trang 17], trong khi Vie-VSL60k có 60.000 cặp câu là một bước tiến nhưng vẫn có thể cần thêm sự mở rộng.
- Hạn chế về đánh giá: Việc đánh giá chất lượng bản dịch chủ yếu dựa trên các độ đo tự động như BLEU và Perplexity [Trang 4, 39-40]. Mặc dù hiệu quả, các độ đo này không hoàn toàn nắm bắt được "độ tự nhiên" hay "sự chấp nhận trong cộng đồng người khiếm thính" [Trang 2], vốn là yếu tố quan trọng trong SLMT.
- Hạn chế về các khía cạnh ngôn ngữ học phức tạp: Luận án đã phân tích sâu các đặc điểm cú pháp như giản lược và trật tự từ [Trang 8-10], nhưng có thể chưa bao gồm đầy đủ các sắc thái ngữ nghĩa, thành ngữ, hoặc sự đa dạng vùng miền của VSL (Hà Nội, Hải Phòng, TP.HCM) [Trang 7].
Các điều kiện biên về context/sample/time: Các kết quả chủ yếu được kiểm định trong bối cảnh VSL và tiếng Việt. Việc khái quát hóa sang các ngôn ngữ ký hiệu khác hoặc các cặp ngôn ngữ khác có thể cần thêm các nghiên cứu điều chỉnh. Mẫu dữ liệu dù được làm giàu nhưng vẫn còn giới hạn về độ bao phủ ngữ nghĩa.
Agenda nghiên cứu trong tương lai với 4-5 hướng cụ thể:
- Mở rộng bộ dữ liệu và đa dạng hóa nguồn dữ liệu: Tiếp tục xây dựng và làm giàu bộ dữ liệu Vie-VSL, bao gồm các ngữ cảnh chuyên biệt hơn (y tế, giáo dục, pháp luật) và các biến thể vùng miền của VSL, có thể thông qua crowdsourcing hoặc hợp tác với cộng đồng người khiếm thính.
- Tích hợp các yếu tố phi thủ công: Mở rộng nghiên cứu để xử lý đầu ra trực quan của VSL (mô hình 3D, video), kết hợp các yếu tố phi thủ công như biểu cảm khuôn mặt, chuyển động đầu, và ánh mắt vào quy trình dịch để tạo ra bản dịch toàn diện và tự nhiên hơn.
- Phát triển phương pháp đánh giá tổng thể: Triển khai các phương pháp đánh giá bán tự động hoặc thủ công có sự tham gia của người khiếm thính và chuyên gia ngôn ngữ ký hiệu để đánh giá chính xác hơn độ tự nhiên và khả năng chấp nhận của bản dịch, bổ sung cho điểm BLEU.
- Nghiên cứu mô hình dịch đa phương thức: Khám phá các mô hình dịch đa phương thức (multimodal machine translation) để xử lý trực tiếp từ giọng nói/video tiếng Việt sang video/mô hình 3D VSL, bỏ qua bước trung gian "văn bản đúng cú pháp trong VSL" hoặc tích hợp nó vào một quy trình end-to-end.
- Ứng dụng học tăng cường (Reinforcement Learning) hoặc học ít mẫu (Few-shot Learning): Để tối ưu hóa các mô hình dịch trong môi trường dữ liệu ít, đặc biệt cho các cặp ngôn ngữ ký hiệu khác cũng bị hạn chế dữ liệu.
Các cải tiến phương pháp luận được đề xuất bao gồm việc tinh chỉnh các quy tắc RBMT để bao phủ nhiều trường hợp cú pháp phức tạp hơn, phát triển các thuật toán làm giàu dữ liệu thông minh hơn có khả năng tạo ra các cấu trúc câu phức tạp và đa dạng ngữ nghĩa. Các mở rộng lý thuyết có thể bao gồm việc phát triển một lý thuyết dịch máy hỗn hợp (hybrid MT theory) chuyên biệt cho các ngôn ngữ ký hiệu, tích hợp chặt chẽ các đặc điểm ngôn ngữ học và các mô hình học máy.
Tác động và ảnh hưởng
Luận án này được kỳ vọng sẽ tạo ra tác động và ảnh hưởng sâu rộng trên nhiều mặt:
- Academic impact: Luận án là một công trình tiên phong trong lĩnh vực dịch tự động Ngôn ngữ Ký hiệu Việt Nam, một chủ đề còn rất ít được nghiên cứu. Việc xây dựng và công bố bộ dữ liệu VSL-Lexicon, Vie-VSL10k, Vie-VSL60k là một đóng góp học thuật cơ bản, cung cấp tài nguyên thiết yếu cho các nghiên cứu tiếp theo về VSLMT và Xử lý Ngôn ngữ Ký hiệu (SLP) tại Việt Nam và khu vực. Ước tính số lượt trích dẫn tiềm năng cho các công trình liên quan đến dữ liệu và phương pháp làm giàu dữ liệu có thể đạt từ 50-100 lượt trong 5 năm tới, do tính chất hiếm có của tài nguyên này. Các đóng góp lý thuyết về tích hợp RBMT, SMT, NMT cho ngôn ngữ ít tài nguyên cũng sẽ mở ra các hướng nghiên cứu mới trong cộng đồng NLP toàn cầu. Luận án đã công bố 7 công trình khoa học [CT1-CT7] liên quan đến các đóng góp chính.
- Industry transformation: Các phương pháp và mô hình dịch được phát triển trong luận án có tiềm năng chuyển đổi ngành công nghệ thông tin và truyền thông. Cụ thể, nó có thể thúc đẩy sự phát triển của các công ty công nghệ tạo ra ứng dụng hỗ trợ người khiếm thính, các thiết bị dịch thuật thời gian thực, hoặc các công cụ giao tiếp số. Các ngành giáo dục và y tế sẽ là những lĩnh vực được hưởng lợi lớn nhất từ các công cụ dịch thuật này, cải thiện khả năng tiếp cận thông tin và dịch vụ cho người khiếm thính. Ví dụ, việc tạo ra các phần mềm dịch tự động giúp người khiếm thính dễ dàng tiếp cận các nội dung trực tuyến, hội nghị, hoặc các khóa học.
- Policy influence: Các kết quả của luận án cung cấp bằng chứng khoa học vững chắc để các nhà hoạch định chính sách có thể đưa ra các quyết định liên quan đến hỗ trợ cộng đồng người khiếm thính. Nó có thể ảnh hưởng đến chính sách cấp chính phủ (ví dụ: Bộ Khoa học và Công nghệ, Bộ Giáo dục và Đào tạo, Bộ Lao động - Thương binh và Xã hội) trong việc đầu tư vào nghiên cứu và phát triển công nghệ hỗ trợ người khuyết tật, ban hành các quy định về tiếp cận thông tin, và thúc đẩy việc chuẩn hóa ngôn ngữ ký hiệu.
- Societal benefits: Tác động xã hội của luận án là vô cùng to lớn. Bằng cách phá vỡ rào cản ngôn ngữ, nó giúp hàng trăm nghìn người khiếm thính tại Việt Nam có cơ hội truyền đạt thông điệp, tham gia đầy đủ hơn vào xã hội, học tập và làm việc một cách dễ dàng và hiệu quả hơn. Điều này không chỉ nâng cao chất lượng cuộc sống của họ mà còn thúc đẩy sự hiểu biết và hòa nhập trong cộng đồng. Lợi ích có thể được định lượng gián tiếp qua việc tăng tỷ lệ người khiếm thính tham gia giáo dục đại học, tăng cơ hội việc làm, và giảm khoảng cách giao tiếp trong các dịch vụ công.
- International relevance: Vấn đề dịch ngôn ngữ ký hiệu không chỉ là vấn đề cấp thiết tại Việt Nam mà còn trên toàn thế giới, đặc biệt đối với các ngôn ngữ ký hiệu ít tài nguyên [Trang 2]. Phương pháp làm giàu dữ liệu và cách tiếp cận tích hợp các mô hình dịch máy cổ điển-hiện đại có thể được áp dụng và điều chỉnh cho các ngôn ngữ ký hiệu khác trên toàn cầu, ví dụ như ngôn ngữ ký hiệu của các quốc gia đang phát triển hoặc các ngôn ngữ ký hiệu địa phương. Điều này giúp nâng cao vai trò của Việt Nam trong nghiên cứu SLMT quốc tế.
Đối tượng hưởng lợi
Luận án này mang lại lợi ích cụ thể cho nhiều đối tượng khác nhau:
- Doctoral researchers: Luận án cung cấp một nguồn tài nguyên học thuật phong phú, đặc biệt là bộ dữ liệu VSL-Lexicon, Vie-VSL10k, Vie-VSL60k, giúp các nghiên cứu sinh trong lĩnh vực NLP, MT, và SLP tại Việt Nam và quốc tế có sẵn dữ liệu để bắt đầu hoặc mở rộng nghiên cứu của họ. Nó cũng chỉ ra các "research gaps" cụ thể và "future research agenda" [Trang 97] để các nghiên cứu sinh tiếp tục phát triển. Cụ thể, các nhà nghiên cứu có thể tiếp tục khám phá các phương pháp làm giàu dữ liệu mới hoặc tích hợp các yếu tố thị giác vào hệ thống dịch. Ước tính lợi ích: Giảm hàng trăm giờ công sức thu thập và tiền xử lý dữ liệu cho mỗi nghiên cứu sinh.
- Senior academics: Các nhà khoa học cấp cao trong lĩnh vực khoa học máy tính và ngôn ngữ học sẽ tìm thấy các đóng góp lý thuyết quan trọng trong luận án, đặc biệt là cách luận án mở rộng và thách thức các lý thuyết MT hiện có cho bối cảnh ngôn ngữ ký hiệu ít tài nguyên. Họ có thể sử dụng khung phân tích và các kết quả của luận án để phát triển các mô hình lý thuyết tổng quát hơn cho dịch máy đa ngôn ngữ và đa phương thức. Ước tính lợi ích: Góp phần thúc đẩy các hướng nghiên cứu mới, dẫn đến các công bố khoa học và hợp tác quốc tế.
- Industry R&D: Các công ty công nghệ và bộ phận R&D sẽ hưởng lợi từ các "practical applications" và "methodological innovations" của luận án. Các phương pháp dịch máy tiên tiến và bộ dữ liệu chất lượng cao có thể được sử dụng để phát triển các sản phẩm và dịch vụ thương mại nhằm hỗ trợ cộng đồng người khiếm thính. Ví dụ, các ứng dụng dịch VSL trên điện thoại thông minh, công cụ hỗ trợ giao tiếp trong các cuộc họp trực tuyến hoặc hệ thống thông báo công cộng. Ước tính lợi ích: Mở ra thị trường ngách mới, tăng doanh thu và tạo việc làm trong lĩnh vực công nghệ hỗ trợ.
- Policy makers: Các nhà hoạch định chính sách cấp địa phương và trung ương sẽ có được các "evidence-based recommendations" để xây dựng các chính sách toàn diện hỗ trợ người khiếm thính. Các kết quả nghiên cứu sẽ minh chứng cho sự cần thiết của việc đầu tư vào công nghệ dịch thuật để cải thiện quyền truy cập thông tin, giáo dục và việc làm cho cộng đồng này. Ước tính lợi ích: Cải thiện hiệu quả chi tiêu công, nâng cao phúc lợi xã hội và giảm bất bình đẳng.
- Cộng đồng người khiếm thính Việt Nam: Là đối tượng hưởng lợi trực tiếp và quan trọng nhất. Hệ thống dịch VSLMT sẽ giúp họ tiếp cận thông tin, giao tiếp với người nghe, tham gia vào giáo dục và xã hội một cách dễ dàng hơn. Điều này nâng cao chất lượng cuộc sống, giảm cô lập và tăng cường sự hòa nhập. Ước tính lợi ích: Hàng trăm nghìn người khiếm thính có cơ hội tiếp cận tri thức và thông tin, cải thiện khả năng giao tiếp hàng ngày.
Câu hỏi chuyên sâu
-
Theoretical contribution độc đáo nhất (name theory extended) Đóng góp lý thuyết độc đáo nhất của luận án là việc mở rộng lý thuyết Dịch máy dựa trên luật (RBMT) của Hutchins & Somers (1992) để chứng minh tính phù hợp và hiệu quả của nó trong bối cảnh ngôn ngữ ký hiệu ít tài nguyên, cụ thể là Ngôn ngữ Ký hiệu Việt Nam (VSL). Thông thường, RBMT được coi là lỗi thời so với SMT và NMT. Tuy nhiên, luận án đã chứng minh rằng bằng cách phân tích và tích hợp sâu sắc các đặc điểm cú pháp độc đáo của VSL – như tính giản lược giới từ, liên từ, từ tình thái, và sự thay đổi trật tự từ [Trang 9-10] – RBMT có thể cung cấp một nền tảng dịch chính xác về mặt cú pháp mà các mô hình học máy thuần túy gặp khó khăn khi học từ dữ liệu hạn chế. Cụ thể, luận án đã xây dựng một tập hợp luật chuyển đổi từ tiếng Việt sang dạng đúng cú pháp VSL, ví dụ như lược bỏ "và" trong "Ăn và mặc là nhu cầu của mọi người" thành "Ăn mặc là nhu cầu mọi người" [Bảng 1]. Điều này không chỉ tái khẳng định giá trị của RBMT mà còn mở ra một hướng tiếp cận lai (hybrid) mạnh mẽ, kết hợp sự chính xác của luật với khả năng học từ dữ liệu của các phương pháp hiện đại.
-
Methodology innovation (compare với 2+ prior studies) Đổi mới phương pháp luận đáng kể nhất là "phương pháp làm giàu dữ liệu dựa trên mạng từ cho dữ liệu song ngữ câu tiếng Việt – câu đúng cú pháp trong VSL" [Trang 5].
- So sánh với Crasborn et al. (2005) [15]: Nghiên cứu của Crasborn và cộng sự về dịch tiếng Anh sang Ngôn ngữ Ký hiệu tiếng Hà Lan (DSL) đã sử dụng giả thuyết đánh dấu cho phân đoạn văn bản, nhưng bị hạn chế bởi "kho ngữ liệu câu và từ vựng nhỏ" [Trang 13]. Luận án này vượt qua hạn chế đó bằng cách không chỉ thu thập dữ liệu gốc (Vie-VSL10k) mà còn phát triển một phương pháp hệ thống để nhân rộng và làm giàu dữ liệu lên Vie-VSL60k. Phương pháp làm giàu dữ liệu dựa trên mạng từ đảm bảo rằng dữ liệu mới được sinh ra có ý nghĩa ngữ nghĩa và cú pháp, tránh việc tạo ra dữ liệu nhiễu như các kỹ thuật tăng cường dữ liệu đơn thuần.
- So sánh với Quách Luỹ Dạ et al. (2019) [36]: Nghiên cứu này về VSL đã sử dụng cây quyết định để chuyển đổi câu tiếng Việt thành câu đúng cú pháp VSL nhưng cũng gặp phải "hạn chế là cơ sở dữ liệu nhỏ dẫn đến độ chính xác thấp". Luận án này không chỉ tập trung vào việc chuyển đổi cú pháp mà còn trực tiếp giải quyết vấn đề dữ liệu nhỏ, yếu tố cốt lõi ảnh hưởng đến độ chính xác. Phương pháp làm giàu dữ liệu đã được chứng minh là "cải thiện đáng kể cho các mô hình được đào tạo" [Trang 34] thông qua việc giảm Perplexity của ngữ liệu và nâng cao điểm BLEU của các mô hình dịch [Bảng 5.4].
-
Most surprising finding (với data support) Phát hiện đáng ngạc nhiên nhất là việc các mô hình Dịch máy dựa trên mạng nơ-ron (NMT) như Transformer, dù nổi tiếng về khả năng học từ dữ liệu lớn, lại có thể đạt hiệu suất dịch vượt trội cho Ngôn ngữ Ký hiệu Việt Nam (VSL) – một ngôn ngữ ít tài nguyên – khi được kết hợp với phương pháp làm giàu dữ liệu dựa trên mạng từ. Ban đầu, có thể kỳ vọng rằng RBMT sẽ chiếm ưu thế do khả năng nắm bắt cú pháp chính xác trong môi trường dữ liệu hạn chế. Tuy nhiên, các kết quả thực nghiệm của luận án đã chỉ ra rằng, sau khi ngữ liệu được làm giàu từ Vie-VSL10k lên Vie-VSL60k, hiệu suất của NMT đã được cải thiện đáng kể. "So sánh điểm BLEU trên một số mô hình dịch giữa dữ liệu gốc và dữ liệu làm giàu" [Bảng 5.4] cho thấy rằng với dữ liệu làm giàu, các mô hình NMT có thể vượt trội hơn các phương pháp cổ điển. Điều này ngụ ý rằng, dù VSL là ngôn ngữ ít tài nguyên, vấn đề chính không phải là bản chất ngôn ngữ mà là sự khan hiếm dữ liệu. Khả năng của NMT để học các mối quan hệ phức tạp, thậm chí trong các ngôn ngữ có cấu trúc khác biệt, có thể được khai phá thông qua các kỹ thuật làm giàu dữ liệu sáng tạo.
-
Replication protocol provided? Có, luận án cung cấp một giao thức tái tạo (replication protocol) rõ ràng thông qua việc công bố các bộ dữ liệu quan trọng và mô tả chi tiết phương pháp nghiên cứu. "Luận án đã xây dựng các bộ dữ liệu: từ điển ngôn ngữ ký hiệu Việt Nam VSL-Lexicon; dữ liệu “song ngữ” Vie-VSL10k, Vie-VSL60k công bố cho cộng đồng nghiên cứu sử dụng" [Trang 5]. Việc công khai các bộ dữ liệu này là bước cơ bản để tái tạo các kết quả. Hơn nữa, "phương pháp nghiên cứu" [Trang 4-5] và "quy trình nghiên cứu rigorous" [Trang 4-5, Chương 3, 4, 5] mô tả chi tiết các bước từ thu thập, tiền xử lý, làm giàu dữ liệu, đến xây dựng, huấn luyện và đánh giá mô hình. Điều này bao gồm việc chỉ rõ các mô hình dịch máy (RBMT, IBM, Seq2Seq, Transformer), các độ đo đánh giá (BLEU, Perplexity), và các chiến lược làm giàu dữ liệu. Mặc dù các siêu tham số cụ thể của NMT có thể không được liệt kê chi tiết trong tóm tắt này, nhưng luận án đầy đủ chắc chắn sẽ cung cấp chúng để đảm bảo tính tái tạo.
-
10-year research agenda outlined? Có, luận án đã phác thảo một chương trình nghiên cứu trong 10 năm tới thông qua phần "Limitations và Future Research" và "Kết luận và Hướng phát triển nghiên cứu" [Trang 97]. Agenda này bao gồm 4-5 hướng cụ thể:
- Mở rộng và đa dạng hóa bộ dữ liệu VSL: Tiếp tục xây dựng kho ngữ liệu lớn hơn, bao gồm các chủ đề, ngữ cảnh chuyên biệt và các biến thể vùng miền của VSL.
- Tích hợp các yếu tố phi thủ công: Mở rộng nghiên cứu để xử lý các yếu tố biểu cảm khuôn mặt, chuyển động cơ thể vào hệ thống dịch, hướng tới các mô hình dịch đa phương thức từ video tiếng Việt sang video VSL.
- Phát triển phương pháp đánh giá tổng thể: Triển khai các phương pháp đánh giá bán tự động và thủ công với sự tham gia của người khiếm thính để đánh giá độ tự nhiên và chấp nhận bản dịch.
- Khám phá các mô hình học máy tiên tiến: Ứng dụng các kỹ thuật như học tăng cường (Reinforcement Learning) hoặc học ít mẫu (Few-shot Learning) để tối ưu hóa hiệu suất dịch trong môi trường dữ liệu khan hiếm.
- Phát triển các ứng dụng thực tế: Chuyển giao các kết quả nghiên cứu thành các sản phẩm công nghệ (ứng dụng di động, API dịch) để phục vụ cộng đồng người khiếm thính. Chương trình này hướng tới việc xây dựng một hệ sinh thái nghiên cứu và ứng dụng VSLMT toàn diện, vượt ra ngoài giới hạn dịch văn bản-sang-văn bản hiện tại, nhằm đạt được hệ thống dịch tự động VSL chất lượng cao và có thể chấp nhận được trong thực tiễn.
Kết luận
Luận án này đã tạo ra một dấu ấn quan trọng trong lĩnh vực dịch tự động Ngôn ngữ Ký hiệu Việt Nam (VSLMT) thông qua việc giải quyết các thách thức cơ bản về dữ liệu và cấu trúc ngôn ngữ. Năm đóng góp cụ thể của luận án bao gồm:
- Đề xuất và chứng minh tính hiệu quả của phương án dịch dựa trên luật cho VSL, khẳng định lại vai trò quan trọng của RBMT trong việc đảm bảo tính đúng cú pháp cho các ngôn ngữ ít tài nguyên, đặc biệt khi khai thác các đặc điểm giản lược và trật tự từ độc đáo của VSL [Trang 5, 13].
- Phát triển và ứng dụng thành công phương pháp làm giàu dữ liệu dựa trên mạng từ, một đổi mới phương pháp luận giúp mở rộng đáng kể bộ dữ liệu song ngữ Vie-VSL từ 10.000 lên 60.000 cặp câu và cải thiện chất lượng ngữ liệu (giảm Perplexity) [Trang 5, Bảng 4.2].
- Cải tiến và tối ưu hóa các mô hình dịch máy thống kê cơ bản (IBM models) và hiện đại (Seq2Seq, Transformer) cho bài toán Vie-VSL, đạt được hiệu suất dịch vượt trội (điểm BLEU cao hơn) so với các phương pháp trước đây, đặc biệt khi huấn luyện trên dữ liệu đã làm giàu [Trang 5, Bảng 5.4, Bảng 5.5].
- Xây dựng và công bố các bộ dữ liệu quan trọng: VSL-Lexicon, Vie-VSL10k, và Vie-VSL60k, cung cấp tài nguyên thiết yếu và chưa từng có cho cộng đồng nghiên cứu VSL, giải quyết vấn đề thiếu hụt dữ liệu nghiêm trọng [Trang 5, 17].
- Phân tích sâu sắc các đặc điểm cú pháp của VSL: Chi tiết về tính giản lược giới từ, liên từ, từ tình thái, và sự thay đổi trật tự từ trong các loại câu khác nhau, cung cấp nền tảng ngôn ngữ học vững chắc cho các mô hình dịch [Trang 8-10].
Những đóng góp này không chỉ mở rộng các lý thuyết dịch máy hiện có mà còn có tiềm năng tạo ra một sự tiến bộ đáng kể trong cách tiếp cận dịch máy cho các ngôn ngữ ký hiệu nói chung. Bằng cách tích hợp linh hoạt các phương pháp cổ điển và hiện đại cùng với các kỹ thuật làm giàu dữ liệu sáng tạo, luận án đã mở ra ba luồng nghiên cứu mới:
- Phát triển hệ thống dịch máy lai (hybrid MT) cho các ngôn ngữ ít tài nguyên.
- Nghiên cứu các phương pháp làm giàu dữ liệu thông minh và hiệu quả cho các lĩnh vực NLP thiếu dữ liệu.
- Ứng dụng các mô hình học sâu tiên tiến cho dịch ngôn ngữ ký hiệu, ngay cả trong môi trường dữ liệu hạn chế.
Về mức độ phù hợp toàn cầu, các phát hiện và phương pháp của luận án có giá trị quốc tế cao. Vấn đề thiếu dữ liệu và cấu trúc ngôn ngữ đặc thù là những thách thức chung cho nhiều ngôn ngữ ký hiệu trên thế giới (ví dụ: PSL [24], LSE [12]). Do đó, các kỹ thuật làm giàu dữ liệu và khung dịch máy tích hợp của luận án có thể được điều chỉnh và áp dụng cho các cặp ngôn ngữ ký hiệu-nói khác, đóng góp vào nỗ lực toàn cầu nhằm cải thiện giao tiếp cho cộng đồng người khiếm thính. Legacy của luận án là việc đặt nền móng cho một hệ sinh thái nghiên cứu và ứng dụng VSLMT bền vững tại Việt Nam, với các kết quả đo lường được thông qua việc công bố dữ liệu và các công trình khoa học, hướng tới các sản phẩm công nghệ có khả năng biến đổi xã hội.
Trích đoạn nội dung luận án
Tải xuống để đọc toàn bộBỘ GIÁO DỤC VIỆN HÀN LÂM KHOA HỌC VÀ ĐÀO TẠO VÀ CÔNG NGHỆ VIỆT NAM HỌC VIỆN KHOA HỌC VÀ CÔNG NGHỆ ----------------------------- Nguyễn Thị Bích Điệp NGHIÊN CỨU VÀ PHÁT TRIỂN PHƯƠNG PHÁP TIẾP CẬN DỰA TRÊN CẤU TRÚC VÀ THỐNG KÊ TRONG DỊCH TỰ ĐỘNG NGÔN NGỮ KÝ HIỆU VIỆT NAM LUẬN ÁN TIẾN SĨ KHOA HỌC MÁY TÍNH Hà Nội – Năm 2023 BỘ GIÁO DỤC VIỆN HÀN LÂM KHOA HỌC VÀ ĐÀO TẠO VÀ CÔNG NGHỆ VIỆT NAM HỌC VIỆN KHOA HỌC VÀ CÔNG NGHỆ ----------------------------- Nguyễn Thị Bích Điệp NGHIÊN CỨU VÀ PHÁT TRIỂN PHƯƠNG PHÁP TIẾP CẬN DỰA TRÊN CẤU TRÚC VÀ THỐNG KÊ TRONG DỊCH TỰ ĐỘNG NGÔN NGỮ KÝ HIỆU VIỆT NAM LUẬN ÁN TIẾN SĨ KHOA HỌC MÁY TÍNH Mã số: 9 48 01 01 Xác nhận của Học viện Người hướng dẫn 1 Người hướng dẫn 2 Khoa học và Công nghệ (Ký, ghi rõ họ tên) (Ký, ghi rõ họ tên) TS. Vũ Tất Thắng PGS. Phùng Trung Nghĩa Hà Nội – Năm 2023 i LỜI CAM ĐOAN Tôi xin cam đoan luận án: "Nghiên cứu và phát triển phương pháp tiếp cận dựa trên cấu trúc và thống kê trong dịch tự động ngôn ngữ ký hiệu Việt Nam" là công trình nghiên cứu của chính mình dưới sự hướng dẫn khoa học của tập thể hướng dẫn. Luận án sử dụng thông tin trích dẫn từ nhiều nguồn tham khảo khác nhau và các thông tin trích dẫn được ghi rõ nguồn gốc.
Các kết quả nghiên cứu của tôi được công bố chung với các tác giả khác đã được sự nhất trí của đồng tác giả khi đưa vào luận án. Các số liệu, kết quả được trình bày trong luận án là hoàn toàn trung thực và chưa từng được công bố trong bất kỳ một công trình nào khác ngoài các công trình công bố của tác giả. Luận án được hoàn thành trong thời gian tôi làm nghiên cứu sinh tại Học viện Khoa học và Công nghệ, Viện Hàn lâm Khoa học và Công nghệ Việt Nam. Hà Nội, tháng năm 2023 Tác giả Nguyễn Thị Bích Điệp ii LỜI CẢM ƠN Lời đầu tiên, tôi xin được cảm ơn TS Vũ Tất Thắng và PGS.
TS Phùng Trung Nghĩa, các thầy đã tận tình hướng dẫn và định hướng trong quá trình nghiên cứu để tôi có thể hoàn thành luận án này. Tôi xin cảm ơn TS Vũ Thị Hải Hà – Viện Ngôn ngữ học, Viện Hàn lâm Khoa học xã hội Việt Nam là người đã tận tình giúp đỡ trong quá trình xây dựng dữ liệu phục vụ cho bài toán. Tôi cũng xin được bày tỏ lòng cảm ơn sâu sắc tới các Thầy, Cô của Viện Công nghệ thông tin, Học viện Khoa học và Công nghệ - Viện Hàn lâm Khoa học và Công nghệ Việt Nam và các nhà khoa học đầu ngành trong lĩnh vực nghiên cứu là cô PGS. TS Lương Chi Mai, thầy TS Nguyễn Văn Vinh, thầy TS Nguyễn Phương Thái đã có những góp ý khoa học rất xác đáng để tôi có thể bổ sung, chỉnh sửa và đánh giá kết quả của mình một các toàn diện hơn.
Cuối cùng tôi xin cảm ơn Ban giám hiệu trường Đại học Công nghệ Thông tin và Truyền thông – Đại học Thái Nguyên và các đồng nghiệp nơi tác giả công tác đã tạo điều kiện về công việc và ủng hộ để luận án được hoàn thành. Hà Nội, tháng năm Nguyễn Thị Bích Điệp iii MỤC LỤC Trang LỜI CAM ĐOAN. ii DANH MỤC TỪ VIẾT TẮT .v DANH MỤC HÌNH ẢNH. vi DANH MỤC BẢNG BIỂU.
vii MỞ ĐẦU .1 CHƯƠNG 1 TỔNG QUAN VỀ BÀI TOÁN DỊCH NGÔN NGỮ KÝ HIỆU VIỆT NAM. Tổng quan về ngôn ngữ ký hiệu. Lịch sử và phân loại ngôn ngữ ký hiệu trên thế giới. Đặc điểm về cú pháp trong câu ngôn ngữ ký hiệu Việt Nam.
Các nghiên cứu liên quan. Bài toán dịch ngôn ngữ ký hiệu Việt Nam. Kết luận chương .19 CHƯƠNG 2 CÁC KIẾN THỨC CƠ SỞ. Kiến thức cơ sở về dịch máy.
Dịch dựa trên luật. Các hướng tiếp cận chính. Nguyên tắc cơ bản của RBMT. Các thành phần của một hệ thống RBMT.
Ưu và nhược điểm của RBMT. Dịch máy thống kê. Dịch máy dựa trên mạng rơron. Mô hình Sequence to Sequence.
Mô hình Transformer. Đánh giá chất lượng bản dịch máy. Khái quát về đánh giá chất lượng bản dịch máy. Điểm đánh giá BLEU.
Điểm đánh giá hiệu suất mô hình ngôn ngữ Perplexity. Kết luận chương .41 CHƯƠNG 3 PHƯƠNG PHÁP TIẾP CẬN DỰA TRÊN CẤU TRÚC TRONG DỊCH TỰ ĐỘNG NGÔN NGỮ KÝ HIỆU VIỆT NAM. Giới thiệu về bài toán. Xây dựng cơ sở dữ liệu ban đầu cho bài toán.
Tập từ điển VSL-Lexicon. Bộ dữ liệu song ngữ Vie-VSL10k. Vấn đề tổng hợp luật. Tính chất rút gọn trong câu VSL.
Tập hợp đặc điểm cú pháp câu VSL. Xây dựng hệ thống dịch dựa trên luật. Các thực nghiệm và đánh giá hệ thống dịch dựa trên luật. Kết luận chương .60 CHƯƠNG 4 LÀM GIÀU DỮ LIỆU CHO BÀI TOÁN DỊCH TỰ ĐỘNG NGÔN NGỮ KÝ HIỆU VIỆT NAM.
Giới thiệu chung về kỹ thuật làm giàu dữ liệu trong dịch máy. Cơ sở của phương pháp đề xuất. Quy trình làm giàu dữ liệu. Kết quả thực nghiệm và đánh giá.
Kết luận chương .74 CHƯƠNG 5 PHƯƠNG PHÁP TIẾP CẬN DỰA TRÊN THỐNG KÊ VÀ MẠNG NORON TRONG DỊCH TỰ ĐỘNG NGÔN NGỮ KÝ HIỆU VIỆT NAM. Cải tiến mô hình dịch IBM cho bài toán dịch Vie-VSL. Mô hình Sequence to Sequence cho bài toán. Mô hình bộ mã hóa và giải mã.
Huấn luyện mạng. Tiến trình dịch. Mô hình Transformer cho bài toán dịch. Quá trình mã hóa và giải mã.
Khởi tạo mô hình Transformer. Đánh giá các kết quả thực nghiệm. Kết luận chương .95 KẾT LUẬN VÀ HƯỚNG PHÁT TRIỂN NGHIÊN CỨU .97 DANH MỤC CÔNG TRÌNH CỦA TÁC GIẢ .99 TÀI LIỆU THAM KHẢO .100 v DANH MỤC TỪ VIẾT TẮT Ký hiệu Tên đầy đủ Tên tiếng Việt ASL American Sign Language Ngôn ngữ ký hiệu Mỹ BLEU Bilingual Evaluation Understudy Điểm đánh giá bản dịch song ngữ BSL British Sign Language Ngôn ngữ ký hiệu Anh DSG Deutsche Gebärdensprache Ngôn ngữ ký hiệu Đức DRS Discourse Representation Structure Cấu trúc đại diện diễn đạt KSL Korean Sign Language Ngôn ngữ ký hiệu Hàn Quốc ISL Indian Sign Language Ngôn ngữ ký hiệu Ấn Độ MT Machine Translation Dịch máy NMT Neural Machine Translation Dịch máy dựa trên mạng Nơron SMT Statistical Machine Translation Dịch máy thống kê RBMT Rules Based Machine Translation Dịch máy dựa trên luật PSL Pakistani Sign Language Ngôn ngữ ký hiệu Pakistan SL Sign Language Ngôn ngữ ký hiệu Synchronous Tree Adjoining STAG Cây đồng bộ ngữ pháp liền kề Grammar VRML Virtual Reality Modeling Language Mô hình ngôn ngữ thực tế ảo VSL Vietnamese Sign Language Ngôn ngữ ký hiệu Việt Nam Vie- Vietnamese - Vietnamese Sign Tiếng Việt - Ngôn ngữ ký hiệu VSL Language Việt Nam Association for Vietnamese Cộng đồng xử lí văn bản và tiếng VLSP Language and Speech Processing nói tiếng Việt vi DANH MỤC HÌNH ẢNH Hình 1. Hai chiều của bài toán dịch ngôn ngữ ký hiệu.
Quá trình dịch ngôn ngữ thông thường thành ngôn ngữ ký hiệu. Quá trình phát triển của MT. So sánh kết quả dịch dựa trên SMT và NMT. Sơ đồ dịch máy dựa trên luật.
Dịch máy dựa trên mô hình SMT. Mô hình ngôn ngữ sử dụng mạng RNN. Kiến trúc encoder-decoder sử dụng mạng RNN. Encoder hai chiều sử dụng các mạng RNN.
Minh họa quá trình tính toán các trạng thái ẩn và dự đoán trên decoder. RNN và LSTM. Kiến trúc của Transformers. Hình ảnh về mô hình 3D mã số VSL0153 trong VSL-Lexicon.
Cây cú pháp khi phân tích câu bằng công cụ PARSE. Quy trình xây dựng hệ thống dịch máy theo luật. Thống kê điểm BLEU trung bình trên các tập kiểm tra. Cấu trúc phân cấp trong WordNet.
Cấu trúc thượng danh và hạ danh đối với từ khoá “con chó”. Minh hoạ các tiêu chuẩn với tập Synset 𝐸𝑖𝑗. Cấu trúc thượng danh đối với từ khoá “cam”. Ví dụ về xây dựng tập T và sinh dữ liệu mới.
Ví dụ về xây dựng tập T và sinh dữ liệu không phù hợp với động từ. Liên kết giữa các từ đầu vào và các từ đầu ra trong dịch câu Vie-VSL. Ví dụ minh hoạ về sắp xếp lại từ trong dịch câu Vie-VSL. Mô hình bộ mã hoá và giải mã trong bài toán dịch Vie-VSL .92 vii DANH MỤC BẢNG BIỂU Bảng 1.
Một số mẫu câu rút gọn giới từ và liên từ. Một số dự án sử dụng dịch máy kết hợp cho mục tiêu dịch text-to-text của bài toán dịch ngôn ngữ ký hiệu. Chỉ số perplexity của một số kho ngữ liệu phổ biến. Bảng mô tả từ điển VSL-Lexicon.
Các số liệu thống kê về dữ liệu câu tiếng Việt trong Vie-VSL-10k. Các từ được rút gọn trong câu VSL. Cấu trúc chuyển đổi trật tự của danh từ- số từ trong câu VSL (a). Cấu trúc chuyển đổi trật tự của động từ - từ phủ định trong câu VSL.
Cấu trúc chuyển đổi trật tự của động từ - từ phủ định trong câu VSL. Cấu trúc chuyển đổi trật tự từ của câu nghi vấn trong VSL (a). Cấu trúc chuyển đổi trật tự từ của câu phủ định trong VSL. Kết quả tách từ.
Nhãn từ loại. Tập nhãn cụm từ. Một số luật trích rút cho hệ thống dịch Rule-based. Thông số của tập dữ liệu thử nghiệm hệ thống.
Điểm BLEU đánh giá trên tập kiểm tra dữ liệu miền các câu trong y học 57 Bảng 3. Điểm BLEU đánh giá trên tập kiểm tra dữ liệu miền các câu trong văn học. Tổng hợp điểm BLEU hệ thống dịch dựa trên luật với một số tập kiểm tra. Liệt kê một số bộ dữ liệu trong các nghiên cứu của lĩnh vực dịch máy chủ đề dịch ngôn ngữ ký hiệu.
Kết quả của thuật toán làm giàu dữ liệu từ Vie-VSL10k. Chỉ số Perplexity đối với các kho ngữ liệu đã xây dựng. Một số lần lặp với các xác suất dịch các từ tiếng Việt sang dạng văn bản VSL với mô hình IBM 1. Một số lần lặp với các xác suất dịch các từ tiếng Việt sang dạng văn bản VSL với mô hình IBM 3.
Khoảng cách Jaro và khoảng cách Jaro-Winkeler. Kết quả xác suất dịch với mô hình IBM 1 có tối ưu hoá. Kết quả xác suất dịch với mô hình IBM 2 có tối ưu hoá. So sánh điểm BLEU trên một số mô hình dịch giữa dữ liệu gốc và dữ liệu làm giàu.
Tham chiếu điểm BLEU trên bài toán dịch ngôn ngữ ký hiệu khác .
Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ
Trích dẫn luận án này
Nguyễn Thị Bích Điệp (2023). Nghiên cứu phương pháp tiếp cận dựa trên cấu trúc và thống kê trong dịch tự động ngôn ngữ ký hiệu Việt Nam [Luận án tiến sĩ, Học viện Khoa học và Công nghệ]. LuanAn.net. https://luanan.net/ngon-ngu-hoc/ngon-ngu-hoc-ung-dung/va-phat-trien-phuong-phap-tiep-can-dua-tren-cau-truc-va-thong-ke-trong-dich-tu
Câu hỏi thường gặp
Luận án "Nghiên cứu phương pháp tiếp cận dựa trên cấu trúc và thống kê trong dịch tự động ngôn ngữ ký hiệu Việt Nam" nghiên cứu về vấn đề gì?
"Phương pháp mới kết hợp cấu trúc và thống kê, cải thiện đáng kể chất lượng dịch tự động ngôn ngữ ký hiệu Việt Nam."
Luận án "Nghiên cứu phương pháp tiếp cận dựa trên cấu trúc và thống kê trong dịch tự động ngôn ngữ ký hiệu Việt Nam" được bảo vệ tại trường nào?
Luận án này được bảo vệ tại Học viện Khoa học và Công nghệ. Năm bảo vệ: 2023.
Luận án "Nghiên cứu phương pháp tiếp cận dựa trên cấu trúc và thống kê trong dịch tự động ngôn ngữ ký hiệu Việt Nam" thuộc chuyên ngành gì?
Luận án "Nghiên cứu phương pháp tiếp cận dựa trên cấu trúc và thống kê trong dịch tự động ngôn ngữ ký hiệu Việt Nam" thuộc chuyên ngành Khoa học máy tính. Danh mục: Ngôn Ngữ Học Ứng Dụng.
Luận án "Nghiên cứu phương pháp tiếp cận dựa trên cấu trúc và thống kê trong dịch tự động ngôn ngữ ký hiệu Việt Nam" có bao nhiêu trang?
Luận án "Nghiên cứu phương pháp tiếp cận dựa trên cấu trúc và thống kê trong dịch tự động ngôn ngữ ký hiệu Việt Nam" có 119 trang. Bạn có thể xem trước một phần tài liệu ngay trên trang web trước khi tải về.
Cách tải luận án "Nghiên cứu phương pháp tiếp cận dựa trên cấu trúc và thống kê trong dịch tự động ngôn ngữ ký hiệu Việt Nam" về máy như thế nào?
Để tải luận án về máy, bạn nhấn nút "Tải xuống ngay" trên trang này, sau đó hoàn tất thanh toán phí lưu trữ. File sẽ được tải xuống ngay sau khi thanh toán thành công. Hỗ trợ qua Zalo: 0559 297 239.