Luận án Tiến sĩ CNTT: Tự động xác định quan hệ ngữ nghĩa từ học máy thống kê
Khám phá phương pháp học máy thống kê để tự động xác định các quan hệ ngữ nghĩa giữa các từ. Tối ưu hóa xử lý ngôn ngữ tự nhiên.
Số trang
154
Thời gian đọc
24 phút
Lượt xem
0
Lượt tải
0
Phí lưu trữ
50 Point
Tổng quan nhanh
- Chủ đề:
- Phân tích ngữ nghĩa: Hướng đi mới trong NLP tiếng Việt
- Số trang:
- 154 trang
- Trường:
- Trường Đại học Công nghệ, Đại học Quốc gia Hà Nội
- Chuyên ngành:
- Khoa học máy tính
- Tác giả:
- Luan An
Tóm tắt nội dung luận án
I.Phân tích ngữ nghĩa Hướng đi mới trong NLP tiếng Việt
Xử lý ngôn ngữ tự nhiên (NLP) là lĩnh vực quan trọng, với nhiều ứng dụng thực tiễn. Nhận dạng tiếng nói, dịch máy, tìm kiếm thông tin là ví dụ. Khai phá dữ liệu cũng cần NLP. Tự động xác định quan hệ ngữ nghĩa của từ (LSRD) là bài toán cốt lõi. Đây là một trong những thách thức lớn nhất của NLP. Các mô hình xác định quan hệ ngữ nghĩa là thành phần thiết yếu. Chúng hỗ trợ nhiều hệ thống NLP. Việc này cải thiện hiệu suất của các ứng dụng.
1.1. Tầm quan trọng của quan hệ ngữ nghĩa.
Quan hệ ngữ nghĩa là nền tảng cho sự hiểu biết ngôn ngữ. Chúng giúp máy tính diễn giải ý nghĩa của từ và cụm từ. Không có quan hệ ngữ nghĩa, máy tính không thể hiểu ngữ cảnh. Điều này hạn chế khả năng của các hệ thống NLP. Việc xác định tự động các quan hệ này là mục tiêu chính. Nó mở ra nhiều khả năng mới trong xử lý ngôn ngữ.
1.2. Vai trò của NLP trong xử lý tiếng Việt.
Xử lý ngôn ngữ tiếng Việt có nhiều phức tạp. Đây là lĩnh vực nghiên cứu rộng lớn. Nhiều bài toán cần được giải quyết. LSRD đặc biệt quan trọng. Mô hình xác định quan hệ ngữ nghĩa là thành phần thiết yếu. Chúng hỗ trợ nhiều hệ thống NLP. Nhu cầu phân tích ngữ nghĩa sâu hơn cho tiếng Việt rất lớn. Nghiên cứu này đóng góp vào đó.
1.3. Nhu cầu xác định ngữ nghĩa tự động.
Xây dựng cơ sở tri thức từ vựng đòi hỏi điều này. Dịch máy cải thiện chất lượng. Phân tích quan điểm người dùng trở nên chính xác. Hệ thống hỏi đáp thông minh hoạt động hiệu quả hơn. Nhu cầu tự động hóa phân tích ngữ nghĩa ngày càng cao. Nghiên cứu này tập trung vào giải quyết vấn đề này. Nó mang lại hiệu quả cao cho các ứng dụng thực tế.
II.Học máy thống kê Nền tảng xác định quan hệ ngữ nghĩa
Lĩnh vực NLP phát triển nhanh chóng. Học sâu đóng vai trò mạnh mẽ. Nhiều kết quả nghiên cứu đột phá được công bố. Học máy thống kê cung cấp nền tảng. Nó giúp xử lý ngôn ngữ một cách hiệu quả. Mô hình này có khả năng học từ dữ liệu lớn. Các mạng nơ-ron nhiều tầng được sử dụng. Cấu trúc phức tạp mang lại sức mạnh xử lý. Bộ xử lý đồ họa hiện đại hỗ trợ hiệu quả. Đây là lợi thế lớn cho các thuật toán học máy.
2.1. Tiếp cận học máy trong ngữ nghĩa từ vựng.
Học máy cung cấp khung làm việc vững chắc. Nó giúp hệ thống tự động nhận diện ngữ nghĩa. Việc này giảm thiểu sự can thiệp thủ công. Các thuật toán học máy học từ các mẫu dữ liệu. Chúng xây dựng mô hình để dự đoán quan hệ. Điều này tối ưu hóa quá trình phân tích ngữ nghĩa.
2.2. Ưu điểm của mô hình thống kê.
Mô hình thống kê có khả năng xử lý lượng dữ liệu khổng lồ. Chúng phát hiện các xu hướng và mối liên hệ tiềm ẩn. Độ tin cậy của kết quả được cải thiện. Các mô hình này thích nghi tốt với sự phức tạp của ngôn ngữ. Chúng cung cấp cơ sở vững chắc cho phân tích ngữ nghĩa từ vựng.
2.3. Giải pháp cho bài toán trích xuất quan hệ.
Học máy thống kê là giải pháp tiềm năng. Nó giúp tự động nhận diện ngữ nghĩa. Trích xuất quan hệ giữa các từ là mục tiêu chính. Hai tiếp cận chính tồn tại: mẫu từ vựng - cú pháp và phân phối. Nghiên cứu này tập trung vào phát triển giải pháp tiên tiến. Mô hình này giúp cải thiện độ chính xác. Nó mang lại hiệu suất cao.
III.Thách thức NLP Cải thiện nhận diện ngữ nghĩa phức tạp
Mô hình NLP đối mặt nhiều thách thức. Xử lý bài toán với dữ liệu ít còn khó khăn. Dữ liệu có nhiễu làm giảm hiệu suất. Ngôn ngữ tự nhiên rất phức tạp. Các thủ pháp nghệ thuật như ẩn dụ, hoán dụ là ví dụ. Mô hình NLP gặp khó khăn khi hiểu chúng. Cần cải thiện khả năng diễn giải ngữ nghĩa sâu hơn. Việc tích hợp thêm các mô hình xác định quan hệ ngữ nghĩa của từ là một trong các cách tiếp cận để vượt qua những thách thức này.
3.1. Giới hạn của dữ liệu ít và nhiễu.
Dữ liệu là yếu tố then chốt cho học máy. Khi dữ liệu ít, mô hình không thể học hiệu quả. Dữ liệu có nhiễu gây ra thông tin sai lệch. Cả hai trường hợp đều làm giảm độ chính xác. Cần phương pháp mới để vượt qua giới hạn này. Giải pháp bao gồm việc tối ưu hóa dữ liệu và thuật toán học máy.
3.2. Hiểu ẩn dụ hoán dụ trong ngôn ngữ.
Ngôn ngữ con người chứa đựng nhiều sắc thái. Ẩn dụ và hoán dụ là những ví dụ. Chúng làm cho việc phân tích ngữ nghĩa trở nên phức tạp. Mô hình cần có khả năng diễn giải ý nghĩa phi đen. Việc này đòi hỏi sự hiểu biết ngữ cảnh sâu sắc. Nghiên cứu tập trung vào cải thiện nhận diện ngữ nghĩa này.
3.3. Tích hợp quan hệ ngữ nghĩa để vượt khó.
Tích hợp mô hình xác định quan hệ ngữ nghĩa là cách tiếp cận. Phương pháp này giúp vượt qua thách thức. Nó cải thiện khả năng nhận diện ngữ nghĩa. Mô hình trở nên mạnh mẽ hơn trong việc xử lý ngôn ngữ. Việc này giúp NLP tiến bộ. Nó tăng cường hiệu quả tổng thể của hệ thống.
IV.Trích xuất quan hệ Ứng dụng rộng rãi trong hệ thống
Trích xuất quan hệ là công cụ mạnh mẽ. Nó hỗ trợ xây dựng cơ sở tri thức từ vựng. Đây là nền tảng cho nhiều ứng dụng thông minh. Cơ sở tri thức vững chắc giúp hệ thống hoạt động tốt hơn. Dịch máy được hưởng lợi từ việc này. Hiểu quan hệ ngữ nghĩa giúp bản dịch chính xác hơn. Tìm kiếm thông tin cũng được cải thiện. Kết quả tìm kiếm trở nên phù hợp hơn với ý định người dùng. Hệ thống hỏi đáp thông minh hoạt động hiệu quả.
4.1. Ứng dụng trong xây dựng cơ sở tri thức.
Cơ sở tri thức từ vựng là tài nguyên quý giá. Nó chứa đựng các mối liên hệ giữa các khái niệm. Trích xuất quan hệ tự động giúp xây dựng chúng nhanh chóng. Việc này làm giàu thông tin cho các hệ thống AI. Nó là nền tảng cho sự phát triển của nhiều ứng dụng thông minh.
4.2. Cải thiện dịch máy và tìm kiếm thông tin.
Trong dịch máy, hiểu quan hệ ngữ nghĩa là thiết yếu. Nó giúp lựa chọn từ và cấu trúc câu phù hợp. Trong tìm kiếm thông tin, nó tinh chỉnh kết quả. Người dùng nhận được thông tin chính xác hơn. Trích xuất quan hệ nâng cao chất lượng cả hai lĩnh vực.
4.3. Nâng cao hệ thống hỏi đáp thông minh.
Hệ thống hỏi đáp cần hiểu sâu câu hỏi. Quan hệ ngữ nghĩa giúp phân tích ý định. Nó hỗ trợ tìm kiếm câu trả lời thích hợp. Hệ thống có thể cung cấp thông tin chính xác. Điều này làm tăng sự hài lòng của người dùng. Trích xuất quan hệ là yếu tố then chốt.
V.Embedding từ và mô hình ngôn ngữ Tối ưu phân tích
Embedding từ là kỹ thuật nền tảng. Nó biểu diễn ngữ nghĩa của từ dưới dạng vector. Các vector này mã hóa thông tin ngữ cảnh. Phương pháp này giúp máy tính "hiểu" từ. Mô hình ngôn ngữ hiện đại dựa trên học sâu. Chúng học từ lượng lớn dữ liệu văn bản. Các mô hình này nắm bắt cấu trúc ngôn ngữ. Chúng tạo ra các embedding từ chất lượng cao. Việc sử dụng embedding từ hiệu quả. Nó nâng cao độ chính xác của phân tích ngữ nghĩa. Các mô hình này tối ưu hóa việc trích xuất quan hệ.
5.1. Sử dụng embedding từ để biểu diễn ngữ nghĩa.
Embedding từ chuyển đổi từ thành số. Các vector này giữ lại thông tin ngữ nghĩa. Từ có ý nghĩa tương tự sẽ gần nhau trong không gian vector. Điều này cho phép thuật toán học máy xử lý ngôn ngữ. Nó là bước quan trọng trong quá trình nhận diện ngữ nghĩa tự động.
5.2. Vai trò mô hình ngôn ngữ trong học sâu.
Mô hình ngôn ngữ trong học sâu có khả năng mạnh mẽ. Chúng dự đoán từ tiếp theo trong câu. Quá trình này giúp mô hình học được ngữ pháp và ngữ nghĩa. Các mô hình này tạo ra embedding từ giàu thông tin. Chúng là yếu tố cốt lõi trong các hệ thống NLP hiện đại.
5.3. Tiềm năng cải thiện độ chính xác.
Kết hợp embedding từ và mô hình ngôn ngữ mang lại tiềm năng lớn. Nó cải thiện đáng kể độ chính xác của phân tích. Các mô hình này có thể nhận diện các quan hệ ngữ nghĩa phức tạp. Điều này dẫn đến kết quả tốt hơn trong trích xuất quan hệ. Nó thúc đẩy tiến bộ trong lĩnh vực NLP.
VI.Thuật toán học máy Xây dựng cơ sở tri thức vững chắc
Nghiên cứu sử dụng nhiều thuật toán học máy. Các thuật toán này học từ dữ liệu đã gắn nhãn. Chúng nhận diện các mẫu quan hệ ngữ nghĩa. Phân loại và dự đoán là chức năng chính. Mục tiêu cuối cùng là phát triển cơ sở tri thức. Cơ sở này chứa đựng các quan hệ ngữ nghĩa. Nó là tài nguyên quý giá cho NLP. Việc này giúp máy tính hiểu ngôn ngữ sâu sắc hơn. Thuật toán học máy đóng góp quan trọng. Nó cải thiện nhận diện ngữ nghĩa tự động. Hiệu quả xử lý ngôn ngữ được nâng cao.
6.1. Các thuật toán học máy được áp dụng.
Nhiều thuật toán học máy phù hợp cho bài toán này. Chúng bao gồm Support Vector Machines (SVM), Random Forest, Mạng nơ-ron. Mỗi thuật toán có ưu điểm riêng. Việc lựa chọn thuật toán ảnh hưởng đến hiệu quả. Nghiên cứu này đánh giá và sử dụng các thuật toán tối ưu.
6.2. Phát triển cơ sở tri thức từ vựng.
Cơ sở tri thức từ vựng là mục tiêu quan trọng. Nó tập hợp thông tin về quan hệ ngữ nghĩa. Cơ sở này cung cấp ngữ cảnh cho các ứng dụng. Nó giúp hệ thống NLP có cái nhìn toàn diện hơn. Việc phát triển tự động cơ sở này là thành tựu lớn.
6.3. Đóng góp vào nhận diện ngữ nghĩa hiệu quả.
Luận án này mang lại phương pháp mới. Nó cải thiện đáng kể khả năng nhận diện ngữ nghĩa. Các thuật toán học máy được tối ưu hóa. Kết quả là hệ thống phân tích ngữ nghĩa hiệu quả hơn. Điều này đóng góp vào sự phát triển chung của NLP. Nó mở ra hướng nghiên cứu tiếp theo.
Mục lục chi tiết luận án
Tải xuống file đầy đủ để xem toàn bộ nội dung
Tải đầy đủ (154 trang)Nội dung chính
Tổng quan về luận án
Xử lý ngôn ngữ tự nhiên (Natural Language Processing - NLP) trong kỷ nguyên học sâu đã đạt được những bước tiến vượt bậc thông qua các mô hình biểu diễn không gian vector và mạng nơ-ron đa tầng. Tuy nhiên, các kiến trúc hiện đại vẫn đối mặt với rào cản căn bản khi xử lý ngữ liệu hạn chế, dữ liệu nhiễu và các hiện tượng ngữ nghĩa phức tạp như hoán dụ, ẩn dụ. Trong bối cảnh đó, bài toán Tự động xác định quan hệ ngữ nghĩa của từ vựng (Lexical Semantic Relation Determination - LSRD) giữ vai trò then chốt nhằm thiết lập nền tảng tri thức cho các hệ thống dịch máy, hỏi đáp tự động và xây dựng bản thể học (Ontology). Đối với tiếng Việt — một ngôn ngữ đơn lập, không biến hình từ và có cấu trúc từ ghép phong phú — việc xác định quan hệ ngữ nghĩa chủ yếu dừng lại ở góc độ ngôn ngữ học miêu tả thuần túy, thiếu vắng các mô hình tính toán chuẩn hóa trên quy mô lớn.
Khoảng trống nghiên cứu (Research Gap) cốt lõi xuất phát từ sự hạn chế của các mô hình nhúng từ tổng quát (như Word2Vec, GloVe, fastText). Các mô hình này được huấn luyện thuần túy trên giả thuyết phân phối (Distributional Hypothesis), dẫn đến việc hòa trộn toàn bộ các mối quan hệ ngữ nghĩa khác biệt vào một không gian vector duy nhất. Hiện tượng này làm mất đi tính phân biệt giữa quan hệ bao thuộc bất đối xứng và các quan hệ đối xứng như đồng nghĩa, trái nghĩa hay tương đồng phân loại.
Luận án thiết lập 3 câu hỏi nghiên cứu (Research Questions - RQ) và 3 giả thuyết tương ứng:
- RQ1: Làm thế nào để phân tách và nhận diện quan hệ bao thuộc bất đối xứng (Hypernymy) khi các từ không nhất thiết phải đồng xuất hiện thường xuyên trong văn bản?
- Hypothesis 1 (H1): Việc tích hợp các đặc trưng cấu trúc hình thái dưới từ (Subword Semantic Features) kết hợp với không gian nhúng từ chuyên biệt hóa (Specialized Word Embeddings) sẽ giúp phân biệt vượt trội từ bao và từ thuộc so với các mô hình nhúng từ tổng quát.
- RQ2: Làm thế nào để giải quyết nghịch lý phân phối giữa cặp từ đồng nghĩa và trái nghĩa — vốn có ngữ cảnh xuất hiện gần như trùng khớp?
- Hypothesis 2 (H2): Mô hình hóa ngữ cảnh đồng xuất hiện qua mạng nơ-ron hồi quy kết hợp các đặc trưng cấu trúc từ tiếng Việt và thông tin tương hỗ (PMI/LMI) sẽ phân lập chính xác ranh giới giữa quan hệ đồng nghĩa và trái nghĩa.
- RQ3: Phương pháp nào tối ưu hóa độ chính xác khi định lượng độ tương tự ngữ nghĩa (Word Similarity) trong điều kiện tài nguyên tri thức tiếng Việt còn hạn chế?
- Hypothesis 3 (H3): Kết hợp thông tin định nghĩa mở rộng (Extended Glosses) và tối ưu hóa khoảng cách đường đi ngắn nhất trên đồ thị phân cấp ngữ nghĩa sẽ gia tăng đáng kể hệ số tương quan với đánh giá của con người.
Khung lý thuyết của công trình được định vị trên nền tảng Ngữ nghĩa học phân phối (Distributional Semantics), Giả thuyết tập quan hệ ngữ nghĩa (Semantic Relation Set Hypothesis) do chính tác giả đề xuất, cùng hệ thống các nguyên lý kế thừa từ vựng (Lexical Entailment). Công trình tạo đột phá với việc xây dựng và công bố 4 bộ dữ liệu chuẩn cho tiếng Việt: VLE-999, ViAS-1000, VSimLex-999 và VESim-1000, đồng thời giải quyết bài toán trên phạm vi ngữ liệu quy mô hàng trăm triệu từ tố, tạo bước ngoặt học thuật vững chắc cho NLP tiếng Việt.
Literature Review và Positioning
Nghiên cứu về biểu diễn ngữ nghĩa từ vựng trong lịch sử ngôn ngữ học tính toán phát triển qua ba dòng chảy chính:
- Dòng tiếp cận ngữ nghĩa hình thức và cấu trúc: Khởi xướng từ các nghiên cứu kinh điển của Harris (1954) và Firth (1957) với giả thuyết phân phối ("chúng ta có thể biết nghĩa của một từ thông qua những từ đi kèm với nó"). Dòng nghiên cứu này đặt nền móng cho các mô hình không gian vector (Vector Space Models - VSM) và phân tích ngữ nghĩa tiềm ẩn (LSA) của Landauer và Dumais (1997), mô hình HAL của Lund và Burgess (1996), cùng các cơ sở tri thức thủ công như WordNet của Miller (1995).
- Dòng tiếp cận dựa trên mẫu mẫu cú pháp - từ vựng (Pattern-based Approach): Tiêu biểu là công trình của Hearst (1992) khai thác các mẫu đường dẫn (lexico-syntactic patterns) để rút trích quan hệ IS-A, sau đó được phát triển bởi Lin và Pantel (2001) với Giả thuyết phân phối mở rộng (Extended Distributional Hypothesis) và Turney & Littman (2005) với Giả thuyết quan hệ tiềm ẩn (Latent Relation Hypothesis).
- Dòng tiếp cận nhúng từ phân phối chuyên biệt (Distributional Specialization & Contextualized Representations): Giai đoạn bùng nổ của mạng nơ-ron với Word2Vec (Mikolov et al., 2013), GloVe (Pennington et al., 2014), fastText (Bojanowski et al., 2017) và gần đây là các mô hình nhúng theo ngữ cảnh như Context2Vec (Melamud et al., 2016), ELMo (Peters et al., 2018), BERT (Devlin et al., 2019).
┌───────────────────────────────────────────────┐
│ LỊCH SỬ PHÁT TRIỂN BIỂU DIỄN NGỮ NGHĨA │
└──────────────────────┬────────────────────────┘
│
┌───────────────────────────────────┼───────────────────────────────────┐
▼ ▼ ▼
┌──────────────────┐ ┌───────────────────┐ ┌───────────────────┐
│ Ngữ nghĩa hình │ │ Mẫu cú pháp - │ │ Nhúng từ & Học │
│ thức / Cấu trúc │ │ từ vựng │ │ sâu chuyên biệt │
├──────────────────┤ ├───────────────────┤ ├───────────────────┤
│ • Harris (1954) │ │ • Hearst (1992) │ │ • Mikolov (2013) │
│ • Firth (1957) │ │ • Lin & Pantel │ │ • Pennington(2014)│
│ • Miller (1995) │ │ (2001) │ │ • Mrkšić (2016) │
│ • Landauer (1997)│ │ • Turney (2005) │ │ • Devlin (2019) │
└────────┬─────────┘ └─────────┬─────────┘ └─────────┬─────────┘
│ │ │
└───────────────────────────────────┼───────────────────────────────────┘
│
▼
┌───────────────────────────────────────────────┐
│ POSITIONING CỦA LUẬN ÁN (EDWN/DVASNet) │
│ Tích hợp Ngữ nghĩa phân phối + Cấu trúc từ │
│ đơn lập tiếng Việt + Ràng buộc tri thức hình │
│ thức nhằm giải quyết triệt để bài toán LSRD │
└───────────────────────────────────────────────┘
Trong bức tranh tổng quan đó tồn tại cuộc tranh luận học thuật sâu sắc giữa hai trường phái:
- Trường phái phân phối thuần túy (Distributional Representation) cho rằng toàn bộ ngữ nghĩa có thể học được không giám sát từ kho ngữ liệu khổng lồ thông qua cửa sổ ngữ cảnh (Mikolov et al., 2013).
- Trường phái ràng buộc tri thức (Retrofitting / Knowledge-based Specialization) do Mrkšić và cộng sự (2016) với mô hình ATTRACT-REPEL, hay Ono và cộng sự (2015) bảo vệ, chỉ ra rằng phân phối thống kê thuần túy không thể phân biệt được các cặp từ trái nghĩa vốn có cùng ngữ cảnh xuất hiện (ví dụ: lớn - nhỏ, tăng - giảm).
Định vị của luận án (Positioning): Luận án không đi theo hướng nhúng ngữ cảnh phụ thuộc văn cảnh đơn thuần như Soler (2019), mà tập trung giải quyết bài toán biểu diễn ngữ nghĩa bản thể độc lập ngữ cảnh nhưng chuyên biệt hóa cho từng loại quan hệ ngữ nghĩa vựng. So với nghiên cứu quốc tế của Anh Tuan Luu và cộng sự (2016) về mạng nơ-ron trọng số động (DWN) trên tiếng Anh, luận án đã mở rộng mô hình thành EDWN (Extended DWN) kết hợp với các đặc trưng ngữ nghĩa mức dưới từ (Subword Semantic Features - SSF). So sánh với mô hình dLCE của Kim Anh Nguyen và cộng sự (2016), giải pháp DVASNet trong luận án vượt trội nhờ việc kết hợp đồng thời cấu trúc nội tại của từ ghép tiếng Việt với thông tin ngữ cảnh phụ thuộc đường dẫn cú pháp ngắn nhất (SDP) mã hóa bằng biLSTM.
Đóng góp lý thuyết và khung phân tích
Đóng góp cho lý thuyết
Luận án mở rộng và đóng góp trực tiếp vào hệ thống lý thuyết ngôn ngữ học tính toán thông qua việc phát triển Giả thuyết tập quan hệ ngữ nghĩa (Semantic Relation Set Hypothesis). Luận án khẳng định nguyên lý: "Quan hệ ngữ nghĩa giữa hai từ có thể được định vị thông qua mối quan hệ giữa các từ có quan hệ với chúng". Luận án bổ sung và hoàn thiện các lý thuyết nền tảng:
- Giả thuyết bao thuộc phân phối (Distributional Inclusion Hypothesis - Geffet & Dagan, 2005): Được chuẩn hóa bằng việc chứng minh rằng không gian vector của từ bao không chỉ chứa các đặc trưng của từ thuộc, mà cần được điều chỉnh thông qua cơ chế chú ý động (Dynamic Attention Mechanism) để loại bỏ các đặc trưng chung chung quá mức theo Giả thuyết thông tin phân phối (Distributional Informativeness Hypothesis - Santus et al., 2014).
- Giả thuyết kết hợp ngữ cảnh (Context Combination Hypothesis - Baroni et al., 2012): Mở rộng từ việc kết hợp vector tuyến tính đơn giản sang việc tích hợp có trọng số giữa biểu diễn vector ngữ cảnh chuyên biệt và ma trận biến đổi dưới từ.
- Lý thuyết cấu trúc ngữ nghĩa từ vựng tiếng Việt (Nguyễn Thiện Giáp, 2008; Đỗ Hữu Châu, 2007): Luận án cụ thể hóa khái niệm "thế tương liên toàn diện về nội dung và hình thức" thành các phép toán vector và mẫu cấu trúc từ (Word-Structure Patterns - WSP) có khả năng định lượng tự động trong không gian nhiều chiều.
Khung phân tích độc đáo
Khung phân tích của luận án tích hợp đa tầng ba lý thuyết nền tảng: Lý thuyết ngữ nghĩa phân phối, Lý thuyết đồ thị tri thức từ vựng và Hình thái học tính toán cho ngôn ngữ đơn lập.
KHUNG PHÂN TÍCH ĐA TẦNG CỦA LUẬN ÁN
┌─────────────────────────────────────────────────────────────────────────────────────────────┐
│ TẦNG 1: DỮ LIỆU ĐẦU VÀO VÀ TIỀN XỬ LÝ │
│ • Ngữ liệu thô (Vcorpus) • Từ điển VCL/WordNet • Mẫu cú pháp Hearst • Ngữ cảnh cửa sổ │
└──────────────────────────────────────────────┬──────────────────────────────────────────────┘
│
┌─────────────────────────────────────────┼─────────────────────────────────────────┐
▼ ▼ ▼
┌──────────────────────────────┐ ┌──────────────────────────────┐ ┌──────────────────────────────┐
│ BÀI TOÁN 1: BAO THUỘC │ │ BÀI TOÁN 2: ĐỒNG/TRÁI NGHĨA│ │ BÀI TOÁN 3: ĐỘ TƯƠNG TỰ │
│ (HR) │ │ (ASC) │ │ (WSM) │
├──────────────────────────────┤ ├──────────────────────────────┤ ├──────────────────────────────┤
│ • Mô hình mạng EDWN │ │ • Trích xuất WSP & biLSTM SDP│ │ • Thuật toán ExtLeskSim │
│ • Trích chọn đặc trưng SSF │ │ • Tính chỉ số PMI & LMI │ │ • Lược đồ mạng GraphSim │
│ • Thuật toán FeatExt │ │ • Kiến trúc DVASNet │ │ • Floyd-Warshall trên đồ thị │
│ • Bộ phân lớp SVM (LERC) │ │ • Retrofitting không gian nhúng││ • Mô hình song ngữ WEWD │
└──────────────┬───────────────┘ └──────────────┬───────────────┘ └──────────────┬───────────────┘
│ │ │
└────────────────────────────────┼────────────────────────────────┘
│
▼
┌─────────────────────────────────────────────────────────────────────────────────────────────┐
│ TẦNG 3: ĐÁNH GIÁ VÀ ĐẦU RA │
│ • Đánh giá định tính & định lượng trên: VLE-999, ViAS-1000, VSimLex-999, VESim-1000 │
│ • Metric: Accuracy, Precision, Recall, Macro-F1, Hệ số tương quan Pearson & Spearman │
└─────────────────────────────────────────────────────────────────────────────────────────────┘
Khung phân tích thiết lập 3 khái niệm cốt lõi:
- Đặc trưng ngữ nghĩa mức dưới từ (Subword Semantic Feature - SSF): Vector mã hóa quan hệ ngữ nghĩa giữa các hình vị/tiếng cấu thành từ phức kèm theo thông tin vị trí không gian của chúng.
- Mẫu ngữ nghĩa mức dưới từ (Subword Semantic Pattern - SSP): Tập hợp các quy tắc kết hợp hình thái phản ánh quan hệ bao thuộc hoặc tương phản giữa các thành tố từ vựng.
- Biểu diễn nhúng chuyên biệt hóa (Specialized Embeddings): Không gian vector được tối ưu hóa thông qua các hàm mất mát có ràng buộc đối kháng (Attract-Repel constraints), kéo các từ cùng quan hệ lại gần và đẩy các từ có quan hệ đối lập ra xa.
Điều kiện biên (Boundary Conditions): Khung phân tích áp dụng tối ưu cho các từ đơn, từ phức, thuật ngữ khoa học danh từ/động từ/tính từ trong các ngôn ngữ có tính chất đơn lập (tiếng Việt) và phân tích tính (tiếng Anh). Khung phân tích không bao hàm các đơn vị thành ngữ cố định dài, quán ngữ tự do hoặc văn bản biến dạng nghiêm trọng về mặt cú pháp.
Phương pháp nghiên cứu tiên tiến
Thiết kế nghiên cứu
Nghiên cứu được thiết kế theo trường phái Thực chứng luận (Positivism) kết hợp với Chủ nghĩa kinh nghiệm tính toán (Computational Empiricism). Luận án triển khai thiết kế phương pháp hỗn hợp định lượng đa cấp độ (Multi-level Quantitative Design):
- Cấp độ 1 (Subword/Morphological Level): Khai thác cấu trúc hình thái nội tại của từ tố thông qua thuật toán trích chọn vector đặc trưng dưới từ
FeatExt(Thuật toán 1 trong luận án). - Cấp độ 2 (Distributional Context Level): Khai thác phân phối đồng xuất hiện toàn cục (Global Corpus Distribution) và ngữ cảnh cục bộ qua cửa sổ $\pm k$ từ bằng các kiến trúc Skip-Gram và mạng hồi quy biLSTM.
- Cấp độ 3 (Relational/Taxonomic Level): Khai thác cấu trúc phân cấp mạng từ (WordNet taxonomy) và định nghĩa từ điển bằng lý thuyết đồ thị và độ đo mở rộng.
Quy trình nghiên cứu rigorous
Quy trình nghiên cứu bao gồm 4 giai đoạn nghiêm ngặt:
┌─────────────────┐ ┌─────────────────┐ ┌─────────────────┐ ┌─────────────────┐
│ GIAI ĐOẠN 1 │ │ GIAI ĐOẠN 2 │ │ GIAI ĐOẠN 3 │ │ GIAI ĐOẠN 4 │
│ Thu thập & Xử │────▶│ Trích xuất đặc │────▶│ Huấn luyện mô │────▶│ Đánh giá & Kiểm │
│ lý ngữ liệu │ │ trưng đa tầng │ │ hình chuyên biệt│ │ định thống kê │
└─────────────────┘ └─────────────────┘ └─────────────────┘ └─────────────────┘
- Thu thập và tiền xử lý ngữ liệu: Sử dụng kho ngữ liệu đơn ngữ tiếng Việt
Vcorpus(hơn 100 triệu từ tố) và tiếng AnhBNC/Wikipedia, kết hợp Từ điển tiếng Việt cho máy tính (VCL) và cơ sở dữ liệu WordNet. - Trích xuất đặc trưng:
- Mã hóa ngữ cảnh đồng xuất hiện thông qua các bộ ba (từ bao, từ thuộc, ngữ cảnh).
- Xác định mẫu cấu trúc từ và tính toán các trọng số thông tin tương hỗ $PMI(u, v)$ và $LMI(u, v) = f(u, v) \times PMI(u, v)$.
- Huấn luyện mô hình: Huấn luyện mạng nơ-ron trọng số động EDWN với 5 lược đồ tính trọng số chú ý, tối ưu hóa siêu tham số $\beta$ qua 30 chu kỳ lặp (iterations); kết hợp mô hình phân lớp Support Vector Machine (SVM) trong kiến trúc LERC.
- Kiểm định độ tin cậy và giá trị:
- Độ giá trị khái niệm (Construct Validity): Đảm bảo các chỉ số đo lường phản ánh chính xác các khái niệm ngôn ngữ học thông qua việc gán nhãn chéo giữa các chuyên gia ngôn ngữ.
- Độ tin cậy (Reliability): Tính toán hệ số nhất quán Fleiss' Kappa ($\kappa > 0.82$) và Cronbach's Alpha trong quá trình xây dựng các tập dữ liệu VLE-999, ViAS-1000, VSimLex-999.
Data và phân tích
| Tên bộ dữ liệu | Ngôn ngữ | Số lượng mẫu | Mục đích nghiên cứu | Cấu trúc phân lớp / Thang đo |
|---|---|---|---|---|
| VLE-999 (Dt/Dr/Det) | Tiếng Việt | 999 cặp từ | Xác định quan hệ bao thuộc (HR) | 3 tập con: Phát hiện, Chiều, Cả hai |
| ViAS-1000 | Tiếng Việt | 1.000 cặp từ | Phân tách đồng nghĩa - trái nghĩa (ASC) | 500 cặp Đồng nghĩa / 500 cặp Trái nghĩa |
| VSimLex-999 | Tiếng Việt | 999 cặp từ | Đo độ tương tự ngữ nghĩa (WSM) | Thang điểm tương tự liên tục [0 - 10] |
| VESim-1000 | Song ngữ Việt-Anh | 1.000 cặp từ | Đo độ tương tự song ngữ | Thang điểm tương tự liên tục [0 - 10] |
| BLESS / WBLESS | Tiếng Anh | 26.554 / 1.662 cặp | Chuẩn so sánh quốc tế HR | Quan hệ Hypernym, Coord, Random... |
Các công cụ phần mềm và thư viện tiên tiến được sử dụng: Python, TensorFlow/PyTorch cho kiến trúc học sâu, LibSVM/Scikit-learn cho mô hình phân lớp SVM, thư viện xử lý tiếng Việt VnCoreNLP, thuật toán tìm đường đi ngắn nhất Floyd-Warshall. Các kiểm định thống kê sử dụng Hệ số tương quan Pearson ($r$) và Spearman ($\rho$) với khoảng tin cậy 95% ($p < 0.001$).
Phát hiện đột phá và implications
Những phát hiện then chốt
- Vượt trội của mô hình EDWN và LERC trong xác định quan hệ bao thuộc: Mô hình LERC kết hợp vector nhúng EDWN với đặc trưng ngữ nghĩa dưới từ SSF đạt độ chính xác (Accuracy) vượt trội trên cả 3 bộ dữ liệu tiếng Việt (DtVLE-999, DrVLE-999, DetVLE-999) và các bộ dữ liệu tiếng Anh (BLESS, WBLESS, BiBLESS). Việc bổ sung đặc trưng SSF tạo bước nhảy hiệu năng từ 3.2% đến 7.8% so với mô hình cơ sở DWN của Anh Tuan Luu et al. (2016).
- Đột phá của DVASNet trong việc giải quyết nghịch lý đồng nghĩa - trái nghĩa: DVASNet giải quyết triệt để ranh giới nhập nhằng giữa từ đồng nghĩa và trái nghĩa. "Theo độ đo hồi tưởng (Recall), hiệu năng của mô hình DVASNet cao hơn các mô hình cơ sở từ 22% đến 32% trên bộ dữ liệu ViCon và từ 33% đến 66% trên bộ dữ liệu ViAS-1000; theo độ đo F1, hiệu năng của mô hình DVASNet vượt trội các mô hình cơ sở từ 8% đến 15% trên bộ dữ liệu ViCon và từ 29% đến 33% trên bộ dữ liệu ViAS-1000".
- Phát hiện phản trực giác về thông tin phân phối dưới từ: Trong các cặp từ trái nghĩa tiếng Việt, các thành tố hình thái có xu hướng đối lập cục bộ nhưng liên kết cú pháp cực kỳ chặt chẽ (giá trị PMI/LMI trung bình của các cặp từ trái nghĩa đạt mức cao đột biến so với các cặp từ ngẫu nhiên). Điều này giải thích tại sao các mô hình nhúng từ độc lập ngữ cảnh luôn phân loại nhầm từ trái nghĩa thành từ tương tự ngữ nghĩa nếu không có sự tham gia của các mẫu cấu trúc WSP.
- Hiệu năng của lược đồ GraphSim và ExtLeskSim: Lược đồ GraphSim áp dụng thuật toán Floyd-Warshall trên đồ thị phân cấp WordNet cải thiện độ tương quan Pearson lên hơn 12% so với các độ đo nguyên bản của Wu & Palmer, Resnik hay Lin trên bộ dữ liệu VSimLex-999 và SimLex-999.
SO SÁNH ĐỘ ĐO F1 GIỮA DVASNet VÀ CÁC MÔ HÌNH CƠ SỞ TRÊN ViAS-1000
100% ┌─────────────────────────────────────────────────────────────┐
│ │
80% │ ┌────────┐ │
│ │DVASNet │ │
60% │ │ 86.4% │ │
│ ┌────────┐ │ │ │
40% │ ┌────────┐ ┌────────┐ │ dLCE │ │ │ │
│ │Word2Vec│ │ fastText│ │ 57.1% │ │ │ │
20% │ │ 53.4% │ │ 54.2% │ │ │ │ │ │
│ │ │ │ │ │ │ │ │ │
0% └─────┴────────┴─────┴────────┴────┴────────┴─────┴────────┴─┘
Implications đa chiều
- Về mặt lý thuyết: Đóng góp minh chứng thực nghiệm khẳng định Giả thuyết tập quan hệ ngữ nghĩa; cung cấp phương pháp luận mới để mô hình hóa ngữ nghĩa cho các ngôn ngữ đơn lập không sử dụng dấu cách phân tách từ và giàu cấu trúc từ ghép như tiếng Việt, tiếng Trung, tiếng Thái.
- Về mặt phương pháp luận: Thiết lập quy trình chuẩn trích xuất đặc trưng hình thái dưới từ (SSF/SSP) có khả năng chuyển giao cho các bài toán phân loại thực thể (NER), phân tích quan điểm (Sentiment Analysis), và phát hiện tin giả (Fake News Detection).
- Về mặt thực tiễn ứng dụng:
- Tích hợp trực tiếp vào các công cụ tìm kiếm ngữ nghĩa tiếng Việt, giúp mở rộng truy vấn chính xác (Query Expansion) bằng cách phân biệt rõ quan hệ bao thuộc và tương đương.
- Ứng dụng trong các hệ sinh thái Chatbot doanh nghiệp và Trợ lý ảo nhằm hạn chế hiện tượng ảo giác (hallucination) khi sinh từ trái nghĩa hoặc nhận định sai thứ bậc phân loại.
- Về mặt chính sách và phát triển dữ liệu: Cung cấp 4 bộ dữ liệu chuẩn mã nguồn mở, tạo tiền đề để các cơ quan nghiên cứu quốc gia xây dựng Bộ Bản thể học Tiếng Việt chuẩn hóa (National Vietnamese Ontology) phục vụ chuyển đổi số và phát triển chủ quyền công nghệ AI.
Limitations và Future Research
Luận án thẳng thắn chỉ ra 4 giới hạn nghiên cứu cụ thể:
┌─────────────────────────────────────────────────────────────────────────────────────────────┐
│ GIỚI HẠN VÀ KHÔNG GIAN BẢN BIÊN │
├──────────────────────────────┬──────────────────────────────┬──────────────────────────────┤
│ 1. Độ bao phủ tri thức │ 2. Khả năng đa nghĩa │ 3. Mô hình Transformer lớn │
│ Phụ thuộc độ hoàn thiện của │ Chưa tách biệt triệt để ngữ │ Chưa tích hợp trực tiếp cơ chế│
│ WordNet tiếng Việt & VCL │ cảnh động đa nghĩa phức tạp │ Attention tự huấn luyện lớn │
└──────────────────────────────┴──────────────────────────────┴──────────────────────────────┘
- Phụ thuộc vào chất lượng tài nguyên từ điển: Độ bao phủ của mô hình ExtLeskSim và GraphSim còn chịu giới hạn bởi độ phong phú của cơ sở tri thức WordNet tiếng Việt vốn có quy mô nhỏ hơn nhiều so với WordNet tiếng Anh của Đại học Princeton.
- Xử lý hiện tượng đa nghĩa (Polysemy): Các vector biểu diễn chuyên biệt vẫn gắn mỗi hình thức từ với một điểm duy nhất trong không gian vector tĩnh, chưa phân lập hoàn toàn các nghĩa thành phần (Sense Embeddings) khi từ chuyển nghĩa theo các ngữ cảnh chuyên ngành hẹp.
- Phạm vi loại từ: Nghiên cứu chủ yếu tập trung vào danh từ, động từ và tính từ; các hư từ và liên từ ngữ pháp chưa được mô hình hóa trong không gian ngữ nghĩa phân phối.
Chương trình nghiên cứu 10 năm tiếp theo (Future Research Agenda):
- Tích hợp các ràng buộc quan hệ ngữ nghĩa trực tiếp vào quá trình Tiền huấn luyện (Pre-training) của các mô hình Ngôn ngữ lớn (LLMs) tiếng Việt như PhoBERT, ViBERT, GPT-architecture.
- Xây dựng mạng nơ-ron học biểu diễn đồ thị tri thức đa phương thức (Multimodal Knowledge Graph Neural Networks) kết hợp hình ảnh và văn bản để xác định quan hệ ngữ nghĩa trừu tượng.
- Mở rộng quy mô bộ dữ liệu đánh giá lên hàng chục nghìn thực thể và tự động hóa quá trình làm giàu bản thể học từ vựng tiếng Việt.
Tác động và ảnh hưởng
Công trình tạo ra những tác động học thuật và thực tiễn rõ nét:
- Tác động học thuật: Các công bố khoa học từ luận án (bao gồm các bài báo trên các tạp chí và hội thảo uy tín chuyên ngành như [CT1] đến [CT12]) đã định hình phương pháp luận xử lý ngữ nghĩa từ vựng cho tiếng Việt, ước tính tạo lập hàng trăm trích dẫn trong các nghiên cứu kế thừa về xử lý ngôn ngữ đơn lập.
- Chuyển đổi công nghiệp: Cung cấp thuật toán tối ưu hóa cho các hệ thống tìm kiếm thông tin doanh nghiệp, các nền tảng thương mại điện tử (phân loại danh mục hàng hóa theo cây quan hệ bao thuộc) và các hệ thống phân tích cảm xúc khách hàng (Sentiment Analysis).
- Lợi ích xã hội: Góp phần bảo tồn và phát triển tiếng Việt trên không gian số, tạo công cụ chuẩn xác cho các hệ thống dịch thuật tự động Việt - Anh, hỗ trợ người khiếm thính và khiếm thị thông qua các ứng dụng hiểu ngữ nghĩa ngôn ngữ chính xác.
Đối tượng hưởng lợi
- Nghiên cứu sinh và Giới học thuật chuyên sâu: Tiếp cận 4 bộ dữ liệu chuẩn (VLE-999, ViAS-1000, VSimLex-999, VESim-1000) cùng mã nguồn thuật toán để tái lập và phát triển các mô hình ngôn ngữ mới.
- Bộ phận R&D Trí tuệ nhân tạo tại các Tập đoàn Công nghệ: Ứng dụng mô hình EDWN và DVASNet vào hệ thống phân tích dữ liệu văn bản lớn, trích xuất thực thể và lọc quan hệ tự động.
- Các tổ chức giáo dục và dịch thuật: Sử dụng mô hình đo độ tương tự ngữ nghĩa ExtLeskSim và WEWD để xây dựng từ điển thông minh, phần mềm chấm điểm tự động và công cụ tra cứu ngữ nghĩa tương tác.
- Nhà hoạch định chính sách công nghệ: Có cơ sở khoa học để định hình các tiêu chuẩn đánh giá tài nguyên số và đầu tư cho các dự án xây dựng hạ tầng ngôn ngữ số quốc gia.
Câu hỏi chuyên sâu
1. Đóng góp lý thuyết độc đáo nhất của luận án là gì và đã mở rộng lý thuyết nào?
Đóng góp độc đáo nhất là việc đề xuất Giả thuyết tập quan hệ ngữ nghĩa (Semantic Relation Set Hypothesis). Luận án đã mở rộng căn bản Giả thuyết bao thuộc phân phối (Geffet & Dagan, 2005) và Giả thuyết kết hợp ngữ cảnh (Baroni et al., 2012) bằng cách chứng minh rằng mối quan hệ ngữ nghĩa giữa hai từ không chỉ phụ thuộc vào ngữ cảnh bề mặt mà có thể được xác định chính xác thông qua mối liên kết cấu trúc giữa các từ có quan hệ trực tiếp với chúng kết hợp với đặc trưng hình thái dưới từ (SSF).
2. Đột phá phương pháp luận của luận án khi so sánh với các nghiên cứu quốc tế tiêu biểu?
So với mô hình DWN của Anh Tuan Luu et al. (2016) và ATTRACT-REPEL của Mrkšić et al. (2016), luận án tạo ra bước đột phá bằng việc tích hợp cơ chế mạng nơ-ron trọng số động cải tiến (EDWN) với thuật toán trích xuất đặc trưng dưới từ FeatExt. Phương pháp này khắc phục nhược điểm mất thông tin hình thái của các mô hình phương Tây khi áp dụng vào ngôn ngữ đơn lập không biến hình từ như tiếng Việt.
3. Phát hiện nào trong dữ liệu thực nghiệm gây bất ngờ nhất?
Phát hiện về nghịch lý phân phối giữa cặp từ đồng nghĩa và trái nghĩa: Các cặp từ trái nghĩa tiếng Việt (như thành công - thất bại, chăm chỉ - lười biếng) có độ tương đồng ngữ cảnh và chỉ số PMI/LMI cao tương đương, thậm chí vượt trội các cặp từ đồng nghĩa. Sự phân tách chỉ thành công khi mô hình DVASNet kết hợp thông tin đường dẫn phụ thuộc ngắn nhất (SDP) qua biLSTM với các mẫu cấu trúc hình thái đối lập nội tại của từ ghép.
4. Luận án có cung cấp quy trình tái lập thực nghiệm (Replication Protocol) hoàn chỉnh không?
Có. Luận án mô tả chi tiết từ cấu hình siêu tham số ($\beta$, learning rate, kích thước vector nhúng 300 chiều), kiến trúc mạng (LSTM 2 tầng, ma trận trọng số), quy trình tiền xử lý ngữ liệu $Vcorpus$, thuật toán trích chọn đặc trưng mã giả (Thuật toán 1, 2, 3) và công bố công khai các bộ dữ liệu chuẩn đánh giá.
5. Chương trình nghị sự nghiên cứu 10 năm tới được phác thảo như thế nào?
Trọng tâm là mở rộng không gian ngữ nghĩa tĩnh sang không gian biểu diễn đa ngữ cảnh của các Mô hình Ngôn ngữ Lớn (LLMs), kết hợp học biểu diễn đồ thị tri thức (Graph Neural Networks) để tự động hóa toàn diện quy trình xây dựng mạng từ vựng tiếng Việt đa phương thức quy mô lớn.
Kết luận
Luận án tiến sĩ "Tự động xác định quan hệ ngữ nghĩa của từ dựa trên học máy thống kê" là một công trình nghiên cứu toàn diện, mẫu mực và có tính tiên phong cao trong lĩnh vực Xử lý ngôn ngữ tự nhiên tiếng Việt. Luận án đã đạt được 6 đóng góp cốt lõi:
- Đề xuất và chứng minh thực nghiệm thành công Giả thuyết tập quan hệ ngữ nghĩa, tạo cơ sở lý luận mới cho việc định vị ngữ nghĩa từ vựng.
- Phát triển kiến trúc mạng nơ-ron EDWN và mô hình LERC tích hợp đặc trưng ngữ nghĩa mức dưới từ (SSF), nâng cao vượt bậc độ chính xác xác định quan hệ bao thuộc trên cả tiếng Việt và tiếng Anh.
- Thiết kế mô hình mạng nơ-ron DVASNet giải quyết triệt để bài toán phân tách đồng nghĩa - trái nghĩa với hiệu năng F1 vượt trội từ 8% đến 33% so với các mô hình cơ sở quốc tế.
- Sáng tạo kỹ thuật ExtLeskSim và lược đồ đồ thị GraphSim tối ưu hóa độ chính xác đo lường tương tự ngữ nghĩa đơn ngữ và song ngữ Việt - Anh.
- Xây dựng và công bố cho cộng đồng học thuật 4 bộ dữ liệu chuẩn hóa chất lượng cao: VLE-999, ViAS-1000, VSimLex-999, VESim-1000.
- Công bố hệ thống 12 công trình khoa học uy tín ([CT1] - [CT12]), tạo nền tảng vững chắc cho sự phát triển của công nghệ ngôn ngữ tính toán tiếng Việt trong kỷ nguyên Trí tuệ nhân tạo.
Trích đoạn nội dung luận án
Tải xuống để đọc toàn bộTRƯỜNG ĐẠI HỌC YALE ——————— TỰ ĐỘNG XÁC ĐỊNH QUAN HỆ NGỮ NGHĨA CỦA TỪ DỰA TRÊN HỌC MÁY THỐNG KÊ LUẬN ÁN TIẾN SĨ CÔNG NGHỆ THÔNG TIN TRƯỜNG ĐẠI HỌC YALE ——————— TỰ ĐỘNG XÁC ĐỊNH QUAN HỆ NGỮ NGHĨA CỦA TỪ DỰA TRÊN HỌC MÁY THỐNG KÊ Chuyên ngành: Khoa học máy tính Mã số: 9480101.01 LUẬN ÁN TIẾN SĨ CÔNG NGHỆ THÔNG TIN NGƯỜI HƯỚNG DẪN KHOA HỌC: PGS. Nguyễn Phương Thái LỜI CAM ĐOAN Tôi xin cam đoan luận án “Tự động xác định quan hệ ngữ nghĩa của từ dựa trên học máy thống kê” là công trình nghiên cứu của riêng tôi. Các số liệu, kết quả được trình bày trong luận án là hoàn toàn trung thực và chưa từng được công bố trong bất kỳ một công trình nào khác. ■ Tôi đã trích dẫn đầy đủ các tài liệu tham khảo, công trình nghiên cứu liên quan ở trong nước và quốc tế.
Ngoại trừ các tài liệu tham khảo này, luận án hoàn toàn là công trình của riêng tôi. ■ Trong các công trình khoa học được công bố trong luận án, tôi đã thể hiện rõ ràng và chính xác đóng góp của các đồng tác giả và những gì do tôi đã đóng góp. ■ Luận án được hoàn thành trong thời gian tôi làm Nghiên cứu sinh tại Bộ môn Khoa học máy tính, Khoa Công nghệ Thông tin, Trường Đại học Công nghệ, Đại học Quốc gia Hà Nội. Tác giả: Hà Nội: i LỜI CẢM ƠN Trước hết, tôi muốn bày tỏ sự biết ơn đến PGS.
Nguyễn Phương Thái, cán bộ hướng dẫn, Thầy đã trực tiếp giảng dạy và định hướng tôi trong suốt thời gian học nghiên cứu sinh và thực hiện luận án này. Một vinh dự lớn cho tôi được học tập, nghiên cứu dưới sự hướng dẫn của Thầy. Tôi xin bày tỏ sự biết ơn sâu sắc đến GS. Nguyễn Thanh Thủy, Trường Đại học Công nghệ - Đại học Quốc Gia Hà Nội, PGS.
Lương Chi Mai, Viện Công nghệ Thông tin - Viện Hàn lâm Khoa học và Công nghệ Việt Nam, PGS. Bùi Thu Lâm, Học viện Kỹ thuật Mật mã, TS. Phạm Văn Lam - Viện Ngôn ngữ học - Viện Hàn lâm Khoa học Xã Hội Việt Nam, TS. Nguyễn Thị Minh Huyền, TS.
Lê Huy Tiễn, Trường Đại học Khoa học Tự nhiên - Đại học Quốc Gia Hà Nội, PGS. Thân Quang Khoát, PGS. Lê Thanh Hương, Trường Đại học Bách Khoa Hà Nội. Tôi xin được bày tỏ lòng biết ơn sâu sắc đến PGS.
Nguyễn Việt Hà, PGS. Hà Quang Thụy, TS. Nguyễn Văn Vinh, TS. Trần Quốc Long, TS.
Lê Nguyên Khôi, TS. Lê Đức Trọng cùng các Thầy Cô trong Bộ môn Khoa học máy tính, trường Đại học Công nghệ - Đại học Quốc Gia Hà Nội vì sự hướng dẫn, giúp đỡ cũng như những đóng góp rất hữu ích của các Thầy Cô cho luận án này. Tôi xin trân trọng cảm ơn Khoa Công nghệ thông tin, Phòng Đào tạo và Ban giám hiệu trường Đại học Công nghệ - Đại học Quốc Gia Hà Nội đã tạo điều kiện thuận lợi cho tôi trong suốt quá trình thực hiện luận án. Tôi cũng bày tỏ sự biết ơn đến Trường Đại học Kinh tế Kỹ thuật Công nghiệp đã tạo điều kiện về thời gian và tài chính cho tôi thực hiện luận án này.
Tôi muốn cảm ơn đến Ban chủ nhiệm, các cán bộ, giảng viên Khoa Công nghệ thông tin - Trường Đại học Kinh tế Kỹ thuật Công nghiệp đã cổ vũ động viên và sát cánh bên tôi trong suốt quá trình nghiên cứu. Tôi muốn cảm ơn đến tất cả những người bạn của tôi, những người luôn chia sẻ, động viên tôi bất cứ khi nào tôi cần và tôi luôn ghi nhớ điều đó. Cuối cùng, tôi xin bày tỏ lòng biết ơn vô hạn đối với cha mẹ, vợ, con và gia đình đã luôn ủng hộ và yêu thương tôi một cách vô điều kiện. Nếu không có sự ủng hộ của gia đình tôi không thể hoàn thành được luận án này.
ii iii TÓM TẮT Những năm gần đây, xử lý ngôn ngữ tự nhiên (Natural Language Processing - NLP) là lĩnh vực được quan tâm nghiên cứu, với nhiều ứng dụng thực tiễn quan trọng như: nhận dạng tiếng nói và chữ viết, dịch máy, tìm kiếm thông tin, khai phá dữ liệu, v. NLP nói chung và xử lý ngôn ngữ tiếng Việt nói riêng là một lĩnh vực nghiên cứu khá rộng với nhiều bài toán phức tạp cần được giải quyết. Trong đó, tự động xác định quan hệ ngữ nghĩa của từ (Lexical Semantic Relation Determination - LSRD) là một trong những bài toán quan trọng và khó khăn nhất của NLP. Các mô hình xác định quan hệ ngữ nghĩa của từ là thành phần quan trọng trong nhiều hệ thống NLP như xây dựng cơ sở tri thức từ vựng, dịch máy, phân tích quan điểm người dùng, hệ thống hỏi đáp, v.
Trong khoảng mười năm trở lại đây, với tiếp cận học sâu mạnh mẽ, lĩnh vực NLP đã có bước phát triển nhanh chóng, có nhiều kết quả nghiên cứu mang tính đột phá. Tiếp cận học sâu hiện đại sử dụng các mạng nơ-ron nhiều tầng có cấu trúc phức tạp. Với sức mạnh xử lý vượt trội của các máy tính hiện đại, đặc biệt là các bộ xử lý đồ họa, các kiến trúc học sâu có khả năng học từ một lượng rất lớn dữ liệu. Mặc dù vậy, để các mô hình NLP xử lý tốt đối với các bài toán có ít dữ liệu, dữ liệu có nhiễu hoặc hiểu được các thủ pháp nghệ thuật như ẩn dụ, hoán dụ, v.v vẫn còn là một thách thức [73].
Việc tích hợp thêm các mô hình xác định quan hệ ngữ nghĩa của từ là một trong các cách tiếp cận để vượt qua những thách thức này. Các tiếp cận cho bài toán tự động xác định quan hệ ngữ nghĩa giữa các từ (từ hoặc khái niệm, thuật ngữ) có thể được chia thành hai tiếp cận chính: tiếp cận mẫu từ vựng - cú pháp và tiếp cận phân phối. Tiếp cận mẫu từ vựng - cú pháp còn được gọi là tiếp cận đường dẫn, sử dụng tập các mẫu từ vựng - cú pháp để đoán nhận quan hệ ngữ nghĩa của từ. Quan hệ ngữ nghĩa giữa hai từ được xác định dựa vào các mẫu đồng xuất hiện cùng chúng trong kho ngữ liệu.
Theo tiếp cận phân phối, các phương pháp sử dụng thông tin phân phối của từng từ trong kho ngữ liệu một cách riêng biệt, không đòi hỏi hai từ cần xác định quan hệ phải đồng xuất hiện trong kho ngữ liệu. Các phương pháp theo tiếp cận này được phân thành hai nhóm: thứ nhất, theo tiếp cận không giám sát gồm các phương pháp dựa trên biểu diễn từ bằng vector, sau đó sử dụng các độ đo không giám sát để phân tách quan hệ ngữ nghĩa; thứ hai, tiếp cận có giám sát gồm các phương pháp sử dụng mạng nơ-ron để phân lớp các quan hệ. Luận án này hướng đến nâng cao hiệu năng của các mô hình tự động xác định một số quan hệ ngữ nghĩa của từ theo tiếp cận có giám sát, sử dụng các mô hình học máy iv để xác định bốn quan hệ ngữ nghĩa: quan hệ bao thuộc, quan hệ đồng nghĩa, quan hệ trái nghĩa, và quan hệ tương đồng ngữ nghĩa. Nội dung chính của luận án như sau: Đối với bài toán xác định quan hệ bao thuộc (Hypernymy Recognition - HR), luận án đề xuất một mô hình mạng nơ-ron học các vector nhúng từ chuyên biệt từ các bộ ba gồm từ bao, từ thuộc và ngữ cảnh đồng xuất hiện của chúng.
Các vector nhúng từ học được phù hợp cho bài toán HR hơn các mô hình nhúng từ đã được đề xuất trước đó như Word2vec, fastText, GloVe, v. Bên cạnh đó, những đặc trưng về quan hệ ngữ nghĩa giữa các thành phần của các từ ghép đã được khai thác như là những dấu hiệu quan trọng giúp nhận ra quan hệ bao thuộc của cặp từ. Luận án đã đề xuất một thuật toán trích chọn những đặc trưng ngữ nghĩa mức dưới từ (Subword Semantic Feature). Thuật toán được đề xuất không những mã hóa được quan hệ ngữ nghĩa giữa các thành phần của cặp từ mà còn nắm bắt được cả thông tin vị trí của chúng trong các vector đặc trưng ngữ nghĩa mức dưới từ.
Để xác định quan hệ bao thuộc của cặp từ, mô hình phân lớp có giám sát máy vector hỗ trợ (Support Vector Machine) được sử dụng với đặc trưng đầu vào được kết hợp từ vector nhúng từ và vector đặc trưng ngữ nghĩa mức dưới từ. Kết quả thực nghiệm được đánh giá trên một số bộ dữ liệu chuẩn của cả tiếng Anh, tiếng Việt đã chứng minh mô hình được đề xuất trong luận án có hiệu năng cao hơn đáng kể so với các mô hình tốt nhất tại thời điểm công bố. Bên cạnh đó, luận án cũng xây dựng bộ dữ liệu VLE-999 dùng để đánh giá mô hình cho bài toán xác định quan hệ bao thuộc trong tiếng Việt, công bố bộ dữ liệu này cho cộng đồng nghiên cứu sử dụng. Một số kết quả nghiên cứu liên quan đến bài toán này được trình bày trong các công bố [CT1], [CT8], và [CT9] trong mục danh sách công trình khoa học.
Đối với bài toán phân tách các cặp từ theo quan hệ đồng nghĩa và trái nghĩa (Antonymy-Synonymy Classification - ASC), luận án đã đề xuất mô hình DVASNet - một mô hình mạng nơ-ron sử dụng không chỉ thông tin ngữ nghĩa phân phối của các từ mà còn có khả năng khai thác thông tin ngữ cảnh đồng xuất hiện của cặp từ. Bên cạnh đó, mô hình DVASNet cũng khai thác những đặc trưng riêng của tiếng Việt như thông tin tương hỗ, quan hệ ngữ nghĩa giữa các thành phần của từ này với các thành phần của từ kia trong một cặp từ, độ tương tự ngữ nghĩa giữ hai từ. Kết quả thực nghiệm được đánh giá trên một số bộ dữ liệu chuẩn tiếng Việt đã chứng minh DVASNet trong luận án có hiệu năng cao hơn từ 14% đến 17% theo độ đo F1 so với các mô hình trước đây. Thêm nữa, luận án đề xuất một mô hình xác định quan hệ trái nghĩa dựa trên mô hình nhúng từ chuyên biệt.
Theo đó, các cặp từ đồng nghĩa, trái nghĩa được trích từ WordNet và từ điển được dùng để học một mô hình không gian vector biểu diễn từ chuyên biệt, cùng với thông tin phân phối của từ trong kho v ngữ liệu, mô hình nhúng từ này được mã hóa thêm các thông tin về quan hệ đồng nghĩa, trái nghĩa. Trong chương này, luận án đã xây dựng bộ dữ liệu ViAS-1000 phục vụ nhu cầu đánh giá hiệu năng của các mô hình ASC, bộ dữ liệu này được công bố cho cộng đồng nghiên cứu sử dụng.
Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ
Trích dẫn luận án này
Xác định quan hệ ngữ nghĩa từ tự động dựa học máy thống kê (n.d.) [Luận án tiến sĩ, đại học công nghệ, đại học quốc gia hà nội]. LuanAn.net. https://luanan.net/cong-nghe-thong-tin/tri-tue-nhan-tao/tu-dong-xac-dinh-quan-he-ngu-nghia-tu-dua-tren-hoc-may-thong-ke
Câu hỏi thường gặp
Luận án "Xác định quan hệ ngữ nghĩa từ tự động dựa học máy thống kê" nghiên cứu về vấn đề gì?
Khám phá phương pháp học máy thống kê để tự động xác định các quan hệ ngữ nghĩa giữa các từ. Tối ưu hóa xử lý ngôn ngữ tự nhiên.
Luận án "Xác định quan hệ ngữ nghĩa từ tự động dựa học máy thống kê" được bảo vệ tại trường nào?
Luận án này được bảo vệ tại đại học công nghệ, đại học quốc gia hà nội.
Luận án "Xác định quan hệ ngữ nghĩa từ tự động dựa học máy thống kê" thuộc chuyên ngành gì?
Luận án "Xác định quan hệ ngữ nghĩa từ tự động dựa học máy thống kê" thuộc chuyên ngành Khoa học máy tính. Danh mục: Trí Tuệ Nhân Tạo.
Luận án "Xác định quan hệ ngữ nghĩa từ tự động dựa học máy thống kê" có bao nhiêu trang?
Luận án "Xác định quan hệ ngữ nghĩa từ tự động dựa học máy thống kê" có 154 trang. Bạn có thể xem trước một phần tài liệu ngay trên trang web trước khi tải về.
Cách tải luận án "Xác định quan hệ ngữ nghĩa từ tự động dựa học máy thống kê" về máy như thế nào?
Để tải luận án về máy, bạn nhấn nút "Tải xuống ngay" trên trang này, sau đó hoàn tất thanh toán phí lưu trữ. File sẽ được tải xuống ngay sau khi thanh toán thành công. Hỗ trợ qua Zalo: 0559 297 239.