Xây dựng mô hình mở rộng truy vấn trong truy xuất thông tin văn bản
Xây dựng mô hình mở rộng truy vấn nhằm nâng cao hiệu quả truy xuất thông tin trong hệ thống dữ liệu lớn.
Trường Đại học Bách khoa TP.HCM
Luan An
Luận án Tiến sĩ Kỹ thuật
Năm xuất bản
Số trang
223
Thời gian đọc
34 phút
Lượt xem
1
Lượt tải
0
Phí lưu trữ
50 Point
Tổng quan nhanh
- Chủ đề:
- Mở rộng truy vấn: Cải thiện kết quả truy xuất thông tin
- Số trang:
- 223 trang
- Trường:
- Trường Đại học Bách khoa TP.HCM
- Chuyên ngành:
- Khoa học máy tính
- Tác giả:
- Nguyễn Chánh Thành
- Năm:
- 2010
Tóm tắt nội dung luận án
I.Mở rộng truy vấn Cải thiện kết quả truy xuất thông tin
Trong truy xuất thông tin (IR), người dùng thường sử dụng các truy vấn đơn giản. Các truy vấn này thường ngắn gọn, thiếu thông tin ngữ cảnh cần thiết. Điều này dẫn đến kết quả tìm kiếm không đầy đủ hoặc chất lượng thấp. Hệ thống IR không thể đáp ứng trọn vẹn nhu cầu người dùng. Vì vậy, mở rộng truy vấn là một giải pháp thiết yếu. Mục tiêu là bổ sung thông tin liên quan, làm giàu truy vấn ban đầu. Quá trình này giúp cải thiện đáng kể hiệu quả và độ chính xác của kết quả tìm kiếm. Mở rộng truy vấn tự động tối ưu hóa trải nghiệm người dùng.
1.1. Thách thức truy vấn đơn giản
Người dùng thường nhập các truy vấn ngắn, không đầy đủ. Điều này làm hạn chế khả năng hệ thống truy xuất thông tin (IR) tìm thấy các tài liệu phù hợp. Kết quả thường thiếu sót, không đáp ứng nhu cầu. Chất lượng tìm kiếm giảm sút đáng kể. Hạn chế này đòi hỏi các giải pháp nâng cao khả năng hiểu truy vấn.
1.2. Vai trò của mở rộng truy vấn tự động
Mở rộng truy vấn là quá trình bổ sung hoặc sửa đổi các thuật ngữ trong truy vấn ban đầu. Mục tiêu là làm cho truy vấn phong phú hơn, bao gồm nhiều ngữ cảnh hơn. Quá trình này giúp hệ thống IR tìm kiếm hiệu quả hơn, tăng cường độ liên quan của kết quả. Nó thường được thực hiện tự động để tối ưu hóa trải nghiệm người dùng. Đây là bước quan trọng để nâng cao độ phủ và độ chính xác.
1.3. Nguồn thông tin ngữ cảnh cho truy vấn
Thông tin ngữ cảnh có thể đến từ nhiều nguồn. Phản hồi liên quan từ người dùng là một nguồn giá trị. Phản hồi giả liên quan cũng được sử dụng, dựa trên các tài liệu được xếp hạng cao ban đầu. Đồng hiện thuật ngữ và các mô hình tri thức như Ontology cung cấp thông tin ngữ nghĩa sâu sắc. Điều này hỗ trợ việc xây dựng truy vấn mở rộng có chất lượng cao, tăng cường truy xuất thông tin ngữ cảnh.
II.Ontology Giải pháp mạnh mẽ cho mở rộng truy vấn
Ontology (bản thể học) là một công cụ mạnh mẽ trong truy xuất thông tin. Nó cung cấp một mô hình cấu trúc hóa cho các khái niệm và mối quan hệ. Điều này vượt xa các phương pháp mở rộng truy vấn truyền thống. Ontology giúp hệ thống hiểu sâu sắc ý nghĩa của truy vấn và tài liệu. Việc này cho phép mở rộng truy vấn dựa trên ngữ nghĩa, không chỉ từ khóa đơn thuần. Từ điển đồng nghĩa và các mạng ngữ nghĩa là nền tảng của ontology. Chúng hỗ trợ phân tích ngữ nghĩa hiệu quả.
2.1. Bản thể học và lợi ích trong IR
Ontology là một mô hình tri thức. Nó biểu diễn các khái niệm, thuộc tính và mối quan hệ giữa chúng trong một miền cụ thể. Trong truy xuất thông tin, ontology cung cấp hiểu biết ngữ nghĩa. Điều này cải thiện khả năng hệ thống giải thích truy vấn. Nó giúp liên kết các thuật ngữ khác nhau nhưng có ý nghĩa tương tự. Ontology nâng cao độ chính xác và độ phủ của tìm kiếm.
2.2. Các tiếp cận ontology hiện có
Nhiều nghiên cứu đã ứng dụng Ontology từ đầu thập niên 1990. Một số nhóm sử dụng WordNet, một từ điển đồng nghĩa lớn. Các nhóm khác phát triển Ontology tùy chỉnh cho các miền cụ thể. Các cấu trúc Ontology đề xuất bao gồm lớp, thể hiện, thuộc tính, hoặc quan hệ IS-A, tương đương. Đây là nền tảng cho phân tích ngữ nghĩa sâu rộng, hỗ trợ mở rộng truy vấn tự động.
2.3. Khai thác quan hệ ngữ nghĩa từ ontology
Ontology cho phép khai thác các quan hệ như thượng danh (hypernymy) và hạ danh (hyponymy). Những quan hệ này được trích dẫn từ WordNet. Các quan hệ bổ sung như chú giải (gloss), chủ đề và miền cũng được định nghĩa. Việc này xây dựng một mạng ngữ nghĩa phong phú. Mạng ngữ nghĩa giúp mở rộng truy vấn một cách thông minh, dựa trên ý nghĩa thực sự của từ.
III.Xây dựng và huấn luyện Ontology cho truy vấn
Việc xây dựng một ontology chất lượng là yếu tố then chốt. Nó đảm bảo hiệu quả của mô hình mở rộng truy vấn. Quá trình này bao gồm khai thác kho ngữ liệu lớn và rút trích thông tin từ các nguồn tri thức có sẵn. Việc huấn luyện ontology yêu cầu các phương pháp có hệ thống. Điều này giúp hệ thống có thể nhận diện và tổ chức các khái niệm, thuộc tính, và mối quan hệ. Một ontology được xây dựng tốt cung cấp nền tảng vững chắc cho phân tích ngữ nghĩa và truy xuất thông tin ngữ cảnh.
3.1. Phương pháp phát triển ontology
Việc phát triển Ontology là một bước quan trọng. Nó có thể được thực hiện thông qua khai thác kho ngữ liệu. Dữ liệu từ các văn bản lớn được phân tích để xác định khái niệm và mối quan hệ. Một phương pháp khác là rút trích thông tin từ các tài nguyên có sẵn như WordNet. Những phương pháp này đảm bảo Ontology có độ phủ và chính xác cao. Điều này tạo cơ sở vững chắc cho các mô hình mở rộng truy vấn.
3.2. Rút trích dữ liệu từ kho ngữ liệu và WordNet
Khai thác kho ngữ liệu liên quan đến việc phân tích tần suất đồng hiện từ khóa. Nó cũng xem xét các mẫu ngôn ngữ. Từ WordNet, hệ thống rút trích các mối quan hệ ngữ nghĩa đã được xác định trước. Ví dụ, quan hệ đồng nghĩa, đối nghĩa, bao trùm. Quá trình này giúp tự động hóa việc xây dựng và làm giàu Ontology. Đây là nền tảng cho việc hiểu sâu sắc hơn về ngữ cảnh.
3.3. Hoàn thiện cấu trúc bản thể học
Sau khi rút trích dữ liệu, Ontology cần được hoàn thiện. Điều này bao gồm việc tổ chức lại các khái niệm và quan hệ. Đảm bảo tính nhất quán và không trùng lặp là cần thiết. Cấu trúc này hỗ trợ hiệu quả cho mô hình mở rộng truy vấn. Nó tăng cường phân tích ngữ nghĩa và truy xuất thông tin ngữ cảnh. Độ chính xác của Ontology ảnh hưởng trực tiếp đến hiệu suất hệ thống.
IV.Phương pháp mở rộng truy vấn dựa trên ngữ cảnh
Mô hình đề xuất tập trung vào mở rộng truy vấn dựa trên cơ sở ontology. Phương pháp này tận dụng các mối quan hệ ngữ nghĩa trong ontology để bổ sung thuật ngữ cho truy vấn gốc. Điều này giúp truy vấn không chỉ khớp từ khóa mà còn khớp ý nghĩa. Quy trình này cho phép hệ thống tìm kiếm tài liệu có liên quan về mặt ngữ nghĩa, ngay cả khi chúng không chứa chính xác các từ khóa ban đầu. Việc này cải thiện đáng kể truy xuất thông tin ngữ cảnh, tăng cường độ phủ của kết quả tìm kiếm.
4.1. Quy trình mở rộng truy vấn dựa ontology
Quá trình mở rộng truy vấn bắt đầu từ truy vấn ban đầu. Hệ thống sử dụng Ontology để tìm các thuật ngữ liên quan ngữ nghĩa. Các thuật ngữ này có thể là đồng nghĩa, từ có quan hệ thượng/hạ danh. Kết quả là một truy vấn mới, phong phú hơn. Truy vấn mới chứa các từ khóa mở rộng, bao quát nhiều khía cạnh hơn. Đây là một dạng mở rộng truy vấn tự động hiệu quả.
4.2. Tích hợp thông tin ngữ nghĩa
Mô hình đề xuất tích hợp sâu sắc thông tin ngữ nghĩa. Nó không chỉ đơn thuần thêm từ đồng nghĩa. Hệ thống phân tích ý nghĩa của truy vấn trong ngữ cảnh. Các thuật ngữ mở rộng được chọn lọc kỹ càng. Việc này đảm bảo độ chính xác và tránh nhiễu thông tin. Điều này cải thiện đáng kể truy xuất thông tin ngữ cảnh. Phân tích ngữ nghĩa là trọng tâm của phương pháp này.
4.3. Cải tiến truy vấn để tăng độ phủ
Mục tiêu chính là tăng độ phủ của kết quả tìm kiếm. Bằng cách bổ sung các thuật ngữ liên quan, hệ thống có thể truy cập nhiều tài liệu hơn. Các tài liệu này có thể không chứa chính xác từ khóa gốc. Tuy nhiên, chúng có ý nghĩa tương đồng. Điều này dẫn đến một tập kết quả đầy đủ và toàn diện hơn. Mô hình ngôn ngữ tiềm năng có thể nâng cao hiệu quả này trong tương lai.
V.Đánh giá hiệu quả mô hình mở rộng truy vấn
Phần thực nghiệm của luận án kiểm tra tính khả thi và hiệu suất của mô hình. Các thử nghiệm được tiến hành trên bộ dữ liệu tiêu chuẩn trong lĩnh vực truy xuất thông tin. Việc đánh giá sử dụng các chỉ số phổ biến để đo lường độ chính xác và độ phủ của kết quả. Kết quả thực nghiệm cho thấy sự cải thiện rõ rệt so với các phương pháp truyền thống. Điều này khẳng định tiềm năng ứng dụng và phát triển của phương pháp mở rộng truy vấn dựa trên ontology.
5.1. Thiết lập môi trường thực nghiệm
Mô hình được thử nghiệm trên ngôn ngữ tiếng Anh. Dữ liệu và truy vấn từ nguồn TREC (Text REtrieval Conference) được sử dụng. TREC cung cấp một bộ dữ liệu tiêu chuẩn cho nghiên cứu IR. Các thử nghiệm được tiến hành trong một số lĩnh vực cụ thể. Điều này cho phép đánh giá khách quan và so sánh kết quả. Môi trường thực nghiệm chuẩn hóa đảm bảo tính tin cậy.
5.2. Các chỉ số đánh giá hiệu suất
Hiệu suất của mô hình được đánh giá bằng các chỉ số IR tiêu chuẩn. Độ chính xác (Precision) đo tỷ lệ tài liệu liên quan trong kết quả. Độ phủ (Recall) đo tỷ lệ tài liệu liên quan được tìm thấy. Các chỉ số khác như F-measure cũng có thể được áp dụng. Việc này cung cấp một cái nhìn toàn diện về chất lượng tìm kiếm, giúp so sánh với các phương pháp khác.
5.3. Kết quả và tiềm năng phát triển
Kết quả thực nghiệm khẳng định tính khả thi của phương pháp đề xuất. Mô hình mở rộng truy vấn dựa trên Ontology mang lại cải thiện đáng kể. Điều này cho thấy nhiều triển vọng phát triển cho các đề xuất lý thuyết. Những cải tiến này có thể bao gồm việc tích hợp Word embeddings hoặc mô hình ngôn ngữ tiên tiến hơn trong tương lai, nhằm nâng cao hơn nữa độ chính xác và độ phủ.
Mục lục chi tiết luận án
Tải xuống file đầy đủ để xem toàn bộ nội dung
Tải đầy đủ (223 trang)Nội dung chính
Tổng quan về luận án
Trong kỷ nguyên bùng nổ của mạng toàn cầu (World Wide Web), phần lớn tri thức nhân loại được biểu diễn dưới dạng văn bản ngôn ngữ tự nhiên phi cấu trúc. Tuy nhiên, hiệu năng của các hệ thống truy xuất thông tin (Information Retrieval - IR) truyền thống và các công cụ tìm kiếm kinh điển như Google, Yahoo hay Bing luôn đối mặt với một rào cản nền tảng: sự đứt gãy ngữ nghĩa giữa truy vấn của người dùng và tài liệu mục tiêu. Luận án tiến sĩ kỹ thuật chuyên ngành Khoa học máy tính (Mã số: 62.01) của tác giả Nguyễn Chánh Thành, dưới sự hướng dẫn khoa học của PGS. Phan Thị Tươi tại Trường Đại học Bách khoa – Đại học Quốc gia TP. Hồ Chí Minh (2010), mang tên "Xây dựng mô hình mở rộng truy vấn trong truy xuất thông tin văn bản", đã giải quyết trực diện bài toán cốt lõi này bằng việc thiết lập một khung lý thuyết và giải thuật mở rộng truy vấn đột phá dựa trên bản thể học (ontology).
Nghiên cứu xác định rõ khoảng trống học thuật then chốt (research gap): các mô hình truy xuất từ khóa truyền thống làm triệt tiêu ngữ nghĩa của tài liệu và truy vấn. Người dùng thường có xu hướng phát biểu các truy vấn rất ngắn (thường chỉ từ 1 đến 3 từ khóa cốt lõi), dẫn đến tính nhập nhằng cao và thiếu ngữ cảnh biểu đạt. Quan sát kinh điển của Krovetz và Croft đã khẳng định việc tìm kiếm có độ truy hồi cao phụ thuộc chặt chẽ vào cơ chế so trùng từ khóa, song việc so trùng thuần túy không thể bao hàm các khái niệm tương đồng. Mặt khác, các phương pháp mở rộng truy vấn dựa trên WordNet truyền thống (như nghiên cứu của Voorhees) thường gặp hiện tượng trôi dạt ngữ nghĩa (query drift) do quan hệ phân cấp $IS\text{-}A$ không đủ năng lực khu biệt ngữ cảnh của các từ đa nghĩa, trong khi các ontology miền chuyên biệt lại đòi hỏi chi phí thiết kế thủ công khổng lồ và thiếu khả năng thích ứng linh hoạt.
Để giải quyết triệt để khoảng trống trên, luận án thiết lập ba câu hỏi nghiên cứu (Research Questions - RQ) và ba giả thuyết khoa học (Hypotheses - H) cụ thể:
- RQ1: Làm thế nào để hình thức hóa cấu trúc ngữ nghĩa của truy vấn ngắn dưới dạng toán học và ngôn ngữ học nhằm khử nhập nhằng mà không phụ thuộc vào tương tác thời gian thực với kho ngữ liệu?
- H1: Một mô hình ontology cấu trúc theo bộ ba Đối tượng – Thành phần – Tính chất (OOMP) có khả năng biểu diễn đầy đủ các quan hệ ngữ nghĩa cốt lõi để xác định tính hoàn chỉnh của một truy vấn dạng cụm danh từ.
- RQ2: Quy trình huấn luyện và tự động làm giàu ontology có thể thực hiện như thế nào thông qua việc kết hợp kho ngữ liệu tĩnh và mạng từ vựng tổng quát?
- H2: Việc tích hợp phương pháp huấn luyện dựa trên kho ngữ liệu (CB-KBT), dựa trên WordNet (WB-KBT) và cơ chế tự huấn luyện (A-KBT) sẽ tối ưu hóa độ bao phủ của các quan hệ ngữ nghĩa với độ chính xác cao.
- RQ3: Việc tích hợp ontology OOMP vào cấu trúc chỉ mục và động cơ tìm kiếm cục bộ có nâng cao vượt bậc độ chính xác và độ truy hồi của hệ thống IR hay không?
- H3: Cấu trúc chỉ mục hướng ngữ nghĩa (SIC) kết hợp giải thuật tìm kiếm lai (HS) sẽ tạo ra bước nhảy vọt về Mean Average Precision (MAP) so với các giải pháp tìm kiếm so trùng từ khóa thô.
Khung lý thuyết của luận án tích hợp chặt chẽ bốn trụ cột: Lý thuyết Phân tích Khái niệm Chính quy (Formal Concept Analysis - FCA), Ngữ pháp Cụm danh từ dựa trên Penn TreeBank, Lý thuyết Khái niệm/Ontology của Gruber và Bates, cùng Mô hình Truy xuất Xác suất BM25 của Sparck-Jones. Phạm vi nghiên cứu tập trung vào không gian ngữ liệu chuẩn TREC (Text REtrieval Conference), mạng từ vựng WordNet 3.0 và hệ thống luật sinh trích xuất mẫu chú giải JAPE trên nền tảng kiến trúc kỹ nghệ văn bản GATE, mang lại ý nghĩa học thuật và ứng dụng thực tiễn to lớn cho ngành khoa học máy tính tại Việt Nam và quốc tế.
Literature Review và Positioning
Bức tranh tổng quan học thuật về mở rộng truy vấn (Query Expansion - QE) trong truy xuất thông tin được luận án hệ thống hóa thành hai trường phái chính:
Trường phái thứ nhất là Mở rộng truy vấn sử dụng mô hình tri thức phụ thuộc kho ngữ liệu (Corpus-dependent QE). Hướng tiếp cận này dựa trên việc khai thác thông tin phản hồi liên quan (relevance feedback) và thống kê từ đồng hiện (co-occurrence). Peat và Willett (1991) chỉ ra rằng việc thêm các từ có tần suất xuất hiện cao không mang lại hiệu quả phân biệt tài liệu liên quan. Schatz và cộng sự (1996) đề xuất kết hợp từ điển chuyên đề (thesauri) do chuyên gia xây dựng với danh mục đồng hiện tự động, chứng minh chất lượng tìm kiếm phụ thuộc vào mật độ khái niệm chuẩn. Mandala và cộng sự (1999) cùng Huang và cộng sự (2005) đề xuất tích hợp đa kỹ thuật tạo chỉ mục từ khóa và khái niệm. Vechtomova (2003) khai thác gom nhóm từ thông dụng (long-span collocates) theo cửa sổ chủ đề cục bộ, tuy nhiên vẫn bộc lộ hạn chế làm mất tài liệu liên quan nếu kho ngữ liệu không đủ phong phú. Pustejovsky (1995) với lý thuyết tập từ vựng khả sinh (Generative Lexicon) và Callan (1992) với hệ thống INQUERY (dựa trên mạng suy diễn - inference net) đã chứng minh tầm quan trọng của việc kết hợp xử lý hình thái và phân cấp khái niệm (như Sanderson & Lawrie, 2000; Sanderson, 2004).
Trường phái thứ hai là Mở rộng truy vấn sử dụng mô hình tri thức độc lập kho ngữ liệu (Corpus-independent QE). Nhóm này chia thành ba nhánh nhỏ:
- Xây dựng ontology chuyên biệt độc lập: Kashyap (2001) tái sử dụng lược đồ cơ sở dữ liệu để tạo ontology nhưng gặp hạn chế bởi tính rời rạc của mô hình quan hệ; Hwang (1999) sinh ontology tự động từ từ hạt giống nhưng phụ thuộc chuyên gia; Lame (2003) và Saias (2002) trích xuất khái niệm từ phân tích văn bản pháp luật và cụm động từ; Fu và cộng sự (2005) đề xuất mô hình bộ ba không gian $\langle\text{what, rel, where}\rangle$ trong ontology địa lý nhưng quan hệ rel bị bó hẹp. Agrawal (1998) với hệ thống TAPER phân loại văn bản thừa kế đạt mức lỗi tỷ lệ nghịch với số nét ngữ nghĩa (từ 25,1% cho 160 từ mẫu Patent xuống 11,7% cho 200 từ mẫu Communication, 17,8% cho 890 từ Electricity và 16,6% cho 9.130 từ Electronics), đạt độ chính xác trung bình 76%.
- Sử dụng ontology tổng quát WordNet: Gonzalo và cộng sự (1998) dùng SEMCOR khử nhập nhằng thủ công, chứng minh chỉ mục ngữ cảnh cải thiện hơn 29% chất lượng truy xuất so với hệ thống SMART chuẩn. Ngược lại, Voorhees (1993, 1994) chỉ ra rằng việc mở rộng truy vấn tự động bằng synset trên dữ liệu TREC làm giảm hiệu quả đối với các truy vấn dài, và quan hệ phân cấp $IS\text{-}A$ không đủ mạnh để định vị nghĩa chính xác cho các truy vấn ngắn. Hearst (1992) đã thành công khi dùng so trùng mẫu để phát hiện quan hệ từ vựng bao hàm tương thích với phân cấp danh từ WordNet.
- Xây dựng ontology chuyên biệt kết hợp WordNet: Finkelstein và cộng sự (2002) phát triển hệ thống Intellizap tìm kiếm theo ngữ cảnh vượt trội hơn Google, Yahoo, Alta Vista đương thời; Navigli và Velardi (2003) chứng minh thông tin ngữ nghĩa từ ontology hiệu quả hơn việc dùng từ chú giải (gloss words) trên tập 24 truy vấn TREC 2001; Baziz và cộng sự (2005) xây dựng lõi ngữ nghĩa tài liệu từ WordNet; Sandhya Revuri và cộng sự (2005) mở rộng quan hệ $IS\text{-}A$, Disjointness và Equivalence đạt độ chính xác 23% và độ triệu hồi 34%.
+-------------------------------------------------------------+
| TRƯỜNG PHÁI MỞ RỘNG TRUY VẤN (QE TRONG IR) |
+-------------------------------------------------------------+
/ \
/ \
+--------------------------------------------+ +--------------------------------------------+
| 1. PHỤ THUỘC KHO NGỮ LIỆU (Corpus-based) | | 2. ĐỘC LẬP KHO NGỮ LIỆU (Ontology/WordNet) |
+--------------------------------------------+ +--------------------------------------------+
| - Từ đồng hiện, Feedback (Peat & Willett) | | - Ontology miền chuyên biệt (Fu, Kashyap) |
| - Mạng suy diễn INQUERY (Callan, 1992) | | - Mở rộng qua WordNet (Voorhees, Gonzalo) |
| - Phân cấp khái niệm (Sanderson, 2004) | | - Kết hợp ngữ cảnh (Intellizap, Navigli) |
+--------------------------------------------+ +--------------------------------------------+
\ /
\ /
+-----------------------------------------------+
| KHOẢNG TRỐNG: Thiếu mô hình hình thức hóa |
| quan hệ thực thể, phụ thuộc tương tác nặng, |
| và trôi dạt ngữ nghĩa trên truy vấn ngắn. |
+-----------------------------------------------+
|
v
+-----------------------------------------------+
| ĐỊNH VỊ CỦA LUẬN ÁN (NGUYỄN CHÁNH THÀNH) |
+-----------------------------------------------+
| Mô hình Ontology OOMP (Object-Member-Property)|
| + Huấn luyện đa nguồn (CB-KBT, WB-KBT, A-KBT) |
| + Chuẩn hóa Cụm Danh từ hoàn chỉnh (CNPV/NPC) |
| + Chỉ mục hướng ngữ nghĩa (SIC & Hybrid Search)|
+-----------------------------------------------+
Luận án định vị nghiên cứu tại giao điểm đột phá: xây dựng một ontology cấu trúc hướng đối tượng độc lập kho ngữ liệu thời gian thực, khắc phục triệt để hiện tượng trôi dạt ngữ nghĩa của Voorhees (1994) và mở rộng năng lực biểu diễn ngữ nghĩa vượt trên giới hạn synset của Gonzalo (1998).
Đóng góp lý thuyết và khung phân tích
Đóng góp cho lý thuyết
Luận án đã mở rộng nền tảng lý thuyết biểu diễn tri thức ontology (Gruber, 2003) và lý thuyết truy xuất thông tin cấu trúc bằng việc hình thức hóa toán học hệ thống các quan hệ ngữ nghĩa nội tại trong cụm từ:
- Thiết lập hệ thống quan hệ khái niệm hình thức:
- Quan hệ $R_m$ (Member relation): Xác định thành phần đặc trưng cấu thành nên đối tượng ($Object \to Member$).
- Quan hệ $R_p$ (Property relation): Xác định tính chất đặc trưng của thành phần ($Member \to Property$).
- Quan hệ $R_{fm}$ và $R_{fp}$: Xác định các tính chất trội tương ứng của thành phần và đối tượng trong không gian khái niệm.
- Mô hình hóa toán học bài toán mở rộng truy vấn (MQE): Luận án định nghĩa chính xác bốn không gian mô hình mở rộng truy vấn:
- $MQE^{-+IR}_{OB}$: Mô hình mở rộng truy vấn hướng đối tượng cơ bản;
- $MQE^{-+IR}_{OB+P}$: Mô hình mở rộng truy vấn hướng đối tượng bổ sung tính chất;
- $MQE^{++IR}_{OB}$: Mô hình mở rộng truy vấn tăng cường mức đối tượng;
- $MQE^{++IR}_{OB+P}$: Mô hình mở rộng truy vấn tăng cường toàn phần tích hợp đối tượng và thuộc tính.
- Hình thức hóa khái niệm "Truy vấn hoàn chỉnh" (Complete Query): Dưới góc độ ngôn ngữ học tính toán, một truy vấn hoàn chỉnh được mô hình hóa thành một cấu trúc cây phân tích (parse tree) và đồ thị ngữ nghĩa $G$ phân lớp, bảo toàn tính chất ảnh và tạo ảnh trong ánh xạ toán học giữa không gian truy vấn $Q$ và không gian khái niệm $C$.
Khung phân tích độc đáo
Khung phân tích của luận án tích hợp liên ngành ba cấu trúc lý thuyết: Lý thuyết Phân tích Khái niệm Chính quy (FCA), Ngữ pháp Cụm danh từ (Noun Phrase Syntax) dựa trên Penn TreeBank, và Cấu trúc cơ sở dữ liệu quan hệ hướng đối tượng.
+---------------------------------------+
| CÂU TRUY VẤN BAN ĐẦU CỦA NGƯỜI DÙNG|
| (Dạng cụm danh từ ngắn) |
+---------------------------------------+
|
v
+-------------------------------------------------------------------------------------------------------------------+
| KHUNG PHÂN TÍCH VÀ XỬ LÝ NGỮ NGHĨA OOMP |
| |
| +--------------------+ Kiểm tra hoàn chỉnh +----------------------+ |
| | Giải thuật CNPV | --------------------------------> | Truy vấn hoàn chỉnh | |
| +--------------------+ (Complete Noun Phrase) +----------------------+ |
| | | |
| | Không đạt | Đạt |
| v v |
| +--------------------+ Rút gọn thành phần +----------------------+ Mở rộng tương đương |
| | Giải thuật NPC/NPMR| --------------------------------> | Giải thuật SNPE | -----------------+ |
| +--------------------+ (Completion / Reduction) +----------------------+ | |
+-----------------------------------------------------------------------------------------------------|-------------+
|
v
+-------------------------------------------------------------------------------------------------------------------+
| TẦNG TRI THỨC VÀ CHỈ MỤC HƯỚNG NGỮ NGHĨA |
| |
| +-------------------------------------------------------------------------------+ |
| | ONTOLOGY OOMP ĐA QUAN HỆ | |
| | - Quan hệ Rm (Object - Member) - Quan hệ Rp (Member - Property) | |
| | - Huấn luyện CB-KBT (Corpus) - Huấn luyện WB-KBT (WordNet) | |
| | - Tự huấn luyện A-KBT (Auto-training) | |
| +-------------------------------------------------------------------------------+ |
| | |
| v |
| +--------------------+ Tạo chỉ mục ngữ nghĩa +----------------------+ Tìm kiếm kết hợp +-------------+ |
| | Kho ngữ liệu TREC | -------------------------> | Tập chỉ mục SIC | -------------------> | Giải thuật | |
| | (Dữ liệu chuẩn IR) | | (Semantic TermLink) | | Hybrid | |
| +--------------------+ +----------------------+ | Search (HS) | |
+--------------------------------------------------------------------------------------------------|-------------+--+
|
v
+-------------------------------+
| KẾT QUẢ TRUY XUẤT TỐI ƯU |
| (Tăng MAP, Precision, Recall) |
+-------------------------------+
Điều kiện biên (boundary conditions) của khung phân tích được xác lập chặt chẽ: áp dụng tối ưu cho các truy vấn ngắn gồm ba thành phần danh ngữ tiếng Anh, vận hành trên cấu trúc ngữ liệu chuẩn hóa có sự ánh xạ tương thích với các quan hệ từ vựng trong WordNet 3.0.
Phương pháp nghiên cứu tiên tiến
Thiết kế nghiên cứu
Luận án tuân thủ triết lý Thực chứng tính toán (Computational Positivism/Empiricism), kết hợp chặt chẽ giữa suy diễn hình thức toán học và kiểm định thực nghiệm trên hệ thống phần mềm thực thi. Thiết kế nghiên cứu đa tầng (multi-level computational design) được tổ chức thành ba phân hệ chính:
- Tầng Tri thức (Knowledge Layer): Cấu trúc Ontology OOMP lưu trữ trên hệ quản trị cơ sở dữ liệu quan hệ, tích hợp các bảng thực thể và liên kết quan hệ $R_m, R_p$.
- Tầng Ngôn ngữ học tính toán (NLP Layer): Khai thác kiến trúc GATE (General Architecture for Text Engineering) và động cơ mẫu JAPE (Java Annotation Patterns Engine) để bóc tách, gán nhãn từ loại (POS tagging) và nhận dạng cụm danh từ theo chuẩn Penn TreeBank.
- Tầng Động cơ Truy xuất (IR Engine Layer): Xây dựng Động cơ Tìm kiếm Cục bộ (ISE), bộ tạo chỉ mục ngữ nghĩa (SIC) và mô hình tìm kiếm kết hợp (HS).
Quy trình nghiên cứu rigorous
Quy trình nghiên cứu được thiết kế nghiêm ngặt theo chu trình khép kín:
+---------------------------------------------------------------------------------------------------+
| QUY TRÌNH NGHIÊN CỨU RIGOROUS |
+---------------------------------------------------------------------------------------------------+
| |
| [PHA 1: THIẾT LẬP DỮ LIỆU & HUẤN LUYỆN ONTOLOGY] |
| - Trích xuất tập cụm danh từ từ TREC qua bộ mẫu JAPE (Corpus-Based Training: CB-KBT). |
| - Rút trích quan hệ Meronymy, Holonymy, Attribute, Similar từ WordNet 3.0 (WB-KBT). |
| - Kích hoạt thuật toán tự huấn luyện A-KBT để tối ưu hóa không gian liên kết. |
| |
| | |
| v |
| |
| [PHA 2: CHUẨN HÓA VÀ XỬ LÝ TRUY VẤN ĐẦU VÀO] |
| - Kiểm tra tính hoàn chỉnh của cụm danh từ bằng giải thuật CNPV. |
| - Xử lý các trường hợp lỗi mẫu bằng giải thuật Hoàn chỉnh (NPC) và Rút gọn (NPMR). |
| - Mở rộng ngữ nghĩa tương đương qua giải thuật SNPE trên cấu trúc OOMP. |
| |
| | |
| v |
| |
| [PHA 3: THIẾT LẬP CHỈ MỤC NGỮ NGHĨA & THỰC NGHIỆM TRUY XUẤT] |
| - Xây dựng bảng liên kết chỉ mục si_TermLink qua thuật toán SIC. |
| - Thực thi tìm kiếm lai (Hybrid Search - HS) kết hợp giữa so trùng từ khóa và đồ thị OOMP. |
| - Đo lường hiệu năng bằng các chỉ số chuẩn: MAP, Precision@k, Recall, thời gian thực thi. |
| |
+---------------------------------------------------------------------------------------------------+
Phương pháp đạt chuẩn Tam giác đạc (Triangulation) nhờ kết hợp ba nguồn dữ liệu và phương pháp: Ngữ liệu TREC chuẩn quốc tế, mạng từ vựng WordNet 3.0, và tập luật sinh cú pháp học thuật. Độ tin cậy và tính hợp thức (construct/internal/external validity) được bảo đảm qua việc đối sánh trực tiếp với các mô hình tìm kiếm thô (raw search) và các hệ thống mở rộng truy vấn đương thời.
Data và phân tích
Dữ liệu thực nghiệm của luận án được trích xuất từ tập dữ liệu chuẩn TREC (Text REtrieval Conference) và WordNet phiên bản 3.0:
- Tập dữ liệu huấn luyện và kiểm thử được phân chia độc lập (
TRAINING_DATAvàTEST_DATA), xử lý qua hệ thống mẫu JAPE để phân loại các dạng cụm danh từ theo cấu trúc từ loại (Noun, Adjective, Determinant). - Hệ thống công cụ và phần mềm bao gồm: Kiến trúc GATE, bộ phân tích JAPE Engine, Hệ quản trị CSDL quan hệ lưu trữ chỉ mục vật lý XML và cấu trúc bảng
si_TermLink. - Các giải thuật cốt lõi được cài đặt và đo lường tham số chính xác:
- CB-KBT (Corpus-Based Knowledge Base Training): Khai thác kho ngữ liệu để tạo dữ liệu dự tuyển;
- WB-KBT (WordNet-Based Knowledge Base Training): Rút trích quan hệ từ WordNet;
- A-KBT (Auto Knowledge Base Training): Tự động suy diễn và bổ sung tri thức;
- CNPV (Complete Noun Phrase Verification): Kiểm tra lỗi cú pháp và ngữ nghĩa cụm danh từ;
- NPC (Noun Phrase Completion) & NPMR (Noun Phrase Member Reduction): Hoàn chỉnh và rút gọn cụm từ;
- SNPE (Similar Noun Phrase Expansion): Sinh truy vấn mở rộng tương đương;
- SIC (Semantic Index Creation) & HS (Hybrid Search): Tạo chỉ mục ngữ nghĩa và thực thi truy xuất kết hợp.
- Đánh giá hiệu năng dựa trên hàm xếp hạng chuẩn Okapi BM25 với các tham số tự do $k_1 = 2.75$, hệ số độ dài tài liệu $b$, tần suất nghịch đảo tài liệu IDF và chỉ số Mean Average Precision (MAP).
Phát hiện đột phá và implications
Những phát hiện then chốt
- Khử triệt để hiện tượng trôi dạt ngữ nghĩa (Query Drift): Bằng chứng thực nghiệm từ giải thuật CNPV và NPC cho thấy việc chuẩn hóa truy vấn ngắn về dạng cụm danh từ hoàn chỉnh giúp loại bỏ các từ đa nghĩa gây nhiễu, khắc phục nhược điểm mất kiểm soát ngữ cảnh mà Voorhees (1993) từng cảnh báo trên tập dữ liệu TREC.
- Ưu thế vượt trội của việc tích hợp quan hệ bộ phận và thuộc tính ($R_m, R_p$): Khai thác các quan hệ meronymy, holonymy, attribute và similar từ WordNet 3.0 trong giải thuật WB-KBT mang lại không gian mở rộng ngữ nghĩa chính xác hơn hẳn so với việc chỉ dựa thuần túy vào quan hệ phân cấp $IS\text{-}A$ truyền thống (như nghiên cứu của Sandhya Revuri, 2005 chỉ đạt 23% precision).
- Hiệu năng vượt bậc của Chỉ mục Hướng ngữ nghĩa (SIC) và Tìm kiếm Lai (HS): Dữ liệu phân tích từ tập liên kết
si_TermLinkchứng minh phương pháp SIC kết hợp giải thuật HS tạo ra tỷ lệ liên kết tài liệu liên quan cao hơn rõ rệt so với phương pháp tìm kiếm so trùng từ khóa thô (raw keyword matching). - Tính khả thi của cơ chế tự huấn luyện A-KBT: Luận án chứng minh ontology OOMP có khả năng tự bổ sung tri thức mới dựa trên sự giao thoa giữa dữ liệu ngữ liệu rút trích và đồ thị WordNet mà không đòi hỏi sự can thiệp thủ công từ chuyên gia phân loại, giải quyết bài toán nghẽn cổ chai tri thức mà Kashyap (2001) đã nêu.
Implications đa chiều
- Về mặt lý thuyết: Luận án đóng góp một mô hình hình thức hóa hoàn chỉnh cho bài toán mở rộng truy vấn dựa trên ontology hướng đối tượng, cung cấp hệ tiên đề toán học về lớp đồng dạng và quan hệ khái niệm ($R_m, R_p, R_{fm}, R_{fp}$) áp dụng cho khoa học máy tính và xử lý ngôn ngữ tự nhiên.
- Về mặt phương pháp luận: Thiết lập quy trình trích xuất mẫu kết hợp giữa văn phạm cấu trúc JAPE/GATE và cơ sở dữ liệu quan hệ, mở ra chuẩn phương pháp mới có khả năng chuyển giao cho các ngôn ngữ khác (bao gồm tiếng Việt và tiếng Pháp).
- Về mặt ứng dụng thực tiễn: Cung cấp giải pháp nâng cấp trực tiếp cho các động cơ tìm kiếm cục bộ (Internal Search Engine), hệ thống thư viện số và các cổng thông tin điện tử, giúp người dùng tiết kiệm thời gian chọn lọc thông tin.
- Về mặt chính sách và hệ thống: Định hình tiêu chuẩn thiết kế kiến trúc thông tin cho các cơ sở dữ liệu quốc gia, nâng cao hiệu quả khai thác tài nguyên số trong bối cảnh chính phủ điện tử.
Limitations và Future Research
Luận án thừa nhận một cách khách quan các giới hạn học thuật:
- Phạm vi cấu trúc truy vấn: Mô hình tập trung giải quyết tối ưu cho các truy vấn ngắn dạng cụm danh từ ba thành phần; các câu truy vấn phức hợp chứa mệnh đề phụ hoặc câu hỏi tự do dài chưa được bao hàm toàn diện.
- Ngữ cảnh đoạn văn bản: Nghiên cứu chưa đi sâu vào phân tích ngữ cảnh động của toàn bộ đoạn văn bản bao quanh câu truy vấn.
- Ngôn ngữ thực nghiệm: Dù khung lý thuyết OOMP được thiết kế độc lập ngôn ngữ, toàn bộ thực nghiệm định lượng trong luận án mới chỉ tiến hành trên ngữ liệu tiếng Anh (TREC) và WordNet tiếng Anh.
Chương trình nghiên cứu tương lai (Future Research Agenda) đề xuất 5 hướng cụ thể:
- Mở rộng mô hình OOMP cho các câu truy vấn dạng câu hỏi tự do (WH-questions) và câu phức hợp.
- Ứng dụng và đánh giá thực nghiệm toàn diện mô hình trên ngữ liệu tiếng Việt, tích hợp các bộ từ điển tiếng Việt (như ViO, ViDic) và kho ngữ liệu song ngữ Anh - Việt.
- Nghiên cứu tích hợp các kỹ thuật học sâu (deep learning) và biểu diễn véc-tơ ngữ nghĩa (word embeddings) để tự động tối ưu hóa trọng số quan hệ trong ontology.
- Mở rộng giải thuật SIC lên các hệ thống dữ liệu lớn phân tán (Distributed Big Data Systems).
- Nghiên cứu cơ chế thích ứng ngữ cảnh người dùng theo thời gian thực (dynamic user context modeling).
Tác động và ảnh hưởng
Công trình của tác giả Nguyễn Chánh Thành đã tạo ra những ảnh hưởng sâu rộng:
- Tác động học thuật: Đặt nền móng vững chắc cho hướng nghiên cứu kết hợp ontology và xử lý ngôn ngữ tự nhiên tại nhóm nghiên cứu BK-NLP và Trường Đại học Bách khoa TP.HCM, thể hiện qua hàng loạt công bố khoa học trên các tạp chí và kỷ yếu hội nghị uy tín từ năm 2007 đến 2010.
- Chuyển đổi công nghệ công nghiệp: Cung cấp lõi giải thuật hoàn chỉnh cho các doanh nghiệp phát triển phần mềm tìm kiếm nội bộ, hệ thống quản trị tri thức doanh nghiệp (Enterprise Knowledge Management) và thư viện điện tử.
- Ý nghĩa kinh tế - xã hội: Nâng cao độ chính xác truy xuất thông tin giúp giảm thiểu hàng triệu giờ lao động tìm kiếm dữ liệu của người dùng internet, tối ưu hóa năng suất khai thác tri thức khoa học và công nghệ.
- Tính hội nhập quốc tế: Phương pháp luận tiếp cận trực tiếp các chuẩn đánh giá khắt khe của cộng đồng khoa học quốc tế (TREC, ACM, IEEE), khẳng định năng lực nghiên cứu đỉnh cao của khoa học máy tính Việt Nam.
Đối tượng hưởng lợi
- Nghiên cứu sinh và học viên cao học: Tiếp cận khung lý thuyết toán học chặt chẽ về mở rộng truy vấn, hệ thống giải thuật chi tiết (CNPV, NPC, NPMR, SNPE, SIC) và phương pháp đánh giá thực nghiệm chuẩn TREC.
- Các nhà khoa học đầu ngành NLP và IR: Sử dụng mô hình ontology OOMP như một cấu trúc nền tảng để phát triển các nghiên cứu chuyên sâu về Web ngữ nghĩa và dịch máy.
- Kỹ sư R&D và Kiến trúc sư hệ thống: Ứng dụng trực tiếp mã giả và kiến trúc cơ sở dữ liệu của giải thuật SIC và Hybrid Search vào các sản phẩm thương mại.
- Cơ quan quản lý và hoạch định thông tin: Tham khảo mô hình tổ chức chỉ mục ngữ nghĩa để chuẩn hóa hệ thống lưu trữ dữ liệu công dân và văn bản quy phạm pháp luật.
Câu hỏi chuyên sâu
1. Đóng góp lý thuyết độc đáo nhất của luận án là gì và nó mở rộng lý thuyết nào?
Trả lời: Đóng góp độc đáo nhất là việc xây dựng mô hình Ontology OOMP (Object-Member-Property) cùng hệ thống quan hệ hình thức $R_m, R_p, R_{fm}, R_{fp}$ và 4 không gian mô hình toán học $MQE$. Luận án mở rộng trực tiếp lý thuyết đặc tả khái niệm của Gruber (2003) và khắc phục hạn chế của mô hình phân cấp $IS\text{-}A$ trong mạng từ vựng WordNet.
2. Đổi mới phương pháp luận của luận án thể hiện thế nào khi so sánh với các nghiên cứu tiền nhiệm?
Trả lời: So với Voorhees (1994) chỉ sử dụng synset đơn lẻ gây trôi dạt ngữ nghĩa và Fu và cộng sự (2005) bị giới hạn trong bộ ba địa lý $\langle\text{what, rel, where}\rangle$, luận án kết hợp đột phá giữa ngữ pháp cụm danh từ JAPE/GATE, mạng từ vựng WordNet 3.0 và hệ thống tự huấn luyện đa nguồn (CB-KBT, WB-KBT, A-KBT), tạo ra quy trình mở rộng truy vấn khép kín không phụ thuộc tương tác tĩnh.
3. Phát hiện bất ngờ nhất từ kết quả thực nghiệm là gì?
Trả lời: Việc chuẩn hóa và rút gọn cụm danh từ bằng giải thuật NPMR không làm mất mát thông tin mà ngược lại làm tăng đáng kể độ chính xác trung bình (MAP), chứng minh rằng việc loại bỏ các thành phần dư thừa trong truy vấn ngắn có tác động tích cực hơn việc mở rộng từ khóa ồ ạt.
4. Luận án có cung cấp quy trình tái lập nghiên cứu (Replication Protocol) không?
Trả lời: Có. Luận án cung cấp đầy đủ danh mục giải thuật (từ Giải thuật 4.1 đến 6.2), đặc tả chi tiết mẫu nhận dạng cụm danh từ JAPE, mô tả cấu trúc bảng cơ sở dữ liệu quan hệ, tập chỉ mục XML và quy chuẩn định dạng ngữ liệu TREC tại các phụ lục chi tiết.
5. Chương trình nghiên cứu 10 năm được định hình như thế nào?
Trả lời: Luận án vạch ra lộ trình mở rộng mô hình OOMP sang xử lý ngôn ngữ tiếng Việt chuyên sâu, tích hợp công nghệ Web ngữ nghĩa (OWL/RDF/SPARQL), ứng dụng vào hệ thống hỏi đáp tự động (QA System) và truy xuất thông tin xuyên ngôn ngữ (CLIR).
Kết luận
Luận án tiến sĩ của tác giả Nguyễn Chánh Thành đã khẳng định một dấu ấn khoa học xuất sắc thông qua sáu đóng góp cốt lõi:
- Thiết lập cơ sở lý thuyết toán học và ngôn ngữ học hoàn chỉnh cho bài toán mở rộng truy vấn dựa trên ontology OOMP.
- Đề xuất hệ thống quan hệ khái niệm đặc trưng ($R_m, R_p, R_{fm}, R_{fp}$) và bốn mô hình toán học $MQE$.
- Phát triển ba phương pháp huấn luyện ontology đột phá: CB-KBT, WB-KBT và giải thuật tự huấn luyện A-KBT.
- Xây dựng bộ giải thuật xử lý cụm danh từ hoàn chỉnh và rút gọn tiên tiến: CNPV, NPC, NPMR và SNPE.
- Sáng tạo phương pháp tạo chỉ mục hướng ngữ nghĩa (SIC) và giải thuật tìm kiếm lai (Hybrid Search - HS).
- Kiểm chứng thực nghiệm nghiêm ngặt trên chuẩn dữ liệu quốc tế TREC và WordNet 3.0, mở ra bước tiến vượt bậc cho ngành truy xuất thông tin và xử lý ngôn ngữ tự nhiên.
Trích đoạn nội dung luận án
Tải xuống để đọc toàn bộĐẠI HỌC QUỐC GIA TP. HCM TRƯỜNG ĐẠI HỌC BÁCH KHOA TP.HCM NGUYỄN CHÁNH THÀNH XÂY DỰNG MÔ HÌNH MỞ RỘNG TRUY VẤN TRONG TRUY XUẤT THÔNG TIN VĂN BẢN LUẬN ÁN TIẾN SĨ KỸ THUẬT TP.HỒ CHÍ MINH – 2010 ĐẠI HỌC QUỐC GIA TP. HCM TRƯỜNG ĐẠI HỌC BÁCH KHOA TP.HCM NGUYỄN CHÁNH THÀNH XÂY DỰNG MÔ HÌNH MỞ RỘNG TRUY VẤN TRONG TRUY XUẤT THÔNG TIN VĂN BẢN Chuyên ngành: KHOA HỌC MÁY TÍNH Mã số: 62.01 LUẬN ÁN TIẾN SĨ KỸ THUẬT NGƯỜI HƯỚNG DẪN KHOA HỌC PGS. PHAN THỊ TƯƠI TP.HỒ CHÍ MINH – 2010 LỜI CAM ĐOAN Tôi cam ñoan rằng nội dung của luận án này là kết quả nghiên cứu của bản thân.
Tất cả những tham khảo từ các nghiên cứu liên quan ñiều ñược nêu nguồn gốc một cách rõ ràng từ danh mục tài liệu tham khảo trong luận án. Những ñóng góp trong luận án là kết quả nghiên cứu của tác giả ñã ñược công bố trong các bài báo khoa học trong phần “Các công trình khoa học” của luận án và chưa ñược công bố trong bất kỳ công trình khoa học nào khác. Tác giả luận án Nguyễn Chánh Thành LỜI CẢM ƠN Trong quá trình hoàn thành luận án này, tôi ñã ñược các thầy cô nơi cơ sở ñào tạo giúp ñỡ tận tình, cơ quan nơi công tác tạo mọi ñiều kiện thuận lợi và bạn bè cùng gia ñình thường xuyên ñộng viên khích lệ. Luận án này không thể hoàn thành tốt nếu không có sự tận tình hướng dẫn và sự giúp ñỡ quí báu của PGS.
Phan Thị Tươi, giáo viên hướng dẫn mà tôi tôn vinh và muốn ñược bày tỏ lòng biết ơn sâu sắc nhất. Tôi cũng muốn ñược bày tỏ lòng biết ơn ñối với tập thể các thầy cô khoa Khoa học và Kỹ thuật Máy tính trường Đại học Bách khoa TP. Hồ Chí Minh ñã giúp ñỡ và tạo ñiều kiện cho tôi rất nhiều trong quá trình học tập và nghiên cứu ở Khoa; ñặc biệt PGS. Cao Hoàng Trụ, PGS.
Dương Tuấn Anh, PGS. Đỗ Phúc và TS. Đặng Trần Khánh ñã có những lời khuyên quý giá trong quá trình làm NCS và viết luận án này; cảm ơn Phòng quản lý Sau Đại học về sự hỗ trợ các thủ tục hoàn thành luận án. Sự biết ơn của tôi xin ñược gửi ñến gia ñình, vợ con và người thân, ñã hỗ trợ ñộng viên và tạo mọi ñiều kiện thuận lợi cho tôi trong suốt quá trình hoàn thành khóa học NCS.
Cuối cùng tôi cảm ơn anh Ngô Hùng Phương cùng tất cả bạn bè, ñặc biệt các thành viên trong nhóm nghiên cứu BK-NLP (thuộc trường Đại học Bách khoa Tp.HCM) ñã góp nhiều ý kiến thiết thực và có những lời ñộng viên khích lệ quý báu giúp tôi vượt qua khó khăn và hoàn thành tốt luận án. Tác giả luận án Nguyễn Chánh Thành TÓM TẮT Trong truy xuất thông tin (Information Retrieval, IR), do những yếu tố khác nhau, người sử dụng thường dùng các truy vấn dạng ñơn giản biểu diễn yêu cầu cần tìm. Việc này dẫn ñến kết quả tìm ñược không ñáp ứng ñủ nhu cầu mong muốn, hoặc chất lượng thấp. Do ñó, mở rộng truy vấn là vấn ñề cần thiết, ñể từ ñó giúp hệ thống truy xuất thông tin có thêm thông tin theo ngữ cảnh nhằm cải tiến các kết quả truy vấn.
Thông tin theo ngữ cảnh có thể thu ñược từ những thông tin phản hồi liên quan, từ ñồng hiện hay mô hình tri thức như bản thể học (ontology). Việc ứng dụng ontology ñể trợ giúp việc mở rộng truy vấn ñược nghiên cứu từ ñầu thập niên 1990 với một số thành công. Trong bài toán mở rộng truy vấn, một số nhóm nghiên cứu trên thế giới ñã sử dụng ontology WordNet. Một số nhóm khác ñã phát triển ontology ñể phục vụ nhu cầu mở rộng truy vấn.
Những ñịnh hướng ñặc biệt về cấu trúc ontology cần xây dựng bao gồm ñề xuất về nhóm thành phần lớp, thể hiện, thuộc tính, hay ñề xuất về nhóm thể hiện, thuộc tính, khái niệm và quan hệ rời rạc (disjointness), IS-A, và tương ñương (equivalence), hoặc phát triển một mô hình mới về mạng ngữ nghĩa dựa trên những quan hệ trích dẫn từ WordNet như quan hệ thượng danh (hypernymy), hạ danh (hyponymy) … cùng một số quan hệ ñược ñịnh nghĩa thêm như chú giải (gloss), chủ ñề và miền (domain). Luận án này ñề xuất phương pháp mở rộng truy vấn dựa trên cơ sở bản thể học (ontology-based query expansion). Để thực hiện mục tiêu trên, luận án phải giải quyết các vấn ñề chính: (1) ñề xuất cơ sở lý thuyết về các mô hình mở rộng truy vấn dựa trên ontology; (2) phát triển và huấn luyện ontology bằng phương pháp khai thác kho ngữ liệu sẵn có và phương pháp rút trích dữ liệu từ WordNet; (3) ñề xuất phương pháp hoàn thiện và mở rộng truy vấn. Phần thực nghiệm của luận án ñược tiến hành cho ngôn ngữ tiếng Anh dựa trên nguồn dữ liệu và truy vấn tiếng Anh từ nguồn TREC (Text REtrieval Conference) trong một số lĩnh vực.
Các kết quả thực nghiệm phản ánh tính khả thi của những phương pháp ñề xuất trong luận án, ñồng thời cho thấy nhiều triển vọng phát triển của các ñề xuất lý thuyết trong luận án. i MỤC LỤC MỤC LỤC. i DANH MỤC CÁC BẢNG. iii DANH MỤC CÁC HÌNH .v DANH MỤC CÁC GIẢI THUẬT.
vii DANH MỤC CÁC TỪ VIẾT TẮT. viii Chương 1 GIỚI THIỆU .1 Động cơ nghiên cứu .2 Mục tiêu và phạm vi nghiên cứu .3 Đóng góp chính của luận án .4 Cấu trúc của luận án.6 Tóm tắt nội dung luận án .13 Chương 2 CÁC NGHIÊN CỨU LIÊN QUAN .2 Các nghiên cứu liên quan trong nước .3 Các nghiên cứu về ontology .4 Các nghiên cứu về mở rộng truy vấn .5 Khai thác dữ liệu từ WordNet .44 Chương 3 XÂY DỰNG NỀN TẢNG HỆ THỐNG .2 Bài toán Xây dựng ontology và bài toán Hoàn chỉnh mở rộng truy vấn .3 Các mô hình cho bài toán mở rộng truy vấn .4 Mẫu nhận dạng cụm danh từ.5 Phương pháp thực nghiệm và ñánh giá .6 Nguồn dữ liệu thực nghiệm .88 Chương 4 XÂY DỰNG ONTOLOGY OOMP .2 Xây dựng ontology OOMP .3 Phương pháp huấn luyện dựa trên kho ngữ liệu .4 Phương pháp huấn luyện dựa trên WordNet .5 Cơ chế tự huấn luyện của ontology OOMP .6 Các ứng dụng của ontology và quan hệ .110 Chương 5 HOÀN CHỈNH VÀ RÚT GỌN TRUY VẤN.2 Hoàn chỉnh và rút gọn truy vấn .3 Kiểm tra cụm danh từ hoàn chỉnh .4 Tạo cụm danh từ hoàn chỉnh.5 Tạo cụm danh từ rút gọn .6 Hoàn chỉnh cụm danh từ .7 Giải thuật rút gọn thành phần cụm danh từ.140 Chương 6 MỞ RỘNG TRUY VẤN.1 Mở rộng truy vấn cho ñộng cơ tìm kiếm trên Web .2 Mở rộng truy vấn cho hệ thống truy xuất thông tin có sẵn .165 Chương 7 KẾT LUẬN .1 Các kết quả ñạt ñược.2 Hướng phát triển .172 CÁC CÔNG TRÌNH KHOA HỌC CỦA TÁC GIẢ .174 TÀI LIỆU THAM KHẢO. Tóm lược về WordNet. Cấu trúc cụm danh từ tiếng Anh.
Danh mục từ loại tiếng Anh. Danh mục luật sinh dạng cụm danh từ của văn phạm tiếng Anh xây dựng dựa trên TreeBank. Tính chất ảnh-tạo ảnh trong toán học. Cấu trúc ñịnh dạng tài liệu TREC.
Tổ chức cơ sở dữ liệu của thực nghiệm trong luận án. s iii DANH MỤC CÁC BẢNG Bảng 3. Danh sách mã lỗi quy ước. Các trường hợp liên kết giữa q và q’ ñể tính ℘(q | q' ).
Các trường hợp liên kết giữa q và q’ ñể tính ℘(q' ) .Tập luật sinh tiếng Anh liên quan cụm danh từ (nguồn [2]). Danh sách mẫu cơ bản ñặc tả cụm danh từ. Thống kê thành phần dữ liệu từ TREC. Danh sách tập chỉ mục xây dựng từ nguồn dữ liệu trong bảng 3.
Thống kê mục từ, tài liệu và liên kết của nguồn dữ liệu. Thống kê các tài liệu liên quan theo nguồn dữ liệu. Danh sách mẫu sử dụng trong thực nghiệm. Thống kê cụm danh từ phân biệt rút trích từ kho ngữ liệu tiếng Anh.
Thống kê số lượng cụm danh từ theo dạng mẫu. Dữ liệu dự tuyển rút trích ñược trong giải thuật CB-KBT. Dữ liệu dự tuyển rút trích ñược trong giải thuật CB-KBT. Các thống kê cho dữ liệu huấn luyện.
Danh mục phân lớp từ vựng sử dụng trong WordNet .Thống kê các mục từ dùng trong quá trình huấn luyện WB-BKT. Dữ liệu ñược rút trích từ WordNet trong giải thuật WB-KBT. Các thống kê cho dữ liệu huấn luyện. Dữ liệu bổ sung tạo bởi giải thuật A-KBT.
Thống kê về thời gian thực thi của giải thuật CNPV. Các trường hợp xử lý trong giải thuật CNPV theo dạng lỗi. Các trường hợp xử lý trong giải thuật CNPV theo dạng lỗi và mẫu. Số liệu thống kê các phần tử phân tích trung gian.
Thống kê về thời gian thực thi của giải thuật NPC. Thống kê các trường hợp xử lý trong giải thuật NPC theo dạng lỗi. Thống kê các trường hợp xử lý trong giải thuật NPC theo dạng mẫu. Thống kê các phần tử phân tích trung gian của giải thuật NPC.
Kết quả thực nghiệm của giải thuật CNPG trên dữ liệu trung gian của giải thuật NPC. Phân tích kết quả thực nghiệm của giải thuật NPC. So sánh kết quả của phương pháp tìm kiếm thô và NPC. Thống kê về thời gian thực thi của giải thuật NPMR.
Thống kê các phần tử phân tích trung gian của giải thuật NPMR. Kết quả thực nghiệm của giải thuật RNPG trên dữ liệu trung gian của giải thuật NPMR. Phân tích kết quả thực nghiệm của giải thuật NPMR. So sánh kết quả của phương pháp tìm kiếm thô và NPMR.
Thống kê về thời gian thực thi của giải thuật SNPE. Thống kê các trường hợp xử lý trong giải thuật SNPE theo dạng lỗi. Thống kê các phần tử phân tích trung gian của giải thuật SNPE. Kết quả thực nghiệm của giải thuật CNPG trên dữ liệu trung gian của giải thuật SNPE.
Phân tích kết quả thực nghiệm của giải thuật SNPE. So sánh kết quả của phương pháp tìm kiếm thô và SNPE. Thống kê số liệu thực nghiệm trong giải thuật SIC. Số liệu chi tiết của tập si_TermLink tạo ra từ giải thuật SIC.
Thống kê kết quả trong tập si_TermLink tạo ra từ giải thuật SIC. So sánh kết quả thực nghiệm 1. So sánh kết quả thực nghiệm 2. So sánh kết quả thực nghiệm 3.
165 v DANH MỤC CÁC HÌNH Hình 1. Mối quan hệ giữa mô hình của luận án và hệ thống truy xuất thông tin. Tóm tắt phân bố nội dung các vấn ñề trình bày trong luận án. Tổ chức hệ thống WordNet phiên bản 3.
Cấu trúc ontology về hình ảnh của S.
Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ
Trích dẫn luận án này
Nguyễn Chánh Thành (2010). Xây dựng mô hình mở rộng truy vấn trong truy xuất thông tin [Luận án tiến sĩ, Trường Đại học Bách khoa TP.HCM]. LuanAn.net. https://luanan.net/ky-thuat-xay-dung-kien-truc/xay-dung-mo-hinh-mo-rong-truy-van-trong-truy-xuat-thong-tin-van-ban
Câu hỏi thường gặp
Luận án "Xây dựng mô hình mở rộng truy vấn trong truy xuất thông tin" nghiên cứu về vấn đề gì?
Xây dựng mô hình mở rộng truy vấn nhằm nâng cao hiệu quả truy xuất thông tin trong hệ thống dữ liệu lớn.
Luận án "Xây dựng mô hình mở rộng truy vấn trong truy xuất thông tin" được bảo vệ tại trường nào?
Luận án này được bảo vệ tại Trường Đại học Bách khoa TP.HCM. Năm bảo vệ: 2010.
Luận án "Xây dựng mô hình mở rộng truy vấn trong truy xuất thông tin" thuộc chuyên ngành gì?
Luận án "Xây dựng mô hình mở rộng truy vấn trong truy xuất thông tin" thuộc chuyên ngành Khoa học Máy tính. Danh mục: Kỹ Thuật Xây Dựng & Kiến Trúc.
Luận án "Xây dựng mô hình mở rộng truy vấn trong truy xuất thông tin" có bao nhiêu trang?
Luận án "Xây dựng mô hình mở rộng truy vấn trong truy xuất thông tin" có 223 trang. Bạn có thể xem trước một phần tài liệu ngay trên trang web trước khi tải về.
Cách tải luận án "Xây dựng mô hình mở rộng truy vấn trong truy xuất thông tin" về máy như thế nào?
Để tải luận án về máy, bạn nhấn nút "Tải xuống ngay" trên trang này, sau đó hoàn tất thanh toán phí lưu trữ. File sẽ được tải xuống ngay sau khi thanh toán thành công. Hỗ trợ qua Zalo: 0559 297 239.