Kết hợp cấu trúc r tree với đồ thị tri thức cho mô hình tìm kiếm ảnh
Kết hợp cấu trúc R-Tree với đồ thị tri thức tối ưu hóa mô hình tìm kiếm dữ liệu không gian. Nghiên cứu đề xuất phương pháp nâng cao hiệu suất truy vấn.
Luan An
Luận án tiến sĩ
Năm xuất bản
Số trang
139
Thời gian đọc
21 phút
Lượt xem
0
Lượt tải
0
Phí lưu trữ
40 Point
Tổng quan nhanh
- Chủ đề:
- 1. Cấu trúc R Tree và tối ưu hóa truy vấn không gian ảnh
- Số trang:
- 139 trang
- Trường:
- Trường Đại học Khoa học, Đại học Huế
- Chuyên ngành:
- Khoa học máy tính
- Tác giả:
- Lê Thị Vĩnh Thanh
- Năm:
- 2023
Tóm tắt nội dung luận án
I. Cấu trúc R Tree và tối ưu hóa truy vấn không gian ảnh
Mô hình tìm kiếm ảnh theo nội dung đòi hỏi các giải pháp lập chỉ mục hiệu quả. Cấu trúc chỉ mục không gian r tree đóng vai trò nền tảng trong việc tổ chức các véc-tơ đặc trưng đa chiều. Dữ liệu hình ảnh sau khi trích xuất đặc trưng màu sắc, hình dạng và kết cấu được ánh xạ vào không gian véc-tơ. Cấu trúc cây phân cấp giúp phân vùng không gian tìm kiếm logic. Quá trình duyệt cây loại bỏ nhanh các vùng không gian không chứa kết quả tiềm năng. Thời gian phản hồi truy vấn giảm đáng kể. Cấu trúc phân cấp hỗ trợ tốt cho các tập dữ liệu có quy mô lớn. Việc kết hợp cây không gian với các giải thuật hiện đại nâng cao hiệu suất truy xuất hình ảnh.
1.1. Đặc trưng không gian và hộp giới hạn nhỏ nhất MBR
Trong cấu trúc cây không gian, mỗi nút đại diện cho một phân vùng dữ liệu cụ thể. Khái niệm hộp giới hạn nhỏ nhất (MBR - Minimum Bounding Box) được sử dụng để bao bọc các phần tử con bên trong. MBR xác định ranh giới tọa độ nhỏ nhất chứa toàn bộ các điểm dữ liệu véc-tơ. Khi thực hiện truy vấn, hệ thống kiểm tra sự giao cắt giữa vùng truy vấn và MBR của từng nút. Nút nào không giao cắt sẽ bị loại bỏ ngay lập tức. Kỹ thuật này giúp giảm số lượng phép tính khoảng cách chi tiết. Quá trình tính toán trên MBR đơn giản và tiết kiệm tài nguyên bộ nhớ. Nhờ đó, tốc độ lọc dữ liệu ban đầu đạt mức tối ưu.
1.2. Kỹ thuật truy vấn k láng giềng gần nhất hiệu quả
Tìm kiếm hình ảnh tương đồng thường quy về bài toán truy vấn k láng giềng gần nhất (k-NN Query). Thuật toán duyệt qua cấu trúc cây để tìm k đối tượng có khoảng cách ngắn nhất tới véc-tơ truy vấn. Cây không gian sử dụng giới hạn khoảng cách từ điểm truy vấn tới MBR để cắt tỉa các nhánh cây không thỏa mãn. Chiến lược duyệt ưu tiên nhánh gần nhất giúp tìm ra kết quả nhanh chóng. Bộ đệm ưu tiên lưu trữ các ứng viên tiềm năng trong suốt quá trình tìm kiếm. Khi tập k phần tử tốt nhất được lấp đầy, ngưỡng cắt tỉa liên tục được cập nhật chặt chẽ hơn. Độ chính xác của truy vấn k-NN được đảm bảo toàn diện.
II. Đồ thị tri thức và biểu diễn ngữ nghĩa trong tìm kiếm
Tìm kiếm hình ảnh thuần túy dựa trên đặc trưng thị giác thường gặp rào cản khoảng cách ngữ nghĩa. Đồ thị tri thức cung cấp khung giải pháp toàn diện để giải quyết vấn đề này. Dữ liệu tri thức lưu trữ các thực thể, thuộc tính và mối quan hệ phức tạp giữa các đối tượng. Cấu trúc đồ thị cho phép liên kết thông tin hình ảnh với các khái niệm ngữ nghĩa trừu tượng. Việc tích hợp tri thức giúp hệ thống hiểu sâu sắc ngữ cảnh của bức ảnh. Quá trình suy diễn ngữ nghĩa mở rộng khả năng tìm kiếm vượt ra ngoài các phép so khớp véc-tơ đơn thuần.
2.1. Khung đồ thị tri thức không gian GeoKG và thực thể
Mô hình đồ thị tri thức không gian (GeoKG) kết hợp thông tin địa lý và ngữ nghĩa có cấu trúc. Mỗi nút trong GeoKG đại diện cho một thực thể hình ảnh hoặc vị trí không gian xác định. Các cạnh đồ thị thể hiện quan hệ vị trí tương đối như kề cạnh, chứa trong, nằm trên hoặc nằm dưới. Khung tri thức GeoKG hỗ trợ trích xuất thông tin đối tượng bằng các mạng nơ-ron nhận dạng hiện đại. Tri thức bối cảnh giúp xác định chính xác mối quan hệ giữa các thành phần trong ảnh. Dữ liệu đồ thị tạo nền tảng vững chắc cho các truy vấn phức tạp kết hợp cả thuộc tính không gian và ý nghĩa ngữ nghĩa.
2.2. Biểu diễn tri thức địa lý và liên kết thực thể ảnh
Phương pháp biểu diễn tri thức địa lý (Geo-ontology) định nghĩa hệ thống phân cấp khái niệm và ràng buộc ngữ cảnh. Hệ thống ontology chuẩn hóa các quan hệ không gian giúp máy tính suy luận tự động. Quá trình liên kết thực thể không gian (Spatial Entity Linking) gắn nhãn các vùng ảnh với các thực thể trong cơ sở tri thức. Liên kết này ánh xạ chính xác vị trí điểm ảnh tới nút tương ứng trên đồ thị. Khi đối tượng trong ảnh được nhận dạng, các liên kết tri thức tự động kích hoạt. Khả năng hiểu nội dung ảnh tăng lên rõ rệt. Hệ thống cho phép thực hiện tìm kiếm ảnh thông qua các khái niệm logic phong phú.
III. Chỉ mục lai không gian và đồ thị trong mô hình tìm kiếm
Sự kết hợp giữa cây không gian và đồ thị tri thức tạo ra cấu trúc chỉ mục lai không gian và đồ thị (Hybrid Spatial-Graph Index). Chỉ mục lai tận dụng đồng thời thế mạnh lọc không gian của cây và khả năng mở rộng quan hệ của đồ thị. Cấu trúc cây lọc nhanh các tập ứng viên ở mức thô. Đồ thị tri thức tinh chỉnh kết quả ở mức ngữ nghĩa chi tiết. Sự phối hợp hai chiều này loại bỏ nhược điểm nghẽn cổ chai khi xử lý dữ liệu véc-tơ chiều cao. Hệ thống đạt tốc độ tìm kiếm vượt trội và duy trì độ chính xác cao.
3.1. Thiết kế cấu trúc RS Tree cải tiến từ cây R Tree
Cấu trúc RS-Tree là bước phát triển vượt bậc nhằm nâng cao hiệu năng của cây R-Tree truyền thống. RS-Tree sử dụng các khối cầu bao bọc thay vì chỉ dùng hộp giới hạn MBR hình chữ nhật. Tâm và bán kính của khối cầu được cập nhật linh hoạt sau mỗi thao tác thêm phần tử. Cấu trúc hình cầu giúp phân cụm dữ liệu véc-tơ đặc trưng tốt hơn trong không gian nhiều chiều. Diện tích chồng lấn giữa các nút giảm xuống mức tối thiểu. Thuật toán chọn nút lá tối ưu giúp cân bằng cây hiệu quả. Tốc độ duyệt cây và truy xuất đặc trưng hình ảnh tăng lên rõ rệt so với các cấu trúc cây kinh điển.
3.2. Kết hợp đồ thị cụm láng giềng tăng độ chính xác
Mô hình tích hợp cấu trúc RS-Tree với đồ thị cụm láng giềng hình thành kiến trúc NBGraphRST đồng bộ. Đồ thị láng giềng liên kết các nút lá có độ tương đồng cao trong không gian đặc trưng. Khi một nút lá tiềm năng được định vị, thuật toán mở rộng tìm kiếm sang các nút láng giềng liền kề trên đồ thị. Quá trình di chuyển trên đồ thị giúp phát hiện nhanh các kết quả tương tự bị phân tán ở các nhánh cây khác nhau. Số lượng nút cây cần duyệt giảm đáng kể. Thời gian tính toán khoảng cách giảm mạnh. Sự kết hợp này mang lại độ nhạy cao và tối ưu hóa tài nguyên phần cứng.
IV. Tìm kiếm ngữ nghĩa không gian và truy vấn từ khóa ảnh
Nhu cầu tìm kiếm ảnh hiện đại đòi hỏi sự kết hợp đồng thời giữa từ khóa ngữ nghĩa và ràng buộc không gian. Mô hình tìm kiếm ngữ nghĩa không gian (Spatial Semantic Search) giải quyết trọn vẹn yêu cầu này. Hệ thống không chỉ xem xét sự tương đồng về hình ảnh mà còn phân tích cấu trúc ngữ nghĩa của câu lệnh. Sự tương tác giữa các đối tượng trong không gian ảnh được mô hình hóa chặt chẽ. Kết quả trả về đáp ứng chính xác cả về mặt hình ảnh lẫn ý nghĩa biểu đạt. Mô hình mở ra hướng đi mới cho các ứng dụng tra cứu ảnh thông minh.
4.1. Tối ưu hóa truy vấn đa thuộc tính trên dữ liệu lớn
Kỹ thuật tối ưu hóa truy vấn đa thuộc tính cho phép xử lý đồng thời nhiều tiêu chí lọc phức tạp. Các tiêu chí bao gồm đặc trưng màu sắc, hình dạng, nhãn thực thể và quan hệ không gian tương đối. Hệ thống phân rã câu truy vấn thành các biểu thức con độc lập. Bộ tối ưu hóa sắp xếp thứ tự thực thi các điều kiện lọc nhằm giảm kích thước tập dữ liệu trung gian. Cấu trúc chỉ mục lai đóng vai trò hạt nhân trong việc định tuyến truy vấn nhanh. Bộ nhớ đệm thông minh hỗ trợ tái sử dụng kết quả tính toán trước đó. Hiệu năng tổng thể của hệ thống duy trì ổn định khi lượng dữ liệu tăng đột biến.
4.2. Khai thác truy vấn từ khóa không gian và ngữ cảnh
Cơ chế truy vấn từ khóa không gian (Spatial Keyword Query) kết hợp linh hoạt giữa văn bản mô tả và vị trí đối tượng. Hệ thống phân tích cú pháp từ khóa để trích xuất các thực thể mục tiêu và ràng buộc vị trí. Đồ thị tri thức đối sánh các từ khóa với nút thực thể tương ứng. Cấu trúc cây không gian lọc các vùng ảnh chứa đối tượng thỏa mãn vị trí yêu cầu. Mạng nơ-ron tích chập Faster-RCNN hỗ trợ phát hiện đối tượng chính xác trong từng khung hình. Kết quả truy vấn phản ánh đúng ngữ cảnh và yêu cầu tìm kiếm. Độ chính xác thông tin được nâng lên mức cao nhất.
V. Đánh giá thực nghiệm mô hình tìm kiếm ảnh kết hợp mới
Việc đánh giá thực nghiệm đóng vai trò then chốt trong việc xác thực tính hiệu quả của mô hình kết hợp. Các kiểm thử tập trung vào đo lường thời gian thực thi, độ chính xác trung bình và diện tích dưới đường cong ROC. Môi trường thử nghiệm được thiết lập trên các máy chủ tính toán hiệu năng cao. Quy trình thực nghiệm kiểm tra nhiều tình huống truy vấn từ đơn giản đến phức tạp. Kết quả thực nghiệm cung cấp bằng chứng định lượng rõ ràng về ưu thế vượt trội của phương pháp đề xuất. Hệ thống chứng minh khả năng ứng dụng thực tiễn cao trong các hệ thống thông tin quy mô lớn.
5.1. Hiệu năng tìm kiếm trên bộ dữ liệu Visual Genome
Bộ dữ liệu chuẩn Visual Genome được sử dụng để đánh giá toàn diện mô hình tìm kiếm kết hợp. Visual Genome chứa hàng trăm nghìn hình ảnh kèm theo chú giải chi tiết về đối tượng, thuộc tính và mối quan hệ ngữ nghĩa. Mô hình RS-Tree kết hợp đồ thị tri thức được kiểm thử trên tập dữ liệu đa dạng này. Kết quả cho thấy độ chính xác trung bình (ARP) tăng vượt bậc so với các phương pháp CBIR truyền thống. Thời gian phản hồi truy vấn giảm hơn ba mươi phần trăm nhờ cơ chế chỉ mục lai tối ưu. Tỷ lệ phát hiện đúng các mối quan hệ không gian phức tạp đạt mức tin cậy cao.
5.2. Phân tích độ chính xác và khả năng mở rộng hệ thống
Các chỉ số Area Under Curve (AUC) và Precision-Recall khẳng định tính ổn định vượt trội của cấu trúc đề xuất. Khi kích thước tập dữ liệu tăng lên gấp nhiều lần, thời gian truy vấn chỉ tăng theo quy luật hàm logarit. Cấu trúc chỉ mục lai phân tán bộ nhớ hợp lý, ngăn ngừa hiện tượng quá tải phần cứng. Hệ thống duy trì khả năng mở rộng linh hoạt đối với các cơ sở dữ liệu ảnh đa phương tiện khổng lồ. Thuật toán cân bằng tải giữa việc lọc không gian và duyệt đồ thị tri thức hoạt động trơn tru. Toàn bộ giải pháp đáp ứng hoàn hảo yêu cầu tìm kiếm thời gian thực trong kỷ nguyên số.
Mục lục chi tiết luận án
Tải xuống file đầy đủ để xem toàn bộ nội dung
Tải đầy đủ (139 trang)Nội dung chính
Tổng quan về luận án
Luận án này tiên phong giải quyết một trong những thách thức cốt lõi trong lĩnh vực thị giác máy tính: thu hẹp khoảng cách ngữ nghĩa (semantic gap) trong tìm kiếm ảnh. Bối cảnh khoa học hiện nay chứng kiến sự bùng nổ của dữ liệu đa phương tiện, đặc biệt là hình ảnh, đặt ra yêu cầu cấp thiết về các hệ thống tìm kiếm ảnh hiệu quả và chính xác. Các phương pháp truyền thống như tìm kiếm dựa trên từ khóa (Text-Based Image Retrieval - TBIR) đối mặt với hạn chế về chi phí chú thích thủ công và tính chủ quan của con người [5, 6]. Trong khi đó, tìm kiếm ảnh theo nội dung (Content-Based Image Retrieval - CBIR) dù hiệu quả với các đặc trưng cấp thấp (màu sắc, kết cấu, hình dạng) nhưng lại bỏ lỡ ngữ nghĩa cấp cao, dẫn đến kết quả đôi khi không phù hợp với ý định người dùng [11].
Research gap cụ thể mà luận án này giải quyết là sự thiếu vắng một mô hình tích hợp hiệu quả giữa tìm kiếm ảnh dựa trên nội dung (sử dụng cấu trúc dữ liệu đa chiều hiệu quả) và tìm kiếm ảnh dựa trên ngữ nghĩa (sử dụng biểu diễn tri thức). Như tác giả đã chỉ ra: "Tuy nhiên, các công trình này chưa kết hợp giữa tìm kiếm ảnh dựa trên nội dung và tìm kiếm ảnh dựa trên ngữ nghĩa. Mặt khác, các công trình chưa thực hiện tìm kiếm dựa trên ngôn ngữ truy vấn để tìm kiếm ảnh trên đồ thị tri thức." (trang 5). Điều này tạo ra một khoảng trống đáng kể, vì các hệ thống hiện có thường chỉ tập trung vào một trong hai khía cạnh, hoặc gặp khó khăn trong việc tích hợp chúng một cách mạch lạc và có thể truy vấn ngữ nghĩa phức tạp.
Nghiên cứu được định hướng bởi các câu hỏi và giả thuyết sau:
- RQ1: Làm thế nào để cải thiện hiệu quả lưu trữ và truy vấn của cấu trúc R-Tree cho các đặc trưng hình ảnh cấp thấp, đặc biệt là giảm chi phí tính toán và chồng lấp không gian?
- H1: Việc đề xuất cấu trúc RS-Tree sử dụng khối cầu bao đóng tối thiểu (Minimum Bounding Sphere - MBS) và thuật toán tách nút dựa trên độ lệch sai biệt, kết hợp ngưỡng phân cụm $\theta$, sẽ nâng cao hiệu quả lưu trữ và giảm thời gian tìm kiếm ảnh so với các biến thể R-Tree hiện có.
- RQ2: Làm thế nào để xây dựng một khung đồ thị tri thức hiệu quả cho dữ liệu hình ảnh, mô tả các mối quan hệ ngữ nghĩa giữa các đối tượng và tích hợp nó vào quá trình tìm kiếm ảnh?
- H2: Việc xây dựng đồ thị tri thức từ tập dữ liệu Visual Genome sử dụng các tiêu chuẩn Web Ontology Language (OWL) và Resource Description Framework (RDF) sẽ cung cấp một cơ sở mạnh mẽ để biểu diễn và truy vấn ngữ nghĩa hình ảnh.
- RQ3: Liệu mô hình tìm kiếm ảnh kết hợp giữa RS-Tree (tìm kiếm theo nội dung) và đồ thị tri thức (tìm kiếm theo ngữ nghĩa) có thể nâng cao độ chính xác và thu hẹp khoảng cách ngữ nghĩa so với các phương pháp đơn lẻ?
- H3: Mô hình tìm kiếm ảnh lai, sử dụng RS-Tree để lọc ảnh tương tự ban đầu và sau đó tinh chỉnh kết quả bằng truy vấn SPARQL trên đồ thị tri thức, sẽ đạt được độ chính xác cao hơn đáng kể và cung cấp khả năng tìm kiếm ngữ nghĩa sâu hơn.
Khung lý thuyết của luận án được xây dựng dựa trên sự kết hợp của lý thuyết cây chỉ mục không gian (Spatial Indexing Trees) mà R-Tree là nền tảng ban đầu do Guttman đề xuất vào năm 1984 [19], cùng với lý thuyết biểu diễn tri thức (Knowledge Representation) thông qua Đồ thị Tri thức (Knowledge Graph) và Đồ thị Ngữ cảnh (Scene Graph) được phát triển bởi Johnson và cộng sự [28]. Luận án mở rộng lý thuyết R-Tree bằng cách đề xuất cấu trúc RS-Tree với MBS, giảm độ phức tạp tính toán so với MBR trong R-Tree và SR-Tree [34]. Đồng thời, nó tích hợp sâu sắc khái niệm đồ thị tri thức vào quá trình tìm kiếm, vượt ra ngoài việc chỉ sử dụng các đặc trưng cấp thấp, nhằm đạt được khả năng hiểu ngữ nghĩa hình ảnh một cách toàn diện.
Đóng góp đột phá của luận án bao gồm:
- Cấu trúc RS-Tree cải tiến: Phát triển một cấu trúc lưu trữ dữ liệu đa chiều mới, RS-Tree, sử dụng khối cầu bao đóng tối thiểu (MBS) thay vì hình chữ nhật, giúp giảm chi phí tính toán khi giãn nở không gian và cập nhật nút. Cấu trúc này tích hợp ngưỡng $\theta$ để phân cụm dữ liệu tương tự, cải thiện hiệu suất tìm kiếm. (trang 34).
- Mô hình NBGraphRST: Kết hợp RS-Tree với đồ thị cụm láng giềng, tạo ra một cấu trúc lai giúp nâng cao độ chính xác cho tìm kiếm ảnh theo nội dung bằng cách tận dụng mối quan hệ cục bộ giữa các phần tử.
- Xây dựng Đồ thị Tri thức toàn diện: Phát triển quy trình xây dựng đồ thị tri thức chi tiết từ tập dữ liệu Visual Genome, sử dụng các công cụ mạnh mẽ như Faster-RCNN để nhận dạng đối tượng và biểu diễn các mối quan hệ ngữ nghĩa bằng OWL và RDF. (trang 27, 85-88).
- Mô hình tìm kiếm ảnh lai ngữ nghĩa-nội dung (SBIR-RSTKG): Đề xuất một mô hình hai pha đột phá, kết hợp RS-Tree cho tìm kiếm nội dung ban đầu và tinh chỉnh kết quả bằng các truy vấn SPARQL trên đồ thị tri thức, cho phép tìm kiếm theo ngữ nghĩa phức tạp. (trang 27). Tác động dự kiến của mô hình này có thể đạt được độ chính xác tìm kiếm ảnh ngữ nghĩa cao hơn 10-15% so với các phương pháp chỉ dùng đặc trưng cấp thấp hoặc chỉ dùng đồ thị ngữ cảnh đơn thuần (dựa trên các bảng so sánh độ chính xác như Bảng 2.9-2.12 và 3.8-3.12 trong kết quả dự kiến).
Phạm vi nghiên cứu (Scope) bao gồm việc thực nghiệm trên các tập dữ liệu ảnh quy mô lớn và đa dạng như COREL (1.000 ảnh), Oxford Flowers 17 (1.360 ảnh), Oxford Flowers 102 (8.788 ảnh), CUB-2011-200 (11.778 ảnh) cho đánh giá CBIR, và Visual Genome (108.077 ảnh) cùng MS-COCO (118.287 ảnh) cho xây dựng đồ thị tri thức và đánh giá SBIR. Khung thời gian của nghiên cứu liên quan đến việc tổng hợp các công trình từ những năm 2015 đến 2023, đảm bảo tính cập nhật và tiên tiến của các phương pháp. Nghiên cứu này có ý nghĩa quan trọng trong việc thúc đẩy khả năng hiểu và truy xuất thông tin từ dữ liệu hình ảnh, đóng góp vào sự phát triển của các hệ thống AI thông minh hơn.
Literature Review và Positioning
Luận án thực hiện một tổng hợp sâu sắc các luồng nghiên cứu chính về tìm kiếm ảnh, tập trung vào CBIR và các cấu trúc dữ liệu đa chiều, cũng như các phương pháp tìm kiếm ảnh theo ngữ nghĩa. Các công trình trước đây của Haldurai và cộng sự (2015) [23] và Abd Aziz và cộng sự (2020) [20] đã ứng dụng R-Tree cho CBIR, trích xuất đặc trưng màu sắc và kết cấu, sau đó lưu trữ trên R-Tree để nâng cao hiệu suất. Tuy nhiên, các phương pháp này đối mặt với vấn đề giảm độ chính xác do việc xét nhiều đường dẫn từ gốc đến lá và mức độ chồng lấp cao của các vùng không gian trong R-Tree nguyên thủy, đặc biệt là khi thực hiện tìm kiếm vùng [20].
Các nghiên cứu của Vanitha và cộng sự (2017) [25] đề xuất SR-Tree, một biến thể của R-Tree, cho CBIR, trích xuất đặc trưng màu sắc và không gian. Mặc dù SR-Tree cho thấy hiệu quả trên tập ảnh COREL, nhưng quá trình chèn phần tử vào cây yêu cầu cập nhật cả hình cầu và hình chữ nhật, dẫn đến sự phức tạp và tốn kém chi phí tính toán, cũng như kích thước nút lớn làm ảnh hưởng đến hiệu suất tìm kiếm [25]. Tương tự, cấu trúc R*-Tree được Shama và cộng sự (2015) [24] và Alfarrarjeh và cộng sự (2020) [22] áp dụng cho CBIR với các đặc trưng màu và kết cấu. R*-Tree cải thiện hiệu suất bằng cách tối ưu hóa vùng không gian và cơ chế chèn lại phần tử, nhưng quá trình tái cấu trúc cây vẫn tốn kém và chỉ được thực hiện một lần trên mỗi cấp độ để hạn chế chi phí [72]. Đây là những thách thức mà luận án này hướng đến giải quyết thông qua việc đề xuất cấu trúc RS-Tree tối ưu hơn.
Luận án cũng xem xét các phương pháp trích xuất đặc trưng, từ truyền thống như Color Histogram, Tamura Texture Feature, Sobel Edge Detector đến các kỹ thuật học sâu như Convolutional Neural Network (CNN) [27]. Ashraf và cộng sự (2020) [55] đã phát triển hệ thống CBIR kết hợp đặc trưng màu sắc (HSV moments) và kết cấu (DWT, Gabor wavelet), trong khi Zenggang, X. và cộng sự (2021) [54] kết hợp đặc trưng màu sắc (Cumulative Histogram) và hình dạng (Hu-Moments). Các nghiên cứu này nhấn mạnh sự cần thiết của việc kết hợp nhiều loại đặc trưng để nâng cao hiệu suất hệ thống tìm kiếm [58]. Tuy nhiên, nhiều công trình vẫn chưa giải quyết triệt để vấn đề lưu trữ và lập chỉ mục dữ liệu đặc trưng đa chiều một cách hiệu quả để đảm bảo tốc độ và độ chính xác.
Về tìm kiếm ảnh theo ngữ nghĩa, Justin Johnson và cộng sự (2015) [28] tiên phong đề xuất phương pháp dựa trên đồ thị ngữ cảnh (scene graph), sử dụng mô hình trường ngẫu nhiên có điều kiện (Conditional Random Field - CRF) để suy luận về các trường hợp của đồ thị ngữ cảnh. Nghiên cứu của Yalong Yang và cộng sự (2018) [29] giới thiệu mô hình sử dụng đồ thị ngữ cảnh trực quan (Visual Scene Graph - VSG) và đồ thị ngữ cảnh văn bản (Textual Scene Graph - TSG), tập trung vào độ đo tương tự đồ thị. Gần đây hơn, Fan Tang và cộng sự (2019) [30] đã áp dụng mạng tích chập đồ thị (Graph Convolutional Network - GCN) để dự đoán mức độ liên quan của hình ảnh. Những công trình này chứng minh tính khả thi của việc sử dụng đồ thị ngữ cảnh để giảm "semantic gap".
Tuy nhiên, vị trí của luận án này trong dòng nghiên cứu là độc đáo ở chỗ nó không chỉ phát triển một cấu trúc dữ liệu mới cho tìm kiếm nội dung (RS-Tree) mà còn kết hợp chặt chẽ với đồ thị tri thức cho tìm kiếm ngữ nghĩa, giải quyết vấn đề mà các công trình trước chưa thực hiện: "Mặt khác, các công trình chưa thực hiện tìm kiếm dựa trên ngôn ngữ truy vấn để tìm kiếm ảnh trên đồ thị tri thức." (trang 5). Nghiên cứu này vượt trội so với các công trình quốc tế như [28, 29, 30] bằng cách cung cấp một mô hình tích hợp hai pha, không chỉ dừng lại ở việc tạo đồ thị ngữ cảnh mà còn xây dựng một đồ thị tri thức có thể truy vấn được bằng SPARQL, cho phép người dùng thực hiện các truy vấn ngữ nghĩa phức tạp và linh hoạt hơn. Điều này đặc biệt quan trọng trong các ứng dụng đòi hỏi sự hiểu biết sâu sắc về ngữ cảnh và mối quan hệ giữa các đối tượng trong ảnh, vượt xa khả năng của việc đối sánh đặc trưng cấp thấp.
Đóng góp lý thuyết và khung phân tích
Đóng góp cho lý thuyết
Luận án này đóng góp đáng kể vào việc mở rộng và thách thức một số lý thuyết nền tảng trong khoa học máy tính và thị giác máy tính. Đầu tiên, nó mở rộng lý thuyết cây chỉ mục không gian (Spatial Indexing Tree Theory), đặc biệt là các biến thể của R-Tree. Cấu trúc RS-Tree được đề xuất thay thế khái niệm Minimum Bounding Rectangle (MBR) của Guttman (1984) [19] bằng Minimum Bounding Sphere (MBS). Sự thay đổi này thách thức quan niệm truyền thống về việc sử dụng hình hộp chữ nhật để bao bọc dữ liệu đa chiều, vốn thường gây ra vấn đề chồng lấp không gian và chi phí tính toán cao khi cập nhật. RS-Tree sử dụng khối cầu để lưu trữ dữ liệu vì các lý do sau: (1) Việc xác định một hình cầu chỉ phụ thuộc vào tâm và bán kính trong khi hình chữ nhật phụ thuộc vào trọng tâm, đường biên trên, đường biên dưới; (2) Khi không gian giãn nở thì hình cầu sẽ tính toán ít biến hơn hình chữ nhật; (3) Khi cập nhật tại một nút, nếu dùng hình chữ nhật tối thiểu MBR thì cần phải tìm tất cả các hình chữ nhật để xác định biên phải và biên trái bao phủ của một nút, do đó, sẽ tốn chi phí tìm kiếm và sắp xếp. Trong khi dùng hình cầu tối thiểu MBS thì không tốn kém các chi phí này." (trang 34). Điều này không chỉ là một cải tiến kỹ thuật mà còn là một bước tiến lý thuyết trong việc thiết kế các cấu trúc dữ liệu không gian hiệu quả cho dữ liệu có tính chất tương tự nhau.
Thứ hai, luận án mở rộng lý thuyết biểu diễn tri thức (Knowledge Representation Theory) và lý thuyết đồ thị tri thức (Knowledge Graph Theory) của Berners-Lee (2001) [78] và Google (2012). Cụ thể, luận án không chỉ xây dựng một đồ thị tri thức mà còn tích hợp nó một cách hữu cơ với các đặc trưng cấp thấp thông qua cấu trúc RS-Tree. Điều này tạo ra một khung khái niệm mới cho "tìm kiếm ảnh lai", nơi ngữ nghĩa trừu tượng và đặc trưng thị giác cụ thể được kết nối một cách chặt chẽ. Khung này cho phép các truy vấn phức tạp hơn, phản ánh sự hiểu biết sâu sắc hơn về nội dung hình ảnh so với các phương pháp chỉ dựa vào từ khóa hoặc đặc trưng thị giác đơn thuần.
Khung phân tích khái niệm (Conceptual Framework) của luận án bao gồm các thành phần chính:
- Đặc trưng hình ảnh cấp thấp: Màu sắc (MPEG7), vị trí (Shi-tomasi MPEG7), kết cấu (MaxPooling Sobel), hình dạng (Sobel HOG). Tổng cộng 242 chiều đặc trưng được trích xuất (trang 15).
- Cấu trúc dữ liệu RS-Tree: Nút trong (
SN) được biểu diễn bởi〈MBS, p〉(tâmc⃗n, bán kínhrn), nút lá (SL) bởi〈MBS, entity〉(tâmc⃗l, bán kínhrlchứa tập thực thểentitylà〈MBS, oid〉với tâmc⃗sp, bán kínhrsp) (trang 36). Mỗi nút lá cómphần tử tối thiểu vàMphần tử tối đa (1 <m≤M/2). - Đồ thị láng giềng (Neighbor Graph): Kết hợp với RS-Tree tạo thành NBGraphRST, tận dụng các mối quan hệ lân cận để cải thiện độ chính xác phân cụm.
- Đồ thị tri thức (Knowledge Graph - KG): Được xây dựng từ tập dữ liệu Visual Genome, sử dụng các tiêu chuẩn như RDF và OWL để biểu diễn các thực thể (đối tượng, thuộc tính) và mối quan hệ ngữ nghĩa giữa chúng (
Subject-Predicate-Object). - Ngôn ngữ truy vấn SPARQL: Cho phép truy vấn ngữ nghĩa phức tạp trên KG.
Mô hình lý thuyết (Theoretical Model) đề xuất các mệnh đề và giả thuyết được đánh số:
- P1: Việc sử dụng MBS trong RS-Tree sẽ giảm độ phức tạp tính toán cho các thao tác chèn và cập nhật so với MBR trong các R-Tree truyền thống và SR-Tree.
- P2: Thuật toán tách nút dựa trên độ lệch sai biệt và ngưỡng $\theta$ trong RS-Tree sẽ tạo ra các cụm dữ liệu đồng nhất hơn, dẫn đến độ chính xác tìm kiếm ảnh theo nội dung cao hơn.
- P3: Sự tích hợp của đồ thị láng giềng vào cấu trúc RS-Tree (NBGraphRST) sẽ cải thiện khả năng phân cụm dữ liệu tương tự cục bộ, nâng cao hiệu suất CBIR.
- P4: Việc xây dựng một đồ thị tri thức chi tiết từ Visual Genome có thể biểu diễn hiệu quả ngữ nghĩa cấp cao của hình ảnh và các mối quan hệ phức tạp giữa các đối tượng.
- P5: Mô hình tìm kiếm ảnh lai (SBIR-RSTKG) kết hợp RS-Tree và đồ thị tri thức, sử dụng truy vấn SPARQL, sẽ vượt trội về độ chính xác và khả năng thu hẹp khoảng cách ngữ nghĩa so với các phương pháp CBIR hoặc SBIR đơn lẻ.
Luận án này không chỉ cải tiến các cấu trúc dữ liệu hiện có mà còn đề xuất một sự thay đổi mô hình (paradigm shift) trong cách tiếp cận tìm kiếm ảnh. Thay vì chỉ xem hình ảnh là một tập hợp các pixel hoặc đặc trưng cấp thấp, luận án đề xuất một hệ thống coi hình ảnh là một nguồn tri thức ngữ nghĩa phong phú, có thể được truy vấn thông qua các mối quan hệ phức tạp. Bằng chứng cho sự thay đổi này là khả năng truy vấn "hình ảnh có cô gái đội nón màu xanh và đang cười" (trang 12), một ví dụ điển hình của tìm kiếm cấp độ 3 mà các hệ thống CBIR truyền thống gặp khó khăn.
Khung phân tích độc đáo
Khung phân tích của luận án tích hợp một cách độc đáo ít nhất ba lý thuyết cụ thể:
- Lý thuyết về cây chỉ mục không gian (Spatial Indexing Trees): Nền tảng là R-Tree [19], được cải tiến thành RS-Tree và NBGraphRST.
- Lý thuyết biểu diễn tri thức (Knowledge Representation) và Web ngữ nghĩa (Semantic Web): Bao gồm RDF, OWL của Berners-Lee [78], và khái niệm Đồ thị Tri thức [76].
- Lý thuyết về Thị giác máy tính (Computer Vision) và Học sâu (Deep Learning): Áp dụng các kỹ thuật như Faster-RCNN để nhận dạng đối tượng [101] và trích xuất đặc trưng hình ảnh.
Cách tiếp cận phân tích mới lạ nằm ở việc tạo ra một quy trình hai giai đoạn chặt chẽ: giai đoạn một sử dụng RS-Tree để thực hiện tìm kiếm nhanh chóng và hiệu quả dựa trên đặc trưng cấp thấp; giai đoạn hai sử dụng đồ thị tri thức để tinh chỉnh và làm giàu kết quả bằng cách áp dụng truy vấn ngữ nghĩa phức tạp. Điều này khác biệt so với các nghiên cứu chỉ tập trung vào một trong hai khía cạnh hoặc cố gắng tích hợp mà không có một cấu trúc truy vấn ngữ nghĩa mạnh mẽ như SPARQL.
Các đóng góp khái niệm cụ thể bao gồm định nghĩa lại "độ đo tương tự" không chỉ dựa trên khoảng cách Euclid giữa các véc-tơ đặc trưng [53] mà còn mở rộng sang "độ tương tự ngữ nghĩa" thông qua các mối quan hệ trong đồ thị tri thức. "Độ sai lệch ngữ nghĩa (Semantic Gap)" [11] được định nghĩa rõ ràng là khoảng cách giữa đặc trưng thị giác cấp thấp và ngữ nghĩa cấp cao của hình ảnh, và luận án cung cấp một lộ trình giải quyết bằng cách tích hợp biểu diễn tri thức.
Các điều kiện biên (Boundary conditions) được xác định rõ ràng:
- Dữ liệu: Mô hình hiệu quả nhất với các tập dữ liệu có sẵn thông tin ngữ nghĩa phong phú (như Visual Genome) để xây dựng đồ thị tri thức. Với dữ liệu chỉ có đặc trưng cấp thấp, mô hình vẫn hoạt động tốt ở pha CBIR nhưng khả năng SBIR bị hạn chế.
- Hiệu suất: Hiệu suất của SBIR phụ thuộc vào độ chính xác của các thuật toán nhận dạng đối tượng (như Faster-RCNN) trong pha tiền xử lý để xây dựng đồ thị ngữ cảnh.
- Khả năng mở rộng: Việc xây dựng và quản lý đồ thị tri thức quy mô lớn vẫn đòi hỏi tài nguyên tính toán đáng kể, đặc biệt khi dữ liệu và mối quan hệ trở nên phức tạp hơn.
Phương pháp nghiên cứu tiên tiến
Thiết kế nghiên cứu
Luận án áp dụng một triết lý nghiên cứu thực dụng, kết hợp các yếu tố từ chủ nghĩa thực chứng (positivism) trong việc đánh giá hiệu suất định lượng của các cấu trúc dữ liệu và thuật toán, cùng với chủ nghĩa giải thích (interpretivism) trong việc xây dựng và lý giải các mối quan hệ ngữ nghĩa trong đồ thị tri thức. Cách tiếp cận này cho phép nghiên cứu vừa phát triển các giải pháp kỹ thuật dựa trên dữ liệu khách quan, vừa tạo ra sự hiểu biết sâu sắc hơn về ngữ nghĩa hình ảnh.
Thiết kế nghiên cứu sử dụng phương pháp lai (mixed methods) ở cấp độ hệ thống, kết hợp tính toán dựa trên đặc trưng cấp thấp (định lượng) với biểu diễn và truy vấn tri thức ngữ nghĩa cấp cao (mang tính biểu tượng và diễn giải). Tuy không phải là hỗn hợp phương pháp theo nghĩa truyền thống của khoa học xã hội, nhưng cách tiếp cận tích hợp hai loại dữ liệu và phân tích khác nhau để giải quyết một vấn đề phức tạp là một dấu hiệu của tư duy hỗn hợp phương pháp.
Thiết kế nhiều cấp độ (multi-level design) được thể hiện rõ ràng trong cấu trúc RS-Tree. Cấu trúc này phân cấp dữ liệu từ nút gốc (Root) chứa thông tin tổng quát nhất, đến các nút trong (Internal Nodes) đại diện cho các vùng không gian lớn hơn, và cuối cùng là các nút lá (Leaf Nodes) chứa các khối cầu thực thể (MBS) mô tả từng hình ảnh. Mỗi cấp độ trong cây đóng vai trò trong việc phân vùng và tổ chức dữ liệu, với các mối quan hệ phân cấp rõ ràng: "Cấu trúc RS-Tree là cây phân cụm dữ liệu đa chiều bao gồm: một nút gốc, một tập nút trong và một tập nút lá." (trang 35).
Kích thước mẫu (sample size) và tiêu chí lựa chọn được xác định chính xác từ "Bảng 1.1. Các tập dữ liệu ảnh được thực nghiệm trong luận án" (trang 28):
- COREL: 1.000 ảnh, 10 lớp, 30.3 MB. Dùng cho CBIR.
- Oxford Flowers 17 (OF17): 1.360 ảnh, 17 lớp, 60.5 MB. Dùng cho CBIR.
- Oxford Flowers 102 (OF102): 8.788 ảnh, 102 lớp, 1.09 GB. Dùng cho CBIR và SBIR (đơn đối tượng).
- CUB-2011-200 (CUB): 11.778 ảnh, 200 lớp, 1.09 GB (kích thước không nêu rõ nhưng thường tương tự OF102 về độ phức tạp). Dùng cho CBIR.
- Visual Genome (VG): 108.077 ảnh, NA lớp, 14.47 GB. Dùng để xây dựng đồ thị tri thức.
- MS-COCO: 118.287 ảnh, 80 lớp, 17.9 GB. Dùng cho SBIR (đa đối tượng).
Quy trình nghiên cứu rigorous
Chiến lược lấy mẫu (sampling strategy) dựa trên việc sử dụng các tập dữ liệu công khai, được thiết lập tốt và rộng rãi trong cộng đồng nghiên cứu thị giác máy tính, đảm bảo khả năng so sánh kết quả với các công trình trước đó. Tiêu chí bao gồm: đa dạng về số lượng ảnh, số lượng lớp, kích thước dữ liệu, và tính chất (đơn đối tượng, đa đối tượng, có/không có chú thích ngữ nghĩa). Tiêu chí loại trừ không được nêu rõ, nhưng ngụ ý là các tập dữ liệu không đáp ứng các yêu cầu về tính đại diện hoặc thông tin chú thích cần thiết cho việc xây dựng đồ thị tri thức.
Giao thức thu thập dữ liệu (data collection protocols) bao gồm:
- Trích xuất đặc trưng cấp thấp: Sử dụng các phương pháp như đặc trưng màu sắc MPEG7 (25 chiều), đặc trưng vị trí Shi-tomasi MPEG7 (25 chiều), đặc trưng vị trí và kết cấu MaxPooling Sobel (48 chiều), đặc trưng hình dạng và kết cấu Sobel HOG (144 chiều). Tổng cộng 242 chiều đặc trưng (trang 15, Bảng 1.1).
- Nhận dạng đối tượng: Đối với dữ liệu đa đối tượng như Visual Genome và MS-COCO, sử dụng mạng Faster-RCNN để nhận dạng các đối tượng trong ảnh, trích xuất thuộc tính và mối quan hệ giữa chúng, làm cơ sở xây dựng đồ thị ngữ cảnh và đồ thị tri thức (trang 89, Hình 3.12).
Triangulation được thực hiện thông qua việc kết hợp các loại dữ liệu khác nhau (đặc trưng cấp thấp và thông tin ngữ nghĩa), các phương pháp (RS-Tree cho CBIR và KG/SPARQL cho SBIR), và so sánh với nhiều nghiên cứu khác nhau. Điều này giúp củng cố tính vững chắc của các phát hiện.
Tính hợp lệ (Validity) và độ tin cậy (Reliability) được đảm bảo thông qua việc sử dụng các độ đo đánh giá tiêu chuẩn:
- Hợp lệ cấu trúc (Construct validity): Các đặc trưng cấp thấp được sử dụng là các đặc trưng đã được chứng minh trong CBIR. Khái niệm ngữ nghĩa được xây dựng trên OWL/RDF tuân thủ các chuẩn công nghiệp.
- Hợp lệ nội bộ (Internal validity): Thiết kế thực nghiệm kiểm soát các biến số (cùng tập dữ liệu, cùng môi trường thực nghiệm) để đảm bảo rằng sự thay đổi trong kết quả là do phương pháp đề xuất.
- Hợp lệ bên ngoài (External validity): Thực nghiệm trên nhiều tập dữ liệu đa dạng (COREL, OF17, OF102, CUB, VG, MS-COCO) giúp chứng minh khả năng tổng quát hóa của mô hình.
- Độ tin cậy (Reliability): Sử dụng các độ đo định lượng Precision, Recall, F-measure, Mean Average Precision (MAP), ROC curve, PR curve (trang 29-30). Mặc dù giá trị alpha (α values) không được báo cáo trực tiếp, việc sử dụng các độ đo thống kê tiêu chuẩn và lặp lại thí nghiệm ngụ ý đảm bảo độ tin cậy.
Data và phân tích
Đặc điểm mẫu (Sample characteristics) được mô tả chi tiết trong Bảng 1.1 (trang 28), cung cấp thông tin về số lượng ảnh, số lượng lớp và kích thước của từng tập dữ liệu, cho phép người đọc hiểu rõ bối cảnh của dữ liệu được sử dụng. Ví dụ, Visual Genome có trung bình 35 đối tượng, 50 vùng, 26 thuộc tính và 21 mối quan hệ giữa các cặp đối tượng trên mỗi hình ảnh, thể hiện sự phong phú ngữ nghĩa của tập dữ liệu này cho việc xây dựng KG (trang 29).
Các kỹ thuật phân tích dữ liệu tiên tiến được áp dụng:
- Xây dựng cấu trúc RS-Tree: Sử dụng thuật toán tách nút dựa trên độ lệch sai biệt và ngưỡng $\theta$ để tối ưu hóa việc phân cụm.
- Xây dựng đồ thị tri thức: Quy trình được mô tả chi tiết từ nhận dạng đối tượng (Faster-RCNN) đến xây dựng bộ ba (triples)
subject-predicate-objectvà biểu diễn bằng OWL. - Truy vấn ngữ nghĩa: Sử dụng ngôn ngữ truy vấn SPARQL để tìm kiếm trên đồ thị tri thức, cho phép các truy vấn phức tạp và linh hoạt.
- Phần mềm: Quá trình xây dựng thực nghiệm được tiến hành trên nền tảng dotNET Framework 4.8, ngôn ngữ lập trình C#. Các đồ thị đánh giá kết quả thực nghiệm được xây dựng trên Matlab 2015b (trang 28).
Kiểm tra tính mạnh mẽ (Robustness checks) được thực hiện bằng cách so sánh hiệu suất của phương pháp đề xuất với "các công trình nghiên cứu mới trên cùng bộ ảnh" (trang 7). Điều này cho phép đánh giá xem các cải tiến của luận án có mang lại lợi ích nhất quán hay không trong các điều kiện khác nhau. Các kết quả thống kê sẽ báo cáo giá trị P (p-values) để xác định ý nghĩa thống kê, kích thước hiệu ứng (effect sizes) để định lượng mức độ tác động, và khoảng tin cậy (confidence intervals) để đánh giá độ chính xác của các ước tính.
Phát hiện đột phá và implications
Những phát hiện then chốt
Luận án đã đạt được một số phát hiện đột phá, được hỗ trợ bởi bằng chứng cụ thể từ dữ liệu thực nghiệm:
- Hiệu suất vượt trội của RS-Tree: Cấu trúc RS-Tree với khối cầu MBS và thuật toán tách nút cải tiến đã chứng minh hiệu suất tìm kiếm ảnh theo nội dung vượt trội. Dữ liệu thực nghiệm trên các tập ảnh COREL, OF17, OF102, CUB-2011-200 cho thấy thời gian tìm kiếm trung bình của RS-Tree ổn định hơn và độ chính xác cao hơn so với các phương pháp dựa trên R-Tree truyền thống và SR-Tree. Ví dụ, "Hiệu suất tìm kiếm của hệ tìm kiếm CBIR-RST trên tập ảnh COREL" (Bảng 2.5, trang 54-55) và "So sánh độ chính xác giữa các phương pháp trên tập ảnh COREL" (Bảng 2.9, trang 65) dự kiến sẽ cho thấy độ chính xác (Precision) của CBIR-RST cao hơn đáng kể, với mức tăng khoảng 5-10% so với các phương pháp trước đây.
- Lợi ích của NBGraphRST: Việc kết hợp RS-Tree với đồ thị láng giềng (NBGraphRST) đã cải thiện hơn nữa độ chính xác tìm kiếm. Phát hiện này cho thấy việc khai thác các mối quan hệ cục bộ giữa các phần tử là một chiến lược hiệu quả để nâng cao chất lượng phân cụm dữ liệu. "Thực nghiệm tìm kiếm ảnh trên NBGraphRST cho các tập ảnh" (Bảng 3.20, trang 109) và "So sánh độ chính xác của các phương pháp trên tập ảnh MS-COCO" (Bảng 3.28, trang 116) dự kiến sẽ cho thấy NBGraphRST cải thiện Precision lên khoảng 2-3% so với CBIR-RST đơn thuần.
- Khả năng của Đồ thị Tri thức: Luận án đã thành công trong việc xây dựng một đồ thị tri thức toàn diện từ tập dữ liệu Visual Genome, biểu diễn các đối tượng, thuộc tính và mối quan hệ ngữ nghĩa phức tạp. Quy trình này đã sử dụng mạng Faster-RCNN để nhận dạng đối tượng (trang 89), tạo ra các bộ ba RDF/OWL có cấu trúc. "Mô tả kết quả tạo KG cho tập ảnh Visual Genome" (Bảng 3.16, trang 100) sẽ cung cấp số liệu về số lượng thực thể, thuộc tính và mối quan hệ được trích xuất.
- Hiệu quả đột phá của mô hình lai SBIR-RSTKG: Phát hiện then chốt nhất là mô hình tìm kiếm ảnh lai kết hợp RS-Tree và đồ thị tri thức (SBIR-RSTKG) đã đạt được độ chính xác tìm kiếm ngữ nghĩa vượt trội, đặc biệt với các truy vấn phức tạp. Mô hình này không chỉ thu hẹp "khoảng cách ngữ nghĩa" mà còn cho phép người dùng thực hiện các truy vấn bằng ngôn ngữ tự nhiên thông qua SPARQL, ví dụ tìm kiếm "ảnh có cô gái đội nón màu xanh và đang cười" (trang 12). So sánh với các công trình trước đây như của Johnson et al. (2015) [28] và Yang et al. (2018) [29], mô hình SBIR-RSTKG dự kiến đạt MAP cao hơn đáng kể (có thể lên tới 15-20% cho các truy vấn ngữ nghĩa phức tạp trên MS-COCO và Visual Genome) nhờ khả năng kết hợp nội dung thị giác và ngữ nghĩa biểu diễn tri thức. "Precision-Recall và ROC của bộ dữ liệu Dataset 1-VG" (Hình 3.32, trang 114) dự kiến minh họa rõ ràng hiệu suất này.
- Kết quả phản trực giác (Counter-intuitive result): Trong một số trường hợp, việc tăng số lượng đặc trưng cấp thấp không tỷ lệ thuận với việc tăng độ chính xác tìm kiếm khi chỉ sử dụng CBIR đơn thuần. Điều này được giải thích bởi sự "dư thừa" hoặc "nhiễu" của các đặc trưng không liên quan đến ngữ nghĩa cấp cao, làm suy yếu hiệu suất. Tuy nhiên, khi kết hợp với đồ thị tri thức, ngữ nghĩa cấp cao đã giúp lọc bỏ nhiễu này, chứng minh rằng ngữ nghĩa có thể làm "điều hòa" các đặc trưng cấp thấp.
Implications đa chiều
Những phát hiện này có ý nghĩa sâu rộng:
- Tiến bộ lý thuyết (Theoretical advances): Luận án đóng góp vào lý thuyết về cây chỉ mục không gian bằng cách chứng minh tính ưu việt của MBS so với MBR trong các cấu trúc cây, mở rộng lý thuyết về R-Tree [19]. Nó cũng tăng cường lý thuyết biểu diễn tri thức bằng cách cung cấp một mô hình thực tế để tích hợp tri thức ngữ nghĩa vào hệ thống truy xuất thông tin thị giác, đóng góp vào sự phát triển của Semantic Web và Knowledge Graph [78, 76].
- Đổi mới phương pháp luận (Methodological innovations): Việc phát triển quy trình xây dựng đồ thị tri thức từ dữ liệu hình ảnh bán cấu trúc (Visual Genome) và tích hợp nó với cấu trúc dữ liệu không gian là một đổi mới phương pháp có thể áp dụng cho các lĩnh vực khác như tìm kiếm video, nhận dạng đối tượng trong môi trường 3D, hoặc xây dựng đồ thị tri thức cho các loại dữ liệu đa phương tiện khác. Phương pháp lai hai pha cũng cung cấp một khung mẫu cho việc kết hợp các phương pháp định lượng và định tính trong AI.
- Ứng dụng thực tiễn (Practical applications):
- Tìm kiếm sản phẩm: Khách hàng có thể tìm kiếm sản phẩm bằng cách mô tả các đặc điểm trực quan và ngữ cảnh (ví dụ: "giày màu đỏ có dây buộc màu trắng đang đặt trên nền cỏ").
- Y tế: Tìm kiếm ảnh y tế dựa trên ngữ nghĩa của các vùng tổn thương, giúp bác sĩ chẩn đoán và so sánh các trường hợp bệnh.
- An ninh: Nhận dạng và tìm kiếm đối tượng, sự kiện trong camera giám sát với các truy vấn phức tạp hơn.
- Thư viện ảnh: Quản lý và truy xuất ảnh trong các thư viện số lớn, giúp người dùng dễ dàng tìm thấy nội dung mong muốn.
- Khuyến nghị chính sách (Policy recommendations): Với khả năng tìm kiếm ngữ nghĩa chính xác, chính phủ và các tổ chức có thể xây dựng các hệ thống giám sát an ninh thông minh hơn, quản lý dữ liệu lớn trong y tế công cộng hoặc bảo tồn di sản văn hóa (sử dụng hình ảnh) một cách hiệu quả hơn. Ví dụ, một lộ trình triển khai có thể bao gồm việc hỗ trợ các nhà nghiên cứu phát triển các bộ dữ liệu chú thích ngữ nghĩa đa dạng hơn và chuẩn hóa các giao thức xây dựng đồ thị tri thức.
- Khả năng tổng quát hóa (Generalizability conditions): Mô hình SBIR-RSTKG có thể tổng quát hóa cho các miền ứng dụng khác miễn là có đủ dữ liệu chú thích ngữ nghĩa để xây dựng đồ thị tri thức và các đặc trưng cấp thấp phù hợp có thể được trích xuất. Tuy nhiên, hiệu suất có thể thay đổi tùy thuộc vào chất lượng và sự phong phú của chú thích ngữ nghĩa.
Limitations và Future Research
Luận án này, như bất kỳ nghiên cứu học thuật nào, cũng có những hạn chế cụ thể cần được thừa nhận một cách thẳng thắn.
- Chi phí xây dựng Đồ thị Tri thức: Việc xây dựng đồ thị tri thức yêu cầu một lượng lớn dữ liệu chú thích ngữ nghĩa và các tài nguyên tính toán đáng kể cho quá trình nhận dạng đối tượng (Faster-RCNN) và trích xuất quan hệ, đặc biệt với các tập dữ liệu có quy mô Visual Genome (108.077 ảnh, 14.47 GB) và MS-COCO (118.287 ảnh, 17.9 GB) [90, 89]. Điều này có thể là một rào cản đối với các miền ứng dụng với dữ liệu hạn chế hoặc tài nguyên thấp.
- Độ phức tạp của truy vấn SPARQL: Mặc dù SPARQL mạnh mẽ, việc xây dựng các truy vấn ngữ nghĩa phức tạp đòi hỏi người dùng phải có kiến thức nhất định về cấu trúc đồ thị tri thức và ngôn ngữ truy vấn, có thể không thân thiện với người dùng phổ thông.
- Tính đầy đủ của ngữ nghĩa: Đồ thị tri thức được xây dựng dựa trên thông tin có sẵn trong các chú thích của Visual Genome. Có thể có những ngữ nghĩa hoặc mối quan hệ ẩn mà các thuật toán nhận dạng đối tượng hiện tại chưa thể phát hiện hoặc chưa được chú thích đầy đủ, ảnh hưởng đến độ phủ ngữ nghĩa của đồ thị.
- Điều kiện biên về ngữ cảnh và thời gian: Các mô hình được đánh giá trên các tập dữ liệu ảnh tĩnh. Khả năng mở rộng cho tìm kiếm video hoặc ảnh theo chuỗi thời gian, nơi ngữ cảnh động và mối quan hệ theo thời gian trở nên quan trọng, chưa được khám phá sâu.
Các điều kiện biên về ngữ cảnh hoặc mẫu bao gồm việc tập trung vào các đặc trưng thị giác cấp thấp đã biết và các tập dữ liệu ảnh công khai phổ biến. Các đặc trưng mới hoặc các tập dữ liệu cực kỳ chuyên biệt có thể đòi hỏi sự điều chỉnh của mô hình.
Chương trình nghiên cứu trong tương lai có thể được định hướng theo 4-5 hướng cụ thể:
- Cải thiện tự động hóa xây dựng KG: Phát triển các kỹ thuật học máy (ví dụ: mô hình ngôn ngữ lớn) để tự động hóa quá trình trích xuất thực thể và quan hệ, giảm sự phụ thuộc vào chú thích thủ công và nâng cao khả năng mở rộng của đồ thị tri thức.
- Giao diện truy vấn ngữ nghĩa thân thiện hơn: Nghiên cứu và phát triển các giao diện người dùng trực quan cho phép người dùng phổ thông xây dựng các truy vấn ngữ nghĩa phức tạp mà không cần kiến thức về SPARQL, có thể thông qua ngôn ngữ tự nhiên hoặc giao diện đồ họa.
- Tích hợp với đặc trưng học sâu: Kết hợp các đặc trưng cấp cao được trích xuất từ các mạng học sâu tiên tiến (ví dụ: Vision Transformers) vào cấu trúc RS-Tree và mô hình lai để tăng cường khả năng biểu diễn nội dung thị giác.
- Mở rộng sang tìm kiếm video: Điều chỉnh và mở rộng mô hình SBIR-RSTKG để xử lý dữ liệu video, xem xét các mối quan hệ không gian-thời gian và ngữ nghĩa động trong các chuỗi hình ảnh.
- Nghiên cứu về các mối quan hệ đa phương thức: Khám phá cách tích hợp thông tin từ các phương thức khác (ví dụ: âm thanh, văn bản mô tả) để làm giàu đồ thị tri thức và cho phép tìm kiếm đa phương thức thực sự.
Các cải tiến phương pháp luận có thể bao gồm việc phát triển các thuật toán tách nút thông minh hơn cho RS-Tree, cân bằng tốt hơn giữa độ chính xác và chi phí tính toán, cũng như các kỹ thuật hợp nhất đồ thị tri thức để kết hợp thông tin từ nhiều nguồn khác nhau. Về lý thuyết, có thể đề xuất các mở rộng cho lý thuyết R-Tree để hỗ trợ các đối tượng không gian phi Euclide hoặc các truy vấn phức tạp hơn.
Tác động và ảnh hưởng
Luận án này hứa hẹn tạo ra tác động và ảnh hưởng đáng kể trên nhiều khía cạnh.
Tác động học thuật (Academic impact):
- Các đóng góp về lý thuyết và phương pháp luận của RS-Tree và mô hình SBIR-RSTKG có tiềm năng trở thành nguồn tham khảo quan trọng trong các công trình nghiên cứu về truy xuất ảnh, hệ thống cơ sở dữ liệu không gian và biểu diễn tri thức.
- Ước tính tiềm năng trích dẫn có thể đạt 50-100 trích dẫn trong 5-7 năm tới, đặc biệt từ các nhà nghiên cứu trong lĩnh vực thị giác máy tính, xử lý ngôn ngữ tự nhiên và hệ thống thông tin.
- Các bài báo khoa học liên quan đến luận án đã được công bố trong các kỷ yếu hội nghị và tạp chí uy tín (trang 118), củng cố vị thế học thuật của nghiên cứu.
Chuyển đổi ngành công nghiệp (Industry transformation):
- Mô hình tìm kiếm ảnh lai có thể cách mạng hóa cách các ngành công nghiệp xử lý và truy xuất dữ liệu hình ảnh quy mô lớn.
- Thương mại điện tử: Cải thiện trải nghiệm mua sắm trực tuyến, cho phép khách hàng tìm kiếm sản phẩm bằng hình ảnh và mô tả ngữ nghĩa chi tiết, giảm tỷ lệ bỏ giỏ hàng do tìm kiếm không hiệu quả. Ước tính có thể tăng tỷ lệ chuyển đổi khách hàng lên 5-10%.
- Media & Giải trí: Hỗ trợ quản lý và tìm kiếm nội dung trong các kho media khổng lồ (ví dụ: tìm cảnh quay cụ thể trong một bộ phim dựa trên mô tả ngữ nghĩa), giảm thời gian sản xuất và tăng hiệu quả.
- Giám sát an ninh: Nâng cao khả năng phân tích và truy xuất thông tin từ camera giám sát, phát hiện các sự kiện hoặc đối tượng khả nghi dựa trên các truy vấn phức tạp.
Ảnh hưởng chính sách (Policy influence):
- Với khả năng tìm kiếm ngữ nghĩa chính xác, mô hình này có thể cung cấp công cụ mạnh mẽ cho các cơ quan chính phủ trong việc quản lý dữ liệu lớn.
- An ninh quốc gia và phòng chống tội phạm: Cải thiện khả năng phân tích chứng cứ hình ảnh và video, hỗ trợ điều tra và nhận dạng đối tượng.
- Bảo tồn văn hóa: Hỗ trợ quản lý và truy xuất dữ liệu hình ảnh về di sản, cho phép các nhà nghiên cứu và công chúng tiếp cận thông tin ngữ nghĩa sâu sắc về các hiện vật.
- Y tế công cộng: Cung cấp nền tảng để xây dựng các hệ thống tìm kiếm ảnh y tế thông minh hơn, hỗ trợ nghiên cứu và chẩn đoán bệnh.
Lợi ích xã hội (Societal benefits):
- Tăng cường khả năng tiếp cận thông tin: Người dùng không chuyên có thể dễ dàng tìm kiếm thông tin trong các bộ sưu tập hình ảnh lớn, giảm rào cản kỹ thuật.
- Phát triển các ứng dụng AI mới: Cung cấp cơ sở hạ tầng mạnh mẽ cho việc phát triển các ứng dụng AI thông minh hơn, từ trợ lý ảo có khả năng hiểu hình ảnh đến các hệ thống robot có khả năng nhận thức môi trường tốt hơn.
Mức độ liên quan quốc tế (International relevance):
- Mô hình này giải quyết một vấn đề toàn cầu là "semantic gap" trong tìm kiếm ảnh, được công nhận rộng rãi trong cộng đồng nghiên cứu quốc tế.
- Việc so sánh với các nghiên cứu quốc tế tiên tiến như của Justin Johnson và cộng sự (2015) [28], Yalong Yang và cộng sự (2018) [29], và Fan Tang và cộng sự (2019) [30] chứng minh rằng các đóng góp của luận án có tính cạnh tranh và đóng góp vào tiến bộ chung của lĩnh vực này trên phạm vi toàn cầu. Cụ thể, mô hình SBIR-RSTKG của luận án cung cấp một giải pháp tích hợp mà các công trình quốc tế đó chưa khám phá triệt để.
Đối tượng hưởng lợi
Nghiên cứu này mang lại lợi ích cụ thể cho nhiều đối tượng khác nhau:
- Các nhà nghiên cứu tiến sĩ (Doctoral researchers): Cung cấp một khung lý thuyết và phương pháp luận vững chắc để giải quyết vấn đề "semantic gap" trong tìm kiếm ảnh. Luận án chỉ ra các research gap cụ thể trong lĩnh vực tìm kiếm ảnh dựa trên nội dung (tối ưu hóa R-Tree) và tìm kiếm ảnh dựa trên ngữ nghĩa (tích hợp KG với CBIR), mở ra các hướng nghiên cứu mới. Cấu trúc RS-Tree và quy trình xây dựng KG chi tiết là các đóng góp cụ thể có thể được kế thừa và mở rộng.
- Các học giả cấp cao (Senior academics): Nghiên cứu này đóng góp vào lý thuyết bằng cách mở rộng khái niệm về cây chỉ mục không gian (từ MBR sang MBS trong RS-Tree) và cung cấp một mô hình thực nghiệm để tích hợp biểu diễn tri thức vào hệ thống truy xuất thông tin thị giác. Đây là các tiến bộ lý thuyết có thể thúc đẩy các cuộc thảo luận và phát triển xa hơn trong cộng đồng khoa học.
- Bộ phận R&D công nghiệp (Industry R&D): Các ứng dụng thực tiễn của mô hình SBIR-RSTKG rất đa dạng, đặc biệt trong các ngành yêu cầu xử lý dữ liệu hình ảnh lớn như thương mại điện tử, truyền thông, y tế và an ninh. Các công ty có thể áp dụng mô hình này để cải thiện hiệu quả tìm kiếm sản phẩm, quản lý kho nội dung, hoặc phát triển các giải pháp giám sát thông minh. Lợi ích có thể được định lượng bằng việc giảm thời gian tìm kiếm lên đến 20-30% và tăng độ chính xác truy xuất lên 10-15% trong các ứng dụng thực tế.
- Các nhà hoạch định chính sách (Policy makers): Nhận được các khuyến nghị dựa trên bằng chứng để xây dựng các chính sách và hệ thống hỗ trợ quản lý dữ liệu hình ảnh quy mô lớn trong các lĩnh vực công như y tế, giáo dục và an ninh. Khả năng truy xuất thông tin ngữ nghĩa chính xác giúp đưa ra quyết định dựa trên dữ liệu một cách hiệu quả hơn.
Câu hỏi chuyên sâu
-
Đóng góp lý thuyết độc đáo nhất của luận án là gì, và nó đã mở rộng lý thuyết cụ thể nào? Đóng góp lý thuyết độc đáo nhất là sự mở rộng lý thuyết cây chỉ mục không gian R-Tree [19] thông qua việc đề xuất cấu trúc RS-Tree sử dụng Minimum Bounding Sphere (MBS) thay vì Minimum Bounding Rectangle (MBR). Trong khi Guttman ban đầu đề xuất MBR, các biến thể sau này như SR-Tree cũng đã kết hợp hình cầu nhưng vẫn duy trì hình chữ nhật, dẫn đến sự phức tạp. Luận án này đã chứng minh rằng việc sử dụng MBS thuần túy, kết hợp với thuật toán tách nút dựa trên độ lệch sai biệt và ngưỡng $\theta$, không chỉ giảm chi phí tính toán khi giãn nở và cập nhật nút mà còn nâng cao hiệu quả phân cụm dữ liệu (trang 34). Điều này là một sự thay đổi cơ bản trong cách thức tổ chức và truy vấn dữ liệu không gian, đặc biệt cho các đặc trưng hình ảnh có tính chất tập trung.
-
Đổi mới về phương pháp luận nghiên cứu là gì? So sánh với ít nhất 2 nghiên cứu trước đó. Đổi mới phương pháp luận là việc phát triển một mô hình tìm kiếm ảnh lai hai pha (SBIR-RSTKG) tích hợp chặt chẽ giữa Content-Based Image Retrieval (CBIR) dựa trên RS-Tree và Semantic-Based Image Retrieval (SBIR) dựa trên Đồ thị Tri thức và truy vấn SPARQL (trang 27).
- So với công trình của Justin Johnson và cộng sự (2015) [28], họ đề xuất tìm kiếm ảnh theo ngữ nghĩa dựa trên đồ thị ngữ cảnh sử dụng CRF. Nghiên cứu của Johnson tập trung vào suy luận ngữ nghĩa từ đồ thị ngữ cảnh nhưng không tích hợp cấu trúc chỉ mục đặc trưng cấp thấp hiệu quả như RS-Tree để lọc ban đầu, cũng không có cơ chế truy vấn ngữ nghĩa linh hoạt như SPARQL.
- So với công trình của Yalong Yang và cộng sự (2018) [29], họ giới thiệu mô hình tìm kiếm ảnh sử dụng đồ thị ngữ cảnh trực quan và văn bản, dựa trên độ đo tương tự đồ thị. Phương pháp của Yang chủ yếu dựa vào đối sánh đồ thị, có thể tốn kém cho các đồ thị lớn và không tận dụng hiệu quả sự phân vùng không gian của dữ liệu đặc trưng cấp thấp. Luận án này vượt trội bằng cách sử dụng RS-Tree để thực hiện lọc nhanh chóng các ảnh tương tự theo nội dung ở pha đầu, sau đó chỉ áp dụng truy vấn SPARQL trên một tập ảnh nhỏ hơn được tinh chỉnh ngữ nghĩa từ đồ thị tri thức, tối ưu hóa cả tốc độ và độ chính xác cho các truy vấn phức tạp (trang 27).
-
Phát hiện đáng ngạc nhiên nhất từ dữ liệu là gì? Phát hiện đáng ngạc nhiên nhất là trong một số trường hợp, việc tăng cường số lượng và độ phức tạp của các đặc trưng cấp thấp cho CBIR đơn thuần không nhất thiết dẫn đến sự cải thiện đáng kể về độ chính xác, thậm chí có thể gây nhiễu và làm giảm hiệu suất đối với các truy vấn ngữ nghĩa phức tạp. Điều này phản ánh giới hạn cố hữu của "semantic gap" (trang 11). Tuy nhiên, khi cùng một bộ đặc trưng đó được kết hợp với khả năng tinh chỉnh ngữ nghĩa từ đồ thị tri thức thông qua mô hình SBIR-RSTKG, độ chính xác lại tăng vọt. Ví dụ, trên tập dữ liệu MS-COCO, kết quả dự kiến cho thấy độ chính xác (Precision/MAP) của SBIR-RSTKG cao hơn CBIR-RST đơn thuần tới 15-20% cho các truy vấn ngữ nghĩa phức tạp, chứng minh rằng ngữ nghĩa không chỉ bổ sung mà còn "điều hòa" và làm giàu ý nghĩa cho các đặc trưng cấp thấp.
-
Giao thức tái tạo (Replication protocol) có được cung cấp không? Giao thức tái tạo được cung cấp một cách gián tiếp thông qua việc mô tả chi tiết các thành phần và quy trình nghiên cứu. Luận án nêu rõ:
- Môi trường thực nghiệm: dotNET Framework 4.8, C#, Matlab 2015b (trang 28).
- Cấu trúc dữ liệu: Mô tả chi tiết cấu trúc RS-Tree, bao gồm cách xác định tâm và bán kính của khối cầu thực thể, nút lá và nút trong (phương trình 2.1-2.5, trang 37-39).
- Thuật toán: Đề xuất mô hình, thuật toán xây dựng RS-Tree và thuật toán tìm kiếm ảnh trên RS-Tree (Chương 2).
- Bộ dữ liệu: Liệt kê cụ thể 6 bộ dữ liệu ảnh công khai (COREL, OF17, OF102, CUB, VG, MS-COCO) với số lượng và đặc điểm (trang 28).
- Đặc trưng: Mô tả các đặc trưng cấp thấp được trích xuất (MPEG7, Shi-tomasi, MaxPooling Sobel, Sobel HOG) và kích thước của chúng (tổng cộng 242 chiều) (trang 15).
- Độ đo: Giải thích rõ ràng các độ đo đánh giá hiệu suất (Precision, Recall, F-measure, MAP, ROC, PR curve) (trang 29-30). Mặc dù không có mã nguồn mở kèm theo, việc mô tả chi tiết này đủ để các nhà nghiên cứu khác có thể tái tạo các thực nghiệm và so sánh kết quả.
-
Chương trình nghiên cứu 10 năm có được phác thảo không? Chương trình nghiên cứu 10 năm được phác thảo thông qua phần "Hướng phát triển" (trang 116) và "Limitations và Future Research" (trang 117-118), với 4-5 hướng cụ thể. Nó bao gồm:
- Tự động hóa xây dựng KG: Phát triển các kỹ thuật học sâu để tự động trích xuất thực thể, thuộc tính và mối quan hệ từ hình ảnh hoặc văn bản, giảm thiểu sự phụ thuộc vào chú thích thủ công.
- Cải thiện giao diện người dùng: Xây dựng giao diện truy vấn ngữ nghĩa thân thiện hơn, có thể thông qua ngôn ngữ tự nhiên hoặc giao diện đồ họa trực quan để người dùng phổ thông có thể tương tác với đồ thị tri thức.
- Tích hợp đa phương thức: Mở rộng mô hình để xử lý dữ liệu đa phương tiện phức tạp hơn như video, âm thanh, và kết hợp thông tin từ nhiều nguồn để làm giàu ngữ nghĩa.
- Tối ưu hóa và mở rộng RS-Tree: Nghiên cứu các biến thể RS-Tree để hỗ trợ các đối tượng không gian phi Euclide, hoặc tích hợp các kỹ thuật tối ưu hóa cây để xử lý dữ liệu cực lớn và động.
- Ứng dụng trong các lĩnh vực mới: Khám phá tiềm năng của mô hình lai trong các lĩnh vực chuyên biệt như y tế, robot học, hoặc hệ thống thông tin địa lý, đòi hỏi sự hiểu biết ngữ nghĩa sâu sắc về hình ảnh.
Kết luận
Luận án này đã thực hiện một nghiên cứu toàn diện và sâu sắc trong lĩnh vực tìm kiếm ảnh, đạt được nhiều đóng góp quan trọng:
- Đề xuất và phát triển cấu trúc RS-Tree cải tiến: Bằng cách thay thế MBR bằng MBS và giới thiệu thuật toán tách nút dựa trên độ lệch sai biệt cùng ngưỡng $\theta$, RS-Tree đã nâng cao đáng kể hiệu quả lưu trữ và độ chính xác tìm kiếm ảnh theo nội dung, giảm chi phí tính toán và chồng lấp không gian so với các biến thể R-Tree trước đây.
- Thiết kế cấu trúc NBGraphRST: Sự kết hợp RS-Tree với đồ thị láng giềng đã chứng minh khả năng cải thiện độ chính xác tìm kiếm ảnh theo nội dung bằng cách tận dụng các mối quan hệ cục bộ giữa các phần tử.
- Xây dựng khung đồ thị tri thức mạnh mẽ: Luận án đã thành công trong việc xây dựng một đồ thị tri thức chi tiết từ tập dữ liệu Visual Genome, sử dụng các tiêu chuẩn OWL và RDF, cung cấp một cơ sở vững chắc để biểu diễn và truy vấn ngữ nghĩa hình ảnh.
- Đề xuất mô hình tìm kiếm ảnh lai SBIR-RSTKG đột phá: Mô hình này tích hợp RS-Tree cho tìm kiếm nội dung và đồ thị tri thức cùng truy vấn SPARQL cho tìm kiếm ngữ nghĩa, giải quyết hiệu quả "semantic gap" và mang lại độ chính xác vượt trội cho các truy vấn phức tạp.
- Thực nghiệm và đánh giá trên bộ dữ liệu đa dạng: Các mô hình đã được thực nghiệm trên nhiều tập dữ liệu quy mô lớn và đa dạng như COREL, OF17, OF102, CUB-2011-200, Visual Genome và MS-COCO, minh chứng tính đúng đắn và hiệu quả của các phương pháp đề xuất.
Nghiên cứu này đánh dấu một sự tiến bộ đáng kể, tạo ra một sự thay đổi mô hình (paradigm advancement) trong cách tiếp cận tìm kiếm ảnh. Nó chuyển dịch từ việc chỉ dựa vào đặc trưng cấp thấp sang một hệ thống có khả năng hiểu và truy vấn ngữ nghĩa cấp cao, đồng thời vẫn duy trì hiệu quả tính toán. Bằng chứng từ các phát hiện cho thấy mô hình lai đã thu hẹp thành công "semantic gap", cung cấp một cái nhìn toàn diện hơn về nội dung hình ảnh.
Các đóng góp của luận án đã mở ra ít nhất ba luồng nghiên cứu mới:
- Nghiên cứu về cấu trúc dữ liệu không gian ngữ nghĩa: Khám phá các biến thể mới của cây chỉ mục tích hợp chặt chẽ hơn với biểu diễn tri thức.
- Phát triển các phương pháp xây dựng KG tự động và mở rộng: Nghiên cứu các kỹ thuật học sâu để tạo và làm giàu đồ thị tri thức một cách tự động từ dữ liệu hình ảnh/video.
- Hệ thống truy vấn đa phương thức và tương tác: Phát triển các giao diện và thuật toán cho phép người dùng tương tác với các hệ thống tìm kiếm ảnh lai một cách trực quan và tự nhiên hơn.
Mô hình và các phát hiện của luận án có mức độ liên quan quốc tế cao, giải quyết một vấn đề toàn cầu trong thị giác máy tính và biểu diễn tri thức. So với các công trình quốc tế trước đây chỉ tập trung vào một khía cạnh (CBIR hoặc SBIR thuần túy), luận án này cung cấp một giải pháp tích hợp toàn diện. Di sản của nghiên cứu có thể đo lường bằng việc nâng cao hiệu suất của các hệ thống tìm kiếm ảnh trong các ứng dụng thực tế, tăng khả năng tiếp cận thông tin cho người dùng, và cung cấp một khung làm việc vững chắc cho các nghiên cứu tương lai trong lĩnh vực AI và thị giác máy tính.
Trích đoạn nội dung luận án
Tải xuống để đọc toàn bộĐẠI HỌC HUẾ TRƯỜNG ĐẠI HỌC KHOA HỌC LÊ THỊ VĨNH THANH KẾT HỢP CẤU TRÚC R-TREE VỚI ĐỒ THỊ TRI THỨC CHO MÔ HÌNH TÌM KIẾM ẢNH LUẬN ÁN TIẾN SĨ NGÀNH KHOA HỌC MÁY TÍNH HUẾ, NĂM 2023 luan an tien si ĐẠI HỌC HUẾ TRƯỜNG ĐẠI HỌC KHOA HỌC LÊ THỊ VĨNH THANH KẾT HỢP CẤU TRÚC R-TREE VỚI ĐỒ THỊ TRI THỨC CHO MÔ HÌNH TÌM KIẾM ẢNH NGÀNH: KHOA HỌC MÁY TÍNH MÃ SỐ: 9480101 LUẬN ÁN TIẾN SĨ NGÀNH KHOA HỌC MÁY TÍNH TẬP THỂ HƯỚNG DẪN KHOA HỌC PGS. LÊ MẠNH THẠNH TS. VĂN THẾ THÀNH HUẾ, NĂM 2023 luan an tien si LỜI CAM ĐOAN Tôi xin cam đoan đây là công trình nghiên cứu của riêng tôi. Nội dung tham khảo từ các công trình khác đều được trích dẫn rõ ràng.
Các kết quả viết chung với các tác giả khác đều được sự đồng ý trước khi đưa vào luận án. Các kết quả của luận án là trung thực và chưa được công bố trong các công trình khác ngoài các công trình của tác giả. Tác giả Lê Thị Vĩnh Thanh i luan an tien si LỜI CÁM ƠN Em xin gửi lời cảm ơn chân thành đến Thầy PGS. TS Lê Mạnh Thạnh và Thầy TS.
Văn Thế Thành đã tận tình hướng dẫn em để thực hiện tốt nhiệm vụ nghiên cứu và hoàn thành luận án này. Em xin gửi lời cảm ơn đến các thầy cô khoa Công nghệ thông tin của trường Đại học Khoa học đã chia sẻ và góp ý xác đáng trong quá trình thực hiện luận án. Em xin gửi lời cảm ơn sâu sắc đến Phòng Đào tạo Sau Đại học, lãnh đạo Trường Đại học Khoa học, lãnh đạo Đại học Huế đã tạo điều kiện thuận lợi cho em trong suốt quá trình học tập và thực hiện luận án. Tôi xin gửi lời cảm ơn đến Ban giám hiệu, các đồng nghiệp là cán bộ, giảng viên Trường Đại học Bà Rịa Vũng Tàu đã tạo mọi điều kiện thuận lợi, đã động viên tôi trong quá trình học tập và nghiên cứu.
Tôi xin gửi lời cảm ơn đến tất cả bạn bè và những người xung quanh luôn chia sẻ, động viên trong những lúc khó khăn. Xin gửi lời cảm ơn và bày tỏ lòng biết ơn vô hạn đến những người thân yêu, ba mẹ, chồng và các con đã hỗ trợ, ủng hộ trong suốt quá trình học tập, nghiên cứu. Tác giả ii luan an tien si MỤC LỤC LỜI CAM ĐOAN. ii DANH MỤC KÝ HIỆU VÀ CHỮ VIẾT TẮT .v DANH MỤC HÌNH ẢNH.
vii DANH MỤC BẢNG BIỂU. ix PHẦN MỞ ĐẦU .TỔNG QUAN VỀ TÌM KIẾM ẢNH, CẤU TRÚC R-TREE VÀ ĐỒ THỊ TRI THỨC. Tìm kiếm ảnh theo nội dung. Đặc trưng hình ảnh.
Độ đo tương tự giữa hai hình ảnh. Cấu trúc R-Tree và các biến thể cho tìm kiếm ảnh. Đồ thị tri thức. Đồ thị ngữ cảnh.
Kiến trúc hệ thống tìm kiếm ảnh. Môi trường thực nghiệm và độ đo đánh giá. Tổng kết chương .TÌM KIẾM ẢNH DỰA TRÊN RS-TREE. Cấu trúc RS-Tree.
Mô tả cấu trúc RS-Tree. Xây dựng cấu trúc RS-Tree. Các thao tác trên cấu trúc RS-Tree. Tiêu chí lựa chọn nút lá phù hợp.
Thêm phần tử vào cây. Cập nhật tâm và bán kính khối cầu. Tìm kiếm ảnh theo nội dung dựa trên RS-Tree. Mô hình tìm kiếm ảnh dựa trên RS-Tree.
Thuật toán tìm kiếm ảnh. Thực nghiệm và đánh giá. Tổng kết chương .69 iii luan an tien si CHƯƠNG 3.KẾT HỢP RS-TREE VÀ ĐỒ THỊ TRI THỨC TRONG TÌM KIẾM ẢNH. RS-Tree kết hợp đồ thị láng giềng.
Khái niệm cơ sở. Cấu trúc đồ thị cụm láng giềng. Thuật toán tạo đồ thị láng giềng. Tìm kiếm ảnh theo nội dung dựa trên cấu trúc NBGraphRST.
Khung đồ thị tri thức cho dữ liệu hình ảnh. Quy trình xây dựng đồ thị tri thức. Quá trình xây dựng đồ thị tri thức. Các thuật toán xây dựng đồ thị tri thức.
Tìm kiếm ảnh kết hợp RS-Tree với đồ thị tri thức. Nhận dạng đối tượng bằng Faster-RCNN. Mô hình tìm kiếm ảnh kết hợp RS-Tree và đồ thị tri thức. Thuật toán tìm kiếm ảnh.
Thực nghiệm và đánh giá. Mô tả bộ dữ liệu Visual Genome. Đánh giá thực nghiệm. Tổng kết chương .116 KẾT LUẬN VÀ HƯỚNG PHÁT TRIỂN .118 DANH MỤC CÁC CÔNG TRÌNH NGHIÊN CỨU CỦA TÁC GIẢ LIÊN QUAN ĐẾN LUẬN ÁN .120 TÀI LIỆU THAM KHẢO .121 iv luan an tien si DANH MỤC KÝ HIỆU VÀ CHỮ VIẾT TẮT Ký hiệu Diễn giải tiếng Anh Diễn giải tiếng Việt ARN Attentive Relational Network Mạng mối quan hệ tập trung ARP Average Retrieval Precision Độ chính xác trung bình AUC Area Under the Curve Diện tích dưới đường cong Content-Based Image CBIR Tìm kiếm ảnh theo nội dung Retrieval Content-based Image Retrieval Tìm ảnh theo nội dung dựa trên CBIR_NBGraphRST on RS-Tree and Neighbor RS-Tree và đồ thị láng giềng Graph Content-Based Image Tìm kiếm ảnh theo nội dung CBIR-RST Retrieval on RS-Tree dựa trên RS-Tree CCM Color Co-occurrence Matrix Ma trận đồng xuất hiện màu CDH Color Difference Histogram Lược đồ màu CNN Convolutional Neural Network Mạng nơ-ron tích chập Trường ngẫu nhiên có điều CRF Conditional Random Field kiện CSD Color Structure Descriptor Bộ mô tả cấu trúc màu DCD Dominant Color Descriptor Bộ mô tả màu chủ đạo DWT Discrete Wavelet Transform Phép biến đổi Wavelet rời rạc EDH Edge Histogram Descriptor Bộ mô tả lược đồ biên FCM Fuzzy C-means Clustering Phân cụm mờ C-means GCN Graph Convolutional Network Mạng tích chập đồ thị Gray-level Co-occurrence Ma trận đồng xuất hiện mức GLCM Matrix xám GMM Gaussian Mixture Models Mô hình hỗn hợp Gauss Histograms of Oriented HOG Lược đồ theo hướng Gradient Gradients KG Knowledge Graph Đồ thị tri thức LBP Local Binary Pattern Mẫu nhị phân cục bộ LD Linked Data Dữ liệu liên kết tài nguyên MAP Mean Average Precision Độ chính xác trung bình v luan an tien si Ký hiệu Diễn giải tiếng Anh Diễn giải tiếng Việt Hình chữ nhật bao đóng tối MBR Minimum Bounding Rectangle thiểu MBS Minimum Bounding Sphere Khối cầu bao đóng tối thiểu MLP Multi-layer Perceptron Mạng Perceptron đa tầng Multi-Resolution Multi- MRMD Đa hướng đa độ phân giải Directional Đồ thị cụm láng giềng trên RS- NBGraphRST Neighbor Graph on RS-Tree Tree OLD Open Linked Data Dữ liệu liên kết mở OWL Web Ontology Language Ngôn ngữ ontology web Resource Description Ngôn ngữ mô tả khung tài RDF Framework nguyên Phương pháp phản hồi liên RF Relevance Feedback quan Receiver Operating ROC Đồ thị mô tả đặc tính Characteristic RS-Tree Region Sphere Tree Cây phân cụm vùng khối cầu Semantic-Based Image SBIR Tìm ảnh theo ngữ nghĩa Retrieval Semantic-based Image Tìm ảnh theo ngữ nghĩa dựa SBIR_GraphRSTKG Retrieval on RS-Tree and trên RS-Tree và đồ thị tri thức Knowledge Graph SG Scene Graph Đồ thị ngữ cảnh Scale Invariant Features SIFT Đặt trưng hình ảnh SIFT Transform SURF Speeded Up Robust Feature Đặc trưng hình ảnh SURF SVM Support Vector Machine Máy vec-tơ hỗ trợ TBIR Text-Based Image Retrieval Tìm kiếm ảnh dựa trên văn bản TTF Tamura Texture Feature Đặc trưng kết cấu Tamura TVG Textual Scene Graph Đồ thị ngữ cảnh theo văn bản Tập dữ liệu ảnh Visual VG Visual Genome Genome VSG Visual Scene Graph Đồ thị ngữ cảnh theo thị giác vi luan an tien si DANH MỤC HÌNH ẢNH Hình 1.
Mô hình tìm kiếm ảnh tương tự theo nội dung. Đặc trưng màu sắc MPEG7. Đặc trưng vị trí Shi-tomasi MPEG7. Đặc trưng vị trí và kết cấu MaxPooling Sobel.
Đặc trưng hình dạng và kết cấu Sobel HOG. Cấu trúc R-Tree dạng phân cấp. Cấu trúc R-Tree dạng phẳng. Ví dụ về đồ thị ngữ cảnh trong bộ dữ liệu VG [28].
Mô hình tìm kiếm ảnh theo nội dung dựa trên cấu trúc RS-Tree. Mô hình tìm kiếm ảnh kết hợp RS-Tree và đồ thị tri thức. Cấu trúc RS-Tree dạng phẳng. Cấu trúc RS-Tree dạng phân cấp.
Mô tả một nút thực thể dạng phẳng trên cấu trúc RS-Tree. Mô tả một nút lá dạng phẳng trên cấu trúc RS-Tree. Mô tả một nút trong dạng phẳng trên RS-Tree. Minh họa quá trình thêm một phần tử vào cấu trúc RS-Tree.
Mô tả thao tác thêm một phần tử vào nút lá. Minh họa sự giãn nở không gian khi thêm mới một phần tử. Minh họa các tiêu chí lựa chọn không gian phân bố phần tử. Mô tả thuật toán tách nút dựa vào độ lệch sai biệt.
Mô hình tìm kiếm ảnh CBIR-RST dựa trên RS-Tree. Giao diện tạo cấu trúc RS-Tree. Giao diện tìm kiếm ảnh dựa trên cấu trúc RS-Tree. Một kết quả tìm kiếm dựa trên cấu trúc RS-Tree.
Thời gian tìm kiếm trung bình của tập ảnh COREL. Thời gian tìm kiếm trung bình của tập ảnh OF17. Thời gian trung bình tìm kiếm của tập ảnh OF102. Thời gian trung bình tìm kiếm của tập ảnh CUB-2011-200.
So sánh hiệu suất giữa các tập dữ liệu ảnh trên cấu trúc RS-Tree. Precision-Recall và ROC của bộ dữ liệu COREL. Precision-Recall và ROC của bộ dữ liệu Oxford Flowers 17. Precision-Recall và ROC của bộ dữ liệu Oxford Flowers 102 (1-51).
Precision-Recall và ROC của bộ dữ liệu Oxford Flowers 102 (52-102) 63 Hình 2. Precision-Recall và ROC của bộ dữ liệu CUB-2011-200 (1-100). Precision-Recall và ROC của bộ dữ liệu CUB-2011-200 (101-200). Tách nút có vùng không gian chồng lấp.
Tách nút có vùng không gian rời nhau. Mô tả tính chất chồng lấp không gian. Minh họa khoảng cách giữa hai nút lá. Mô tả đồ thị láng giềng của một nút lá.
Cấu trúc đồ thị láng giềng NBGraphRST dạng phẳng .76 vii luan an tien si Hình 3. Cấu trúc đồ thị láng giềng NBGraphRST phân cấp. Một đồ thị ngữ cảnh con của ảnh 2371376. Tiến trình xây dựng đồ thị tri thức.
Dữ liệu mẫu các phân lớp ảnh. Mẫu dữ liệu các đối tượng ảnh. Mẫu dữ liệu mối quan hệ giữa các đối tượng ảnh. Mô hình của đồ thị tri thức.
Bộ ba định nghĩa lớp trong đồ thị tri thức. Bộ ba định nghĩa các cá thể trong đồ thị tri thức. Bộ ba thể hiện mối quan hệ của các cá thể. Thuộc tính dữ liệu của cá thể inclass.
Thuộc tính dữ liệu của cá thể OBJ. Thuộc tính dữ liệu của đối tượng OBJ1068652 dưới dạng OWL. Thuộc tính dữ liệu của cá thể IMG1. Thuộc tính dữ liệu của ảnh IMG3 dưới dạng OWL.
Các chú thích của mối quan hệ opREL2. Các đối tượng trong hình ảnh của bộ dữ liệu COCO. Minh họa quá trình phân lớp đối tượng bằng mạng Faster-RCNN. Minh họa trích xuất đặc trưng cho ảnh đầu vào.
Mô hình tìm kiếm ảnh theo ngữ nghĩa kết hợp RS-Tree với KG. Mô hình tìm kiếm ảnh trên CBIR_NBGraphRST. Một kết quả tìm kiếm ảnh trên CBIR-NBGraphRST. Tạo KG cho bộ dữ liệu Visual Genome .
Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ
Trích dẫn luận án này
Lê Thị Vĩnh Thanh (2023). Kết hợp cấu trúc r tree với đồ thị tri thức cho mô hình tìm [Luận án tiến sĩ, Trường Đại học Khoa học - Đại học Huế]. LuanAn.net. https://luanan.net/cong-nghe-thong-tin/he-thong-thong-tin/ket-hop-cau-truc-r-tree-voi-do-thi-tri-thuc-cho-mo-hinh-tim-kiem-anh
Câu hỏi thường gặp
Luận án "Kết hợp cấu trúc r tree với đồ thị tri thức cho mô hình tìm" nghiên cứu về vấn đề gì?
Kết hợp cấu trúc R-Tree với đồ thị tri thức tối ưu hóa mô hình tìm kiếm dữ liệu không gian. Nghiên cứu đề xuất phương pháp nâng cao hiệu suất truy vấn.
Luận án "Kết hợp cấu trúc r tree với đồ thị tri thức cho mô hình tìm" được bảo vệ tại trường nào?
Luận án này được bảo vệ tại Trường Đại học Khoa học - Đại học Huế. Năm bảo vệ: 2023.
Luận án "Kết hợp cấu trúc r tree với đồ thị tri thức cho mô hình tìm" thuộc chuyên ngành gì?
Luận án "Kết hợp cấu trúc r tree với đồ thị tri thức cho mô hình tìm" thuộc chuyên ngành Khoa học máy tính. Danh mục: Hệ Thống Thông Tin.
Luận án "Kết hợp cấu trúc r tree với đồ thị tri thức cho mô hình tìm" có bao nhiêu trang?
Luận án "Kết hợp cấu trúc r tree với đồ thị tri thức cho mô hình tìm" có 139 trang. Bạn có thể xem trước một phần tài liệu ngay trên trang web trước khi tải về.
Cách tải luận án "Kết hợp cấu trúc r tree với đồ thị tri thức cho mô hình tìm" về máy như thế nào?
Để tải luận án về máy, bạn nhấn nút "Tải xuống ngay" trên trang này, sau đó hoàn tất thanh toán phí lưu trữ. File sẽ được tải xuống ngay sau khi thanh toán thành công. Hỗ trợ qua Zalo: 0559 297 239.