Luận án: Phương pháp phục vụ xếp hạng trang web trong tìm kiếm xuyên ngữ - Trường Đại học Bách khoa Đà Nẵng

"Luận án nghiên cứu các phương pháp xếp hạng trang web trong tìm kiếm xuyên ngữ, đề xuất phương pháp mới hiệu quả và cải tiến khả năng tìm kiếm trên internet."

Tác giả

Luan An

Thể loại

Luận án

Số trang

157

Thời gian đọc

24 phút

Lượt xem

1

Lượt tải

0

Phí lưu trữ

50 Point

Tổng quan nhanh

Chủ đề:
Tổng quan về xếp hạng trang web trong tìm kiếm xuyên ngữ
Số trang:
157 trang
Trường:
Trường Đại học Bách khoa, Đại học Đà Nẵng
Tác giả:

Tóm tắt nội dung luận án

I.Tổng quan về xếp hạng trang web trong tìm kiếm xuyên ngữ

Luận án này khám phá các phương pháp xếp hạng trang web trong tìm kiếm xuyên ngữ. Nó giải quyết những thách thức khi truy xuất thông tin qua các rào cản ngôn ngữ. Hệ thống truy vấn thông tin hiện tại thường gặp khó khăn với các truy vấn đa ngôn ngữ. Nghiên cứu này nhằm mục tiêu phát triển các phương pháp mạnh mẽ. Các phương pháp này cải thiện hiệu quả tìm kiếm web. Luận án tập trung vào cặp ngôn ngữ Việt-Anh làm ứng dụng thực tế. Công trình đóng góp vào việc nâng cao trải nghiệm người dùng. Nó hỗ trợ truy cập thông tin toàn cầu hiệu quả hơn.

1.1. Mục tiêu và phạm vi nghiên cứu

Nghiên cứu đặt mục tiêu phát triển các phương pháp xếp hạng trang web mới. Mục tiêu là cải thiện hiệu quả tìm kiếm xuyên ngữ. Phạm vi nghiên cứu tập trung vào xử lý truy vấn từ tiếng Việt sang tài liệu tiếng Anh. Nó bao gồm các khía cạnh dịch truy vấn. Nó cũng bao gồm điều chỉnh truy vấn và xếp hạng lại kết quả. Đối tượng là các thuật toán và mô hình liên quan đến truy vấn thông tin xuyên ngữ. Luận án cung cấp cái nhìn sâu sắc về thách thức này.

1.2. Hạn chế tìm kiếm đề xuất giải pháp mới

Tìm kiếm xuyên ngữ đối mặt với nhiều hạn chế cố hữu. Các vấn đề bao gồm thiếu từ điển chất lượng. Đa nghĩa của từ gây ra khó khăn. Sự khác biệt cấu trúc ngôn ngữ là một thách thức lớn. Các phương pháp xếp hạng truyền thống không tối ưu cho môi trường đa ngôn ngữ. Luận án đề xuất một loạt giải pháp toàn diện. Các giải pháp này bao gồm cải tiến dịch tự động. Nó cũng bao gồm học xếp hạng trang web hiệu quả. Mục tiêu là vượt qua các thách thức hiện có.

II.Kỹ thuật dịch tự động phục vụ tìm kiếm xuyên ngữ

Dịch tự động là một thành phần cốt lõi của tìm kiếm xuyên ngữ. Nó chuyển đổi câu truy vấn từ ngôn ngữ nguồn sang ngôn ngữ đích. Chất lượng bản dịch ảnh hưởng trực tiếp đến kết quả tìm kiếm. Luận án phân tích nhiều phương pháp dịch khác nhau. Mục tiêu là tìm ra cách tiếp cận hiệu quả nhất cho truy vấn tìm kiếm. Các kỹ thuật bao gồm sử dụng từ điển, kho ngữ liệu. Ngôn ngữ trung gian cũng được xem xét. Nghiên cứu đánh giá các ưu nhược điểm của từng phương pháp. Điều này đảm bảo lựa chọn tối ưu cho hệ thống CLIR.

2.1. Các phương pháp dịch tự động hiệu quả

Có nhiều cách tiếp cận dịch tự động khác nhau. Sử dụng máy dịch cung cấp bản dịch tự động. Kho ngữ liệu hỗ trợ dịch dựa trên văn bản song ngữ song song. Phương pháp dựa trên từ điển là lựa chọn phổ biến. Ngôn ngữ trung gian đơn giản hóa quá trình dịch đa ngôn ngữ. Mỗi phương pháp có những ưu điểm và nhược điểm riêng. Luận án đánh giá kỹ lưỡng từng phương pháp. Mục đích là chọn giải pháp tối ưu. Điều này nhằm đạt được độ chính xác cao cho câu truy vấn tìm kiếm.

2.2. Mô hình dịch dựa trên từ điển máy

Mô hình này sử dụng từ điển song ngữ làm trọng tâm. Nó bao gồm xây dựng dữ liệu từ điển chi tiết. Vấn đề lớn là khử nhập nhằng từ. Một từ có thể có nhiều nghĩa khác nhau. Luận án đề xuất một công thức khử nhập nhằng mới. Công thức này dựa trên độ đo mức độ liên quan của cặp từ. Nó chọn bản dịch tốt nhất cho mỗi từ trong ngữ cảnh. Sau đó, hệ thống xây dựng câu truy vấn đích có cấu trúc. Các thực nghiệm chứng minh hiệu quả của mô hình này. Nó cải thiện đáng kể chất lượng bản dịch truy vấn.

III.Nâng cao chất lượng câu truy vấn tìm kiếm xuyên ngữ

Dịch tự động ban đầu thường chưa đạt độ hoàn hảo tối đa. Câu truy vấn đích có thể cần được cải thiện liên tục. Các kỹ thuật hỗ trợ dịch giúp tối ưu hóa truy vấn đã dịch. Mục tiêu là làm cho câu truy vấn phù hợp hơn với mục đích tìm kiếm. Điều này tăng khả năng tìm thấy tài liệu liên quan. Luận án tập trung vào các chiến lược điều chỉnh và mở rộng truy vấn. Các chiến lược này giải quyết các vấn đề như từ không có trong từ điển. Nó cũng giải quyết các từ mơ hồ nghĩa.

3.1. Hỗ trợ dịch câu truy vấn nguồn

Việc phân đoạn câu truy vấn nguồn là một bước quan trọng. Các công cụ như vnTagger hỗ trợ việc này hiệu quả. Phân đoạn giúp xác định các cụm từ quan trọng. Sau đó, câu truy vấn có thể được mở rộng. Thêm các thuật ngữ đồng nghĩa hoặc liên quan. Ngược lại, thu hẹp câu truy vấn loại bỏ các từ không cần thiết. Xử lý thuật ngữ không có trong từ điển là thách thức lớn. Các kỹ thuật này giúp cải thiện bản dịch ban đầu. Nó tăng cường độ chính xác của truy vấn.

3.2. Điều chỉnh câu truy vấn tại ngôn ngữ đích

Sau khi dịch, câu truy vấn có thể được điều chỉnh thêm. Phản hồi ẩn là một kỹ thuật hiệu quả cho việc này. Nó sử dụng thông tin từ các kết quả tìm kiếm ban đầu. Điều chỉnh dựa trên phản hồi này giúp tối ưu hóa truy vấn. Trong tìm kiếm xuyên ngữ, phản hồi ẩn áp dụng cho ngôn ngữ đích. Câu truy vấn có cấu trúc cũng có thể được điều chỉnh. Các thực nghiệm đã được tiến hành để đánh giá. Kết quả cho thấy sự cải thiện đáng kể về độ phù hợp.

IV.Phương pháp xếp hạng trang web tiên tiến trong CLIR

Xếp hạng trang web là giai đoạn cuối cùng trong quy trình tìm kiếm. Nó sắp xếp các tài liệu theo mức độ liên quan dự kiến. Trong tìm kiếm xuyên ngữ, điều này phức tạp hơn đáng kể. Cần các phương pháp xếp hạng lại tiên tiến. Luận án nghiên cứu học xếp hạng (Learning to Rank - LTR). Mục tiêu là tìm ra hàm xếp hạng tối ưu. Các kỹ thuật này xem xét nhiều yếu tố phức tạp. Bao gồm cả thông tin người dùng và cấu trúc liên kết trang web. Điều này nhằm mang lại kết quả tìm kiếm chính xác nhất.

4.1. Học xếp hạng trang web dùng lập trình di truyền

Học xếp hạng là một hướng tiếp cận mạnh mẽ. Nó tự động tạo ra các hàm xếp hạng tối ưu. Lập trình di truyền được ứng dụng trong mô hình này. Nó tìm kiếm tổ hợp các đặc trưng tốt nhất. Mô hình này xây dựng công cụ thử nghiệm cụ thể. Các thực nghiệm chứng minh khả năng cải thiện xếp hạng. Học xếp hạng giúp hệ thống thích nghi tốt hơn. Nó tối ưu hóa việc sắp xếp kết quả tìm kiếm. Điều này dẫn đến hiệu suất tìm kiếm cao hơn.

4.2. Đề xuất mô hình lân cận cải thiện hiệu suất

Luận án đề xuất các mô hình lân cận mới lạ. Các mô hình này dựa trên quan hệ ngữ nghĩa giữa các thuật ngữ. Ví dụ: CL-Büttcher, CL-Rasolofo, CL-HighDensity. Chúng khai thác mật độ và vị trí của từ khóa trong văn bản. Các mô hình này đặc biệt hiệu quả trong tìm kiếm xuyên ngữ. Thực nghiệm được tiến hành để đánh giá chi tiết. Kết quả cho thấy hiệu suất được cải thiện rõ rệt. Chúng tăng cường khả năng tìm thấy tài liệu phù hợp. Điều này nâng cao chất lượng kết quả tìm kiếm.

V.Hệ thống tìm kiếm web xuyên ngữ Việt Anh thực tiễn

Luận án không chỉ dừng lại ở phát triển lý thuyết. Nó triển khai một hệ thống tìm kiếm web xuyên ngữ hoàn chỉnh. Hệ thống này hoạt động với cặp ngôn ngữ Việt-Anh cụ thể. Nó tích hợp tất cả các giải pháp được đề xuất trong luận án. Mục tiêu là chứng minh tính khả thi và hiệu quả của các phương pháp. Hệ thống này là một công cụ toàn diện và mạnh mẽ. Nó bao gồm các thành phần từ dịch truy vấn đến xếp hạng cuối cùng. Thiết kế tập trung vào hiệu quả và khả năng mở rộng.

5.1. Thiết kế và triển khai hệ thống

Hệ thống có kiến trúc rõ ràng và được tổ chức tốt. Các thành phần bao gồm module dịch tự động chính xác. Có module điều chỉnh câu truy vấn thông minh. Module xếp hạng lại cũng được tích hợp liền mạch. Dữ liệu từ điển được xây dựng cẩn thận và chi tiết. Dữ liệu đánh chỉ mục là nền tảng cho quá trình tìm kiếm. Sơ đồ thuật toán minh họa luồng xử lý dữ liệu. Hệ thống được thiết kế để dễ dàng mở rộng. Nó cung cấp một nền tảng vững chắc cho nghiên cứu tương lai.

5.2. Đánh giá hiệu quả các giải pháp tích hợp

Nhiều thực nghiệm đã được tiến hành một cách kỹ lưỡng. Các cấu hình khác nhau được kiểm tra cẩn thận. Hiệu quả của giải pháp dịch câu truy vấn được đánh giá chi tiết. Giải pháp điều chỉnh câu truy vấn cũng được kiểm tra nghiêm ngặt. Thực nghiệm xếp hạng lại cho thấy sự cải thiện đáng kể. Cuối cùng, đánh giá tổng thể hiệu quả của việc tích hợp các kỹ thuật. Các kỹ thuật được kết hợp để đạt kết quả tốt nhất. Kết quả chứng minh luận án đạt được mục tiêu đề ra.

Mục lục chi tiết luận án

LỜI CAM ĐOAN
MỞ ĐẦU
1. MỤC TIÊU, ĐỐI TƯỢNG VÀ PHẠM VI NGHIÊN CỨU
2. ĐÓNG GÓP CỦA LUẬN ÁN
3. BỐ CỤC CỦA LUẬN ÁN
1. CHƯƠNG 1: TỔNG QUAN VÀ ĐỀ XUẤT NGHIÊN CỨU
1.1. TRUY VẤN THÔNG TIN
1.1.1. Định nghĩa hình thức
1.1.2. Sơ đồ xử lý của hệ thống truy vấn thông tin
1.1.3. Các mô hình truy vấn thông tin truyền thống
1.1.4. Khai thác quan hệ giữa các thuật ngữ trong văn bản
1.2. ĐÁNH GIÁ HỆ THỐNG TRUY VẤN THÔNG TIN
1.2.1. Môi trường thực nghiệm
1.3. TRUY VẤN THÔNG TIN XUYÊN NGỮ
1.3.1. Các hướng tiếp cận
1.3.2. Các kỹ thuật dịch tự động
1.4. CÁC KỸ THUẬT XẾP HẠNG LẠI
1.4.1. Xếp hạng và xếp hạng lại
1.4.2. Khai thác thông tin của các máy tìm kiếm có sẵn
1.4.3. Học xếp hạng
1.4.4. Khai thác thông tin người sử dụng
1.5. XẾP HẠNG TRANG WEB
1.5.1. Đặc thù của tìm kiếm web
1.5.2. Các phương pháp xếp hạng trang Web
1.5.3. Xếp hạng trang Web trong tìm kiếm xuyên ngữ
1.6. CÁC HẠN CHẾ VÀ ĐỀ XUẤT NGHIÊN CỨU
1.6.1. Đề xuất nghiên cứu
1.7. TIỂU KẾT CHƯƠNG
2. CHƯƠNG 2: DỊCH TỰ ĐỘNG PHỤC VỤ TRUY VẤN XUYÊN NGỮ
2.1. CÁC PHƯƠNG PHÁP DỊCH TỰ ĐỘNG
2.1.1. Sử dụng máy dịch
2.1.2. Sử dụng kho ngữ liệu
2.1.3. Sử dụng từ điển
2.1.4. Sử dụng ngôn ngữ trung gian
2.1.5. Sử dụng không gian ngữ nghĩa
2.1.6. Đánh giá chung
2.2. KHỬ NHẬP NHẰNG
2.3. MÔ HÌNH SỬ DỤNG TỪ ĐIỂN MÁY
2.3.1. Xây dựng dữ liệu từ điển
2.3.2. Khử nhập nhằng dựa trên độ đo mức độ liên quan của cặp từ
2.3.3. Các biến thể của công thức MI
2.3.4. Thuật toán chọn bản dịch tốt nhất
2.3.5. Xây dựng câu truy vấn
2.4. THỰC NGHIỆM ÁP DỤNG CÔNG THỨC SMI
2.4.1. Môi trường thực nghiệm
2.4.2. Kết quả thực nghiệm
2.5. THỰC NGHIỆM TẠO BẢN DỊCH CÂU TRUY VẤN CÓ CẤU TRÚC
2.5.1. Môi trường thực nghiệm
2.5.2. Cấu hình thực nghiệm
2.5.3. Kết quả thực nghiệm
2.6. TIỂU KẾT CHƯƠNG
3. CHƯƠNG 3: HỖ TRỢ DỊCH CÂU TRUY VẤN
3.1. CÁC KỸ THUẬT HỖ TRỢ DỊCH CÂU TRUY VẤN
3.1.1. Phân đoạn câu truy vấn ở ngôn ngữ nguồn
3.1.2. Mở rộng câu truy vấn
3.1.3. Thu hẹp câu truy vấn
3.1.4. Xử lý thuật ngữ không có trong từ điển
3.2. PHÂN ĐOẠN CÂU TRUY VẤN
3.2.1. Sử dụng công cụ vnTagger
3.2.2. Thuật toán WLQS
3.2.3. Kết hợp WLQS và công cụ vnTagger
3.3. ĐIỀU CHỈNH CÂU TRUY VẤN Ở NGÔN NGỮ ĐÍCH
3.3.1. Phản hồi ẩn
3.3.2. Phản hồi ẩn trong truy vấn xuyên ngữ
3.3.3. Điều chỉnh câu truy vấn có cấu trúc ở ngôn ngữ đích
3.3.4. Cấu hình thực nghiệm
3.4. TIỂU KẾT CHƯƠNG
4. CHƯƠNG 4: XẾP HẠNG LẠI
4.1. HỌC XẾP HẠNG DỰA TRÊN LẬP TRÌNH DI TRUYỀN
4.1.1. Mô hình ứng dụng lập trình di truyền
4.1.2. Xây dựng công cụ và kết quả thực nghiệm
4.2. ĐỀ XUẤT CÁC MÔ HÌNH LÂN CẬN
4.2.1. Mô hình CL-Büttcher
4.2.2. Mô hình xếp hạng CL-Rasolofo
4.2.3. Mô hình xếp hạng CL-HighDensity
4.2.4. Thực nghiệm việc ứng dụng mô hình lân cận xuyên ngữ
4.3. HỌC XẾP HẠNG TRANG WEB
4.3.1. Các mô hình học xếp hạng
4.3.2. Môi trường thực nghiệm
4.3.3. Cấu hình thực nghiệm
4.3.4. Kết quả thực nghiệm
4.4. TIỂU KẾT CHƯƠNG
5. CHƯƠNG 5: HỆ THỐNG TÌM KIẾM WEB XUYÊN NGỮ VIỆT-ANH
5.1. THIẾT KẾ HỆ THỐNG
5.1.1. Các thành phần hệ thống & sơ đồ thuật toán
5.1.2. Dữ liệu từ điển
5.1.3. Dữ liệu đánh chỉ mục
5.2. PHƯƠNG PHÁP THỰC NGHIỆM
5.3. THỰC NGHIỆM CÁC GIẢI PHÁP DỊCH CÂU TRUY VẤN
5.3.1. Cấu hình thực nghiệm
5.3.2. Kết quả thực nghiệm
5.4. THỰC NGHIỆM ĐIỀU CHỈNH CÂU TRUY VẤN
5.4.1. Cấu hình thực nghiệm
5.4.2. Kết quả thực nghiệm
5.5. THỰC NGHIỆM XẾP HẠNG LẠI
5.5.1. Cấu hình thực nghiệm
5.5.2. Kết quả thực nghiệm
5.6. ĐÁNH GIÁ HIỆU QUẢ KẾT HỢP CÁC KỸ THUẬT
5.7. TIỂU KẾT CHƯƠNG
KẾT LUẬN VÀ HƯỚNG PHÁT TRIỂN
1. Tóm tắt nội dung luận án
2. Các kết quả đạt được
3. HƯỚNG PHÁT TRIỂN
TÀI LIỆU THAM KHẢO
DANH MỤC HÌNH VẼ
DANH MỤC BẢNG
DANH MỤC TỪ VIẾT TẮT
DANH MỤC THUẬT NGỮ
Xem trước tài liệu
Tải đầy đủ để xem toàn bộ nội dung
Luận án một số phương pháp phục vụ xếp hạng các trang web trong tìm kiếm xuyên ngữ

Tải xuống file đầy đủ để xem toàn bộ nội dung

Tải đầy đủ (157 trang)

Trích đoạn nội dung luận án

Tải xuống để đọc toàn bộ

LỜI CAM ĐOAN Tôi xin cam đoan: Luận án này là công trình nghiên cứu thực sự của cá nhân tôi, được thực hiện tại Trường Đại học Bách khoa, Đại học Đà Nẵng dưới sự hướng dẫn khoa học của PGS. Võ Trung Hùng và PGS. Huỳnh Công Pháp. Các số liệu, những kết luận nghiên cứu được trình bày trong luận án này là trung thực và chưa từng được công bố ở bất kỳ công trình nào của các tác giả khác.

Tôi xin chịu trách nhiệm về những lời cam đoan của tôi. Tác giả, Lâm Tùng Giang -i- MỤC LỤC MỞ ĐẦU. MỤC TIÊU, ĐỐI TƯỢNG VÀ PHẠM VI NGHIÊN CỨU. ĐÓNG GÓP CỦA LUẬN ÁN.

BỐ CỤC CỦA LUẬN ÁN. 8 CHƯƠNG 1: TỔNG QUAN VÀ ĐỀ XUẤT NGHIÊN CỨU. TRUY VẤN THÔNG TIN. Định nghĩa hình thức.

Sơ đồ xử lý của hệ thống truy vấn thông tin. Các mô hình truy vấn thông tin truyền thống. Khai thác quan hệ giữa các thuật ngữ trong văn bản. ĐÁNH GIÁ HỆ THỐNG TRUY VẤN THÔNG TIN.

Môi trường thực nghiệm. TRUY VẤN THÔNG TIN XUYÊN NGỮ. Các hướng tiếp cận. Các kỹ thuật dịch tự động.

CÁC KỸ THUẬT XẾP HẠNG LẠI. Xếp hạng và xếp hạng lại. Khai thác thông tin của các máy tìm kiếm có sẵn. Học xếp hạng.

Khai thác thông tin người sử dụng. XẾP HẠNG TRANG WEB. Đặc thù của tìm kiếm web. Các phương pháp xếp hạng trang Web.

Xếp hạng trang Web trong tìm kiếm xuyên ngữ. CÁC HẠN CHẾ VÀ ĐỀ XUẤT NGHIÊN CỨU. Đề xuất nghiên cứu. TIỂU KẾT CHƯƠNG.

41 CHƯƠNG 2: DỊCH TỰ ĐỘNG PHỤC VỤ TRUY VẤN XUYÊN NGỮ. CÁC PHƯƠNG PHÁP DỊCH TỰ ĐỘNG. Sử dụng máy dịch. Sử dụng kho ngữ liệu.

Sử dụng từ điển. Sử dụng ngôn ngữ trung gian. Sử dụng không gian ngữ nghĩa. Đánh giá chung.

KHỬ NHẬP NHẰNG. MÔ HÌNH SỬ DỤNG TỪ ĐIỂN MÁY. Xây dựng dữ liệu từ điển. Khử nhập nhằng dựa trên độ đo mức độ liên quan của cặp từ.

Các biến thể của công thức MI. Thuật toán chọn bản dịch tốt nhất. Xây dựng câu truy vấn. THỰC NGHIỆM ÁP DỤNG CÔNG THỨC SMI.

Môi trường thực nghiệm. Kết quả thực nghiệm. THỰC NGHIỆM TẠO BẢN DỊCH CÂU TRUY VẤN CÓ CẤU TRÚC. Môi trường thực nghiệm.

Cấu hình thực nghiệm. Kết quả thực nghiệm. TIỂU KẾT CHƯƠNG. 67 CHƯƠNG 3: HỖ TRỢ DỊCH CÂU TRUY VẤN.

CÁC KỸ THUẬT HỖ TRỢ DỊCH CÂU TRUY VẤN. Phân đoạn câu truy vấn ở ngôn ngữ nguồn. Mở rộng câu truy vấn. Thu hẹp câu truy vấn.

Xử lý thuật ngữ không có trong từ điển. PHÂN ĐOẠN CÂU TRUY VẤN. Sử dụng công cụ vnTagger. Thuật toán WLQS.

Kết hợp WLQS và công cụ vnTagger. ĐIỀU CHỈNH CÂU TRUY VẤN Ở NGÔN NGỮ ĐÍCH. Phản hồi ẩn. Phản hồi ẩn trong truy vấn xuyên ngữ.

Điều chỉnh câu truy vấn có cấu trúc ở ngôn ngữ đích. Cấu hình thực nghiệm. TIỂU KẾT CHƯƠNG. 89 CHƯƠNG 4: XẾP HẠNG LẠI.

HỌC XẾP HẠNG DỰA TRÊN LẬP TRÌNH DI TRUYỀN. Mô hình ứng dụng lập trình di truyền. Xây dựng công cụ và kết quả thực nghiệm. ĐỀ XUẤT CÁC MÔ HÌNH LÂN CẬN.

Mô hình CL-Büttcher. Mô hình xếp hạng CL-Rasolofo. Mô hình xếp hạng CL-HighDensity. Thực nghiệm việc ứng dụng mô hình lân cận xuyên ngữ.

HỌC XẾP HẠNG TRANG WEB. Các mô hình học xếp hạng. Môi trường thực nghiệm. Cấu hình thực nghiệm.

Kết quả thực nghiệm. TIỂU KẾT CHƯƠNG. 110 CHƯƠNG 5: HỆ THỐNG TÌM KIẾM WEB XUYÊN NGỮ VIỆT-ANH. THIẾT KẾ HỆ THỐNG.

Các thành phần hệ thống & sơ đồ thuật toán. Dữ liệu từ điển. Dữ liệu đánh chỉ mục. PHƯƠNG PHÁP THỰC NGHIỆM.

THỰC NGHIỆM CÁC GIẢI PHÁP DỊCH CÂU TRUY VẤN. Cấu hình thực nghiệm. Kết quả thực nghiệm. THỰC NGHIỆM ĐIỀU CHỈNH CÂU TRUY VẤN.

Cấu hình thực nghiệm. Kết quả thực nghiệm. THỰC NGHIỆM XẾP HẠNG LẠI. Cấu hình thực nghiệm.

Kết quả thực nghiệm. ĐÁNH GIÁ HIỆU QUẢ KẾT HỢP CÁC KỸ THUẬT. TIỂU KẾT CHƯƠNG. 128 KẾT LUẬN VÀ HƯỚNG PHÁT TRIỂN.

Tóm tắt nội dung luận án. Các kết quả đạt được. HƯỚNG PHÁT TRIỂN. 132 TÀI LIỆU THAM KHẢO.

133 - vi - DANH MỤC HÌNH VẼ Hình 1.1: Quá trình xử lý của hệ thống truy vấn thông tin .2: Biểu đồ trung bình 11 điểm .3: Mô hình xếp hạng tìm kiếm Web đa ngữ .4: Sơ đồ xử lý giai đoạn truy vấn .1: Phân loại phương pháp mở rộng câu truy vấn.2: Phản hồi của người dùng .3: Phản hồi ẩn về độ phù hợp của kết quả tìm kiếm ban đầu .4: Đồ thị trung bình 11 điểm .1: Hệ thống tìm kiếm Web đa ngữ Việt-Anh .1: Các thành phần của hệ thống tìm kiếm Web Việt - Anh .2: Sơ đồ thuật toán của hệ thống.3: So sánh các cấu hình dùng 1 bản dịch .4: So sánh các cấu hình dùng 3 bản dịch .5: Kết quả của 5 lần huấn luyện của các phương pháp .6: Điểm MAP khi sử dụng phương án dịch Top_three_all .7: Điểm MAP khi sử dụng phương án dịch Top_three_weight. 128 - vii - DANH MỤC BẢNG Bảng 1.1 Thông tin sử dụng & đặc điểm của các mô hình xếp hạng.1: Cấu hình thực nghiệm .2: Kết quả thực nghiệm .3: So sánh P@k và MAP các cấu hình .1: Điểm số MAP .2: Số lượng tài liệu phù hợp tải về .1 Ví dụ thuộc tính của bộ sưu tập OHSUMED.2 So sánh giá trị MAP .3 So sánh giá trị NDCG@k.4: So sánh giá trị P@k .5: Điểm MAP của các cấu hình thực nghiệm .6: Mức độ tăng hiệu quả khi áp dụng mô hình lân cận .7: Các phương án hàm distance .8: Kết quả thực nghiệm .1: Các cấu hình đánh giá các giải pháp dịch câu truy vấn .2: So sánh các giải pháp dịch câu truy vấn .3: Cấu hình đánh giá kết quả điều chỉnh câu truy vấn .4: So sánh các giải pháp điều chỉnh câu truy vấn .5: Cấu hình thực nghiệm học xếp hạng .6: Kết quả thực nghiệm các phương pháp học xếp hạng .7: Đánh giá việc áp dụng các kỹ thuật đề xuất. 125 - viii - DANH MỤC TỪ VIẾT TẮT AP Average Precision CLEF Cross Language Evaluation Forum CLIR Cross Language Information Retrieval DF Document frequency FIRE Forum for Information Retrieval Evaluation GP Genetic Programming HITS Hypertext Induced Topic Search HTML Hyper Text Markup Language IDF Inverse Document Frequency IR Information Retrieval LETOR LEearning TO Rank LMIR Language Models in Information Retrieval LSI Latent Sematic Indexing MAP Mean Average Precision MI Mutual Information MRD Machine Readable Dictionary NDCG Normalized Discount Cumulative Gain PRF Pseudo-Relevance Feedback SMI Summary Mutual Information SVD Singular-Value Decomposition TF Term frequency TREC Text REtrieval Conference UNL Universal Network Language VSM Vector Space Model WLQS Word-Length-based Query Segmentation WWW Word Wide Web - ix - DANH MỤC THUẬT NGỮ Anchor Mốc, neo Authority Độ tin cậy Average Precision Độ chính xác trung bình Bag of Words Túi từ Bilingual Machine Readable Dictionary Từ điển máy song ngữ Binary Independence Retrieval – BIR Mô hình truy vấn nhị phân độc lập Boolean model Mô hình Boolean Cohesion Score Điểm liên kết Cross Language Information Retrieval - Truy vấn thông tin xuyên ngữ CLIR Cross-language Web Search Tìm kiếm web xuyên ngữ Data sparsity Tính thưa thớt dữ liệu Degree of similarity Mức độ tương tự Discounted Cumulative Gain Độ lợi tích lũy giảm dần Fuzzy-Logic model Mô hình lô-gic mờ Gain Function Hàm lợi ích Hub Trung tâm Hyper Text Markup Language-HTML Ngôn ngữ siêu văn bản Hyperlink Siêu liên kết Information Retrieval – IR Truy vấn thông tin Inverse document frequency – IDF Tần suất tài liệu nghịch đảo IR model Mô hình truy vấn thông tin Language Model – LMIR Mô hình ngôn ngữ Latent Sematic Indexing - LSI Mô hình chỉ mục ngữ nghĩa ngầm Learning to Rank Học xếp hạng Loss Function Hàm tổn thất Machine Learning - ML Học máy -x- Mean Average Precision Độ chính xác trung bình bình quân Meta tag Thẻ cung cấp thông tin trang web Mutual Information - MI Thông tin tương hỗ Precision Độ chính xác Probabilistic model Mô hình xác suất Proximity Model Mô hình lân cận Pseudo-Relevance Feedback – PRF Phản hồi giả Query Câu truy vấn Recall Độ bao phủ Regions models Mô hình vùng Relevant information Thông tin phù hợp Singular-Value Decomposition – SVD Phân tích giá trị đơn Summary Mutual Information Tổng thông tin tương hỗ Term frequency – TF Tần suất xuất hiện của thuật ngữ trong tài liệu Three-way data dữ liệu 3 hướng True Relevance Feedback Phản hồi thực sự Two-way data dữ liệu 2 hướng Vector Space model – VSM Mô hình không gian vec-tơ Word-length-based Query Segmentation Phân đoạn câu truy vấn dựa trên độ dài từ World Wide Web Mạng lưới thông tin toàn cầu - xi - MỞ ĐẦU 1. ĐẶT VẤN ĐỀ Hơn hai mươi năm qua, chúng ta chứng kiến sự phát triển và lớn mạnh vượt bậc của Internet và World Wide Web.

Đến cuối năm 2015, chỉ riêng Google đã đánh chỉ mục được khoảng 47 tỷ trang web1. Bên cạnh kích thước khổng lồ, sự tăng trưởng của World Wide Web còn thể hiện ở tính đa dạng của các ngôn ngữ được sử dụng trong các trang web. Đến thời điểm này, tiếng Anh tiếp tục là ngôn ngữ phổ biến nhất, được sử dụng tại 54% trong tổng số các website, tiếp theo là tiếng Nga và tiếng Đức, tương ứng là 6,1% và 5,7%. Riêng tiếng Việt được sử dụng tại khoảng 0,6% tổng số các website2.

Cùng với sự đa dạng về ngôn ngữ, việc tìm kiếm thông tin không còn giới hạn ở tiếng mẹ đẻ của người dùng mà đã được mở rộng ra các ngôn ngữ khác. Bài toán tìm kiếm web xuyên ngữ (Cross-Language Web Search) đặt ra nhiệm vụ từ nhu cầu thông tin của người dùng được trình bày ở một ngôn ngữ (gọi là ngôn ngữ nguồn), thực hiện việc xác định các trang web phù hợp được viết bằng một ngôn ngữ khác (gọi là ngôn ngữ đích). Việc giải quyết bài toán có ý nghĩa thực tế, cho phép người sử dụng truy cập các nguồn tài nguyên thông tin ở các ngôn ngữ khác nhau [134]. Nền tảng công nghệ để giải quyết bài toán tìm kiếm web xuyên ngữ là sự kết hợp các kỹ thuật áp dụng trong truy vấn thông tin xuyên ngữ (Cross-language Information Retrieval - CLIR) - một lĩnh vực con của truy vấn thông tin (Information Retrieval - IR) - và việc khai thác các đặc thù riêng của các trang web.

Truy vấn thông tin quan tâm vấn đề tìm kiếm thông tin phù hợp hay tài liệu chứa các thông tin như vậy dựa trên nhu cầu thông tin của người sử dụng từ một tập hợp lớn các tài liệu (được gọi là kho tài liệu). Nhu cầu thông tin được biểu diễn dưới dạng câu truy vấn.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Trích dẫn luận án này

Lâm Tùng Giang (n.d.). Luận án phương pháp xếp hạng trang web trong tìm kiếm xuyên ngữ [Luận án tiến sĩ, Trường Đại học Bách khoa, Đại học Đà Nẵng]. LuanAn.net. https://luanan.net/cong-nghe-thong-tin/he-thong-thong-tin/luan-an-phuong-phap-xep-hang-trang-web-tim-kiem-xuyen-ngu

Câu hỏi thường gặp

Luận án "Luận án phương pháp xếp hạng trang web trong tìm kiếm xuyên ngữ" nghiên cứu về vấn đề gì?

"Luận án nghiên cứu các phương pháp xếp hạng trang web trong tìm kiếm xuyên ngữ, đề xuất phương pháp mới hiệu quả và cải tiến khả năng tìm kiếm trên internet."

Luận án "Luận án phương pháp xếp hạng trang web trong tìm kiếm xuyên ngữ" được bảo vệ tại trường nào?

Luận án này được bảo vệ tại Trường Đại học Bách khoa, Đại học Đà Nẵng.

Luận án "Luận án phương pháp xếp hạng trang web trong tìm kiếm xuyên ngữ" có bao nhiêu trang?

Luận án "Luận án phương pháp xếp hạng trang web trong tìm kiếm xuyên ngữ" có 157 trang. Bạn có thể xem trước một phần tài liệu ngay trên trang web trước khi tải về.

Cách tải luận án "Luận án phương pháp xếp hạng trang web trong tìm kiếm xuyên ngữ" về máy như thế nào?

Để tải luận án về máy, bạn nhấn nút "Tải xuống ngay" trên trang này, sau đó hoàn tất thanh toán phí lưu trữ. File sẽ được tải xuống ngay sau khi thanh toán thành công. Hỗ trợ qua Zalo: 0559 297 239.

Luận án liên quan

Chia sẻ tài liệu: Facebook Twitter