Nghiên cứu phương pháp nâng cao hiệu quả tính toán tập rút gọn trên không gian xấp xỉ mờ - Luận án TS
Nghiên cứu các phương pháp nâng cao hiệu quả tính toán tập rút gọn trên không gian xấp xỉ mờ, tối ưu hóa thuật toán cho dữ liệu lớn.
Luan An
Luận án tiến sĩ
Năm xuất bản
Số trang
75
Thời gian đọc
12 phút
Lượt xem
1
Lượt tải
0
Phí lưu trữ
40 Point
Tải xuống file đầy đủ để xem toàn bộ nội dung
Tải đầy đủ (75 trang)Trích đoạn nội dung luận án
Tải xuống để đọc toàn bộBỘ GIÁO DỤC VIỆN HÀN LÂM KHOA HỌC VÀ ĐÀO TẠO VÀ CÔNG NGHỆ VIỆT NAM HỌC VIỆN KHOA HỌC VÀ CÔNG NGHỆ _______________________ Phạm Minh Ngọc Hà NGHIÊN CỨU MỘT SỐ PHƯƠNG PHÁP NÂNG CAO HIỆU QUẢ TÍNH TOÁN TẬP RÚT GỌN TRÊN KHÔNG GIAN XẤP XỈ MỜ TÓM TẮT LUẬN ÁN TIẾN SĨ HỆ THỐNG THÔNG TIN Mã số: 9 48 01 04 Hà Nội – 2024 Công trình được hoàn thành tại: Học viện Khoa học và Công nghệ , Viện Hàn lâm Khoa học và Công nghệ Việt Nam Người hướng dẫn khoa học: 1. Người hướng dẫn 1: PGS.TS Nguyễn Long Giang, Viện Công nghệ Thông tin, Viện Hàn lâm Khoa học và Công nghệ Việt Nam, Hà Nội, Việt Nam 2. Người hướng dẫn 2: TS Nguyễn Mạnh Hùng, Học viện Kĩ thuật Quân sự, Hà Nội, Việt Nam Phản biện 1:. Luận án được bảo vệ trước Hội đồng đánh giá luận án tiến sĩ cấp Học viện họp tại Học viện Khoa học và Công nghệ, Viện Hàn lâm Khoa học và Công nghệ Việt Nam vào hồi.
Có thể tìm hiểu luận án tại: 1. Thư viện Học viện Khoa học và Công nghệ 2. Thư viện Quốc gia Việt Nam 1 MỞ ĐẦU Tính cấp thiết của đề tài luận án Chọn lọc thuộc tính, còn được gọi là chọn lọc đặc trưng, là một bước quan trọng trong phân tích dữ liệu và học máy thống kê. Quá trình này bao gồm việc lựa chọn một tập con các thuộc tính có liên quan từ tập thuộc tính ban đầu, sao cho thông tin quan trọng được giữ lại một cách tối đa.
Chọn lọc thuộc tính mang lại nhiều lợi ích đáng kể: 1) giảm độ phức tạp tính toán, 2) cải thiện khả năng diễn giải mô hình, và 3) nâng cao khả năng dự đoán. Mục tiêu chính là tìm ra một tập con các đặc trưng, từ tập đặc trưng ban đầu, mà vẫn đảm bảo bảo toàn thông tin hoặc khả năng đưa ra quyết định chính xác. Các ứng dụng quan trọng của chọn lọc thuộc tính xuất hiện rộng rãi trong các lĩnh vực như nhận dạng mẫu và khai thác dữ liệu, bao gồm phân loại văn bản [1], [2], xử lý ảnh [3]–[5], và xử lý tiếng nói [6]–[9]. Năm 1982, Pawlak giới thiệu mô hình lý thuyết tập thô (Rough Set - RS) [10], được cộng đồng khoa học đánh giá cao về khả năng phân tích dữ liệu trong các tình huống không đầy đủ và thiếu nhất quán.
Nhờ khả năng này, chọn lọc thuộc tính theo tiếp cận RS đã thu hút sự quan tâm của nhiều nhà nghiên cứu trong lĩnh vực lý thuyết tập thô trong nhiều năm qua [4], [11]–[16]. Dựa trên khái niệm không gian xấp xỉ (Approximation Space - AP) của RS, nhiều độ đo đã được đề xuất để định nghĩa reduct và hỗ trợ chọn lọc thuộc tính. Các nghiên cứu gần đây cho thấy rằng, các phương pháp rút gọn thuộc tính theo tiếp cận tập thô truyền thống mang lại nhiều kết quả đáng chú ý trong việc giảm số lượng thuộc tính mà vẫn bảo toàn khả năng phân lớp của bảng quyết định [1], [8], [14]–[17]. Tuy nhiên, tập thô truyền thống chủ yếu phù hợp với các bảng quyết định có miền giá trị rời rạc [18].
Do đó, cần phải rời rạc hóa dữ liệu của các bảng quyết định số (miền giá trị liên tục) trước khi thực hiện chọn lọc thuộc tính. Quá trình này phát sinh thêm chi phí tính toán, có thể làm mất đi tính tự nhiên của dữ liệu, và tiềm ẩn nguy cơ làm mất thông tin quan trọng. Để khắc phục những hạn chế này, các nhà nghiên cứu đã đề xuất mở rộng RS trên không gian xấp xỉ mờ, tạo ra mô hình tập thô mờ (Fuzzy Rough Set - FRS) [19]–[21], và mở rộng RS trên không gian xấp xỉ mờ trực cảm, tạo ra mô hình tập thô mờ trực cảm (Intuitionistic Fuzzy Rough Set - IFRS) [22]. Các mô hình này cho phép xây dựng các phương pháp chọn lọc thuộc tính trực tiếp trên bảng quyết định gốc mà không cần rời rạc hóa.
Không gian xấp xỉ mờ của FRS sử dụng khái niệm quan hệ tương tự (similarity relation) thay cho quan hệ tương đương (equivalence relation) để xây dựng không gian quan hệ giữa các đối tượng. Nhờ đó, quan hệ giữa các đối tượng trong không gian xấp xỉ mờ trở nên mềm dẻo hơn so với quan hệ tương đương truyền thống. Mức độ quan hệ giữa các đối tượng được biểu diễn bằng các giá trị trong khoảng [0, 1] thay vì chỉ 0 hoặc 1 như trong tập thô truyền thống. Hiện nay, việc phát triển các phương pháp chọn lọc thuộc tính dựa trên việc xây dựng độ đo trên không gian xấp xỉ mờ diễn ra rất sôi động, với nhiều độ đo điển hình đã được đề xuất, bao gồm độ đo FPOS [20], [21], [23]–[28], độ đo FIE [4], [29]–[32], và độ đo FD [6], [11], [33]–[35].
Tại Việt Nam, luận án của TS. Nguyễn Văn Thiện đã mở rộng một số độ đo trên không gian xấp xỉ mờ, rút gọn thuộc tính cho bảng quyết định số. Tuy các nghiên cứu đã chỉ ra rằng các phương pháp chọn lọc thuộc tính theo tiếp cận xây dựng độ đo trên không gian xấp xỉ mờ của FRS hoạt động hiệu quả với các bộ dữ liệu có miền giá trị số, nhưng hiệu quả của chúng có thể giảm khi áp dụng cho các bộ dữ liệu số có độ nhạy cao về tỉ lệ phân nhầm lớp (tức là có nhiều nhiễu). Do đó, mô hình tập thô mờ độ chính xác thay đổi (Variable Precision Fuzzy Rough Sets - VPFRS) [19], [31], [36]–[50] và các độ đo xây dựng trên không gian xấp xỉ mờ trực cảm của mô hình IFRS [13], [20], [22], [41], [46], [51]–[54] đã được đề xuất để giải 5 Cấu trúc của luận án: Ngoài phần mở đầu và phần kết luận, luận án xây dựng 03 chương nghiên cứu với các nội dung chính như sau: Chương 1.
Nghiên cứu tổng quan về phương pháp rút gọn thuộc tính trên không gian xấp xỉ mờ. Chương này giới thiệu tổng quát về bài toán rút gọn thuộc tính, trình bày các kiến thức cơ sở của lý thuyết tập thô và tập thô mở rộng trên không gian xấp xỉ mờ, rút gọn thuộc tính cho bảng quyết định số. Rút gọn thuộc tính theo tiếp cận mở rộng tập thô mờ độ chính xác thây đổi trên không gian xấp xỉ mờ. Chương này trình bày các đóng góp quan trọng trong việc xây dựng độ đo độ phụ thuộc mở rộng, có thời gian tính toán hiệu quả.
Đáng chú ý, một số tập rút gọn trên các bảng quyết định số có chứa nhiễu có khả năng cải thiện độ chính xác phân lớp tốt hơn so với các phương pháp hiện có. Chương 3 Phương pháp tính toán gia tăng tập rút gọn theo tiếp cận tính toán hạt trên không gian xấp xỉ mờ. Chương này trình bày các đóng góp chính trong việc xây dựng phương pháp tính toán gia tăng tập rút gọn hiệu quả trên không gian xấp xỉ mở. Hơn nữa, phương pháp đề xuất cũng trình bày một số kết quả thực nghiệm đáng chú ý về khả năng cải thiện độ chính xác phân lớp tốt trên một số bộ dữ liệu có kích thước lớn.
TTỔNG QUAN VỀ PHƯƠNG PHÁP RÚT GỌN THUỘC TÍNH TRÊN KHÔNG GIAN XẤP XỈ MỜ. Chương 1 của luận án tập trung vào việc cung cấp một cái nhìn tổng quan về bài toán chọn lọc thuộc tính (còn được gọi là rút gọn thuộc tính hay chọn lọc đặc trưng) và các kiến thức nền tảng cần thiết cho các chương tiếp theo [1]. Chương này trình bày tổng quan về các phương pháp chọn lọc thuộc tính trên không gian xấp xỉ mờ, tập trung vào hai hướng tiếp cận chính: cải thiện độ chính xác phân lớp trên các bảng quyết định số có chứa nhiễu và tính toán gia tăng trên các bảng quyết định số cập nhật tập các đối tượng [1, 2]. Mở đầu Phần mở đầu giới thiệu tính cấp thiết của đề tài luận án, khẳng định rằng chọn lọc thuộc tính là một bước quan trọng trong tiền xử lý dữ liệu cho các tác vụ phân tích dữ liệu và học máy, đặc biệt trong bối cảnh dữ liệu ngày càng lớn và phức tạp [3, 4].
Quá trình này giúp chọn ra một tập con các thuộc tính có liên quan từ tập thuộc tính ban đầu, bảo toàn thông tin và khả năng phân lớp của dữ liệu gốc, đồng thời giảm độ phức tạp tính toán, cải thiện khả năng diễn giải mô hình và nâng cao khả năng dự đoán [4, 5]. Khái quát bài toán chọn lọc thuộc tính theo tiếp cận tập thô Luận án nhắc lại việc Pawlak giới thiệu mô hình lý thuyết tập thô (Rough Set - RS) vào năm 1982, một công cụ mạnh mẽ để phân tích dữ liệu không đầy đủ và thiếu nhất quán [6, 7]. Dựa trên khả năng này, chọn lọc thuộc tính theo tiếp cận RS đã thu hút sự quan tâm rộng rãi [5, 6]. Không giống như các phương pháp giảm chiều dữ liệu như PCA hay SVD, phương pháp này chọn lọc trực tiếp các thuộc tính mà không làm thay đổi tính tự nhiên của dữ liệu sau khi rút gọn [5].
Bài toán chọn lọc thuộc tính theo tiếp cận tập thô bao gồm các bước chính [8]: • Xác định không gian tìm kiếm: Tập hợp tất cả các tập con có thể của tập thuộc tính ban đầu. • Xây dựng hàm đánh giá thuộc tính: Sử dụng các độ đo dựa trên khái niệm không gian xấp xỉ 8 có thể cải thiện chất lượng reduct trên dữ liệu nhiễu, nhưng có chi phí tính toán cao hơn [35]. Việc xây dựng các hàm thành viên và không thành viên độc lập cũng là một thách thức [33]. Vấn đề còn tồn tại Các nghiên cứu gần đây về phương pháp chọn lọc thuộc tính cải thiện độ chính xác phân lớp, đặc biệt là dựa trên VPFRS, còn hạn chế về hiệu quả thời gian tính toán [38, 39].
Việc xem xét toàn bộ các đối tượng trong bảng quyết định khi điều chỉnh độ chính xác dẫn đến chi phí tính toán lớn [39]. Luận án đặt mục tiêu cải thiện thời gian tính toán bằng cách tối ưu hóa các phép toán xấp xỉ dựa trên các tính chất cơ bản của tập thô mờ với độ chính xác thay đổi [36, 40]. Phương pháp chọn lọc thuộc tính gia tăng trên không gian xấp xỉ mờ Trong nhiều ứng dụng thực tế, dữ liệu liên tục được cập nhật và thay đổi theo thời gian, đòi hỏi mô hình phân lớp phải được điều chỉnh tương ứng [40]. Chọn lọc thuộc tính gia tăng đóng vai trò quan trọng trong việc giảm thời gian tiền xử lý dữ liệu khi có sự thay đổi, từ đó tăng hiệu quả cho quá trình cập nhật mô hình [40, 41].
Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ
Trích dẫn luận án này
Phạm Minh Ngọc Hà (2024). Nâng cao hiệu quả tính toán tập rút gọn trên không gian xấp xỉ mờ [Luận án tiến sĩ, Học viện Khoa học và Công nghệ]. LuanAn.net. https://luanan.net/cong-nghe-thong-tin/tri-tue-nhan-tao/tom-tat-nghien-cuu-mot-so-phuong-phap-nang-cao-hieu-qua-tinh-toan-tap-rut-gon
Câu hỏi thường gặp
Luận án "Nâng cao hiệu quả tính toán tập rút gọn trên không gian xấp xỉ mờ" nghiên cứu về vấn đề gì?
Nghiên cứu các phương pháp nâng cao hiệu quả tính toán tập rút gọn trên không gian xấp xỉ mờ, tối ưu hóa thuật toán cho dữ liệu lớn.
Luận án "Nâng cao hiệu quả tính toán tập rút gọn trên không gian xấp xỉ mờ" được bảo vệ tại trường nào?
Luận án này được bảo vệ tại Học viện Khoa học và Công nghệ. Năm bảo vệ: 2024.
Luận án "Nâng cao hiệu quả tính toán tập rút gọn trên không gian xấp xỉ mờ" thuộc chuyên ngành gì?
Luận án "Nâng cao hiệu quả tính toán tập rút gọn trên không gian xấp xỉ mờ" thuộc chuyên ngành Hệ thống thông tin. Danh mục: Trí Tuệ Nhân Tạo.
Luận án "Nâng cao hiệu quả tính toán tập rút gọn trên không gian xấp xỉ mờ" có bao nhiêu trang?
Luận án "Nâng cao hiệu quả tính toán tập rút gọn trên không gian xấp xỉ mờ" có 75 trang. Bạn có thể xem trước một phần tài liệu ngay trên trang web trước khi tải về.
Cách tải luận án "Nâng cao hiệu quả tính toán tập rút gọn trên không gian xấp xỉ mờ" về máy như thế nào?
Để tải luận án về máy, bạn nhấn nút "Tải xuống ngay" trên trang này, sau đó hoàn tất thanh toán phí lưu trữ. File sẽ được tải xuống ngay sau khi thanh toán thành công. Hỗ trợ qua Zalo: 0559 297 239.