Luận án tiến sĩ phát triển một số phương pháp rút gọn thuộc tính trong bảng quyế
Tài liệu: Luận án tiến sĩ phát triển một số phương pháp rút gọn thuộc tính trong bảng quyết định không đầy đủ theo tiếp cận filter wrapper. Tải miễn phí tại Tai
Luan An
luận án tiến sĩ
Năm xuất bản
Số trang
176
Thời gian đọc
27 phút
Lượt xem
1
Lượt tải
0
Phí lưu trữ
50 Point
Tổng quan nhanh
- Chủ đề:
- Tổng quan rút gọn thuộc tính bảng quyết định không đầy đủ
- Số trang:
- 176 trang
- Trường:
- Viện Khoa học và Công nghệ Quân sự
- Chuyên ngành:
- Toán học
- Tác giả:
- Nguyễn Bá Quảng
- Năm:
- 2021
Tóm tắt nội dung luận án
I.Tổng quan rút gọn thuộc tính bảng quyết định không đầy đủ
Luận án tập trung vào vấn đề rút gọn thuộc tính trong các bảng quyết định không đầy đủ. Rút gọn thuộc tính là một nhiệm vụ quan trọng trong khai phá dữ liệu. Nó giúp giảm chiều dữ liệu, cải thiện hiệu suất của các thuật toán học máy. Đồng thời, rút gọn thuộc tính còn tăng cường khả năng diễn giải mô hình. Bảng quyết định không đầy đủ chứa thông tin thiếu, đây là một thách thức phổ biến. Tài liệu này khám phá sâu về lý thuyết tập thô dung sai. Lý thuyết này cung cấp nền tảng vững chắc cho việc xử lý dữ liệu không chắc chắn. Luận án xem xét các tiếp cận Filter và Wrapper trong rút gọn thuộc tính. Các phương pháp này được áp dụng để tối ưu hóa việc lựa chọn tập thuộc tính. Mục tiêu là duy trì hoặc cải thiện chất lượng quyết định. Các nghiên cứu liên quan cũng được tổng hợp để đặt nền tảng cho các đề xuất mới.
1.1. Cơ sở lý thuyết tập thô dung sai
Luận án giới thiệu hệ thống thông tin không đầy đủ. Mô hình tập thô dung sai được phát triển để xử lý sự thiếu hụt thông tin. Khái niệm bảng quyết định không đầy đủ được định nghĩa rõ ràng. Ma trận dung sai đóng vai trò trung tâm trong việc đo lường sự tương đồng. Tập xấp xỉ dưới và tập xấp xỉ trên được sử dụng để biểu diễn các khái niệm không rõ ràng. Quan hệ dung sai trên tập thuộc tính thiết lập cơ sở cho việc nhóm các đối tượng. Các khái niệm này là nền tảng cho việc phát triển các thuật toán rút gọn. Việc hiểu rõ cơ sở lý thuyết này rất quan trọng để xây dựng các phương pháp hiệu quả. Nó giúp vượt qua hạn chế của dữ liệu truyền thống, đầy đủ. Việc này mở ra hướng đi mới cho phân tích dữ liệu phức tạp, không hoàn chỉnh.
1.2. Các tiếp cận rút gọn thuộc tính phổ biến
Có hai tiếp cận chính trong rút gọn thuộc tính. Đó là tiếp cận Filter và tiếp cận Wrapper. Tiếp cận Filter đánh giá thuộc tính dựa trên đặc tính nội tại của dữ liệu. Nó độc lập với thuật toán học máy. Tiếp cận này thường nhanh hơn. Tiếp cận Wrapper sử dụng một thuật toán học máy cụ thể để đánh giá chất lượng tập thuộc tính. Nó có xu hướng tạo ra tập thuộc tính tối ưu hơn cho một nhiệm vụ nhất định. Tuy nhiên, nó tốn kém hơn về mặt tính toán. Luận án kết hợp cả hai tiếp cận. Nó tạo ra một phương pháp Filter-Wrapper mạnh mẽ. Phương pháp này tận dụng ưu điểm của cả hai. Nó cung cấp sự cân bằng giữa hiệu quả và hiệu suất. Các nghiên cứu liên quan trong lĩnh vực tập thô dung sai được tổng hợp. Điều này cung cấp bối cảnh cho các đóng góp mới của luận án.
II.Thuật toán Filter Wrapper cho bảng quyết định không đầy đủ
Luận án đề xuất một thuật toán Filter-Wrapper mới. Thuật toán này tìm tập rút gọn trong các bảng quyết định không đầy đủ. Đây là đóng góp cốt lõi của nghiên cứu. Thuật toán này được xây dựng dựa trên một độ đo khoảng cách tiên tiến. Độ đo này được thiết kế đặc biệt cho dữ liệu thiếu. Nó giải quyết những hạn chế của các phương pháp hiện có. Thuật toán hoạt động hiệu quả trên nhiều tập dữ liệu thực tế. Các bước thực nghiệm chứng minh hiệu quả và độ chính xác. Phương pháp này mang lại một giải pháp mạnh mẽ cho bài toán phức tạp. Nó mở rộng khả năng xử lý dữ liệu không đầy đủ trong các ứng dụng thực tiễn. Việc kết hợp Filter và Wrapper giúp tối ưu hóa quá trình lựa chọn thuộc tính. Điều này đảm bảo tính bền vững và khả năng mở rộng của thuật toán.
2.1. Xây dựng độ đo khoảng cách mới trong dữ liệu không đầy đủ
Một độ đo khoảng cách mới được phát triển. Độ đo này hoạt động trực tiếp trên các bảng quyết định không đầy đủ. Đây là một điểm đột phá. Độ đo khoảng cách truyền thống thường không hiệu quả với dữ liệu thiếu. Độ đo mới này tính toán khoảng cách giữa hai tập hợp. Nó cũng tính khoảng cách giữa hai tập thuộc tính. Độ đo này xem xét sự không chắc chắn của dữ liệu. Nó giúp định lượng mức độ tương tự hoặc khác biệt. Việc này rất quan trọng cho giai đoạn Filter của thuật toán. Nó cho phép lựa chọn các thuộc tính có ý nghĩa. Độ đo mới đảm bảo tính chính xác. Nó cũng duy trì sự mạnh mẽ khi đối mặt với thông tin không hoàn chỉnh. Nó là chìa khóa để thuật toán Filter-Wrapper hoạt động hiệu quả.
2.2. Đề xuất thuật toán Filter Wrapper hiệu quả
Thuật toán Filter-Wrapper được xây dựng theo hai giai đoạn. Giai đoạn Filter sử dụng độ đo khoảng cách đã phát triển. Nó loại bỏ các thuộc tính không cần thiết ban đầu. Giai đoạn này nhanh chóng thu hẹp không gian tìm kiếm. Giai đoạn Wrapper sau đó sử dụng một chiến lược tối ưu hóa. Nó tinh chỉnh tập thuộc tính đã rút gọn. Điều này giúp đạt được hiệu suất cao nhất. Thuật toán được đánh giá qua các thực nghiệm rộng rãi. Các tập dữ liệu benchmark được sử dụng. Kết quả cho thấy hiệu quả vượt trội. Nó so sánh với các phương pháp rút gọn thuộc tính hiện có. Thuật toán này mang lại một giải pháp toàn diện. Nó giải quyết bài toán rút gọn thuộc tính trong môi trường dữ liệu không đầy đủ.
III.Thuật toán gia tăng rút gọn thuộc tính khi đối tượng thay đổi
Dữ liệu thường xuyên thay đổi trong các ứng dụng thực tế. Việc này đòi hỏi các thuật toán rút gọn thuộc tính phải có khả năng thích ứng. Luận án giới thiệu các thuật toán gia tăng. Các thuật toán này xử lý khi có sự thay đổi về đối tượng. Điều này bao gồm việc bổ sung hoặc loại bỏ các hàng (đối tượng) khỏi bảng quyết định. Các phương pháp gia tăng tránh việc tính toán lại toàn bộ. Chúng chỉ cập nhật các phần bị ảnh hưởng. Điều này tiết kiệm đáng kể thời gian và tài nguyên tính toán. Hiệu quả này rất quan trọng đối với các hệ thống dữ liệu lớn. Các hệ thống này cần cập nhật liên tục. Luận án cung cấp các công thức cập nhật khoảng cách chi tiết. Các thuật toán cụ thể được phát triển cho từng trường hợp. Việc này đảm bảo tính toàn vẹn của tập rút gọn. Nó vẫn giữ nguyên hiệu suất cao.
3.1. Cập nhật rút gọn khi bổ sung đối tượng vào bảng quyết định
Khi một hoặc nhiều đối tượng mới được bổ sung. Việc cập nhật tập rút gọn thuộc tính là cần thiết. Luận án đề xuất một công thức cập nhật khoảng cách. Công thức này tính toán lại khoảng cách một cách hiệu quả. Nó không cần xem xét lại toàn bộ dữ liệu. Một thuật toán gia tăng Filter-Wrapper được phát triển. Thuật toán này xử lý trường hợp bổ sung đối tượng. Nó duy trì tập rút gọn tối ưu. Thực nghiệm chứng minh hiệu quả tính toán của phương pháp này. Nó vượt trội so với việc chạy lại thuật toán từ đầu. Điều này đặc biệt hữu ích cho các hệ thống dữ liệu động. Hệ thống này liên tục tiếp nhận dữ liệu mới. Việc này giúp tiết kiệm thời gian, tối ưu tài nguyên tính toán.
3.2. Cập nhật rút gọn khi loại bỏ đối tượng khỏi bảng quyết định
Trường hợp loại bỏ đối tượng cũng được giải quyết. Đây là một tình huống phổ biến trong quản lý dữ liệu. Một công thức cập nhật khoảng cách mới được đề xuất. Công thức này điều chỉnh khoảng cách sau khi loại bỏ đối tượng. Một thuật toán gia tăng Filter-Wrapper được thiết kế. Thuật toán này cập nhật tập rút gọn khi đối tượng bị loại bỏ. Nó đảm bảo tính nhất quán của mô hình. Các thực nghiệm đánh giá cho thấy hiệu quả của thuật toán. Thuật toán này duy trì tính chính xác. Nó giảm thiểu chi phí tính toán. Điều này quan trọng đối với các ứng dụng có yêu cầu thời gian thực. Nó giúp hệ thống phản ứng nhanh với sự thay đổi của dữ liệu. Nó tối ưu hóa hiệu suất tổng thể của hệ thống.
IV.Thuật toán gia tăng rút gọn thuộc tính khi thuộc tính thay đổi
Bên cạnh thay đổi về đối tượng, các thuộc tính cũng có thể thay đổi. Luận án tiếp tục phát triển các thuật toán gia tăng. Các thuật toán này xử lý khi có sự bổ sung hoặc loại bỏ thuộc tính. Việc này bao gồm cả thuộc tính điều kiện và thuộc tính quyết định. Các thuật toán được thiết kế để cập nhật tập rút gọn một cách thông minh. Chúng không cần khởi tạo lại toàn bộ quá trình. Điều này đặc biệt quan trọng trong các hệ thống có nhiều thuộc tính. Đặc biệt là những hệ thống yêu cầu linh hoạt. Các công thức cập nhật khoảng cách được trình bày chi tiết. Các thuật toán gia tăng được đề xuất cho từng kịch bản. Thực nghiệm kiểm chứng hiệu quả và tính ổn định. Nó đảm bảo rằng hệ thống có thể thích nghi tốt. Hệ thống vẫn giữ được độ chính xác trong môi trường thay đổi liên tục.
4.1. Cập nhật rút gọn khi bổ sung thuộc tính mới
Khi có thuộc tính mới được thêm vào bảng quyết định. Cần cập nhật tập rút gọn hiện có. Luận án trình bày công thức cập nhật khoảng cách. Công thức này xem xét thuộc tính mới một cách hiệu quả. Thuật toán gia tăng Filter-Wrapper được xây dựng. Thuật toán này tích hợp thuộc tính mới vào quy trình rút gọn. Nó đảm bảo tập thuộc tính vẫn tối ưu. Các thử nghiệm chỉ ra rằng phương pháp này rất hiệu quả. Nó nhanh hơn nhiều so với việc tính toán lại từ đầu. Điều này cung cấp giải pháp thiết thực. Nó ứng dụng cho các kịch bản mở rộng dữ liệu. Các hệ thống cần thêm các thông tin mới thường xuyên sẽ được hưởng lợi.
4.2. Cập nhật rút gọn khi loại bỏ thuộc tính không còn phù hợp
Việc loại bỏ các thuộc tính không còn hữu ích hoặc dư thừa là cần thiết. Điều này giúp duy trì tính gọn nhẹ của mô hình. Luận án đưa ra công thức cập nhật khoảng cách. Công thức này điều chỉnh các giá trị khoảng cách. Nó sau khi một thuộc tính bị loại bỏ. Một thuật toán gia tăng Filter-Wrapper được phát triển. Thuật toán này cập nhật tập rút gọn trong trường hợp này. Nó đảm bảo không làm mất đi thông tin quan trọng. Kết quả thực nghiệm xác nhận hiệu quả của thuật toán. Nó duy trì hiệu suất tốt. Nó giúp các hệ thống khai phá dữ liệu luôn được tối ưu. Nó thích ứng linh hoạt với sự thay đổi của nguồn dữ liệu. Điều này quan trọng cho các ứng dụng thực tế.
Mục lục chi tiết luận án
Tải xuống file đầy đủ để xem toàn bộ nội dung
Tải đầy đủ (176 trang)Nội dung chính
Tổng quan về luận án
Trong kỷ nguyên bùng nổ thông tin và khoa học dữ liệu lớn (Big Data), việc xử lý các bảng dữ liệu có số lượng chiều thuộc tính khổng lồ nhưng lại tồn tại các giá trị bị khuyết thiếu (missing values) đặt ra thách thức toán học và tin học sâu sắc. Rút gọn thuộc tính (Attribute Reduction hay Feature Selection) đóng vai trò là giai đoạn tiền xử lý then chốt nhằm loại bỏ các thông tin dư thừa, nhiễu loạn mà vẫn bảo toàn năng lực phân loại của hệ thống tri thức. Luận án tiến sĩ toán học chuyên ngành Cơ sở toán học cho tin học (mã số: 9460110) với đề tài "Phát triển một số phương pháp rút gọn thuộc tính trong bảng quyết định không đầy đủ theo tiếp cận Filter-Wrapper" của Nghiên cứu sinh Nguyễn Bá Quảng, dưới sự hướng dẫn khoa học của PGS. TS Nguyễn Long Giang và TS Ngô Trọng Mại (Viện Khoa học và Công nghệ quân sự, 2021), đại diện cho một công trình nghiên cứu tiên phong, giải quyết toàn diện bài toán tối ưu hóa không gian thuộc tính trên các hệ thông tin không hoàn hảo.
┌────────────────────────────────────────────────────────┐
│ Bảng quyết định không đầy đủ (IDS = <U, C ∪ {d}>) │
│ (Dữ liệu lớn, giá trị khuyết thiếu '*') │
└──────────────────────────┬─────────────────────────────┘
│
┌─────────────────────┴─────────────────────┐
▼ ▼
┌───────────────────────────┐ ┌───────────────────────────┐
│ Bảng quyết định CỐ ĐỊNH │ │ Bảng quyết định ĐỘNG │
└─────────────┬─────────────┘ └─────────────┬─────────────┘
│ │
┌─────────────▼─────────────┐ ┌─────────────▼─────────────┐
│ Độ đo Khoảng cách Phủ mới │ │ Công thức Cập nhật │
│ trên Quan hệ Dung sai │ │ Khoảng cách Gia tăng │
└─────────────┬─────────────┘ └─────────────┬─────────────┘
│ │
┌─────────────▼─────────────┐ ┌─────────────▼─────────────┐
│ Thuật toán Filter-Wrapper │ │ 04 Thuật toán Gia tăng │
│ IDS_FW_DAR │ │ IDS_IFW_{AO, DO, AA, DA} │
└─────────────┬─────────────┘ └─────────────┬─────────────┘
│ │
└─────────────────────┬─────────────────────┘
▼
┌────────────────────────────────────────────────────────┐
│ HIỆU NĂNG VƯỢT TRỘI TRÊN BENCHMARK UCI │
│ - Cực tiểu hóa số thuộc tính rút gọn │
│ - Nâng cao độ chính xác phân lớp (Classification Acc) │
│ - Cắt giảm đột phá thời gian tính toán gia tăng │
└────────────────────────────────────────────────────────┘
Khoảng trống nghiên cứu (Research Gap) cốt lõi được luận án xác định xuất phát từ hai hạn chế nền tảng trong y văn quốc tế:
- Hầu hết các thuật toán rút gọn thuộc tính trên bảng quyết định không đầy đủ (Incomplete Decision Tables - IDS) dựa trên mô hình tập thô dung sai (Tolerance Rough Set Model - TRSM) trước đây như công trình của Kryszkiewicz (1998), Meng và cộng sự (2009), Qian và cộng sự (2011), hay Xie và cộng sự (2018) đều thuần túy vận hành theo tiếp cận Filter. Tiếp cận này chọn thuộc tính độc lập với thuật toán học máy phân lớp, dẫn đến việc tập rút gọn thu được chưa tối ưu về số lượng chiều và chưa cực đại hóa được độ chính xác phân lớp (Classification Accuracy).
- Khi cơ sở dữ liệu biến động động (Dynamic Datasets) thông qua việc bổ sung/loại bỏ đối tượng hoặc thuộc tính, các thuật toán không gia tăng truyền thống buộc phải tái tính toán toàn cục từ đầu trên toàn bộ bảng dữ liệu $O(|U|^2 \cdot |C|)$, gây bùng nổ chi phí tính toán và tắc nghẽn bộ nhớ. Các thuật toán gia tăng đã công bố như của Shu và cộng sự (2014, 2015), Ma và cộng sự (2016), hay Wang và cộng sự (2019) chỉ dừng lại ở tiếp cận Filter đơn thuần hoặc chỉ xử lý trên bảng quyết định đầy đủ theo lý thuyết tập thô mờ (Fuzzy Rough Sets).
Nhằm khỏa lấp khoảng trống này, luận án tập trung giải quyết 3 câu hỏi nghiên cứu và hệ giả thuyết khoa học:
- Research Question 1 (RQ1): Làm thế nào để thiết lập một không gian metric khoảng cách mới trên các phủ dung sai nhằm phản ánh chính xác mức độ phân biệt của các thuộc tính trong điều kiện dữ liệu khuyết thiếu? $\rightarrow$ Hypothesis 1 (H1): Độ đo khoảng cách mới giữa các phủ sẽ thiết lập được độ quan trọng thuộc tính phi tuyến, đóng vai trò là hàm heuristic hiệu quả cho giai đoạn lọc (Filter).
- Research Question 2 (RQ2): Cơ chế kết hợp Filter-Wrapper nào cho phép vừa giảm thiểu số lượng thuộc tính rút gọn, vừa bảo toàn và nâng cao độ chính xác của các bộ phân lớp học máy? $\rightarrow$ Hypothesis 2 (H2): Chiến lược Filter sinh các tập ứng viên xấp xỉ kết hợp Wrapper thẩm định bằng bộ phân lớp sẽ loại bỏ triệt để các thuộc tính "dư thừa cục bộ" mà phương pháp Filter đơn thuần không thể phát hiện.
- Research Question 3 (RQ3): Làm thế nào để xây dựng các công thức toán học cập nhật gia tăng ma trận dung sai và độ đo khoảng cách khi bảng quyết định biến động theo cả chiều dọc (đối tượng) và chiều ngang (thuộc tính)? $\rightarrow$ Hypothesis 3 (H3): Các định lý cập nhật gia tăng cục bộ trên phần sai khác $\Delta U$ và $\Delta C$ sẽ giảm độ phức tạp thời gian tính toán từ bậc đa thức cao xuống tiệm cận tuyến tính mà không làm suy giảm chất lượng tập rút gọn.
Khung lý thuyết của luận án tích hợp chặt chẽ giữa Lý thuyết tập thô kinh điển (Classical Rough Set Theory - Pawlak, 1982), Mô hình tập thô dung sai (Tolerance Rough Set Model - Kryszkiewicz, 1998), Lý thuyết tính toán hạt (Granular Computing) và Khung lựa chọn đặc trưng lai ghép Filter-Wrapper (Kohavi & John, 1997). Đóng góp đột phá của luận án được định lượng thông qua việc cắt giảm từ 20% đến 50% số lượng thuộc tính so với các thuật toán Filter kinh điển (POS-R, INF-R, NEW-R), đồng thời cải thiện độ chính xác phân lớp trên các tập dữ liệu thực nghiệm chuẩn từ kho dữ liệu UCI Machine Learning Repository (bao gồm Audiology, Soybean-large, Congressional Voting Records, Arrhythmia, Anneal, Advertisements).
Literature Review và Positioning
Lịch sử phát triển của lý thuyết tập thô bắt đầu từ công trình nền tảng của Z. Pawlak (1982, 1991), dựa trên quan hệ tương đương (Equivalence Relation - thỏa mãn tính phản xạ, đối xứng và bắc cầu) để phân hoạch không gian đối tượng $U$ thành các lớp không phân biệt được (Indiscernibility Classes). Tuy nhiên, quan hệ tương đương đòi hỏi thông tin tuyệt đối đầy đủ. Khi áp dụng vào các bảng quyết định không đầy đủ $IDS = \langle U, C \cup {d} \rangle$, nơi tồn tại các giá trị chưa xác định ký hiệu là '*', quan hệ tương đương bị phá vỡ.
Để khắc phục, Kryszkiewicz (1998, 1999) đã mở rộng quan hệ tương đương thành quan hệ dung sai (Tolerance Relation) $SIM(P)$, loại bỏ tính chất bắc cầu: $$(u, v) \in SIM(P) \iff \forall a \in P, ; a(u) = a(v) \lor a(u) = '' \lor a(v) = ''$$ Quan hệ này hình thành một hệ phủ (Covering) $\mathcal{K}(P) = U/SIM(P) = {S_P(u) \mid u \in U}$, trong đó $S_P(u)$ là lớp dung sai chứa đối tượng $u$.
┌────────────────────────────────────────┐
│ Lý thuyết Tập thô Pawlak (1982) │
│ - Quan hệ tương đương (Phân hoạch) │
│ - Giả định dữ liệu đầy đủ 100% │
└───────────────────┬────────────────────┘
│ (Mở rộng quan hệ)
▼
┌────────────────────────────────────────┐
│ Tập thô Dung sai Kryszkiewicz (1998) │
│ - Quan hệ dung sai SIM(P) (Hệ phủ) │
│ - Xử lý trực tiếp missing value '*' │
└───────────────────┬────────────────────┘
│
┌────────────────────────────────┴────────────────────────────────┐
│ │
▼ ▼
┌────────────────────────────────────────┐ ┌────────────────────────────────────────┐
│ Các phương pháp FILTER truyền thống │ │ Khoảng trống nghiên cứu (GAPS) │
│ - Miền dương: Meng (2009), Hu (2017) │ │ 1. Filter đơn thuần: Chưa tối ưu hóa │
│ - Ma trận phân biệt: Ma, Giang (2013) │ │ kích thước và độ chính xác │
│ - Entropy thông tin: Dai, Sun (2013) │ │ 2. Thiếu cơ chế gia tăng động 4 chiều │
│ - Độ không nhất quán: Xie (2018) │ │ (Add/Del Objects, Add/Del Attr) │
└──────────────────┬─────────────────────┘ └──────────────────┬─────────────────────┘
│ │
└──────────────────────────────┬─────────────────────────────────┘
│ (Định vị & Đột phá)
▼
┌────────────────────────────────────────┐
│ ĐÓNG GÓP ĐỘT PHÁ CỦA LUẬN ÁN │
│ - Độ đo khoảng cách phủ tối ưu │
│ - Kiến trúc lai Filter-Wrapper │
│ - Hệ 04 thuật toán gia tăng toàn diện │
│ IDS_FW_DAR & IDS_IFW_{AO,DO,AA,DA} │
└────────────────────────────────────────┘
Trong suốt hai thập kỷ qua, y văn học thuật thế giới hình thành nhiều trường phái rút gọn thuộc tính trên bảng quyết định không đầy đủ theo tiếp cận Filter:
- Trường phái Miền dương mở rộng (Generalized Positive Region): Meng và cộng sự (2009), Peng và cộng sự (2010), Qian và cộng sự (2011), Hu và cộng sự (2017) định nghĩa tập rút gọn bảo toàn miền dương $POS_C(d)$. Hạn chế của hướng tiếp cận này là miền dương có xu hướng bị co hẹp nghiêm trọng khi tỷ lệ giá trị thiếu tăng cao, khiến việc đánh giá độ quan trọng của thuộc tính bị sai lệch.
- Trường phái Ma trận phân biệt và Hàm phân biệt (Discernibility Matrix): Xu và cộng sự (2009), Tan và cộng sự (2010), Zou và cộng sự (2012), Vũ Văn Định và Nguyễn Long Giang (2013), Ma và cộng sự (2017) chuyển bài toán rút gọn thành việc tìm tập phủ cực tiểu của ma trận phân biệt. Nhược điểm chí mạng là độ phức tạp không gian lưu trữ ma trận $O(|U|^2)$, không khả thi với dữ liệu quy mô lớn.
- Trường phái Entropy thông tin mở rộng (Information Entropy): Sun và cộng sự (2012), Dai và cộng sự (2013), Xu và cộng sự (2013), Yue và cộng sự (2015), Tao và cộng sự (2017) sử dụng độ bất định thông tin để định hướng tìm kiếm. Mặc dù có tính tổng quát cao, chi phí tính toán phân bố xác suất có điều kiện trên các lớp dung sai giao nhau là vô cùng đắt đỏ.
- Trường phái Độ không nhất quán (Inconsistency Degree): Điển hình là nghiên cứu quốc tế của Xie và cộng sự (2018) với thuật toán NEW-R, chứng minh tính vượt trội so với thuật toán POS-R (Meng et al., 2009) và INF-R (Dai et al., 2013). Tuy nhiên, NEW-R vẫn giam mình trong không gian tìm kiếm đơn tầng của Filter.
Về phương diện tính toán gia tăng (Incremental Computing), các nghiên cứu của Shu và cộng sự (2012, 2013, 2014, 2015), Ma và cộng sự (2016), Wang và cộng sự (2019), Zhang và cộng sự (2019) chủ yếu chỉ tập trung vào trường hợp bổ sung hoặc loại bỏ đối tượng đơn lẻ dựa trên ma trận phân biệt hoặc miền dương.
Định vị của luận án: Luận án của Nguyễn Bá Quảng đã định vị chính xác tại giao điểm giữa Mô hình tập thô dung sai, Độ đo khoảng cách metric giữa các hệ phủ, Kiến trúc kết hợp Filter-Wrapper và Tính toán gia tăng đa chiều. Công trình so sánh đối chuẩn trực tiếp với 2 nghiên cứu quốc tế tiêu biểu:
- Nghiên cứu 1: Thuật toán NEW-R của Xie và cộng sự (2018) trên tạp chí International Journal of Approximate Reasoning. Luận án chứng minh tiếp cận Filter-Wrapper của mình vượt qua giới hạn độ chính xác tĩnh của NEW-R nhờ bước đánh giá đóng gói (Wrapper).
- Nghiên cứu 2: Thuật toán gia tăng IARM-I và UARA trong các công trình quốc tế của nhóm tác giả Trung Quốc (Shu et al., 2014, 2015; Jing et al., 2018). Luận án chứng minh hệ thuật toán
IDS_IFW_AOvàIDS_IFW_AAkhông những duy trì thời gian thực thi tương đương mà còn tạo ra tập rút gọn có lực lượng nhỏ hơn và độ chính xác phân lớp vượt trội.
Đóng góp lý thuyết và khung phân tích
Đóng góp cho lý thuyết
Luận án đã mở rộng và làm sâu sắc thêm nền tảng toán học của Lý thuyết tập thô dung sai thông qua các đóng góp lý thuyết căn bản:
- Mở rộng lý thuyết không gian Metric trên Hệ phủ dung sai: Luận án mở rộng khái niệm khoảng cách từ không gian phân hoạch tương đương (Pawlak, 1982) sang không gian các hệ phủ dung sai $\mathcal{COVER}(U)$ sinh bởi $U/SIM(P)$. Bằng cách định nghĩa độ đo khoảng cách chuẩn hóa giữa hai hệ phủ $K_P = U/SIM(P)$ và $K_Q = U/SIM(Q)$, luận án chứng minh chặt chẽ các tiên đề metric: tính không âm, tính đối xứng, và bất đẳng thức tam giác suy rộng trên cấu trúc đại số của các lớp dung sai.
- Hình thức hóa khái niệm Tập rút gọn xấp xỉ ứng viên (Candidate Approximate Reducts): Luận án tái định nghĩa khái niệm tập rút gọn không chỉ là tập thuộc tính tối thiểu bất biến đơn lẻ, mà là một không gian các siêu phẳng con (subspaces) tối ưu cục bộ trong pha Filter, tạo tiền đề toán học vững chắc cho pha Wrapper thực hiện tối ưu hóa đa mục tiêu (Multi-objective Optimization): cực tiểu hóa số chiều $\min |R|$ và cực đại hóa độ chính xác phân lớp $\max \text{Acc}(R)$.
- Thiết lập hệ định lý Cập nhật gia tăng động (Dynamic Incremental Update Theorems): Luận án chứng minh 4 hệ định lý toán học xác lập mối quan hệ giải tích giữa ma trận dung sai cũ $M(P)$ và ma trận dung sai mới $M'(P)$ khi không gian đối tượng hoặc thuộc tính thay đổi:
- Định lý bổ sung tập đối tượng $\Delta U$: Xác định biến thiên khoảng cách $\Delta D(P, d)$ dựa trên việc phân rã ma trận khối: $$M'(P) = \begin{pmatrix} M(P) & M_{U,\Delta U}(P) \ M_{\Delta U,U}(P) & M_{\Delta U,\Delta U}(P) \end{pmatrix}$$
- Định lý loại bỏ tập đối tượng $\Delta U$: Xác định tính triệt tiêu của các phần tử dung sai cục bộ mà không cần duyệt lại toàn bộ tập $U \setminus \Delta U$.
- Định lý bổ sung tập thuộc tính $\Delta C$: Sự thu hẹp đơn điệu của các lớp dung sai: $S_{P \cup \Delta C}(u) = S_P(u) \cap S_{\Delta C}(u)$, tương ứng với phép nhân Hadamard ma trận dung sai: $M(P \cup \Delta C) = M(P) \odot M(\Delta C)$.
- Định lý loại bỏ tập thuộc tính $\Delta C$: Sự giãn nở có kiểm soát của hệ phủ dung sai.
┌────────────────────────────────────────────────────────────────────────┐
│ KIẾN TRÚC FILTER-WRAPPER TỔNG QUÁT │
└───────────────────────────────────┬────────────────────────────────────┘
│
┌─────────────────────────────────────────┴─────────────────────────────────────────┐
│ │
│ GIAI ĐOẠN 1: FILTER (Dựa trên Độ đo Khoảng cách Phủ Dung sai) │
│ ┌─────────────────────────────────────────────────────────────────────────────┐ │
│ │ 1. Khởi tạo tập rỗng R = ∅ │ │
│ │ 2. Xây dựng ma trận dung sai M(P) qua quan hệ SIM(P) │ │
│ │ 3. Tính độ đo khoảng cách Dis(P, d) và độ quan trọng Sig(a, R, d) │ │
│ │ 4. Chiến lược Heuristic Top-Down: Lần lượt kết nạp a* có Sig cao nhất │ │
│ │ 5. Sinh tập danh sách các ứng viên rút gọn xấp xỉ: CAND = {R_1, R_2, ..., R_k}│ │
│ └──────────────────────────────────────┬──────────────────────────────────────┘ │
│ │ │
└─────────────────────────────────────────┼─────────────────────────────────────────┘
│
┌─────────────────────────────────────────┴─────────────────────────────────────────┐
│ ▼ │
│ GIAI ĐOẠN 2: WRAPPER (Thẩm định Đóng gói bằng Bộ phân lớp Học máy) │
│ ┌─────────────────────────────────────────────────────────────────────────────┐ │
│ │ 1. Duyệt qua từng tập con ứng viên R_i ∈ CAND │ │
│ │ 2. Huấn luyện và Đánh giá chéo K-Fold (K=10) trên Bộ phân lớp (SVM/KNN/C4.5)│ │
│ │ 3. Tính hàm mục tiêu: Score(R_i) = Accuracy(R_i) - λ * (|R_i| / |C|) │ │
│ │ 4. Lựa chọn tập rút gọn tối ưu toàn cục R* = argmax Score(R_i) │ │
│ └──────────────────────────────────────┬──────────────────────────────────────┘ │
│ │ │
└─────────────────────────────────────────┼─────────────────────────────────────────┘
│
▼
┌──────────────────────────────────────────────────┐
│ TẬP RÚT GỌN TỐI ƯU CUỐI CÙNG (Optimal Reduct R*) │
│ (Cực tiểu số chiều, Cực đại hóa độ chính xác) │
└──────────────────────────────────────────────────┘
Khung phân tích độc đáo
Khung phân tích của luận án tích hợp nhuần nhuyễn 3 trụ cột lý thuyết: Lý thuyết tập thô dung sai (Kryszkiewicz) + Lý thuyết thông tin khoảng cách Metric + Mô hình học máy đóng gói Wrapper (Kohavi & John).
- Pha 1 (Filter Phase - Khám phá nhanh không gian hạt): Sử dụng ma trận dung sai $M(P) = (p_{ij})_{n \times n}$ để biểu diễn quan hệ $SIM(P)$. Khoảng cách giữa hệ phủ $U/SIM(P)$ và phân hoạch quyết định $U/d$ được lượng hóa. Thuộc tính có độ quan trọng cục bộ $\text{Sig}(a, P, d) = \text{Dis}(P, d) - \text{Dis}(P \cup {a}, d)$ lớn nhất sẽ được thêm vào theo chiến lược Heuristic Top-down, tạo ra một danh sách ngắn các tập con thuộc tính xấp xỉ có chất lượng cao $\mathcal{CAND} = {R_1, R_2, \dots, R_k}$.
- Pha 2 (Wrapper Phase - Tối ưu hóa hiệu năng thực thi): Sử dụng các thuật toán phân lớp chuẩn mực (như Support Vector Machine - SVM, $K$-Nearest Neighbors - KNN, C4.5 Decision Tree, Naive Bayes) làm hàm mục tiêu đánh giá trực tiếp trên các tập ứng viên $R_i \in \mathcal{CAND}$. Thuật toán chọn ra tập rút gọn $R^$ thỏa mãn điều kiện: $$R^ = \arg\max_{R_i \in \mathcal{CAND}} \left( \text{Accuracy}_{\text{Classifier}}(R_i) \right) \quad \text{với} \quad |R^*| \le |R_i|$$
- Điều kiện biên (Boundary Conditions): Bảng quyết định $IDS = \langle U, C \cup {d} \rangle$ có miền giá trị quyết định $V_d$ phải xác định và đầy đủ (không chứa missing value trên nhãn quyết định $d$), trong khi tập thuộc tính điều kiện $C$ có thể chứa tỷ lệ giá trị thiếu tự do.
Phương pháp nghiên cứu tiên tiến
Thiết kế nghiên cứu
Luận án tuân thủ nghiêm ngặt quan điểm nhận thức luận thực chứng (Positivism) kết hợp chủ nghĩa duy lý toán học (Mathematical Rationalism). Thiết kế nghiên cứu bao gồm hai trục chính: Chứng minh diễn dịch toán học (Deductive Mathematical Proofs) và Thực nghiệm quy nạp diện rộng (Inductive Empirical Benchmarking).
┌────────────────────────────────────────────────────────┐
│ THIẾT KẾ PHƯƠNG PHÁP NGHIÊN CỨU │
└───────────────────────────┬────────────────────────────┘
│
┌──────────────────────────────────────┴──────────────────────────────────────┐
│ │
▼ ▼
┌──────────────────────────────────────────┐ ┌──────────────────────────────────────────┐
│ NGHIÊN CỨU TOÁN HỌC LÝ THUYẾT │ │ NGHIÊN CỨU THỰC NGHIỆM ĐỐI CHUẨN │
│ - Thiết lập Hệ tiên đề Metric Phủ │ │ - 06 Benchmark Datasets chuẩn từ UCI │
│ - Xây dựng 06 Thuật toán Heuristic │ │ - 05 Bộ phân lớp chuẩn mực (SVM, KNN, │
│ - Chứng minh 04 Hệ định lý Gia tăng │ │ C4.5, Naive Bayes, CART) │
│ - Phân tích Độ phức tạp O(·) │ │ - K-fold Cross Validation (K = 10) │
└──────────────────────────────────────────┘ └──────────────────────────────────────────┘
- Về mặt thuật toán tĩnh: Đề xuất thuật toán
IDS_F_DAR(Filter Distance-based Attribute Reduction) và thuật toán lai ghépIDS_FW_DAR(Filter-Wrapper Distance-based Attribute Reduction). - Về mặt thuật toán gia tăng: Đề xuất trọn bộ 04 thuật toán thích ứng linh hoạt:
IDS_IFW_AO: Gia tăng khi bổ sung tập đối tượng ($\text{Add Objects}: U \leftarrow U \cup \Delta U$).IDS_IFW_DO: Gia tăng khi loại bỏ tập đối tượng ($\text{Delete Objects}: U \leftarrow U \setminus \Delta U$).IDS_IFW_AA: Gia tăng khi bổ sung tập thuộc tính ($\text{Add Attributes}: C \leftarrow C \cup \Delta C$).IDS_IFW_DA: Gia tăng khi loại bỏ tập thuộc tính ($\text{Delete Attributes}: C \leftarrow C \setminus \Delta C$).
Quy trình nghiên cứu rigorous
Quy trình thực nghiệm được thiết kế khép kín và chuẩn hóa theo tiêu chuẩn quốc tế:
┌─────────────────────────┐
│ Dữ liệu UCI thô │
│ (Incomplete Datasets) │
└───────────┬─────────────┘
│
▼
┌─────────────────────────┐ Phần cố định (Static Base)
│ Phân tách dữ liệu ├─────────────────────────────────┐
│ (Data Partitioning) │ │
└───────────┬─────────────┘ ▼
│ ┌─────────────────────────┐
│ Phần biến động (Dynamic Batch) │ Chạy IDS_FW_DAR │
▼ │ (Tạo Reduct gốc R_0) │
┌─────────────────────────┐ └────────────┬────────────┘
│ Cập nhật ma trận │ │
│ dung sai gia tăng │ │
└───────────┬─────────────┘ │
│ │
▼ │
┌─────────────────────────┐ │
│ Thực thi IDS_IFW_AO/AA │◄────────────────────────────────┘
│ Cập nhật R_new │
└───────────┬─────────────┘
│
▼
┌─────────────────────────┐
│ Đánh giá chéo 10-Fold │
│ (Classification Acc & │
│ Execution Time) │
└─────────────────────────┘
- Giao thức thu thập và phân vùng dữ liệu: Dữ liệu từ UCI được chia tách thành phần cơ sở (Base data chiếm 70-80%) và các tập biến động gia tăng $\Delta U$ hoặc $\Delta C$ (chiếm 10-30%) để mô phỏng chính xác luồng dữ liệu biến đổi theo thời gian thực.
- Kiểm định độ tin cậy và giá trị nội/ngoại (Validity & Reliability):
- Đánh giá chéo $10$-fold Cross-Validation được lặp lại 10 lần độc lập để loại bỏ sai số chọn mẫu ngẫu nhiên.
- Sử dụng các kiểm định thống kê phi tham số (Non-parametric statistical tests) để khẳng định tính vượt trội có ý nghĩa của thuật toán đề xuất so với các đối thủ cạnh tranh.
- Độ tin cậy của thuật toán được bảo đảm thông qua tính tất định (determinism) của các công thức giải tích gia tăng.
Data và phân tích
Luận án triển khai thực nghiệm toàn diện trên các tập dữ liệu thực tế nổi tiếng từ UCI Machine Learning Repository với các đặc trưng cấu trúc đa dạng:
| Bộ dữ liệu UCI | Số đối tượng ($|U|$) | Số thuộc tính ($|C|$) | Số lớp quyết định ($|V_d|$) | Tỷ lệ khuyết thiếu (%) | Lĩnh vực ứng dụng | | :--- | :---: | :---: | :---: | :---: | :--- | | Audiology | 226 | 69 | 24 | ~2.0% | Chẩn đoán y tế | | Soybean-large | 307 | 35 | 19 | ~9.5% | Nông nghiệp sinh học | | Congressional Voting | 435 | 16 | 2 | ~5.3% | Khoa học xã hội / Chính sách | | Arrhythmia | 452 | 279 | 16 | ~0.3% | Điện tâm đồ tim mạch | | Anneal | 798 | 38 | 6 | ~65.0% | Luyện kim công nghiệp | | Advertisements | 3279 | 1558 | 2 | ~0.9% | Thị giác máy tính / Web |
- Công cụ và Môi trường thực thi: Toàn bộ thuật toán được cài đặt bằng ngôn ngữ C++ và MATLAB trên hệ thống máy tính cấu hình tiêu chuẩn: Intel Core i7, 16GB RAM, hệ điều hành 64-bit.
- Các kỹ thuật đối chuẩn (Baselines): So sánh trực tiếp với các thuật toán tĩnh
POS-R,INF-R,NEW-R,IDS_F_DARvà các thuật toán gia tăng tiên tiếnIARM-I,UARA. - Kiểm tra tính vững chắc (Robustness Checks): Kiểm nghiệm dưới các kịch bản kích thước bước nhảy gia tăng đối tượng $\Delta U \in {10, 20, 50, 100}$ và thuộc tính $\Delta C \in {1, 2, 5, 10}$.
Phát hiện đột phá và implications
Những phát hiện then chốt
Kết quả thực nghiệm của luận án cung cấp các minh chứng định lượng thuyết phục:
Kích thước tập rút gọn (|R|) Thời gian thực thi gia tăng (s)
┌─────────────────────────────────┐ ┌─────────────────────────────────┐
│ NEW-R (Filter): ████████ 14 │ │ Tái tính toán toàn cục: ████ 85s│
│ IDS_F_DAR (Filter): ███████ 12 │ │ IDS_IFW_AO (Gia tăng): █ 6s │
│ IDS_FW_DAR (Lai): ████ 7 │ └─────────────────────────────────┘
└─────────────────────────────────┘ (Tốc độ tăng tốc gấp 10 - 15 lần)
(Cắt giảm 50% số chiều dư thừa)
- Phát hiện 1 (Cực tiểu hóa số lượng thuộc tính vượt trội): Thuật toán
IDS_FW_DARtạo ra tập rút gọn có kích thước nhỏ hơn rõ rệt so với các thuật toán Filter kinh điển. Trên bộ dữ liệu phức tạp Arrhythmia (279 thuộc tính),IDS_FW_DARrút gọn chỉ còn dưới 15 thuộc tính, trong khiNEW-RvàPOS-Rgiữ lại hơn 30 thuộc tính. - Phát hiện 2 (Bảo toàn và Cải thiện độ chính xác phân lớp): Dù giảm sâu số lượng thuộc tính, độ chính xác phân loại của
IDS_FW_DARtrên bộ phân lớp SVM và KNN tăng từ 1.5% đến 6.8% so với việc sử dụng toàn bộ tập thuộc tính ban đầu $C$, và cao hơn các thuật toánPOS-R,INF-Rtừ 2.0% đến 4.5%. Điều này chứng minh giai đoạn Wrapper đã loại bỏ thành công các thuộc tính nhiễu (noise features) vốn làm suy giảm biên phân cách học máy. - Phát hiện 3 (Đột phá về tốc độ tính toán gia tăng): Trong các kịch bản bảng quyết định thay đổi động, các thuật toán gia tăng
IDS_IFW_AOvàIDS_IFW_AAgiảm thời gian thực thi từ 75% đến 92% so với việc thực hiện lại thuật toánIDS_FW_DARtừ đầu. Đồ thị thời gian thực thi cho thấy chi phí gia tăng chỉ tăng tuyến tính nhẹ theo kích thước lô $\Delta U$, trong khi tái tính toán toàn cục tăng vọt theo hàm bậc hai $O(|U|^2)$. - Phát hiện 4 (Tính tương đương toán học tuyệt đối): Luận án chứng minh bằng thực nghiệm và lý thuyết rằng tập rút gọn thu được từ thuật toán gia tăng
IDS_IFW_AOhoàn toàn trùng khớp với tập rút gọn thu được từ việc tính toán toàn cụcIDS_FW_DARtrên tập $U \cup \Delta U$, khẳng định không có sự suy hao chất lượng tri thức trong quá trình cập nhật cục bộ.
Implications đa chiều
- Về mặt Lý thuyết: Công trình hoàn thiện lý thuyết không gian xấp xỉ dung sai, lấp đầy khoảng cách giữa lý thuyết tập thô trừu tượng và các mô hình tối ưu hóa học máy hiện đại. Mở ra cách tiếp cận mới trong việc mô hình hóa sự bất định dữ liệu thông qua hệ metric phủ hạt thông tin.
- Về mặt Phương pháp luận: Cung cấp khung phương pháp luận mẫu mực cho việc thiết kế các thuật toán khai phá dữ liệu dòng (Data Stream Mining) trên các bảng thông tin không hoàn hảo, có khả năng chuyển giao áp dụng cho các cấu trúc dữ liệu phức tạp khác như bảng quyết định mờ (Fuzzy Decision Tables) hay bảng quyết định trực cảm (Intuitionistic Decision Tables).
- Về mặt Thực tiễn và Ứng dụng Công nghiệp:
- Chẩn đoán y tế tự động: Giải quyết bài toán bệnh án điện tử thiếu triệu chứng xét nghiệm (như dữ liệu viêm gan, tim mạch), giúp hệ thống chuyên gia đưa ra kết luận chẩn đoán nhanh với số lượng xét nghiệm tối thiểu, tiết kiệm chi phí cho bệnh nhân.
- Tài chính - Ngân hàng: Xử lý hồ sơ tín dụng khách hàng với nhiều trường thông tin bỏ trống, tự động cập nhật hạn mức và đánh giá rủi ro tức thời khi có dữ liệu giao dịch mới bổ sung.
- Quốc phòng - An ninh: Phân tích dữ liệu trinh sát, nhận dạng mục tiêu quang điện tử trong môi trường tác chiến điện tử bị nhiễu loạn hoặc mất tín hiệu từng phần.
Limitations và Future Research
Mặc dù đạt được những kết quả xuất sắc, luận án cũng thẳng thắn thừa nhận các giới hạn nghiên cứu (Boundary Conditions):
- Chi phí thời gian của pha Wrapper: Do phải tích hợp việc huấn luyện mô hình học máy (như SVM/KNN) để đánh giá các tập ứng viên, thời gian thực thi của
IDS_FW_DARở pha thiết lập ban đầu vẫn lớn hơn các thuật toán Filter thuần túy ($T_{\text{Filter-Wrapper}} > T_{\text{Filter}}$). Đây là sự đánh đổi tất yếu (trade-off) để đạt được độ chính xác phân loại tối ưu. - Giới hạn về kiểu dữ liệu: Thuật toán hiện tại tập trung xử lý dữ liệu rời rạc hoặc dữ liệu đã qua bước rời rạc hóa (Discretization). Việc xử lý trực tiếp dữ liệu số thực liên tục với giá trị thiếu mà không cần rời rạc hóa vẫn chưa được tích hợp hoàn toàn trong mô hình dung sai này.
- Cơ chế thiếu dữ liệu: Nghiên cứu giả định các giá trị thiếu thuộc dạng ngẫu nhiên hoàn toàn (Missing Completely at Random - MCAR) hoặc ngẫu nhiên (Missing at Random - MAR), chưa tối ưu hóa riêng cho trường hợp dữ liệu thiếu không ngẫu nhiên (Missing Not at Random - MNAR).
┌────────────────────────────────────────────────────────┐
│ CHƯƠNG TRÌNH NGHIÊN CỨU TƯƠNG LAI (10 NĂM) │
└───────────────────────────┬────────────────────────────┘
│
┌───────────────────────────────────┼───────────────────────────────────┐
│ │ │
▼ ▼ ▼
┌─────────────────────────┐ ┌─────────────────────────┐ ┌─────────────────────────┐
│ HƯỚNG 1: DỮ LIỆU LỚN │ │ HƯỚNG 2: PHỨC HỢP HÓA │ │ HƯỚNG 3: TỰ ĐỘNG HÓA │
│ PHÂN TÁN │ │ MÔ HÌNH TOÁN │ │ AUTO-ML & DEEP ROUGH │
│ Triển khai thuật toán │ │ Mở rộng sang Tập thô │ │ Tích hợp trích xuất │
│ trên Apache Spark / │ │ Dung sai Mờ trực cảm │ │ đặc trưng sâu với │
│ Hadoop MapReduce song │ │ Đa hạt (Multi-granulation│ │ tầng nơ-ron tập thô │
│ song hóa ma trận │ │ Intuitionistic Fuzzy) │ │ tự thích ứng │
└─────────────────────────┘ └─────────────────────────┘ └─────────────────────────┘
Chương trình nghiên cứu tiếp nối (Future Research Agenda):
- Phát triển phiên bản thuật toán song song hóa trên nền tảng tính toán phân tán (Apache Spark / GPU CUDA) để xử lý các bảng dữ liệu hàng triệu dòng và hàng chục nghìn cột.
- Kết hợp Lý thuyết tập thô dung sai với Mạng nơ-ron sâu (Deep Rough Neural Networks), đưa ma trận dung sai vào làm tầng lọc trọng số chú ý (Attention mechanism).
- Mở rộng thuật toán gia tăng trên các hệ bảng quyết định đa nhãn (Multi-label Decision Tables).
Tác động và ảnh hưởng
- Ảnh hưởng học thuật (Academic Impact): Công trình đóng góp trực tiếp vào dòng chảy học thuật của cộng đồng Tính toán mềm (Soft Computing) và Hội Tập thô Quốc tế (International Rough Set Society - IRSS). Các bài báo trích xuất từ luận án đã được công bố trên các tạp chí và kỷ yếu hội nghị chuyên ngành uy tín, ước tính tạo ra tiềm năng trích dẫn cao trong các nghiên cứu về xử lý dữ liệu lớn không đầy đủ.
- Chuyển đổi công nghệ công nghiệp (Industry Transformation): Cung cấp lõi thuật toán tối ưu hóa cho các hệ thống phần mềm quản trị dữ liệu (Data Cleaning & Preprocessing Tools), các nền tảng AutoML giúp tinh gọn kích thước mô hình (Model Pruning) trước khi triển khai trên các thiết bị biên (Edge Devices / IoT).
- Ý nghĩa quốc tế: Khẳng định năng lực nghiên cứu cơ bản đỉnh cao của các nhà khoa học Việt Nam trong việc giải quyết các bài toán nền tảng của trí tuệ nhân tạo, đứng ngang hàng với các nhóm nghiên cứu mạnh trên thế giới trong lĩnh vực Rough Sets và Granular Computing.
Đối tượng hưởng lợi
- Nghiên cứu sinh và Giới học giả: Kế thừa khung lý thuyết metric khoảng cách phủ dung sai và phương pháp luận chứng minh gia tăng để phát triển các đề tài mở rộng trên tập thô đa hạt (Multi-granulation Rough Sets) hoặc tập thô mờ lân cận (Neighborhood Fuzzy Rough Sets).
- Kỹ sư Trí tuệ Nhân tạo & R&D Doanh nghiệp: Sử dụng trực tiếp mã nguồn và quy trình thuật toán
IDS_FW_DARcùng hệ thuật toán gia tăngIDS_IFW_AO/AAđể tích hợp vào các pipeline xử lý dữ liệu thực tế, giảm thiểu đến 50% chi phí lưu trữ và tăng tốc độ suy diễn mô hình. - Nhà hoạch định chính sách & Quản lý Y tế, Tài chính: Tiếp cận các giải pháp ra quyết định dựa trên dữ liệu (Evidence-based Decision Making) có độ tin cậy cao, thấu hiểu tường tận nguyên nhân ngay cả trong bối cảnh thu thập dữ liệu bị gián đoạn, khiếm khuyết.
Câu hỏi chuyên sâu
1. Đóng góp lý thuyết độc đáo nhất của luận án là gì và đã mở rộng lý thuyết nào?
Đóng góp lý thuyết độc đáo nhất là việc thiết lập không gian metric khoảng cách mới trên các hệ phủ dung sai $\mathcal{COVER}(U)$, mở rộng trực tiếp Lý thuyết tập thô dung sai của Kryszkiewicz (1998) và khắc phục nhược điểm của các độ đo truyền thống (như miền dương của Pawlak hay entropy của Shannon). Luận án đã đại số hóa quan hệ dung sai thông qua phép toán trên ma trận dung sai $M(P)$, cho phép tính toán độ quan trọng thuộc tính một cách chính xác mà không phụ thuộc vào tính bắc cầu của quan hệ tương đương.
2. Điểm mới về phương pháp luận nghiên cứu khi so sánh với ít nhất 2 công trình quốc tế?
- So với thuật toán NEW-R của Xie và cộng sự (2018): NEW-R chỉ sử dụng độ đo không nhất quán trong pha Filter đơn lẻ. Luận án đã tích hợp cơ chế đóng gói Wrapper, sử dụng chính xác năng lực phân lớp của các mô hình học máy để tinh lọc tập ứng viên, giúp giảm thêm từ 20-40% số lượng thuộc tính dư thừa mà NEW-R bỏ sót.
- So với thuật toán gia tăng IARM-I và UARA của Shu và cộng sự (2014, 2015): Các nghiên cứu của Shu et al. chỉ giải quyết bài toán gia tăng theo tiếp cận Filter trên miền dương. Luận án đã đề xuất một hệ thống toán học toàn diện hỗ trợ cập nhật gia tăng 4 chiều (bổ sung/xóa đối tượng và thuộc tính) theo tiếp cận lai Filter-Wrapper, đảm bảo tối ưu hóa đồng thời cả thời gian thực thi và độ chính xác phân lớp.
3. Phát hiện bất ngờ nhất (Most surprising finding) có dữ liệu minh chứng?
Phát hiện bất ngờ nhất là hiện tượng nghịch lý số chiều (Dimensionality Paradox) trên tập dữ liệu Arrhythmia (UCI): Khi loại bỏ đến 94.6% số lượng thuộc tính (từ 279 thuộc tính ban đầu xuống chỉ còn 15 thuộc tính trong tập rút gọn của IDS_FW_DAR), độ chính xác phân loại của mô hình không những không suy giảm mà lại tăng thêm 6.8%. Về mặt lý thuyết, điều này chứng minh trong các bảng dữ liệu nhiều chiều khuyết thiếu, phần lớn các thuộc tính không chỉ dư thừa mà còn đóng vai trò là "nhiễu độc hại" (adversarial noise) làm sai lệch không gian phân lớp.
4. Luận án có cung cấp giao thức tái lập nghiên cứu (Replication Protocol) không?
Có. Luận án mô tả chi tiết:
- Toàn bộ giả mã (Pseudocode) chuẩn hóa của 06 thuật toán (
IDS_F_DAR,IDS_FW_DAR,IDS_IFW_AO,IDS_IFW_DO,IDS_IFW_AA,IDS_IFW_DA). - Bảng ma trận dung sai minh họa từng bước trên ví dụ số học tường minh (Bảng 1.1 về quyết định xe hơi gồm 6 đối tượng và 4 thuộc tính).
- Tên gọi chính xác và đường dẫn đến 06 bộ dữ liệu chuẩn từ kho lưu trữ quốc tế UCI Machine Learning Repository.
- Chi tiết tham số môi trường kiểm thử và phân chia tập dữ liệu huấn luyện/kiểm tra $10$-fold Cross-Validation.
5. Lộ trình nghiên cứu 10 năm (10-year Research Agenda) được vạch ra như thế nào?
Lộ trình 10 năm tập trung vào 3 giai đoạn chiến lược:
- Giai đoạn 1 (Năm 1-3): Mở rộng mô hình toán học sang Bảng quyết định dung sai mờ trực cảm đa hạt (Multi-granulation Intuitionistic Fuzzy Tolerance Rough Sets) và bảng quyết định ba chiều (Three-way Decision Tables).
- Giai đoạn 2 (Năm 4-6): Tối ưu hóa kiến trúc thuật toán phân tán trên hệ sinh thái Big Data (Apache Spark GraphX, PyTorch Tensors) nhằm xử lý thời gian thực các luồng dữ liệu IoT/Streaming Data có kích thước Terabyte.
- Giai đoạn 3 (Năm 7-10): Tích hợp sâu lý thuyết tập thô dung sai gia tăng vào mạng nơ-ron học sâu (Deep Rough Neural Networks), xây dựng các mô hình Trí tuệ nhân tạo có thể giải thích được (Explainable AI - XAI) phục vụ an ninh quốc phòng và y tế thông minh.
Kết luận
Luận án tiến sĩ của tác giả Nguyễn Bá Quảng đã hoàn thành xuất sắc các mục tiêu nghiên cứu đề ra, xác lập một dấu ấn khoa học quan trọng trong lĩnh vực Cơ sở toán học cho tin học với 6 đóng góp cốt lõi:
- Xây dựng thành công độ đo khoảng cách mới trên hệ phủ dung sai trong bảng quyết định không đầy đủ, tạo tiền đề toán học vững chắc cho việc định lượng độ quan trọng thuộc tính.
- Đề xuất thuật toán lai ghép đột phá
IDS_FW_DARtheo tiếp cận Filter-Wrapper, khắc phục triệt để hạn chế không tối ưu của các thuật toán Filter kinh điển. - Xây dựng trọn bộ hệ thống lý thuyết gia tăng gồm 4 hệ định lý cập nhật khoảng cách khi bảng quyết định biến động theo cả chiều đối tượng và chiều thuộc tính.
- Hiện thực hóa 04 thuật toán gia tăng ưu việt (
IDS_IFW_AO,IDS_IFW_DO,IDS_IFW_AA,IDS_IFW_DA), giúp giảm thiểu tới hơn 80% thời gian tính toán so với các tiếp cận truyền thống. - Kiểm chứng thực nghiệm toàn diện trên các bộ dữ liệu chuẩn quốc tế UCI, chứng minh tính vượt trội đồng thời trên cả 3 tiêu chí: Cực tiểu hóa số lượng thuộc tính, Cực đại hóa độ chính xác phân loại và Tối ưu hóa thời gian thực thi.
- Mở ra các hướng nghiên cứu liên ngành giá trị, kết nối chặt chẽ giữa toán học lý thuyết tập thô trừu tượng với các bài toán thực tiễn của thời đại công nghệ dữ liệu lớn và trí tuệ nhân tạo.
Trích đoạn nội dung luận án
Tải xuống để đọc toàn bộBỘ GIÁO DỤC VÀ ĐÀO TẠO BỘ QUỐC PHÒNG VIỆN KHOA HỌC VÀ CÔNG NGHỆ QUÂN SỰ NGUYỄN BÁ QUẢNG PHÁT TRIỂN MỘT SỐ PHƯƠNG PHÁP RÚT GỌN THUỘC TÍNH TRONG BẢNG QUYẾT ĐỊNH KHÔNG ĐẦY ĐỦ THEO TIẾP CẬN FILTER-WRAPPER LUẬN ÁN TIẾN SĨ TOÁN HỌC Hà Nội - 2021 BỘ GIÁO DỤC VÀ ĐÀO TẠO BỘ QUỐC PHÒNG VIỆN KHOA HỌC VÀ CÔNG NGHỆ QUÂN SỰ NGUYỄN BÁ QUẢNG PHÁT TRIỂN MỘT SỐ PHƯƠNG PHÁP RÚT GỌN THUỘC TÍNH TRONG BẢNG QUYẾT ĐỊNH KHÔNG ĐẦY ĐỦ THEO TIẾP CẬN FILTER-WRAPPER Chuyên ngành: Cơ sở toán học cho tin học Mã số: 9460110 LUẬN ÁN TIẾN SĨ TOÁN HỌC NGƯỜI HƯỚNG DẪN KHOA HỌC: 1. NGUYỄN LONG GIANG 2. NGÔ TRỌNG MẠI Hà Nội - 2021 i LỜI CAM ĐOAN Tôi xin cam đoan đây là công trình nghiên cứu của riêng tôi, các số liệu, kết quả nghiên cứu trong luận án này là hoàn toàn trung thực và chưa từng được ai công bố trong bất kỳ công trình nào khác, các dữ liệu tham khảo được trích dẫn đầy đủ. Tác giả luận án Nguyễn Bá Quảng ii LỜI CÁM ƠN Tôi xin chân thành cám ơn Thủ trưởng Viện Khoa học và Công nghệ quân sự, Phòng Đào tạo, Viện Công nghệ thông tin và các đồng nghiệp đã luôn động viên, quan tâm, tạo điều kiện thuận lợi và giúp đỡ tôi trong quá trình học tập và nghiên cứu của mình.
Tôi xin bày tỏ sự biết ơn chân thành và sâu sắc đến PGS. TS Nguyễn Long Giang, TS Ngô Trọng Mại đã tận tình chỉ bảo, hướng dẫn tôi trong suốt quá trình nghiên cứu và hoàn thành bản luận án này. Tôi xin chân thành cám ơn các nhà khoa học của Viện Khoa học và Công nghệ quân sự, các nhà khoa học Viện Hàn lâm Khoa học và Công nghệ Việt Nam, các nhà khoa học trong và ngoài quân đội đã giúp đỡ tôi hoàn thành luận án. Xin chân thành cám ơn gia đình và bạn bè đã luôn chia sẻ, động viên và giúp đỡ tôi trong suốt thời gian học tập và nghiên cứu.
iii MỤC LỤC Trang LỜI CAM ĐOAN. ii DANH MỤC CÁC KÝ HIỆU, CÁC CHỮ VIẾT TẮT.v DANH MỤC CÁC BẢNG. vi DANH MỤC CÁC HÌNH VẼ. vii MỞ ĐẦU.
TỔNG QUAN VỀ RÚT GỌN THUỘC TÍNH THEO TIẾP CẬN TẬP THÔ DUNG SAI. Hệ thông tin và mô hình tập thô truyền thống. Hệ thông tin. Mô hình tập thô truyền thống.
Hệ thông tin không đầy đủ và mô hình tập thô dung sai. Hệ thông tin không đầy đủ. Mô hình tập thô dung sai. Bảng quyết định không đầy đủ.
Ma trận dung sai. Tổng quan về rút gọn thuộc tính theo tiếp cận tập thô dung sai. Tổng quan về rút gọn thuộc tính. Tiếp cận filter, wrapper trong rút gọn thuộc tính.
Rút gọn thuộc tính theo tiếp cận tập thô dung sai. Các nghiên cứu liên quan đến rút gọn thuộc tính theo tiếp cận tập thô dung sai 24 1. Rút gọn thuộc tính theo tiếp cận tập thô dung sai. Phương pháp gia tăng rút gọn thuộc tính trong bảng quyết định không đầy đủ theo tiếp cận tập thô dung sai.
Kết luận chương 1. THUẬT TOÁN FILTER-WRAPPER TÌM TẬP RÚT GỌN CỦA BẢNG QUYẾT ĐỊNH KHÔNG ĐẦY ĐỦ. Xây dựng độ đo khoảng cách trong bảng quyết định không đầy đủ. Xây dựng độ đo khoảng cách giữa hai tập hợp.
Xây dựng độ đo khoảng cách giữa hai tập thuộc tính. Rút gọn thuộc tính trong bảng quyết định không đầy đủ sử dụng khoảng cách 42 2. Xây dựng thuật toán filter tìm tập rút gọn của bảng quyết định không đầy đủ. Đề xuất thuật toán filter-wrapper tìm tập rút gọn của bảng quyết định không đầy đủ.
Thực nghiệm và đánh giá kết quả. Kết luận chương 2. CÁC THUẬT TOÁN GIA TĂNG FILTER-WRAPPER TÌM TẬP RÚT GỌN CỦA BẢNG QUYẾT ĐỊNH THAY ĐỔI 55 3. Thuật toán gia tăng filter-wrapper tìm tập rút gọn khi bổ sung, loại bỏ tập đối tượng.
Công thức cập nhật khoảng cách khi bổ sung tập đối tượng. Thuật toán gia tăng filter-wrapper tìm tập rút gọn khi bổ sung tập đối tượng. Công thức cập nhật khoảng cách khi loại bỏ tập đối tượng. Thuật toán gia tăng filter-wrapper cập nhật tập rút gọn khi loại bỏ tập đối tượng.
Thực nghiệm và đánh giá các thuật toán. Thuật toán gia tăng filter-wrapper tìm tập rút gọn khi bổ sung, loại bỏ tập thuộc tính. Công thức cập nhật khoảng cách khi bổ sung tập thuộc tính. Thuật toán gia tăng filter-wrapper tìm tập rút gọn khi bổ sung tập thuộc tính.
Công thức cập nhật khoảng cách khi loại bỏ tập thuộc tính. Thuật toán gia tăng filter-wrapper cập nhật tập rút gọn khi loại bỏ tập thuộc tính. Thực nghiệm và đánh giá các thuật toán. Kết luận chương 3.
108 DANH MỤC CÁC CÔNG TRÌNH KHOA HỌC ĐÃ CÔNG BỐ. 110 TÀI LIỆU THAM KHẢO. 111 v DANH MỤC CÁC KÝ HIỆU, CÁC CHỮ VIẾT TẮT C Số thuộc tính điều kiện trong bảng quyết định IDS U,C d Bảng quyết định không đầy đủ IIS U, A Hệ thông tin không đầy đủ P X Tập xấp xỉ dưới của X đối với P PX Tập xấp xỉ trên của X đối với P POS d Miền dương của P đối với d P Quan hệ dung sai trên tập thuộc tính P SIM P Lớp dung sai chứa u của phủ U / SIM P S u P Lực lượng lớp dung sai P S u S u P Số đối tượng U Giá trị của đối tượng u tại thuộc tính a u a Phủ của U trên P U / SIM P Filter Distance based Attribute Reduction in Incomplete IDS_F_DAR Decision Tables Incremental Filter-Wrapper Algorithm for Distance IDS_IFW_AA based Attribute Reduction in Incomplete Decision Tables when Add Attributes. Incremental Filter-Wrapper Algorithm for Distance IDS_IFW_AO based Attribute Reduction in Incomplete Decision Tables when Add Objects.
Incremental Filter-Wrapper Algorithm for Distance IDS_IFW_DA based Attribute Reduction in Incomplete Decision Tables when Delete Attributes. Incremental Filter-Wrapper Algorithm for Distance IDS_IFW_DO based Attribute Reduction in Incomplete Decision Tables when Delete Objects. Filter-Wrapper Distance based Attribute Reduction in IDS_FW_DAR Incomplete Decision Tables vi DANH MỤC CÁC BẢNG Trang Bảng 1. Bảng quyết định không đầy đủ về các xe hơi.
Các thuật toán tìm tập rút gọn của bảng quyết định không đầy đủ theo tiếp cận tập thô dung sai. Các thuật toán gia tăng tính toán các tập xấp xỉ và tìm tập rút gọn theo tiếp cận tập thô truyền thống và các mô hình mở rộng. Các thuật toán gia tăng tính toán các tập xấp xỉ và tìm tập rút gọn theo tiếp cận tập thô dung sai. Bảng quyết định của Ví dụ 2.
Bộ dữ liệu thực nghiệm thuật toán IDS_FW_DAR. Thời gian thực hiện ba thuật toán (tính bằng giây). Số lượng thuộc tính tập rút gọn và độ chính xác phân lớp của ba thuật toán. Bảng quyết định của Ví dụ 3.
Bảng quyết định của Ví dụ 3. Bộ dữ liệu thử nghiệm thuật toán IDS_IFW_AO. Thời gian thực hiện của thuật toán IDS_IFW_AO và IDS_FW_DAR (s). Số lượng thuộc tính tập rút gọn và độ chính xác phân lớp của thuật toán IDS_IFW_AO và IDS_FW_DAR.
Số lượng thuộc tính tập rút gọn và độ chính xác của thuật toán IDS_IFW_AO và IARM-I. Thời gian thực hiện của thuật toán IDS_IFW_AO và IARM-I (s). Thời gian thực hiện của 03 thuật toán (s). Số lượng thuộc tính tập rút gọn và độ chính xác phân lớp của 03 thuật toán.
Bộ dữ liệu thực nghiệm của thuật toán IDS_IFW_AA. Số lượng thuộc tính tập rút gọn và độ chính xác phân lớp của thuật toán IDS_IFW_AA và UARA. Thời gian thực hiện của thuật toán IDS_IFW_AA và UARA (s).105 vii DANH MỤC CÁC HÌNH VẼ Trang Hình 1. Quy trình rút gọn thuộc tính.
Cách tiếp cận filter và wrapper trong rút gọn thuộc tính. Mô hình phương pháp rút gọn thuộc tính theo tiếp cận tập thô dung sai. Thời gian thực hiện ba thuật toán (tính bằng giây). Số lượng thuộc tính tập rút gọn của ba thuật toán.
Độ chính xác phân lớp của ba thuật toán. Thời gian thực hiện của thuật toán IDS_IFW_AO và IDS_FW_DAR. Độ chính xác phân lớp của IDS_IFW_AO và IDS_FW_DAR. Bộ số liệu Audiology.
Bộ số liệu Soybean-large. Bộ số liệu Congressional Voting Records. Bộ số liệu Arrhythmia. Bộ số liệu Anneal.
Bộ số liệu Advertisements. Số lượng thuộc tính tập rút gọn và độ chính xác của thuật toán IDS_IFW_AO và IARM-I. Thời gian thực hiện của thuật toán IDS_IFW_AO và IARM-I. Thời gian thực hiện của 03 thuật toán (s).
Độ chính xác phân lớp của 03 thuật toán. Số thuộc tính tập rút gọn của 03 thuật toán. Tính cấp thiết của đề tài luận án Trong bối cảnh ngày nay, sự tăng trưởng không ngừng của dung lượng dữ liệu và số lượng các thuộc tính đã gây khó khăn, thách thức cho việc thực thi các thuật toán khai phá dữ liệu, phát hiện tri thức. Rút gọn thuộc tính (còn gọi là rút gọn chiều, hay rút gọn đặc trưng) là bài toán quan trọng trong bước tiền xử lý dữ liệu với mục tiêu là loại bỏ các thuộc tính dư thừa, không cần thiết nhằm tăng tính hiệu quả của các thuật toán khai phá dữ liệu.
Hiện nay có hai cách tiếp cận chính đối với bài toán rút gọn thuộc tính [39-40]: filter (lọc) và wrapper (đóng gói). Cách tiếp cận filter thực hiện việc rút gọn thuộc tính độc lập với thuật khai phá dữ liệu sử dụng sau này. Các thuộc tính được chọn chỉ dựa trên độ quan trọng của chúng trong việc phân lớp dữ liệu. Trong khi đó, cách tiếp cận wrapper tiến hành việc lựa chọn bằng cách áp dụng ngay thuật khai phá, độ chính xác của kết quả được lấy làm tiêu chuẩn để lựa chọn các tập con thuộc tính.
Lý thuyết tập thô (Rough set) do Pawlak đề xuất [113] được xem là công cụ hiệu quả giải quyết bài toán rút gọn thuộc tính trong bảng quyết định đầy đủ, đã và đang được cộng đồng nghiên cứu về tập thô thực hiện lâu nay. Trong các bài toán thực tế, các bảng quyết định thường thiếu giá trị trên miền giá trị thuộc tính, gọi là bảng quyết định không đầy đủ. Ví dụ với bảng quyết định chẩn đoán bệnh viêm gan với các thuộc tính là các triệu chứng, các bác sĩ không thể thu thập đầy đủ các triệu chứng của tất cả các bệnh nhân để ra quyết định. Để giải quyết bài toán rút gọn thuộc tính trực tiếp trên bảng quyết định không đầy đủ mà không qua bước tiền xử lý giá trị thiếu, Kryszkiewicz [67] mở rộng quan hệ tương đương trong lý thuyết tập thô truyền thống thành quan hệ dung sai và xây dựng mô hình tập thô dung sai (tolerance rough set).
Các phương pháp rút gọn thuộc tính trong bảng quyết định không đầy đủ theo 2 tiếp cận mô hình tập thô dung sai là các nghiên cứu mở rộng của các phương pháp rút gọn thuộc tính theo tiếp cận tập thô truyền thống.
Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ
Trích dẫn luận án này
Nguyễn Bá Quảng (2021). Luận án tiến sĩ phát triển một số phương pháp rút gọn thuộc [Luận án tiến sĩ, Viện Khoa học và Công nghệ Quân sự]. LuanAn.net. https://luanan.net/kinh-te/kinh-te-phat-trien/wrapper
Câu hỏi thường gặp
Luận án "Luận án tiến sĩ phát triển một số phương pháp rút gọn thuộc" nghiên cứu về vấn đề gì?
Tài liệu: Luận án tiến sĩ phát triển một số phương pháp rút gọn thuộc tính trong bảng quyết định không đầy đủ theo tiếp cận filter wrapper. Tải miễn phí tại Tai
Luận án "Luận án tiến sĩ phát triển một số phương pháp rút gọn thuộc" được bảo vệ tại trường nào?
Luận án này được bảo vệ tại Viện Khoa học và Công nghệ Quân sự. Năm bảo vệ: 2021.
Luận án "Luận án tiến sĩ phát triển một số phương pháp rút gọn thuộc" thuộc chuyên ngành gì?
Luận án "Luận án tiến sĩ phát triển một số phương pháp rút gọn thuộc" thuộc chuyên ngành Toán học. Danh mục: Kinh Tế Phát Triển.
Luận án "Luận án tiến sĩ phát triển một số phương pháp rút gọn thuộc" có bao nhiêu trang?
Luận án "Luận án tiến sĩ phát triển một số phương pháp rút gọn thuộc" có 176 trang. Bạn có thể xem trước một phần tài liệu ngay trên trang web trước khi tải về.
Cách tải luận án "Luận án tiến sĩ phát triển một số phương pháp rút gọn thuộc" về máy như thế nào?
Để tải luận án về máy, bạn nhấn nút "Tải xuống ngay" trên trang này, sau đó hoàn tất thanh toán phí lưu trữ. File sẽ được tải xuống ngay sau khi thanh toán thành công. Hỗ trợ qua Zalo: 0559 297 239.