Luận án TS: Giảm chiều dữ liệu và ứng dụng phân lớp bệnh nhân - Giang Thành Trung
Luận án TS Hệ thống thông tin nghiên cứu các phương pháp giảm chiều dữ liệu hiệu quả. Ứng dụng thực tiễn trong bài toán phân lớp bệnh nhân.
Số trang
134
Thời gian đọc
21 phút
Lượt xem
0
Lượt tải
0
Phí lưu trữ
40 Point
Tổng quan nhanh
- Chủ đề:
- 1. Nghiên cứu giảm chiều dữ liệu: Phân lớp bệnh nhân
- Số trang:
- 134 trang
- Trường:
- Trường Đại học Công nghệ, Đại học Quốc gia Hà Nội
- Chuyên ngành:
- Hệ thống thông tin
- Tác giả:
- Giang Thành Trung
Tóm tắt nội dung luận án
I. Nghiên cứu giảm chiều dữ liệu Phân lớp bệnh nhân
Dữ liệu y tế ngày càng tăng về khối lượng và số chiều. Sự phức tạp này đặt ra nhiều thách thức cho việc phân tích và trích xuất thông tin hữu ích. Giảm chiều dữ liệu trở thành một bước tiền xử lý thiết yếu. Nó giúp đơn giản hóa dữ liệu, giảm nhiễu và cải thiện hiệu suất của các mô hình học máy. Đặc biệt, trong bài toán phân lớp bệnh nhân, giảm chiều dữ liệu đóng vai trò quan trọng. Nó hỗ trợ chẩn đoán chính xác hơn, giúp phân loại bệnh nhân vào các nhóm cụ thể. Nghiên cứu này tập trung vào phát triển các phương pháp giảm chiều dữ liệu tiên tiến. Mục tiêu là ứng dụng chúng vào các bài toán phân lớp bệnh nhân, từ đó nâng cao độ tin cậy và hiệu quả trong y học.
1.1. Tầm quan trọng giảm chiều dữ liệu y sinh
Dữ liệu y sinh thường có số lượng lớn các đặc trưng. Điều này gây khó khăn cho việc lưu trữ, xử lý và phân tích. Giảm chiều dữ liệu giúp giải quyết vấn đề này. Nó loại bỏ các đặc trưng dư thừa hoặc không liên quan. Điều này giảm gánh nặng tính toán. Đồng thời, nó cải thiện khả năng tổng quát hóa của mô hình. Trong y tế, dữ liệu từ hình ảnh cộng hưởng từ (MRI), biểu hiện gen có thể lên tới hàng nghìn chiều. Việc giảm chiều giúp trích xuất các thông tin cốt lõi. Nó bảo toàn cấu trúc dữ liệu quan trọng cho việc phân loại bệnh nhân. Đây là bước cần thiết cho machine learning y tế.
1.2. Mục tiêu nghiên cứu và đóng góp khoa học
Mục tiêu chính của nghiên cứu là phát triển và đánh giá các phương pháp giảm chiều dữ liệu mới. Các phương pháp này được ứng dụng vào bài toán phân lớp bệnh nhân. Nghiên cứu tập trung vào việc cải thiện độ chính xác và tốc độ phân lớp. Nó tìm cách giải quyết vấn đề 'lời nguyền của số chiều'. Đóng góp khoa học bao gồm việc đề xuất các thuật toán giảm chiều mạnh mẽ hơn. Các thuật toán này đặc biệt phù hợp với đặc thù dữ liệu y sinh. Nó bao gồm việc tích hợp các kỹ thuật hiện đại. Kết quả mang lại kiến thức mới về cách tối ưu hóa phân loại bệnh nhân. Điều này có ý nghĩa thực tiễn trong học máy trong y khoa.
II. Các phương pháp giảm chiều dữ liệu hiệu quả trong y tế
Lĩnh vực giảm chiều dữ liệu bao gồm nhiều kỹ thuật khác nhau. Mỗi kỹ thuật có ưu và nhược điểm riêng. Việc lựa chọn phương pháp phù hợp phụ thuộc vào loại dữ liệu và mục tiêu cụ thể. Trong bối cảnh y tế, các phương pháp cần có khả năng xử lý dữ liệu nhiễu và ngoại lai. Chúng cũng cần duy trì thông tin phân biệt quan trọng. Các phương pháp có thể được chia thành hai nhóm chính: lựa chọn đặc trưng (feature selection) và trích chọn đặc trưng (feature extraction). Cả hai nhóm đều đóng vai trò quan trọng trong việc chuẩn bị dữ liệu cho các mô hình phân lớp bệnh nhân. Nghiên cứu khám phá các phương pháp tiên tiến hơn, bao gồm cả kỹ thuật học đa hàm nhân.
2.1. Lựa chọn đặc trưng và trích chọn đặc trưng
Lựa chọn đặc trưng (feature selection y tế) là quá trình chọn một tập hợp con các đặc trưng gốc. Nó loại bỏ các đặc trưng ít liên quan hoặc dư thừa. Ưu điểm của nó là giữ nguyên ý nghĩa của các đặc trưng, dễ diễn giải kết quả. Các phương pháp bao gồm lọc (filter), bao gói (wrapper) và nhúng (embedded). Trích chọn đặc trưng (feature extraction) tạo ra các đặc trưng mới từ sự kết hợp của các đặc trưng gốc. Các đặc trưng mới này thường có chiều thấp hơn. Chúng không giữ nguyên ý nghĩa ban đầu nhưng có thể hiệu quả hơn trong việc nén thông tin. PCA phân tích thành phần chính là một ví dụ điển hình của phương pháp này. Cả hai đều nhằm mục tiêu phân loại bệnh nhân tốt hơn.
2.2. Học đa hàm nhân và nhúng đồ thị
Học đa hàm nhân (Multiple Kernel Learning - MKL) là một phương pháp mạnh mẽ. Nó kết hợp nhiều hàm nhân khác nhau để tạo ra một hàm nhân tối ưu. MKL-DR (MKL for Dimensionality Reduction) mở rộng ý tưởng này cho giảm chiều dữ liệu. Nó giúp xử lý các mối quan hệ phức tạp trong dữ liệu y tế. Phương pháp nhúng đồ thị (graph embedding) là một kỹ thuật giảm chiều khác. Nó bảo toàn cấu trúc lân cận của dữ liệu. Các kỹ thuật như t-SNE và UMAP là những ví dụ phổ biến. Chúng thường được sử dụng để trực quan hóa dữ liệu đa chiều. Các phương pháp này rất có giá trị trong việc khám phá cấu trúc ẩn của dữ liệu bệnh nhân và hỗ trợ phân lớp bệnh nhân.
III. Phân tích thành phần chính PCA cho phân lớp bệnh nhân
Phân tích thành phần chính (PCA phân tích thành phần chính) là một trong những kỹ thuật giảm chiều dữ liệu phổ biến nhất. Nó tìm cách biến đổi dữ liệu sang một không gian mới. Trong không gian này, các chiều (thành phần chính) được sắp xếp theo mức độ phương sai. Các thành phần chính đầu tiên chứa phần lớn thông tin của dữ liệu gốc. PCA được sử dụng rộng rãi trong xử lý dữ liệu y tế. Nó giúp giảm số chiều của ảnh y khoa hoặc dữ liệu biểu hiện gen. Tuy nhiên, PCA truyền thống có thể nhạy cảm với dữ liệu nhiễu và ngoại lai. Đặc tính này thường xuất hiện trong các tập dữ liệu y sinh. Do đó, các phiên bản tăng cường của PCA đã được phát triển để khắc phục hạn chế này. Chúng giúp cải thiện độ bền vững của mô hình.
3.1. Nguyên lý hoạt động của PCA trong y học
PCA hoạt động bằng cách tìm các vector riêng của ma trận hiệp phương sai của dữ liệu. Các vector này định nghĩa các thành phần chính. Thành phần chính đầu tiên nắm giữ nhiều phương sai nhất. Các thành phần tiếp theo nắm giữ phương sai nhiều nhất còn lại và trực giao với các thành phần trước. Bằng cách chọn một số lượng nhỏ các thành phần chính, có thể giảm đáng kể số chiều dữ liệu. Trong y học, PCA được sử dụng để giảm chiều dữ liệu ảnh MRI bệnh nhân Alzheimer. Nó cũng ứng dụng trong phân tích biểu hiện gen bệnh ung thư. PCA giúp cô đọng thông tin, làm nổi bật sự khác biệt giữa các nhóm bệnh nhân, hỗ trợ phân loại bệnh nhân.
3.2. PCA tăng cường RPCA cho dữ liệu y tế nhiễu
Robust Principal Component Analysis (RPCA) là một phiên bản cải tiến của PCA. Nó được thiết kế để hoạt động tốt hơn với dữ liệu có nhiễu hoặc ngoại lai đáng kể. RPCA phân tách ma trận dữ liệu thành hai phần: một ma trận hạng thấp (tương tự như kết quả PCA) và một ma trận thưa. Ma trận thưa chứa các thành phần nhiễu hoặc ngoại lai. Khả năng này cực kỳ hữu ích trong xử lý dữ liệu y tế. Dữ liệu y tế thường bị ảnh hưởng bởi lỗi đo lường, sai sót hoặc các biến thể sinh học không mong muốn. RPCA giúp làm sạch dữ liệu. Nó trích xuất thông tin thực sự quan trọng. Điều này dẫn đến các mô hình phân lớp bệnh nhân bền vững và chính xác hơn.
IV. Học máy y tế ứng dụng phân loại bệnh nhân chính xác
Học máy đã cách mạng hóa nhiều lĩnh vực, bao gồm cả y tế. Ứng dụng của học máy trong y khoa, đặc biệt là phân loại bệnh nhân, mang lại tiềm năng to lớn. Nó giúp cải thiện khả năng chẩn đoán, dự đoán diễn biến bệnh và cá nhân hóa liệu pháp điều trị. Các mô hình học máy có thể phân tích các tập dữ liệu y tế phức tạp. Chúng xác định các mẫu ẩn không thể phát hiện bằng mắt thường hoặc phương pháp thống kê truyền thống. Sau khi giảm chiều dữ liệu, hiệu suất của các mô hình học máy thường được nâng cao đáng kể. Điều này tạo ra hệ thống hỗ trợ quyết định lâm sàng hiệu quả hơn.
4.1. Vai trò của phân loại bệnh nhân trong lâm sàng
Phân loại bệnh nhân đóng vai trò then chốt trong thực hành lâm sàng. Nó giúp các bác sĩ đưa ra quyết định chẩn đoán nhanh chóng và chính xác. Ví dụ, phân loại bệnh nhân Alzheimer dựa trên ảnh MRI. Hoặc phân loại các loại ung thư khác nhau dựa trên biểu hiện gen. Khả năng phân loại đúng nhóm bệnh giúp khởi động liệu pháp điều trị phù hợp sớm hơn. Điều này có thể cải thiện tiên lượng bệnh nhân. Học máy trong y khoa cung cấp công cụ mạnh mẽ. Nó hỗ trợ phân loại bệnh nhân vào các nhóm nguy cơ, dự đoán phản ứng với thuốc, hoặc xác định các tiểu nhóm bệnh có đặc điểm riêng. Đây là nền tảng cho y học cá thể hóa.
4.2. Các thuật toán học máy phổ biến cho y khoa
Nhiều thuật toán học máy được áp dụng trong phân loại bệnh nhân. Máy vector hỗ trợ (Support Vector Machine - SVM) là một lựa chọn phổ biến. Nó hiệu quả trong việc tìm siêu phẳng phân chia tốt nhất giữa các lớp. K láng giềng gần nhất (K-Nearest Neighbors - KNN) cũng được sử dụng. KNN phân loại một điểm dữ liệu dựa trên đa số phiếu của các láng giềng gần nhất. Các mô hình học đa hàm nhân cũng ngày càng được ưa chuộng. Chúng có thể xử lý các mối quan hệ phi tuyến tính và phức tạp. Việc kết hợp các thuật toán này với các phương pháp giảm chiều dữ liệu như PCA tăng cường tạo ra các hệ thống phân loại bệnh nhân mạnh mẽ. Nó có khả năng thích nghi với tính đa dạng của dữ liệu y tế.
V. Lựa chọn đặc trưng y tế nâng cao hiệu suất học máy
Lựa chọn đặc trưng là một kỹ thuật giảm chiều dữ liệu quan trọng. Nó tập trung vào việc xác định và chọn ra tập hợp con tối ưu các đặc trưng từ dữ liệu gốc. Trong bối cảnh y tế, việc có quá nhiều đặc trưng có thể dẫn đến hiện tượng quá khớp (overfitting). Điều này làm giảm khả năng tổng quát hóa của mô hình. Bằng cách loại bỏ các đặc trưng không liên quan hoặc dư thừa, lựa chọn đặc trưng y tế có thể cải thiện đáng kể hiệu suất của các mô hình học máy. Nó cũng tăng cường khả năng diễn giải của chúng. Quá trình này giúp mô hình tập trung vào thông tin thực sự quan trọng, dẫn đến kết quả phân loại bệnh nhân chính xác và đáng tin cậy hơn.
5.1. Phân loại kỹ thuật lựa chọn đặc trưng y tế
Các kỹ thuật lựa chọn đặc trưng được phân loại thành ba nhóm chính: lọc (filter), bao gói (wrapper) và nhúng (embedded). Phương pháp lọc đánh giá đặc trưng dựa trên các tiêu chí thống kê độc lập với thuật toán học máy. Ví dụ bao gồm độ tương quan hoặc thông tin lẫn nhau. Phương pháp bao gói sử dụng hiệu suất của mô hình học máy để đánh giá các tập con đặc trưng. Điều này thường tốn kém về mặt tính toán nhưng có thể cho kết quả tốt hơn. Phương pháp nhúng tích hợp quá trình lựa chọn đặc trưng vào thuật toán học máy. Chúng thường có hiệu quả cao và ít tốn kém hơn so với bao gói. Các kỹ thuật này giúp tìm ra các đặc trưng quan trọng cho phân loại bệnh nhân.
5.2. Tối ưu hóa đặc trưng cho phân lớp bệnh nhân
Việc tối ưu hóa các đặc trưng là rất quan trọng để đạt được kết quả phân lớp bệnh nhân tốt nhất. Các đặc trưng được chọn phải có khả năng phân biệt cao giữa các lớp bệnh nhân khác nhau. Đồng thời, chúng phải ít bị nhiễu và ít tương quan với nhau. Một tập hợp đặc trưng tối ưu không chỉ cải thiện độ chính xác phân lớp mà còn giảm thời gian tính toán. Nó còn làm cho mô hình dễ hiểu hơn. Điều này đặc biệt có giá trị trong y tế, nơi khả năng giải thích của mô hình là yếu tố then chốt. Việc kết hợp lựa chọn đặc trưng với các phương pháp giảm chiều khác có thể tạo ra hiệu quả tổng hợp, nâng cao chất lượng phân loại bệnh nhân trong học máy y tế.
VI. Kết quả thực nghiệm giảm chiều dữ liệu và phân lớp
Các phương pháp giảm chiều dữ liệu và phân lớp bệnh nhân được đề xuất trong nghiên cứu đã trải qua quá trình thực nghiệm nghiêm ngặt. Việc đánh giá dựa trên nhiều tập dữ liệu y tế thực tế. Các tập dữ liệu này bao gồm thông tin từ bệnh Alzheimer và nhiều loại ung thư khác nhau. Mục tiêu của các thực nghiệm là chứng minh hiệu quả của các phương pháp. Nó so sánh hiệu suất của chúng với các phương pháp hiện có. Kết quả thực nghiệm cung cấp bằng chứng cụ thể về khả năng cải thiện độ chính xác phân lớp. Nó cũng chỉ ra sự giảm đáng kể về thời gian tính toán. Các phát hiện này khẳng định giá trị của việc áp dụng các kỹ thuật giảm chiều tiên tiến trong học máy y khoa.
6.1. Bộ dữ liệu y tế đa dạng trong thực nghiệm
Thực nghiệm sử dụng các bộ dữ liệu y tế đa dạng. Điều này đảm bảo tính tổng quát của các phương pháp. Các tập dữ liệu bao gồm ảnh cộng hưởng từ (MRI) từ sáng kiến ADNI cho bệnh nhân Alzheimer. Nó cũng bao gồm dữ liệu biểu hiện gen cho nhiều loại ung thư. Các loại ung thư này gồm ung thư vú (Breast Invasive Carcinoma - BREAST), ung thư não (Glioblastoma Multiforme - GBM), ung thư phổi (Lung Squamous Cell Carcinoma - LUNG) và ung thư buồng trứng (Ovarian Serous Cytadenocarcinoma - OV). Sự đa dạng này giúp đánh giá khả năng ứng dụng của các phương pháp trên các loại dữ liệu và bệnh lý khác nhau, phục vụ tốt cho phân loại bệnh nhân.
6.2. Đánh giá hiệu suất phân lớp bệnh nhân
Hiệu suất của các phương pháp giảm chiều dữ liệu và phân lớp được đánh giá bằng nhiều chỉ số. Các chỉ số này bao gồm độ chính xác (accuracy), diện tích dưới đường cong ROC (AUC). Thời gian thực hiện cũng được ghi nhận và so sánh. Các mô hình tích hợp, ví dụ như PCA tăng cường (RPCA) kết hợp với các bộ phân lớp, đã cho thấy kết quả vượt trội. Chúng cải thiện đáng kể độ chính xác phân lớp so với việc sử dụng dữ liệu gốc. Việc so sánh với các phương pháp giảm chiều khác như MKL-DR và các kỹ thuật lựa chọn đặc trưng đã chứng minh tính ưu việt của các phương pháp được đề xuất. Kết quả này khẳng định tiềm năng ứng dụng mạnh mẽ của machine learning y tế.
Mục lục chi tiết luận án
Tải xuống file đầy đủ để xem toàn bộ nội dung
Tải đầy đủ (134 trang)Nội dung chính
Tổng quan về luận án
Trong kỷ nguyên của y học chính xác (Precision Medicine) và khoa học dữ liệu y sinh, sự bùng nổ của các công nghệ xét nghiệm thông lượng cao (High-throughput Screening) và thiết bị chẩn đoán hình ảnh tiên tiến đã tạo ra những khối dữ liệu khổng lồ với cấu trúc đa tầng, đa phương thức (Multimodal Data). Tuy nhiên, rào cản lớn nhất đối với việc khai phá tri thức y sinh phục vụ chẩn đoán và điều trị chính là "nghịch lý số chiều" (Curse of Dimensionality). Các tập dữ liệu biểu hiện gen microarray thường chứa từ vài nghìn đến hàng chục nghìn chiều ($S \approx 10^3 - 10^5$), dữ liệu tương tác gen đạt tới hàng triệu thuộc tính, và dữ liệu ảnh cộng hưởng từ không gian 3 chiều (3D-MRI) sở hữu hàng trăm nghìn voxels, trong khi số lượng mẫu quan sát bệnh nhân ($N$) lại vô cùng hạn chế ($N \ll S$).
Luận án tiến sĩ chuyên ngành Hệ thống thông tin (Mã số: 9480104.01) của nghiên cứu sinh Giang Thành Trung, thực hiện dưới sự hướng dẫn khoa học của PGS. Trần Đăng Hưng và TS. Lê Nguyên Khôi tại Trường Đại học Công nghệ – Đại học Quốc gia Hà Nội, mang tiêu đề: "Nghiên cứu một số phương pháp giảm chiều dữ liệu, ứng dụng trong bài toán phân lớp bệnh nhân". Công trình giải quyết trực diện khoảng trống nghiên cứu (Research Gap) then chốt: sự kém hiệu quả về chi phí tính toán của các phương pháp tích hợp dữ liệu đa nguồn kết hợp giảm chiều hiện nay, cùng với sự suy giảm nghiêm trọng về độ chính xác khi đối mặt với dữ liệu y sinh bị nhiễu, thưa và chứa nhiều giá trị ngoại lai (outliers).
Luận án định vị và trả lời 3 câu hỏi nghiên cứu cốt lõi (Research Questions - RQ) gắn liền với 3 giả thuyết khoa học (Hypotheses - H):
- RQ1: Làm sao để khắc phục những tồn tại về chi phí thời gian tính toán của phương pháp tích hợp dữ liệu kết hợp giảm chiều dữ liệu dựa trên học đa hàm nhân?
- H1: Tối ưu hóa thứ tự nhân tích chuỗi ma trận (Matrix Chain Multiplication Ordering - MCMO) và chính quy hóa trong không gian nhúng đồ thị sẽ giảm thiểu độ phức tạp tính toán của thuật toán MKL-DR mà không làm suy giảm độ chính xác phân tách dữ liệu.
- RQ2: Làm sao để ứng dụng hiệu quả phương pháp phân tích thành phần chính tăng cường (Robust Principal Component Analysis - RPCA) trong giảm chiều dữ liệu y sinh học chứa nhiều nhiễu và ngoại lai?
- H2: Việc phân rã ma trận biểu hiện gen thành thành phần hạng thấp (Low-rank) và thành phần thưa (Sparse) bằng RPCA cho phép trích xuất tập đặc trưng bất biến, loại bỏ hoàn toàn nhiễu sinh học và mẫu ngoại lai tốt hơn PCA truyền thống.
- RQ3: Làm sao để ứng dụng tối ưu các phương pháp giảm chiều dữ liệu cải tiến vào việc xây dựng mô hình phân lớp bệnh nhân ung thư và bệnh thoái hóa thần kinh?
- H3: Mô hình phân lớp tích hợp đa hàm nhân kết hợp dữ liệu sinh học phân tử và hình ảnh y tế đã qua tiền xử lý fMKL-DR/RPCA sẽ nâng cao rõ rệt độ chính xác (Accuracy) và diện tích dưới đường cong ROC (AUC) với ý nghĩa thống kê $p < 0.05$.
Khung lý thuyết của luận án được thiết lập vững chắc trên nền tảng Khung nhúng đồ thị (Graph Embedding Framework), Lý thuyết không gian Hilbert tái tạo hạt nhân (Reproducing Kernel Hilbert Space - RKHS), Quy hoạch nửa xác định (Semidefinite Programming - SDP) và Lý thuyết phân rã ma trận tối ưu (Convex Optimization for Low-Rank Matrix Recovery). Phạm vi nghiên cứu bao quát các tập dữ liệu ung thư chuẩn quốc tế từ The Cancer Genome Atlas (TCGA) bao gồm ung thư vú (BREAST), ung thư não (GBM), ung thư phổi (LUNG), ung thư buồng trứng (OV) và cơ sở dữ liệu bệnh thoái hóa thần kinh Alzheimer (ADNI) với hàng nghìn lát cắt ảnh cộng hưởng từ MRI kết hợp điểm trắc nghiệm trí tuệ MMSE.
Literature Review và Positioning
Tổng quan y văn học thuật thế giới chỉ ra ba dòng tiếp cận chính trong bài toán giảm chiều dữ liệu y sinh: Lựa chọn đặc trưng (Feature Selection), Trích chọn đặc trưng (Feature Extraction), và Phương pháp lai (Hybrid Methods).
┌────────────────────────────────────────────────────────┐
│ GIẢM CHIỀU DỮ LIỆU Y SINH HỌC │
└──────────────────────────┬─────────────────────────────┘
│
┌─────────────────────────────────────────────┼─────────────────────────────────────────────┐
│ │ │
┌────────┴──────────────┐ ┌──────────┴────────────┐ ┌──────────┴──────────────┐
│ Lựa chọn đặc trưng │ │ Trích chọn đặc trưng │ │ Phương pháp lai │
└────────┬──────────────┘ └──────────┬────────────┘ └──────────┬──────────────┘
│ │ │
├─ Phương pháp Lọc (Filter) ├─ Tuyến tính (Linear) ├─ mRMR kết hợp ABC/GA
│ ├─ Lin & Chen (2004) │ ├─ PCA (Pearson, 1901) │ ├─ Alshamlan et al. (2015)
│ ├─ Sun et al. (2010) │ └─ Classical MDS / PCoA │ └─ Akadi et al. (2011)
│ └─ Mortazavi et al. (2016) │ ├─ Genetic Bee Colony (GBC)
├─ Phương pháp Bao gói (Wrapper) ├─ Phi tuyến (Non-linear) │ └─ Alshamlan et al. (2015)
│ ├─ SFS / SFFS / ASFFS │ ├─ Kernel-PCA (Ha et al., 2016) ├─ Tabu Search + BPSO
│ ├─ Maugis et al. (2009) [Gaussian Mix] │ ├─ LLE / Laplacian Eigenmaps │ └─ Chuang et al. (2008)
│ └─ Kar et al. (2015) [PSO] │ ├─ ISODATA & Fuzzy-SVM └─ k-Top Scoring Pair (k-TSP)
└─ Phương pháp Nhúng (Embedded) │ └─ Deep Autoencoder (2016-2020) └─ Shi et al. (2011)
├─ LLDA-RFE (Niijima & Okno, 2007) └─ Tích hợp đa nguồn + Giảm chiều
├─ KP-SVM (Maldonado et al., 2014) └─ MKL-DR (Lin et al., 2011/2016)
└─ Lasso-NN (Zhang et al., 2019) ──► CẢI TIẾN: fMKL-DR / RPCA-MKL (Luận án)
Trong nhánh Lựa chọn đặc trưng, các phương pháp Lọc đơn biến và đa biến (Filter Methods) được phát triển mạnh mẽ nhằm xếp hạng gen theo độ đo tương quan và phân cụm thống kê (Lin và Chen, 2004), học tập cục bộ phân rã bài toán phi tuyến (Sun et al., 2010), độ đo entropy thông tin (Zhu et al., 2010), hoặc lý thuyết trò chơi cộng tác đa pha (Mortazavi et al., 2016). Mặc dù các phương pháp lọc có ưu điểm tính toán nhanh và độc lập với bộ phân lớp, chúng bỏ qua mối quan hệ tương tác phức tạp giữa các gen. Ngược lại, các phương pháp Bao gói (Wrapper Methods) như tìm kiếm tiến động thích nghi ASFFS (Somol et al., 1999), mô hình ngẫu nhiên Bayesian MCMC (Ai-Jun và Xin-Yan, 2009), phân chia hồi quy từng phần PLS (Ji et al., 2011), hay tối ưu bầy đàn PSO (Kar et al., 2015) lại tối ưu hóa trực tiếp độ chính xác của bộ phân loại. Tuy nhiên, phương pháp bao gói gặp rào cản tính toán cực lớn ($O(2^S)$) và rất dễ dẫn đến hiện tượng quá khớp (Overfitting) khi kiểm thử trên dữ liệu độc lập. Nhóm phương pháp Nhúng (Embedded Methods) như loại bỏ đặc trưng đệ quy LLDA-RFE (Niijima và Okno, 2007), hàm nhân phạt KP-SVM (Maldonado et al., 2014) hay Lasso kết hợp mạng nơ-ron (Zhang et al., 2019) cố gắng cân bằng giữa thời gian tính toán và độ phức tạp mô hình nhưng vẫn phụ thuộc mật thiết vào cấu trúc thuật toán học cơ sở.
Trong nhánh Trích chọn đặc trưng, Phân tích thành phần chính (PCA) là kỹ thuật tuyến tính kinh điển nhưng hoàn toàn bất lực trước cấu trúc phi tuyến của các mạng lưới điều hòa sinh học. Để khắc phục, các phương pháp phi tuyến như Kernel-PCA (Ha et al., 2016), Nhúng tuyến tính cục bộ LLE, Laplacian Eigenmaps LE (Belkin và Niyogi), hay Phân tích thành phần độc lập ICA (Hyvarinen, 2001) đã được triển khai. Gần đây, các mô hình học sâu như Bộ tự mã hóa sâu (Deep Autoencoder) được áp dụng để trích xuất biểu diễn phi tuyến trong phân loại ung thư (Tan et al., 2016) và ảnh não Alzheimer (Suk et al., 2014). Tuy vậy, các mạng sâu đòi hỏi dung lượng mẫu cực lớn và đóng vai trò như một "hộp đen" thiếu tính diễn giải sinh học.
Đặc biệt, năm 2011 và 2016, Lin và các cộng sự đã đề xuất khung làm việc Multiple Kernel Learning for Dimensionality Reduction (MKL-DR), đánh dấu bước đột phá trong việc tích hợp đồng thời nhiều nguồn dữ liệu (gen, protein, ảnh y tế) vào một không gian nhúng giảm chiều duy nhất. Tuy nhiên, MKL-DR tồn tại điểm nghẽn nghiêm trọng: quy trình tối ưu hóa lặp đòi hỏi tính toán liên tục các tích chuỗi ma trận bậc cao, dẫn đến thời gian thực thi bùng nổ khi kích thước ma trận nhân tăng lên.
Luận án của NCS. Giang Thành Trung định vị chính xác tại điểm giao thoa giữa trích chọn đặc trưng đa hàm nhân và tối ưu hóa số học ma trận:
- So sánh với công trình gốc MKL-DR của Lin et al. (2016): Luận án đề xuất phương pháp fMKL-DR (Fast Multiple Kernel Learning for Dimensionality Reduction) ứng dụng thủ tục tối ưu thứ tự nhân chuỗi ma trận MCMO, giúp cắt giảm đột phá thời gian huấn luyện trong khi vẫn bảo toàn 100% độ chính xác phân lớp.
- So sánh với các kỹ thuật lọc/bao gói lai tiên tiến như mRMR-ABC của Alshamlan et al. (2015) và KP-SVM của Maldonado et al. (2014): Khung RPCA-MKL của luận án chứng minh khả năng kháng nhiễu và triệt tiêu điểm dị biệt vượt trội trên các bộ dữ liệu microarray có độ thưa và tỷ lệ lỗi đo đạc cao.
Đóng góp lý thuyết và khung phân tích
Đóng góp cho lý thuyết
Luận án mở rộng trực tiếp Lý thuyết Nhúng đồ thị tổng quát (Graph Embedding Framework) và Lý thuyết Học đa hàm nhân (Multiple Kernel Learning Theory) thông qua việc tái định nghĩa hàm mục tiêu tối ưu hóa không gian chiếu dưới các ràng buộc đại số ma trận chặt chẽ.
Toán học hóa bài toán giảm chiều dữ liệu trong luận án được phát biểu chuẩn tắc: $$\text{Tìm hàm số } f: \mathbb{R}^S \to \mathbb{R}^D \text{ với } D \ll S$$ Biến đổi một vector bệnh nhân $x \in \mathbb{R}^S$ trong không gian nguyên bản thành vector $z \in \mathbb{R}^D$ trong không gian con sao cho bảo toàn tối đa cấu trúc đồ thị nội tại (Intrinsic Graph $G$) phản ánh sự tương đồng giữa các cá thể cùng lớp, đồng thời tối đa hóa khoảng cách trên đồ thị phạt (Penalty Graph $G_p$) phản ánh mối quan hệ giữa các cá thể khác lớp.
┌───────────────────────────────────────────────────┐
│ KHUNG PHÂN TÍCH TỔNG HỢP CỦA LUẬN ÁN │
└─────────────────────────┬─────────────────────────┘
│
┌────────────────────────────────────┴────────────────────────────────────┐
│ │
┌────────┴─────────────────────────────────────────┐ ┌─────────────────────────┴─────────────────────────────────────────┐
│ HƯỚNG 1: TÍCH HỢP ĐA NGUỒN VÀ fMKL-DR │ │ HƯỚNG 2: XỬ LÝ DỮ LIỆU NGOẠI LAI VỚI RPCA │
└────────┬─────────────────────────────────────────┘ └─────────────────────────┬─────────────────────────────────────────┘
│ │
┌───────┴─────────────────────────────────────────┐ ┌────────────────┴─────────────────────────────────┐
│ Dữ liệu đa phương thức (Microarray, MRI, MMSE) │ │ Dữ liệu y sinh thưa, nhiễu và ngoại lai (TCGA) │
└───────┬─────────────────────────────────────────┘ └────────────────┬─────────────────────────────────┘
▼ ▼
┌─────────────────────────────────────────────────┐ ┌──────────────────────────────────────────────────┐
│ Xây dựng các ma trận nhân cơ sở {K_m} │ │ Phân rã ma trận quan sát: X = L + S │
└───────┬─────────────────────────────────────────┘ │ • L (Hạng thấp - Low Rank): Bản chất sinh học │
▼ │ • S (Thưa - Sparse Matrix): Nhiễu & Ngoại lai │
┌─────────────────────────────────────────────────┐ └────────────────┬─────────────────────────────────┘
│ Khung nhúng đồ thị hàm nhân: K(β) = Σ β_m K_m │ ▼
└───────┬─────────────────────────────────────────┘ ┌──────────────────────────────────────────────────┐
▼ │ Trích chọn đặc trưng bất biến từ L │
┌─────────────────────────────────────────────────┐ └────────────────┬─────────────────────────────────┘
│ Tối ưu hóa chuỗi nhân ma trận (MCMO Algorithm) │ ▼
└───────┬─────────────────────────────────────────┘ ┌──────────────────────────────────────────────────┐
▼ │ Xây dựng ma trận nhân từ đặc trưng đã làm sạch │
┌─────────────────────────────────────────────────┐ └────────────────┬─────────────────────────────────┘
│ fMKL-DR: Không gian nhúng chiều thấp tối ưu │ │
└───────┬─────────────────────────────────────────┘ │
│ │
└────────────────────────────────────┬────────────────────────────────────┘
│
▼
┌───────────────────────────────────────────────────┐
│ MÔ HÌNH PHÂN LỚP TÍCH HỢP ĐA HÀM NHÂN (MKL) │
│ (Ensemble Multi-Kernel Classifier: SVM/KNN) │
└─────────────────────────┬─────────────────────────┘
│
▼
┌───────────────────────────────────────────────────┐
│ KẾT QUẢ CHẨN ĐOÁN & PHÂN LỚP BỆNH NHÂN │
│ • Phân tầng bệnh nhân ung thư (TCGA Cohorts) │
│ • Chẩn đoán sớm Alzheimer & MCI (ADNI Cohort) │
└───────────────────────────────────────────────────┘
Trong khung fMKL-DR, sự kết hợp tuyến tính của $M$ hàm nhân cơ sở ${K_m}{m=1}^M$ với vector trọng số $\beta = (\beta_1, \beta_2, \dots, \beta_M)^T$ ($\beta_m \ge 0, \sum \beta_m = 1$) tạo ra ma trận nhân kết hợp $K(\beta) = \sum{m=1}^M \beta_m K_m$. Luận án chứng minh định lý về tối ưu hóa tính toán: bằng cách áp dụng thuật toán Quy hoạch động xác định thứ tự nhân tối ưu cho chuỗi tích ma trận đa chiều (MCMO), độ phức tạp tính toán của mỗi bước lặp trong thuật toán MKL-DR giảm từ $O(M \cdot N^3)$ xuống mức tối thiểu, loại bỏ hoàn toàn các phép nhân ma trận dư thừa trên các chiều không gian trung gian.
Đối với hướng tiếp cận xử lý dữ liệu ngoại lai, luận án phát triển mô hình RPCA dựa trên việc giải bài toán tối ưu lồi Principal Component Pursuit (PCP): $$\min_{L, S} |L|_* + \lambda |S|1 \quad \text{thỏa mãn } X = L + S$$ Trong đó $|L|*$ là chuẩn hạt nhân (tổng các giá trị suy biến của ma trận $L$), $|S|_1$ là chuẩn $L_1$ (tổng trị tuyệt đối các phần tử của ma trận $S$), và $\lambda > 0$ là tham số điều hòa. Đóng góp lý thuyết ở đây là việc chứng minh: ma trận $L$ thu được đại diện cho cấu trúc sinh học nền tảng có thứ hạng thấp của quần thể bệnh nhân, trong khi $S$ cô lập hoàn toàn các sai số kỹ thuật, đột biến ngẫu nhiên và nhiễu đo đạc.
Khung phân tích độc đáo
Khung phân tích của luận án tích hợp đồng thời 3 trụ cột lý thuyết:
- Lý thuyết Không gian hàm nhân tái tạo (RKHS): Cho phép chiếu phi tuyến các dữ liệu không đồng nhất (Heterogeneous Data) về một không gian Hilbert chung để thực hiện phép đo khoảng cách tương đồng.
- Lý thuyết Đồ thị phổ và Bảo toàn cấu trúc đa tạp (Spectral Graph Theory & Manifold Learning): Đảm bảo hình học cục bộ của dữ liệu trong không gian ban đầu được bảo toàn nguyên vẹn sau khi nén chiều.
- Lý thuyết Tối ưu hóa điều hòa ma trận Robust (Regularized Matrix Optimization): Ngăn chặn hiện tượng suy biến ma trận hiệp phương sai thông qua việc đưa vào các số hạng chính quy hóa ($rMKL-DR$), kiểm soát chặt chẽ điều kiện biên (Boundary Conditions) khi kích thước mẫu $N$ nhỏ hơn rất nhiều so với số chiều $S$.
Phương pháp nghiên cứu tiên tiến
Thiết kế nghiên cứu
Luận án tuân thủ thế giới quan khoa học thực chứng (Positivism / Post-positivism), đặt trọng tâm vào phương pháp suy diễn định lượng, kiểm chứng giả thuyết thông qua mô hình hóa toán học và thực nghiệm tính toán trên các bộ dữ liệu chuẩn quốc tế.
Thiết kế nghiên cứu được tổ chức theo cấu trúc đa tầng (Multi-level Experimental Design):
- Tầng 1 (Cơ sở dữ liệu đa nguồn): Thu thập và tiền xử lý dữ liệu đa phương thức gồm biểu hiện gen microarray/RNA-seq từ TCGA và ảnh chụp cộng hưởng từ 3D-MRI não bộ kèm điểm lâm sàng MMSE từ ADNI.
- Tầng 2 (Thuật toán nén chiều & Tách nhiễu): Triển khai song song hai động cơ xử lý: fMKL-DR (tối ưu hóa tốc độ và tích hợp hạt nhân) và RPCA (khôi phục ma trận hạng thấp).
- Tầng 3 (Mô hình phân lớp tích hợp): Xây dựng các bộ phân lớp học máy tiên tiến gồm Máy vector hỗ trợ (SVM), $k$-Láng giềng gần nhất (KNN) và các mô hình tổ hợp đa hàm nhân (Ensemble Multi-Kernel Classifiers).
- Tầng 4 (Đánh giá & Thống kê suy luận): Đánh giá định lượng qua 20 lần chạy độc lập kết hợp kiểm định giả thuyết Paired Samples T-Test trên phần mềm chuyên dụng.
Quy trình nghiên cứu rigorous
Quy trình xử lý dữ liệu được thiết kế khép kín nhằm triệt tiêu hiện tượng rò rỉ dữ liệu (Data Leakage) và sai số hệ thống:
- Tiền xử lý & Chuẩn hóa: Dữ liệu thô được làm sạch, xử lý giá trị khuyết thiếu (Imputation), co dãn thang đo (Scaling) về đoạn $[0, 1]$ hoặc chuẩn hóa Z-score ($N(0, 1)$). Đối với ảnh y tế 3D-MRI, kỹ thuật phân vùng quan tâm (Regions of Interest - ROI) được áp dụng để trích xuất thể tích và độ dày vỏ não.
- Khai triển thuật toán:
- Module tiền xử lý và trích xuất đặc trưng được lập trình trên nền tảng C#.
- Các thuật toán tối ưu hóa ma trận phức tạp (fMKL-DR, RPCA, SVD, SDP) được cài đặt và tối ưu hóa bằng ngôn ngữ khoa học MATLAB.
- Tam giác đạc (Triangulation):
- Data Triangulation: Kiểm định chéo trên 4 loại ung thư khác nhau (vú, não, phổi, buồng trứng) và bệnh thoái hóa thần kinh.
- Methodological Triangulation: So sánh đối ứng giữa phương pháp đề xuất với hàng loạt thuật toán cơ sở: PCA, Kernel-PCA, MKL-DR nguyên bản, SVM đơn nhân, KNN, Random Forest.
Data và phân tích
Đặc tính mẫu và thông số thực nghiệm được kiểm soát nghiêm ngặt:
- Tập dữ liệu TCGA Oncology: Hàng nghìn mẫu bệnh phẩm ung thư biểu mô vú (BREAST), ung thư não đa hình (GBM), ung thư biểu mô tế bào vảy phổi (LUNG), và ung thư biểu mô tuyến buồng trứng (OV).
- Tập dữ liệu ADNI: Phân nhóm bệnh nhân gồm nhóm bệnh nhân Alzheimer thực thể (AD), nhóm suy giảm nhận thức nhẹ (MCI), và nhóm người cao tuổi khỏe mạnh đối chứng (NC).
- Phần mềm phân tích thống kê: IBM SPSS Statistics (Version 20.0).
- Giao thức kiểm định giả thuyết thống kê:
Thiết lập kiểm định $t$ cho từng cặp mẫu (Paired Samples T-Test) với khoảng tin cậy 95% ($\alpha = 0.05$). Cặp giả thuyết kiểm định:
- Giả thuyết không ($H_0$): Độ chính xác (hoặc AUC) trung bình của mô hình $\le a$ ($H_0: \mu \le a$).
- Giả thuyết đối ($H_1$): Độ chính xác (hoặc AUC) trung bình của mô hình $> a$ ($H_1: \mu > a$). Tất cả các mô hình phân lớp đều được thực nghiệm lặp lại 20 lần độc lập ($N = 20$, bậc tự do $df = 19$) để tính toán giá trị trung bình, độ lệch chuẩn, $t$-statistic, và giá trị xác suất $p$-value.
Phát hiện đột phá và implications
Những phát hiện then chốt
Bằng chứng trích dẫn trực tiếp từ văn bản luận án:
"Bài toán giảm chiều dữ liệu là bài toán đi tìm một hàm số: $f : \mathbb{R}^S \to \mathbb{R}^D$ với $D \ll S$, hàm $f$ biến một điểm dữ liệu $x$ trong không gian có số chiều lớn $\mathbb{R}^S$ thành một điểm $z$ trong không gian có số chiều nhỏ $\mathbb{R}^D$." "Các tập dữ liệu gồm nhiều dữ liệu nhiễu, thưa và ngoại lai, nếu phân tích chung với dữ liệu thông thường sẽ cho ra kết quả không chính xác. Thách thức này thường xảy ra với các tập dữ liệu sinh học phân tử." "Thông qua việc chia bệnh nhân thành các lớp bệnh nhân khác nhau dựa trên đặc điểm sinh học và tình trạng bệnh, các cơ sở y tế sẽ kịp thời chẩn đoán phát hiện và xác định tình trạng bệnh để có các phác đồ điều trị phù hợp..."
Bảng tổng hợp kết quả phân lớp và kiểm định thống kê của các mô hình đề xuất:
| Tập dữ liệu y sinh | Kích thước đặc trưng gốc ($S$) | Phương pháp tiền xử lý | Mô hình phân lớp | Độ chính xác trung bình (Accuracy %) | Diện tích dưới ROC (AUC) | Giá trị kiểm định thống kê ($p$-value, SPSS) |
|---|---|---|---|---|---|---|
| Ung thư Vú (BREAST) | $> 10.000$ gen | Dữ liệu gốc (Raw) | SVM / KNN | 84.15% | 0.862 | - |
| Ung thư Vú (BREAST) | Giảm chiều tối ưu | RPCA + MKL | Ensemble MKL | 92.40% | 0.954 | $p < 0.001$ ($df = 19$) |
| Ung thư Não (GBM) | $> 12.000$ gen | Dữ liệu gốc (Raw) | SVM / KNN | 79.30% | 0.815 | - |
| Ung thư Não (GBM) | Giảm chiều tối ưu | RPCA + MKL | Ensemble MKL | 88.75% | 0.928 | $p < 0.001$ ($df = 19$) |
| Ung thư Phổi (LUNG) | $> 15.000$ gen | PCA thông thường | SVM đơn nhân | 81.20% | 0.840 | $p = 0.032$ |
| Ung thư Phổi (LUNG) | Giảm chiều tối ưu | RPCA + MKL | Ensemble MKL | 90.65% | 0.946 | $p < 0.001$ ($df = 19$) |
| Ung thư Buồng trứng (OV) | $> 10.000$ gen | Dữ liệu gốc (Raw) | SVM | 76.50% | 0.795 | - |
| Ung thư Buồng trứng (OV) | Giảm chiều tối ưu | RPCA + MKL | Ensemble MKL | 86.90% | 0.912 | $p < 0.001$ ($df = 19$) |
| Alzheimer (ADNI: 3D-MRI) | $\approx 250.000$ voxels | MKL-DR (Lin et al.) | MKL Classifier | 88.50% (Thời gian cao) | 0.910 | $p < 0.01$ |
| Alzheimer (ADNI: MRI+MMSE) | Đa phương thức | fMKL-DR (Đề xuất) | Ensemble MKL | 94.10% (Tốc độ $\times 3.8$) | 0.968 | $p < 0.0001$ ($df = 19$) |
Năm phát hiện khoa học đột phá của luận án:
- Đột phá về tốc độ tính toán của fMKL-DR: Việc tích hợp thủ tục MCMO giúp thuật toán fMKL-DR đạt tốc độ thực thi nhanh hơn từ 3.2 đến 4.5 lần so với MKL-DR gốc của Lin et al. trên các tập dữ liệu ảnh y tế MRI kích thước lớn, trong khi đường cong ROC và chỉ số AUC hoàn toàn tương đương hoặc vượt trội.
- Ưu thế tuyệt đối của RPCA trước dữ liệu nhiễu và ngoại lai: Tiền xử lý bằng RPCA giúp cải thiện độ chính xác phân lớp bệnh nhân ung thư thêm từ 6.8% đến 10.4% so với việc phân tích trên dữ liệu gốc, và vượt trội hơn 5.5% - 8.2% so với phương pháp PCA truyền thống. Phân tích thành phần thưa $S$ đã loại bỏ thành công các biến dị ngoại lai gây sai lệch biên phân cách.
- Hiệu năng vượt trội của mô hình tổ hợp đa hàm nhân: Mô hình phân lớp tích hợp từ 2 đến 3 hàm nhân thành phần (Ensemble Multi-Kernel) đạt chỉ số AUC trung bình trên 0.940 ở tất cả các tập dữ liệu ung thư, giảm thiểu phương sai và triệt tiêu hoàn toàn hiện tượng quá khớp thường gặp ở các bộ phân lớp đơn lẻ.
- Hiệu quả chẩn đoán sớm bệnh Alzheimer: Việc kết hợp đa phương thức giữa thông tin cấu trúc thể tích não bộ từ ảnh cộng hưởng từ (MRI) và điểm kiểm tra nhận thức lâm sàng (MMSE) thông qua fMKL-DR mang lại độ nhạy (Sensitivity/TPR) đạt 94.0% và độ đặc hiệu (Specificity) đạt 95.0%, hỗ trợ phân biệt chính xác giai đoạn tiền lâm sàng MCI chuyển sang Alzheimer thực thể.
- Phát hiện phản trực giác về phương pháp giảm chiều cơ học: Luận án chứng minh việc nén kích thước ảnh cơ học (ví dụ giảm độ phân giải ảnh từ $1000 \times 1000$ xuống $200 \times 200$ điểm ảnh) làm phá hủy các đặc trưng vi mô của vỏ não, khiến độ chính xác chẩn đoán giảm sâu; trong khi phương pháp trích chọn đặc trưng dựa trên đồ thị hàm nhân giữ lại trọn vẹn thông tin chẩn đoán cốt lõi.
Implications đa chiều
- Về mặt học thuật và lý thuyết: Luận án làm phong phú thêm lý thuyết tối ưu hóa ma trận trong không gian hàm nhân, thiết lập cầu nối toán học vững chắc giữa đại số tuyến tính số trị (Numerical Linear Algebra) và bài toán học máy y sinh.
- Về mặt phương pháp luận: Quy trình kết hợp fMKL-DR và RPCA tạo ra một tiêu chuẩn phương pháp luận mở, có khả năng chuyển giao và áp dụng trực tiếp cho các lĩnh vực xử lý dữ liệu phức tạp khác như thị giác máy tính, nhận dạng tiếng nói, và phân tích chuỗi thời gian tài chính.
- Về ứng dụng thực tiễn y tế: Cung cấp công cụ toán học hỗ trợ đắc lực cho các Hệ thống hỗ trợ ra quyết định lâm sàng (Clinical Decision Support Systems - CDSS), giúp bác sĩ phát hiện sớm các dấu hiệu ung thư và thoái hóa thần kinh ở giai đoạn sớm.
- Về chính sách y tế công cộng: Kết quả nghiên cứu tạo tiền đề xây dựng các quy chuẩn xử lý dữ liệu y tế quốc gia, tối ưu hóa chi phí xét nghiệm gen và chụp chiếu hình ảnh thông qua các thuật toán chẩn đoán tự động hóa độ chính xác cao.
Limitations và Future Research
Nhìn nhận khách quan theo chuẩn mực học thuật quốc tế, luận án chỉ ra 4 giới hạn nghiên cứu chính:
- Rào cản tài nguyên bộ nhớ đối với ma trận Gram cỡ lớn: Mặc dù fMKL-DR đã tối ưu hóa thời gian nhân chuỗi ma trận, phương pháp học hàm nhân vẫn đòi hỏi lưu trữ ma trận kích thước $N \times N$. Khi số lượng mẫu bệnh nhân $N$ đạt tới hàng triệu cá thể, chi phí bộ nhớ RAM trở thành thách thức lớn.
- Độ nhạy của siêu tham số điều hòa: Hiệu năng của thuật toán RPCA và fMKL-DR phụ thuộc nhất định vào việc tinh chỉnh tham số điều hòa $\lambda$ và các tham số hàm nhân (như bán kính $\sigma$ của nhân RBF Gaussian). Hiện tại, quy trình này vẫn dựa vào tìm kiếm lưới (Grid Search) có kiểm soát.
- Phạm vi dữ liệu thực nghiệm hồi cứu: Các tập dữ liệu kiểm thử chủ yếu là các cơ sở dữ liệu hồi cứu quốc tế (TCGA, ADNI). Luận án chưa có điều kiện thử nghiệm trên dữ liệu lâm sàng thời gian thực (Real-time Prospective Cohorts) tại các bệnh viện Việt Nam do rào cản về chuẩn hóa dữ liệu hồ sơ bệnh án điện tử (EHR).
- Chưa tích hợp sâu với kiến trúc mạng đồ thị sâu (Graph Neural Networks - GNN): Mô hình hiện tại tập trung vào học hàm nhân truyền thống kết hợp nhúng đồ thị giải tích mà chưa mở rộng sang các kiến trúc học sâu biểu diễn đồ thị tự động.
Chương trình nghiên cứu tương lai (Future Research Agenda):
- Phát triển phiên bản thuật toán fMKL-DR phân tán (Distributed fMKL-DR) trên nền tảng điện toán đám mây và tính toán song song GPU để xử lý dữ liệu giải trình tự gen đơn bào (Single-cell RNA sequencing) quy mô hàng triệu tế bào.
- Tích hợp kỹ thuật Học sâu hàm nhân (Deep Kernel Learning) và Mạng nơ-ron đồ thị (GNN) để tự động học các ma trận kề mà không cần xác định trước cấu trúc đồ thị nội tại.
- Mở rộng mô hình phân lớp sang bài toán theo dõi tiến trình bệnh theo chuỗi thời gian (Longitudinal Disease Progression Modeling).
- Xây dựng giải pháp Học liên kết (Federated Learning) kết hợp fMKL-DR nhằm tích hợp dữ liệu y tế phân tán giữa nhiều bệnh viện mà vẫn bảo mật tuyệt đối thông tin bệnh nhân.
Tác động và ảnh hưởng
- Tác động học thuật: Các kết quả nghiên cứu then chốt của luận án đã được công bố trên các tạp chí khoa học chuyên ngành và hội nghị quốc tế uy tín (các công trình GTTrung-1, GTTrung-2, GTTrung-3, GTTrung-4). Mô hình fMKL-DR và RPCA-MKL mở ra tiềm năng trích dẫn cao trong cộng đồng nghiên cứu Tin-sinh học (Bioinformatics) và Trí tuệ nhân tạo y tế.
- Chuyển đổi công nghệ y tế và R&D: Đóng góp trực tiếp vào các dự án nghiên cứu y tế thông minh trọng điểm, tiêu biểu là Dự án mã số VINIF.DA18 do Quỹ Đổi mới sáng tạo Vingroup (VINIF) tài trợ, khẳng định tính ứng dụng thực tế trong việc phát triển các phần mềm hỗ trợ chẩn đoán hình ảnh y tế.
- Ảnh hưởng kinh tế - xã hội: Giúp giảm tỷ lệ chẩn đoán sai sót, rút ngắn thời gian phân tích mẫu bệnh phẩm từ vài ngày xuống vài phút, nâng cao tỷ lệ sống sót cho bệnh nhân ung thư và kéo dài tuổi thọ chất lượng cao cho bệnh nhân Alzheimer thông qua can thiệp y khoa kịp thời.
Đối tượng hưởng lợi
- Nghiên cứu sinh và Giới học thuật: Tiếp cận một khung phân tích toán học mẫu mực về nhúng đồ thị, giải bài toán tối ưu ma trận và quy trình kiểm định thống kê y sinh nghiêm ngặt bằng SPSS và Matlab.
- Kỹ sư AI và Nhà phát triển hệ thống y tế: Sở hữu thuật toán fMKL-DR mã nguồn tối ưu có thể đóng gói trực tiếp vào các module phần mềm chẩn đoán hình ảnh và phân tích dữ liệu omics.
- Bác sĩ và Cơ sở khám chữa bệnh: Nhận được công cụ phân tầng bệnh nhân chuẩn xác, hỗ trợ xây dựng phác đồ điều trị cá thể hóa (Personalized Medicine) dựa trên sự kết hợp đồng thời giữa dấu ấn sinh học phân tử và hình ảnh chẩn đoán.
- Nhà hoạch định chính sách y tế số: Có cơ sở khoa học thực chứng để xây dựng lộ trình đầu tư hạ tầng tính toán khoa học phục vụ chuyển đổi số ngành y tế.
Câu hỏi chuyên sâu
1. Đóng góp lý thuyết độc đáo nhất của luận án là gì và mở rộng lý thuyết nào? Trả lời: Đóng góp lý thuyết độc đáo nhất là việc tái cấu trúc toán học của khung nhúng đồ thị đa hàm nhân thông qua phương pháp fMKL-DR. Công trình mở rộng trực tiếp Lý thuyết Nhúng đồ thị của Yan et al. và Lý thuyết Học đa hàm nhân của Lin et al., chứng minh rằng việc áp dụng thủ tục tối ưu hóa chuỗi nhân ma trận MCMO cho phép giải quyết triệt để sự bùng nổ chi phí tính toán trong không gian Hilbert tái tạo hạt nhân (RKHS) mà vẫn giữ nguyên tính tối ưu toàn cục của bài toán tối ưu lồi.
2. Đổi mới phương pháp luận của luận án thể hiện như thế nào khi so sánh với ít nhất 2 nghiên cứu quốc tế? Trả lời:
- So với MKL-DR của Lin et al. (2016): fMKL-DR của luận án loại bỏ các phép tính ma trận thừa, giảm thời gian xử lý xuống từ 3 đến 4 lần trên các tập dữ liệu ảnh 3D-MRI lớn.
- So với KP-SVM của Maldonado et al. (2014): Phương pháp tiếp cận RPCA-MKL của luận án tách biệt rõ ràng giữa thành phần tín hiệu bất biến hạng thấp ($L$) và nhiễu thưa ngoại lai ($S$), giúp mô hình không bị lệch biên phân lớp ngay cả khi tỷ lệ mẫu nhiễu trong tập microarray lên tới 20-30%.
3. Phát hiện bất ngờ nhất trong quá trình thực nghiệm kèm dữ liệu chứng minh là gì? Trả lời: Phát hiện bất ngờ nhất là việc các mô hình phân lớp dựa trên phương pháp trích chọn đặc trưng tuyến tính cổ điển (như PCA) bị suy giảm độ chính xác nghiêm trọng trên dữ liệu ung thư buồng trứng (OV) và não (GBM) do hiện tượng nhiễu thưa; trong khi việc kết hợp lọc đặc trưng dựa trên ma trận hạng thấp của RPCA với bộ phân loại đa hàm nhân đã tạo ra bước nhảy vọt về AUC từ 0.795 lên 0.912 (đối với OV) và từ 0.815 lên 0.928 (đối với GBM), khẳng định vai trò sống còn của việc khử nhiễu cấu trúc ma trận trước khi phân lớp.
4. Luận án có cung cấp giao thức tái lập nghiên cứu (Replication Protocol) hoàn chỉnh không? Trả lời: Luận án cung cấp đầy đủ giao thức tái lập nghiên cứu:
- Mã nguồn: Công cụ tiền xử lý viết bằng C# và thuật toán huấn luyện viết bằng MATLAB.
- Dữ liệu: Toàn bộ dữ liệu kiểm thử đều là các tập dữ liệu mở chuẩn quốc tế (TCGA, ADNI).
- Quy trình thống kê: Thiết lập chi tiết 5 bước kiểm định Paired Samples T-Test trên IBM SPSS 20 với độ tin cậy 95%, cung cấp đầy đủ các tham số kiểm định ($t$-value, $p$-value, $df = 19$).
5. Lộ trình nghiên cứu 10 năm tới được phác thảo ra sao? Trả lời: Lộ trình 10 năm định hướng phát triển hệ sinh thái phân tích y sinh thông minh gồm: (1) Mở rộng fMKL-DR sang kiến trúc Federated Graph Learning bảo mật đa trung tâm; (2) Tích hợp mô hình nền tảng (Biomedical Foundation Models) với các hàm nhân sinh học chuyên biệt; (3) Triển khai thử nghiệm lâm sàng tiến cứu (Prospective Clinical Trials) trên hệ thống bệnh viện thông minh nhằm cá thể hóa phác đồ điều trị ung thư và thoái hóa thần kinh.
Kết luận
Luận án tiến sĩ của NCS. Giang Thành Trung đã hoàn thành trọn vẹn các mục tiêu nghiên cứu đề ra với 5 đóng góp học thuật cốt lõi:
- Đề xuất thành công thuật toán fMKL-DR: Giải quyết triệt để rào cản chi phí tính toán của phương pháp MKL-DR truyền thống thông qua tối ưu hóa chuỗi nhân ma trận MCMO, gia tăng hiệu năng xử lý lên gấp nhiều lần.
- Đề xuất phương pháp trích chọn đặc trưng kháng nhiễu dựa trên RPCA: Khai thác thành công phân rã ma trận hạng thấp để loại bỏ ngoại lai và dữ liệu thưa, tạo bước đột phá trong tiền xử lý dữ liệu biểu hiện gen microarray.
- Xây dựng mô hình phân lớp bệnh nhân ung thư đa nguồn đạt hiệu năng cao: Đạt độ chính xác từ 86.9% đến 92.4% và AUC từ 0.912 đến 0.954 trên 4 loại ung thư phức tạp thuộc cơ sở dữ liệu TCGA, kiểm định thống kê $p < 0.001$.
- Xây dựng mô hình chẩn đoán sớm bệnh Alzheimer dựa trên ảnh 3D-MRI và MMSE: Đạt độ chính xác 94.1% và AUC 0.968, mở ra công cụ chẩn đoán hình ảnh tiên tiến cho y học thần kinh.
- Chứng minh tính đúng đắn bằng thực nghiệm và thống kê nghiêm ngặt: Toàn bộ các kết quả được kiểm định qua 20 lần chạy độc lập trên phần mềm SPSS 20, khẳng định ý nghĩa khoa học vững chắc với độ tin cậy 95%.
Công trình đánh dấu bước chuyển dịch quan trọng từ các phương pháp xử lý dữ liệu y sinh đơn lẻ, thụ động sang mô hình tích hợp đa phương thức thông minh, kháng nhiễu và tối ưu hóa tính toán. Luận án mở ra 3 nhánh nghiên cứu giàu tiềm năng: học máy bảo mật phân tán trong y tế, học sâu hàm nhân đa phương thức, và hệ thống phân tầng bệnh nhân tự động hóa phục vụ y học chính xác toàn cầu.
Trích đoạn nội dung luận án
Tải xuống để đọc toàn bộĐẠI HỌC QUỐC GIA HÀ NỘI TRƯỜNG ĐẠI HỌC CÔNG NGHỆ —+—— GIANG THÀNH TRUNG NGHIÊN CỨU MỘT SỐ PHƯƠNG PHÁP GIAM CHIEU DU LIEU, UNG DUNG TRONG BAI TOAN PHAN LGP BENH NHAN LUAN AN TIEN SI HE THONG THONG TIN DAI HỌC QUỐC GIA HÀ NỘI TRƯỜNG ĐẠI HỌC CÔNG NGHỆ ———+%_——— GIANG THÀNH TRUNG NGHIÊN CỨU MỘT SỐ PHƯƠNG PHÁP GIẢM CHIEU DU LIEU, GNG DỤNG TRONG BAI TOAN PHAN LGP BENH NHAN Chuyên ngành: Hệ thống thông tin Mã số: 9480104.01 LUẬN ÁN TIỀN SĨ HỆ THỐNG THÔNG TIN NGƯỜI HƯỚNG DẪN KHOA HỌC: 1. TRAN DANG HUNG 2. LE NGUYEN KHOI Mục lục Trang MỞ ĐẦU|. |Lựa chon đặc trung).
[Irích chọn đặc trưng|.|Phương pháp lail. |Một số thách thức đặt ra khi giảm chiều dit liệu y sinh học 1./Van đề nghiên cứu của luận án|. Kiến thức nền tảng chung|.|Đánh giá kết quả thực nghiệm|. c2 2020221221121 n HE ng ng nh nh nha 42 2.
[Kiến thức nền tảng|.Phương pháp hàm nhân|.|Phương pháp học da hàm nhân|. |Phương pháp nhúng đồ thị trong giảm chiều dữ liệu 4ï 2.|Phương pháp MKL-DR. Nhan xét phương pháp MKL-DRÌ. [Thực nghiệm và kết quải|.[Tập dit liỆN|L.
2222222002220 2 01 2n ha 60 PHÂN LỚP BỆNH NHÂN DỰA TRÊN PHƯƠNG PHÁP PHAN TÍCH THÀNH PHAN CHÍNH TANG CƯỜNG. eee reer nn nhe nhe nhe nho 77 ii 3.|Phương pháp phân tích thành phần chính|.|Phương pháp PCA|. Phân lớp dựa trên Hoc da ham nhân|. [Thực nghiệm và kết quải|.
[Tập di liệu|. c0 2n 2n HE nề neo 97 3. [Thiết kế thực nghiệm|. [Kết quả thực nghiệm|.cc c2 22c Ằ: 99 Danh mục các công trình khoa học của tac giả liên quan dén luận án US 11 Danh sách hình vẽ điều trị "Ăn Se tương ứng vdi giá trị của véc tơ 8 được trả vé của thuật toán) 2.5 So sánh độ chính xác của bộ phân lớp trên từng tập dữ liệu 2.6 Đường cong ROC so sánh các mô hình phân lớp|.
67 27 So sánh thời gian thực hiện khi số lần lặp là 20 với kích thước tập di liệu khác nhau 2.8 Mô hình tiền xử lý dữ liệu ảnh cộng hưởng từ bệnh nhân Alzheimer|.1 Ví dụ về đo thông tin dựa trên phương sail.2 Minh họa ý tưởng phương pháp PCA|L.3 Ý tưởng chính của phương pháp PCA|.6 Mô hình tiền xử lý tập dữ liệu biểu hiện gen dựa trên RPCA 3.7 Biểu đồ đường cong ROC của các mô hình phân lớp trên từng tập dữ liệu bệnh ung thư Danh sách bảng 11 Ưu, nhược điểm của Phương pháp lọc|_.2 Ưu, nhược điểm của Phương pháp bao gói|.3 Ưu, nhược điểm của Phương pháp nhúng.4 Ưu, nhược điểm của Phương pháp trích chọn đặc trưng|. 26 15 Ưu, nhược điểm của Phương pháp lai.6 Bảng minh họa kết quả dự đoán|.2 Do chính xác của các bộ phân lớp giữa các tập dữ liệu gốc và các tập dữ liệu được tiền xử lý dựa trên RPCA 3.3 Độ chính xác của các mô hình phân lớp tích hợp từ 2, 3 bộ phan lớp thành phần vì Giá trị AUC của các mô hình phân lớp vii Thuật ngữ và từ viết tắt Từ viết tắt | Từ gốc Giải nghĩa - Tạm dịch AD Alzheimer Disease Bệnh Alzheimer ADNI Alzheimer’s Disease Neroimag- | Sáng kiến chan đoán và điều ing Initiative trị bệnh Alzheimer dựa trên hình ảnh AUC Area Under the Curver Diện tích bên dưới đường cong ROC BREAST Breast Invasive Carcinoma Bệnh ung thư biểu mô vú DL Dữ liệu fMKL-DR Fast Multiple Kernel Learning | Học đa hàm nhân kết hợp for Dimensionality Reduction | giảm chiều dữ liệu nhanh GBM Glioblastoma Multiforme Bệnh ung thư não KNN K-Nearest Neighbors K láng giềng gần nhất LUNG Lung Squamous Cell Carci- | Bệnh ung thư phổi noma MCMO Matrix Chain Multiplication | Thủ tục tính thứ tự nhân Ordering Proceduce tích chuỗi ma trận tối ưu MKL Multiple Kernel Learning Hoc da ham nhan MKL-DR Multiple Kernel Learning for | Học đa hàm nhân kết hợp Dimensionality Reduetion giảm chiều dữ liệu ML Machine Learning Học máy MMSE Mini Mental State Examina- | Trắc nghiệm trí tuệ tion MRI Magnetic Resonance Imaging Anh chụp cộng hưởng từ OV Ovarian Serous Cytadenocarci- | Bệnh ung thư biểu mô noma buồng trứng PCA Principal Component Analysis | Phan tích thành phần chính rMKL-DR Regularized Multiple Kernel Learning for Dimensionality Reduction ROC Receiver Operating Character- istic ROI Regions of Interest Vùng được quan tâm RPCA Robust Principal Component | Phân tích thành phần chính Analysis tăng cường SDP Semidefinite Programming SVD Singular Value Decomposition viii SVM Support Vector Machine Máy vector hỗ trợ ix Lời cam đoan Tôi xin cam đoan đây là công trình nghiên cứu do tôi thực hiện dưới sự hướng dẫn của PGS. Trần Dăng Hưng và TS. Lê Nguyên Khôi tại bộ môn Hệ thống thông tin, Khoa Công nghệ Thông tin, Trường Đại học Công nghệ, Đại học Quốc gia Hà Nội.
Các số liệu và kết quả trình bày trong luận án là trung thực, chưa được công bố bởi bất kỳ tác giả nào hay ở bất kỳ công trình nào khác. Tác giả Lời cảm ơn Trước tiên tôi xin gửi lời cảm ơn chân thành và sâu sắc đến thầy giáo, PGS. Trần Đăng Hưng - người thầy đã hướng dẫn, khuyến khích, truyền cảm hứng, chỉ bảo và tạo cho tôi những điều kiện tốt nhất từ khi bắt đầu làm nghiên cứu sinh đến khi hoàn thành luận án. Toi xin cẩm ơn thay giáo, TS.
Lê Nguyên Khôi - người thầy hướng dẫn đã luôn khuyến khích, động viên tôi để tôi có thể hoàn thành luận án. Toi xin cám ơn Tiến sĩ Nguyễn Thanh Phương, Trường Đại học Luxemburg - người đã chia sẻ với tôi nhiều kiến thức và kinh nghiệm trong nghiên cứu khoa học để tôi có thể hoàn thành luận án này. Tôi xin chân thành cảm ơn các thầy cô giáo khoa Công nghệ thông tin, Trường Đại học Công nghệ, Đại học Quốc gia Hà Nội, đặc biệt là các Thầy Cô trong Bộ môn Các Hệ thống thông tin đã tận tình đào tạo, cung cấp cho tôi những kiến thức vô cùng quý giá, đã tạo điều kiện tốt nhất cho tôi về môi trường làm việc trong suốt quá trình học tập, nghiên cứu tại Trường. Tôi xin chân thành cảm ơn Khoa Công nghệ Thông tin, Trung tâm Tính toán khoa học, Trường Dại học Sư phạm Hà Nội đã tạo điều kiện về môi trường làm việc và hỗ trợ hệ thống tính toán để giúp tôi hoàn thành nghiên cứu này.
Đồng thời tôi xin chân thành cảm ơn các đồng nghiệp trong Phòng Bảo đảm chất lượng và Thanh tra Pháp chế, Khoa Khoa học Tự nhiên - Công nghệ thuộc Trường Đại học Tây Bắc, Công ty cổ phần Đầu tư GCL đã tạo mọi điều kiện, bố trí thời gian tốt nhất dành cho tôi trong suốt quá trình làm nghiên cứu sinh. Tôi xin cảm ơn Công ty TNHH Đầu tư và Phát triển đô thị Gia Lâm thuộc Tập đoàn Vingroup và hỗ trợ bởi Quỹ Đổi mới sáng tạo Vingroup (VINIF) trong Dự án mã số VINIF.DA18 đã tài trợ cho tôi thực hiện nghiên cứu này. Cuối cùng, tôi xin chân thành cảm ơn những người thân trong gia đình cùng toàn thể bạn bè đã luôn giúp đỡ, động viên tôi những lúc gặp phải khó khăn trong suốt quá trình học tập và nghiên cứu. xi MỞ ĐẦU Đặt vấn đề Trong thập kỷ vừa qua, ngành khoa học sự sống và thực nghiệm đã trải qua một cuộc cách mạng với sự phát triển nhanh chóng của các thiết bị thí nghiệm và thiết bị đo công nghệ cao.
Cùng với sự phát triển đó, lượng dit liệu được do đạc, lưu trữ và xử lý ngày càng lớn trên tất cả các lĩnh vực của đời sống xã hội, đặc biệt trong lĩnh vực y sinh học đã có sự phát triển vượt bậc về dữ liệu khi tạo ra một lượng lớn dữ liệu, như dữ liệu gen, protein, dữ liệu chuyển hóa, dữ liệu dược lý, dữ liệu lâm sàng. Nhiều bộ dữ liệu y sinh học có sự gia tăng nhanh chóng về kích thước, độ phức tạp cũng như cách biểu diễn (ảnh, vector số, video, văn ban) [2]. Nguồn dữ liệu này là cơ sở cho việc phân tích và đề xuất trong các hệ thống trợ giúp ra quyết định hỗ trợ cho các hoạt động chẩn đoán và chữa trị các bệnh do chúng là thông tin phản ánh khách quan các hoạt động đã xảy ra trong chính các cơ quan của cơ thể. Dữ liệu ở dạng thô được xử lý, biến đổi, tính toán và chuyển hóa thành tri thức để trở nên hữu ích nhằm hỗ trợ ra quyết định.
Tuy nhiên, một trong các thách thức đối với các phương pháp xử lý dữ liệu đó là các tập dữ liệu hiện nay có số chiều (hay còn gọi là đặc trưng, thuộc tính hoặc biến) rất lớn. Trong nhiều trường hợp, các bộ dữ liệu có số chiều lên tới hàng nghìn, hàng triệu chiều. Cụ thể, một tập dữ liệu microarray của một loại sinh vật có số lượng gen thường từ vài nghìn đến vài chục nghìn gen, mỗi gen được coi như một chiều (biến) khi biểu diễn dữ liệu trong các bài toán. Số lượng chiều lớn kéo theo đòi hỏi chi phí tính toán lớn, dẫn đến các phương pháp phân tích gặp nhiều khó khăn để đáp ứng yêu cầu về thời gian phản hồi khi đưa vào trong các bài toán thực tế.
Khi đó, một bước tiền xử lý được đề xuất là giảm chiều dữ liệu nhằm giảm số lượng biến để phù hợp với các hệ thống máy tính và giảm thời gian thực hiện thuật toán [3]. Giảm chiều dữ liệu được hiểu là từ một tập dữ liệu gốc ban đầu, áp dụng các phương pháp phân tích để giảm rất nhiều đặc trưng của dữ liệu sao cho vẫn giữ lại được bản chất thông tin của tập dữ liệu đó. Hiện nay, giảm chiều dữ liệu đã trỏ thành một bước kỹ thuật cần thiết nhằm biến đổi dữ liệu gốc ban đầu bằng cách giảm đặc trưng để phù hợp với số mẫu và các mô hình tính toán ở bước tiếp theo. Trong nhiều năm qua, hướng nghiên cứu về giảm chiều dit liệu luôn thu hút được sự quan tâm của các nhà nghiên cứu và thực tế đã có nhiều phương pháp giảm chiều dữ liệu đã được đưa ra nhằm giải quyết thách thức nêu trên ñð|.
Có hai hướng tiếp cận chính để giảm chiều dữ liệu là lựa chọn đặc trưng và trích chọn đặc trưng. Lựa chọn đặc trưng giảm chiều bằng cách lựa chon một tập con đặc trưng từ tập đặc trưng gốc sao cho tập dữ liệu từ tập con đặc trưng vẫn phản ánh được bản chất thông tin nhiều nhất có thể so với tập dữ liệu ban đầu. Trích chọn đặc trưng giảm chiều dựa trên việc biến đổi tập đặc trưng gốc thành một tập đặc trưng mới trong không gian thấp chiều sao cho tối thiểu hóa mất mát thông tin so với tập dữ liệu ban đầu.
Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ
Trích dẫn luận án này
Giang Thành Trung (n.d.). Luận án TS: Giảm chiều dữ liệu ứng dụng phân lớp bệnh nhân [Luận án tiến sĩ, Trường Đại học Công nghệ, Đại học Quốc gia Hà Nội]. LuanAn.net. https://luanan.net/cong-nghe-thong-tin/he-thong-thong-tin/luan-an-ts-giam-chieu-du-lieu-ung-dung-phan-lop-benh-nhan
Câu hỏi thường gặp
Luận án "Luận án TS: Giảm chiều dữ liệu ứng dụng phân lớp bệnh nhân" nghiên cứu về vấn đề gì?
Luận án TS Hệ thống thông tin nghiên cứu các phương pháp giảm chiều dữ liệu hiệu quả. Ứng dụng thực tiễn trong bài toán phân lớp bệnh nhân.
Luận án "Luận án TS: Giảm chiều dữ liệu ứng dụng phân lớp bệnh nhân" được bảo vệ tại trường nào?
Luận án này được bảo vệ tại Trường Đại học Công nghệ, Đại học Quốc gia Hà Nội.
Luận án "Luận án TS: Giảm chiều dữ liệu ứng dụng phân lớp bệnh nhân" thuộc chuyên ngành gì?
Luận án "Luận án TS: Giảm chiều dữ liệu ứng dụng phân lớp bệnh nhân" thuộc chuyên ngành Hệ thống thông tin. Danh mục: Hệ Thống Thông Tin.
Luận án "Luận án TS: Giảm chiều dữ liệu ứng dụng phân lớp bệnh nhân" có bao nhiêu trang?
Luận án "Luận án TS: Giảm chiều dữ liệu ứng dụng phân lớp bệnh nhân" có 134 trang. Bạn có thể xem trước một phần tài liệu ngay trên trang web trước khi tải về.
Cách tải luận án "Luận án TS: Giảm chiều dữ liệu ứng dụng phân lớp bệnh nhân" về máy như thế nào?
Để tải luận án về máy, bạn nhấn nút "Tải xuống ngay" trên trang này, sau đó hoàn tất thanh toán phí lưu trữ. File sẽ được tải xuống ngay sau khi thanh toán thành công. Hỗ trợ qua Zalo: 0559 297 239.