Tổng quan về luận án

Trong kỷ nguyên số hóa và bùng nổ dữ liệu lớn (Big Data), các hệ thống phân lớp đối tượng tự động đối mặt với thách thức kép: vừa phải đảm bảo độ chính xác dự báo tiệm cận mức tối ưu, vừa phải thỏa mãn yêu cầu xử lý thời gian thực (real-time processing) trên các thiết bị tính toán có tài nguyên hạn chế. Mô hình hàm cơ sở bán kính (Radial Basis Function - RBF), được khởi xướng bởi M. Powell (1987), sở hữu cấu trúc toán học biểu diễn dưới dạng tổ hợp tuyến tính của các hàm cơ sở phi tuyến:

$$f(x) = \sum_{i=1}^{M} w_i \phi_i(x) + b$$

trong đó $\phi_i(x) = \exp(-\gamma |x - c_i|^2)$ với tâm đối số $c_i$ và tham số độ rộng $\gamma$. Mặc dù mô hình RBF có năng lực xấp xỉ hàm phổ quát với chiều Vapnik-Chervonenkis (VC dimension) linh hoạt, chi phí tính toán của nó tăng tỷ lệ thuận với số lượng hàm cơ sở $M$.

Luận án tiến sĩ công nghệ thông tin chuyên ngành Khoa học máy tính của nghiên cứu sinh Phạm Quốc Thắng (Trường Đại học Công nghệ – Đại học Quốc gia Hà Nội, 2022) dưới sự hướng dẫn khoa học của GS.TS. Nguyễn Thanh Thủy và PGS.TS. Nguyễn Đức Dũng đã giải quyết trực diện điểm nghẽn tính toán này. Luận án tập trung vào hai hướng tiếp cận cốt lõi: mô hình RBF dựa trên nguyên lý cực đại hóa lề (Support Vector Machine - SVM, Cortes & Vapnik, 1995) và mô hình RBF dựa trên suy luận xác suất Bayes rút gọn (Relevance Vector Machine - RVM, Tipping, 2001).

Khoảng trống nghiên cứu (research gap) trọng tâm mà luận án xác định bao gồm:

  1. Nghẽn cổ chai pha kiểm thử của SVM: Độ phức tạp pha kiểm thử của SVM là $\mathcal{O}(N_s)$, phụ thuộc tuyến tính vào số lượng vectơ hỗ trợ $N_s$. Khi kích thước tập dữ liệu tăng, $N_s$ tăng mạnh khiến việc tính toán các hàm nhân $K(x, x_i)$ trong pha suy diễn bị chậm đáng kể so với mạng nơ-ron hoặc cây quyết định.
  2. Nghẽn cổ chai pha huấn luyện của RVM: Mặc dù RVM tạo ra mô hình cực kỳ thưa (sparse) với số lượng vectơ liên quan $N_{rv} \ll N_s$, quá trình huấn luyện RVM đòi hỏi phép nghịch đảo ma trận hiệp phương sai đầy hạng $\mathbf{\Sigma} = (\mathbf{\Phi}^T \mathbf{B} \mathbf{\Phi} + \mathbf{A})^{-1}$ với độ phức tạp không gian $\mathcal{O}(N^2)$ và thời gian $\mathcal{O}(N^3)$, gây quá tải nghiêm trọng trên tập dữ liệu lớn.
  3. Sự thiếu hụt khung tích hợp đặc trưng mức cao: Các mô hình RBF truyền thống chủ yếu phụ thuộc vào đặc trưng nông trích xuất thủ công, thiếu cơ chế liên kết động với các biểu diễn trừu tượng bất biến từ mạng nơ-ron tích chập (CNN).

Luận án đặt ra ba câu hỏi nghiên cứu và giả thuyết khoa học:

  • RQ1: Làm thế nào để rút gọn số lượng vectơ hỗ trợ $N_s$ về tập rút gọn $N_z$ ($N_z \ll N_s$) mà không làm suy giảm ý nghĩa phân lớp của siêu phẳng tối ưu?
    • Giả thuyết H1: Việc phân rã giá trị đơn (Singular Value Decomposition - SVD) trên không gian trọng số và nhân RBF cho phép xấp xỉ trực giao chuẩn vectơ pháp tuyến $w$, cực tiểu hóa khoảng cách giữa nghiệm rút gọn và nghiệm gốc.
  • RQ2: Cơ chế nào cho phép triệt tiêu chi phí nghịch đảo ma trận kích thước lớn trong quá trình tối đa hóa bằng chứng Bayes loại II của RVM?
    • Giả thuyết H2: Tái cấu trúc quy trình cập nhật siêu tham số $\alpha_i$ tuần tự kết hợp phân rã đại số tối ưu sẽ rút ngắn thời gian huấn luyện mà vẫn bảo toàn độ thưa và phân phối hậu nghiệm.
  • RQ3: Kiến trúc lai giữa biểu diễn học sâu và bộ phân lớp RBF rút gọn có mang lại hiệu năng vượt trội trên dữ liệu phi cấu trúc phức tạp hay không?
    • Giả thuyết H3: Mô hình lai tổng quát CNN-RBF tận dụng tầng trích chọn đặc trưng tự động của CNN kết hợp bộ phân lớp RBF rút gọn sẽ đạt độ chính xác cao hơn CNN thuần và thời gian thực thi nhanh hơn SVM/RVM truyền thống.

Phạm vi thực nghiệm của luận án bao quát 8 tập dữ liệu chuẩn đa dạng từ UCI Machine Learning Repository (DNA, Letter, Satimage, Shuttle, Vowel, Pendigits, USPS, MNIST với số chiều từ 9 đến 784, quy mô từ 990 đến 70.000 mẫu) cùng 3 bài toán ứng dụng thực tế: nhận dạng ngôn ngữ ký hiệu Auslan, nhận dạng cử chỉ người từ cảm biến Microsoft Kinect (MSRC-12), và phân loại hình ảnh thực vật (Oxford 17-Flowers, Oxford 102-Flowers).

Literature Review và Positioning

Khung lý thuyết của bài toán phân lớp dựa trên hàm cơ sở bán kính được định hình qua hai trường phái tính toán song song: trường phái lề cực đại (Frequentist Maximum-Margin) và trường phái suy luận Bayes xác suất (Bayesian Inference).

                      ┌────────────────────────────────────────┐
                      │    MÔ HÌNH RBF TRONG PHÂN LỚP DỮ LIỆU  │
                      └───────────────────┬────────────────────┘
                                          │
                  ┌───────────────────────┴───────────────────────┐
                  ▼                                               ▼
     ┌────────────────────────┐                      ┌────────────────────────┐
     │  TIẾP CẬN LỀ CỰC ĐẠI   │                      │  TIẾP CẬN XÁC SUẤT     │
     │      (SVM - RBF)       │                      │     BAYES (RVM)        │
     └────────────┬───────────┘                      └────────────┬───────────┘
                  │                                               │
        ┌─────────┴─────────┐                           ┌─────────┴─────────┐
        ▼                   ▼                           ▼                   ▼
┌───────────────┐   ┌───────────────┐           ┌───────────────┐   ┌───────────────┐
│Top-down Reduce│   │Bottom-up Merge│           │Cholesky/GPU   │   │Sequential ARD │
│ (Burges 1996) │   │ (Nguyen 2005) │           │(Yang Li 2013) │   │(Tipping 2003) │
└───────┬───────┘   └───────┬───────┘           └───────┬───────┘   └───────┬───────┘
        │                   │                           │                   │
        └─────────┬─────────┘                           └─────────┬─────────┘
                  ▼                                               ▼
     ┌────────────────────────┐                      ┌────────────────────────┐
     │    ĐỀ XUẤT LUẬN ÁN:    │                      │    ĐỀ XUẤT LUẬN ÁN:    │
     │      SimpSVM-SVD       │                      │        FastRVM         │
     │ (Tối ưu pha kiểm thử)  │                      │ (Tối ưu pha huấn luyện)│
     └────────────┬───────────┘                      └────────────┬───────────┘
                  │                                               │
                  └───────────────────────┬───────────────────────┘
                                          ▼
                      ┌────────────────────────────────────────┐
                      │    MÔ HÌNH LAI TỔNG QUÁT CNN-RBF       │
                      │ (Deep Representation + Sparse Kernel)  │
                      └────────────────────────────────────────┘

Trong nhánh nghiên cứu SVM, Vapnik (1995) cùng Cortes & Vapnik (1995) đã thiết lập nguyên lý giảm thiểu rủi ro cấu trúc (Structural Risk Minimization). Tuy nhiên, nhược điểm số lượng vectơ hỗ trợ lớn đã thúc đẩy các nghiên cứu rút gọn nghiệm. Burges (1996) khởi xướng phương pháp tập rút gọn (Reduced Set Method) theo tiếp cận top-down, tìm kiếm lặp các vectơ $\tilde{z}_m$ nhằm xấp xỉ nghiệm nguyên bản:

$$\min |\Psi - \sum_{m=1}^{N_z} \beta_m \phi(\tilde{z}_m)|^2$$

Schölkopf et al. (1999) mở rộng kỹ thuật này nhưng bộc lộ hạn chế nghiêm trọng: thuật toán tối ưu phi tuyến gradient descent dễ bị sa lầy vào các điểm cực tiểu cục bộ (local minima). Tang & Mazzoni (2006) đề xuất áp dụng giải thuật tiến hóa vi phân (Differential Evolution) để tìm kiếm vectơ rút gọn cho SVM đa lớp, nhưng tốc độ hội tụ rất chậm do không gian tìm kiếm đa cực trị. Ngược lại, tiếp cận bottom-up của Nguyen & Ho (2005) dựa trên cơ học tĩnh điện để gộp từng cặp vectơ hỗ trợ cùng lớp thành một vectơ tương đương giải quyết được bẫy cực tiểu địa phương, nhưng chỉ giới hạn trong bài toán nhị phân và làm méo mó ranh giới quyết định đa lớp.

Trong nhánh nghiên cứu RVM, Tipping (2001) giới thiệu mô hình Relevance Vector Machine áp dụng cơ chế xác định mức độ liên quan tự động (Automatic Relevance Determination - ARD) của MacKay (1992). RVM vượt trội hơn SVM ở khả năng đưa ra dự báo dưới dạng phân phối xác suất và nghiệm cực kỳ thưa ($N_{rv} \ll N_s$). Dẫu vậy, chi phí tính toán cập nhật ma trận $\mathbf{\Sigma} = (\mathbf{\Phi}^T \mathbf{B} \mathbf{\Phi} + \mathbf{A})^{-1}$ khiến RVM không thể mở rộng trên tập mẫu lớn. Tipping & Faul (2003) xây dựng thuật toán Fast RVM tuần tự (sequential learning), thêm bớt từng hàm cơ sở dựa trên phân tích đạo hàm hàm hợp lý biên lề $\mathcal{L}(\alpha)$. D’Souza, Vijayakumar & Schaal (2004) đề xuất xấp xỉ ma trận với chi phí $\mathcal{O}(N^2)$. Yang et al. (2013) song song hóa phân rã Cholesky trên GPU CUDA. Ha & Zhang (2013) sử dụng phân phối chuẩn ma trận nhưng chỉ áp dụng cho bài toán hồi quy (regression), chưa giải quyết trọn vẹn bài toán phân lớp đa lớp phi tuyến.

Về hướng kết hợp học sâu và bộ phân lớp lề cực đại, Niu & Suen (2012) đề xuất mô hình lai CNN-SVM cho nhận dạng chữ viết tay, thay thế tầng Softmax bằng SVM tuyến tính. Omara et al. (2018) kết hợp mạng VGG-M với phân tích chính tắc phân biệt (DCA) và SVM trong nhận dạng sinh trắc học mặt và tai. Shen et al. (2020) áp dụng mô hình RVM-CNN dự đoán tuổi thọ pin Lithium-ion nhưng chỉ dùng RVM để tăng cường dữ liệu đầu vào.

Luận án của Phạm Quốc Thắng định vị tại giao điểm then chốt: kết hợp giải tích ma trận đại số tuyến tính nâng cao (SVD) vào quy trình rút gọn nghiệm SVM để triệt tiêu hiện tượng sa lầy cực trị cục bộ; tái cấu trúc quy trình học xác suất Bayes nhanh FastRVM cho bài toán phân lớp; và tổng quát hóa mô hình lai Deep-RBF (CNN-SimpSVM, CNN-FastRVM) nhằm hợp nhất sức mạnh biểu diễn sâu với các bộ phân lớp lề cực đại và Bayes rút gọn.

Đóng góp lý thuyết và khung phân tích

Đóng góp cho lý thuyết

Luận án tạo ra bước tiến lý thuyết đáng kể thông qua việc mở rộng các định lý xấp xỉ không gian Hilbert tái tạo (Reproducing Kernel Hilbert Space - RKHS):

  1. Mở rộng lý thuyết xấp xỉ không gian đặc trưng lề cực đại: Luận án chứng minh rằng nghiệm của siêu phẳng phân lớp $w = \sum_{i=1}^{N_s} \alpha_i y_i \phi(x_i)$ có thể được biểu diễn chính xác thông qua không gian con sinh bởi các vectơ trực giao rút ra từ phép phân rã giá trị đơn (SVD) của ma trận hạt nhân. Thay vì giải bài toán tối ưu phi tuyến phi lồi đa biến như Burges (1996), việc áp dụng SVD cho phép phân tách độc lập việc tìm vị trí các điểm cơ sở rút gọn $\tilde{x}_m$ và tối ưu hóa vector trọng số $\beta$. Điều này chứng minh rằng số chiều hiệu dụng của mặt phân cách SVM thực chất nhỏ hơn rất nhiều so với số lượng $N_s$ lý thuyết.

  2. Chuẩn hóa quy trình tối ưu bằng chứng Bayes loại II trong FastRVM: Luận án mở rộng khung lý thuyết xấp xỉ Laplace (Laplace Approximation Framework) cho hàm likelihood Bernoulli trong bài toán phân lớp đa lớp:

$$p(y|w) = \prod_{i=1}^N \sigma(w^T \phi(x_i))^{y_i} [1 - \sigma(w^T \phi(x_i))]^{1 - y_i}$$

Bằng cách thiết lập điều kiện hội tụ chặt chẽ cho vector siêu tham số $\alpha = (\alpha_1, \alpha_2, \dots, \alpha_M)^T$, thuật toán loại bỏ dứt điểm các thành phần cơ sở có $\alpha_i \to \infty$ ngay trong từng chu kỳ lặp, giúp giảm số chiều ma trận Hessian $\mathbf{H} = \mathbf{\Phi}^T \mathbf{B} \mathbf{\Phi} + \mathbf{A}$ từ sớm.

  1. Thiết lập mô hình lai tổng quát CNN-RBF: Luận án chứng minh tính tương thích toán học giữa ánh xạ đặc trưng phi tuyến sâu $g_\Theta: \mathbb{R}^D \to \mathbb{R}^d$ của CNN với hàm nhân RBF $K(g_\Theta(x), g_\Theta(x')) = \exp(-\gamma |g_\Theta(x) - g_\Theta(x')|^2)$. Ánh xạ này bảo toàn tính bất biến đối với các phép biến dạng affine và dịch chuyển đàn hồi trong không gian ảnh thô, đồng thời chuẩn hóa bề mặt quyết định của bộ phân lớp lề cực đại.
┌────────────────────────────────────────────────────────────────────────────────────────┐
│                        KIẾN TRÚC MÔ HÌNH LAI TỔNG QUÁT CNN-RBF                         │
└────────────────────────────────────────────────────────────────────────────────────────┘
 [Dữ liệu đầu vào: Ảnh thô / Tín hiệu cảm biến]
                         │
                         ▼
 ┌──────────────────────────────────────────────────────────────┐
 │             MẠNG NƠ-RON TÍCH CHẬP (CNN BACKBONE)             │
 │  ┌────────────────────────┐      ┌────────────────────────┐  │
 │  │ Convolutional Filters  │ ───► │   Pooling & Activation │  │
 │  └────────────────────────┘      └────────────────────────┘  │
 │                               │                              │
 │                               ▼                              │
 │                  ┌────────────────────────┐                  │
 │                  │ Fully Connected Layer  │                  │
 │                  └────────────────────────┘                  │
 └───────────────────────────────┬──────────────────────────────┘
                                 │
                 Vector đặc trưng sâu mức cao: g_Θ(x)
                                 │
                                 ▼
 ┌──────────────────────────────────────────────────────────────┐
 │            BỘ HỌC PHÂN LỚP DỰA TRÊN MÔ HÌNH RBF RÚT GỌN      │
 │                                                              │
 │   ┌───────────────────────────┐  ┌────────────────────────┐  │
 │   │        SimpSVM-SVD        │  │        FastRVM         │  │
 │   │  (Giảm số SV qua SVD,     │  │ (Tối ưu hóa Bayes ARD, │  │
 │   │   tăng tốc pha kiểm thử)  │  │ tăng tốc pha train)    │  │
 │   └─────────────┬─────────────┘  └───────────┬────────────┘  │
 └─────────────────┼────────────────────────────┼───────────────┘
                   │                            │
                   └─────────────┬──────────────┘
                                 ▼
                     [Dự báo nhãn phân lớp Y*]

Khung phân tích độc đáo

Khung phân tích của luận án tích hợp đồng thời 3 trường phái lý thuyết:

  • Lý thuyết tối ưu lồi và bất đẳng thức KKT (Karush-Kuhn-Tucker Conditions) kiểm soát biên độ siêu phẳng phân tách mềm (soft-margin hyperplane).
  • Lý thuyết ước lượng bằng chứng MacKay và phân phối xác suất Bernoulli-Gaussian điều khiển độ thưa tự nhiên của các vector liên quan.
  • Lý thuyết biểu diễn bất biến cục bộ (Local Invariance Representation) từ kiến trúc tích chập sâu.

Điều kiện biên lý thuyết (Boundary Conditions): Thuật toán SimpSVM-SVD đạt hiệu quả tối ưu khi ma trận Gram $K_{i,j}$ của các vectơ hỗ trợ có phổ giá trị đơn suy giảm nhanh (fast decaying singular values), đảm bảo năng lượng tập trung ở $k$ thành phần chính đầu tiên. Đối với FastRVM, điều kiện biên yêu cầu ma trận thông tin Fisher cục bộ duy trì tính xác định dương tại lân cận nghiệm xấp xỉ Laplace.

Phương pháp nghiên cứu tiên tiến

Thiết kế nghiên cứu

Luận án tuân thủ triết lý nghiên cứu thực chứng (Positivism) với mô hình thực nghiệm định lượng quy mô lớn. Phương pháp nghiên cứu được chia làm hai giai đoạn: xây dựng mô hình toán học giải thuật và kiểm chứng thực nghiệm chéo (Cross-Validation).

┌─────────────────────────────────────────────────────────────────────────────────────────┐
│                           QUY TRÌNH THỰC NGHIỆM VÀ ĐÁNH GIÁ                             │
└─────────────────────────────────────────────────────────────────────────────────────────┘
  [Thu thập dữ liệu: UCI Benchmarks, Auslan Sensor, Kinect MSRC-12, Oxford Flowers]
                                          │
                                          ▼
  [Tiền xử lý, chuẩn hóa dữ liệu & Trích xuất đặc trưng (Hand-crafted / ResNet-18)]
                                          │
                                          ▼
  [Phân chia tập mẫu: 5-Fold Cross Validation & Grid-Search tối ưu siêu tham số (C, γ)]
                                          │
                                          ▼
  ┌───────────────────────────────────────┴───────────────────────────────────────┐
  │                                                                               │
  ▼                                                                               ▼
┌─────────────────────────────────┐             ┌─────────────────────────────────┐
│      NHÁNH TỐI ƯU HÓA SVM       │             │      NHÁNH TỐI ƯU HÓA RVM       │
│ 1. Huấn luyện SVM gốc O(N_s)    │             │ 1. Thiết lập mô hình Bayes      │
│ 2. Trích xuất ma trận hạt nhân  │             │ 2. Xấp xỉ Laplace ma trận B, H  │
│ 3. Áp dụng SimpSVM-GD vs SVD    │             │ 3. Cập nhật lặp ARD & loại bỏ α │
│ 4. Đo lường tốc độ & sai số     │             │ 4. Đo lường thời gian huấn luyện│
└────────────────┬────────────────┘             └────────────────┬────────────────┘
                 │                                               │
                 └────────────────────────┬──────────────────────┘
                                          ▼
  [Đánh giá đa tiêu chí: Test Accuracy, F1-Score, Tỷ lệ rút gọn SV/RV, Tốc độ suy diễn]

Quy trình nghiên cứu rigorous

  1. Chiến lược lấy mẫu và kiểm định: Áp dụng kỹ thuật kiểm tra chéo 5-fold (5-fold cross-validation) trên toàn bộ các tập dữ liệu thực nghiệm nhằm triệt tiêu hiện tượng quá khớp (overfitting) và đảm bảo tính khách quan thống kê.
  2. Giao thức tối ưu siêu tham số: Sử dụng thuật toán tìm kiếm trên lưới (Grid Search) trong không gian logarit để xác định cặp tham số tối ưu $(C, \gamma)$ cho hàm nhân RBF kernel: $C \in [2^{-5}, 2^{15}]$, $\gamma \in [2^{-15}, 2^3]$.
  3. Quy trình thuật toán SimpSVM-SVD:
    • Bước 1: Huấn luyện bộ phân lớp SVM gốc, thu được tập vectơ hỗ trợ ${x_i}_{i=1}^{N_s}$ và trọng số tương ứng ${\alpha_i}$.
    • Bước 2: Xây dựng ma trận trọng số - đặc trưng kết hợp trong không gian RBF kernel.
    • Bước 3: Thực hiện phân tích SVD ma trận thành $\mathbf{U} \mathbf{\Sigma} \mathbf{V}^T$, chọn $N_z$ giá trị đơn lớn nhất để tái thiết lập tập vectơ cơ sở rút gọn ${\tilde{z}m}{m=1}^{N_z}$ với $N_z \ll N_s$.
    • Bước 4: Giải hệ phương trình tuyến tính cực tiểu hóa khoảng cách $|w - \tilde{w}|^2$ để xác định hệ số mới ${\beta_m}$.
  4. Quy trình thuật toán FastRVM:
    • Khởi tạo với một hàm cơ sở duy nhất.
    • Tính toán biến đổi phân tích Cholesky cục bộ trên ma trận Hessian rút gọn thay vì đảo ma trận toàn cục.
    • Sử dụng tiêu chuẩn đơn điệu hóa hàm hợp lý biên lề $\mathcal{L}(\alpha_i)$ để quyết định bổ sung, cập nhật hoặc loại bỏ vĩnh viễn hàm cơ sở khỏi mô hình.

Data và phân tích

Môi trường thực nghiệm được lập trình cài đặt bằng ngôn ngữ C/C++ (sử dụng thư viện LIBSVM tối ưu hóa) và MATLAB R2020b, tích hợp GPU CUDA cho các tác vụ trích xuất đặc trưng sâu từ mạng ResNet-18 và VGG.

Bảng tổng hợp đặc tính các tập dữ liệu chuẩn UCI và dữ liệu chuyên ngành trong luận án:

Tập dữ liệu Số chiều đặc trưng Số lớp Số mẫu huấn luyện Số mẫu kiểm thử Bản chất miền dữ liệu
DNA 180 3 1.400 1.186 Sinh học phân tử (Nucleotide sequences)
Letter 16 26 10.500 5.000 Nhận dạng 26 ký tự chữ cái tiếng Anh
Satimage 36 6 3.104 2.000 Viễn thám vệ tinh đa phổ quang học
Shuttle 9 7 30.450 14.500 Cảm biến hành trình tàu con thoi NASA
Vowel 10 11 528 462 Âm học phát âm nguyên âm tiếng Anh
Pendigits 16 10 7.494 3.498 Chữ số viết tay từ 44 đối tượng
USPS 256 10 7.291 2.007 Ảnh quét mã bưu chính Bưu điện Mỹ
MNIST 784 10 60.000 10.000 Bộ dữ liệu chuẩn chữ số viết tay 28x28
Auslan 22 kênh cảm biến 95 1.465 Phân chia 5-fold Cảm biến găng tay CyberGlove ngôn ngữ ký hiệu
MSRC-12 Cấu trúc khung xương 3D 12 6.244 chuỗi Phân chia 5-fold Cử chỉ động từ cảm biến chiều sâu Kinect
Oxford Flowers Trích đặc trưng ResNet 17 / 102 1.360 / 8.189 Phân chia chuẩn Hình ảnh quang học thực vật độ phân giải cao

Phát hiện đột phá và implications

Những phát hiện then chốt

Các thực nghiệm phân tích đối sánh chi tiết trong luận án chỉ ra 4 phát hiện bước ngoặt:

┌────────────────────────────────────────────────────────────────────────────────────────┐
│               SO SÁNH ĐỘ THƯA VÀ HIỆU NĂNG SUY DIỄN CÁC THUẬT TOÁN                     │
└────────────────────────────────────────────────────────────────────────────────────────┘
  Số lượng hàm cơ sở (Vectơ hỗ trợ SV / Vectơ liên quan RV):
  SVM Gốc      : [████████████████████████████████████████] 100% (Baseline - N_s lớn)
  SimpSVM-GD   : [██████████████████] 45% (Chậm hội tụ, dễ kẹt cực tiểu địa phương)
  SimpSVM-SVD  : [████████] 20% - 35% (N_z giảm mạnh, tăng tốc pha kiểm thử 3x-6x)
  RVM2         : [████] 10% (Huấn luyện chậm với ma trận O(N^3))
  FastRVM      : [███] 8% - 12% (Huấn luyện nhanh vượt bậc, độ thưa tối đa)
  ────────────────────────────────────────────────────────────────────────────────────────
  Thời gian thực thi pha kiểm thử (Inference Latency per Sample):
  SVM Gốc      : [──────────────────────────────] 100% (Cao do N_s lớn)
  SimpSVM-SVD  : [──────] Giảm 65% - 82% thời gian tính toán hàm nhân K(x, x_i)
  1. SimpSVM-SVD đạt tỷ lệ nén vector hỗ trợ vượt trội mà không làm suy giảm độ chính xác: Trên các tập dữ liệu chuẩn UCI, SimpSVM-SVD giúp cắt giảm từ 60% đến 80% số lượng vectơ hỗ trợ so với mô hình SVM ban đầu. Cụ thể trên tập dữ liệu DNA (180 chiều), số lượng SV giảm từ 612 xuống còn 145 vectơ rút gọn, trong khi độ chính xác kiểm thử chỉ dao động giảm nhẹ 0.35% (từ 95.45% xuống 95.10%). Thời gian xử lý pha kiểm thử thực tế tăng tốc từ 3.2 đến 5.8 lần.
  2. Khắc phục triệt để hiện tượng kẹt cực trị địa phương của giải thuật Gradient Descent: Phương pháp SimpSVM-GD (Gradient Descent) truyền thống thường xuyên dừng ở các nghiệm dưới tối ưu khi số chiều dữ liệu tăng cao (như USPS 256 chiều hay MNIST 784 chiều). Ngược lại, SimpSVM-SVD nhờ phép phân tích trực giao đại số cho kết quả đơn trị, ổn định tuyệt đối qua các lần chạy lặp và rút ngắn thời gian huấn luyện rút gọn tới 4.5 lần so với SimpSVM-GD.
  3. FastRVM đẩy nhanh tốc độ huấn luyện từ 2.5 đến 4.8 lần so với RVM truyền thống: Trên tập dữ liệu cử chỉ MSRC-12 và Shuttle, thuật toán FastRVM đề xuất giảm thời gian huấn luyện trung bình 68% so với giải pháp RVM2 tiêu chuẩn của Tipping & Faul, đồng thời duy trì số lượng vector liên quan (Relevance Vectors) ở mức cực kỳ thưa thớt (chỉ bằng khoảng 5% đến 12% số lượng SV của SVM).
  4. Mô hình lai CNN-RBF vượt trội trên dữ liệu phi cấu trúc: Trên tập dữ liệu Oxford 17-Flowers và Oxford 102-Flowers, mô hình kết hợp trích chọn đặc trưng ResNet-18 với bộ phân lớp FastRVM (CNN-FastRVM) và SimpSVM-SVD (CNN-SimpSVM-SVD) đạt độ chính xác tương ứng 96.8% và 91.4%, vượt trội hơn hẳn mô hình CNN nguyên bản sử dụng tầng phân lớp Softmax truyền thống (đạt 94.2% và 88.7%) và mô hình SVM thủ công dùng đặc trưng màu sắc/kết cấu nông.

Implications đa chiều

  • Về mặt học thuật: Khẳng định tính khả thi của việc giải cấu trúc không gian hạt nhân Hilbert đa chiều thông qua các phép biến đổi đại số tuyến tính kinh điển, mở ra hướng nghiên cứu mới về việc nén mô hình học máy (model compression) dựa trên nền tảng toán học tiền định thay vì các kỹ thuật heuristic ngẫu nhiên.
  • Về mặt công nghệ và công nghiệp: Tạo tiền đề kỹ thuật then chốt để triển khai các thuật toán học máy phức tạp lên các vi điều khiển nhúng, thiết bị biên Edge AI và hệ thống cảm biến thông minh (Smart Sensors) vốn bị hạn chế khắt khe về bộ nhớ RAM và năng lượng tiêu thụ.
  • Về mặt ứng dụng xã hội: Hệ thống nhận dạng ngôn ngữ ký hiệu Auslan và cử chỉ MSRC-12 đạt tốc độ phản hồi tức thời (< 15ms/mẫu) với độ chính xác > 94%, cung cấp giải pháp công nghệ trợ năng mạnh mẽ hỗ trợ cộng đồng người khiếm thính giao tiếp hòa nhập xã hội.

Limitations và Future Research

Nhằm duy trì tính trung thực học thuật và phản ánh khách quan ranh giới nghiên cứu, luận án làm rõ các hạn chế nội tại:

  1. Chi phí phân rã ma trận SVD ban đầu: Mặc dù SimpSVM-SVD tối ưu hóa vượt bậc pha kiểm thử, quá trình phân tích SVD trên ma trận kích thước lớn trong pha huấn luyện rút gọn vẫn đòi hỏi bộ nhớ mở rộng khi số lượng SV ban đầu vượt quá $10^4$ mẫu.
  2. Hạn chế về tính thích nghi tham số hạt nhân: Nghiên cứu hiện sử dụng siêu tham số $\gamma$ cố định cho toàn bộ các hàm cơ sở RBF trong một mô hình, chưa triển khai cơ chế thích nghi cục bộ (local adaptive bandwidth) cho từng cụm không gian dữ liệu riêng biệt.
  3. Mô hình lai chưa thực hiện huấn luyện đồng thời đầu-cuối (End-to-End Fine-Tuning): Trong mô hình CNN-RBF đề xuất, mạng CNN đóng vai trò bộ trích xuất đặc trưng tĩnh (feature extractor) sau khi đã tiền huấn luyện, việc lan truyền ngược đạo hàm sai số (backpropagation) từ hàm mục tiêu RBF xuyên suốt trở lại các tầng tích chập chưa được tối ưu hóa đồng thời.

Chương trình nghiên cứu tiếp nối định hướng:

  • Nghiên cứu thuật toán SVD gia tăng (Incremental SVD) và SVD ngẫu nhiên (Randomized SVD) để mở rộng khả năng rút gọn trực tuyến trên luồng dữ liệu thời gian thực (streaming data).
  • Tích hợp hàm mất mát lề cực đại khả vi (differentiable max-margin loss) trực tiếp vào đồ thị tính toán của PyTorch/TensorFlow để thực hiện huấn luyện end-to-end cho mô hình CNN-RBF.
  • Phát triển mô hình RBF rút gọn trên các kiến trúc học sâu tiên tiến hơn như Vision Transformer (ViT) và Graph Neural Networks (GNN).

Tác động và ảnh hưởng

Luận án mang lại giá trị ảnh hưởng sâu rộng trên nhiều bình diện:

┌────────────────────────────────────────────────────────────────────────────────────────┐
│                        CÁC TRỤ CỘT TÁC ĐỘNG CỦA LUẬN ÁN                                │
└────────────────────────────────────────────────────────────────────────────────────────┘
 ┌───────────────────────────┐      ┌───────────────────────────┐
 │   HỌC THUẬT & LÝ THUYẾT   │      │   CÔNG NGHỆ NHÚNG & IOT   │
 │ • Cung cấp phương pháp    │      │ • Giảm độ trễ suy diễn    │
 │   rút gọn hạt nhân bằng   │      │   xuống < 15ms trên chip  │
 │   giải tích ma trận SVD   │      │ • Triển khai Edge AI      │
 └─────────────┬─────────────┘      └─────────────┬─────────────┘
               │                                  │
               └────────────────┬─────────────────┘
                                │
 ┌──────────────────────────────┴───────────────────────────────┐
 │                     GIÁ TRỊ XÃ HỘI THỰC TIỄN                 │
 │ • Hệ thống nhận dạng ngôn ngữ ký hiệu Auslan và cử chỉ Kinect│
 │ • Hỗ trợ thiết bị trợ thính, giao tiếp cho người khuyết tật  │
 └──────────────────────────────────────────────────────────────┘
  • Tác động học thuật: Các công trình công bố từ luận án (bao gồm các bài báo trên tạp chí khoa học chuyên ngành và kỷ yếu hội nghị quốc tế uy tín) đóng góp lời giải rõ ràng cho bài toán kinh điển về cân bằng giữa độ thưa và độ chính xác trong lý thuyết học thống kê.
  • Chuyển đổi công nghiệp: Cung cấp giải pháp phần mềm tối ưu cho các dây chuyền phân loại sản phẩm quang học tốc độ cao trong công nghiệp sản xuất linh kiện điện tử và viễn thám tài nguyên môi trường.
  • Lợi ích xã hội: Thúc đẩy sự phát triển của các công nghệ giao tiếp người - máy tự nhiên (Human-Computer Interaction - HCI) thân thiện, chi phí thấp cho các trung tâm bảo trợ y tế và giáo dục đặc biệt.

Đối tượng hưởng lợi

  • Nghiên cứu sinh & Nhà khoa học máy tính: Tiếp cận khung tham chiếu toán học chặt chẽ về cách thức kết hợp giữa giải tích ma trận đại số (SVD, Cholesky) và lý thuyết học máy hạt nhân (Kernel Methods).
  • Kỹ sư R&D Hệ thống Nhúng & Trí tuệ nhân tạo (AI Engineers): Sở hữu giải thuật cụ thể (SimpSVM-SVD, FastRVM) để tối ưu hóa mô hình phân lớp, nén kích thước thực thi trên các phần cứng chuyên biệt như Raspberry Pi, Jetson Nano hay vi điều khiển STM32.
  • Doanh nghiệp phát triển thiết bị Y tế & Trợ năng: Ứng dụng trực tiếp mã nguồn và quy trình xử lý dữ liệu nhận dạng cử chỉ/ký hiệu vào các thiết bị hỗ trợ vận động và giao tiếp thông minh.

Câu hỏi chuyên sâu

1. Đóng góp lý thuyết độc đáo nhất của luận án là gì và nó mở rộng lý thuyết nào? Trả lời: Đóng góp độc đáo nhất là việc vận dụng giải tích phân rã giá trị đơn (SVD) vào không gian lề cực đại của SVM để giải quyết triệt để bài toán rút gọn nghiệm tập vector hỗ trợ (Reduced Set Problem). Công trình này mở rộng trực tiếp Lý thuyết Giảm thiểu Rủi ro Cấu trúc của Vapnik (1995) và phương pháp xấp xỉ tập rút gọn của Burges (1996), chuyển đổi một bài toán tối ưu phi tuyến đa cực trị thành bài toán đại số tuyến tính có nghiệm đóng tiền định và ổn định.

2. Điểm cải tiến phương pháp luận của SimpSVM-SVD so với các nghiên cứu quốc tế tiền nhiệm (Burges 1996, Tang & Mazzoni 2006)? Trả lời: Burges (1996) sử dụng tối ưu hóa dựa trên Gradient Descent cục bộ, dễ rơi vào bẫy cực tiểu địa phương khi số chiều tăng. Tang & Mazzoni (2006) dùng thuật toán tiến hóa vi phân với chi phí lặp rất lớn và tốc độ hội tụ chậm. SimpSVM-SVD phân tích trực tiếp phổ giá trị đơn của ma trận hạt nhân, loại bỏ hoàn toàn quá trình dò tìm ngẫu nhiên, giúp giảm thời gian tạo tập rút gọn gấp 4.5 lần và đảm bảo độ chính xác phân lớp không bị suy giảm quá 1.2%.

3. Phát hiện thực nghiệm nào gây bất ngờ nhất trong luận án? Trả lời: Đó là hiện tượng "nghịch lý độ thưa" trên tập dữ liệu DNA và Satimage: khi loại bỏ tới 76% số lượng vectơ hỗ trợ bằng SimpSVM-SVD, sai số kiểm thử (test error) không những không tăng mà còn giảm nhẹ 0.15% trên một số fold thử nghiệm. Lý do lý thuyết là phép lọc SVD đã triệt tiêu các thành phần nhiễu ngoại lai (outliers/noise vectors) nằm sát biên phân chia, giúp siêu phẳng rút gọn có độ khái quát hóa tốt hơn cả nghiệm ban đầu.

4. Giao thức tái lập thực nghiệm (Replication Protocol) được cung cấp như thế nào? Trả lời: Luận án chuẩn hóa toàn bộ quy trình: sử dụng 8 tập dữ liệu công khai từ UCI kèm tham số phân chia train/test rõ ràng; công bố đầy đủ dải tham số tìm kiếm lưới $(C, \gamma)$; mô tả chi tiết giả mã (pseudocode) cho hai thuật toán SimpSVM-SVD và FastRVM; và tích hợp thư viện LIBSVM chuẩn trên môi trường C++/MATLAB.

5. Chương trình nghị sự 10 năm tiếp theo từ kết quả luận án? Trả lời: Xây dựng khung kiến trúc học máy lai tự động (Auto-Hybrid Learning) có khả năng tự động lựa chọn giữa biểu diễn sâu (Deep Representation) và hạt nhân RBF thưa tùy thuộc vào độ phức tạp của luồng dữ liệu thời gian thực trên các thiết bị tính toán lượng tử hoặc chip neuromorphic thế hệ mới.

Kết luận

Luận án tiến sĩ của NCS. Phạm Quốc Thắng đã hoàn thành xuất sắc các mục tiêu nghiên cứu với các dấu ấn học thuật cốt lõi:

  1. Đề xuất thành công thuật toán SimpSVM-SVD: Rút gọn từ 60% đến 80% số lượng vectơ hỗ trợ, tăng tốc độ suy diễn pha kiểm thử từ 3 đến 6 lần mà vẫn bảo toàn độ chính xác phân lớp.
  2. Đề xuất thành công thuật toán FastRVM: Tối ưu hóa quy trình suy luận Bayes rút gọn, giảm thời gian huấn luyện tới 68% và cho phép RVM mở rộng hiệu quả trên các tập dữ liệu quy mô lớn hơn.
  3. Xây dựng khung kiến trúc lai tổng quát CNN-RBF: Hợp nhất năng lực biểu diễn đặc trưng tự động của học sâu với độ chính xác và độ thưa của bộ phân lớp RBF.
  4. Thực nghiệm đa diện, quy chuẩn: Kiểm chứng toàn diện trên 8 bộ dữ liệu chuẩn quốc tế UCI và 3 bài toán thực tiễn phức tạp (Auslan, MSRC-12, Oxford Flowers).
  5. Mở ra 3 hướng nghiên cứu mới: Học máy nén cho thiết bị biên (Edge ML), tối ưu hóa hạt nhân thích nghi cục bộ, và học sâu lề cực đại end-to-end.
  6. Giá trị ứng dụng thực tiễn cao: Cung cấp giải pháp công nghệ hoàn chỉnh cho các bài toán nhận dạng cử chỉ, ngôn ngữ ký hiệu và thị giác máy tính với độ trễ siêu thấp.