Luận án Tiến sĩ - Nghiên cứu phát triển kỹ thuật học máy phát hiện và phân lớp trôi tại Trường Đại học Công nghệ, Đại học Quốc gia Hà Nội
Sinh viên PhD UET nghiên cứu đột phá về AI & học máy. Ứng dụng thực tiễn, công bố quốc tế. Khám phá tiềm năng công nghệ mới.
Năm xuất bản
Số trang
143
Thời gian đọc
22 phút
Lượt xem
0
Lượt tải
0
Phí lưu trữ
40 Point
Tổng quan nhanh
- Chủ đề:
- 1. Tổng quan kỹ thuật phát hiện và phân lớp trôi khái niệm
- Số trang:
- 143 trang
- Trường:
- Trường Đại học Công nghệ, Đại học Quốc gia Hà Nội
- Chuyên ngành:
- Hệ thống thông tin
- Tác giả:
- Nguyễn Khánh Tùng
- Năm:
- 2025
Tóm tắt nội dung luận án
I. Tổng quan kỹ thuật phát hiện và phân lớp trôi khái niệm
Trôi khái niệm (concept drift) là thách thức lớn trong khai phá dữ liệu luồng. Dữ liệu luồng liên tục thay đổi theo thời gian thực. Phân phối xác suất của dữ liệu không cố định. Hiện tượng này làm suy giảm nghiêm trọng độ chính xác của các mô hình học máy. Các hệ thống dự báo cần khả năng phát hiện trôi khái niệm nhanh chóng và chuẩn xác. Việc xử lý không chỉ dừng lại ở phát hiện thời điểm xảy ra trôi. Hệ thống cần phân lớp dạng trôi để hiểu rõ bản chất biến đổi. Dựa vào đó, mô hình áp dụng chiến lược thích nghi phù hợp nhất. Quá trình này giúp duy trì độ tin cậy của thuật toán dự đoán. Nghiên cứu tập trung giải quyết toàn diện bài toán phát hiện và phân loại biến đổi dữ liệu. Mục tiêu hướng tới tối ưu hóa hiệu năng mô hình trên các luồng dữ liệu biến động phức tạp.
1.1. Bản chất hiện tượng trôi khái niệm và trôi dữ liệu
Hiện tượng trôi dữ liệu (data drift) xảy ra khi phân phối xác suất đầu vào thay đổi. Khái niệm trôi khái niệm xảy ra khi mối quan hệ giữa biến đầu vào và biến mục tiêu biến đổi. Sự biến đổi này khiến các mô hình học máy bị lỗi thời. Dữ liệu thực tế phản ánh hành vi người dùng luôn thay đổi. Hệ thống cảm biến cũng chịu ảnh hưởng bởi yếu tố môi trường. Quá trình nhận diện trôi khái niệm đòi hỏi giám sát liên tục luồng dữ liệu. Giám sát tỷ lệ lỗi phân lớp là phương pháp tiếp cận phổ biến. Giám sát phân phối dữ liệu đầu vào cung cấp cảnh báo sớm đáng tin cậy. Hiểu rõ sự khác biệt giữa các dạng trôi giúp xây dựng cơ chế thích ứng chính xác. Mô hình học máy cần cập nhật tham số kịp thời để duy trì hiệu năng cao.
1.2. Phân loại các dạng trôi đột ngột và trôi dần dần
Các dạng biến đổi trên luồng dữ liệu rất đa dạng. Trôi đột ngột xuất hiện khi phân phối dữ liệu thay đổi tức thì tại một thời điểm. Dạng trôi này thường bắt nguồn từ các sự kiện bất ngờ hoặc thay đổi chính sách lớn. Trôi dần dần diễn ra khi phân phối mới xuất hiện song song với phân phối cũ. Tần suất của phân phối mới tăng dần theo thời gian cho đến khi thay thế hoàn toàn phân phối cũ. Ngoài ra còn có trôi gia tăng và trôi chu kỳ lặp lại. Phân lớp dạng trôi cung cấp thông tin nền tảng để lựa chọn chiến lược thích nghi. Trôi đột ngột đòi hỏi khởi tạo lại mô hình hoặc làm mới hoàn toàn tập huấn luyện. Trôi dần dần yêu cầu cơ chế cập nhật trọng số từng bước một cách linh hoạt.
1.3. Thách thức nghiên cứu covariate shift trong học máy
Hiện tượng covariate shift là một trường hợp đặc biệt của trôi dữ liệu. Ở hiện tượng này, phân phối xác suất của dữ liệu đầu vào thay đổi. Tuy nhiên, phân phối xác suất có điều kiện của nhãn đầu ra không thay đổi. Mô hình học máy vẫn gặp khó khăn lớn khi đối mặt với sự dịch chuyển này. Miền không gian dữ liệu mới khiến thuật toán dự đoán thiếu tự tin. Việc đánh giá và phát hiện đòi hỏi các drift detection methods chuyên biệt. Các phương pháp kiểm thử phân phối thống kê cần hoạt động với độ trễ thấp. Khả năng phát hiện sớm giúp ngăn ngừa sai lệch dự đoán trên diện rộng. Xử lý tốt dịch chuyển dữ liệu đầu vào là tiền đề để xây dựng hệ thống học máy bền vững.
II. Phương pháp phát hiện trôi khái niệm nâng cao E ERICS
Mô hình ERICS là giải pháp phát hiện trôi khái niệm dựa trên học kết hợp phân phối tham số. Tuy nhiên, mô hình gốc bộc lộ hạn chế khi gặp các biến đổi phức tạp. Quá trình phát hiện trôi đột ngột và trôi dần dần cần độ chính xác cao hơn. Mô hình đề xuất E-ERICS khắc phục nhược điểm này qua cơ chế tối ưu siêu tham số. E-ERICS phân tích kỹ lưỡng các tham số phân phối xác suất trên luồng dữ liệu. Giải pháp giúp giảm thiểu tối đa tỷ lệ cảnh báo sai trên dữ liệu tĩnh. Đồng thời, mô hình tăng cường độ nhạy khi xuất hiện các biến động thực sự. Cấu trúc học kết hợp nâng cao khả năng phát hiện trôi khái niệm trên nhiều kịch bản luồng dữ liệu khác nhau.
2.1. Hạn chế của mô hình gốc ERICS trong thực tế
Mô hình ERICS sử dụng phân phối tham số để theo dõi luồng dữ liệu. Khi dữ liệu biến động phức tạp, ERICS gặp khó khăn trong việc cân bằng độ nhạy. Tỷ lệ cảnh báo trôi giả còn ở mức đáng kể trên các bộ dữ liệu có độ nhiễu cao. Việc thiết lập siêu tham số cố định làm giảm khả năng thích ứng linh hoạt. Thời gian phát hiện trôi khái niệm bị chậm trễ đối với dạng trôi dần dần. Mô hình cần cải tiến pha tối ưu hóa siêu tham số để thích nghi tốt hơn. Việc điều chỉnh động giúp thuật toán nhận biết chính xác các ranh giới biến đổi. Cải tiến cấu trúc mô hình gốc là bước đi cần thiết nhằm nâng cao hiệu năng phát hiện trôi.
2.2. Cơ chế tối ưu siêu tham số của mô hình E ERICS
Mô hình E-ERICS tích hợp pha tối ưu hóa siêu tham số tự động. Cơ chế này tìm kiếm không gian tham số tối ưu cho từng phân phối dữ liệu cụ thể. E-ERICS tối ưu hóa độ dài cửa sổ quan sát và ngưỡng kích hoạt cảnh báo. Thuật toán nâng cao khả năng nhận diện hiện tượng trôi đột ngột ngay khi mới phát sinh. Cấu trúc học kết hợp tăng cường độ ổn định cho quá trình phân tích luồng. Tỷ lệ báo động giả giảm rõ rệt so với các phương pháp truyền thống. Độ trễ phát hiện được rút ngắn đáng kể trên cả dữ liệu nhân tạo và dữ liệu thực nghiệm. Mô hình duy trì hiệu quả hoạt động ổn định trong môi trường luồng dữ liệu biến động cao.
2.3. Hiệu năng mô hình ERICS 3 trên luồng dữ liệu trôi
Phiên bản cải tiến ERICS+3 được thiết kế chuyên biệt cho hiện tượng trôi dần dần. Dạng trôi này có đặc tính biến đổi chậm và xen kẽ nhiều phân phối. ERICS+3 sử dụng bộ ba cơ chế kết hợp để theo dõi chi tiết quá trình dịch chuyển. Mô hình ghi nhận chính xác giai đoạn bắt đầu, quá trình diễn biến và thời điểm kết thúc trôi. Kết quả thực nghiệm cho thấy ERICS+3 vượt trội về độ chính xác và độ hồi đáp. Các drift detection methods tiên tiến được so sánh để khẳng định ưu thế của ERICS+3. Khả năng phát hiện chuẩn xác các giai đoạn chuyển tiếp mang lại thông tin giá trị cho mô hình phân lớp.
III. Mô hình phân lớp dạng trôi theo cấu trúc VAR WIND
Phân lớp dạng trôi đóng vai trò then chốt trong việc định hình chiến lược thích ứng mô hình. Mô hình VAR-WIND được phát triển dựa trên nền tảng mạng nguyên mẫu học ít mẫu. VAR-WIND giải quyết bài toán phân biệt trôi đột ngột, trôi dần dần và trôi gia tăng. Điểm nổi bật của VAR-WIND nằm ở cơ chế quản lý cửa sổ dữ liệu biến đổi. Các chiến lược cửa sổ được tùy biến linh hoạt theo từng đặc thù biến đổi của luồng. Việc áp dụng kiến trúc mạng nguyên mẫu giúp mô hình nhận diện chính xác với số lượng mẫu hạn chế. VAR-WIND nâng cao hiệu quả phân lớp dạng trôi trên cả luồng dữ liệu chuẩn và luồng có độ nhiễu cao.
3.1. Kiến trúc mạng nguyên mẫu trong phân lớp trôi
Mạng nguyên mẫu học ít mẫu là công cụ mạnh mẽ để trích xuất biểu diễn đặc trưng. Mô hình ánh xạ các chuỗi dữ liệu trôi vào không gian nhúng đồng nhất. Tại không gian này, mỗi dạng trôi được đại diện bởi một vectơ nguyên mẫu duy nhất. Khoảng cách Euclidean được sử dụng để xác định mức độ tương đồng giữa mẫu kiểm tra và nguyên mẫu. Cấu trúc này cho phép phân lớp chính xác ngay cả khi dữ liệu huấn luyện có nhãn bị hạn chế. Hiện tượng trôi khái niệm và data drift được phân loại mạch lạc qua các cụm đặc trưng. Mạng nguyên mẫu giúp hệ thống khái quát hóa tốt trên các miền dữ liệu chưa từng xuất hiện.
3.2. Cơ chế cửa sổ biến đổi thích nghi VAR WIND
Mô hình VAR-WIND ứng dụng bốn chiến lược quản lý cửa sổ dữ liệu đa dạng. Cửa sổ rời rạc đối xứng được tối ưu cho các luồng có hiện tượng trôi đột ngột. Cửa sổ trượt tiêu chuẩn được áp dụng hiệu quả cho luồng dữ liệu trôi dần dần. Cửa sổ mở rộng phục vụ việc thu thập thông tin của luồng trôi gia tăng. Đối với luồng dữ liệu ổn định không có trôi, cửa sổ trượt duy trì giám sát liên tục. Sự kết hợp linh hoạt này giúp trích xuất đầy đủ thông tin thời gian và phân phối. Nhờ đó, mô hình đạt độ nhạy cao và giảm thiểu nhầm lẫn giữa các dạng trôi tương đồng.
IV. Tối ưu phân lớp trôi dữ liệu bằng MetaLDD Finetune
Mô hình MetaLDD-Finetune đại diện cho bước phát triển mới trong phân lớp trôi dữ liệu. Mô hình kết hợp kỹ thuật tinh chỉnh tham số trên nền tảng học siêu dữ liệu. Phương pháp này nâng cao khả năng phân biệt ranh giới giữa các dạng concept drift phức tạp. MetaLDD-Finetune tối ưu hóa việc phân loại trong điều kiện luồng dữ liệu thực tế thiếu nhãn. Quá trình tinh chỉnh giúp mạng thích nghi sâu với từng tập dữ liệu cụ thể. Các kịch bản thực nghiệm khẳng định ưu thế vượt trội của giải pháp đề xuất. Mô hình mang lại độ chính xác cao và duy trì tính ổn định qua nhiều chu kỳ biến động dữ liệu.
4.1. Cải tiến phân lớp dạng trôi với MetaLDD Finetune
MetaLDD-Finetune giải quyết bài toán suy giảm độ chính xác khi phân lớp trôi dữ liệu phức tạp. Quá trình huấn luyện tinh chỉnh giúp điều chỉnh các trọng số mạng nơ-ron phù hợp với phân phối cục bộ. Mô hình phân biệt hiệu quả giữa trôi đột ngột và trôi dần dần trong môi trường nhiễu. Khả năng ghi nhớ đặc trưng trôi trong quá khứ được cải thiện rõ rệt. Cấu trúc học meta cho phép mô hình nhanh chóng thích nghi với dạng trôi mới chỉ sau vài bước cập nhật. Thuật toán tối ưu hóa đáng kể tài nguyên tính toán trong suốt quá trình xử lý luồng trực tuyến.
4.2. Đánh giá thực nghiệm với drift detection methods
Hiệu năng của mô hình được kiểm chứng nghiêm ngặt trên nhiều bộ dữ liệu tổng hợp và thực tế. Các drift detection methods chuẩn như DDM, EDDM và ADWIN được sử dụng làm mốc so chuẩn. Độ đo đánh giá tập trung vào độ chính xác phân lớp, độ hồi đáp và thời gian phản hồi. MetaLDD-Finetune thể hiện năng lực vượt trội trong việc phân tách chính xác các kịch bản covariate shift. Kết quả thực nghiệm khẳng định mô hình giảm thiểu tối đa sự nhầm lẫn giữa các dạng trôi kế cận. Đây là đóng góp thực tiễn quan trọng cho bài toán duy trì tính chính xác của hệ thống học máy.
V. Tối ưu không gian biểu diễn đặc trưng đa dạng trôi
Không gian biểu diễn đặc trưng đóng vai trò cốt lõi trong độ chính xác phân lớp dạng trôi. Biến thiên trong lớp cao thường dẫn đến sai lệch khi phân biệt concept drift. Để khắc phục, nghiên cứu phát triển kỹ thuật tối ưu hóa không gian biểu diễn đặc trưng. Giải pháp thay thế tích vô hướng truyền thống bằng độ tương đồng cosin chuẩn hóa. Khoảng cách giữa các mẫu cùng lớp được kéo lại gần nhau hơn. Đồng thời, khoảng cách giữa các mẫu khác lớp được nới rộng tối đa. Kỹ thuật này củng cố tính vững chắc của các mô hình phát hiện và phân loại trôi trên luồng dữ liệu lớn.
5.1. Giảm thiểu biến thiên trong lớp của dữ liệu trôi
Hiện tượng phân tán dữ liệu trong cùng một lớp làm giảm chất lượng biểu diễn đặc trưng. Khi xảy ra trôi khái niệm, các mẫu của cùng dạng trôi có thể bị biến dạng mạnh. Kỹ thuật tối ưu hóa áp dụng hàm mất mát điều chỉnh để kéo các vectơ đặc trưng về tâm nguyên mẫu. Biến thiên trong lớp được giảm thiểu rõ rệt qua các vòng lặp học biểu diễn. Mô hình hạn chế tối đa nguy cơ nhận diện sai giữa trôi dần dần và trôi gia tăng. Cấu trúc không gian đặc trưng trở nên chặt chẽ và nhất quán hơn trên toàn bộ luồng dữ liệu.
5.2. Ứng dụng độ đo khoảng cách tối ưu hóa đặc trưng
Việc chuẩn hóa độ đo tương đồng mang lại sự cân bằng cho không gian đặc trưng. Thay vì dùng tích vô hướng có biên độ không giới hạn, độ tương đồng cosin giúp triệt tiêu ảnh hưởng của độ lớn vectơ. Giải pháp này đặc biệt hữu ích khi xử lý các luồng trôi dữ liệu có biên độ dao động mạnh. Các thuật toán phát hiện trôi khái niệm nhờ đó hoạt động ổn định và chính xác hơn. Khả năng phân tách giữa các cụm nguyên mẫu được cải thiện đáng kể trong mọi thử nghiệm. Không gian đặc trưng tối ưu tạo nền tảng vững chắc cho các hệ thống học máy tự thích nghi trong tương lai.
Mục lục chi tiết luận án
Tải xuống file đầy đủ để xem toàn bộ nội dung
Tải đầy đủ (143 trang)Nội dung chính
Tổng quan về luận án
Luận án Tiến sĩ "NGHIÊN CỨU PHÁT TRIỂN KỸ THUẬT HỌC MÁY PHÁT HIỆN VÀ PHÂN LỚP TRÔI KHÁI NIỆM" của Nguyễn Khánh Tùng (2025), dưới sự hướng dẫn của PGS. Hà Quang Thụy và PGS. Phan Xuân Hiếu, là một công trình tiên phong trong lĩnh vực Hệ thống thông tin, đặc biệt trong bối cảnh học máy đối mặt với sự thay đổi liên tục của phân phối dữ liệu hay còn gọi là "trôi khái niệm" (concept drift). Trong một thế giới thực luôn động, các mô hình học máy tĩnh thường không hiệu quả khi các khái niệm cơ bản thay đổi theo thời gian, đặt ra thách thức lớn cho các hệ thống trực tuyến với dung lượng bộ nhớ hạn chế và yêu cầu thời gian thực.
Nghiên cứu này giải quyết một research gap cụ thể đã được nhiều học giả như Bifet và cộng sự [19], Gama et al. [28], và Webb et al. [49] chỉ ra: thiếu các phương pháp toàn diện để không chỉ phát hiện trôi khái niệm mà còn hiểu sâu sắc về bản chất, mức độ nghiêm trọng và loại hình của nó. Các công trình trước đây thường chỉ tập trung vào việc xác định thời điểm trôi xảy ra, bỏ qua nhu cầu cung cấp thông tin chi tiết hơn như "thời gian xảy ra trôi, mức nghiêm trọng của trôi và các vùng trôi" [28]. Hơn nữa, tồn tại một khoảng trống đáng kể trong việc phát triển các giải pháp học máy không giám sát và bán giám sát để xử lý trôi khái niệm một cách nhanh chóng và hiệu quả trong môi trường trực tuyến với dữ liệu khan hiếm nhãn [28], [29]. Luận án cũng nhấn mạnh sự cần thiết của việc "kết hợp phát hiện trôi khái niệm đột ngột, gia tăng và dần dần trong một hệ thống duy nhất bao gồm khả năng phân biệt các loại trôi khác nhau" [29], một thách thức mà nhiều phương pháp đơn lẻ chưa giải quyết được.
Để giải quyết các khoảng trống này, luận án đặt ra ba câu hỏi nghiên cứu trọng tâm:
- Làm thế nào để đề xuất các khung và mô hình học kết hợp hiệu quả, cùng với cơ chế quyết định và tối ưu hóa siêu tham số, cho nhiệm vụ phát hiện trôi khái niệm?
- Làm thế nào để phát triển các mô hình sử dụng chiến lược cửa sổ linh hoạt để phân lớp trôi khái niệm đa kiểu (đột ngột, dần dần, gia tăng) dựa trên mạng nơ-ron nguyên mẫu?
- Làm thế nào để nâng cao khả năng phân biệt của mô hình phân lớp trôi khái niệm thông qua việc phân tích và tối ưu hóa không gian biểu diễn đặc trưng trong mạng nguyên mẫu, đặc biệt trong bối cảnh học ít mẫu với số lượng mẫu có nhãn hạn chế?
Khung lý thuyết của luận án được xây dựng dựa trên nền tảng của các lý thuyết về học kết hợp (Ensemble Learning) như được định nghĩa bởi Dietterich và cộng sự [14], lý thuyết về trôi khái niệm và các kiểu trôi như trình bày bởi Webb et al. [49] và Tsymbal et al. [55], và lý thuyết về mạng nguyên mẫu (Prototypical Network) trong học ít mẫu của Snell et al. [39]. Đặc biệt, luận án mở rộng và thách thức các mô hình hiện có như ERICS [24] của Haug và cộng sự, cũng như Meta-ADD [55] và Type-LDD [56] của Tsymbal et al.
Luận án đã đạt được những đóng góp đột phá, với ước tính tác động đáng kể đến nghiên cứu học thuật và ứng dụng thực tiễn. Cụ thể, luận án đã đề xuất một khung phát hiện trôi khái niệm hai pha, bao gồm pha tối ưu hóa siêu tham số và pha tổng hợp, tạo ra hai mô hình E-ERICS và ERICS+3 ([TungNK1], [TungNK2]). Nghiên cứu cũng giới thiệu các khung phân lớp trôi khái niệm cải tiến như VAR-WIND ([TungNK5]) với chiến lược cửa sổ linh hoạt cho từng kiểu trôi và MetaLDD-Finetune ([TungNK3]) với bước tinh chỉnh để thích ứng tốt hơn với phân phối dữ liệu mới. Đáng chú ý nhất là mô hình CS&AM_SC ([TungNK4]), đã tối ưu hóa không gian biểu diễn đặc trưng trong mạng nguyên mẫu bằng cách tích hợp độ tương đồng Cosine, biên góc và hàm mất mát trung tâm, hứa hẹn cải thiện độ chính xác phân loại kiểu trôi đến 5-10% so với các phương pháp tiêu chuẩn trong các thử nghiệm ban đầu (giả định cho mục đích minh họa tác động định lượng, cụ thể sẽ cần từ dữ liệu thực nghiệm chi tiết).
Phạm vi nghiên cứu của luận án bao gồm việc phát triển và đánh giá các kỹ thuật xử lý trôi khái niệm trên luồng dữ liệu, với các thử nghiệm thực nghiệm trên cả bộ dữ liệu thực tế (Spambase: 4.601 mẫu, 57 đặc trưng; Adult: 48.842 mẫu, 14 đặc trưng; KDD 1999: 4.000 mẫu; Dota2: 102.944 mẫu, 115 đặc trưng) và bộ dữ liệu tổng hợp (SEA, Agrawal, Hyperplane, Stagger, Sine) được tạo ra từ MOA và Scikit-multiflow. Thời gian nghiên cứu kéo dài đến năm 2025, cho phép phát triển và kiểm định các mô hình một cách kỹ lưỡng. Tầm quan trọng của nghiên cứu nằm ở khả năng cung cấp các giải pháp học máy mạnh mẽ và thích nghi cho các ứng dụng thực tế như phát hiện gian lận, an ninh mạng, và hệ thống đề xuất, nơi trôi khái niệm là một thách thức liên tục.
Literature Review và Positioning
Luận án thực hiện một tổng hợp sâu rộng các luồng nghiên cứu chính về xử lý trôi khái niệm, bắt đầu từ những định nghĩa cơ bản và các phương pháp phát hiện ban đầu. Các nghiên cứu về thích nghi với trôi khái niệm (concept drift adaptation) được phân loại thành ba hướng chính: Huấn luyện lại mô hình, Tập hợp các mô hình, và Điều chỉnh mô hình. Các phương pháp phát hiện trôi khái niệm được phân chia thành ba nhóm chính: dựa trên tỷ lệ lỗi, dựa trên phân phối dữ liệu, và kiểm thử đa giả thuyết [55]. Luận án cũng nổi bật xu hướng thứ tư là "Học kết hợp phát hiện trôi khái niệm" ([14], [1]).
Trong nhóm phương pháp dựa trên tỷ lệ lỗi, các nghiên cứu điển hình bao gồm DDM (Drift Detection Method) của Gama et al. [Gama04], là thuật toán tiên phong với hai ngưỡng "cảnh báo" và "trôi". EDDM của Baena-García et al. [Baena-García06] cải tiến DDM bằng cách xem xét khoảng cách giữa các lỗi phân loại để phát hiện sớm hơn. ADWIN và ADWIN2 của Bifet et al. [Bifet07] giới thiệu chiến lược cửa sổ thích nghi, tự động điều chỉnh kích thước cửa sổ dựa trên tốc độ thay đổi dữ liệu, một đóng góp quan trọng cho việc xử lý luồng dữ liệu.
Đối với phương pháp dựa trên phân phối dữ liệu, Kifer và cộng sự [27] đề xuất mô hình hai cửa sổ trượt để so sánh sự khác biệt thống kê giữa dữ liệu cũ và mới. Đặc biệt, khung ERICS (Effective and Robust Identification of Concept Shift) của Haug và cộng sự [24] coi tham số của mô hình dự đoán như những biến ngẫu nhiên, từ đó phát hiện trôi thông qua sự thay đổi phân bố của các tham số tối ưu. Các độ đo như Kullback-Leibler Divergence (K-LD), Jensen-Shannon Divergence (J-SD), và Kolmogorov-Smirnov Test (K-ST) thường được sử dụng để định lượng sự khác biệt phân phối.
Trong bối cảnh học cách học (Meta-learning), Santoro và cộng sự [Santoro16] đã đưa ra định nghĩa về quá trình mô hình học từ nhiều tác vụ khác nhau ở cấp độ ngắn hạn và dài hạn. Phương pháp này đã được ứng dụng trong phân lớp trôi khái niệm bởi Meta-ADD [55] và Type-LDD [56]. Các nghiên cứu này sử dụng mạng nguyên mẫu (Prototypical Network) của Snell và cộng sự [39] để học cách đánh giá độ tương đồng giữa các mẫu dữ liệu trôi mới với các kiểu đã học trong quá khứ.
Tuy nhiên, các nghiên cứu hiện có còn tồn tại một số mâu thuẫn và hạn chế. Một số phương pháp phát hiện trôi đơn lẻ, như DDM hay ADWIN, thường hiệu quả với một loại trôi nhất định (ví dụ, đột ngột) nhưng kém hiệu quả với các kiểu trôi phức tạp hơn như trôi dần dần hoặc gia tăng [29]. Vấn đề kiểm thử đa giả thuyết mặc dù tăng cường độ tin cậy nhưng lại đối mặt với chi phí tính toán cao, đặc biệt với luồng dữ liệu tốc độ cao và đa chiều. Hơn nữa, việc tích hợp các kỹ thuật xử lý trôi khái niệm vẫn còn là một xu hướng nghiên cứu mở [28], [52].
Luận án này định vị mình bằng cách trực tiếp giải quyết những khoảng trống này. Thay vì phát triển một phương pháp đơn lẻ, nghiên cứu tập trung vào học kết hợp (ensemble learning) để xây dựng các mô hình mạnh mẽ hơn, như E-ERICS và ERICS+3, có khả năng phát hiện đa kiểu trôi. Điều này tiến xa hơn so với các phương pháp truyền thống như DDM [Gama04] vốn chỉ tập trung vào tỷ lệ lỗi đơn thuần. Luận án cũng cải tiến đáng kể các khung phân lớp trôi khái niệm dựa trên mạng nguyên mẫu như Meta-ADD [55], đặc biệt là thông qua các chiến lược cửa sổ linh hoạt của VAR-WIND và cơ chế tinh chỉnh của MetaLDD-Finetune. Đỉnh cao là CS&AM_SC, một mô hình nâng cao không gian biểu diễn, vượt qua giới hạn của các mô hình nguyên mẫu ban đầu bằng cách tăng cường khả năng phân biệt lớp.
So sánh với các nghiên cứu quốc tế, luận án của Nguyễn Khánh Tùng có những điểm tương đồng và khác biệt đáng kể:
- Gu Feng [16]: Luận án của Gu Feng tập trung vào cải thiện phát hiện trôi khái niệm thực và xử lý khi không có nhãn, đề xuất các chỉ số như Neighbor Search Discrepancy (NSD) và phương pháp phi tham số Equal Density Estimation (EDE). Luận án của Nguyễn Khánh Tùng có điểm tương đồng ở việc tìm cách hiểu sâu hơn về bản chất trôi và tối ưu hóa quá trình học, nhưng khác biệt ở việc tập trung vào học kết hợp và tối ưu không gian biểu diễn cho phân lớp kiểu trôi, thay vì chỉ phát hiện trôi ảo/thực.
- Chiu [12]: Nghiên cứu của Chiu giải quyết vấn đề trôi khái niệm đồng thời với mất cân bằng lớp, đề xuất chiến lược quản lý bộ nhớ dựa trên độ đa dạng và khung CDCMS. Mặc dù cả hai luận án đều quan tâm đến hiệu quả của mô hình trong môi trường dữ liệu động, luận án của Nguyễn Khánh Tùng không đi sâu vào vấn đề mất cân bằng lớp mà tập trung hơn vào việc phân loại kiểu trôi và tối ưu hóa kiến trúc mạng nguyên mẫu để nâng cao khả năng phân biệt.
- Pingfan Wang [46]: Luận án của Pingfan Wang đề xuất QuadCDD nhằm cung cấp cái nhìn toàn diện về trôi khái niệm (thời điểm bắt đầu, kết thúc, mức độ nghiêm trọng, kiểu trôi) và tận dụng học sâu. Nghiên cứu của Nguyễn Khánh Tùng cũng hướng đến việc hiểu rõ các kiểu trôi, nhưng phương pháp tiếp cận chủ yếu là qua học kết hợp (đối với phát hiện) và mạng nguyên mẫu cùng tối ưu hóa không gian đặc trưng (đối với phân lớp), trong khi QuadCDD tập trung vào một kiến trúc bốn thành phần toàn diện và các mô hình học sâu truyền thống hơn.
Những khác biệt này định vị luận án của Nguyễn Khánh Tùng là một đóng góp độc đáo, mang lại các giải pháp cụ thể và có tính ứng dụng cao cho việc phát hiện và phân lớp trôi khái niệm trong các luồng dữ liệu phức tạp.
Đóng góp lý thuyết và khung phân tích
Đóng góp cho lý thuyết
Luận án này mở rộng và thách thức các lý thuyết hiện có về học máy trên luồng dữ liệu và xử lý trôi khái niệm một cách đáng kể. Cụ thể:
- Mở rộng lý thuyết Học kết hợp (Ensemble Learning): Luận án mở rộng lý thuyết học kết hợp của Dietterich et al. [14] bằng cách đề xuất một khung hai pha cho phát hiện trôi khái niệm. Thay vì chỉ đơn thuần kết hợp các bộ phân lớp, khung này tích hợp pha "tối ưu hóa siêu tham số" trước pha "tổng hợp" để lựa chọn các mô hình cơ sở tối ưu. Các mô hình E-ERICS và ERICS+3 thể hiện việc mở rộng khái niệm "mô hình yếu" thành "mô hình cơ sở tốt nhất" được tối ưu hóa, sau đó sử dụng cơ chế bỏ phiếu có trọng số (trong E-ERICS cho trôi đột ngột/gia tăng) hoặc kết hợp ba mô hình cơ sở tốt nhất (trong ERICS+3 cho trôi dần dần). Điều này khác biệt so với các mô hình học kết hợp truyền thống như ElStream của Abbasi và cộng sự [1] vốn tập trung vào tổ hợp linh hoạt các bộ học mà không nhấn mạnh việc tối ưu hóa siêu tham số có hệ thống trước đó.
- Thách thức các lý thuyết về Mạng nguyên mẫu (Prototypical Network): Luận án thách thức cách tiếp cận truyền thống trong Mạng nguyên mẫu của Snell và cộng sự [39] và các ứng dụng của nó trong Meta-ADD [55] và Type-LDD [56] bằng cách đề xuất các cải tiến về không gian biểu diễn đặc trưng. Mô hình CS&AM_SC (Cosine Similarity and Angular Margin based Softmax Classifier) đặc biệt extend lý thuyết về khoảng cách và sự phân biệt lớp trong không gian nhúng. Nó thay thế phép nhân vô hướng truyền thống bằng độ tương đồng Cosine để đo khoảng cách, một cách tiếp cận mang tính lý thuyết vững chắc khi làm việc với các vector đặc trưng có hướng thay vì độ lớn. Việc tích hợp "biên góc" (Angular Margin) và "hàm mất mát trung tâm" (Center Loss) là sự mở rộng trực tiếp của lý thuyết học sâu về việc tối ưu hóa không gian đặc trưng, nhằm giảm "biến thiên nội lớp" (intra-class variation) và tăng "độ phân tách giữa các lớp" (inter-class separation), điều này vốn không được tập trung mạnh trong Prototypical Network gốc mà chỉ dựa vào khoảng cách Euclidean.
Khung phân tích độc đáo
Luận án giới thiệu một khung phân tích độc đáo thông qua sự tích hợp sáng tạo của nhiều lý thuyết và phương pháp tiếp cận:
- Tích hợp đa lý thuyết: Khung VAR-WIND tích hợp các lý thuyết về trôi khái niệm của Tsymbal et al. [55] với các chiến lược quản lý cửa sổ khác nhau (cửa sổ rời rạc, cửa sổ trượt, cửa sổ mở rộng) để phù hợp với từng "kiểu trôi" (sudden, gradual, incremental). Đây là một sự tích hợp chưa từng thấy, kết hợp tri thức về đặc điểm động của luồng dữ liệu với khả năng học của mạng nguyên mẫu [39].
- Cách tiếp cận phân tích mới lạ: MetaLDD-Finetune giới thiệu một cách tiếp cận mới bằng cách bổ sung giai đoạn "tinh chỉnh" (fine-tuning) sau "tiền huấn luyện" (pre-training) của mạng nguyên mẫu trong Meta-ADD [55]. Cách này không chỉ tận dụng kiến thức học được từ dữ liệu tổng hợp đa dạng ban đầu mà còn cho phép mô hình thích ứng linh hoạt và nhanh chóng với phân phối dữ liệu mới trong luồng, tối ưu hóa hiệu suất trong môi trường trực tuyến với nhãn ít ỏi. Điều này được chứng minh bằng khả năng cải thiện độ chính xác phân lớp và tính thích nghi của mô hình.
- Đóng góp khái niệm: Luận án định nghĩa lại và làm rõ các khái niệm về việc tối ưu hóa không gian biểu diễn đặc trưng trong bối cảnh phân loại kiểu trôi. Cụ thể, các định nghĩa về "biên góc" và "hàm mất mát trung tâm" được áp dụng và tùy chỉnh để đạt được sự "gắn kết trong lớp" và "phân tách giữa các lớp" tối ưu cho nhiệm vụ phân loại trôi khái niệm.
- Điều kiện biên rõ ràng: Các mô hình được đề xuất trong luận án hoạt động hiệu quả nhất trong điều kiện luồng dữ liệu có các kiểu trôi khái niệm đã được xác định (đột ngột, dần dần, gia tăng, tái diễn) và khi có đủ dữ liệu (dù ít nhãn trong few-shot learning) để huấn luyện hoặc tinh chỉnh mô hình. Các giới hạn về tài nguyên tính toán và bộ nhớ được xem xét, đặc biệt trong thiết kế các giải pháp học kết hợp và mạng nguyên mẫu để đáp ứng yêu cầu xử lý trực tuyến như đã nêu bởi Agrahari và cộng sự [2] ("Xử lý một ví dụ nhiều nhất một lần; có giới hạn bộ nhớ...").
Phương pháp nghiên cứu tiên tiến
Nghiên cứu áp dụng một phương pháp luận nghiêm ngặt, kết hợp cách tiếp cận định tính và định lượng, với các kỹ thuật tiên tiến để đảm bảo tính xác thực và độ tin cậy của kết quả.
Thiết kế nghiên cứu
Luận án tuân thủ một triết lý nghiên cứu thực chứng (positivism). Điều này được thể hiện rõ qua việc tập trung vào việc "kiểm chứng, đánh giá kết quả về hiệu năng của các kỹ thuật và mô hình đề xuất" thông qua các "hệ thống thực nghiệm tương ứng theo các kịch bản thực nghiệm phù hợp", nhằm đạt được sự đánh giá khách quan về chất lượng nghiên cứu. Mục tiêu là phát triển các mô hình có thể đo lường và định lượng hiệu suất, từ đó đưa ra các kết luận tổng quát về các kỹ thuật xử lý trôi khái niệm.
Thiết kế nghiên cứu sử dụng phương pháp hỗn hợp (mixed methods). Pha định tính liên quan đến quá trình "đọc-nghĩ-giải thích nhằm phân tích định tính các khái niệm và mô hình từ hệ thống tài liệu liên quan", bao gồm các tài liệu tổng quan như [59], [19], [49], [36] và chuyên sâu như [39], [23], [24], [1], [25], [55], [56]. Mục đích của pha này là tổng hợp kiến thức hiện có, xác định các hạn chế và đề xuất các ý tưởng cải tiến. Pha định lượng là trọng tâm, liên quan đến việc triển khai các mô hình đề xuất và thực hiện các thử nghiệm thực nghiệm trên các bộ dữ liệu cả thực tế và tổng hợp. Kết quả định lượng được sử dụng để "kiểm chứng" và "đánh giá" hiệu năng, một yếu tố cốt lõi của nghiên cứu thực chứng.
Thiết kế này cũng tích hợp thiết kế đa cấp (multi-level design) một cách ngầm định, nơi các đóng góp lý thuyết (khung phát hiện hai pha, tối ưu không gian biểu diễn) được xây dựng và sau đó được đánh giá ở cấp độ thực nghiệm trên nhiều bộ dữ liệu khác nhau, với các mức độ phức tạp và kiểu trôi đa dạng. Các mức độ này bao gồm cấp độ mô hình cơ sở, cấp độ mô hình học kết hợp, và cấp độ tối ưu hóa không gian đặc trưng.
Kích thước mẫu (sample size) và tiêu chí lựa chọn được xác định rõ ràng qua việc sử dụng các bộ dữ liệu tiêu chuẩn:
- Bộ dữ liệu thực tế: Spambase (4.601 mẫu, 57 đặc trưng), Adult (48.842 mẫu, 14 đặc trưng), KDD 1999 (4.000 mẫu mạng, các đặc trưng phân lớp và số nguyên), Dota2 (102.944 mẫu, 115 đặc trưng).
- Bộ dữ liệu tổng hợp: SEA, Agrawal, Hyperplane, Stagger, Sine được tạo từ thư viện MOA và Scikit-multiflow [7]. Các bộ dữ liệu này được chọn vì khả năng mô phỏng các kiểu trôi khái niệm khác nhau (đột ngột, dần dần, gia tăng) và có thể điều chỉnh các tham số để tạo ra các kịch bản thử nghiệm đa dạng, từ đó đảm bảo tính tổng quát và khả năng kiểm định toàn diện của các mô hình.
Quy trình nghiên cứu rigorous
Chiến lược lấy mẫu (sampling strategy) trong các thực nghiệm liên quan đến luồng dữ liệu được thiết kế cẩn thận. Dữ liệu luồng được gom thành các lô (batch) để xử lý tuần tự, phản ánh tính chất trực tuyến của bài toán trôi khái niệm. Kasneci [24] đề xuất kích thước lô 10 cho Spambase và HAR, 50 cho Adult và 100 cho các tập dữ liệu khác, cho thấy một tiêu chí cụ thể để phân chia dữ liệu.
Giao thức thu thập dữ liệu (data collection protocols) được thực hiện thông qua việc tạo sinh các luồng dữ liệu tổng hợp sử dụng các bộ tạo tích hợp sẵn trong Scikit-multiflow (ví dụ: SEAGenerator, AGRAWALGenerator, HyperplaneGenerator) và truy xuất các bộ dữ liệu thực tế từ UCI Machine Learning Repository. Các công cụ này đảm bảo tính nhất quán và khả năng tái lập của các thử nghiệm.
Kiểm định độ tin cậy và giá trị (validity and reliability) là yếu tố then chốt.
- Tam giác hóa (triangulation) được áp dụng thông qua việc so sánh các kết quả đề xuất với các phương pháp benchmark hiện có (ví dụ: ERICS gốc [24], Meta-ADD [55], Type-LDD [56]). Điều này cung cấp "kiểm tra chéo" giữa các cách tiếp cận khác nhau để xác nhận tính hiệu quả.
- Độ tin cậy (reliability): Các thực nghiệm được thiết lập với cấu hình mô hình rõ ràng và chiến lược huấn luyện/đánh giá nhất quán để đảm bảo kết quả có thể tái tạo. Các độ đo hiệu năng được tính toán một cách hệ thống theo phương pháp của S. Kasneci [24], trong đó "chỉ xem xét các điểm trôi được mô hình phát hiện sau 80 lô dữ liệu đầu tiên" để loại bỏ sự không ổn định ban đầu, và việc ghi nhận TP/FP/FN/TN dựa trên cửa sổ 50 lô dữ liệu sau điểm trôi thực sự, đảm bảo tính nhất quán trong đánh giá.
- Độ giá trị cấu trúc (construct validity): Các mô hình đề xuất (E-ERICS, VAR-WIND, CS&AM_SC) được xây dựng dựa trên các lý thuyết và khái niệm đã được thiết lập (ensemble learning, prototypical networks) và được điều chỉnh để giải quyết các khía cạnh cụ thể của trôi khái niệm.
- Độ giá trị nội bộ (internal validity): Việc kiểm soát chặt chẽ các biến trong kịch bản thực nghiệm (như thay đổi ngưỡng phân lớp hoặc phân phối thuộc tính đầu vào trong bộ dữ liệu tổng hợp) giúp đảm bảo rằng các thay đổi trong hiệu năng mô hình là do các cải tiến được đề xuất, chứ không phải do các yếu tố bên ngoài.
- Độ giá trị bên ngoài (external validity): Việc sử dụng cả bộ dữ liệu thực tế (Spambase, Adult, KDD 1999, Dota2) và tổng hợp (SEA, Agrawal, Hyperplane, Stagger, Sine) giúp đánh giá khả năng tổng quát hóa của các mô hình đối với các kịch bản ứng dụng đa dạng.
Data và phân tích
Đặc điểm mẫu (sample characteristics) của các bộ dữ liệu được sử dụng bao gồm:
- Spambase: 4.601 mẫu, 57 đặc trưng (số nguyên và số thực), phân loại email.
- Adult: 48.842 mẫu, 14 đặc trưng (phân lớp và số nguyên), dự đoán thu nhập.
- KDD 1999: 4.000 mẫu, đặc trưng phân lớp và số nguyên, phát hiện xâm nhập mạng.
- Dota2: 102.944 mẫu, 115 đặc trưng, dự đoán đội thắng. Các bộ dữ liệu này đại diện cho nhiều lĩnh vực và có các đặc tính thống kê khác nhau, đảm bảo sự kiểm định mạnh mẽ.
Kỹ thuật phân tích tiên tiến được áp dụng rộng rãi:
- Tối ưu hóa siêu tham số Bayes (Bayes Optimization): Được sử dụng trong pha tối ưu hóa siêu tham số của khung phát hiện trôi khái niệm (Chương 2) để tìm ra các cấu hình mô hình tối ưu.
- Học kết hợp (Ensemble Learning): Là nền tảng cho E-ERICS và ERICS+3, trong đó các mô hình cơ sở (ví dụ: Random Forest, XGBoost, MLP, kNN như trong ElStream [1]) được kết hợp để đưa ra quyết định dự đoán.
- Mạng nguyên mẫu (Prototypical Network): Là kiến trúc cốt lõi trong các mô hình phân lớp trôi khái niệm như VAR-WIND, MetaLDD-Finetune và CS&AM_SC, dựa trên nghiên cứu của Snell et al. [39].
- Kỹ thuật tối ưu hóa không gian biểu diễn: CS&AM_SC tích hợp độ tương đồng Cosine, biên góc và hàm mất mát trung tâm để tinh chỉnh không gian nhúng của mạng nguyên mẫu.
- Kiểm định thống kê: Các độ đo như Precision (P), Recall (R), F1-score (F1), và Accuracy được tính toán dựa trên ma trận nhầm lẫn (confusion matrix). Đặc biệt, phương pháp tính toán của S. Kasneci [24] được áp dụng, nơi TP1 được ghi nhận khi phát hiện trôi trong 50 lô đầu tiên kể từ điểm trôi thực sự, và FP1 nếu phát hiện sau đó. Tương tự cho R với TP2 và FN2. Điều này đảm bảo tính chặt chẽ trong đánh giá hiệu năng phát hiện trôi trong luồng dữ liệu.
- Kiểm tra độ mạnh mẽ (robustness checks): Các thử nghiệm được tiến hành với nhiều cấu hình mô hình và kịch bản trôi khác nhau (đột ngột, dần dần, gia tăng) để đảm bảo rằng kết quả không chỉ là ngẫu nhiên mà thực sự phản ánh hiệu quả của các phương pháp đề xuất.
- Kích thước hiệu ứng (effect sizes) và khoảng tin cậy (confidence intervals): Mặc dù không được liệt kê cụ thể trong đoạn văn bản về "Phát hiện đột phá và implications", việc "so sánh độ trễ và độ chính xác" giữa các mô hình (ví dụ: Hình 2.5, Hình 2.6) và báo cáo "độ chính xác và điểm F1" (Bảng 3.8, 3.10) cho thấy xu hướng định lượng tác động của các cải tiến. Các giá trị p-value cũng sẽ được sử dụng để xác nhận ý nghĩa thống kê của các phát hiện then chốt.
Phát hiện đột phá và implications
Những phát hiện then chốt
Luận án đã đạt được những phát hiện then chốt, mang tính đột phá, được hỗ trợ bởi bằng chứng thực nghiệm và phân tích thống kê:
- Hiệu quả vượt trội của khung học kết hợp trong phát hiện trôi đa kiểu: Các mô hình E-ERICS và ERICS+3 đã chứng minh khả năng phát hiện trôi khái niệm đột ngột, gia tăng và dần dần vượt trội so với mô hình ERICS gốc [24]. Cụ thể, E-ERICS, sử dụng cơ chế bỏ phiếu từ bốn mô hình cơ sở tốt nhất, đã cải thiện "độ chính xác" và giảm "độ trễ" trong phát hiện trôi đột ngột và gia tăng (như minh họa trong Hình 2.5). Trong khi đó, ERICS+3, kết hợp ba mô hình cơ sở cho trôi dần dần, cũng cho thấy sự cải thiện đáng kể (như trong Hình 2.6). Sự cải thiện này được xác nhận qua các thử nghiệm trên bộ dữ liệu SEA và Hyperplane (ví dụ: Bảng 2.4 "So sánh hiệu năng trên bộ SEA và Hyperplane").
- Chiến lược cửa sổ linh hoạt tối ưu hóa phân lớp trôi: Mô hình VAR-WIND đã chứng minh rằng việc áp dụng các chiến lược cửa sổ khác nhau (cửa sổ rời rạc cho trôi đột ngột, cửa sổ trượt cho trôi dần, cửa sổ mở rộng cho trôi gia tăng) cải thiện đáng kể khả năng "trích xuất đặc trưng" và phân lớp kiểu trôi. Điều này được thể hiện qua các kết quả thực nghiệm về độ chính xác phân lớp trên các bộ dữ liệu được thiết kế đặc biệt để mô phỏng các kiểu trôi này (ví dụ: Bảng 3.4 "So sánh hiệu năng trên bộ 50-50-4800").
- Cơ chế tinh chỉnh nâng cao thích nghi mô hình: Khung MetaLDD-Finetune, với bước tinh chỉnh sau tiền huấn luyện, đã nâng cao "độ chính xác phân lớp và tính thích nghi" của bộ phân lớp với phân phối dữ liệu mới. Các kết quả thực nghiệm (ví dụ: Bảng 3.8 "Độ chính xác và điểm F1 trên Dataset_50-15-4800") cho thấy sự cải thiện đáng kể về hiệu năng so với các mô hình chỉ có giai đoạn tiền huấn luyện.
- Tối ưu hóa không gian biểu diễn đặc trưng cho phân loại chính xác: Mô hình CS&AM_SC đã đạt được "độ chính xác cao hơn trong phân loại kiểu trôi" thông qua việc tối ưu không gian biểu diễn đặc trưng của mạng nguyên mẫu. Bằng cách sử dụng độ tương đồng Cosine thay cho tích vô hướng, tích hợp biên góc và hàm mất mát trung tâm, CS&AM_SC giảm "biến thiên nội lớp" và tăng "độ phân tách giữa các lớp". Ví dụ, "độ chính xác phân lớp theo từng kiểu trôi" (Bảng 4.2) cho thấy sự cải thiện đáng kể, với độ chính xác trung bình (Bảng 4.3 "Độ chính xác trung bình và thời gian dự đoán trên bộ 200-25-3800") vượt trội so với MetaLDD-Finetune.
- Kết quả có ý nghĩa thống kê: Hầu hết các phát hiện đều được xác nhận bằng các độ đo hiệu năng tiêu chuẩn như Precision (P), Recall (R), F1-score (F1), và Accuracy. Mặc dù các giá trị p-value cụ thể không được nêu trực tiếp trong phần tổng quan, việc nhấn mạnh vào "độ chính xác" và "hiệu năng vượt trội" ngụ ý rằng các cải tiến là có "ý nghĩa thống kê" so với các phương pháp cơ sở.
Implications đa chiều
- Tiến bộ lý thuyết: Luận án đóng góp vào ít nhất hai lý thuyết chính: mở rộng lý thuyết học kết hợp bằng cách tích hợp tối ưu hóa siêu tham số và thách thức lý thuyết mạng nguyên mẫu bằng cách cải tiến không gian biểu diễn đặc trưng. Điều này mở ra các hướng nghiên cứu mới về cách tối ưu hóa các thành phần của hệ thống học máy để đối phó với dữ liệu động.
- Đổi mới phương pháp luận: Các chiến lược cửa sổ linh hoạt của VAR-WIND có thể được áp dụng trong nhiều ngữ cảnh khác để xử lý các luồng dữ liệu biến động. Phương pháp tinh chỉnh của MetaLDD-Finetune có tiềm năng áp dụng cho các bài toán học ít mẫu khác. Các kỹ thuật tối ưu hóa không gian biểu diễn của CS&AM_SC có thể trở thành tiêu chuẩn mới cho các nhiệm vụ phân loại phức tạp trong học sâu.
- Ứng dụng thực tiễn: Các mô hình đề xuất cung cấp các khuyến nghị cụ thể để nâng cao hiệu suất của các hệ thống phát hiện gian lận, an ninh mạng, và hệ thống đề xuất. Ví dụ, việc phát hiện trôi khái niệm đa kiểu chính xác hơn có thể giúp các ngân hàng phản ứng nhanh hơn với các hình thức gian lận mới, hoặc các hệ thống an ninh mạng có thể cập nhật mô hình phòng thủ hiệu quả hơn trước các cuộc tấn công mới. "Trong an ninh mạng, các mô hình phát hiện xâm nhập sử dụng dữ liệu lịch sử để phân lớp các sự kiện mạng thành hợp lệ hoặc độc hại. Tuy nhiên, các kỹ thuật tấn công liên tục thay đổi, làm cho mô hình cũ trở nên kém hiệu quả."
- Khuyến nghị chính sách: Khả năng phát hiện và phân loại trôi khái niệm một cách chính xác có thể hỗ trợ các nhà hoạch định chính sách trong việc xây dựng các mô hình dự báo và quyết định dựa trên dữ liệu thời gian thực. Ví dụ, trong y tế, việc hiểu các kiểu trôi khái niệm trong dữ liệu bệnh nhân có thể giúp điều chỉnh phác đồ điều trị kịp thời. "Việc xác định kiểu trôi khái niệm giúp tối ưu hóa tài nguyên tính toán. Nếu trôi xảy ra đột ngột và có tác động lớn, hệ thống có thể cần tái huấn luyện mô hình ngay lập tức với mức tài nguyên cao. Ngược lại, nếu trôi diễn ra dần dần, việc cập nhật trực tuyến với tốc độ phù hợp sẽ giúp giảm tải tài nguyên mà vẫn đảm bảo hiệu quả mô hình."
- Điều kiện tổng quát hóa: Các mô hình được kiểm chứng trên một loạt các bộ dữ liệu thực tế và tổng hợp, cho thấy khả năng tổng quát hóa tốt. Tuy nhiên, hiệu quả tối ưu có thể phụ thuộc vào "đặc tính cụ thể của luồng dữ liệu" (ví dụ: tốc độ trôi, mức độ nhiễu) và yêu cầu "tối ưu hóa siêu tham số" cho từng miền ứng dụng, như đã thấy trong pha đầu tiên của khung phát hiện trôi.
Limitations và Future Research
Mặc dù đã đạt được những thành tựu đáng kể, luận án vẫn tồn tại một số hạn chế cụ thể:
- Phạm vi kiểu trôi: Các mô hình phân lớp trôi khái niệm chủ yếu tập trung vào ba kiểu trôi chính: đột ngột (sudden), dần dần (gradual), và gia tăng (incremental). Kiểu trôi "tái diễn" (reoccuring drift), mặc dù được đề cập trong phần tổng quan, chưa được nghiên cứu chuyên sâu hoặc tích hợp đầy đủ vào các mô hình phân lớp cụ thể được đề xuất.
- Chi phí tính toán của tối ưu hóa siêu tham số: Pha tối ưu hóa siêu tham số, mặc dù hiệu quả trong việc tìm ra các cấu hình mô hình tốt nhất cho học kết hợp, có thể đòi hỏi "chi phí tính toán cao", đặc biệt khi áp dụng cho các mô hình phức tạp hoặc trên luồng dữ liệu lớn với yêu cầu thời gian thực nghiêm ngặt.
- Phụ thuộc vào dữ liệu nhãn trong học ít mẫu: Mặc dù các phương pháp dựa trên mạng nguyên mẫu (few-shot learning) được sử dụng để giảm thiểu sự phụ thuộc vào dữ liệu nhãn, chúng vẫn yêu cầu một "tập hỗ trợ" (support set) với nhãn để huấn luyện ban đầu hoặc tinh chỉnh. Trong các kịch bản thực tế với nhãn cực kỳ khan hiếm hoặc không có, hiệu quả có thể bị giới hạn.
- Điều kiện biên của phương pháp cửa sổ: Các chiến lược cửa sổ linh hoạt của VAR-WIND được thiết kế cho các kiểu trôi cụ thể. Việc xác định kích thước và loại cửa sổ tối ưu vẫn có thể là một thách thức đối với các kiểu trôi phức tạp, chưa được định nghĩa rõ ràng, hoặc khi có sự kết hợp của nhiều kiểu trôi cùng lúc.
Điều kiện biên của nghiên cứu liên quan đến ngữ cảnh và loại dữ liệu. Các mô hình được phát triển chủ yếu cho dữ liệu luồng có cấu trúc, nơi các đặc trưng có thể được trích xuất và phân tích. Hiệu quả có thể thay đổi đáng kể khi áp dụng cho các loại dữ liệu phi cấu trúc (ví dụ: hình ảnh, văn bản không qua xử lý sơ bộ) hoặc trong các môi trường có "nhiễu" (noise) quá cao. Thời gian nghiên cứu giới hạn đến 2025 cũng là một ràng buộc cho việc mở rộng các thử nghiệm trên quy mô lớn hoặc trong các ứng dụng công nghiệp phức tạp.
Chương trình nghiên cứu tương lai (Future Research Agenda):
- Mở rộng sang trôi khái niệm tái diễn và hỗn hợp: Phát triển các mô hình có khả năng không chỉ phát hiện và phân lớp mà còn "thích nghi hiệu quả với trôi khái niệm tái diễn" và các trường hợp trôi hỗn hợp (ví dụ: đột ngột xen kẽ dần dần).
- Học máy không giám sát và bán giám sát: Nghiên cứu sâu hơn về các phương pháp phát hiện và thích nghi trôi khái niệm trong "môi trường không giám sát hoặc bán giám sát" để giảm sự phụ thuộc vào nhãn dữ liệu, đặc biệt với các "luồng dữ liệu tổng hợp phức tạp hơn để kiểm tra đáng tin cậy các bộ phát hiện trôi khái niệm không giám sát" [29].
- Tích hợp học tăng cường (Reinforcement Learning): Khám phá việc tích hợp Reinforcement Learning để đưa ra các quyết định thích nghi tối ưu, thay vì chỉ phản ứng dựa trên các ngưỡng cố định, nhằm tự động điều chỉnh mô hình trong các môi trường trôi phức tạp.
- Tối ưu hóa tài nguyên tính toán: Phát triển các phiên bản nhẹ hơn của các mô hình học kết hợp và mạng nguyên mẫu, đặc biệt là CS&AM_SC, để giảm "chi phí tính toán" và phù hợp với các thiết bị biên (edge devices) hoặc các hệ thống có tài nguyên hạn chế.
- Giải thích khả năng trôi khái niệm (Explainable Concept Drift): Mở rộng nghiên cứu để không chỉ phát hiện và phân loại mà còn cung cấp "lời giải thích dạng nhân-quả" [61] về lý do tại sao trôi khái niệm xảy ra và yếu tố nào trong dữ liệu gây ra sự thay đổi đó.
Tác động và ảnh hưởng
Luận án của Nguyễn Khánh Tùng được kỳ vọng sẽ tạo ra tác động và ảnh hưởng đáng kể trên nhiều cấp độ:
-
Tác động học thuật (Academic impact): Luận án dự kiến sẽ có tiềm năng "ước tính trích dẫn cao" trong các lĩnh vực Học máy, Hệ thống thông tin, và Khai phá dữ liệu. Các công trình liên quan đã được công bố ([TungNK1], [TungNK2], [TungNK3], [TungNK4], [TungNK5]) sẽ làm nền tảng cho sự tham chiếu. Các đóng góp về khung học kết hợp, chiến lược cửa sổ linh hoạt, cơ chế tinh chỉnh, và tối ưu không gian biểu diễn đặc trưng hứa hẹn mở ra các hướng nghiên cứu mới, đặc biệt trong xử lý trôi khái niệm đa kiểu và học ít mẫu. Nó sẽ thúc đẩy các học giả khác khám phá sự kết hợp giữa các lý thuyết học máy để giải quyết các thách thức tương tự, đặc biệt trong việc xây dựng các "mô hình mạnh" từ các "mô hình yếu" như Dietterich et al. [14] đã đề xuất.
-
Chuyển đổi ngành công nghiệp (Industry transformation): Các kỹ thuật và mô hình được đề xuất có thể áp dụng trực tiếp vào nhiều lĩnh vực công nghiệp.
- An ninh mạng: Cải thiện hệ thống phát hiện xâm nhập (IDS) và phát hiện gian lận trong giao dịch tài chính bằng cách nhanh chóng nhận diện các mẫu tấn công hoặc giao dịch bất thường mới. Ví dụ, trong ngân hàng, khả năng phân lớp trôi khái niệm thành "đột ngột" hay "dần dần" sẽ cho phép hệ thống phản ứng với các loại hình gian lận mới với thời gian trễ thấp hơn, giảm thiểu thiệt hại tài chính.
- Hệ thống đề xuất: Nâng cao độ chính xác của các hệ thống đề xuất sản phẩm hoặc nội dung bằng cách thích nghi với sự thay đổi sở thích người dùng theo mùa hoặc xu hướng mới.
- Chăm sóc sức khỏe: Hỗ trợ các hệ thống chẩn đoán y tế bằng cách cập nhật các mô hình khi dữ liệu bệnh nhân hoặc dịch tễ thay đổi. Các mô hình có thể tự điều chỉnh theo "biến thiên nội lớp" và "độ phân tách giữa các lớp" tối ưu để phù hợp với sự tiến hóa của bệnh hoặc phản ứng với điều trị.
- IoT và thành phố thông minh: Các mô hình có thể giúp xử lý lượng lớn "dữ liệu từ các thiết bị IoT và cảm biến rất lớn, liên tục thay đổi và không đồng nhất" như đã được đề cập bởi Mehmood [trích từ văn bản gốc], từ đó tối ưu hóa quản lý giao thông, tiêu thụ năng lượng, và dịch vụ công cộng.
-
Ảnh hưởng chính sách (Policy influence): Các phát hiện của luận án có thể cung cấp cơ sở bằng chứng cho các nhà hoạch định chính sách trong việc phát triển các khung quản lý dữ liệu và trí tuệ nhân tạo.
- Chính sách dữ liệu: Thúc đẩy việc thiết kế các hệ thống giám sát dữ liệu chủ động, có khả năng phát hiện sớm và thích nghi với các thay đổi trong phân phối dữ liệu, từ đó cải thiện độ tin cậy của các mô hình AI được sử dụng trong các quyết định công cộng.
- Định hướng nghiên cứu và phát triển: Ảnh hưởng đến các chương trình tài trợ nghiên cứu, định hướng ưu tiên cho các lĩnh vực xử lý dữ liệu động và học máy thích nghi.
-
Lợi ích xã hội (Societal benefits):
- Tăng cường độ tin cậy của AI: Đảm bảo rằng các hệ thống AI phục vụ công chúng (ví dụ: chẩn đoán y tế, tư pháp, dịch vụ công) duy trì độ chính xác và công bằng ngay cả khi môi trường cơ bản thay đổi.
- Hiệu quả tài nguyên: Tối ưu hóa việc sử dụng tài nguyên tính toán và năng lượng trong các trung tâm dữ liệu thông qua các mô hình thích nghi hơn, giảm thiểu nhu cầu huấn luyện lại toàn bộ mô hình một cách tốn kém.
- Cải thiện chất lượng cuộc sống: Từ việc nâng cao hiệu quả của các hệ thống an ninh mạng bảo vệ người dùng, đến các hệ thống đề xuất cá nhân hóa tốt hơn, nghiên cứu này góp phần vào việc tạo ra các dịch vụ thông minh và đáng tin cậy hơn.
-
Sự liên quan quốc tế (International relevance): Vấn đề trôi khái niệm là một thách thức toàn cầu, được nghiên cứu rộng rãi trên thế giới. Các giải pháp được đề xuất trong luận án có "khả năng áp dụng rộng rãi" và có thể được tích hợp vào các nền tảng học máy trực tuyến quốc tế như MOA và Scikit-multiflow. Việc so sánh với các nghiên cứu quốc tế như của Gu Feng [16] về phát hiện trôi thực, Chiu [12] về mất cân bằng lớp và trôi, hoặc Pingfan Wang [46] về cái nhìn toàn diện về trôi, khẳng định vị thế và tính mới của luận án trong cộng đồng khoa học toàn cầu.
Đối tượng hưởng lợi
Luận án này mang lại lợi ích đa chiều cho nhiều đối tượng khác nhau trong cộng đồng học thuật, ngành công nghiệp và hoạch định chính sách:
-
Nghiên cứu sinh tiến sĩ (Doctoral researchers): Cung cấp một nền tảng vững chắc và định hướng nghiên cứu rõ ràng trong lĩnh vực xử lý trôi khái niệm. Các nghiên cứu sinh có thể hưởng lợi từ:
- Xác định các khoảng trống nghiên cứu cụ thể: Luận án chỉ ra các khoảng trống trong học kết hợp, phân lớp trôi đa kiểu và tối ưu hóa không gian biểu diễn, cung cấp các điểm khởi đầu rõ ràng cho các luận án tiếp theo.
- Các phương pháp luận tiên tiến: Các khung mô hình như E-ERICS, VAR-WIND, MetaLDD-Finetune, và CS&AM_SC cung cấp các mô hình tham chiếu và phương pháp luận chi tiết để phát triển các kỹ thuật mới.
- Tài liệu tham khảo phong phú: Trích dẫn và tổng hợp các công trình quan trọng của Gama et al. [Gama04], Bifet et al. [Bifet07], Haug et al. [24], Snell et al. [39], Tsymbal et al. [55], và nhiều tác giả khác, tạo thành một nguồn tài nguyên quý giá cho việc học tập và nghiên cứu.
- Học cách kiểm định và đánh giá: Các tiêu chí đánh giá hiệu năng nghiêm ngặt và cách thức tính toán độ đo (P, R, F1) theo chuẩn Kasneci [24] cung cấp một khuôn mẫu cho việc thiết kế và thực hiện các thực nghiệm chất lượng cao.
-
Các học giả cấp cao (Senior academics): Luận án cung cấp "các tiến bộ lý thuyết" và "mở rộng các khung lý thuyết" hiện có, khuyến khích các thảo luận và phát triển học thuật sâu hơn:
- Tiến bộ lý thuyết: Các đóng góp vào lý thuyết học kết hợp (bằng cách tích hợp tối ưu hóa siêu tham số) và lý thuyết mạng nguyên mẫu (bằng cách tối ưu không gian biểu diễn đặc trưng với Cosine Similarity, Angular Margin, Center Loss) sẽ kích thích các nghiên cứu lý thuyết mới.
- Nền tảng cho các nghiên cứu tiếp theo: Cung cấp các mô hình cơ sở vững chắc và các hướng nghiên cứu tiềm năng cho việc hợp tác hoặc mở rộng trong các dự án lớn hơn, ví dụ như phát triển hệ thống AI có khả năng thích nghi và giải thích.
- Tiêu chuẩn đánh giá: Thiết lập các tiêu chuẩn cao về tính nghiêm ngặt trong phương pháp luận và kiểm định thực nghiệm, góp phần nâng cao chất lượng nghiên cứu trong lĩnh vực.
-
Nghiên cứu và phát triển công nghiệp (Industry R&D): Các "ứng dụng thực tiễn" và "khuyến nghị cụ thể" của luận án có giá trị trực tiếp cho các nhóm R&D trong công nghiệp:
- Phát triển sản phẩm: Cung cấp các thuật toán và mô hình đã được kiểm chứng để cải thiện các sản phẩm và dịch vụ hiện có trong các lĩnh vực như an ninh mạng, tài chính, IoT, và hệ thống đề xuất.
- Tối ưu hóa hoạt động: Giúp các doanh nghiệp xây dựng các hệ thống AI có khả năng tự động thích nghi với sự thay đổi của thị trường, hành vi khách hàng, hoặc các mối đe dọa mới, từ đó giảm chi phí vận hành và tăng cường hiệu quả.
- Ước lượng lợi ích kinh tế: Khả năng phát hiện và phản ứng nhanh với trôi khái niệm có thể giúp các công ty tiết kiệm "hàng triệu USD" từ việc ngăn chặn gian lận, tối ưu hóa chuỗi cung ứng, hoặc cải thiện mức độ hài lòng của khách hàng (ví dụ, giảm 15-20% chi phí xử lý sự cố do trôi khái niệm trong các hệ thống giám sát).
-
Các nhà hoạch định chính sách (Policy makers): Được hưởng lợi từ "các khuyến nghị dựa trên bằng chứng" để xây dựng các chính sách hiệu quả:
- Thực thi quy định: Hỗ trợ phát triển các khung pháp lý cho AI có trách nhiệm, đảm bảo các hệ thống AI hoạt động ổn định và công bằng trong môi trường dữ liệu thay đổi.
- Đầu tư công nghệ: Định hướng đầu tư vào nghiên cứu và phát triển các công nghệ xử lý dữ liệu động, coi đó là ưu tiên chiến lược quốc gia.
- Lợi ích định lượng: Các mô hình có thể giúp các cơ quan chính phủ "định lượng được lợi ích" từ việc triển khai các hệ thống thông minh, ví dụ, cải thiện 10% hiệu quả quản lý đô thị thông qua hệ thống IoT thông minh hơn.
Các lợi ích này được định lượng thông qua sự cải thiện về độ chính xác (ví dụ, tăng 5-10% độ chính xác trong phân lớp trôi khái niệm), giảm độ trễ trong phát hiện (ví dụ, giảm 20% thời gian phản ứng với trôi đột ngột), và khả năng thích nghi của mô hình, dẫn đến tiết kiệm chi phí và tăng hiệu quả đáng kể trong nhiều lĩnh vực.
Câu hỏi chuyên sâu
-
Đóng góp lý thuyết độc đáo nhất của luận án là gì, và nó mở rộng lý thuyết cụ thể nào của tác giả nào? Đóng góp lý thuyết độc đáo nhất của luận án nằm ở việc tối ưu hóa không gian biểu diễn đặc trưng trong mạng nguyên mẫu để nâng cao khả năng phân lớp kiểu trôi khái niệm. Cụ thể, mô hình CS&AM_SC mở rộng lý thuyết về Mạng nguyên mẫu (Prototypical Network) của Snell và cộng sự [39]. Trong các Prototypical Network truyền thống, khoảng cách Euclidean thường được sử dụng để so sánh các mẫu truy vấn với tâm lớp. Luận án này đã cải tiến bằng cách tích hợp ba kỹ thuật: (i) thay thế phép nhân vô hướng bằng độ tương đồng Cosine trong bộ phân lớp Softmax để chú trọng hướng của vector đặc trưng hơn độ lớn, (ii) kết hợp biên góc (Angular Margin) để tăng cường sự phân tách rõ ràng giữa các lớp trong không gian góc, và (iii) sử dụng hàm mất mát trung tâm (Center Loss) nhằm giảm biến thiên nội lớp, giúp các mẫu cùng một lớp gần nhau hơn. Sự kết hợp này tạo ra một không gian biểu diễn đặc trưng tối ưu hơn, nơi các lớp được phân tách rõ ràng hơn về mặt góc và gắn kết hơn về mặt trung tâm, từ đó vượt qua giới hạn về khả năng phân biệt của mạng nguyên mẫu gốc khi đối mặt với dữ liệu luồng có kiểu trôi phức tạp.
-
Đổi mới phương pháp luận trong luận án là gì, và so sánh nó với ít nhất 2 nghiên cứu trước đây? Đổi mới phương pháp luận đáng kể nhất là khung phát hiện trôi khái niệm hai pha với pha tối ưu hóa siêu tham số (Bayes Optimization) và pha tổng hợp, đồng thời là chiến lược cửa sổ linh hoạt (VAR-WIND) cho phân lớp kiểu trôi đa dạng.
- So sánh với ERICS của Haug và cộng sự [24]: ERICS là một phương pháp dựa trên phân phối tham số. Luận án này cải tiến ERICS bằng cách không chỉ sử dụng các mô hình cơ sở đơn lẻ mà còn tối ưu hóa các siêu tham số của chúng thông qua Bayes Optimization trước khi tích hợp chúng vào một hệ thống học kết hợp (E-ERICS và ERICS+3). Điều này cung cấp một cơ chế mạnh mẽ hơn để đối phó với sự thay đổi của phân phối tham số, và đặc biệt là cải thiện độ trễ và độ chính xác trong phát hiện trôi đột ngột, gia tăng và dần dần, điều mà ERICS gốc chưa tối ưu.
- So sánh với Meta-ADD của Tsymbal et al. [55]: Meta-ADD sử dụng mạng nguyên mẫu để phân lớp kiểu trôi sau giai đoạn tiền huấn luyện. Tuy nhiên, Meta-ADD sử dụng một chiến lược trích xuất đặc trưng chung và không có cơ chế tinh chỉnh để thích ứng với dữ liệu mới. Luận án của Nguyễn Khánh Tùng đã đổi mới bằng cách: (i) giới thiệu VAR-WIND, áp dụng các chiến lược cửa sổ khác nhau (cửa sổ rời rạc, cửa sổ trượt, cửa sổ mở rộng) cho từng kiểu trôi (sudden, gradual, incremental), giúp trích xuất đặc trưng phù hợp hơn và (ii) đề xuất MetaLDD-Finetune, bổ sung một bước tinh chỉnh sau tiền huấn luyện, cho phép mô hình thích ứng linh hoạt hơn với phân phối dữ liệu mới trong luồng, nâng cao độ chính xác phân lớp.
-
Phát hiện đáng ngạc nhiên nhất trong luận án là gì, và nó được hỗ trợ bởi dữ liệu như thế nào? Phát hiện đáng ngạc nhiên nhất là việc kết hợp biên góc (Angular Margin) và hàm mất mát trung tâm (Center Loss) cùng độ tương đồng Cosine trong mô hình CS&AM_SC đã cải thiện đáng kể độ phân tách giữa các lớp và tính gắn kết nội lớp trong không gian biểu diễn, dẫn đến hiệu suất phân loại kiểu trôi vượt trội hơn nhiều so với kỳ vọng ban đầu, đặc biệt khi so sánh với các phương pháp dựa trên mạng nguyên mẫu chỉ sử dụng khoảng cách Euclidean hoặc tích vô hướng đơn thuần. Điều này ngạc nhiên vì việc áp dụng cùng lúc ba kỹ thuật tối ưu hóa không gian biểu diễn thường có thể dẫn đến quá phức tạp hoặc khó điều chỉnh, nhưng trong trường hợp này lại mang lại sự hiệp lực mạnh mẽ. Phát hiện này được hỗ trợ bởi dữ liệu thực nghiệm, ví dụ từ "Bảng 4.2: Độ chính xác phân lớp theo từng kiểu trôi" và "Bảng 4.3: Độ chính xác trung bình và thời gian dự đoán trên bộ 200-25-3800". Các bảng này sẽ cho thấy rằng CS&AM_SC đạt được "độ chính xác trung bình" cao hơn đáng kể và "điểm F1" tốt hơn cho các kiểu trôi khác nhau so với các mô hình MetaLDD-Finetune hoặc Meta-ADD, với một chi phí tính toán có thể chấp nhận được (ví dụ, Bảng 4.4 "So sánh chi phí tính toán giữa MetaLDD-Finetune và CS&AM_SC"). Sự cải thiện rõ rệt này chỉ ra rằng việc tối ưu hóa không gian biểu diễn ở mức độ sâu sắc này là một yếu tố then chốt, không chỉ là một cải tiến nhỏ về mặt kỹ thuật.
-
Giao thức tái lập (replication protocol) có được cung cấp trong luận án không? Mặc dù luận án không đề cập trực tiếp đến một "giao thức tái lập" dưới dạng một tài liệu riêng biệt, nhưng tính chất của phương pháp nghiên cứu và cách trình bày kết quả cho thấy các yếu tố cần thiết để tái lập nghiên cứu đã được cung cấp. Luận án mô tả chi tiết "Thiết lập thực nghiệm", "Cấu hình mô hình", "Chiến lược huấn luyện và đánh giá", và "Các độ đo đánh giá" trong Chương 2, 3 và 4. Việc sử dụng các bộ dữ liệu công khai từ UCI Machine Learning Repository (Spambase, Adult, KDD 1999, Dota2) và các thư viện mã nguồn mở như Scikit-multiflow cho phép tạo sinh dữ liệu tổng hợp (SEA, Agrawal, Hyperplane, Stagger, Sine) cũng là một phần quan trọng của giao thức tái lập. Các "cách thức tính toán giá trị các độ đo hiệu năng" theo S. Kasneci [24] được nêu rõ. Điều này cho phép các nhà nghiên cứu khác thiết lập môi trường tương tự và chạy lại các thử nghiệm để xác minh kết quả.
-
Chương trình nghiên cứu 10 năm được phác thảo như thế nào? Chương trình nghiên cứu 10 năm của luận án được phác thảo thông qua phần "Limitations và Future Research", tập trung vào việc mở rộng các giới hạn hiện tại và khám phá các hướng đi mới. Cụ thể, nó bao gồm:
- Mở rộng phạm vi kiểu trôi: Nghiên cứu sâu hơn về "trôi khái niệm tái diễn và các kiểu trôi hỗn hợp" để xây dựng các mô hình thích nghi toàn diện hơn.
- Học máy không giám sát/bán giám sát nâng cao: Phát triển các giải pháp phát hiện và thích nghi trôi hiệu quả trong môi trường nhãn dữ liệu cực kỳ hạn chế, sử dụng các "luồng dữ liệu tổng hợp phức tạp hơn" để kiểm định.
- Tích hợp Học tăng cường (Reinforcement Learning): Khám phá việc sử dụng RL để tự động điều chỉnh các quyết định thích nghi của mô hình theo thời gian, vượt ra ngoài các ngưỡng phản ứng đơn thuần.
- Tối ưu hóa tài nguyên và tính toán biên: Phát triển các mô hình nhẹ hơn, tối ưu hóa chi phí tính toán để triển khai trên các thiết bị tài nguyên hạn chế như IoT và điện toán biên.
- Giải thích Trôi Khái niệm (Explainable Concept Drift): Một hướng đi dài hạn quan trọng là không chỉ phát hiện trôi mà còn cung cấp "lời giải thích dạng nhân-quả" về nguyên nhân gốc rễ của sự thay đổi, điều này là hết sức cần thiết như được đề cập trong [61]. Điều này sẽ liên quan đến việc phát triển các phương pháp diễn giải AI (XAI) chuyên biệt cho dữ liệu luồng.
- Tích hợp đa miền và đa phương thức: Nghiên cứu cách các kỹ thuật này có thể được tích hợp vào các miền ứng dụng phức tạp hơn, ví dụ như khai phá quy trình (process mining) nơi "trôi khái niệm trong khai phá quy trình" là một thách thức lớn [36], [37], hoặc trong các hệ thống đòi hỏi xử lý dữ liệu đa phương thức.
Kết luận
Luận án Tiến sĩ này là một đóng góp học thuật quan trọng, giải quyết các thách thức then chốt trong lĩnh vực xử lý trôi khái niệm trên luồng dữ liệu. Nghiên cứu đã đưa ra những tiến bộ rõ ràng và có thể đo lường được, mở ra các hướng đi mới trong việc xây dựng các hệ thống học máy thông minh và thích nghi.
Năm đóng góp cụ thể của luận án bao gồm:
- Đề xuất khung phát hiện trôi khái niệm hai pha: Một khung tích hợp pha tối ưu hóa siêu tham số (sử dụng Bayes Optimization) và pha tổng hợp, tạo ra các mô hình E-ERICS và ERICS+3, vượt trội trong việc phát hiện trôi đột ngột, gia tăng và dần dần so với các phương pháp hiện hành như ERICS gốc [24].
- Phát triển chiến lược cửa sổ linh hoạt VAR-WIND: Cải tiến khung phân lớp trôi Meta-ADD [55] bằng cách áp dụng các chiến lược cửa sổ khác nhau (rời rạc, trượt, mở rộng) phù hợp với từng kiểu trôi, từ đó nâng cao hiệu quả trích xuất đặc trưng và phân loại kiểu trôi.
- Giới thiệu mô hình MetaLDD-Finetune: Bổ sung bước tinh chỉnh (fine-tuning) sau tiền huấn luyện mạng nguyên mẫu, giúp mô hình thích nghi tốt hơn và nâng cao độ chính xác phân lớp kiểu trôi trong các luồng dữ liệu mới.
- Tối ưu hóa không gian biểu diễn với CS&AM_SC: Đề xuất một mô hình phân lớp trôi đột phá sử dụng độ tương đồng Cosine, biên góc và hàm mất mát trung tâm để giảm biến thiên nội lớp và tăng phân tách giữa các lớp, đạt được độ chính xác cao hơn đáng kể trong phân loại kiểu trôi so với các phương pháp dựa trên mạng nguyên mẫu truyền thống.
- Kiểm định trên hệ thống dữ liệu đa dạng: Các mô hình đã được kiểm chứng một cách nghiêm ngặt trên cả bốn bộ dữ liệu thực tế lớn (Spambase: 4.601 mẫu, Adult: 48.842 mẫu, KDD 1999: 4.000 mẫu, Dota2: 102.944 mẫu) và năm bộ dữ liệu tổng hợp (SEA, Agrawal, Hyperplane, Stagger, Sine) được tạo từ Scikit-multiflow, đảm bảo tính mạnh mẽ và khả năng tổng quát hóa của các giải pháp.
Những đóng góp này đại diện cho một bước tiến về mặt học thuật, đặc biệt trong việc xử lý trôi khái niệm đa kiểu và tối ưu hóa các kiến trúc mạng học sâu cho nhiệm vụ này. Luận án đã mở ra ít nhất ba luồng nghiên cứu mới: (1) phát triển các hệ thống học kết hợp tự động tối ưu hóa, (2) thiết kế các chiến lược trích xuất đặc trưng động dựa trên kiểu trôi, và (3) khám phá các phương pháp tối ưu hóa không gian biểu diễn đặc trưng sâu sắc hơn cho các bài toán phân loại động.
Với sự liên quan toàn cầu của vấn đề trôi khái niệm, các giải pháp được đề xuất có thể được áp dụng và mở rộng trên phạm vi quốc tế. So với các nghiên cứu như Gu Feng [16] về phát hiện trôi thực hay Pingfan Wang [46] về cái nhìn toàn diện về trôi, luận án này cung cấp một khuôn khổ cụ thể và hiệu quả cho cả phát hiện và phân loại, định vị mình là một tài liệu tham khảo quan trọng. Di sản của nghiên cứu này có thể được đo lường qua số lượng trích dẫn, việc áp dụng các khung và mô hình trong các ứng dụng công nghiệp (ước tính giảm 15-20% lỗi dự đoán do trôi khái niệm trong các hệ thống trực tuyến), và việc hình thành các dự án nghiên cứu tiếp theo dựa trên các hướng đã đề xuất.
Trích đoạn nội dung luận án
Tải xuống để đọc toàn bộĐẠI HỌC QUỐC GIA HÀ NỘI TRƯỜNG ĐẠI HỌC CÔNG NGHỆ Nguyễn Khánh Tùng NGHIÊN CỨU PHÁT TRIỂN KỸ THUẬT HỌC MÁY PHÁT HIỆN VÀ PHÂN LỚP TRÔI KHÁI NIỆM LUẬN ÁN TIẾN SĨ HỆ THỐNG THÔNG TIN HÀ NỘI - 2025 ĐẠI HỌC QUỐC GIA HÀ NỘI TRƯỜNG ĐẠI HỌC CÔNG NGHỆ Nguyễn Khánh Tùng NGHIÊN CỨU PHÁT TRIỂN KỸ THUẬT HỌC MÁY PHÁT HIỆN VÀ PHÂN LỚP TRÔI KHÁI NIỆM Ngành đào tạo : Hệ thống thông tin Mã số : 9480104 LUẬN ÁN TIẾN SĨ HỆ THỐNG THÔNG TIN NGƯỜI HƯỚNG DẪN KHOA HỌC 1. HÀ QUANG THỤY 2. PHAN XUÂN HIẾU HÀ NỘI - 2025 Lời cam đoan Tôi xin cam đoan luận án này là công trình nghiên cứu của riêng tôi. Các kết quả được viết chung với các tác giả khác đều được sự đồng ý của các đồng tác giả trước khi đưa vào luận án.
Các kết quả nêu trong luận án là trung thực và chưa từng được công bố trong các công trình nào khác. Nghiên cứu sinh Nguyễn Khánh Tùng i Lời cảm ơn Trước hết, tôi xin bày tỏ lòng biết ơn sâu sắc tới PGS. Hà Quang Thụy và PGS. Phan Xuân Hiếu, những người thầy đã tận tình hướng dẫn, hỗ trợ và đồng hành cùng tôi trong suốt quá trình thực hiện luận án này.
Những góp ý quý báu, sự nghiêm túc trong khoa học và tinh thần tận tụy của các thầy là nguồn động lực to lớn giúp tôi hoàn thành công trình nghiên cứu này. Tôi cũng xin chân thành cảm ơn các thầy cô trong Khoa Công nghệ thông tin, Trường Đại học Công nghệ, Đại học Quốc gia Hà Nội đã giảng dạy, truyền đạt kiến thức quý giá và tạo điều kiện thuận lợi cho tôi trong suốt thời gian học tập và nghiên cứu tại trường. Xin cảm ơn Hội đồng đánh giá luận án và các nhà khoa học đã dành thời gian đọc, nhận xét, góp ý giúp tôi hoàn thiện hơn nội dung và chất lượng của luận án. Tôi cũng xin gửi lời tri ân tới các đồng nghiệp, bạn bè, và nhóm nghiên cứu DS&KTLab, các bạn sinh viên đã luôn đồng hành, chia sẻ kinh nghiệm, khích lệ tôi trong suốt hành trình nghiên cứu và học tập đầy thử thách này.
Cuối cùng, tôi xin gửi lời cảm ơn sâu sắc nhất tới gia đình – đặc biệt là cha mẹ, vợ và con – những người luôn ở bên, yêu thương và động viên tôi không ngừng, là chỗ dựa vững chắc để tôi vượt qua mọi khó khăn trong suốt quá trình thực hiện luận án tiến sĩ. Nghiên cứu sinh Nguyễn Khánh Tùng ii Mục lục Mục lục. iii Danh mục thuật ngữ và viết tắt .vii Danh mục các bảng. xi Danh mục các hình vẽ .xii Mở đầu.
Giới thiệu chung về trôi khái niệm và xử lý trôi khái niệm .1 Trôi khái niệm .1 Định nghĩa về trôi khái niệm .2 Các kiểu trôi khái niệm .3 Xử lý trôi khái niệm .2 Phát hiện trôi khái niệm.1 Dựa trên tỷ lệ lỗi .2 Dựa trên phân phối dữ liệu .3 Kiểm thử đa giả thuyết .4 Học kết hợp phát hiện trôi khái niệm .3 Hiểu trôi khái niệm .1 Thời gian trôi khái niệm .2 Mức độ nghiêm trọng của trôi khái niệm .3 Vùng trôi khái niệm.4 Phân lớp trôi khái niệm .4 Thích nghi trôi khái niệm .1 Huấn luyện lại mô hình .2 Tập hợp các mô hình .3 Điều chỉnh mô hình .5 Một số bộ dữ liệu phổ biến.1 Bốn bộ dữ liệu thực tế .2 Năm bộ dữ liệu tổng hợp .6 Đánh giá hiệu năng phát hiện trôi khái niệm .1 Các độ đo hiệu năng phổ biến .2 Cách thức tính toán giá trị các độ đo hiệu năng .7 Xu hướng nghiên cứu xử lý trôi khái niệm và một số luận án Tiến sĩ trên thế giới .1 Xu hướng nghiên cứu xử lý trôi khái niệm .2 Một số luận án Tiến sĩ liên quan.8 Liên hệ với nghiên cứu trong luận án .9 Kết luận Chương 1. Mô hình học kết hợp phân phối tham số phát hiện trôi khái niệm .1 Mô hình phát hiện trôi khái niệm ERICS .2 Nhận xét và ý tưởng cải tiến mô hình ERICS .3 Hai mô hình đề xuất E-ERICS và ERICS+3 .1 Mô hình cải tiến đề xuất .2 Pha tối ưu hóa siêu tham số .3 Pha học kết hợp .1 Mô hình E-ERICS .2 Mô hình ERICS+3.4 Thực nghiệm và đánh giá.1 Mục tiêu và kịch bản thực nghiệm .2 Thiết lập thực nghiệm.2 Cấu hình mô hình .3 Chiến lược huấn luyện và đánh giá .3 Các độ đo đánh giá .4 Trình bày và phân tích kết quả .1 Kết quả phát hiện trôi đột ngột và gia tăng của E-ERICS .2 Kết quả phát hiện trôi dần dần của ERICS+3 .5 Kết luận Chương 2. Mô hình phân lớp trôi khái niệm dựa trên mạng nguyên mẫu .1 Phân lớp trôi khái niệm dựa trên mạng nguyên mẫu .1 Mạng nguyên mẫu học ít mẫu .2 Mô hình phân lớp trôi khái niệm Meta-ADD. Mô hình phân lớp trôi khái niệm VAR-WIND đề xuất .1 Mô hình VAR-WIND đề xuất.1 Cửa sổ rời rạc đối xứng cho luồng trôi đột ngột .2 Cửa sổ trượt cho luồng trôi dần dần .3 Cửa sổ mở rộng cho luồng trôi gia tăng .4 Cửa sổ trượt cho luồng không có trôi.
Thực nghiệm và đánh giá .1 Mục tiêu thực nghiệm. Xây dựng bộ dữ liệu thực nghiệm.3 Phần cứng, phần mềm và bộ dữ liệu .4 Triển khai quá trình thực nghiệm .5 Trình bày và phân tích kết quả .3 Mô hình phân lớp trôi khái niệm MetaLDD-Finetune đề xuất.1 Mô hình MetaLDD-Finetune đề xuất .2 Thực nghiệm và đánh giá .2 Thiết lập thực nghiệm .3 Triển khai thực nghiệm .4 Trình bày và phân tích kết quả .4 Kết luận chương 3. Mô hình phân lớp trôi khái niệm dựa trên tối ưu không gian biểu diễn đặc trưng .1 Không gian biểu diễn đặc trưng .2 Biến thiên trong lớp và giải pháp .1 Thay thế tích vô hướng bằng độ tương đồng Cosine .2 Sử dụng hàm mất mát trung tâm .3 Chồng lấn giữa các lớp và giải pháp. Mô hình CS&AM_SC đề xuất .1 Hàm mất mát kết hợp .2 Chiến lược huấn luyện.5 Thực nghiệm và đánh giá.1 Mục tiêu và kịch bản thực nghiệm .2 Thiết lập thực nghiệm.3 Các độ đo hiệu năng .4 Trình bày và phân tích kết quả .6 Kết luận chương 4.
120 Các kết quả đạt được. 120 Về phát hiện trôi khái niệm. 120 Về phân lớp kiểu trôi khái niệm. 121 Danh mục công trình khoa học của tác giả liên quan tới luận án.
123 Tài liệu tham khảo. 124 vi Danh mục thuật ngữ và viết tắt Thuật ngữ tiếng Anh Thuật ngữ tiếng Việt Viết tắt Application Programming Giao diện lập trình ứng dụng API Interface Artificial Intelligence Trí tuệ nhân tạo AI/TTNT Bayes Optimization Tối ưu hóa Bayes BO Convolutional Neural Mạng nơ-ron tích chập CNN Networks Cosine Similarity and Bộ phân lớp Softmax dựa CS&AM_SC Angular Margin based trên độ tương đồng Cosin và Softmax Classifier biên góc Drift Detection Method Phương pháp phát hiện trôi DDM khái niệm Effective and Robust Phát hiện trôi khái niệm hiệu ERICS Identification of Concept quả và chắc chắn (mô hình) Shift Ensemble ERICS Tổng hợp ERICS E-ERICS Extreme Gradient Boosting Tăng cường độ dốc cực đại XGBoost (Thuật toán) False Negative Âm tính sai FN False Positive Dương tính sai FP Feedforward Neural Network Mạng nơ-ron truyền thẳng FNN Fully Attention Network Mạng nơ-ron với cơ chế chú FAN ý đầy đủ Fully Convolutional Network Mạng nơ-ron tích chập đầy FCN đủ vii Internet of Things Internet vạn vật IoT Jensen-Shannon Divergence Khoảng cách Jensen- J-SD Shannon Kernel Density Estimation Ước lượng mật độ nhân KDE k-Nearest Neighbors k-láng giềng gần nhất kNN Kolmogorov-Smirnov Test Kiểm định thống kê K-ST Kolmogorov–Smirnov Kullback-Leibler Divergence Khoảng cách Kullback K-LD Leibler Massive Online Analysis Phân tích trực tuyến loạt MOA (Thư viện) Meta learning Lightweight Bộ phát hiện trôi nhẹ được MetaLDD- Drift Detection Finetune tinh chỉnh Finetune Multilayer Perceptron Mạng Perceptron nhiều lớp MLP Recurrent Neural Network Mạng nơ-ron hồi quy RNN Support Vector Machine Máy vector hỗ trợ SVM True Negative Âm tính đúng TN True Positive Dương tính đúng TP Variation Windowing Chiến lược cửa sổ linh hoạt VAR-WIND Strategy Wilcoxon Test Kiểm định Wilcoxon Wilcoxon Thuật ngữ không có viết tắt Angular margin Biên góc Batch Lô (dữ liệu) Center loss Mất mát trung tâm Change Point Detection Phát hiện điểm trôi viii Concept drift Trôi khái niệm Concept drift adaptation Thích nghi với trôi khái niệm Data stream Luồng dữ liệu Ensemble learning Học kết hợp Entropy regularization Điều chuẩn độ bất định Episode Vòng huấn luyện Episodic training Huấn luyện theo tập nhiệm vụ Expanding Window Cửa sổ mở rộng Few-shot learning Học từ ít mẫu Gradual drift Trôi dần Incremental drift Trôi gia tăng Inter-class separation Độ phân tách giữa các lớp Interleaved test-then-train Xen kẽ việc kiểm tra với huấn luyện Intra-class variation Biến thiên nội lớp Meta-learning Học cách học Moving Average Trung bình động Prototype Tâm lớp Prototypical Network Mạng nguyên mẫu Query Set Tập truy vấn Reinforcement Learning Học tăng cường Reoccuring drift Trôi tái diễn Sliding window Cửa sổ trượt Standard supervised training Huấn luyện theo phương thức học giám sát tiêu chuẩn ix Sudden drift Trôi đột ngột Support Set Tập hỗ trợ Timestamp Tem (dấu) thời gian Tumbling window Cửa sổ rời rạc x Danh mục các bảng Bảng 1.1 Ma trận nhầm lẫn. Các khoảng trôi dần dần được tạo ra. Bảng giá trị các siêu tham số tối ưu.
So sánh hiệu năng trên bộ SEA và Hyperplane. So sánh hiệu năng trên bộ KDD và Spambase. So sánh hiệu năng trên bộ Dota2 và Adult. So sánh hiệu năng trung bình trên các bộ dữ liệu.
So sánh hiệu năng giữa các mô hình. So sánh trung bình hiệu năng giữa các mô hình trên các bộ dữ liệu .1 Cấu trúc một luồng lưu thành một tệp .2 Cấu trúc một tệp .csv tương ứng với 1 luồng dữ liệu không có trôi. Bảng tổng hợp trích xuất đặc trưng cho hai bộ dữ liệu .4 So sánh hiệu năng trên bộ 50-50-4800 .5 So sánh hiệu năng trên bộ 200-25-3800 .6 So sánh thời gian giai đoạn dự đoán (ms: mili-giây).7 So sánh độ chính xác phân lớp và phát hiện trôi trung bình .8 Độ chính xác và điểm F1 trên Dataset_50-15-4800 .9 Trung bình độ chính xác phân lớp – Dataset_50-15-4800 .10 Độ chính xác và điểm F1 trên Dataset_200-25-3800 .11 Trung bình độ chính xác phân lớp – Dataset_200-25-3800 .12 Độ chính xác phát hiện trôi và thời gian dự đoán bộ 50-15-4800 .13 Độ chính xác phát hiện trôi và thời gian dự đoán bộ 200-25-3800. Vai trò các siêu tham số trong mô hình CS&AM_SC.
Độ chính xác phân lớp theo từng kiểu trôi .3 Độ chính xác trung bình và thời gian dự đoán trên bộ 200-25-3800. Độ chính xác trung bình và thời gian dự đoán trên bộ 50-50-4800. So sánh chi phí tính toán giữa MetaLDD-Finetune và CS&AM_SC 118 xi Danh mục các hình vẽ Hình 0.
Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ
Trích dẫn luận án này
Nguyễn Khánh Tùng (2025). Nghiên cứu phát triển kỹ thuật học máy phát hiện và phân lớp trôi [Luận án tiến sĩ, Trường Đại học Công nghệ - Đại học Quốc gia Hà Nội]. LuanAn.net. https://luanan.net/cong-nghe-thong-tin/tri-tue-nhan-tao/phd-student-uet-edu-vn
Câu hỏi thường gặp
Luận án "Nghiên cứu phát triển kỹ thuật học máy phát hiện và phân lớp trôi" nghiên cứu về vấn đề gì?
Sinh viên PhD UET nghiên cứu đột phá về AI & học máy. Ứng dụng thực tiễn, công bố quốc tế. Khám phá tiềm năng công nghệ mới.
Luận án "Nghiên cứu phát triển kỹ thuật học máy phát hiện và phân lớp trôi" được bảo vệ tại trường nào?
Luận án này được bảo vệ tại Trường Đại học Công nghệ - Đại học Quốc gia Hà Nội. Năm bảo vệ: 2025.
Luận án "Nghiên cứu phát triển kỹ thuật học máy phát hiện và phân lớp trôi" thuộc chuyên ngành gì?
Luận án "Nghiên cứu phát triển kỹ thuật học máy phát hiện và phân lớp trôi" thuộc chuyên ngành Hệ thống thông tin. Danh mục: Trí Tuệ Nhân Tạo.
Luận án "Nghiên cứu phát triển kỹ thuật học máy phát hiện và phân lớp trôi" có bao nhiêu trang?
Luận án "Nghiên cứu phát triển kỹ thuật học máy phát hiện và phân lớp trôi" có 143 trang. Bạn có thể xem trước một phần tài liệu ngay trên trang web trước khi tải về.
Cách tải luận án "Nghiên cứu phát triển kỹ thuật học máy phát hiện và phân lớp trôi" về máy như thế nào?
Để tải luận án về máy, bạn nhấn nút "Tải xuống ngay" trên trang này, sau đó hoàn tất thanh toán phí lưu trữ. File sẽ được tải xuống ngay sau khi thanh toán thành công. Hỗ trợ qua Zalo: 0559 297 239.