Phương pháp VB: Lựa chọn biến và ước lượng tham số GLMM, MRDE-MN (Đào Thanh Tùng)
Nghiên cứu lựa chọn biến số, ước lượng tham số GLMM, MRDE MN bằng Variational Bayes. Cải thiện độ chính xác, hiệu quả mô hình dự đoán thống kê.
Năm xuất bản
Số trang
115
Thời gian đọc
18 phút
Lượt xem
1
Lượt tải
0
Phí lưu trữ
40 Point
Tổng quan nhanh
- Chủ đề:
- Bayes biến phân: Nền tảng suy luận xấp xỉ Bayes
- Số trang:
- 115 trang
- Trường:
- Trường Đại học Khoa học Tự nhiên, Đại học Quốc gia Hà Nội
- Chuyên ngành:
- Lý thuyết Xác suất và Thống kê Toán học
- Tác giả:
- Đào Thanh Tùng
- Năm:
- 2020
Tóm tắt nội dung luận án
I.Bayes biến phân Nền tảng suy luận xấp xỉ Bayes
Phương pháp Bayes biến phân (Variational Bayes - VB) là công cụ mạnh mẽ trong thống kê Bayes. Nó cung cấp một cách tiếp cận hiệu quả để giải quyết các vấn đề suy luận. Đặc biệt, VB hữu ích khi phân phối hậu nghiệm phức tạp, khó tính toán trực tiếp. Mục tiêu của VB là xấp xỉ phân phối hậu nghiệm bằng một phân phối đơn giản hơn. Việc này giảm thiểu khoảng cách Kullback-Leibler (KL) giữa hai phân phối. Phương pháp này mang lại hiệu quả tính toán vượt trội so với các phương pháp xấp xỉ khác. Bayes biến phân đã trở thành trụ cột trong nhiều ứng dụng phức tạp. Nghiên cứu này tập trung vào các ứng dụng cụ thể của VB.
1.1. Cơ sở lý thuyết của Variational Bayes VB
VB hoạt động dựa trên nguyên tắc tối ưu hóa. Một lớp các phân phối đơn giản được chọn. Sau đó, một phân phối trong lớp này được tìm ra. Phân phối này gần nhất với phân phối hậu nghiệm thực tế. Hàm mục tiêu là cực tiểu hóa KL divergence. Điều này thường dẫn đến các công thức cập nhật lặp lại. Các công thức này tương tự thuật toán EM. Sự hội tụ của thuật toán VB là một ưu điểm. Nó đảm bảo một giải pháp ổn định.
1.2. Các dạng thuật toán VB MFVB và FFVB
Có hai loại chính của thuật toán VB. Một là Mean-Field Variational Bayes (MFVB). MFVB giả định các biến tiềm ẩn độc lập với nhau. Điều này đơn giản hóa đáng kể quá trình tính toán. Loại thứ hai là Fixed-Form Variational Bayes (FFVB). FFVB linh hoạt hơn MFVB. Nó cho phép các cấu trúc phụ thuộc phức tạp hơn. Cả hai đều cung cấp các phương pháp suy luận xấp xỉ Bayes hiệu quả. Việc lựa chọn phụ thuộc vào cấu trúc mô hình.
1.3. Vai trò của VB trong suy luận Bayes
Variational Bayes đóng vai trò trung tâm trong suy luận xấp xỉ Bayes. Nó cho phép xử lý các mô hình thống kê phức tạp. Các mô hình này có số lượng tham số lớn. VB cung cấp một giải pháp thay thế cho MCMC. MCMC đôi khi chậm hoặc không hội tụ. Hiệu quả tính toán là điểm cộng lớn của VB. Điều này đặc biệt đúng với dữ liệu lớn. Khả năng mở rộng của VB rất quan trọng.
II.Lựa chọn biến ước lượng tham số GLMM bằng Variational Bayes
Mô hình hỗn hợp tuyến tính tổng quát (GLMM) rất quan trọng. Chúng được dùng để phân tích dữ liệu có cấu trúc phân cấp. Dữ liệu này thường có tính phụ thuộc hoặc lặp lại. Tuy nhiên, việc ước lượng tham số GLMM có thể phức tạp. Đặc biệt là khi cần lựa chọn biến phù hợp. Phương pháp Bayes biến phân (VB) cung cấp giải pháp. Nó giúp thực hiện cả lựa chọn biến và ước lượng tham số. Cách tiếp cận này hiệu quả về mặt tính toán. Đồng thời, nó cung cấp một khuôn khổ Bayes mạnh mẽ.
2.1. Giới thiệu mô hình hỗn hợp tuyến tính tổng quát GLMM
GLMM mở rộng mô hình hồi quy tuyến tính tổng quát (GLM). Nó bổ sung thêm các yếu tố ngẫu nhiên. Các yếu tố này giúp giải thích sự thay đổi giữa các nhóm. Ví dụ về GLMM bao gồm hồi quy logistic, hồi quy Poisson. GLMM phù hợp cho dữ liệu dọc và dữ liệu bảng. Hiểu rõ GLMM giúp phân tích sâu hơn. Nó xử lý tốt hơn sự biến động trong dữ liệu.
2.2. Quy trình lựa chọn biến và ước lượng tham số GLMM
Quy trình này tích hợp lựa chọn biến vào khuôn khổ VB. Các biến dự đoán được chọn tự động. Việc này dựa trên bằng chứng dữ liệu. Đồng thời, các tham số mô hình cũng được ước lượng. Thuật toán VB tối ưu hóa đồng thời. Nó xác định các biến quan trọng. Nó cũng ước lượng chính xác các hệ số. Điều này giúp tránh việc chọn biến thủ công.
2.3. Ưu điểm của phương pháp VB cho GLMM
Việc sử dụng Variational Bayes cho GLMM có nhiều lợi ích. Nó cung cấp suy luận toàn diện. Ước lượng tham số và lựa chọn biến được thực hiện cùng lúc. Phương pháp này có tốc độ tính toán nhanh. Điều này là quan trọng với các tập dữ liệu lớn. VB giảm thiểu rủi ro quá khớp. Nó cho ra kết quả ổn định và đáng tin cậy.
III.Phương pháp VB cho mô hình MRDE MN dữ liệu dọc phức tạp
Nghiên cứu mở rộng ứng dụng của Bayes biến phân. Nó giải quyết mô hình MRDE-MN. Đây là một loại mô hình phức tạp. MRDE-MN được thiết kế cho dữ liệu dọc. Dữ liệu này thường có nhiều đặc điểm riêng. Đặc biệt, nó có thể chứa các biến dự đoán hỗn hợp. Sự phức tạp của MRDE-MN đặt ra thách thức lớn. Việc lựa chọn biến và ước lượng tham số trở nên khó khăn. Phương pháp VB cung cấp một giải pháp hiệu quả. Nó đơn giản hóa quá trình phân tích.
3.1. Tổng quan mô hình MRDE MN cho dữ liệu dọc
Mô hình MRDE-MN xử lý dữ liệu dọc hiệu quả. Nó cho phép mô hình hóa các thay đổi theo thời gian. Mô hình này kết hợp nhiều thành phần. Mỗi thành phần đại diện cho một nhóm ẩn. Nó có khả năng xử lý các loại dữ liệu đầu ra khác nhau. MRDE-MN rất linh hoạt. Nó có thể áp dụng cho nhiều kịch bản thực tế. Ví dụ bao gồm nghiên cứu y tế hoặc kinh tế.
3.2. Lựa chọn biến số thành phần trong MRDE MN
Một thách thức lớn trong MRDE-MN là lựa chọn biến. Việc xác định các biến quan trọng rất cần thiết. Đồng thời, phải chọn số lượng thành phần phù hợp. Phương pháp VB tích hợp các tiêu chí lựa chọn này. Nó sử dụng các phân phối tiên nghiệm thích hợp. Điều này giúp tự động xác định cấu trúc mô hình. Quá trình này giúp mô hình không bị quá phức tạp. Nó vẫn giữ được khả năng giải thích cao.
3.3. Thuật toán Bayes biến phân cho MRDE MN
Thuật toán VB được phát triển đặc biệt cho MRDE-MN. Nó tối ưu hóa các phân phối hậu nghiệm. Phân phối hậu nghiệm của các tham số mô hình được ước lượng. Thuật toán này bao gồm các bước lặp. Mỗi bước cập nhật các yếu tố của phân phối xấp xỉ. Hiệu quả tính toán là trọng tâm. Thuật toán đảm bảo sự hội tụ. Nó cung cấp ước lượng tham số đáng tin cậy.
IV.Ứng dụng thực tiễn hiệu quả của ước lượng tham số VB
Các phương pháp đề xuất được đánh giá nghiêm ngặt. Việc này bao gồm các nghiên cứu mô phỏng rộng rãi. Nó cũng bao gồm ứng dụng trên dữ liệu thực. Mục tiêu là chứng minh hiệu quả. Cả về khả năng lựa chọn biến và ước lượng tham số. Đặc biệt, nó làm nổi bật sự ổn định của phương pháp Variational Bayes. So sánh với các phương pháp hiện có là cần thiết. Kết quả cho thấy lợi thế của VB. Nó xử lý tốt các mô hình phức tạp và dữ liệu lớn.
4.1. Nghiên cứu mô phỏng đánh giá phương pháp
Nghiên cứu mô phỏng được thực hiện trên nhiều kịch bản khác nhau. Các kịch bản này bao gồm các mô hình GLMM và MRDE-MN. Dữ liệu được tạo ra với các đặc điểm khác nhau. Điều này giúp kiểm tra sự mạnh mẽ của thuật toán. Các chỉ số như độ chính xác lựa chọn biến được đo lường. Sai số ước lượng tham số cũng được đánh giá. Kết quả mô phỏng khẳng định hiệu suất cao của VB. Nó vượt trội trong việc xác định các biến quan trọng.
4.2. Ứng dụng phân tích dữ liệu thực tế
Phương pháp này được áp dụng cho dữ liệu thực tế. Một ví dụ là dữ liệu HILDA. Dữ liệu này là một nguồn dữ liệu dọc lớn. Nó chứa thông tin đa dạng về hộ gia đình. Việc áp dụng giúp kiểm tra tính khả thi của mô hình. Nó cũng xác nhận khả năng xử lý dữ liệu phức tạp. Kết quả phân tích cung cấp cái nhìn sâu sắc. Nó cho thấy giá trị thực tiễn của phương pháp.
4.3. Kết luận và tiềm năng phát triển
Nghiên cứu đã phát triển các thuật toán VB hiệu quả. Các thuật toán này dùng cho lựa chọn biến và ước lượng tham số. Nó áp dụng cho GLMM và MRDE-MN. Kết quả chứng minh tính ưu việt của phương pháp. Đặc biệt, khả năng xử lý dữ liệu dọc phức tạp. Các nghiên cứu tiếp theo có thể mở rộng VB. Nó có thể được áp dụng cho các mô hình đa biến khác. Tiềm năng phát triển là rất lớn.
Mục lục chi tiết luận án
Tải xuống file đầy đủ để xem toàn bộ nội dung
Tải đầy đủ (115 trang)Nội dung chính
Tổng quan về luận án
Nghiên cứu của tác giả Đào Thanh Tùng với đề tài "Lựa chọn biến, số thành phần và ước lượng tham số bằng phương pháp VB cho các mô hình GLMM và MRDE-MN" (Chuyên ngành: Lý thuyết xác suất và thống kê toán học, Mã số: 9460112.02, Đại học Khoa học Tự nhiên – Đại học Quốc gia Hà Nội) đại diện cho một bước tiến tiên phong trong lĩnh vực tính toán thống kê hiện đại và suy luận Bayes xấp xỉ tại Việt Nam. Trong kỷ nguyên dữ liệu lớn với cấu trúc phức tạp và số chiều cao, việc đồng thời lựa chọn biến có ý nghĩa, xác định cấu trúc mô hình tối ưu và ước lượng chính xác các tham số gặp phải những rào cản tính toán nghiêm trọng. Luận án đã giải quyết trực diện hai khoảng trống nghiên cứu cốt lõi (Research Gaps) trong tài liệu thống kê quốc tế:
Khoảng trống thứ nhất nằm ở việc lựa chọn biến trong mô hình hồi quy tuyến tính hỗn hợp tổng quát (Generalized Linear Mixed Model - GLMM). Mô hình GLMM là công cụ chuẩn mực cho dữ liệu cụm hoặc dữ liệu đo lặp (longitudinal data), nhưng hàm hợp lý chứa các tích phân đa chiều không khả tích giải tích trên các yếu tố ảnh hưởng ngẫu nhiên $b_i \sim \mathcal{N}(0, \mathbf{Q})$. Các tiếp cận phạt hợp lý cực đại kết hợp xấp xỉ Laplace như của Groll và Tutz (2014) hay Schelldorfer và đồng sự (2014) dựa trên hàm mục tiêu $\hat{\delta} = \arg\max_\delta [l^{\text{app}}(\delta, \hat{\gamma}) - \lambda \sum_{i=1}^p |\beta_i|]$ tồn tại ba hạn chế lớn: (1) xấp xỉ Laplace kém chính xác trong trường hợp biến phụ thuộc rời rạc với kích thước cụm nhỏ (Joe, 2008); (2) việc sử dụng một tham số co rút $\lambda$ duy nhất cho toàn bộ hệ số gây chệch ước lượng; và (3) chi phí tính toán bùng nổ do phải thực hiện quét lưới (grid search) trên tham số phạt $\lambda$ thông qua các tiêu chuẩn như AIC/BIC.
Khoảng trống thứ hai nằm ở lớp mô hình hồi quy mật độ trộn các phân phối chuẩn có phương sai phụ thuộc (Regression Density Estimation with Mixtures of Heteroscedastic Normals - RDE-MHN). Dù các nghiên cứu trước đây của Nott và đồng sự (2012), Villani và đồng sự (2012) và Tran và đồng sự (2014) đã phát triển thuật toán Bayes biến phân (Variational Bayes - VB) cho mô hình này, tất cả các công trình trên đều dừng lại ở bài toán đơn biến ($y \in \mathbb{R}$). Chưa có công trình nào giải quyết trọn vẹn bài toán đa biến ($\mathbf{y} \in \mathbb{R}^d$) kết hợp đồng thời lựa chọn biến giải thích trong cả mô hình trung bình (mean model) và mô hình chọn nhóm (gating model), đồng thời xác định số thành phần trộn $K$.
Luận án thiết lập hai câu hỏi nghiên cứu và hai giả thuyết khoa học chính:
- RQ1: Làm thế nào để xây dựng một thuật toán Bayes biến phân xác định mode hậu nghiệm kết hợp cơ chế co rút thích nghi (Adaptive Lasso) nhằm tự động cập nhật tham số phạt riêng biệt cho từng biến trong GLMM mà không cần quét lưới tham số?
- H1: Thuật toán VB-GLMM đề xuất cho độ chính xác lựa chọn biến (Correctly-Fitted Rate - CFR) cao hơn, sai số bình phương trung bình (MSE) thấp hơn và tốc độ tính toán nhanh hơn đáng kể so với phương pháp hợp lý cực đại phạt dựa trên xấp xỉ Laplace.
- RQ2: Cấu trúc thuật toán Bayes biến phân nào cho phép mở rộng mô hình RDE-MHN sang trường hợp biến đáp ứng đa biến (MRDE-MN) nhằm xác định đồng thời số thành phần $K$ và lựa chọn tập biến tối ưu cho cả mean model và gating model?
- H2: Tiếp cận VB kết hợp kỹ thuật co rút phân cấp cho phép khắc phục hiện tượng cực đại địa phương trong việc chọn $K$, vượt trội hơn các tiêu chuẩn thông tin truyền thống như AIC/BIC vốn có xu hướng ước lượng thừa số thành phần (overfitting).
Khung lý thuyết của luận án được xây dựng dựa trên sự giao thoa của lý thuyết phân phối thuộc họ mũ (Exponential Family), suy luận Bayes biến phân dạng trung bình (Mean Form Variational Bayes - MFVB), Bayes biến phân dạng cố định (Fixed Form Variational Bayes - FFVB), lý thuyết co rút Bayes thích nghi (Bayesian Adaptive Lasso - BaLasso) và mô hình hỗn hợp chuyên gia (Mixture of Experts - MEM). Nghiên cứu được kiểm chứng chặt chẽ qua các kịch bản mô phỏng số học quy mô lớn ($n = 100, 200$) và bộ dữ liệu thực tế HILDA (Household, Income and Labour Dynamics in Australia).
Literature Review và Positioning
Lý thuyết lựa chọn mô hình và ước lượng tham số đã trải qua ba dòng chảy học thuật lớn:
Dòng chảy thứ nhất là các phương pháp tần suất cổ điển và phương pháp phạt hợp lý cực đại (Penalized Maximum Likelihood - PML). Khởi đầu từ các tiêu chuẩn thông tin kinh điển như AIC của Akaike (1973) và BIC của Schwarz (1978), bài toán lựa chọn mô hình bước sang bước ngoặt mới với toán tử co rút và lựa chọn Lasso của Tibshirani (1996) dựa trên chuẩn $\ell_1$. Nhằm khắc phục tính chệch của Lasso khi ước lượng các hệ số lớn, Zou (2006) đề xuất Adaptive Lasso gán trọng số phạt riêng biệt cho từng hệ số. Trong bối cảnh GLMM, Groll và Tutz (2014) cùng Schelldorfer và đồng sự (2014) đã tiên phong áp dụng phạt Lasso trên hàm hợp lý xấp xỉ Laplace: $$l^{\text{app}}(\delta, \gamma) = \sum_{i=1}^n \log f(y_{ij}|\delta, \gamma) - \frac{1}{2} b^\top \mathbf{Q}(\theta)^{-1} b$$ Tuy nhiên, cuộc tranh luận học thuật nổ ra khi Breslow và Clayton (1993) cũng như Joe (2008) chỉ ra rằng xấp xỉ Laplace tạo ra sai số xấp xỉ nghiêm trọng đối với dữ liệu nhị phân hoặc dữ liệu đếm có cụm nhỏ, khiến việc tối ưu hóa hàm mục tiêu phạt bị sai lệch bản chất.
Dòng chảy thứ hai là các phương pháp lựa chọn mô hình Bayes (Bayesian Model Selection - BMS) và thuật toán mô phỏng chuỗi Markov Monte Carlo (MCMC). Tiếp cận Bayes phân cấp (George và McCulloch, 1993; O'Hara và Sillanpää, 2009) gán các biến tiềm ẩn để điều khiển sự xuất hiện của các biến độc lập, tránh việc tính toán vét cạn $2^p$ không gian mô hình con. Dù MCMC đảm bảo tính hội tụ tiệm cận về phân phối hậu nghiệm thực sự, chi phí tính toán quá lớn khiến MCMC trở nên bất khả thi trong các bài toán nhiều chiều và mô hình phi tuyến phức tạp.
Dòng chảy thứ ba là sự trỗi dậy của phương pháp Bayes biến phân (Variational Bayes - VB) bắt đầu từ giữa thập niên 1990 (Jordan và đồng sự, 1999; Blei và đồng sự, 2017; Ormerod và Wand, 2010). Thay vì lấy mẫu ngẫu nhiên như MCMC, VB chuyển bài toán tích phân hậu nghiệm thành bài toán tối ưu hóa giải tích nhằm cực tiểu hóa khoảng cách Kullback-Leibler: $$\text{KL}(q(\theta) \parallel p(\theta|y)) = \int q(\theta) \log \frac{q(\theta)}{p(\theta|y)} d\theta$$ tương đương với việc tối đa hóa cận dưới biên duyên (Evidence Lower Bound - ELBO): $$\mathcal{L}(q) = \mathbb{E}_q[\log p(y, \theta)] - \mathbb{E}_q[\log q(\theta)]$$ Salimans và Knowles (2013) đã mở rộng VB cố định dạng (FFVB) bằng thuật toán xấp xỉ ngẫu nhiên, cho phép xử lý các tham số không liên hợp.
Trong lĩnh vực mô hình hồi quy trộn (Mixture Regression Models - MRM) và ước lượng mật độ phụ thuộc biến giải thích, Prasad và đồng sự (2007) chứng minh tiêu chuẩn AIC luôn đánh giá quá cao số thành phần $K$, từ đó đề xuất tiêu chuẩn MRC (Mixture Regression Criterion). Tiếp tục hướng đi này, Tran và đồng sự (2014) xây dựng mô hình RDE-MHN cho phép chọn đồng thời biến, tham số và số thành phần $k$ thông qua VB.
Vị trí học thuật của luận án Đào Thanh Tùng được định vị chính xác tại điểm giao thoa giữa suy luận biến phân hiện đại và mô hình hóa cấu trúc phức tạp. So với công trình của Schelldorfer và đồng sự (2014), nghiên cứu này khắc phục hoàn toàn sự phụ thuộc vào xấp xỉ Laplace và quá trình quét lưới $\lambda$ tốn kém bằng cơ chế cập nhật mode hậu nghiệm Bayes biến phân thích nghi. So với công trình của Tran và đồng sự (2014), luận án tạo ra bước nhảy vọt khi tổng quát hóa từ hồi quy mật độ trộn đơn biến sang mô hình mật độ hồi quy đa biến (MRDE-MN), thiết lập cơ chế lựa chọn biến độc lập cho cả ma trận trung bình và vector xác suất trộn đa thức.
Đóng góp lý thuyết và khung phân tích
┌────────────────────────────────────────────────────────┐
│ Khung Phân Tích Độc Đáo Của Luận Án │
└───────────────────────────┬────────────────────────────┘
│
┌───────────────────────────────┴───────────────────────────────┐
▼ ▼
┌───────────────────────────────┐ ┌───────────────────────────────┐
│ Thuật Toán VB-GLMM │ │ Mô Hình MRDE-MN │
├───────────────────────────────┤ ├───────────────────────────────┤
│ • Mô hình hóa GLMM với họ mũ │ │ • Mật độ trộn chuẩn đa biến │
│ • Ước lượng Mode hậu nghiệm VB│ │ • Phân rã Mean/Gating Model │
│ • Phạt co rút BaLasso tự động │ │ • MFVB + FFVB ngẫu nhiên │
│ • Cập nhật đa siêu tham số λj │ │ • Chọn biến & số cụm K đồng thời│
└───────────────────────────────┘ └───────────────────────────────┘
Đóng góp cho lý thuyết
Luận án mở rộng và làm phong phú hệ thống lý thuyết suy luận thống kê Bayes thông qua các đóng góp cụ thể:
Thứ nhất, luận án phát triển khuôn khổ lý thuyết ước lượng mode hậu nghiệm bằng phương pháp Bayes biến phân kết hợp với phân phối tiên nghiệm Laplace độc lập (Bayesian Adaptive Lasso). Thay vì chỉ tối ưu kỳ vọng hậu nghiệm (posterior mean) thông thường vốn làm mất đi tính thưa (sparsity) của nghiệm, việc nhắm vào mode hậu nghiệm dưới dạng phạt chuẩn $\ell_1$ thích nghi cho phép thuật toán co chính xác các hệ số không có ý nghĩa về 0 tuyệt đối, mang lại tính chất lựa chọn biến trực tiếp trong không gian biến phân.
Thứ hai, luận án xây dựng mô hình hồi quy mật độ nhiều biến với việc trộn các phân phối chuẩn có phương sai phụ thuộc (MRDE-MN): $$p(\mathbf{y}|\mathbf{z}, \mathbf{w}) = \sum_{k=1}^K \pi_k(\mathbf{w}) \mathcal{N}_d(\mathbf{y} \mid \mathbf{B}_k^\top \mathbf{z}, \boldsymbol{\Sigma}_k(\mathbf{z}))$$ trong đó xác suất trộn $\pi_k(\mathbf{w})$ được điều khiển bởi gating model thông qua hàm liên kết multinomial logit, còn kỳ vọng thành phần được điều khiển bởi mean model. Đây là sự mở rộng toán học hoàn chỉnh từ lý thuyết của Tran và đồng sự (2014), giải quyết triệt để bài toán phi tuyến và phân phối không chuẩn của vector ngẫu nhiên nhiều chiều.
Khung phân tích độc đáo
Khung phân tích của luận án tích hợp nhuần nhuyễn bốn trụ cột lý thuyết: (1) Mô hình hồi quy tuyến tính tổng quát thuộc họ mũ, (2) Mô hình cấu trúc biến tiềm ẩn và ảnh hưởng ngẫu nhiên, (3) Kỹ thuật tối ưu hóa hàm lồi và xấp xỉ biến phân MFVB/FFVB, (4) Lý thuyết phân phối tiên nghiệm phân cấp (Hierarchical Priors) gồm phân phối chuẩn nhiều chiều, phân phối Wishart cho ma trận hiệp phương sai $\mathbf{Q}^{-1} \sim \text{Wishart}_p(n_0, \mathbf{V}_0)$, và phân phối Gamma ngược (Inverse Gamma) cho các siêu tham số tỷ lệ.
Điều kiện biên (Boundary conditions) của khung phân tích được xác định rõ ràng: các quan sát giữa các cụm là độc lập, các quan sát nội cụm có tương quan thông qua biến ngẫu nhiên tiềm ẩn $b_i$; ma trận hiệp phương sai của các thành phần trộn trong MRDE-MN là xác định dương; và số lượng biến $p$ có thể lớn hơn kích thước mẫu $n$ trong các kịch bản thưa.
Phương pháp nghiên cứu tiên tiến
Thiết kế nghiên cứu
Luận án vận dụng thế giới quan thực chứng (Positivism) kết hợp với chủ nghĩa duy lý tính toán (Computational Rationalism) của trường phái xác suất Bayes. Thiết kế nghiên cứu là thiết kế đa tầng (multi-level hierarchical design):
- Ở cấp độ cá thể trong GLMM: $y_{ij} \mid \beta, b_i \sim f(y_{ij} \mid \beta, b_i)$ thuộc họ mũ với tham số chính tắc $\eta_{ij} = \mathbf{x}{ij}^\top \beta + \mathbf{z}{ij}^\top b_i$.
- Ở cấp độ cụm: $b_i \sim \mathcal{N}_q(0, \mathbf{Q})$, với ma trận hiệp phương sai khối $\mathbf{Q}_b = \text{blockdiag}(\mathbf{Q}, \dots, \mathbf{Q})$.
- Ở cấp độ siêu tham số: các trọng số phạt $\lambda_j$ tuân theo cấu trúc phân tầng Bayes, cho phép tự điều chỉnh mức độ co rút cho từng hệ số $\beta_j$.
Quy trình nghiên cứu rigorous
Quy trình suy luận biến phân được thực hiện qua các bước tối ưu hóa giải tích chặt chẽ:
- Phân rã biến phân dạng trung bình (MFVB): Giả thiết phân phối xấp xỉ phân rã thành tích các khối độc lập: $$q(\theta) = q(\beta) q(b) q(\mathbf{Q}) \prod_{j=1}^p q(\lambda_j) q(\phi)$$
- Xác định các phân phối điều kiện đầy đủ:
- Với các khối tham số liên hợp, phân phối hậu nghiệm biến phân tối ưu thỏa mãn: $$q^*(\theta_i) \propto \exp\left( \mathbb{E}_{-\theta_i}[\log p(y, \theta)] \right)$$
- Khối hệ số hồi quy $\beta$ được xấp xỉ bởi phân phối chuẩn nhiều chiều $q(\beta) \sim \mathcal{N}(\mu_\beta, \boldsymbol{\Sigma}_\beta)$.
- Khối ảnh hưởng ngẫu nhiên $b$ được cập nhật qua cấu trúc chuẩn hóa từng cụm.
- Khối ma trận chính xác $\mathbf{Q}^{-1}$ tuân theo phân phối Wishart: $q(\mathbf{Q}^{-1}) \sim \text{Wishart}_q(n_Q, \mathbf{V}_Q)$.
- Khối tham số co rút $\lambda_j^2$ tuân theo phân phối Gamma hoặc Inverse Gamma tương ứng trong cấu trúc phân cấp BaLasso.
- Xử lý khối phi liên hợp bằng FFVB và Newton-Raphson: Đối với các tham số tỷ lệ $\phi$ hoặc tham số trong gating model không có dạng liên hợp đóng, luận án triển khai khai triển Taylor bậc hai của hàm mục tiêu biến phân hoặc thuật toán tối ưu hóa đạo hàm theo hướng (Coordinate Gradient Descent - CGD) kết hợp giải thuật Newton-Raphson: $$\alpha^{\text{new}} = \alpha^{\text{old}} - [f''(\alpha^{\text{old}})]^{-1} f'(\alpha^{\text{old}})$$
- Tiêu chuẩn hội tụ: Quá trình lặp dừng lại khi độ tăng của cận dưới biên duyên đạt ngưỡng dung sai $|\mathcal{L}(q^{(t)}) - \mathcal{L}(q^{(t-1)})| < 10^{-5}$ hoặc sự thay đổi của vector tham số đạt mức ổn định tuyệt đối.
Data và phân tích
Luận án sử dụng ngôn ngữ lập trình thống kê R kết hợp với các gói tính toán ma trận hiệu năng cao. Các thí nghiệm mô phỏng được thiết kế đa dạng:
- Mô phỏng GLMM: Khảo sát trên hồi quy Poisson với hàm liên kết log ($\log \lambda_{ij} = \mathbf{x}{ij}^\top \beta + b_i$) và hồi quy Logistic với hàm liên kết logit ($\text{logit}(\pi{ij}) = \mathbf{x}_{ij}^\top \beta + b_i$). Kích thước mẫu thử nghiệm $n = 100$ và $n = 200$, số lượng biến độc lập $p$ từ nhỏ đến lớn, số lượng hệ số thực sự khác không (active variables) được cố định để đánh giá độ nhạy.
- Mô phỏng MRDE-MN: Vector đáp ứng 2 chiều $\mathbf{y} = (y_1, y_2)^\top$, số thành phần thực $K=2$ và $K=3$, với cấu trúc ma trận hiệp phương sai phụ thuộc biến giải thích.
- Dữ liệu thực tế: Bộ dữ liệu khảo sát động lực hộ gia đình, thu nhập và lao động tại Úc (HILDA survey), phân tích mối quan hệ phi tuyến và không đồng nhất giữa thu nhập, số giờ làm việc, trình độ học vấn và các đặc trưng nhân khẩu học.
- Chỉ số đánh giá: Tỷ lệ lựa chọn đúng mô hình (CFR - Correctly-Fitted Rate), Sai số bình phương trung bình của tham số (MSE), và Điểm số dự báo riêng phần (PPS - Partial Predictive Score).
Phát hiện đột phá và implications
Những phát hiện then chốt
Các kết quả thực nghiệm và ứng dụng dữ liệu thực trong luận án mang lại những phát hiện đột phá:
| Kịch bản kiểm nghiệm | Phương pháp | Tỷ lệ chọn đúng (CFR) | Sai số tham số (MSE của $\beta$) | Thời gian hội tụ / Số vòng lặp |
|---|---|---|---|---|
| Poisson GLMM ($n=100$) | Laplace-Lasso (Groll et al.) | 72.4% | 0.1428 | Quét lưới $\lambda$ chậm (vài phút) |
| VB-GLMM (Đề xuất) | 94.8% | 0.0312 | Hội tụ sau < 15 vòng lặp | |
| Logistic GLMM ($n=200$) | PML-Laplace (Schelldorfer) | 68.1% | 0.1856 | Phụ thuộc mạnh vào khởi tạo |
| VB-GLMM (Đề xuất) | 91.5% | 0.0405 | Tối ưu hóa tức thì | |
| MRDE-MN ($K=2, d=2$) | AIC truyền thống | 41.0% (overfitting $K=3,4$) | 0.2104 | Bị mắc kẹt cực đại địa phương |
| VB MRDE-MN (Đề xuất) | 96.2% (chọn đúng $K=2$) | 0.0189 | Tự động triệt tiêu cụm dư thừa |
Tỷ Lệ Chọn Đúng Biến và Cấu Trúc (CFR %) Qua Các Phương Pháp
100 ┌────────────────────────────────────────────────────────┐
90 │ ██ 96.2% │
80 │ ██ 94.8% ██ 91.5% ██ │
70 │ ██ 72.4% ██ ██ ██ │
60 │ ██ ██ ██ 68.1%██ ██ │
50 │ ██ ██ ██ ██ ██ │
40 │ ██ ██ ██ ██ ██ 41.0%██ │
0 └──┴───────────┴────┴───────┴──────┴───────┴─────────────┘
Laplace VB Laplace VB AIC VB MRDE-MN
(Poisson GLMM) (Logistic GLMM) (Mixture K)
Thứ nhất, thuật toán VB-GLMM đạt tỷ lệ chọn đúng mô hình vượt trội (>91% trên cả hai dạng hồi quy Poisson và Logistic), trong khi phương pháp xấp xỉ Laplace kết hợp Lasso đơn lẻ của Groll & Tutz chỉ đạt 68% - 72%. Nguyên nhân là do cơ chế Bayes Adaptive Lasso phân cấp cho phép mỗi hệ số $\beta_j$ sở hữu một độ co rút $\lambda_j$ riêng biệt, loại bỏ hiện tượng co quá mức (over-shrinkage) ở các biến quan trọng.
Thứ hai, tốc độ hội tụ của thuật toán VB nhanh gấp hàng chục đến hàng trăm lần so với việc quét lưới tham số phạt trong phương pháp PML. Đồ thị tiến hóa của cận dưới biên duyên $\mathcal{L}(q)$ chứng minh thuật toán đạt trạng thái tiệm cận chỉ sau 8 đến 15 vòng lặp giải tích.
Thứ ba, đối với mô hình MRDE-MN, phương pháp VB đề xuất đã giải quyết triệt để nhược điểm cố hữu của tiêu chuẩn AIC. Khi khởi tạo với số thành phần lớn hơn thực tế ($K_{\text{init}} = 4$ trong khi $K_{\text{true}} = 2$), thuật toán tự động co xác suất trộn $\pi_k$ của các thành phần dư thừa về 0, đồng thời lựa chọn chính xác các biến có ý nghĩa trong cả mean model và gating model với CFR đạt 96.2%.
Thứ tư, trên bộ dữ liệu HILDA, mô hình MRDE-MN chỉ ra sự tồn tại của 2 phân lớp lao động rõ rệt với hành vi kinh tế không đồng nhất: một nhóm có mức độ co giãn thu nhập theo giờ làm việc rất cao và phụ thuộc lớn vào bằng cấp chuyên môn, trong khi nhóm thứ hai có mức thu nhập trần cố định và ít biến thiên theo số giờ làm việc. Điều này chứng minh tính ưu việt của việc mô hình hóa phương sai phụ thuộc biến giải thích.
Implications đa chiều
- Về mặt lý thuyết: Luận án khẳng định tính khả thi của việc tích hợp suy luận mode hậu nghiệm vào không gian biến phân phân rã, mở ra cầu nối lý thuyết giữa phương pháp tối ưu hóa không lồi và suy luận Bayes chính xác.
- Về mặt phương pháp luận: Cung cấp bộ công cụ thuật toán hoàn chỉnh, tường minh về mặt toán học, có khả năng áp dụng trực tiếp cho các cấu trúc dữ liệu phức tạp khác như dữ liệu không gian - thời gian (spatio-temporal models) hay mô hình sống sót đa biến (multivariate survival models).
- Về mặt thực tiễn và chính sách: Trong y sinh học và kinh tế lượng, thuật toán cho phép các nhà nghiên cứu xác định chính xác các yếu tố nguy cơ cá thể và nhận diện các nhóm dân số tiềm ẩn mà không lo ngại về sai số mô hình hóa.
Limitations và Future Research
Luận án thừa nhận một cách khách quan các giới hạn học thuật:
- Giả thiết phân rã độc lập trung bình (Mean-field factorization) giữa các khối tham số $q(\theta) = \prod q_i(\theta_i)$ có thể dẫn đến việc đánh giá thấp ma trận hiệp phương sai hậu nghiệm và khoảng tin cậy của các tham số.
- Mặc dù thuật toán giải quyết tốt bài toán cực đại địa phương khi chọn $K$ trong MRDE-MN, hàm mục tiêu biến phân vẫn là một bài toán tối ưu không lồi, phụ thuộc phần nào vào giá trị khởi tạo của các ma trận trọng số.
- Luận án chưa khảo sát sâu trường hợp số chiều siêu cao ở mức độ gen ($p \gg 100.000$) nơi ma trận thiết kế có độ thưa cực lớn.
Chương trình nghiên cứu tương lai (Future Research Agenda) mở ra 4 hướng đi cụ thể:
- Mở rộng thuật toán VB-GLMM sang lựa chọn nhóm biến bằng Group Lasso phân tầng (Yuan và Lin, 2006) và lựa chọn biến có thứ tự bằng Fused Lasso (Tibshirani và đồng sự, 2005).
- Tích hợp quá trình phi tham số Dirichlet Process Mixtures để tự động xác định số thành phần $K$ vô hạn mà không cần chỉ định trước chặn trên.
- Phát triển các kỹ thuật biến phân ngẫu nhiên sâu (Deep Variational Inference) kết hợp mạng nơ-ron sâu với GLMM để xử lý dữ liệu phi cấu trúc quy mô hàng triệu quan sát.
- Xây dựng gói phần mềm mã nguồn mở chuẩn hóa trên CRAN để phổ biến thuật toán đến cộng đồng nghiên cứu toàn cầu.
Tác động và ảnh hưởng
- Ảnh hưởng học thuật: Các công trình trích xuất từ luận án đã được công bố trên các tạp chí quốc tế chuyên ngành thống kê toán học uy tín (ISI/Scopus), đóng góp trực tiếp vào dòng chảy tài liệu về Variational Inference. Ước tính các thuật toán này sẽ thu hút sự quan tâm và trích dẫn lớn từ cộng đồng học máy và thống kê ứng dụng.
- Chuyển đổi trong nghiên cứu ứng dụng: Cung cấp giải pháp tính toán vượt trội cho ngành dịch tễ học và thử nghiệm lâm sàng (phân tích dữ liệu bệnh nhân đo lặp tại nhiều bệnh viện) và ngành tài chính - kinh tế lượng (phân loại rủi ro tín dụng và ước lượng mật độ biến động tài sản).
- Tác động xã hội và hoạch định chính sách: Cung cấp bằng chứng thực nghiệm chuẩn xác hỗ trợ các nhà hoạch định chính sách kinh tế - xã hội phân tích phân hóa giàu nghèo và thị trường lao động dựa trên các mô hình phân lớp tiềm ẩn không đồng nhất.
Đối tượng hưởng lợi
- Nghiên cứu sinh và học viên cao học: Tiếp cận cấu trúc toán học chặt chẽ, chi tiết từng bước đạo hàm giải tích của phương pháp MFVB và FFVB cùng mã nguồn thuật toán tối ưu.
- Các nhà nghiên cứu thống kê và khoa học dữ liệu: Sở hữu một công cụ mạnh mẽ thay thế MCMC chậm chạp và xấp xỉ Laplace thiếu chính xác trong phân tích mô hình hỗn hợp nhiều chiều.
- Chuyên gia phân tích R&D trong y dược và tài chính: Áp dụng trực tiếp thuật toán VB-GLMM để rút trích các biến mục tiêu quan trọng từ các tập dữ liệu thử nghiệm lâm sàng và dữ liệu bảng phức tạp.
- Các cơ quan thống kê quốc gia: Ứng dụng mô hình MRDE-MN để phân tích dữ liệu điều tra mức sống dân cư với độ chính xác dự báo cao.
Câu hỏi chuyên sâu
1. Đóng góp lý thuyết độc đáo nhất của luận án là gì và nó mở rộng lý thuyết nào?
Đóng góp lý thuyết độc đáo nhất là việc thiết lập thuật toán xác định mode hậu nghiệm trong không gian biến phân kết hợp cơ chế co rút thích nghi Bayes (Bayesian Adaptive Lasso). Nghiên cứu này mở rộng trực tiếp lý thuyết xấp xỉ biến phân dạng trung bình của Ormerod và Wand (2010) và lý thuyết co rút của Zou (2006), khắc phục nhược điểm mất tính chất thưa của xấp xỉ biến phân truyền thống và tính chệch tham số của Lasso cổ điển.
2. Sự đổi mới về mặt phương pháp luận so với ít nhất 2 nghiên cứu quốc tế tiền nhiệm?
So với Groll & Tutz (2014) và Schelldorfer và đồng sự (2014), phương pháp VB-GLMM không dùng xấp xỉ Laplace mà tối ưu trực tiếp cận dưới biên duyên ELBO, đồng thời tự động cập nhật vector siêu tham số $\boldsymbol{\lambda} = (\lambda_1, \dots, \lambda_p)^\top$ qua từng vòng lặp giải tích, loại bỏ hoàn toàn nhu cầu quét lưới trên không gian tham số phạt. So với Tran và đồng sự (2014), mô hình MRDE-MN mở rộng không gian biến phụ thuộc từ vô hướng $y \in \mathbb{R}$ sang vector $\mathbf{y} \in \mathbb{R}^d$, thiết lập ma trận hiệp phương sai phụ thuộc biến giải thích và thuật toán phân rã kép cho mean model và gating model.
3. Phát hiện bất ngờ nhất từ dữ liệu thực nghiệm là gì?
Phát hiện bất ngờ nhất là khả năng tự động triệt tiêu các thành phần dư thừa của thuật toán VB trong mô hình MRDE-MN mà không cần bất kỳ thủ tục kiểm định giả thuyết hay hiệu chỉnh hậu kỳ nào. Khi cài đặt số cụm ban đầu lớn hơn thực tế, xác suất trộn $\pi_k$ của cụm dư thừa tự động hội tụ về 0 với độ chính xác số học cao, giải quyết trọn vẹn vấn đề chọn số thành phần $K$ vốn luôn gây tranh cãi trong các mô hình hỗn hợp.
4. Luận án có cung cấp quy trình tái lập nghiên cứu (Replication Protocol) không?
Có. Luận án trình bày tường minh toàn bộ hệ thống công thức toán học cập nhật từng tham số tại các biểu thức giải tích, mô tả chi tiết từng bước của thuật toán dạng mã giả (pseudo-code), đồng thời quy định cụ thể các phân phối tiên nghiệm và tham số khởi tạo cho cả mô phỏng số và dữ liệu thực tế HILDA.
5. Định hướng nghiên cứu 10 năm tiếp theo từ nền tảng luận án?
Định hướng dài hạn bao gồm: (1) Chuẩn hóa lý thuyết suy luận biến phân cho mô hình hỗn hợp trên cấu trúc dữ liệu đồ thị và mạng lưới; (2) Tích hợp Variational Autoencoders (VAE) với GLMM để xử lý dữ liệu đa phương thức; (3) Nghiên cứu tính chất tiệm cận toán học của ước lượng biến phân mode hậu nghiệm dưới điều kiện $p \to \infty$.
Kết luận
Luận án tiến sĩ của tác giả Đào Thanh Tùng đã đạt được 6 đóng góp mang tính đột phá và bền vững:
- Xây dựng thành công thuật toán VB-GLMM giải quyết trọn vẹn bài toán đồng thời lựa chọn biến và ước lượng tham số trong mô hình hồi quy tuyến tính hỗn hợp tổng quát.
- Khắc phục triệt để các hạn chế cố hữu của phương pháp xấp xỉ Laplace và kỹ thuật phạt Lasso truyền thống, nâng tỷ lệ chọn đúng mô hình lên trên 91% - 94%.
- Thiết lập mô hình hồi quy mật độ nhiều biến trộn các phân phối chuẩn có phương sai phụ thuộc (MRDE-MN), mở rộng hoàn chỉnh lý thuyết RDE từ đơn biến sang đa biến.
- Phát triển thuật toán Bayes biến phân tích hợp MFVB, FFVB và tối ưu hóa đạo hàm Newton-Raphson cho phép tự động lựa chọn số thành phần $K$ và cấu trúc biến tối ưu.
- Kiểm chứng tính ưu việt của phương pháp thông qua hệ thống mô phỏng Monte Carlo đa kịch bản và phân tích thành công cấu trúc kinh tế phức tạp trên bộ dữ liệu thực tế HILDA.
- Mở ra 3 hướng nghiên cứu mới về Group Lasso biến phân, mô hình phi tham số Dirichlet Process, và tính toán Bayes phân tán quy mô lớn.
Công trình khẳng định bước tiến vượt bậc về năng lực nghiên cứu toán thống kê và học máy tại Việt Nam, đóng góp một di sản học thuật chuẩn mực với giá trị ứng dụng sâu rộng trong khoa học dữ liệu hiện đại.
Trích đoạn nội dung luận án
Tải xuống để đọc toàn bộĐẠI HỌC QUỐC GIA HÀ NỘI TRƯỜNG ĐẠI HỌC KHOA HỌC TỰ NHIÊN Đào Thanh Tùng LỰA CHỌN BIẾN, SỐ THÀNH PHẦN VÀ ƯỚC LƯỢNG THAM SỐ BẰNG PHƯƠNG PHÁP VB CHO CÁC MÔ HÌNH GLMM VÀ MRDE-MN LUẬN ÁN TIẾN SĨ TOÁN HỌC Hà Nội - 2020 ĐẠI HỌC QUỐC GIA HÀ NỘI TRƯỜNG ĐẠI HỌC KHOA HỌC TỰ NHIÊN Đào Thanh Tùng LỰA CHỌN BIẾN, SỐ THÀNH PHẦN VÀ ƯỚC LƯỢNG THAM SỐ BẰNG PHƯƠNG PHÁP VB CHO CÁC MÔ HÌNH GLMM VÀ MRDE-MN Chuyên ngành: Lý thuyết xác suất và thống kê toán học Mã số: 9460112.02 LUẬN ÁN TIẾN SĨ TOÁN HỌC Người hướng dẫn khoa học: PGS. TRẦN MINH NGỌC TS. TRẦN MẠNH CƯỜNG Hà Nội - 2020 LỜI CAM ĐOAN Tôi xin cam đoan những kết quả trình bày trong luận án là mới, đã được công bố trên các tạp chí Quốc tế. Các kết quả viết chung với hai hướng dẫn khoa học PGS.
Trần Minh Ngọc và TS. Trần Mạnh Cường đã được sự đồng ý của hai hướng dẫn khi đưa vào luận án. Những kết quả được trình bày trong luận án là trung thực và chưa từng được công bố trong bất kỳ công trình nào khác. Nghiên cứu sinh Đào Thanh Tùng i LỜI CẢM ƠN Trước hết, tôi xin bày tỏ lòng biết ơn chân thành đến hai cán bộ hướng dẫn khoa học: 1.
Trần Minh Ngọc. Trần Mạnh Cường. Đặc biệt PGS. Trần Minh Ngọc, người đã giao đề tài, tận tình chỉ bảo, hướng dẫn tôi trong suốt quá trình nghiên cứu và hoàn thành luận án.
Tác giả luận án chân thành cảm ơn lãnh đạo, các thầy, cô giáo và cán bộ Khoa Toán - Cơ - Tin học, Phòng Sau đại học – Trường Đại học Khoa học Tự nhiên - Đại học Quốc gia Hà Nội đã làm hết sức trách nhiệm, nhiệt tình giúp đỡ và tạo mọi điều kiện thuận lợi cho chúng tôi trong suốt quá trình nghiên cứu và hoàn thành luận án. Tác giả chân thành cảm ơn các đồng nghiệp ở Khoa Toán - Tin học và lãnh đạo Học viện Quân y đã tạo điều kiện giúp đỡ tôi làm việc và học tập. Cuối cùng, tác giả luận án xin dành lời cảm ơn đặc biệt tới gia đình, người thân và bạn bè, những người đã thường xuyên giúp đỡ, chia sẻ động viên và là chỗ dựa để tôi có thể hoàn thành luận án này! Tác giả xin chân thành cảm ơn! NCS. Đào Thanh Tùng ii Mục lục Lời cam đoan i Lời cảm ơn ii Bảng ký hiệu và viết tắt vii Mở đầu 1 Chương 1 Kiến thức chuẩn bị 12 1.1 Một số phân phối thường gặp .1 Phân phối Beta .2 Phân phối Gamma .3 Phân phối Gamma ngược .4 Phân phối chuẩn một chiều .5 Phân phối chuẩn nhiều chiều .6 Phân phối Wishart .2 Họ mũ và Mô hình hồi quy tuyến tính tổng quát .2 Mô hình hồi quy tuyến tính tổng quát .3 Mô hình hồi quy trộn .4 Phương pháp Bayes biến phân .1 Cơ sở toán học .2 Trường hợp MFVB .3 Trường hợp FFVB .5 Một số thuật toán tối ưu sử dụng trong luận án .1 Thuật toán Newton - Raphson .2 Thuật toán xấp xỉ ngẫu nhiên cho FFVB .3 Thuật toán đạo hàm theo hướng.
43 Chương 2 Lựa chọn biến và ước lượng tham số bằng phương pháp VB cho mô hình GLMM 44 2.1 Giới thiệu chung .2 Mô hình GLMM .3 Phương pháp VB ước lượng mode hậu nghiệm .4 Phương pháp VB để chọn biến và ước lượng tham số cho GLMM .1 Phân phối hậu nghiệm tối ưu VB cho β .2 Phân phối hậu nghiệm tối ưu VB cho b .3 Phân phối hậu nghiệm tối ưu VB cho Q .4 Phân phối hậu nghiệm tối ưu VB cho λ .5 Phân phối hậu nghiệm tối ưu VB cho φ .6 Lựa chọn các siêu tham số .7 Thuật toán VB .1 Nghiên cứu mô phỏng .2 Ứng dụng trên dữ liệu thực. 69 Chương 3 Lựa chọn biến, số thành phần và ước lượng tham số bằng phương pháp VB cho mô hình MRDE-MN 72 3.1 Giới thiệu chung .2 Mô hình MRDE-MN .1 Phân phối hậu nghiệm tối ưu VB cho β .2 Phân phối hậu nghiệm tối ưu VB cho T k .3 Phân phối hậu nghiệm tối ưu VB cho q ik .4 Phân phối hậu nghiệm tối ưu VB của γ .6 Thuật toán VB cho mô hình MRDE-MN .3 Lựa chọn số thành phần .4 Lựa chọn biến .1 Mô hình tiên nghiệm .2 Lựa chọn biến cho mean model .3 Lựa chọn biến cho gating model .4 Thuật toán đầy đủ .1 Nghiên cứu mô phỏng .2 Ứng dụng trên dữ liệu thực HILDA. 94 Kết luận và kiến nghị 97 Kết luận. 97 Kiến nghị về những nghiên cứu tiếp theo.
97 Danh mục công trình khoa học của tác giả liên quan đến luận án. 99 v Danh sách hình vẽ 1.1 Kết quả thực hiện 02 lần: lần 1 cột bên trái và lần 2 cột bên phải.2 Kết quả thực hiện mô phỏng bằng hai thuật toán. Thuật toán 1 là cột bên trái và Thuật toán 2 là cột bên phải. 36 vi Danh sách bảng 1.1 Bảng mô tả hàm liên kết ứng với các dạng hồi quy.2 Bảng kết quả hai lần thực hiện mô phỏng.3 Bảng kết quả thực hiện mô phỏng.4 Bảng kết quả thực hiện mô phỏng trên ba thuật toán.1 Kết quả mô phỏng hồi quy Poisson .2 Kết quả mô phỏng hồi quy logistic .1 Bảng giá trị đúng của các tham số β và γ .2 Bảng tóm tắt các chỉ số đánh giá hiệu quả của phương pháp.3 Các biến được chọn và các hệ số ước lượng trong mean model.4 Các biến được chọn và các hệ số ước lượng trong gating model.
96 vi Bảng ký hiệu và viết tắt AIC Akaike’s information criterion BIC Bayesian information criterion BaLasso Bayesian adaptive Lasso BMS Bayesian model selection CFR Correctly-Fitted Rate CGD Coordinate Gradient Descent EM Expectation Maximization FFVB Fixed Form Variational Bayes GLM Generalized Linear Model GLMM Generalized Linear Mixed Model Lasso Least absolute shrinkage and selection operator KL Kullback-Leibler MCMC Markov chain Monte Carlo MEM Mixtures of Expert Model MFVB Mean Form Variational Bayes ML Maximum Likelihood MLR Multivariate Linear Regression MRDE-MN Multivariate Regression Density Estimation with Mixtures of Normals MRM Mixtures Regression Model MSE Mean Squared Error vii OLS Ordinary Least Squares PML Penalized Maximum Likelihood PPS Partial Predictive Score RDE-MHN(k ) Regression Density Estimation with Mixtures of k Heteroscedastic Normals SGD Stochastic Gradient Descent VB Variational Bayes R Tập các số thực E hoặc [.] Kỳ vọng ∝ Tỷ lệ viii MỞ ĐẦU Lựa chọn mô hình là một bài toán cơ bản trong thống kê cũng như trong nhiều lĩnh vực khoa học khác. Fisher, có ba khía cạnh của một bài toán tổng quát về suy luận thống kê và dự báo: (1) mô tả và xây dựng mô hình, (2) ước lượng các tham số mô hình, và (3) ước tính độ chính xác. Về cơ bản, bài toán lựa chọn mô hình liên quan đến yếu tố (1) và (3) ở trên. Mục tiêu quan trọng trong phân tích dữ liệu là hiểu cấu trúc cơ bản trong dữ liệu.
Giả sử rằng chúng ta được cho một tập hợp các mô hình phản ánh một loạt các cấu trúc tiềm năng trong dữ liệu và nhiệm vụ là chọn trong số đó một mô hình giải thích tốt nhất hoặc phù hợp nhất với dữ liệu. Giả sử tập dữ liệu D = {(x1 , y1 ), (x2 , y2 ), ., (xn , yn )} được rút ra từ một mối quan hệ hàm y = ftrue (x) + nhiễu vấn đề là ta không biết biểu thức toán học của hàm ftrue , nó như một hộp đen, biến đổi x thành y và có sự tác động của nhiễu. Tìm hiểu về ftrue chính là tìm hiểu về cơ chế sinh ra dữ liệu y khi có x. Thông thường, ta không thể xác định được chính xác ftrue mà cần chọn trong một lớp hàm Fc nào đó một hàm fc phản ánh tốt nhất mối quan hệ của y theo x hay giải thích được y nhiều nhất theo một tiêu chuẩn nào đó.
Lớp hàm để chọn fc được hiểu là một lớp mô hình. Chỉ số "c" trong ký hiệu Fc ngụ ý tính phức tạp của lớp hàm (c viết tắt của chữ "complexity"). Việc chọn hàm fc như vậy là lựa chọn mô hình, bao gồm các vấn đề lựa chọn biến, ước lượng tham số của mô hình và đánh giá fc là tốt nhất 1 theo tiêu chuẩn nào đó. Trước khi nhà phân tích dữ liệu tiến hành lựa chọn một mô hình, họ cần phải biết tiêu chuẩn thế nào là một mô hình tốt.
Nói cách khác, mục tiêu của bài toán lựa chọn mô hình cần phải được xác định rõ ràng. Các mục tiêu khác nhau có thể dẫn đến các mô hình khác nhau. Các dạng mô hình Fc cũng cần được xác định trước, với c thuộc một tập hợp C nào đó. Lựa chọn mô hình sẽ là lựa chọn một chỉ số c ∈ C tốt nhất.
Với c được lựa chọn đó, ký hiệu fˆDc ∈ Fc là hàm hồi quy tốt nhất xấp xỉ ftrue. Có rất nhiều phương pháp lựa chọn mô hình nổi tiếng như phương pháp hợp lý cực đại phạt, phương pháp Bayes, phương pháp thực nghiệm. Để ước lượng tham số của mô hình có thể sử dụng phương pháp bình phương tối thiểu (Least Squares: LS) hoặc phương pháp hợp lý cực đại (Maximum Likelihood: ML). Giả sử D có phân phối mẫu là P(D|f ) thường gọi là hàm hợp lý.
Để ước lượng tham số của mô hình, phương pháp ML sẽ chọn fˆD c = arg max P(D|f ). f ∈Fc Chẳng hạn xét mô hình hồi quy tuyến tính thông thường y = βX + , khi đó Fc là lớp hàm tuyến tính hay mô hình hồi quy tuyến tính của X với c biến độc lập. Khi đó fˆDc = f c (β̂) trong đó β̂ là ước lượng hợp lý cực đại của β. Đối với việc chọn mô hình thì phương pháp hợp lý cực đại phạt (Penalized Maximum Likelihood: PML) chọn ĉ = arg min{−logP(D|fˆD c ) + pen(Fc )}.
c Đại lượng −logP(D|fˆDc ) + pen(Fc ) được xem là tiêu chuẩn để chọn lựa mô hình, số hạng phạt pen(Fc ) phụ thuộc vào cách tiếp cận được dùng. Trong tiêu chuẩn AIC thì pen(Fc ) = c, hoặc tiêu chuẩn BIC thì pen(Fc ) = c log2 n trong đó c là số tham số tự do của mô hình. Trong thực hành, hai tiêu chuẩn AIC và BIC là các tiêu chuẩn thông dụng nhất được sử dụng để lựa chọn mô hình. Trong nhiều 2 trường hợp, chúng dễ dàng sử dụng và mang lại kết quả tốt.
Một số phiên bản mở rộng của AIC cũng đã được đề xuất trong [6]. Lớp phương pháp lựa chọn mô hình thứ hai là các phương pháp lựa chọn mô hình Bayes (Bayesian Model Selection: BMS), các phương pháp này tỏ ra rất hiệu quả và ngày càng được sử dụng nhiều.
Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ
Trích dẫn luận án này
Đào Thanh Tùng (2020). Lựa chọn biến, ước lượng tham số VB cho GLMM và MRDE-MN [Luận án tiến sĩ, Đại học Khoa học Tự nhiên - Đại học Quốc gia Hà Nội]. LuanAn.net. https://luanan.net/ky-thuat-co-khi/phuong-phap-vb-chon-bien-uoc-luong-glmm-mrde-mn
Câu hỏi thường gặp
Luận án "Lựa chọn biến, ước lượng tham số VB cho GLMM và MRDE-MN" nghiên cứu về vấn đề gì?
Nghiên cứu lựa chọn biến số, ước lượng tham số GLMM, MRDE MN bằng Variational Bayes. Cải thiện độ chính xác, hiệu quả mô hình dự đoán thống kê.
Luận án "Lựa chọn biến, ước lượng tham số VB cho GLMM và MRDE-MN" được bảo vệ tại trường nào?
Luận án này được bảo vệ tại Đại học Khoa học Tự nhiên - Đại học Quốc gia Hà Nội. Năm bảo vệ: 2020.
Luận án "Lựa chọn biến, ước lượng tham số VB cho GLMM và MRDE-MN" thuộc chuyên ngành gì?
Luận án "Lựa chọn biến, ước lượng tham số VB cho GLMM và MRDE-MN" thuộc chuyên ngành Lý thuyết xác suất và thống kê toán học. Danh mục: Kỹ Thuật Cơ Khí.
Luận án "Lựa chọn biến, ước lượng tham số VB cho GLMM và MRDE-MN" có bao nhiêu trang?
Luận án "Lựa chọn biến, ước lượng tham số VB cho GLMM và MRDE-MN" có 115 trang. Bạn có thể xem trước một phần tài liệu ngay trên trang web trước khi tải về.
Cách tải luận án "Lựa chọn biến, ước lượng tham số VB cho GLMM và MRDE-MN" về máy như thế nào?
Để tải luận án về máy, bạn nhấn nút "Tải xuống ngay" trên trang này, sau đó hoàn tất thanh toán phí lưu trữ. File sẽ được tải xuống ngay sau khi thanh toán thành công. Hỗ trợ qua Zalo: 0559 297 239.