Luận án tiến sĩ khoa học máy tính khai phá luồng văn bản với kỹ thuật gom cụm

Luận án tiến sĩ khoa học máy tính khai phá luồng văn bản. Phương pháp xử lý ngôn ngữ tự nhiên sử dụng AI nâng cao hiệu suất phân tích.

Tác giả

Luan An

Thể loại

Luận án tiến sĩ

Năm xuất bản

Số trang

152

Thời gian đọc

23 phút

Lượt xem

0

Lượt tải

0

Phí lưu trữ

50 Point

Tổng quan nhanh

Chủ đề:
1. Khai Phá Luồng Văn Bản
Số trang:
152 trang
Trường:
Trường Đại học Lạc Hồng
Chuyên ngành:
Khoa học máy tính
Năm:

Tóm tắt nội dung luận án

I. Khai Phá Luồng Văn Bản

Khai phá luồng văn bản là quá trình phân tích và trích xuất thông tin từ luồng văn bản. Điều này giúp chúng ta hiểu rõ hơn về chủ đề và nội dung của văn bản.

1.1. Tổng Quan Về Đề Tài

Đề tài luận án tiến sĩ này tập trung vào việc khai phá luồng văn bản với kỹ thuật gom cụm.

1.2. Bài Toán Nghiên Cứu

Bài toán nghiên cứu trong luận án này là phát triển một mô hình gom cụm luồng văn bản hiệu quả.

II. Các Nghiên Cứu Liên Quan

Có nhiều nghiên cứu liên quan đến khai phá luồng văn bản đã được thực hiện trước đây. Các nghiên cứu này đã đề xuất các phương pháp tiếp cận khác nhau để giải quyết bài toán gom cụm luồng văn bản.

2.1. So Sánh Các Cách Tiếp Cận

So sánh các cách tiếp cận khác nhau để gom cụm luồng văn bản, bao gồm phương pháp tiếp cận dựa trên mô hình chủ đề truyền thống, phương pháp tiếp cận dựa trên mô hình hỗn hợp động và phương pháp tiếp cận dựa trên biểu diễn không gian vectơ.

2.2. Mô Hình Hóa Chủ Đề

Mô hình hóa chủ đề là một trong những phương pháp tiếp cận phổ biến để gom cụm luồng văn bản.

III. Gom Cụm Luồng Văn Bản

Gom cụm luồng văn bản là quá trình nhóm các văn bản tương tự lại với nhau. Điều này giúp chúng ta hiểu rõ hơn về chủ đề và nội dung của văn bản.

3.1. Phương Pháp Gom Cụm

Phương pháp gom cụm luồng văn bản dựa trên biểu diễn không gian vectơ và mô hình hỗn hợp.

3.2. Thực Nghiệm Và Bàn Luận

Thực nghiệm và bàn luận về kết quả gom cụm luồng văn bản.

IV. Phát Hiện Cụm Từ Xu Thế

Phát hiện cụm từ xu thế là quá trình tìm kiếm các cụm từ phổ biến trong luồng văn bản. Điều này giúp chúng ta hiểu rõ hơn về chủ đề và nội dung của văn bản.

4.1. Phương Pháp Phát Hiện

Phương pháp phát hiện cụm từ xu thế dựa trên biểu diễn không gian vectơ và mô hình hỗn hợp.

4.2. Thực Nghiệm Và Bàn Luận

Thực nghiệm và bàn luận về kết quả phát hiện cụm từ xu thế.

V. Kết Luận Hướng Phát Triển

Kết luận và hướng phát triển của luận án tiến sĩ này là tiếp tục nghiên cứu và phát triển các phương pháp tiếp cận mới để giải quyết bài toán gom cụm luồng văn bản.

5.1. Kết Quả Đạt Được

Kết quả đạt được của luận án tiến sĩ này là phát triển một mô hình gom cụm luồng văn bản hiệu quả.

5.2. Hướng Phát Triển

Hướng phát triển của luận án tiến sĩ này là tiếp tục nghiên cứu và phát triển các phương pháp tiếp cận mới để giải quyết bài toán gom cụm luồng văn bản.

Mục lục chi tiết luận án

LỜI CẢM ƠN
LỜI CAM ĐOAN
1. CHƯƠNG 1: GIỚI THIỆU
1.1. Tổng quan về đề tài luận án
1.1.1. Bài toán nghiên cứu và ý nghĩa
1.1.2. Thách thức của bài toán gom cụm luồng văn bản
1.1.3. Các vấn đề nghiên cứu
1.1.4. Các bài toán nghiên cứu
1.2. Đóng góp của luận án và các công trình đã được công bố
1.3. Mục tiêu, phạm vi và phương pháp nghiên cứu
1.3.1. Mục tiêu nghiên cứu
1.3.2. Phạm vi nghiên cứu
1.3.3. Phương pháp nghiên cứu
1.4. Cấu trúc của luận án
1.5. Kết chương
2. CHƯƠNG 2: CÁC NGHIÊN CỨU LIÊN QUAN
2.1. So sánh một số cách tiếp cận mới liên quan đến gom cụm luồng văn bản
2.1.1. Phương pháp tiếp cận dựa trên mô hình chủ đề truyền thống
2.1.2. Phương pháp tiếp cận dựa trên mô hình hỗn hợp động
2.1.3. Phương pháp tiếp cận dựa trên biểu diễn không gian vectơ
2.1.4. Mô hình hóa chủ đề (Topic modeling)
2.1.5. Mô hình hỗn hợp dựa trên quy trình Dirichlet (DPMM)
2.1.6. Đồ thị con phổ biến
2.1.7. Mô hình hóa sự nổi bật trên luồng văn bản của Kleinberg
2.2. Kết chương
3. CHƯƠNG 3: GOM CỤM LUỒNG VĂN BẢN THEO NGỮ NGHĨA DỰA TRÊN ĐỒ THỊ TỪ
3.1. Phương pháp
3.1.1. Biểu diễn đặt trưng văn bản bằng phương pháp túi từ (BOW)
3.1.2. Biểu diễn văn bản bằng đồ thị từ (GOW)
3.1.3. Gom cụm luồng văn bản dựa trên mô hình hỗn hợp
3.2. Thực nghiệm và bàn luận
3.3. Kết chương
4. CHƯƠNG 4: PHÁT HIỆN CỤM TỪ XU THẾ TRÊN LUỒNG VĂN BẢN
4.1. Phương pháp
4.2. Thực nghiệm và bàn luận
4.3. Kết chương
5. CHƯƠNG 5: KẾT LUẬN & HƯỚNG PHÁT TRIỂN
5.1. Các kết quả đạt được, hạn chế và hướng phát triển
5.2. Ý nghĩa học thuật và thực tiễn của luận án
BẢNG THUẬT NGỮ ANH – VIỆT
DANH MỤC BẢNG
DANH MỤC HÌNH
DANH MỤC THUẬT TOÁN
MỘT SỐ ĐỊNH NGHĨA
TÓM TẮT
Xem trước tài liệu
Tải đầy đủ để xem toàn bộ nội dung
Luận án tiến sĩ khoa học máy tính khai phá luồng văn bản với kỹ thuật gom cụm

Tải xuống file đầy đủ để xem toàn bộ nội dung

Tải đầy đủ (152 trang)

Trích đoạn nội dung luận án

Tải xuống để đọc toàn bộ

BỘ GIÁO DỤC VÀ ĐÀO TẠO TRƯỜNG ĐẠI HỌC LẠC HỒNG VÕ THỊ HỒNG THẮM KHAI PHÁ LUỒNG VĂN BẢN VỚI KỸ THUẬT GOM CỤM LUẬN ÁN TIẾN SĨ KHOA HỌC MÁY TÍNH Đồng Nai, năm 2021 BỘ GIÁO DỤC VÀ ĐÀO TẠO TRƯỜNG ĐẠI HỌC LẠC HỒNG VÕ THỊ HỒNG THẮM KHAI PHÁ LUỒNG VĂN BẢN VỚI KỸ THUẬT GOM CỤM LUẬN ÁN TIẾN SĨ KHOA HỌC MÁY TÍNH Chuyên ngành: Khoa học máy tính Mã số: 9480101 NGƯỜI HƯỚNG DẪN KHOA HỌC PGS. ĐỖ PHÚC Đồng Nai, năm 2021 LỜI CẢM Xin chân thành cảm ơn PGS. Đỗ Phúc đã tận tình hướng dẫn nghiên cứu sinh hoàn thành luận án tiến sĩ. Xin chân thành cảm ơn quý thầy/cô khoa sau đại học, trường đại học Lạc Hồng đã tạo điện kiện thuận lợi và hỗ trợ nghiên cứu sinh hoàn thành luận án.

Xin trân trọng cảm ơn trường đại học Thủ Dầu Một đã hỗ trợ nghiên cứu sinh tham gia học tập tại trường đại học Lạc Hồng. Xin chân thành cám ơn quý bạn bè, đồng nghiệp đã tạo điều kiện giúp đỡ nghiên cứu sinh hoàn thành luận án. Nghiên cứu sinh - Võ Thị Hồng Thắm LỜI CAM Tôi xin cam đoan luận án này là công trình nghiên cứu của riêng tôi dưới sự hướng dẫn của PGS. Các số liệu và tài liệu trong nghiên cứu là trung thực và chưa được công bố trong bất kỳ công trình nghiên cứu nào.

Tất cả các tham khảo và kế thừa đều được trích dẫn và tham chiếu đầy đủ. Đồng Nai, ngày … tháng 5 năm 2021 Nghiên cứu sinh Võ Thị Hồng Thắm MỤC CHƯƠNG 1: GIỚI THIỆU.1 Tổng quan về đề tài luận án.1 Bài toán nghiên cứu và ý nghĩa.2 Thách thức của bài toán gom cụm luồng văn bản.3 Các vấn đề nghiên cứu.4 Các bài toán nghiên cứu.2 Đóng góp của luận án và các công trình đã được công bố.3 Mục tiêu, phạm vi và phương pháp nghiên cứu.1 Mục tiêu nghiên cứu.2 Phạm vi nghiên cứu.3 Phương pháp nghiên cứu.4 Cấu trúc của luận án.5 Kết chương. 13 CHƯƠNG 2: CÁC NGHIÊN CỨU LIÊN QUAN.1 So sánh một số cách tiếp cận mới liên quan đến gom cụm luồng văn bản.1 Phương pháp tiếp cận dựa trên mô hình chủ đề truyền thống.2 Phương pháp tiếp cận dựa trên mô hình hỗn hợp động.3 Phương pháp tiếp cận dựa trên biểu diễn không gian vectơ.4 Mô hình hóa chủ đề (Topic modeling).5 Mô hình hỗn hợp dựa trên quy trình Dirichlet (DPMM).6 Đồ thị con phổ biến.7 Mô hình hóa sự nổi bật trên luồng văn bản của Kleinberg.2 Kết chương. 40 CHƯƠNG 3: GOM CỤM LUỒNG VĂN BẢN THEO NGỮ NGHĨA DỰA TRÊN ĐỒ THỊ TỪ.1 Phương pháp.1 Biểu diễn đặt trưng văn bản bằng phương pháp túi từ (BOW).2 Biểu diễn văn bản bằng đồ thị từ (GOW).3 Gom cụm luồng văn bản dựa trên mô hình hỗn hợp.2 Thực nghiệm và bàn luận.3 Kết chương.

74 CHƯƠNG 4: PHÁT HIỆN CỤM TỪ XU THẾ TRÊN LUỒNG VĂN BẢN.1 Phương pháp.2 Thực nghiệm và bàn luận.3 Kết chương. 103 CHƯƠNG 5: KẾT LUẬN & HƯỚNG PHÁT TRIỂN.1 Các kết quả đạt được, hạn chế và hướng phát triển.2 Ý nghĩa học thuật và thực tiễn của luận án.106 BẢNG THUẬT NGỮ ANH – VIỆT Tiếng Anh Viết tắt Tiếng Việt Allocation Dirichlet Latent LDA Phân bổ tiềm ẩn Direntlet Bag of Word BOW Túi từ Benchmark Đối sánh Cluster validation Xác nhận cụm Common sub GOWs Đồ thị con phổ biến Concept/topic drift Dòng trôi khái niệm/chủ đề Corpus Kho ngữ liệu Density-based Dựa trên mật độ Dirichlet Process DP Quy trình Dirichlet Dirichlet-Hawkes Topic Model DHTM Mô hình chủ đề Dirichlet-Hawkes Document batch Lô tài liệu Dynamic Clustering Topic DCT Mô hình chủ đề gom cụm động Dynamic Topic Model DTM Mô hình chủ đề động Features of meaning Đặc trưng ngữ nghĩa Filtering Lọc Frequent sub-graph FSG Đồ thị con phổ biến Graph of Word GOW Đồ thị từ Microblogs Bài viết ngắn dạng blog Model’s hyper-parameter Độ nhạy của siêu tham số của mô hình sensitivity (viết ngắn là độ nhạy) Mstream MStream Thuật toán gom cụm luồng dữ liệu dựa trên mô hình hỗn hợp DP Noise Yếu tố nhiễu Outlier Ngoại lệ Politeness Độ sâu Preprocess Tiền xử lý Proximity measure Đo lường lân cận Sequence Monte Carlo SMC Tuần tự Monte Carlo Sparse nature Tính rời rạc tự nhiên Sparsity of text Sự rời rạc của văn bản Stemming and Lemmatization Trả từ về nguyên mẫu Stop word Từ dừng Streaming LDA ST-LDA Streaming LDA Survey Khảo sát Tiếng Anh Viết tắt Tiếng Việt Temporal Dynamic Process Model TDPM Mô hình hỗn hợp quy trình Dirichlet theo thời gian Temporal model-LDA TM-LDA Mô hình LDA theo thời gian Temporal Text Mining TTM Khai phá văn bản theo thời gian Term Frequency TF Tần số từ Term Frequency-Invert Document TF-IDF Tần số từ -Tần số tài liệu nghịch đảo Frequency Text corpus Tập văn bản Text similarity Sự tương tự văn bản Text to Graph Text2graph Đồ thị hóa văn bản Trendy Keyword Extraction System TKES Hệ thống rút trích từ khóa tiêu biểu Tokenization Tách từ Topic tracking model TTM mô hình theo dõi chủ đề Vector Space model VSM Mô hình không gian vectơ Visualize Hiển thị trực quan Word relatedness Sự liên quan từ Word segmentation Tách từ Word similarity Sự tương tự từ Word vector Véc tơ từ DANH MỤC BẢNG Bảng 1.1: Phân tích các điểm mạnh và tồn tại của các mô hình.1: Biểu diễn văn bản với BOW truyền thống.2: Biểu diễn văn bản với BOW và TF-IDF.3: Biểu diễn văn bản với GOW.4: Biểu diễn văn bản kết hợp BOW và GOW.5: Biểu diễn véc tơ chủ đề trong mô hình GOW-Stream.6: Chi tiết về bộ dữ liệu thử nghiệm.7: Chi tiết về cấu hình cho các mô hình gom cụm luồng văn bản.8: Kết quả đầu ra trung bình của tác vụ gom cụm văn bản với các mô hình khác nhau với độ đo NMI.9: Kết quả đầu ra thử nghiệm của tác vụ gom cụm văn bản với các mô hình khác nhau với độ đo F1.1: Các thuộc tính của nút và mối quan hệ.2: Một ví dụ về tính toán chỉ số xếp hạng của từ.3: Một ví dụ về tính tổng trọng số của từ khóa trong chuyên mục.4: Thí dụ về cấu trúc lưu trữ Burst.5: Các Burst của từ khóa “Facebook”.6: Xác định danh sách từ xu thế chung với từ khóa “Facebook”.7: Thử nghiệm thời gian thực thi trên bộ thu thập thông tin.8: Kiểm tra thời gian thực thi của việc thêm dữ liệu vào cơ sở dữ liệu đồ thị 91 Bảng 4.9: Kiểm tra thời gian chạy của bộ xử lý.10: Thời gian xử lý số lượng bài viết khác nhau với độ dài khác nhau.11: Tỷ lệ giống nhau của dữ liệu sinh ra từ 2 thuật toán TF-IDF viết bằng ngôn ngữ lập trình khác nhau.12: Tần số của từ khóa.13: Một số tham số với word2Vec.14: Các từ liên quan đến từ khóa “Ứng dụng”.15: So sánh mức độ tương đồng khi sử dụng các thước đo khoảng cách tương đồng khác nhau.16: Thời gian huấn luyện các mô hình.17: Thời gian xử lý để tìm 10 từ liên quan.18: Kiểm tra thời gian xử lý phát hiện Burst của các bài báo trong 19 ngày .100 DANH MỤC HÌNH Hình 1.1: Mối liên hệ giữa các bài toán và các công trình đã công bố đối với từng bài toán.1: Mô hình sinh LDA.2: Mô hình sinh của mô hình hỗn hợp dựa trên quy trình Dirichlet.3: Mô hình sinh của mô hình hỗn hợp hữu hạn.4: Tỉ lệ của các sự kiện mục tiêu.1: Hình ảnh minh họa cấu trúc đồ thị hóa văn bản (text2graph) với đồ thị vô hướng.2: Biểu diễn đồ thị từ của tập tài liệu 𝐷.3: Tập đồ thị con phổ biến chung của tập tài liệu 𝐷.4: Mô hình sinh của mô hình GOW-Stream.5: Mô hình sinh của MStream & GOW-Stream.6: Lưu đồ thuật toán GOW-Stream.7: Kết quả thử nghiệm đối với số lượng lô tài liệu khác nhau với độ đo NMI .8: Kết quả thử nghiệm trên số lượng lô tài liệu khác nhau với độ đo F1.9: So sánh với k-means sử dụng độ đo NMI.10: So sánh với k-means sử dụng độ đo F1.11: Khả năng nâng cao hiệu suất của các kỹ thuật gom cụm luồng văn bản khác nhau.12: Tốc độ xử lý của GOW-Stream so với MStream khi tính luôn chi phí tìm đồ thị con phổ biến.13: Đánh giá ảnh hưởng của số lần lặp đến tính chính xác của kết quả của mô hình GOW-Stream.14: Kết quả thực nghiệm về ảnh hưởng của siêu tham số α.15: Kết quả thực nghiệm về ảnh hưởng của siêu tham số β.1: Hệ thống được đề xuất phục vụ tìm cụm từ xu thế.2: Kiến trúc hệ thống TKES.3: Trình tự xử lý của hệ thống TKES.4: Luồng văn bản đến liên tục theo thời gian.5: Cấu trúc lưu trữ dạng cây.6: Cấu trúc lưu trữ chung và ví dụ.7: Ví dụ về các bước xử lý rút trích từ khóa.8: Cấu trúc lưu trữ dùng để phát hiện sự nổi bật.9: Phát hiện sự nổi bật đối với từ khóa “Facebook”.10: Ảnh hưởng của chiều dài bài viết và số lượng bài viết đối với thời gian chạy của bộ xử lý.11: So sánh chi phí giữa huấn luyện mới và huấn luyện cập nhật.12: Thời gian xử lý tìm 10 từ khóa liên quan.13: Thời gian xử lý phát hiện sự nổi bật.14: Cấu trúc lưu trữ dữ liệu chưa qua xử lý.15: Cấu trúc lưu trữ dữ liệu đã qua xử lý.16: Cấu trúc lưu trữ danh sách các từ khóa hàng đầu của bài viết.17: Cấu trúc lưu trữ danh sách các từ khóa hàng đầu của chuyên mục.103 DANH MỤC THUẬT TOÁN Thuật toán 2.1: Thuật toán Gibbs Sampling.2: Mô hình hỗn hợp Dirichlet hữu hạn.3: Mô hình hỗn hợp Dirichlet vô hạn.4: Thuật toán gSpanAlgorithm.5: Thuật toán con Subgraph_Mining của gSpanAlgorithm.1: Rút trích các đồ thị con phổ biến từ tập tài liệu đã cho (D).2: Thuật toán GOW-Stream.1: Thuật toán tổng quát.2: Thuật toán thu thập dữ liệu.3: Tính tần số từ. 85 MỘT SỐ ĐỊNH NGHĨA Luồng dữ liệu [53]: là một chuỗi các phần tử vô hạn đếm được. Cấu trúc của các phần tử luồng trong các mô hình luồng khác nhau sẽ khác nhau.

Xử lý luồng là phân tích các luồng dữ liệu đầu vào một cách nhanh chóng để đưa ra kết quả. Khi xử lý luồng, thời gian là khái niệm trung tâm và mỗi phần tử luồng được liên kết với một hoặc nhiều nhãn thời gian được chỉ định ví dụ như khi phần tử được tạo, hoặc khi phần tử sẵn sàng để xử lý. Luồng văn bản[10]: là chuỗi các văn bản được sắp xếp theo thứ tự đến nhanh chóng và liên tục theo thời gian trong hai dạng chính: tin tức và truyền thông xã hội. Khai phá văn bản[16]: là khai phá dữ liệu từ các bộ sưu tập dữ liệu văn bản với mục đích là khám phá kiến thức (hoặc thông tin, mẫu) từ dữ liệu văn bản không có cấu trúc hoặc bán cấu trúc.

Gom cụm văn bản [47]: là tự động nhóm các tài liệu dạng văn bản (ví dụ: tài liệu ở dạng văn bản thuần túy, trang web, email, .) thành các cụm (thường gọi là chủ đề) dựa trên sự giống nhau (tương đồng) về nội dung của chúng.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Trích dẫn luận án này

Võ Thị Hồng Thắm (2021). Luận án tiến sĩ khoa học máy tính khai phá luồng văn bản với [Luận án tiến sĩ, Trường Đại học Lạc Hồng]. LuanAn.net. https://luanan.net/cong-nghe-thong-tin/khoa-hoc-may-tinh/luan-an-tien-si-khoa-hoc-may-tinh-khai-pha-luong-van-ban-voi-ky-thuat-gom-cum

Câu hỏi thường gặp

Luận án "Luận án tiến sĩ khoa học máy tính khai phá luồng văn bản với" nghiên cứu về vấn đề gì?

Luận án tiến sĩ khoa học máy tính khai phá luồng văn bản. Phương pháp xử lý ngôn ngữ tự nhiên sử dụng AI nâng cao hiệu suất phân tích.

Luận án "Luận án tiến sĩ khoa học máy tính khai phá luồng văn bản với" được bảo vệ tại trường nào?

Luận án này được bảo vệ tại Trường Đại học Lạc Hồng. Năm bảo vệ: 2021.

Luận án "Luận án tiến sĩ khoa học máy tính khai phá luồng văn bản với" thuộc chuyên ngành gì?

Luận án "Luận án tiến sĩ khoa học máy tính khai phá luồng văn bản với" thuộc chuyên ngành Khoa học máy tính. Danh mục: Khoa Học Máy Tính.

Luận án "Luận án tiến sĩ khoa học máy tính khai phá luồng văn bản với" có bao nhiêu trang?

Luận án "Luận án tiến sĩ khoa học máy tính khai phá luồng văn bản với" có 152 trang. Bạn có thể xem trước một phần tài liệu ngay trên trang web trước khi tải về.

Cách tải luận án "Luận án tiến sĩ khoa học máy tính khai phá luồng văn bản với" về máy như thế nào?

Để tải luận án về máy, bạn nhấn nút "Tải xuống ngay" trên trang này, sau đó hoàn tất thanh toán phí lưu trữ. File sẽ được tải xuống ngay sau khi thanh toán thành công. Hỗ trợ qua Zalo: 0559 297 239.

Luận án liên quan

Chia sẻ tài liệu: Facebook Twitter