Luận án tiến sĩ ngành máy tính tóm tắt dữ liệu bằng ngôn ngữ theo cách tiếp cận

Luận án: Luận án tiến sĩ ngành máy tính tóm tắt dữ liệu bằng ngôn ngữ theo cách tiếp cận đại số gia tử. Xem tóm tắt và tải về tại LuanAn.net

Tác giả

Luan An

Thể loại

Luận án tiến sĩ

Năm xuất bản

Số trang

150

Thời gian đọc

23 phút

Lượt xem

0

Lượt tải

0

Phí lưu trữ

40 Point

Tổng quan nhanh

Chủ đề:
1. Tổng quan tóm tắt dữ liệu ngôn ngữ
Số trang:
150 trang
Trường:
Học viện Khoa học và Công nghệ
Chuyên ngành:
Khoa học máy tính
Tác giả:
Năm:

Tóm tắt nội dung luận án

I. Tổng quan tóm tắt dữ liệu ngôn ngữ

Tóm tắt dữ liệu bằng ngôn ngữ là một lĩnh vực trọng tâm trong khoa học dữ liệu. Lĩnh vực này tập trung vào việc chuyển đổi dữ liệu thô thành các bản tóm tắt dễ hiểu bằng ngôn ngữ tự nhiên. Quá trình này giúp người dùng nhanh chóng nắm bắt thông tin quan trọng. Lý thuyết tập mờ là nền tảng cơ bản. Các khái niệm như định nghĩa tập mờ, biến ngôn ngữ và phân hoạch mờ được áp dụng. Chúng cho phép mô hình hóa sự không chắc chắn và tính linh hoạt của ngôn ngữ. Một khung nhận thức dựa trên tập mờ được phát triển. Khung này tăng cường khả năng giải nghĩa và hiểu dữ liệu. Mục tiêu là tạo ra các câu mô tả ngữ nghĩa từ dữ liệu số.

1.1. Nền tảng tóm tắt dữ liệu ngôn ngữ

Tóm tắt dữ liệu bằng ngôn ngữ là lĩnh vực quan trọng trong khoa học dữ liệu. Nó cung cấp cái nhìn tổng quan dễ hiểu từ tập dữ liệu phức tạp. Quá trình này giúp con người nhanh chóng nắm bắt thông tin cốt lõi. Lý thuyết tập mờ đóng vai trò nền tảng. Các khái niệm như định nghĩa tập mờ, biến ngôn ngữ, và phân hoạch mờ được áp dụng. Điều này cho phép biểu diễn thông tin không chắc chắn một cách tự nhiên hơn. Một khung nhận thức dựa trên tập mờ được thiết lập. Khung này hỗ trợ giải nghĩa và hiểu dữ liệu. Mục tiêu là chuyển đổi dữ liệu số thành các câu mô tả ngôn ngữ.

1.2. Thách thức trong trích rút tóm tắt tự động

Bài toán tóm tắt văn bản tự động đối mặt nhiều thách thức. Đặc biệt là với việc trích rút tóm tắt bằng ngôn ngữ. Cần xác định các dạng câu tóm tắt hiệu quả. Các câu này thường chứa từ lượng hóa ngôn ngữ. Ví dụ: "hầu hết sinh viên có điểm cao". Việc trích rút tóm tắt từ cơ sở dữ liệu đòi hỏi kỹ thuật tiên tiến. Mục tiêu là tìm ra tập câu tóm tắt tối ưu. Các câu này phải mang nhiều thông tin nhưng vẫn ngắn gọn. Giải thuật di truyền thường được sử dụng. Giải thuật này giúp tìm kiếm các tập tóm tắt hiệu quả. Các yếu tố như độ phủ, độ chính xác được cân nhắc. Lĩnh vực xử lý ngôn ngữ tự nhiên (NLP) cung cấp công cụ cần thiết. Nó giúp phân tích cấu trúc và ý nghĩa của các câu tóm tắt. Khai phá văn bản là một nhánh khác đóng góp. Nó hỗ trợ tìm kiếm mẫu thông tin ẩn trong dữ liệu. Phân tích dữ liệu lớn hưởng lợi từ khả năng này.

II. Đại số gia tử trong tóm tắt ngôn ngữ

Luận án đề xuất một cách tiếp cận đột phá. Đó là việc ứng dụng lý thuyết đại số gia tử. Đây là một cấu trúc toán học mạnh mẽ. Nó cung cấp nền tảng vững chắc để mô hình hóa biến ngôn ngữ. Đại số gia tử mở rộng khả năng biểu diễn ngữ nghĩa. Nó giúp nắm bắt các sắc thái tinh tế trong ngôn ngữ. Phương pháp này tạo điều kiện cho tạo ngôn ngữ tự nhiên (NLG) có chất lượng cao. Một khung nhận thức ngôn ngữ (LFoC) mới được phát triển. Khung này dựa trên đại số gia tử. LFoC giải quyết các vấn đề về nội dung thông tin trong câu tóm tắt. Nó cải thiện cách biểu diễn các tập mờ. Cấu trúc đa ngữ nghĩa của LFoC là đặc điểm nổi bật. Nó cho phép một từ có nhiều ý nghĩa ngữ cảnh khác nhau. Mô hình bụi được sử dụng để minh họa cấu trúc này. Điều này là quan trọng cho xử lý ngôn ngữ tự nhiên (NLP). Luận án cũng trình bày quy trình xây dựng ngữ nghĩa tính toán. Ngữ nghĩa này có tính giải nghĩa được cao. Cấu trúc đa thể được tích hợp. Điều này đảm bảo tính minh bạch. Nó làm cho các hệ thống học máy cho tóm tắt dữ liệu trở nên đáng tin cậy hơn.

2.1. Giới thiệu đại số gia tử

Luận án giới thiệu lý thuyết đại số gia tử. Đây là cách tiếp cận mới để mô hình hóa biến ngôn ngữ. Cấu trúc đại số này cung cấp nền tảng vững chắc. Nó giúp xử lý các miền giá trị của biến ngôn ngữ. Đại số gia tử mở rộng mô hình lõi ngữ nghĩa của các hạng từ. Nó cho phép biểu diễn ngữ nghĩa linh hoạt hơn. Mô hình này giúp nắm bắt các sắc thái ngôn ngữ. Nó tạo điều kiện cho việc tạo ngôn ngữ tự nhiên (NLG) có chất lượng cao. Các hạng từ như "cao", "thấp", "nhiều" được định nghĩa chặt chẽ. Điều này làm tăng tính chính xác của các câu tóm tắt.

2.2. Khung nhận thức ngôn ngữ mới

Một khung nhận thức ngôn ngữ (LFoC) được phát triển. Khung này dựa trên lý thuyết đại số gia tử. LFoC giải quyết vấn đề nội dung thông tin của câu tóm tắt. Nó cải thiện cách biểu diễn tập mờ của miền ngôn ngữ thuộc tính. Cấu trúc đa ngữ nghĩa là một đặc điểm chính. Điều này cho phép một từ có nhiều ý nghĩa ngữ cảnh. Mô hình bụi được sử dụng để biểu diễn. Mô hình này giúp nắm bắt cấu trúc phức tạp. Tính mở rộng được của LFoC là lợi thế lớn. Nó có thể thích nghi với các tập dữ liệu và ngữ cảnh khác nhau. Đây là bước tiến quan trọng trong xử lý ngôn ngữ tự nhiên (NLP).

2.3. Xây dựng ngữ nghĩa tính toán

Luận án trình bày thủ tục xây dựng ngữ nghĩa. Ngữ nghĩa này mang tính tính toán và giải nghĩa được. Cấu trúc đa thể được tích hợp. Điều này đảm bảo tính minh bạch của quá trình tóm tắt. Việc xây dựng này là cần thiết cho các hệ thống học máy cho tóm tắt dữ liệu. Nó giúp mô hình hiểu rõ hơn ý nghĩa. Kết quả là các câu tóm tắt được tạo ra có ý nghĩa hơn. Chúng dễ dàng được con người hiểu và tin cậy.

III. Phương pháp trích rút tóm tắt ngôn ngữ mới

Luận án giới thiệu một phương pháp tiên tiến. Phương pháp này tập trung vào tóm tắt trích rút các câu tóm tắt ngôn ngữ. Nó sử dụng nền tảng lý thuyết đại số gia tử. Cú pháp của câu tóm tắt trong ngôn ngữ tự nhiên được phân tích kỹ lưỡng. Các thành phần chính của phương pháp được xác định rõ ràng. Điều này đảm bảo khả năng tạo ra các tóm tắt chính xác. Một ưu điểm nổi bật là tính mở rộng được của phương pháp. Nó có thể thích ứng với nhiều loại dữ liệu. Điều này mở rộng phạm vi ứng dụng trong khai phá văn bản. Việc đánh giá thông tin của câu tóm tắt là một bước quan trọng. Các tiêu chí định lượng được áp dụng để đảm bảo chất lượng đầu ra. Điều này hỗ trợ hiệu quả cho tóm tắt văn bản tự động. Các thí nghiệm thực tế đã được tiến hành. Chúng chứng minh ưu điểm của khung nhận thức ngôn ngữ (LFoC). Khả năng mở rộng tri thức từ cơ sở dữ liệu cũng được kiểm chứng. Các thí nghiệm về trích rút phân phối ngôn ngữ cho các nhóm mờ cũng mang lại kết quả tích cực. Phương pháp này mang lại các câu tóm tắt chất lượng cao. Nó đóng góp đáng kể vào lĩnh vực khoa học dữ liệu.

3.1. Cú pháp và cấu trúc câu tóm tắt

Luận án đề xuất một phương pháp mới. Phương pháp này trích rút câu tóm tắt ngôn ngữ. Nó dựa trên lý thuyết đại số gia tử. Cú pháp câu tóm tắt trong ngôn ngữ tự nhiên được phân tích. Các thành phần chính của phương pháp được xác định. Điều này bao gồm việc định nghĩa các hạng từ. Việc xử lý các từ lượng hóa cũng được chú trọng. Phương pháp này hướng tới tóm tắt trích rút thông tin. Nó chọn ra các phần quan trọng nhất từ dữ liệu. Các câu tóm tắt tạo ra phải có ý nghĩa và chính xác.

3.2. Tính mở rộng và đánh giá thông tin

Một ưu điểm nổi bật là tính mở rộng được. Phương pháp này có thể áp dụng cho nhiều loại dữ liệu. Nó cũng có khả năng tích hợp thêm tri thức mới. Điều này làm tăng giá trị ứng dụng. Việc đánh giá thông tin của câu tóm tắt là cốt yếu. Các tiêu chí định lượng được sử dụng. Mục tiêu là đảm bảo chất lượng của đầu ra. Phương pháp này hỗ trợ tóm tắt văn bản tự động hiệu quả hơn. Nó đặc biệt hữu ích cho các tác vụ khai phá văn bản.

3.3. Thực nghiệm chứng minh hiệu quả

Nhiều thí nghiệm được thực hiện. Các thí nghiệm này minh chứng ưu điểm của LFoC. LFoC với số lượng từ lớn được đánh giá. Khả năng mở rộng tập tri thức từ cơ sở dữ liệu cũng được kiểm chứng. Thí nghiệm về trích rút phân phối ngôn ngữ cho các nhóm mờ được tiến hành. Kết quả cho thấy tính hiệu quả. Phương pháp này mang lại các câu tóm tắt chất lượng. Nó góp phần vào sự phát triển của khoa học dữ liệu.

IV. Tối ưu hóa tóm tắt dữ liệu bằng học máy

Luận án tập trung vào việc tối ưu hóa quá trình tóm tắt. Nó sử dụng các kỹ thuật học máy cho tóm tắt dữ liệu. Đặc biệt, giải thuật di truyền được áp dụng. Giải thuật này được kết hợp với chiến lược tham lam. Mục tiêu là trích rút tập câu tóm tắt tối ưu. Các tập tóm tắt này phải cô đọng và mang nhiều thông tin. Điều này đặc biệt quan trọng trong bối cảnh phân tích dữ liệu lớn. Giải thuật di truyền giúp tìm kiếm hiệu quả trong không gian giải pháp rộng lớn. Chiến lược tham lam được tích hợp để cải thiện tốc độ và chất lượng. Nó đảm bảo các giải pháp cục bộ tốt được tìm thấy nhanh chóng. Mối liên hệ giữa luật kết hợp ngôn ngữ và câu tóm tắt được phân tích sâu sắc. Điều này giúp tăng cường sự hiểu biết về dữ liệu. Việc chuyển đổi từ thuật toán khai phá luật kết hợp sang trích rút tóm tắt được trình bày. Điều này mở rộng phạm vi ứng dụng. Nó cung cấp một nền tảng mạnh mẽ cho tóm tắt trích rút tự động. Toàn bộ quy trình tối ưu hóa này cải thiện đáng kể chất lượng của các bản tóm tắt được tạo ra.

4.1. Giải thuật di truyền cho tóm tắt tối ưu

Luận án khám phá việc trích rút tập câu tóm tắt tối ưu. Giải thuật di truyền được áp dụng. Giải thuật này được kết hợp với chiến lược tham lam. Mục tiêu là tìm ra các tập con câu tóm tắt tốt nhất. Các câu này phải bao quát thông tin nhưng vẫn cô đọng. Đây là phương pháp học máy cho tóm tắt dữ liệu hiệu quả. Nó xử lý tốt bài toán tối ưu hóa phức tạp. Các yếu tố của mô hình giải thuật di truyền được điều chỉnh. Chúng giúp tối ưu hóa việc trích rút.

4.2. Kết hợp chiến lược tham lam hiệu quả

Chiến lược tham lam được tích hợp. Điều này giúp tăng cường hiệu quả tìm kiếm. Nó đảm bảo các giải pháp cục bộ tốt. Việc kết hợp này cải thiện khả năng của giải thuật di truyền. Nó giúp nhanh chóng đạt được tập tóm tắt chất lượng. Bài toán trích rút tập con câu tóm tắt được giải quyết. Giải pháp này phù hợp cho phân tích dữ liệu lớn. Nó giúp lọc ra thông tin quan trọng nhất.

4.3. Liên hệ với luật kết hợp ngôn ngữ

Mối liên hệ giữa luật kết hợp ngôn ngữ và câu tóm tắt được phân tích. Đặc biệt là các câu tóm tắt có từ lượng hóa. Luật kết hợp ngôn ngữ cung cấp cái nhìn sâu sắc. Nó giúp hiểu các mối quan hệ ẩn trong dữ liệu. Việc chuyển đổi từ thuật toán khai phá luật kết hợp sang trích rút tóm tắt được trình bày. Điều này mở rộng phạm vi ứng dụng. Nó cung cấp một nền tảng mạnh mẽ cho tóm tắt trích rút tự động.

V. Ứng dụng và tiềm năng của tóm tắt ngôn ngữ

Phương pháp luận án đề xuất có tiềm năng ứng dụng rộng lớn. Nó đặc biệt hữu ích trong các lĩnh vực khoa học dữ liệuphân tích dữ liệu lớn. Khả năng tạo ra các tóm tắt ngôn ngữ dễ hiểu là vô giá. Điều này giúp các hệ thống hỗ trợ ra quyết định trở nên hiệu quả hơn. Người dùng không chuyên có thể tiếp cận thông tin phức tạp. Luận án cũng vạch ra các hướng phát triển trong tương lai. Điều này bao gồm việc mở rộng phương pháp để xử lý các cấu trúc dữ liệu phức tạp hơn. Việc tích hợp với các mô hình xử lý ngôn ngữ tự nhiên (NLP) tiên tiến là cần thiết. Đặc biệt, mô hình Transformer có thể nâng cao đáng kể chất lượng tóm tắt. Nó cải thiện khả năng biểu diễn ngữ nghĩa. Thách thức về khả năng mở rộng cho các tập dữ liệu khổng lồ vẫn được nhận diện. Cần tiếp tục nghiên cứu để đảm bảo hiệu suất tối ưu. Đặc biệt là với các hệ thống tạo ngôn ngữ tự nhiên (NLG) quy mô lớn. Mục tiêu là tạo ra các hệ thống tóm tắt thông minh hơn, hiệu quả hơn.

5.1. Tiềm năng ứng dụng trong khoa học dữ liệu

Phương pháp đề xuất có tiềm năng lớn. Nó ứng dụng trong nhiều lĩnh vực khoa học dữ liệu. Đặc biệt là phân tích dữ liệu lớn. Khả năng tạo ra các tóm tắt ngôn ngữ dễ hiểu rất giá trị. Điều này hỗ trợ quá trình ra quyết định. Nó giúp người dùng không chuyên tiếp cận thông tin. Các hệ thống hỗ trợ ra quyết định được cải thiện. Nó biến dữ liệu phức tạp thành tri thức hữu ích. Ví dụ trong kinh doanh, y tế, hoặc giáo dục.

5.2. Hướng phát triển và thách thức tương lai

Hướng phát triển tiếp theo bao gồm việc mở rộng. Nó giải quyết các cấu trúc dữ liệu phức tạp hơn. Việc tích hợp với các mô hình xử lý ngôn ngữ tự nhiên (NLP) tiên tiến là cần thiết. Ví dụ như mô hình Transformer. Điều này có thể nâng cao chất lượng tóm tắt. Nó tăng cường khả năng biểu diễn ngữ nghĩa. Thách thức về khả năng mở rộng cho các tập dữ liệu khổng lồ vẫn tồn tại. Cần nghiên cứu thêm để đảm bảo hiệu suất. Đặc biệt là với các hệ thống tạo ngôn ngữ tự nhiên (NLG) quy mô lớn.

Mục lục chi tiết luận án

LỜI CAM ĐOAN
LỜI CẢM ƠN
DANH MỤC CÁC BẢNG
DANH MỤC CÁC HÌNH VẼ, ĐỒ THỊ
DANH MỤC CÁC KÝ HIỆU, CHỮ VIẾT TẮT
MỞ ĐẦU
1. CHƯƠNG 1: MỘT SỐ KIẾN THỨC CƠ SỞ
1.1. Một số kiến thức cơ bản về tập mờ
1.1.1. Định nghĩa tập mờ
1.1.2. Biến ngôn ngữ
1.1.3. Phân hoạch mờ
1.2. Khung nhận thức dựa trên lý thuyết tập mờ
1.2.1. Định nghĩa khung nhận thức
1.2.2. Các ràng buộc về tính giải nghĩa được
1.3. Tổng quan về trích rút tóm tắt bằng ngôn ngữ dựa trên lý thuyết tập mờ
1.3.1. Bài toán trích rút tóm tắt bằng ngôn ngữ là một nhánh trong lĩnh vực khai phá dữ liệu
1.3.2. Dạng câu tóm tắt có từ lượng hóa ngôn ngữ và ứng dụng
1.3.3. Trích rút tóm tắt từ cơ sở dữ liệu
1.3.4. Trích rút tập câu tóm tắt tối ưu từ cơ sở dữ liệu
1.3.5. Giải thuật di truyền giải bài toán trích rút tập tóm tắt
1.3.6. Các yếu tố trong mô hình giải thuật di truyền trích rút tập câu tóm tắt
1.4. Lý thuyết đại số gia tử
1.4.1. Cấu trúc đại số cho miền giá trị của biến ngôn ngữ
1.4.2. Đại số gia tử mở rộng mô hình lõi ngữ nghĩa của hạng từ
1.5. Kết luận chương 1
2. CHƯƠNG 2: VẤN ĐỀ NỘI DUNG THÔNG TIN CÂU TÓM TẮT VÀ BIỂU DIỄN TẬP MỜ CỦA MIỀN NGÔN NGỮ THUỘC TÍNH
2.1. Vai trò của khung nhận thức trong bài toán trích rút tóm tắt bằng ngôn ngữ dựa trên lý thuyết tập mờ
2.2. Vấn đề nội dung thông tin của các câu tóm tắt bằng ngôn ngữ
2.3. Khung nhận thức ngôn ngữ trong lý thuyết đại số gia tử
2.4. Cấu trúc đa ngữ nghĩa và tính mở rộng được của LFoC
2.4.1. Cấu trúc đa ngữ nghĩa trong LFoC
2.4.2. Mô hình bụi biểu diễn cấu trúc đa ngữ nghĩa của LFoC
2.4.3. Tính mở rộng được của LFoC
2.5. Xây dựng cấu trúc ngữ nghĩa tính toán giải nghĩa được của LFoC
2.5.1. Thủ tục xây dựng ngữ nghĩa tính toán cho LFoC
2.5.2. Tính giải nghĩa được của ngữ nghĩa tính toán với cấu trúc đa thể
2.6. Kết luận chương 2
3. CHƯƠNG 3: PHƯƠNG PHÁP TRÍCH RÚT CÂU TÓM TẮT NGÔN NGỮ DỰA TRÊN ĐẠI SỐ GIA TỬ
3.1. Cú pháp câu tóm tắt trong ngôn ngữ tự nhiên
3.2. Phương pháp trích rút câu tóm tắt dựa trên lý thuyết Đại số gia tử
3.2.1. Các thành phần chính trong phương pháp đề xuất
3.2.2. Tính mở rộng được của phương pháp đề xuất
3.2.3. Đánh giá thông tin của câu tóm tắt
3.3. Mục tiêu thực hiện thí nghiệm
3.4. Cơ sở dữ liệu, cú pháp và ngữ nghĩa của các thuộc tính
3.5. Thí nghiệm 1: Ưu điểm của LFoC có số lượng từ lớn và tính mở rộng được
3.6. Thí nghiệm 2: Khả năng mở rộng tập tri thức trích rút từ cơ sở dữ liệu
3.7. Thí nghiệm 3: Trích rút phân phối ngôn ngữ cho các nhóm mờ
3.8. Kết luận chương 3
4. CHƯƠNG 4: TRÍCH RÚT TẬP CÂU TÓM TẮT TỐI ƯU SỬ DỤNG GIẢI THUẬT DI TRUYỀN KẾT HỢP CHIẾN LƯỢC THAM LAM
4.1. Mối liên hệ giữa luật kết hợp ngôn ngữ và câu tóm tắt có từ lượng hóa
4.1.1. Liên hệ giữa luật kết hợp ngôn ngữ và câu tóm tắt bằng ngôn ngữ
4.1.2. Từ thuật toán khai phá luật kết hợp đến thuật toán trích rút tóm tắt
4.2. Bài toán trích rút tập con câu tóm tắt tối ưu
4.3. Giải thuật di truyền trích rút tập câu tóm tắt tối ưu
4.3.1. Hàm đánh giá độ thích nghi
4.3.2. Các phép toán trong mô hình giải thuật di truyền lai Hybrid-GA
4.3.3. Một số hạn chế trong mô hình giải thuật di truyền lai Hybrid-GA và định hướng khắc phục
4.4. Đề xuất thủ tục sinh câu tóm tắt tốt dựa trên chiến lược tham lam
4.4.1. Ý tưởng trích rút câu tóm tắt tốt và làm tăng độ đa dạng tập câu tóm tắt
4.4.2. Ý tưởng sinh câu tóm tắt tốt dựa trên đánh giá lực lượng của nhóm mờ
4.5. Đề xuất mô hình giải thuật di truyền kết hợp chiến lược tham lam trích rút tập câu tóm tắt tối ưu
4.5.1. Hàm đánh giá độ thích nghi
4.5.2. Mô hình giải thuật di truyền Greedy-GA
4.5.3. Cơ sở dữ liệu và dạng câu tóm tắt
4.5.4. Khung nhận thức ngôn ngữ của các thuộc tính và từ lượng hóa Q
4.5.5. Tham số của giải thuật di truyền
4.5.6. Kết quả thực nghiệm
4.6. Kết luận chương 4
KẾT LUẬN VÀ HƯỚNG PHÁT TRIỂN
DANH MỤC CÔNG TRÌNH CỦA TÁC GIẢ
TÀI LIỆU THAM KHẢO
Xem trước tài liệu
Tải đầy đủ để xem toàn bộ nội dung
Luận án tiến sĩ ngành máy tính tóm tắt dữ liệu bằng ngôn ngữ theo cách tiếp cận đại số gia tử

Tải xuống file đầy đủ để xem toàn bộ nội dung

Tải đầy đủ (150 trang)

Trích đoạn nội dung luận án

Tải xuống để đọc toàn bộ

BỘ GIÁO DỤC VÀ ĐÀO TẠO VIỆN HÀN LÂM KHOA HỌC VÀ CÔNG NGHỆ VIỆT NAM HỌC VIỆN KHOA HỌC VÀ CÔNG NGHỆ ----------------------------- PHẠM THỊ LAN TÓM TẮT DỮ LIỆU BẰNG NGÔN NGỮ THEO CÁCH TIẾP CẬN ĐẠI SỐ GIA TỬ LUẬN ÁN TIẾN SĨ NGÀNH MÁY TÍNH Hà Nội – 2022 BỘ GIÁO DỤC VÀ ĐÀO TẠO VIỆN HÀN LÂM KHOA HỌC VÀ CÔNG NGHỆ VIỆT NAM HỌC VIỆN KHOA HỌC VÀ CÔNG NGHỆ ----------------------------- PHẠM THỊ LAN TÓM TẮT DỮ LIỆU BẰNG NGÔN NGỮ THEO CÁCH TIẾP CẬN ĐẠI SỐ GIA TỬ LUẬN ÁN TIẾN SĨ NGÀNH MÁY TÍNH Chuyên ngành: Khoa học máy tính Mã số: 9 48 01 01 NGƯỜI HƯỚNG DẪN KHOA HỌC: 1.TSKH Nguyễn Cát Hồ 2.TS Hồ Cẩm Hà Hà Nội – 2022 LỜI CAM ĐOAN Tôi xin cam đoan đây là công trình nghiên cứu của riêng tôi. Các kết quả được viết chung với các tác giả khác đều được sự đồng ý của các đồng tác giả trước khi đưa vào luận án. Các kết quả nêu trong luận án là trung thực và chưa từng được công bố trong các công trình nào khác. Luận án được hoàn thành trong thời gian tôi làm Nghiên cứu sinh tại Học viện Khoa học và Công nghệ, Viện Hàn lâm Khoa học và Công nghệ Việt Nam.

Tác giả NCS Phạm Thị Lan LỜI CẢM ƠN Trước tiên, tôi xin gửi lời cảm ơn sâu sắc tới tập thể hướng dẫn là PGS.TSKH Nguyễn Cát Hồ và PGS.TS Hồ Cẩm Hà. Trong quá trình nghiên cứu và hoàn thành luận án, tác giả đã nhận được sự chỉ dẫn tận tình, các định hướng khoa học, những kinh nghiệm quý báu trong nghiên cứu từ hai thầy cô. Đặc biệt, thầy cô luôn quan tâm, khuyến khích, động viên tác giả vượt qua các giai đoạn khó khăn để hoàn thành luận án. Tác giả xin gửi lời cảm ơn chân thành tới các thầy cô, các phòng ban trong Học viện Khoa học và Công nghệ, Viện Hàn lâm Khoa học Việt Nam đã tạo điều kiện thuận lợi cho tác giả trong suốt quá trình nghiên cứu và thực hiện bảo vệ luận án.

Tác giả xin gửi lời cảm ơn tới các thầy cô và anh chị trong nhóm nghiên cứu Đại số gia tử và ứng dụng đã luôn chia sẻ, động viên và đưa ra góp ý quý báu đối với vấn đề nghiên cứu của tác giả. Tác giả cũng xin gửi lời cảm ơn chân thành tới Ban giám hiệu trường Đại học Sư phạm Hà Nội, Ban chủ nhiệm khoa và cán bộ, giảng viên tại khoa Công nghệ thông tin, trường Đại học Sư phạm Hà Nội đã tạo điều kiện, giúp đỡ, động viên trong suốt quá trình học tập, nghiên cứu và hoàn thiện bảo vệ luận án. Tác giả xin gửi lời cảm ơn và lòng biết ơn sâu sắc tới các thành viên trong đại gia đình đã luôn hỗ trợ, tạo điều kiện, động viên để tác giả có thời gian, tâm lý tốt nhất để thực hiện các nhiệm vụ trong nghiên cứu. Tác giả NCS Phạm Thị Lan 1 MỤC LỤC DANH MỤC CÁC BẢNG.5 DANH MỤC CÁC HÌNH VẼ, ĐỒ THỊ.6 DANH MỤC CÁC KÝ HIỆU, CHỮ VIẾT TẮT.

MỘT SỐ KIẾN THỨC CƠ SỞ. Một số kiến thức cơ bản về tập mờ. Định nghĩa tập mờ. Biến ngôn ngữ.

Phân hoạch mờ. Khung nhận thức dựa trên lý thuyết tập mờ. Định nghĩa khung nhận thức. Các ràng buộc về tính giải nghĩa được.

Tổng quan về trích rút tóm tắt bằng ngôn ngữ dựa trên lý thuyết tập mờ. Bài toán trích rút tóm tắt bằng ngôn ngữ là một nhánh trong lĩnh vực khai phá dữ liệu. Dạng câu tóm tắt có từ lượng hóa ngôn ngữ và ứng dụng. Trích rút tóm tắt từ cơ sở dữ liệu.

Trích rút tập câu tóm tắt tối ưu từ cơ sở dữ liệu. Giải thuật di truyền giải bài toán trích rút tập tóm tắt. Các yếu tố trong mô hình giải thuật di truyền trích rút tập câu tóm tắt. Lý thuyết đại số gia tử.

Cấu trúc đại số cho miền giá trị của biến ngôn ngữ. Đại số gia tử mở rộng mô hình lõi ngữ nghĩa của hạng từ. Kết luận chương 1. VẤN ĐỀ NỘI DUNG THÔNG TIN CÂU TÓM TẮT VÀ BIỂU DIỄN TẬP MỜ CỦA MIỀN NGÔN NGỮ THUỘC TÍNH.

Vai trò của khung nhận thức trong bài toán trích rút tóm tắt bằng ngôn ngữ dựa trên lý thuyết tập mờ. Vấn đề nội dung thông tin của các câu tóm tắt bằng ngôn ngữ. Khung nhận thức ngôn ngữ trong lý thuyết đại số gia tử. Cấu trúc đa ngữ nghĩa và tính mở rộng được của LFoC.

Cấu trúc đa ngữ nghĩa trong LFoC. Mô hình bụi biểu diễn cấu trúc đa ngữ nghĩa của LFoC. Tính mở rộng được của LFoC. Xây dựng cấu trúc ngữ nghĩa tính toán giải nghĩa được của LFoC.

Thủ tục xây dựng ngữ nghĩa tính toán cho LFoC. Tính giải nghĩa được của ngữ nghĩa tính toán với cấu trúc đa thể. Kết luận chương 2. PHƯƠNG PHÁP TRÍCH RÚT CÂU TÓM TẮT NGÔN NGỮ DỰA TRÊN ĐẠI SỐ GIA TỬ.

Cú pháp câu tóm tắt trong ngôn ngữ tự nhiên. Phương pháp trích rút câu tóm tắt dựa trên lý thuyết Đại số gia tử. Các thành phần chính trong phương pháp đề xuất. Tính mở rộng được của phương pháp đề xuất.

Đánh giá thông tin của câu tóm tắt. Mục tiêu thực hiện thí nghiệm. Cơ sở dữ liệu, cú pháp và ngữ nghĩa của các thuộc tính. Thí nghiệm 1: Ưu điểm của LFoC có số lượng từ lớn và tính mở rộng được 95 3.

Thí nghiệm 2: Khả năng mở rộng tập tri thức trích rút từ cơ sở dữ liệu 3. Thí nghiệm 3: Trích rút phân phối ngôn ngữ cho các nhóm mờ. Kết luận chương 3. TRÍCH RÚT TẬP CÂU TÓM TẮT TỐI ƯU SỬ DỤNG GIẢI THUẬT DI TRUYỀN KẾT HỢP CHIẾN LƯỢC THAM LAM.

Mối liên hệ giữa luật kết hợp ngôn ngữ và câu tóm tắt có từ lượng hóa. Liên hệ giữa luật kết hợp ngôn ngữ và câu tóm tắt bằng ngôn ngữ. Từ thuật toán khai phá luật kết hợp đến thuật toán trích rút tóm tắt 111 4. Bài toán trích rút tập con câu tóm tắt tối ưu.

Giải thuật di truyền trích rút tập câu tóm tắt tối ưu. Hàm đánh giá độ thích nghi. Các phép toán trong mô hình giải thuật di truyền lai Hybrid-GA. Một số hạn chế trong mô hình giải thuật di truyền lai Hybrid-GA và định hướng khắc phục.

Đề xuất thủ tục sinh câu tóm tắt tốt dựa trên chiến lược tham lam. Ý tưởng trích rút câu tóm tắt tốt và làm tăng độ đa dạng tập câu tóm tắt. Ý tưởng sinh câu tóm tắt tốt dựa trên đánh giá lực lượng của nhóm mờ. Đề xuất mô hình giải thuật di truyền kết hợp chiến lược tham lam trích rút tập câu tóm tắt tối ưu.

Hàm đánh giá độ thích nghi. Mô hình giải thuật di truyền Greedy-GA. Cơ sở dữ liệu và dạng câu tóm tắt. Khung nhận thức ngôn ngữ của các thuộc tính và từ lượng hóa Q.

Tham số của giải thuật di truyền. Kết quả thực nghiệm. Kết luận chương 4. 131 KẾT LUẬN VÀ HƯỚNG PHÁT TRIỂN.133 DANH MỤC CÔNG TRÌNH CỦA TÁC GIẢ.136 TÀI LIỆU THAM KHẢO.137 5 DANH MỤC CÁC BẢNG Bảng 1.1: Dữ liệu ví dụ về 10 công việc.2: Tính độ thuộc của từng mức lương vào các tập mờ tương ứng từ ngôn ngữ trong Dom(LƯƠNG).3: Phân loại các mức tổng quát cấu trúc câu tóm tắt.4: Quan hệ dấu giữa một gia tử trên dòng với gia tử trên cột.1: Các câu tóm tắt trích rút từ cơ sở dữ liệu, điều kiện lọc là “o(JOB) IS ‘technician’ AND o(Y) IS ‘yes’”, có 730 bản ghi thỏa điều kiện lọc.2: Phân phối ngôn ngữ của nhóm mờ xác định bởi điều kiện “(JOB IS ‘student’) AND (AGE IS x)” đối với thuộc tính CCI và Y = ‘yes’ với tập từ lượng hóa Q có tính riêng mức 3 ℱQ,(3).3: Phân phối ngôn ngữ của nhóm mờ xác định bởi điều kiện “(JOB IS ‘student’) AND (AGE IS x)” đối với thuộc tính CCI và Y = ‘yes’ với tập từ lượng hóa Q có tính riêng mức 4 ℱQ,(4).4: Phân phối ngôn ngữ của nhóm mờ xác định bởi điều kiện “(JOB IS ‘student’) AND (AGE IS x)” đối với thuộc tính CCI và Y = ‘no’ với tập từ lượng hóa Q có tính riêng mức 3 ℱQ,(3).5: Phân phối ngôn ngữ của nhóm mờ xác định bởi điều kiện “(JOB IS ‘student’) AND (AGE IS x)” đối với thuộc tính CCI và Y = ‘no’ với tập từ lượng hóa Q có tính riêng mức 4 ℱQ,(4).1: Thống kê số lượng câu tóm tắt theo số thuộc tính trong câu 114 Bảng 4.2: Kết quả trung bình 10 lần chạy mô hình Greedy-GA và kết quả thực nghiệm mô hình Hybrid-GA trong [38].131 6 DANH MỤC CÁC HÌNH VẼ, ĐỒ THỊ Hình 1.1: Ba kiểu tập mờ phổ biến.2: Ví dụ năm tập mờ biểu diễn ngữ nghĩa các giá trị ngôn ngữ của biến LƯƠNG trong miền tham chiếu [0, 10] (đơn vị: triệu đồng).

Ví dụ về phân hoạch mờ: (a) dạng đơn thể hạt; (b) dạng đa thể hạt .4: Ví dụ về các tập mờ trên miền tham chiếu số.5: Khung nhận thức ngôn ngữ gồm 3 tập mờ và gán nhãn ngữ nghĩa không đúng về thứ tự ngữ nghĩa.6: Hai ví dụ về khung nhận thức được thiết kế có tính giải nghĩa tốt 25 Hình 1.7: Quá trình khai phá tri thức từ cơ sở dữ liệu.8: Mờ hóa miền tham chiếu của khoảng cách, lương/tháng và đoạn [0,1] của từ lượng hóa tương đối.9: Các khoảng tính mờ của các hạng từ trong X(2) với tập gia tử H = {L, V}.10: Các tập mờ tam giác xây dựng từ giá trị định lượng ngữ nghĩa.11: Cấu trúc ngữ nghĩa của các hạng từ sinh ra từ hạng từ ‘old’.12: Các khoảng tính mờ của hạng từ trong Xen,(3) sinh ra từ c+.13: Các tập mờ hình thang cho các hạng từ trong X(2).1: Vấn đề chuyển đổi cấu trúc của miền hạng từ ngôn ngữ thành một cấu trúc tính toán phù hợp.2: Một phần cấu trúc bụi biểu diễn hai quan hệ ngữ nghĩa vốn của trong LFoC: quan hệ thứ tự và quan hệ tính chung – riêng.3: Ngữ nghĩa tập mờ ở dạng đa mức cho các hạng từ ℱ3 với tập gia tử H = {L, V}.4: Các khoảng tính mờ của các hạng từ trong X(3) sinh từ cấu trúc Đại số gia tử với tập gia tử H = {L, V}.5: Một phần kết hợp các tập mờ hình thang ở mức k và mức k+1 trên cùng miền tham chiếu [0, 1], với |H| = |H+| = 2.1: Các thành phần chính trong phương pháp trích rút tóm tắt bằng ngôn ngữ dựa trên lý thuyết đại số gia tử.2: Các tập mờ hình thang biểu diễn ngữ nghĩa cho các từ lượng hóa trong ℱQ,1, ℱQ,2 và ℱQ,3.3: Cây phân cấp biểu diễn phân phối ngôn ngữ các độ tuổi của nhóm khách hàng JOB = ‘retired’ AND Y = ‘no’.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Trích dẫn luận án này

Phạm Thị Lan (2022). Luận án tiến sĩ ngành máy tính tóm tắt dữ liệu bằng ngôn ngữ [Luận án tiến sĩ, Học viện Khoa học và Công nghệ]. LuanAn.net. https://luanan.net/tai-lieu-khac/luan-an-tien-si-nganh-may-tinh-tom-tat-du-lieu-bang-ngon-ngu-theo-cach-tiep-can-dai-so-gia-tu

Câu hỏi thường gặp

Luận án "Luận án tiến sĩ ngành máy tính tóm tắt dữ liệu bằng ngôn ngữ" nghiên cứu về vấn đề gì?

Luận án: Luận án tiến sĩ ngành máy tính tóm tắt dữ liệu bằng ngôn ngữ theo cách tiếp cận đại số gia tử. Xem tóm tắt và tải về tại LuanAn.net

Luận án "Luận án tiến sĩ ngành máy tính tóm tắt dữ liệu bằng ngôn ngữ" được bảo vệ tại trường nào?

Luận án này được bảo vệ tại Học viện Khoa học và Công nghệ. Năm bảo vệ: 2022.

Luận án "Luận án tiến sĩ ngành máy tính tóm tắt dữ liệu bằng ngôn ngữ" thuộc chuyên ngành gì?

Luận án "Luận án tiến sĩ ngành máy tính tóm tắt dữ liệu bằng ngôn ngữ" thuộc chuyên ngành Khoa học máy tính. Danh mục: Tài liệu khác.

Luận án "Luận án tiến sĩ ngành máy tính tóm tắt dữ liệu bằng ngôn ngữ" có bao nhiêu trang?

Luận án "Luận án tiến sĩ ngành máy tính tóm tắt dữ liệu bằng ngôn ngữ" có 150 trang. Bạn có thể xem trước một phần tài liệu ngay trên trang web trước khi tải về.

Cách tải luận án "Luận án tiến sĩ ngành máy tính tóm tắt dữ liệu bằng ngôn ngữ" về máy như thế nào?

Để tải luận án về máy, bạn nhấn nút "Tải xuống ngay" trên trang này, sau đó hoàn tất thanh toán phí lưu trữ. File sẽ được tải xuống ngay sau khi thanh toán thành công. Hỗ trợ qua Zalo: 0559 297 239.

Luận án liên quan

Chia sẻ tài liệu: Facebook Twitter