Phân lớp dữ liệu bằng cây quyết định mờ dựa trên đại số gia tử luận án tiến sĩ
Luận án: Phân lớp dữ liệu bằng cây quyết định mờ dựa trên đại số gia tử luận án tiến sĩ. Xem tóm tắt và tải về tại LuanAn.net
Luan An
Luận án tiến sĩ
Năm xuất bản
Số trang
120
Thời gian đọc
18 phút
Lượt xem
0
Lượt tải
0
Phí lưu trữ
40 Point
Tổng quan nhanh
- Chủ đề:
- 1. Cơ sở lý thuyết: Cây quyết định mờ và đại số gia
- Số trang:
- 120 trang
- Trường:
- Trường Đại học Khoa học, Đại học Huế
- Chuyên ngành:
- Khoa học máy tính
- Tác giả:
- Lê Văn Tường Lân
- Năm:
- 2018
Tóm tắt nội dung luận án
I. Cơ sở lý thuyết Cây quyết định mờ và đại số gia
Trong lĩnh vực khai phá dữ liệu, việc xử lý thông tin không chắc chắn và mơ hồ là một thách thức lớn. Các thuật toán phân lớp truyền thống, đặc biệt là cây quyết định rõ ràng, thường gặp khó khăn trong việc xử lý dữ liệu mờ, dẫn đến hiệu suất không tối ưu và mất mát thông tin quan trọng. Nghiên cứu này đặt ra một nền tảng lý thuyết vững chắc để phát triển các phương pháp phân lớp dữ liệu bằng cây quyết định mờ tiên tiến. Nó tích hợp chặt chẽ các nguyên tắc cơ bản từ lý thuyết tập mờ và đại số gia tử để xây dựng các mô hình thông minh. Những mô hình này được thiết kế để xử lý hiệu quả các biến ngôn ngữ và thông tin mơ hồ, từ đó nâng cao khả năng phân loại chính xác. Mục tiêu chính là thu hẹp khoảng cách giữa các mô hình dữ liệu sắc nét truyền thống và tính mờ vốn có trong các tập dữ liệu thực tế. Sự tích hợp này củng cố đáng kể khả năng của các hệ thống học máy và trí tuệ nhân tạo trong các kịch bản diễn giải dữ liệu phức tạp. Hiểu rõ các lý thuyết nền tảng này là điều cần thiết để đánh giá sự đổi mới và hiệu quả của các đóng góp trong việc xây dựng và tối ưu hóa cây quyết định mờ. Phần này cung cấp một cái nhìn tổng quan chi tiết về kiến thức tiên quyết, tạo tiền đề cho các phát triển thuật toán được trình bày ở các chương sau, đặc biệt trong lĩnh vực xử lý dữ liệu không chắc chắn.
1.1. Lý thuyết tập mờ và thông tin không chắc chắn
Lý thuyết tập mờ, do Lotfi Zadeh tiên phong, cung cấp một khung toán học mạnh mẽ và linh hoạt để biểu diễn và suy luận với thông tin không chính xác hoặc mơ hồ. Không giống như lý thuyết tập hợp cổ điển, chỉ cho phép tư cách thành viên nhị phân (một phần tử hoặc hoàn toàn thuộc về hoặc không thuộc về một tập hợp), các tập mờ giới thiệu khái niệm mức độ thành viên. Điều này cho phép các phần tử thuộc về một tập hợp một phần, mang lại sự biểu diễn sắc thái và thực tế hơn về các hiện tượng trong thế giới thực. Khái niệm này đặc biệt quan trọng khi xử lý ngôn ngữ con người và đánh giá định tính, nơi các thuật ngữ như “cao”, “nóng”, “trẻ” hoặc “trung bình” vốn dĩ mang tính mơ hồ. Trong bối cảnh phân lớp dữ liệu, các tập mờ cho phép các thuộc tính mang các giá trị ngôn ngữ, cung cấp một biểu diễn dữ liệu phong phú và biểu cảm hơn so với các giá trị số sắc nét. Khả năng này đặc biệt quan trọng trong các tác vụ khai phá dữ liệu mà các tính năng đầu vào có thể mang tính chủ quan, liên tục hoặc được mô tả tốt nhất về mặt định tính. Bằng cách áp dụng logic mờ, cây quyết định mờ có thể nắm bắt hiệu quả các sắc thái của dữ liệu không chắc chắn, làm cho quá trình phân loại trở nên linh hoạt, mạnh mẽ và sâu sắc hơn trước sự mơ hồ cố hữu. Nó đại diện cho một tiến bộ đáng kể trong trí tuệ nhân tạo để lập mô hình các quy trình ra quyết định phức tạp trong điều kiện mơ hồ và không chính xác.
1.2. Đại số gia tử Xử lý dữ liệu ngôn ngữ
Trong khi lý thuyết tập mờ cung cấp cơ sở khái niệm cho các tập mờ, Đại số gia tử (Hedge Algebra - HA) mở rộng điều này bằng cách cung cấp một khung đại số chặt chẽ để tính toán và thao tác các giá trị ngôn ngữ định lượng. HA cho phép tạo và thao tác có cấu trúc các thuật ngữ ngôn ngữ này, bắt đầu từ một tập hợp các thuật ngữ cơ bản (ví dụ: “nhỏ”, “trung bình”, “lớn”) và một tập hợp các từ bổ nghĩa (ví dụ: “rất”, “ít nhiều”, “khá”). Khả năng độc đáo này cung cấp một phương pháp luận chính thức và nhất quán để biểu diễn và tính toán các giá trị ngữ nghĩa của các biến ngôn ngữ, điều này cực kỳ quan trọng để xây dựng cây quyết định mờ có thể diễn giải và hiệu quả. HA tạo điều kiện thuận lợi cho việc chuyển đổi kiến thức định tính của con người – thường được diễn đạt bằng ngôn ngữ tự nhiên – thành một dạng định lượng phù hợp cho xử lý thuật toán. Điều này làm cho HA trực tiếp áp dụng và cực kỳ có lợi cho các thuật toán học máy tiên tiến. Khả năng vô song của nó trong việc nắm bắt các sắc thái và mức độ của các biểu thức ngôn ngữ là vô giá cho xử lý dữ liệu không chắc chắn bắt nguồn từ các chuyên gia con người, khảo sát hoặc các phép đọc cảm biến không chính xác. Bằng cách tích hợp sâu HA, cây quyết định có được khả năng phân loại dựa trên các quy tắc ngôn ngữ phức tạp, mô phỏng lý luận của con người chặt chẽ hơn và cải thiện đáng kể tính minh bạch cũng như khả năng giải thích của thuật toán phân lớp kết quả.
1.3. Cây quyết định Hạn chế và tiềm năng mờ hóa
Các cây quyết định truyền thống, như thuật toán C4.5, ID3 hoặc CART, từ lâu đã là nền tảng trong phân lớp dữ liệu nhờ tính dễ hiểu, hiệu quả tính toán và dễ thực hiện. Các thuật toán này xây dựng các mô hình phân chia không gian dữ liệu thành các vùng riêng biệt, không chồng lấn dựa trên các điều kiện sắc nét (nhị phân) áp dụng cho các giá trị thuộc tính. Tuy nhiên, cách tiếp cận “rõ ràng” này thường đơn giản hóa quá mức sự phức tạp và liên tục vốn có trong nhiều hiện tượng thế giới thực. Khi xử lý các thuộc tính liên tục, các thuật toán này yêu cầu lựa chọn ngưỡng phân chia tùy ý, điều này có thể dẫn đến mất mát thông tin đáng kể, tạo ra các ranh giới nhân tạo và góp phần vào “vấn đề ranh giới sắc nét” nổi tiếng. Hơn nữa, các cây quyết định truyền thống gặp khó khăn rất lớn với các tập dữ liệu chứa sự mơ hồ, không rõ ràng hoặc đầu vào chủ quan của con người, nơi không thể phân biệt chính xác. Những hạn chế cơ bản này hạn chế hiệu quả tổng thể của chúng trong nhiều tác vụ khai phá dữ liệu nâng cao, đặc biệt khi các ranh giới quyết định vốn đã mờ hoặc chồng chéo. Khái niệm “mờ hóa” xuất hiện như một mô hình mạnh mẽ để khắc phục những hạn chế này. Bằng cách tích hợp các nguyên tắc từ lý thuyết tập mờ vào quá trình xây dựng cây quyết định, cây quyết định mờ có khả năng xử lý mạnh mẽ các lớp chồng chéo, các giá trị thuộc tính không chính xác và dữ liệu ngôn ngữ. Quá trình “mờ hóa” mang tính biến đổi này tận dụng các điểm mạnh vốn có của logic mờ để xây dựng các thuật toán phân lớp mạnh mẽ, linh hoạt và nhận biết ngữ cảnh hơn, từ đó vượt qua ranh giới của các kỹ thuật học máy truyền thống và nâng cao khả năng ứng dụng của chúng trong các môi trường phức tạp, không chắc chắn.
II. Cải tiến phân lớp dữ liệu mờ bằng đối sánh điểm
Phần này tập trung khám phá các phương pháp cải tiến được thiết kế đặc biệt để nâng cao hiệu suất và độ tin cậy của các mô hình phân lớp dữ liệu bằng cây quyết định mờ. Trọng tâm chính là phát triển và ứng dụng “phương pháp đối sánh điểm mờ”, một cách tiếp cận tinh vi giúp giải quyết các thách thức quan trọng như tập huấn luyện không thuần nhất và sự hiện diện của các điểm ngoại lai ngôn ngữ. Các kỹ thuật được đề xuất nhằm mục đích tăng cường đáng kể độ chính xác và độ tin cậy của các thuật toán phân lớp bằng cách định lượng cẩn thận và tận dụng chiến lược thông tin mờ có trong các tập dữ liệu phức tạp. Những tiến bộ này rất quan trọng để đạt được kết quả khai phá dữ liệu hiệu quả hơn và tinh chỉnh các mô hình học máy hiện có, đặc biệt khi xử lý dữ liệu có mức độ mơ hồ và không chính xác cao. Thảo luận chi tiết sẽ làm nổi bật cách các phương pháp mới này đóng góp vào sự hiểu biết và xử lý dữ liệu mờ sắc thái hơn, từ đó làm cho các hệ thống trí tuệ nhân tạo có khả năng xử lý các phức tạp dữ liệu trong thế giới thực.
2.1. Phân lớp dữ liệu với ngưỡng miền trị thuộc tính
Một thách thức đáng kể trong phân lớp dữ liệu là xử lý hiệu quả các thuộc tính liên tục hoặc thuộc tính hỗn hợp trong các mô hình cây quyết định. Phần này trình bày chi tiết một phương pháp mạnh mẽ để xây dựng cây quyết định dựa trên các ngưỡng miền trị thuộc tính được xác định chính xác. Cơ chế cơ bản bao gồm việc xác định các ngưỡng tối ưu phân chia không gian dữ liệu một cách hiệu quả, chuyển đổi các biến liên tục thành các khoảng rời rạc, dễ quản lý. Cách tiếp cận này giảm thiểu việc mất thông tin thường liên quan đến các điểm phân chia tùy ý trong các thuật toán truyền thống. Nghiên cứu giới thiệu thuật toán MixC4.5, một mở rộng đổi mới được thiết kế để xử lý thành thạo các tập dữ liệu bao gồm cả thuộc tính số và ngôn ngữ. Các nguyên tắc hoạt động của nó, bao gồm lựa chọn các thuộc tính phân chia và xây dựng các quy tắc quyết định, được giải thích cặn kẽ. Việc triển khai và đánh giá thực nghiệm của MixC4.5 chứng minh hiệu quả thực tế và hiệu suất nâng cao trong nhiều kịch bản khai phá dữ liệu, đặc biệt là những kịch bản mà việc thiết lập ranh giới rõ ràng giữa các lớp tỏ ra khó khăn. Đánh giá xác nhận khả năng cải thiện độ chính xác và khả năng diễn giải của phân loại, cung cấp một giải pháp thực dụng cho xử lý dữ liệu không chắc chắn.
2.2. Thuật toán FMixC4.5 Đối sánh điểm mờ hiệu quả
Dựa trên các nguyên tắc cơ bản, nghiên cứu này giới thiệu thuật toán FMixC4.5 mới lạ, đại diện cho một tiến bộ đáng kể trong phân lớp dữ liệu bằng cây quyết định mờ thông qua cơ chế đối sánh điểm mờ của nó. Một đổi mới quan trọng nằm ở cách tiếp cận tinh vi để so sánh các giá trị ngôn ngữ, vượt ra ngoài các kiểm tra bình đẳng đơn giản để bao gồm các mức độ tương đồng. Phương pháp này trực tiếp giải quyết các vấn đề phổ biến như mẫu huấn luyện không đồng nhất và định lượng chính xác các điểm ngoại lai ngôn ngữ – các điểm dữ liệu khác biệt đáng kể về mặt ngữ nghĩa ngôn ngữ. Bằng cách sử dụng đại số gia tử để định lượng ngữ nghĩa, FMixC4.5 tính toán “khoảng cách mờ” hoặc “mức độ tương đồng” giữa các thuật ngữ ngôn ngữ, cho phép các ranh giới quyết định linh hoạt và chính xác hơn. Các chi tiết xây dựng thuật toán, bao gồm cách tính lợi ích thông tin trong ngữ cảnh mờ, được trình bày kỹ lưỡng. Các kết quả thực nghiệm rộng rãi và phân tích so sánh được trình bày, chứng minh nghiêm ngặt hiệu quả vượt trội của FMixC4.5 trong việc cải thiện độ chính xác phân loại và tăng cường tính mạnh mẽ chống lại nhiễu và sự không chính xác cố hữu của dữ liệu. Sự phát triển này đóng góp đáng kể vào ứng dụng thực tế của học máy trong các môi trường phức tạp và nâng cao độ chính xác của trí tuệ nhân tạo trong diễn giải dữ liệu.
III. Nâng cao phân lớp dữ liệu mờ Đối sánh khoảng mờ
Phần này tiếp tục phát triển các phương pháp cho phân lớp dữ liệu bằng cây quyết định mờ bằng cách giới thiệu một cách tiếp cận tinh vi hơn: “đối sánh khoảng mờ”. Kỹ thuật này tinh chỉnh cách thông tin mờ được xử lý và diễn giải trong cây quyết định, hứa hẹn độ chính xác phân loại cao hơn và xử lý tốt hơn dữ liệu rất không chắc chắn hoặc mơ hồ. Sự đổi mới cốt lõi nằm ở việc tận dụng sức mạnh biểu cảm của đại số gia tử để định nghĩa chặt chẽ và so sánh hiệu quả các khoảng mờ, từ đó xây dựng một khuôn khổ mạnh mẽ và dễ thích nghi cho các tác vụ khai phá dữ liệu đòi hỏi cao. Phương pháp này vượt ra ngoài các so sánh điểm đơn lẻ, xem xét các phạm vi giá trị ngôn ngữ, điều này phản ánh chính xác hơn nhận thức của con người và phân bố dữ liệu trong thế giới thực. Các nguyên tắc được thảo luận ở đây là cơ bản để phát triển các thuật toán phân lớp tiên tiến có thể hoạt động hiệu quả trong các môi trường có tính mơ hồ đáng kể, tiếp tục đẩy xa ranh giới của khả năng học máy và trí tuệ nhân tạo trong các miền không chắc chắn.
3.1. Xây dựng đối sánh khoảng mờ dựa trên đại số gia
Việc xây dựng cơ chế đối sánh khoảng hiệu quả cho các thuộc tính mờ tạo thành nền tảng của phương pháp phân lớp dữ liệu tiên tiến này. Phần này trình bày chi tiết cách đại số gia tử cung cấp khung toán học và logic cơ bản cần thiết để xác định và so sánh các khoảng mờ một cách nghiêm ngặt. Không giống như các phương pháp truyền thống dựa vào các ranh giới sắc nét, cách tiếp cận này cho phép các giá trị thuộc tính được biểu diễn dưới dạng các khoảng mờ, nắm bắt sự không chính xác cố hữu của chúng. Một khía cạnh quan trọng của sự phát triển này là phương pháp luận để xác định và so sánh định lượng các khoảng mờ này ngay cả trong các kịch bản mà các phạm vi tối thiểu (MIN) và tối đa (MAX) của các thuộc tính không được biết rõ ràng hoặc bản thân chúng không chắc chắn. Khả năng mới lạ này rất quan trọng để xử lý dữ liệu không chắc chắn gặp phải trong các ứng dụng thực tế đa dạng, nơi thông tin đầy đủ hiếm khi có sẵn. Việc xây dựng có hệ thống đảm bảo rằng các so sánh giữa các giá trị ngôn ngữ, được biểu diễn dưới dạng các khoảng mờ, là nhất quán, có ý nghĩa ngữ nghĩa và có thể áp dụng trực tiếp trong khuôn khổ cây quyết định mờ. Sự tích hợp này nâng cao đáng kể khả năng lý luận của mô hình với sự không chắc chắn về ngôn ngữ.
3.2. Thuật toán HAC4.5 Phân lớp bằng đối sánh khoảng mờ
Nghiên cứu này giới thiệu thuật toán HAC4.5, một thuật toán phân lớp mới lạ sử dụng khéo léo cơ chế đối sánh khoảng mờ, được xây dựng một cách tỉ mỉ dựa trên đại số gia tử. HAC4.5 đại diện cho một sự phát triển đáng kể trong lĩnh vực cây quyết định mờ, đặc biệt trong khả năng xử lý các thuộc tính liên tục và ngôn ngữ với độ chính xác chưa từng có. Các nguyên tắc hoạt động của HAC4.5 được mô tả kỹ lưỡng, chi tiết cách các khoảng mờ được tạo ra cho các giá trị thuộc tính và cách tính lợi ích thông tin bằng cách sử dụng các so sánh khoảng này để xác định các điểm phân chia tối ưu. Phương pháp luận này cho phép cây quyết định điều hướng hiệu quả sự phức tạp của các ranh giới mờ, dẫn đến phân loại mạnh mẽ và chính xác hơn. Thiết lập thực nghiệm và đánh giá toàn diện HAC4.5 được trình bày, so sánh nghiêm ngặt hiệu suất của nó với các phương pháp cây quyết định mờ và sắc nét hiện có và tiên tiến nhất. Các kết quả nhất quán chứng minh những lợi thế vượt trội của nó trong việc xử lý chính xác các mẫu dữ liệu mờ phức tạp, giảm độ nhạy với nhiễu và cung cấp các quy tắc quyết định dễ hiểu hơn. Tiến bộ này đóng góp đáng kể vào khả năng học máy tinh vi, cung cấp một công cụ mạnh mẽ để khai phá dữ liệu trong các môi trường rất không chắc chắn.
IV. Tối ưu hóa mô hình cây quyết định mờ hiệu quả
Phần kết luận này đi sâu vào các chiến lược tối ưu hóa tiên tiến để tăng cường các mô hình cây quyết định mờ, đặc biệt tập trung vào khái niệm đổi mới về “khoảng mờ lớn nhất”. Mục tiêu bao trùm là xây dựng các mô hình phân lớp dữ liệu thậm chí mạnh mẽ hơn, chính xác hơn và có khả năng tổng quát hóa tốt hơn, có thể mang lại hiệu suất vượt trội trong các môi trường dữ liệu đa dạng và phức tạp. Sự khám phá này trực tiếp giải quyết những thách thức cố hữu của học đa mục tiêu trong các ngữ cảnh mờ, nơi việc cân bằng độ chính xác phân loại với khả năng diễn giải và độ phức tạp của mô hình trở nên cực kỳ quan trọng. Các kỹ thuật tinh chỉnh được thảo luận ở đây đã đẩy xa ranh giới của các mô hình học máy hiện tại bằng cách cung cấp các cách tiếp cận tinh vi hơn để xây dựng các thuật toán phân lớp nắm bắt hiệu quả các sắc thái của dữ liệu không chắc chắn. Giai đoạn tối ưu hóa này rất quan trọng để đảm bảo rằng các mô hình được phát triển không chỉ đúng về mặt lý thuyết mà còn vượt trội về mặt thực tế, mang lại những cải tiến hữu hình trong các ứng dụng trí tuệ nhân tạo trong thế giới thực cho khai phá dữ liệu.
4.1. Bài toán học phân lớp đa mục tiêu và khoảng mờ
Việc xây dựng phân lớp dữ liệu bằng cây quyết định mờ có thể được coi là một nhiệm vụ học đa mục tiêu phức tạp. Quan điểm này thừa nhận rằng một cây quyết định tối ưu phải đồng thời thỏa mãn một số tiêu chí, bao gồm tối đa hóa độ chính xác phân loại, đảm bảo khả năng diễn giải cao của các quy tắc và giảm thiểu độ phức tạp của mô hình (ví dụ: kích thước cây). Tối ưu hóa đơn mục tiêu truyền thống thường bỏ qua những đánh đổi quan trọng này. Nghiên cứu này giới thiệu khái niệm “khoảng mờ lớn nhất” như một yếu tố then chốt để đạt được nhiều mục tiêu này. Khoảng mờ lớn nhất đại diện cho phạm vi đại diện và bao quát nhất cho một thuật ngữ ngôn ngữ trong một ngữ cảnh nhất định, cung cấp cơ sở ổn định và mạnh mẽ hơn cho việc ra quyết định. Ý nghĩa của nó trong việc tối ưu hóa quá trình học cây quyết định mờ được trình bày chi tiết, giải thích cách nó giúp lựa chọn các điểm phân chia cung cấp nhiều thông tin nhất. Cách tiếp cận mới lạ này rất quan trọng để phát triển các thuật toán phân lớp tinh vi và cân bằng hơn trong các ứng dụng trí tuệ nhân tạo tiên tiến, đặc biệt trong các kịch bản đòi hỏi cả khả năng dự đoán cao và những hiểu biết rõ ràng, có thể hành động từ quá trình khai phá dữ liệu.
4.2. Thuật toán HAC4.5 Tiếp cận khoảng mờ lớn nhất
Dựa trên khái niệm đối sánh khoảng mờ và khoảng mờ lớn nhất, nghiên cứu này trình bày thuật toán HAC4.5* được nâng cấp đáng kể. Thuật toán phân lớp được tối ưu hóa này đại diện cho đỉnh cao của các tiến bộ trước đó, tích hợp khái niệm khoảng mờ lớn nhất để tinh chỉnh hơn nữa việc xây dựng cây quyết định mờ. HAC4.5* hoạt động bằng cách thông minh xác định và sử dụng các khoảng mờ lớn nhất này trong quá trình xây dựng cây, dẫn đến các ranh giới quyết định ổn định và có khả năng tổng quát hóa tốt hơn. Các chi tiết phương pháp luận, bao gồm cách các khoảng tối ưu này được tính toán và tích hợp vào các phép tính lợi ích thông tin mờ, được làm rõ kỹ lưỡng. Các kết quả thực nghiệm rộng rãi và phân tích so sánh nghiêm ngặt được thực hiện để xác thực thực nghiệm độ chính xác vượt trội, tính mạnh mẽ được cải thiện và hiệu quả nâng cao của HAC4.5* so với các phiên bản trước đó và các phương pháp tiên tiến khác trong các kịch bản khai phá dữ liệu đa dạng. Tiến bộ đáng kể này đóng góp cơ bản vào việc phát triển các mô hình học máy hiệu quả và đáng tin cậy cao, cung cấp một công cụ mạnh mẽ để xử lý dữ liệu không chắc chắn và thúc đẩy tiến bộ trong các ứng dụng trí tuệ nhân tạo trong thế giới thực.
Tải xuống file đầy đủ để xem toàn bộ nội dung
Tải đầy đủ (120 trang)Trích đoạn nội dung luận án
Tải xuống để đọc toàn bộĐẠI HỌC HUẾ TRƢỜNG ĐẠI HỌC KHOA HỌC LÊ VĂN TƢỜNG LÂN PHÂN LỚP DỮ LIỆU BẰNG CÂY QUYẾT ĐỊNH MỜ DỰA TRÊN ĐẠI SỐ GIA TỬ CHUYÊN NGÀNH: KHOA HỌC MÁY TÍNH MÃ SỐ: 62.01 LUẬN ÁN TIẾN SĨ KHOA HỌC MÁY TÍNH Ngƣời hƣớng dẫn khoa học: 1. Nguyễn Mậu Hân 2. Nguyễn Công Hào HUẾ - NĂM 2018 Phân lớp dữ liệu bằng cây quyết định mờ dựa trên đại số gia tử LỜI CAM ĐOAN Tôi xin cam đoan đây là công trình nghiên cứu do tôi thực hiện, dưới sự hướng dẫn khoa học của PGS. Nguyễn Mậu Hân và TS.
Nguyễn Công Hào. Các số liệu và kết quả trình bày trong luận án là trung thực, chưa được công bố bởi bất kỳ tác giả nào hay ở bất kỳ công trình nào khác. ii Phân lớp dữ liệu bằng cây quyết định mờ dựa trên đại số gia tử LỜI CẢM ƠN Trong quá trình thực hiện đề tài “Phân lớp dữ liệu bằng cây quyết định mờ dựa trên đại số gia tử”, tôi đã nhận được rất nhiều sự giúp đỡ, tạo điều kiện của tập thể Ban giám hiệu, Phòng Đào tạo Sau đại học, Khoa Công nghệ thông tin và các phòng chức năng của Trường Đại học Khoa học, Đại học Huế. Tôi xin bày tỏ lòng cảm ơn chân thành về sự giúp đỡ quý báu đó.
Tôi xin được bày tỏ lòng biết ơn sâu sắc tới PGS. Nguyễn Mậu Hân và TS. Nguyễn Công Hào là những thầy giáo trực tiếp hướng dẫn và chỉ bảo cho tôi hoàn thành luận án. Tôi xin chân thành cảm ơn gia đình, bạn bè và đồng nghiệp đã động viên, khích lệ, tạo điều kiện và giúp đỡ tôi trong suốt quá trình thực hiện và hoàn thành luận án này.
TÁC GIẢ LUẬN ÁN Nghiên cứu sinh Lê Văn Tƣờng Lân iii Phân lớp dữ liệu bằng cây quyết định mờ dựa trên đại số gia tử MỤC LỤC Lời cam đoan .ii Lời cảm ơn. iii Danh mục các từ viết tắt .vii Danh mục các ký hiệu. viii Danh mục các bảng biểu. ix Danh mục các hình vẽ.
Cơ sở lý thuyết về đại số gia tử và tổng quan phân lớp dữ liệu bằng cây quyết định. Lý thuyết tập mờ .Tập mờ và thông tin không chắc chắn. Biến ngôn ngữ. Đại số gia tử.
Khái niệm đại số gia tử. Các hàm đo của đại số gia tử. Một số tính chất của các hàm đo. Khoảng mờ và các mối tương quan của khoảng mờ.
Phân lớp dữ liệu bằng cây quyết định. Bài toán phân lớp trong khai phá dữ liệu. Cây quyết định. Lợi ích thông tin và tỷ lệ lợi ích thông tin.
Vấn đề quá khớp trong mô hình cây quyết định. Phân lớp dữ liệu bằng cây quyết định mờ. Các hạn chế của phân lớp dữ liệu bằng cây quyết định rõ. Bài toán phân lớp dữ liệu bằng cây quyết định mờ.
29 iv Phân lớp dữ liệu bằng cây quyết định mờ dựa trên đại số gia tử 1. Một số vấn đề của bài toán phân lớp dữ liệu bằng cây quyết định mờ. Kết luận chương 1. Phân lớp dữ liệu bằng cây quyết định mờ theo phƣơng pháp đối sánh điểm mờ dựa trên đại số gia tử.
Phương pháp chọn tập mẫu huấn luyện đặc trưng cho bài toán học phân lớp dữ liệu bằng cây quyết định. Tính chất thuộc tính của tập mẫu huấn luyện đối với quá trình huấn luyện. Ảnh hưởng từ phụ thuộc hàm giữa các thuộc tính trong tập huấn luyện. Phân lớp dữ liệu bằng cây quyết định dựa trên ngưỡng miền trị thuộc tính.
Cơ sở của việc xác định ngưỡng cho quá trình học phân lớp. Thuật toán MixC4.5 dựa trên ngưỡng miền trị thuộc tính. Cài đặt thử nghiệm và đánh giá thuật toán MixC4. Phân lớp dữ liệu bằng cây quyết định mờ dựa trên đối sánh điểm mờ.
Xây dựng mô hình học phân lớp dữ liệu bằng cây quyết định mờ 53 2. Vấn đề với tập mẫu huấn luyện không thuần nhất. Một cách định lượng giá trị ngôn ngữ ngoại lai trong tập mẫu huấn luyện. Thuật toán học bằng cây quyết định mờ FMixC4.5 dựa trên đối sánh điểm mờ.
Cài đặt thử nghiệm và đánh giá thuật toán FMixC4. Kết luận Chương 2. Phƣơng pháp huấn luyện cây quyết định mờ cho bài toán phân lớp dữ liệu dựa trên đối sánh khoảng mờ. Phương pháp đối sánh giá trị khoảng trên thuộc tính mờ.
Xây dựng cách thức đối sánh giá trị khoảng dựa trên đại số gia tử70 v Phân lớp dữ liệu bằng cây quyết định mờ dựa trên đại số gia tử 3. Phương pháp định lượng khoảng mờ khi chưa biết miền trị MIN, MAX của các thuộc tính mờ. Phân lớp dữ liệu bằng cây quyết định mờ dựa trên cách thức đối sánh khoảng mờ. Thuật toán phân lớp dữ liệu bằng cây quyết định mờ HAC4.5 dựa trên đối sánh khoảng mờ.
Cài đặt thử nghiệm và đánh giá thuật toán HAC4. Xây dựng khái niệm khoảng mờ lớn nhất và phương pháp học nhằm tối ưu mô hình cây quyết định mờ. Phát biểu bài toán học phân lớp dữ liệu bằng cây quyết định mờ theo hướng đa mục tiêu. Khái niệm khoảng mờ lớn nhất và cách thức tính khoảng mờ lớn nhất cho các thuộc tính mờ.
Thuật toán phân lớp dữ liệu bằng cây quyết định mờ HAC4.5* theo cách tiếp cận khoảng mờ lớn nhất. Cài đặt thử nghiệm và đánh giá thuật toán HAC4. Kết luận chương 3. 98 Danh mục các công trình khoa học của tác giả liên quan đến luận án.
100 Tài liệu tham khảo. 101 vi Phân lớp dữ liệu bằng cây quyết định mờ dựa trên đại số gia tử DANH MỤC CÁC TỪ VIẾT TẮT Viết tắt Viết đầy đủ ĐSGT Đại số gia tử GĐ1 Giai đoạn 1 GĐ2 Giai đoạn 2 CART Classification and Regression Trees Dom Domain Gain Gain Information GainRatio Gain Information Ratio HA Hedge Algebra LDT Linguistic Decision Tree Sim Similar SplitInfo Split Information vii Phân lớp dữ liệu bằng cây quyết định mờ dựa trên đại số gia tử DANH MỤC CÁC KÝ HIỆU Ký hiệu Diễn giải ý nghĩa Ai Thuộc tính Ai D Tập mẫu huấn luyện 𝐷𝐴𝑖 Tập các giá trị kinh điển của Ai f Ánh xạ fh(S) Hàm đánh giá tính hiệu quả của cây fn(S) Hàm đánh giá tính đơn giản của cây Ik Tập tất cả các khoảng mờ mức k của các giá trị ngôn ngữ 𝐿𝐷𝐴𝑖 Tập các giá trị ngôn ngữ của Ai O(log n) Độ phức tạp logarit của thuật toán µA(v) Hàm định lượng của giá trị ngôn ngữ A (đo độ thuộc của v) S Cây quyết định sim(x, y) Mức độ gần nhau của x và y v Giá trị định lượng theo điểm của giá trị ngôn ngữ X Đại số gia tử Y Thuộc tính phân lớp viii Phân lớp dữ liệu bằng cây quyết định mờ dựa trên đại số gia tử DANH MỤC CÁC BẢNG BIỂU Bảng 2. Bảng dữ liệu DIEUTRA. Thông số thuộc tính tập huấn luyện chọn từ cơ sở dữ liệu Northwind.
Bảng so sánh kết quả huấn luyện của thuật toán MixC4.5 với 1000 mẫu trên cơ sở dữ liệu Northwind. Bảng so sánh kết quả huấn luyện của thuật toán MixC4.5 với 1500 mẫu trên cơ sở dữ liệu Northwind. Thông số thuộc tính tập huấn luyện từ cơ sở dữ liệu Mushroom. Bảng so sánh kết quả của thuật toán MixC4.5 với 5000 mẫu huấn luyện trên cơ sở dữ liệu có chứa thuộc tính mờ Mushroom.
Bảng dữ liệu DIEUTRA có thuộc tính Lương chứa dữ liệu rõ mà mờ. Bảng so sánh kết quả kiểm tra độ chính xác của thuật toán FMixC4.5 trên cơ sở dữ liệu có chứa thuộc tính mờ Mushroom. Bảng so sánh thời gian kiểm tra của thuật toán FMixC4.5 trên cơ sở dữ liệu có chứa thuộc tính mờ Mushroom. Tập mẫu huấn luyện chứa thuộc tính Lương không thuần nhất, chưa xác định Min-Max.
Bảng so sánh kết quả với 5000 mẫu huấn luyện của thuật toán C4.5 trên cơ sở dữ liệu có chứa thuộc tính mờ Mushroom. Thông số thuộc tính tập huấn luyện từ cơ sở dữ liệu Aldult. Bảng so sánh kết quả với 20000 mẫu huấn luyện của thuật toán C4.5 trên cơ sở dữ liệu có chứa thuộc tính mờ Adult 82 Bảng 3. Đối sách thời gian kiểm tra từ 1000 đến 5000 mẫu trên dữ liệu Adult.
Đối sánh kết quả huấn luyện trên dữ liệu Adult. Tỷ lệ kiểm tra của HAC4.5* trên dữ liệu Adult. Kết quả dự đoán trung bình của các thuật toán FMixC4.5* đối với các cách tiếp cận khác. 94 ix Phân lớp dữ liệu bằng cây quyết định mờ dựa trên đại số gia tử DANH MỤC CÁC HÌNH VẼ Hình 1.
Tính mờ của phần tử sinh lớn. Mối tương quan I(y) I(x). Mối tương quan của y được đối sánh theo x, khi I(y) I(x). Mối tương quan của y được đối sánh theo x1, khi I(y) I(x).
Minh họa hình học về chỉ số Gini. Vấn đề “quá khớp” trong cây quyết định. Điểm phân chia đa phân theo giá trị ngôn ngữ tại thuộc tính mờ. Điểm phân chia nhị phân theo giá trị ngôn ngữ hoặc giá trị số tại thuộc tính mờ, dựa trên phương pháp định lượng ngữ nghĩa theo điểm trong ĐSGT.
Cây quyết định được tạo từ tập mẫu huấn luyện M1. Cây quyết định không có hiệu quả được tạo từ tập huấn luyện M2. So sánh thời gian huấn luyện của MixC4.5 với các thuật toán khác. So sánh số nút trên cây kết quả của MixC4.5 với các thuật toán khác.
So sánh tỷ lệ đúng trên kết quả của MixC4.5 với các thuật toán khác. Mô hình cho quá trình học phân lớp mờ. Mô hình đề nghị cho việc học phân lớp bằng cây quyết định mờ. Cây quyết định kết quả “sai lệch” khi tập mẫu huấn luyện bị loại bỏ giá trị ngôn ngữ.
Tính mờ của thuộc tính Lương khi chưa xét các giá trị ngoại lai. So sánh thời gian huấn luyện với 5000 mẫu Mushroom của FMixC4.5 với các thuật toán khác. So sánh thời gian kiểm tra với 2000 mẫu Mushroom của FMixC4.5 với các thuật toán khác. So sánh tỷ lệ đúng trên cây kết quả của FMixC4.5 với các thuật toán khác.
So sánh thời gian huấn luyện trên mẫu 5000 mẫu của Mushroom. 81 x Phân lớp dữ liệu bằng cây quyết định mờ dựa trên đại số gia tử Hình 3. So sánh tỷ lệ kiểm tra từ 100 đến 2000 trên mẫu dữ liệu Mushroom. So sánh thời gian huấn luyện với 20000 mẫu của Adult.
So sánh tỷ lệ kiểm tra từ 1000 đến 5000 trên mẫu dữ liệu của Adult. So sánh thời gian kiểm tra từ 1000 đến 5000 trên dữ liệu Adult.
Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ
Trích dẫn luận án này
Lê Văn Tường Lân (2018). Phân lớp dữ liệu bằng cây quyết định mờ dựa trên đại số gia [Luận án tiến sĩ, Trường Đại học Khoa học, Đại học Huế]. LuanAn.net. https://luanan.net/tai-lieu-khac/phan-lop-du-lieu-bang-cay-quyet-dinh-mo-dua-tren-dai-so-gia-tu-luan-an-tien-si
Câu hỏi thường gặp
Luận án "Phân lớp dữ liệu bằng cây quyết định mờ dựa trên đại số gia" nghiên cứu về vấn đề gì?
Luận án: Phân lớp dữ liệu bằng cây quyết định mờ dựa trên đại số gia tử luận án tiến sĩ. Xem tóm tắt và tải về tại LuanAn.net
Luận án "Phân lớp dữ liệu bằng cây quyết định mờ dựa trên đại số gia" được bảo vệ tại trường nào?
Luận án này được bảo vệ tại Trường Đại học Khoa học, Đại học Huế. Năm bảo vệ: 2018.
Luận án "Phân lớp dữ liệu bằng cây quyết định mờ dựa trên đại số gia" thuộc chuyên ngành gì?
Luận án "Phân lớp dữ liệu bằng cây quyết định mờ dựa trên đại số gia" thuộc chuyên ngành Khoa học máy tính. Danh mục: Tài liệu khác.
Luận án "Phân lớp dữ liệu bằng cây quyết định mờ dựa trên đại số gia" có bao nhiêu trang?
Luận án "Phân lớp dữ liệu bằng cây quyết định mờ dựa trên đại số gia" có 120 trang. Bạn có thể xem trước một phần tài liệu ngay trên trang web trước khi tải về.
Cách tải luận án "Phân lớp dữ liệu bằng cây quyết định mờ dựa trên đại số gia" về máy như thế nào?
Để tải luận án về máy, bạn nhấn nút "Tải xuống ngay" trên trang này, sau đó hoàn tất thanh toán phí lưu trữ. File sẽ được tải xuống ngay sau khi thanh toán thành công. Hỗ trợ qua Zalo: 0559 297 239.