Nghiên cứu phát triển kỹ thuật phát hiện đạo văn và ứng dụng cho văn bản tiếng Việt - Luận án tiến sĩ toán học của Nguyễn Văn Sơn
Luận án tiến sĩ đề xuất kỹ thuật phát hiện đạo văn cho văn bản tiếng Việt, cải thiện độ chính xác 20% so baseline.
Luan An
Luận án tiến sĩ toán học
Năm xuất bản
Số trang
173
Thời gian đọc
26 phút
Lượt xem
1
Lượt tải
0
Phí lưu trữ
50 Point
Tổng quan nhanh
- Chủ đề:
- 1. Tổng quan phát hiện đạo văn: Kiến thức nền tảng & thách thức
- Số trang:
- 173 trang
- Trường:
- Viện Khoa học và Công nghệ Quân sự
- Chuyên ngành:
- Cơ sở toán học cho tin học
- Tác giả:
- Nguyễn Văn Sơn
- Năm:
- 2022
Tóm tắt nội dung luận án
I. Tổng quan phát hiện đạo văn Kiến thức nền tảng thách thức
Phát hiện đạo văn là vấn đề cấp thiết. Nó đảm bảo tính toàn vẹn học thuật và chất lượng nghiên cứu. Tài liệu này cung cấp cái nhìn tổng quan về các hình thức sao chép. Đồng thời, nó giới thiệu các kiến thức nền tảng cần thiết. Bao gồm các khía cạnh về xử lý ngôn ngữ tự nhiên tiếng Việt (NLP tiếng Việt). Luận án đề cập cơ sở lý thuyết về mô hình chủ đề LDA. Kỹ thuật luật kết hợp Apriori cũng được trình bày. Các mạng nơ ron hồi quy RNN và LSTM xếp chồng là công cụ chính. Phần này cũng tổng hợp các nghiên cứu chống đạo văn nổi bật trên thế giới. Các hướng tiếp cận trong nước cũng được xem xét. Mục tiêu là xác định những thách thức còn tồn tại. Từ đó, định hình các vấn đề luận án cần tập trung giải quyết. Đây là nền tảng quan trọng cho việc phát triển các thuật toán phát hiện đạo văn hiệu quả.
1.1. Các dạng sao chép và kiến thức cơ bản về NLP
Bài toán kiểm tra đạo văn bao gồm nhiều hình thức khác nhau. Sao chép trực tiếp, paraphrase, sao chép cấu trúc là những dạng phổ biến. Xử lý ngôn ngữ tự nhiên tiếng Việt là yếu tố then chốt. Luận án trình bày các kiến thức nền tảng về đặc trưng ngôn ngữ tiếng Việt. Việc này giúp xây dựng mô hình phát hiện đạo văn phù hợp. Các thuật toán cần hiểu ngữ nghĩa văn bản. Điều này cải thiện độ chính xác khi so sánh văn bản. Kiến thức vững chắc về NLP tiếng Việt hỗ trợ phát triển phần mềm phát hiện đạo văn. Đó là một phần quan trọng của giải pháp tổng thể.
1.2. Các tiếp cận phát hiện đạo văn trên thế giới trong nước
Nhiều nghiên cứu quốc tế đã phát triển các phương pháp chống đạo văn. Trích rút từ khóa và phát hiện đoạn sao chép là hai hướng tiếp cận chính. Luận án tổng hợp các tiến bộ trong lĩnh vực này. Các giải pháp trong nước cũng được phân tích. So sánh các phương pháp hiện có giúp xác định điểm mạnh và hạn chế. Việc này đặt ra yêu cầu cải tiến. Mục tiêu là phát triển các thuật toán phát hiện đạo văn hiệu quả hơn. Đặc biệt với đặc thù của văn bản tiếng Việt. Việc kiểm tra đạo văn cần được cải thiện liên tục.
1.3. Vấn đề trọng tâm cần giải quyết trong phát hiện đạo văn
Luận án tập trung giải quyết các thách thức cụ thể. Phát hiện đạo văn văn bản tiếng Việt còn gặp nhiều khó khăn. Thiếu kho ngữ liệu đủ lớn là một rào cản. Độ phức tạp của ngữ pháp tiếng Việt cũng là một vấn đề. Cần có thuật toán phát hiện đạo văn có độ chính xác cao. Khả năng phân tích ngữ nghĩa sâu là rất quan trọng. Mục tiêu là xây dựng các kỹ thuật mới. Những kỹ thuật này giúp cải thiện đáng kể hiệu quả chống đạo văn. Chúng sẽ tạo nền tảng cho phần mềm phát hiện đạo văn tiên tiến.
II. Kỹ thuật trích rút từ khóa Nâng cao độ chính xác
Trích rút từ khóa đóng vai trò quan trọng trong việc tìm kiếm tài liệu nguồn tiềm năng. Điều này giúp giảm thiểu không gian tìm kiếm trong bài toán phát hiện đạo văn. Chương này phát biểu chi tiết bài toán trích rút từ khóa. Một kỹ thuật mới được đề xuất. Nó dựa trên trích rút đặc trưng và mô hình mạng nơ ron truyền thẳng (FFNN). Mô hình học sâu này được thiết kế để nâng cao hiệu quả. Đồng thời, nó cải thiện độ chính xác trong việc xác định các từ khóa quan trọng. Các thử nghiệm đánh giá được thực hiện. Kết quả cho thấy sự cải thiện đáng kể. Kỹ thuật này góp phần vào một hệ thống kiểm tra đạo văn tổng thể.
2.1. Phát biểu bài toán trích rút từ khóa hỗ trợ kiểm tra đạo văn
Trích rút từ khóa là một bước tiền xử lý quan trọng. Nó giúp nhanh chóng xác định chủ đề chính của văn bản. Bài toán này được định nghĩa rõ ràng. Mục tiêu là tìm ra tập hợp các từ hoặc cụm từ đại diện. Chúng giúp xác định độ tương đồng văn bản ban đầu. Việc này đặc biệt hữu ích khi xử lý khối lượng dữ liệu lớn. Các từ khóa được trích xuất hiệu quả. Điều đó giúp thuật toán phát hiện đạo văn làm việc hiệu quả hơn. Nó tối ưu hóa quá trình khai phá dữ liệu tài liệu.
2.2. Mô hình học sâu FFNN cho trích rút từ khóa hiệu quả
Luận án đề xuất một mô hình trích rút từ khóa dựa trên FFNN. Mô hình này sử dụng các kỹ thuật trích rút đặc trưng tiên tiến. Nó học cách nhận diện các từ khóa có giá trị ngữ nghĩa cao. Các mạng nơ ron truyền thẳng có khả năng xử lý dữ liệu phức tạp. Điều này giúp cải thiện đáng kể độ chính xác của từ khóa được trích xuất. Đây là bước tiến quan trọng. Nó hỗ trợ các hệ thống chống đạo văn thông minh hơn. Mô hình này là một phần của giải pháp NLP tiếng Việt toàn diện.
2.3. Đánh giá thực nghiệm hiệu năng trích rút từ khóa
Hiệu quả của mô hình FFNN được đánh giá kỹ lưỡng. Các thử nghiệm thực hiện trên bộ dữ liệu kiểm tra. Kết quả cho thấy mô hình hoạt động vượt trội. Nó có khả năng trích rút từ khóa chính xác. So sánh với các phương pháp truyền thống, hiệu suất được nâng cao rõ rệt. Đánh giá này khẳng định tính khả thi của kỹ thuật mới. Nó đóng góp vào việc phát triển phần mềm phát hiện đạo văn chất lượng cao.
III. Phát hiện đạo văn đoạn Mô hình học máy tiên tiến
Phát hiện đạo văn đoạn là một thách thức lớn. Nó đòi hỏi khả năng phân tích ngữ nghĩa sâu. Chương này tập trung vào việc phát triển các mô hình học máy tiên tiến. Mục tiêu là xác định các đoạn văn bản bị sao chép giữa hai tài liệu. Luận án đề xuất hai hướng tiếp cận chính. Thứ nhất là mô hình chủ đề, có khả năng phân tích ngữ nghĩa. Thứ hai là kỹ thuật trích rút đặc trưng kết hợp với mô hình LSTM xếp chồng. Các mô hình này được thiết kế để giải quyết sự phức tạp của việc so sánh văn bản. Đặc biệt, chúng có thể phát hiện các trường hợp đạo văn tinh vi. Các thử nghiệm được thực hiện trên kho ngữ liệu PAN, một tiêu chuẩn quốc tế.
3.1. Các mô hình chủ đề và so sánh ngữ nghĩa văn bản
Mô hình chủ đề được ứng dụng để phát hiện đạo văn đoạn. Các mô hình này phân tích ngữ nghĩa tiềm ẩn của văn bản. Chúng xác định các chủ đề chung giữa các đoạn văn. Việc này giúp đánh giá độ tương đồng văn bản ở mức cao hơn. Phương pháp này có thể phát hiện các trường hợp đạo văn có sửa đổi nhẹ. Nó vượt qua giới hạn của các phương pháp so khớp chuỗi truyền thống. Giải pháp này cải thiện độ chính xác trong kiểm tra đạo văn.
3.2. Kỹ thuật trích rút đặc trưng LSTM xếp chồng cải tiến
Luận án giới thiệu kỹ thuật trích rút đặc trưng mới. Kỹ thuật này được kết hợp với mô hình LSTM xếp chồng. LSTM (Long Short-Term Memory) rất phù hợp cho dữ liệu chuỗi. Nó có khả năng ghi nhớ thông tin dài hạn trong văn bản. Mô hình này giúp phát hiện các mối quan hệ ngữ nghĩa phức tạp. Điều này cần thiết cho việc xác định đoạn sao chép chính xác. Mô hình đề xuất hoạt động ở cả cấp độ đoạn và cấp độ từ. Nó nâng cao khả năng phân tích ngữ nghĩa trong thuật toán phát hiện đạo văn.
3.3. Thử nghiệm đánh giá hiệu quả trên bộ dữ liệu PAN
Các mô hình đề xuất được đánh giá trên kho ngữ liệu PAN. Đây là một bộ dữ liệu chuẩn quốc tế cho phát hiện đạo văn. Kết quả thử nghiệm cho thấy hiệu quả vượt trội. Các mô hình học máy đạt được độ chính xác cao. Chúng có khả năng phát hiện đạo văn đoạn tốt hơn các phương pháp hiện có. Đánh giá này khẳng định tính hiệu quả của các kỹ thuật. Chúng góp phần cải thiện phần mềm phát hiện đạo văn. Điều này mở ra hướng phát triển mới cho việc chống đạo văn.
IV. Phát triển kho ngữ liệu Nâng cấp phát hiện đạo văn tiếng Việt
Việc thiếu kho ngữ liệu chất lượng cao là một rào cản lớn. Đặc biệt đối với phát hiện đạo văn văn bản tiếng Việt. Chương này tập trung vào việc xây dựng một kho ngữ liệu chuyên biệt. Kho ngữ liệu này được thiết kế đặc biệt cho bài toán phát hiện đoạn sao chép tiếng Việt. Luận án đề xuất một giải pháp xây dựng kho ngữ liệu. Giải pháp này đảm bảo tính đa dạng và độ tin cậy của dữ liệu. Nó bao gồm cả văn bản gốc và văn bản bị sao chép. Sau đó, luận án đánh giá chất lượng của kho ngữ liệu. Việc này cung cấp một nguồn tài nguyên quý giá. Nó là nền tảng để đào tạo và kiểm thử các thuật toán phát hiện đạo văn tiếng Việt. Sự phát triển này rất quan trọng cho NLP tiếng Việt.
4.1. Giải pháp xây dựng kho ngữ liệu đạo văn văn bản tiếng Việt
Luận án trình bày chi tiết quy trình xây dựng kho ngữ liệu. Kho ngữ liệu này dành riêng cho phát hiện đạo văn tiếng Việt. Các bước thu thập, tiền xử lý và gắn nhãn dữ liệu được mô tả. Mục tiêu là tạo ra một tập dữ liệu lớn và đa dạng. Nó phản ánh đúng các dạng sao chép thực tế. Kho ngữ liệu này giúp cải thiện độ tin cậy của việc kiểm tra đạo văn. Đây là một đóng góp quan trọng cho nghiên cứu NLP tiếng Việt.
4.2. Đánh giá chất lượng và tiềm năng của kho ngữ liệu mới
Kho ngữ liệu mới được đánh giá kỹ lưỡng về chất lượng. Các tiêu chí như độ bao phủ, tính cân bằng và độ chính xác của nhãn được xem xét. Kết quả đánh giá cho thấy kho ngữ liệu có tiềm năng lớn. Nó có thể trở thành một chuẩn mực cho cộng đồng nghiên cứu. Việc này thúc đẩy sự phát triển của các thuật toán phát hiện đạo văn. Đặc biệt, nó hỗ trợ phát triển phần mềm phát hiện đạo văn cho tiếng Việt.
4.3. Từ khóa TF IDF học sâu trong xử lý văn bản tiếng Việt
Kỹ thuật trích rút từ khóa được cải tiến cho văn bản tiếng Việt. Phương pháp TF-IDF được điều chỉnh để phù hợp với đặc thù ngôn ngữ. Ngoài ra, mô hình học sâu cũng được áp dụng. Điều này giúp tăng cường khả năng trích rút từ khóa chính xác. Việc cải tiến này đóng góp vào hiệu quả của giai đoạn tìm kiếm tài liệu ứng cử. Nó là một phần không thể thiếu trong hệ thống chống đạo văn toàn diện. Đây cũng là một bước tiến trong khai phá dữ liệu tiếng Việt.
V. Ứng dụng kỹ thuật tiên tiến Phát hiện đạo văn tiếng Việt hiệu quả
Chương cuối cùng của luận án tập trung vào việc ứng dụng thực tiễn các kỹ thuật đã phát triển. Các mô hình chủ đề và kỹ thuật trích rút đặc trưng kết hợp LSTM xếp chồng được tinh chỉnh. Mục tiêu là tối ưu hóa hiệu suất cho văn bản tiếng Việt. Luận án trình bày các cải tiến cụ thể. Những cải tiến này giúp tăng cường độ chính xác khi phát hiện đoạn sao chép. Đồng thời, chúng giải quyết các thách thức đặc thù của ngôn ngữ. Kết quả đạt được minh chứng cho tiềm năng của các phương pháp đề xuất. Chúng có thể được tích hợp vào các phần mềm phát hiện đạo văn. Việc này góp phần bảo vệ quyền sở hữu trí tuệ. Nó thúc đẩy môi trường học thuật trung thực ở Việt Nam.
5.1. Cải tiến mô hình chủ đề cho phát hiện đoạn đạo văn tiếng Việt
Mô hình chủ đề được điều chỉnh và cải tiến. Mục tiêu là tăng cường hiệu quả cho văn bản tiếng Việt. Các đặc điểm ngữ pháp và từ vựng tiếng Việt được xem xét. Việc này giúp mô hình phân tích ngữ nghĩa sâu hơn. Khả năng phát hiện đạo văn đoạn bị paraphrasing được nâng cao. Đây là một bước tiến quan trọng. Nó giúp nâng cao chất lượng của việc kiểm tra đạo văn. Các thuật toán phát hiện đạo văn trở nên thông minh hơn.
5.2. Nâng cấp trích rút đặc trưng LSTM cho tiếng Việt
Kỹ thuật trích rút đặc trưng và mô hình LSTM xếp chồng được tối ưu hóa. Chúng được tinh chỉnh đặc biệt cho ngôn ngữ tiếng Việt. Các cải tiến bao gồm xử lý từ vựng, ngữ pháp, và cấu trúc câu. Điều này giúp mô hình hiểu rõ hơn về ngữ cảnh tiếng Việt. Kết quả là độ chính xác của việc phát hiện đạo văn được cải thiện đáng kể. Đặc biệt là đối với các đoạn văn bản có độ tương đồng ngữ nghĩa cao. Phương pháp này góp phần vào việc chống đạo văn hiệu quả.
5.3. Tiềm năng phát triển phần mềm chống đạo văn tiếng Việt
Các kỹ thuật và mô hình được nghiên cứu có tiềm năng lớn. Chúng có thể được tích hợp vào các hệ thống và phần mềm phát hiện đạo văn. Luận án mở ra hướng phát triển cho các công cụ chống đạo văn mạnh mẽ. Điều này đặc biệt quan trọng trong môi trường giáo dục và nghiên cứu ở Việt Nam. Việc này thúc đẩy sự minh bạch. Nó hỗ trợ bảo vệ bản quyền. Đồng thời, nó nâng cao chất lượng học thuật bằng cách ngăn chặn đạo văn. Đây là một ứng dụng thiết thực của NLP tiếng Việt.
Mục lục chi tiết luận án
Tải xuống file đầy đủ để xem toàn bộ nội dung
Tải đầy đủ (173 trang)Trích đoạn nội dung luận án
Tải xuống để đọc toàn bộBỘ GIÁO DỤC VÀ ĐÀO TẠO BỘ QUỐC PHÒNG VIỆN KHOA HỌC VÀ CÔNG NGHỆ QUÂN SỰ NGUYỄN VĂN SƠN NGHIÊN CỨU PHÁT TRIỂN MỘT SỐ KỸ THUẬT HỖ TRỢ PHÁT HIỆN ĐẠO VĂN VÀ ỨNG DỤNG CHO VĂN BẢN TIẾNG VIỆT LUẬN ÁN TIẾN SĨ TOÁN HỌC Hà Nội - 2022 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com BỘ GIÁO DỤC VÀ ĐÀO TẠO BỘ QUỐC PHÒNG VIỆN KHOA HỌC VÀ CÔNG NGHỆ QUÂN SỰ NGUYỄN VĂN SƠN NGHIÊN CỨU PHÁT TRIỂN MỘT SỐ KỸ THUẬT HỖ TRỢ PHÁT HIỆN ĐẠO VĂN VÀ ỨNG DỤNG CHO VĂN BẢN TIẾNG VIỆT Chuyên ngành: Cơ sở toán học cho tin học Mã số: 9 46 01 10 LUẬN ÁN TIẾN SĨ TOÁN HỌC NGƯỜI HƯỚNG DẪN KHOA HỌC: 1.TS Lê Thanh Hương 2. Nguyễn Chí Thành Hà Nội - 2022 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com i LỜI CAM ĐOAN Tôi xin cam đoan, đây là công trình nghiên cứu của riêng tôi. Những nội dung, số liệu và kết quả trình bày trong luận án là hoàn toàn trung thực và chưa có tác giả nào công bố trong bất cứ một công trình nào khác. Các tài liệu tham khảo được trích dẫn đầy đủ.
Hà Nội, ngày 12 tháng 01 năm 2022 Tác giả Nguyễn Văn Sơn LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com ii LỜI CẢM ƠN Luận án này được thực hiện tại Viện Công nghệ thông tin, Viện Khoa học và Công nghệ quân sự-Bộ Quốc phòng. Lời đầu tiên, NCS xin bày tỏ lòng biết ơn sâu sắc tới PGS.TS Lê Thanh Hương, TS. Nguyễn Chí Thành đã tận tình giúp đỡ, trang bị cho NCS phương pháp nghiên cứu, kinh nghiệm, kiến thức khoa học để hoàn thành các nội dung luận án. NCS xin chân thành cảm ơn Thủ trưởng Viện KH-CN quân sự, Phòng Đào tạo, Viện Công nghệ thông tin là cơ sở đào tạo và đơn vị quản lý đã tạo mọi điều kiện, hỗ trợ, giúp đỡ NCS trong quá trình học tập, nghiên cứu.
NCS xin bày tỏ lòng biết ơn chân thành tới các thầy cô của Viện KH-CN quân sự, các nhà khoa học trong và ngoài quân đội đã giảng dạy, truyền đạt kiến thức và giúp đỡ về chuyên môn trong quá trình học tập, nghiên cứu của NCS. NCS luôn ghi nhớ công ơn của bố mẹ, gia đình và xin dành lời cảm ơn đặc biệt tới vợ con, những người đã luôn ở bên cạnh, động viên và là chỗ dựa về mọi mặt giúp NCS vượt qua khó khăn để hoàn thành công việc. NCS xin chân thành cảm ơn bạn bè, đồng nghiệp và rất nhiều người đã luôn động viên, chia sẻ, giúp đỡ NCS trong suốt thời gian qua. Tác giả Nguyễn Văn Sơn LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com iii MỤC LỤC Trang DANH MỤC CÁC KÝ HIỆU, CHỮ VIẾT TẮT.
v DANH MỤC CÁC BẢNG. vi DANH MỤC CÁC HÌNH VẼ. vii MỞ ĐẦU. 1 CHƯƠNG 1 TỔNG QUAN VỀ BÀI TOÁN PHÁT HIỆN SAO CHÉP .2 Các hình thức sao chép.
Các kiến thức nền tảng .1 Một số kiến thức nền tảng về ngôn ngữ tiếng Việt .2 Cơ sở lý thuyết về thuật toán LDA .3 Giới thiệu luật kết hợp và thuật toán Apriori .4 Giới thiệu mạng nơ ron hồi quy RNN .5 Giới thiệu mạng LSTM xếp chồng .3 Các nghiên cứu về phát hiện sao chép trên thế giới.1 Trích rút từ khóa .2 Phát hiện đoạn sao chép .4 Các hướng tiếp cận phát hiện sao chép trong nước .5 Kho ngữ liệu và phương pháp đánh giá .1 Kho ngữ liệu thử nghiệm .2 Phương pháp đánh giá .6 Những vấn đề luận án cần tập trung nghiên cứu giải quyết .7 Kết luận Chương 1. 42 CHƯƠNG 2 TRÍCH RÚT TỪ KHÓA DỰA TRÊN MÔ HÌNH HỌC SÂU .2 Phát biểu bài toán tìm tập tài liệu ứng cử và bài toán trích rút từ khóa .4 Trích rút từ khóa dựa trên kỹ thuật trích rút đặc trưng và mô hình mạng FFNN .1 Nội dung đề xuất .2 Đánh giá thử nghiệm .5 Kết luận Chương 2. 61 CHƯƠNG 3 PHÁT HIỆN ĐOẠN SAO CHÉP GIỮA HAI TÀI LIỆU DỰA TRÊN CÁC MÔ HÌNH HỌC MÁY .2 Phát biểu bài toán phát hiện đoạn sao chép .4 Mô hình chủ đề cho bài toán phát hiện đoạn sao chép .1 Đề xuất giải pháp. 65 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.2 Đánh giá thử nghiệm trên kho ngữ liệu PAN .5 Kỹ thuật trích rút đặc trưng và mô hình LSTM xếp chồng cho bài toán phát hiện đoạn sao chép .1 Mô hình đề xuất pha đoạn và pha từ .2 Đánh giá thử nghiệm trên kho ngữ liệu PAN.
Kết luận Chương 3. 95 CHƯƠNG 4 ỨNG DỤNG CÁC KỸ THUẬT PHÁT HIỆN SAO CHÉP CHO VĂN BẢN TIẾNG VIỆT .2 Xây dựng kho ngữ liệu phát hiện đoạn sao chép tiếng Việt .2 Đề xuất giải pháp xây dựng kho ngữ liệu phát hiện đoạn sao chép văn bản tiếng Việt .3 Kết quả, đánh giá kho ngữ liệu .3 Trích rút từ khóa cho văn bản tiếng Việt .1 Trích rút từ khóa dựa trên độ đo TF-IDF cho văn bản dài tiếng Việt .2 Cải tiến kỹ thuật trích rút từ khóa dựa trên mô hình học sâu cho văn bản tiếng Việt .4 Ứng dụng kỹ thuật phát hiện đoạn sao chép cho văn bản tiếng Việt .1 Cải tiến mô hình chủ đề cho bài toán phát hiện đoạn sao chép văn bản tiếng Việt .2 Cải tiến kỹ thuật trích rút đặc trưng và mô hình LSTM xếp chồng cho bài toán phát hiện đoạn sao chép văn bản tiếng Việt .5 Kết luận Chương 4. 123 DANH MỤC CÁC CÔNG TRÌNH KHOA HỌC ĐÃ CÔNG BỐ. 125 TÀI LIỆU THAM KHẢO.
137 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com v DANH MỤC CÁC KÝ HIỆU, CHỮ VIẾT TẮT ADAM Thuật toán tối ưu mạng nơ ron (Adaptive Moment Estimation) ANN Mạng nơ ron nhân tạo (Artificial Neural Network) BPTT Thuật toán lan truyền ngược liên hồi (Backpropagation Through Time) CNG Chuỗi liên tiếp gồm N ký tự (Character-based N-Gram) CNN Mạng nơ ron tích chập (Convolutional Neural Network) CSDL Cơ sở dữ liệu ĐATN Đồ án tốt nghiệp IDF Nghịch đảo tần suất của một từ trong một tập văn bản (Inverse Document Frequency) FFNN Mạng nơ ron truyền thẳng (Feed-forward Neural Network) FSE Thư viện trên ngôn ngữ Python để tính véc tơ câu (Fast Sentence Embeddings) GCNN Mô hình mạng nơ ron đồ thị (Graph Convolutional Neural Network) LDA Mô hình phân phối Dirichlet ẩn (Latent Dirichlet Allocation) LSA Phân tích ngữ nghĩa tiềm ẩn (Latent Semantic Analysis) LSTM Mạng bộ nhớ dài – ngắn (Long Short Term Memory Network) NCS Nghiên cứu sinh PAN Chuỗi sự kiện thường niên về đạo văn (Plagiarism Analysis, Authorship Identification, and Near Duplicate Detection) PHSC Phát hiện sao chép POS Gán nhãn từ loại (Part of Speech Tagging) RNN Mạng nơ ron hồi quy (Recurrent Neural Network) SVM Máy vector hỗ trợ (Support Vector Machine) TF Tần suất xuất hiện của một từ trong một văn bản (Term Frequency) XML Ngôn ngữ đánh dấu mở rộng (eXtensible Markup Language) XLNNTN Xử lý ngôn ngữ tự nhiên WNG Chuỗi liên tiếp gồm N từ (Word-based N-Gram) LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com vi DANH MỤC CÁC BẢNG Trang Bảng 1. Kết quả kiểm tra trùng lặp từ hệ thống Coopy. Ví dụ 10 kết quả đầu ra của mô hình đề xuất. Giá trị F-score trích rút 10 từ khóa.
So sánh với các kết quả nghiên cứu gần đây. Kết quả thử nghiệm. Kết quả đã công bố của Sanchez-Perez. Kết quả mã hóa đoạn.
Sự phụ thuộc giá trị k vào độ dài đoạn sao chép. Kết quả thử nghiệm. So sánh kết quả với các nghiên cứu gần đây. Bảng thông tin dữ liệu thu thập.
Bảng phân bố độ dài đoạn sao chép. Mô tả dữ liệu từ đồng nghĩa. Thống kê kho ngữ liệu phát hiện đoạn sao chép tiếng Việt. Tóm tắt thông tin kho ngữ liệu ĐATN.
Kết quả thử nghiệm kho ngữ liệu ĐATN. Tóm tắt thông tin kho ngữ liệu trích rút từ khóa tiếng Việt. Kết quả thử nghiệm với kho ngữ liệu bài báo tiếng Việt. Kết quả thử nghiệm với thuật toán YAKE!.
Kết quả thử nghiệm với kho ngữ liệu tiếng Việt. Kết quả thử nghiệm của tác giả Sanchez-Perez. Kết quả thử nghiệm với kho ngữ liệu tiếng Việt. 121 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com vii DANH MỤC CÁC HÌNH VẼ Trang Hình 1.
Các hình thức sao chép. Mô hình thuật toán LDA. Mô hình mạng RNN. Sơ đồ biểu diễn kiến trúc bên trong của một tế bào LSTM.
Kiến trúc mô hình LSTM xếp chồng. Phân loại các tiếp cận phát hiện sao chép. Mô hình phát hiện sao chép toàn cục. Mối quan hệ giữa S và D.
Mô hình hệ thống phát hiện sao chép. Mô hình tổng quát của bài toán tìm tập tài liệu ứng cử. Quy trình tổng quan hệ thống trích rút từ khóa. Mô hình trích rút từ khóa dựa trên mô hình FFNN.
Mô hình trích rút từ khóa dựa trên mô hình LSTM. Lược đồ quan hệ giữa độ chính xác và số lần lặp. Lược đồ quan hệ giữa độ mất mát và số lần lặp. Quy trình phát hiện đoạn sao chép dựa trên mô hình chủ đề.
Quy trình phát hiện đoạn sao chép. Mô hình phát hiện sao chép mức đoạn. Mô hình phát hiện sao chép mức từ .5 Đoạn kết quả nằm ngoài đoạn văn bản sao chép .6 Đoạn kết quả nằm trong đoạn văn bản sao chép .7 Đoạn kết quả nằm trong một phần đoạn văn bản sao chép. Sự ảnh hưởng của các đặc trưng đến kết quả phát hiện sao chép.
Mô hình tạo trường hợp sao chép nguyên văn. 103 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com viii Hình 4. Mô hình tạo trường hợp sao chép thay thế từ đồng nghĩa .3 Mô hình tạo trường hợp sao chép dịch tự động. Mô hình trích rút từ khóa.
108 LUAN VAN CHAT LUONG download : add luanvanchat@agmail.com 1 MỞ ĐẦU 1. Tính cấp thiết của đề tài luận án Sự phát triển công nghệ thông tin và sự ra đời của Internet đã tạo ra một khối lượng tài liệu số khổng lồ. Để thu thập thông tin về một chủ đề nào đó chúng ta chỉ cần sử dụng một số công cụ tìm kiếm phổ biến như Google hoặc các ứng dụng tra cứu trên Internet là có thể có tìm được rất nhiều tài liệu liên quan. Chính vì thế, chúng ta có thể dễ dàng sử dụng lại thông tin thông qua các hình thức sao chép hoặc mượn ý tưởng từ các tài liệu thu thập.
Việc sử dụng lại thông tin từ các tài liệu khác mà không có trích dẫn đến tài liệu đó được xem là đạo văn. Hiện nay, tình trạng đạo văn trên thế giới và tại Việt Nam diễn ra hết sức phức tạp.
Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ
Trích dẫn luận án này
Nguyễn Văn Sơn (2022). Luận án tiến sĩ kỹ thuật phát hiện đạo văn văn bản tiếng Việt [Luận án tiến sĩ, Viện Khoa học và Công nghệ quân sự]. LuanAn.net. https://luanan.net/cong-nghe-thong-tin/he-thong-thong-tin/luan-an-tien-si-ky-thuat-phat-hien-dao-van-van-ban-tieng-viet
Câu hỏi thường gặp
Luận án "Luận án tiến sĩ kỹ thuật phát hiện đạo văn văn bản tiếng Việt" nghiên cứu về vấn đề gì?
Luận án tiến sĩ đề xuất kỹ thuật phát hiện đạo văn cho văn bản tiếng Việt, cải thiện độ chính xác 20% so baseline.
Luận án "Luận án tiến sĩ kỹ thuật phát hiện đạo văn văn bản tiếng Việt" được bảo vệ tại trường nào?
Luận án này được bảo vệ tại Viện Khoa học và Công nghệ quân sự. Năm bảo vệ: 2022.
Luận án "Luận án tiến sĩ kỹ thuật phát hiện đạo văn văn bản tiếng Việt" thuộc chuyên ngành gì?
Luận án "Luận án tiến sĩ kỹ thuật phát hiện đạo văn văn bản tiếng Việt" thuộc chuyên ngành Cơ sở toán học cho tin học. Danh mục: Hệ Thống Thông Tin.
Luận án "Luận án tiến sĩ kỹ thuật phát hiện đạo văn văn bản tiếng Việt" có bao nhiêu trang?
Luận án "Luận án tiến sĩ kỹ thuật phát hiện đạo văn văn bản tiếng Việt" có 173 trang. Bạn có thể xem trước một phần tài liệu ngay trên trang web trước khi tải về.
Cách tải luận án "Luận án tiến sĩ kỹ thuật phát hiện đạo văn văn bản tiếng Việt" về máy như thế nào?
Để tải luận án về máy, bạn nhấn nút "Tải xuống ngay" trên trang này, sau đó hoàn tất thanh toán phí lưu trữ. File sẽ được tải xuống ngay sau khi thanh toán thành công. Hỗ trợ qua Zalo: 0559 297 239.