Luận án tiến sĩ công nghệ thông tin nghiên cứu nhận dạng thực thể có tên và thực
Luận án: Luận án tiến sĩ công nghệ thông tin nghiên cứu nhận dạng thực thể có tên và thực thể biểu hiện trong văn bản và ứng dụng. Xem tóm tắt và tải về tại Lua
Năm xuất bản
Số trang
138
Thời gian đọc
21 phút
Lượt xem
0
Lượt tải
0
Phí lưu trữ
40 Point
Tổng quan nhanh
- Chủ đề:
- Tổng quan Nghiên cứu Nhận dạng Thực thể và Ứng dụng
- Số trang:
- 138 trang
- Trường:
- Trường Đại học Công nghệ, Đại học Quốc gia Hà Nội
- Chuyên ngành:
- Hệ thống thông tin
- Tác giả:
- Trần Mai Vũ
- Năm:
- 2018
Tóm tắt nội dung luận án
I.Tổng quan Nghiên cứu Nhận dạng Thực thể và Ứng dụng
Nghiên cứu công nghệ thông tin này tập trung vào bài toán Nhận dạng Thực thể (Named Entity Recognition - NER) và các thực thể biểu hiện trong văn bản. Luận án tiến sĩ CNTT này trình bày các khái niệm cơ bản về nhận dạng thực thể. Nhận dạng thực thể là một nhiệm vụ cốt lõi trong Xử lý ngôn ngữ tự nhiên (NLP). Nó giúp Trích xuất thông tin quan trọng từ văn bản. Nhiệm vụ này bao gồm việc xác định và phân loại các thực thể có tên như người, địa điểm, tổ chức, ngày tháng, và các thực thể biểu hiện khác.
Nghiên cứu chỉ ra những thách thức đáng kể trong việc phát triển các hệ thống nhận dạng thực thể hiệu quả. Các thách thức bao gồm sự phức tạp của ngôn ngữ tự nhiên, sự mơ hồ trong ngữ cảnh và sự đa dạng của các loại thực thể. Đặc biệt, việc xử lý văn bản tiếng Việt và văn bản y sinh tiếng Anh đặt ra những rào cản riêng biệt. Văn bản y sinh thường chứa thuật ngữ chuyên ngành phức tạp và cấu trúc câu đặc thù. Nhận dạng thực thể có ứng dụng rộng rãi trong nhiều lĩnh vực. Chúng bao gồm tìm kiếm thông tin, phân tích dữ liệu lớn, dịch máy và hệ thống hỏi đáp tự động. Các phương pháp Học máy (Machine Learning) và Học sâu (Deep Learning) đóng vai trò then chốt trong việc giải quyết các bài toán này. Luận án đặt nền móng cho việc hiểu rõ các kỹ thuật tiên tiến trong Trí tuệ nhân tạo (AI) áp dụng cho nhận dạng thực thể.
1.1. Định nghĩa và Thách thức trong Nhận dạng Thực thể
Nhận dạng thực thể là quá trình xác định và phân loại các đoạn văn bản thành các danh mục được định nghĩa trước. Các danh mục thường là tên người, tên tổ chức, địa điểm, biểu hiện bệnh lý. Thách thức lớn nằm ở việc xử lý sự đa dạng ngôn ngữ. Sự thay đổi ngữ cảnh cũng gây khó khăn. Dữ liệu huấn luyện thường thiếu hoặc không đồng nhất. Điều này đòi hỏi các giải pháp Học máy và Học sâu mạnh mẽ.
1.2. Ứng dụng rộng rãi của Nhận dạng Thực thể
Nhận dạng thực thể là nền tảng cho nhiều ứng dụng Xử lý ngôn ngữ tự nhiên. Nó hỗ trợ Trích xuất thông tin tự động từ các tài liệu lớn. Phân tích văn bản hiệu quả dựa vào khả năng nhận diện thực thể. Trong lĩnh vực Trí tuệ nhân tạo, NER cải thiện hiệu suất của các hệ thống hỏi đáp. Nó cũng nâng cao chất lượng tìm kiếm thông tin chuyên ngành.
1.3. Bối cảnh Nhận dạng Thực thể tiếng Việt và Y sinh
Nhận dạng thực thể trong tiếng Việt gặp khó khăn do thiếu tài nguyên. Tiếng Việt có cấu trúc ngữ pháp phức tạp. Trong miền y sinh, văn bản chứa nhiều thuật ngữ chuyên môn. Các tên bệnh, thuốc, triệu chứng đòi hỏi sự chính xác cao. Việc xử lý dữ liệu y sinh yêu cầu các mô hình nhận dạng thực thể tiên tiến. Điều này giúp nâng cao hiệu quả Phân tích văn bản y tế.
II.Nhận dạng Thực thể Tên người và Thuộc tính Tiếng Việt
Nghiên cứu này trình bày các phương pháp nhận dạng thực thể tên người và các thuộc tính liên quan trong văn bản tiếng Việt. Đây là một phần quan trọng của Xử lý ngôn ngữ tự nhiên (NLP) cho tiếng Việt. Luận án đề xuất một mô hình kết hợp hiệu quả để giải quyết bài toán này. Mô hình sử dụng các kỹ thuật Học máy tiên tiến. Cụ thể, mô hình Entropy cực đại giải mã bằng tìm kiếm chùm (MEM+BS) và Trường ngẫu nhiên có điều kiện (CRF) được áp dụng. Những phương pháp này được tinh chỉnh để phù hợp với đặc thù của ngôn ngữ tiếng Việt.
Việc nhận dạng tên người trong tiếng Việt gặp phải nhiều thách thức riêng. Chúng bao gồm sự đa dạng trong cách viết, vấn đề phân định ranh giới từ và sự thiếu hụt các bộ dữ liệu huấn luyện lớn. Nghiên cứu đã xây dựng và sử dụng các tập đặc trưng phong phú. Các đặc trưng này bao gồm đặc trưng từ vựng, hình thái và cú pháp. Chúng giúp mô hình cải thiện đáng kể khả năng nhận diện. Kết quả thực nghiệm cho thấy hiệu quả vượt trội của mô hình đề xuất. Mô hình không chỉ nhận dạng chính xác tên người mà còn xác định các thuộc tính đi kèm. Những thuộc tính này cung cấp thông tin ngữ cảnh quan trọng. Ứng dụng thực tiễn của mô hình được minh họa thông qua việc tích hợp vào một hệ thống hỏi đáp tên người tiếng Việt. Điều này chứng minh tiềm năng của công nghệ Trí tuệ nhân tạo (AI) trong việc giải quyết các bài toán ngôn ngữ cụ thể.
2.1. Mô hình Học máy cho Nhận dạng Tên người
Nghiên cứu phát triển các mô hình Học máy cho nhận dạng tên người. Các kỹ thuật như MEM+BS và CRF được điều chỉnh. Chúng xử lý hiệu quả các thách thức của tiếng Việt. Mô hình tận dụng các đặc trưng ngôn ngữ. Điều này giúp tăng cường độ chính xác trong Nhận dạng thực thể có tên.
2.2. Đặc trưng ngôn ngữ và Dữ liệu tiếng Việt
Luận án tập trung vào việc xây dựng tập đặc trưng. Các đặc trưng từ vựng, hình thái và cú pháp được sử dụng. Điều này giúp mô hình hiểu rõ hơn cấu trúc tiếng Việt. Việc xử lý dữ liệu tiếng Việt còn bao gồm việc tạo ra các bộ dữ liệu đánh giá chất lượng cao. Chúng hỗ trợ việc huấn luyện và kiểm định mô hình Nhận dạng thực thể.
2.3. Ứng dụng vào Hệ thống Hỏi đáp Tự động
Mô hình nhận dạng tên người được tích hợp vào một hệ thống hỏi đáp. Hệ thống này có khả năng trả lời các câu hỏi liên quan đến thực thể tên người. Đây là một ứng dụng thực tiễn của Trí tuệ nhân tạo và Xử lý ngôn ngữ tự nhiên. Ứng dụng này minh họa giá trị của Nhận dạng thực thể trong việc cải thiện tương tác người-máy.
III.Nhận dạng Thực thể Y Sinh Tiếng Anh Thực thể Biểu hiện
Luận án tiếp tục mở rộng nghiên cứu sang Nhận dạng Thực thể trong miền y sinh tiếng Anh. Trọng tâm là nhận dạng các thực thể biểu hiện và các thực thể liên quan. Đây là một lĩnh vực quan trọng trong Xử lý ngôn ngữ tự nhiên (NLP) y tế. Văn bản y sinh thường chứa mật độ thông tin cao. Nó bao gồm nhiều thuật ngữ chuyên ngành, từ viết tắt và cấu trúc câu phức tạp. Điều này tạo ra những thách thức lớn cho các hệ thống Nhận dạng thực thể có tên (NER) truyền thống.
Nghiên cứu đã khảo sát vấn đề thích nghi miền (domain adaptation). Khả năng thích nghi miền là yếu tố then chốt. Nó giúp các mô hình duy trì hiệu suất trên các tập dữ liệu mới hoặc chuyên biệt. Một mô hình nhận dạng thực thể biểu hiện tiên tiến được đề xuất. Mô hình này kết hợp các kỹ thuật Học máy (Machine Learning) đa dạng. Nó còn sử dụng các tài nguyên ngôn ngữ hỗ trợ. Các tài nguyên này bao gồm từ điển thuật ngữ y tế và cơ sở tri thức chuyên ngành. Luận án trình bày chi tiết các thực nghiệm đánh giá. Các thực nghiệm so sánh hiệu quả của mô hình đề xuất với các kỹ thuật Học sâu (Deep Learning) và các phương pháp hiện có. Kết quả cho thấy mô hình đạt hiệu suất cao. Nó chứng tỏ khả năng xử lý hiệu quả các thực thể phức tạp trong văn bản y sinh. Ứng dụng mô hình vào cuộc thi BioCreAtIvE V CDR Task cũng khẳng định tính ứng dụng và độ tin cậy. Nghiên cứu đóng góp vào lĩnh vực Trí tuệ nhân tạo (AI) y tế.
3.1. Thách thức nhận dạng trong miền Y sinh
Miền y sinh đặc trưng bởi thuật ngữ phức tạp. Sự mơ hồ ngữ cảnh và thiếu dữ liệu gán nhãn là vấn đề lớn. Các thực thể biểu hiện như triệu chứng, bệnh lý, thuốc men cần được nhận diện chính xác. Điều này đòi hỏi các phương pháp Phân tích văn bản chuyên biệt. Nhận dạng thực thể có tên trong y sinh là chìa khóa.
3.2. Mô hình đề xuất và Thích nghi miền dữ liệu
Nghiên cứu đề xuất một mô hình robust cho Nhận dạng thực thể y sinh. Mô hình này tích hợp các kỹ thuật Học máy tiên tiến. Nó chú trọng khả năng thích nghi miền. Điều này cho phép mô hình hoạt động hiệu quả trên các tập dữ liệu khác nhau. Mục tiêu là duy trì độ chính xác cao.
3.3. Đánh giá hiệu quả mô hình qua thực nghiệm
Các thực nghiệm được tiến hành nghiêm ngặt. Chúng đánh giá hiệu quả của mô hình đề xuất. So sánh với các phương pháp hiện đại được thực hiện. Việc đánh giá bao gồm phân tích đóng góp của từng tài nguyên. Kết quả chứng minh ưu điểm của mô hình. Điều này củng cố nền tảng cho Nghiên cứu công nghệ thông tin y tế.
IV.Mô hình Lai ghép và Học xếp hạng trong Nhận dạng Thực thể
Chương này của Luận án tiến sĩ CNTT tập trung vào việc nâng cấp hiệu quả Nhận dạng Thực thể y sinh. Nghiên cứu đề xuất một mô hình dựa trên kỹ thuật lai ghép và Học xếp hạng. Đây là một bước tiến quan trọng trong Xử lý ngôn ngữ tự nhiên (NLP). Kỹ thuật lai ghép kết hợp sức mạnh của nhiều phương pháp khác nhau. Nó tận dụng cả Học máy (Machine Learning) truyền thống và Học sâu (Deep Learning) hiện đại. Mục tiêu là tối ưu hóa quá trình Trích xuất thông tin từ văn bản y tế.
Học xếp hạng (Learning to Rank) được giới thiệu để cải thiện độ chính xác. Phương pháp này giúp mô hình học cách sắp xếp các ứng viên thực thể tiềm năng. Việc xếp hạng giúp ưu tiên những thực thể có khả năng đúng cao nhất. Kỹ thuật này đặc biệt hữu ích khi xử lý các trường hợp mơ hồ. Nó cũng giải quyết hiệu quả các thực thể có cấu trúc phức tạp. Nghiên cứu đã phát triển một mô hình nâng cấp toàn diện. Mô hình này không chỉ cải thiện hiệu suất nhận dạng. Nó còn tăng cường khả năng thích nghi với các miền dữ liệu mới. Các thử nghiệm đã chứng minh rằng mô hình lai ghép và học xếp hạng mang lại kết quả vượt trội. Nó vượt qua nhiều hệ thống Nhận dạng thực thể có tên (NER) khác. Điều này đóng góp đáng kể vào lĩnh vực Trí tuệ nhân tạo (AI) và Nghiên cứu công nghệ thông tin.
4.1. Kỹ thuật Lai ghép và cải thiện hiệu năng
Kỹ thuật lai ghép kết hợp nhiều phương pháp nhận dạng. Nó tận dụng ưu điểm của từng phương pháp. Điều này giúp cải thiện đáng kể hiệu năng tổng thể. Mô hình lai ghép có khả năng xử lý các loại thực thể đa dạng. Nó cũng đối phó tốt với các thách thức ngôn ngữ.
4.2. Học xếp hạng trong Nhận dạng thực thể Y sinh
Học xếp hạng là một phương pháp mạnh mẽ. Nó tối ưu hóa việc lựa chọn thực thể. Kỹ thuật này đặc biệt phù hợp cho miền y sinh. Nó giúp giải quyết sự phức tạp của thuật ngữ. Học xếp hạng nâng cao độ chính xác của các hệ thống Trích xuất thông tin.
4.3. Phát triển mô hình nhận dạng hiệu quả cao
Mô hình được phát triển nhằm đạt hiệu quả nhận dạng cao nhất. Nó kết hợp kỹ thuật lai ghép với Học xếp hạng. Kết quả là một hệ thống Nhận dạng thực thể mạnh mẽ. Hệ thống này có thể áp dụng rộng rãi. Nó đặc biệt hữu ích trong các ứng dụng Xử lý ngôn ngữ tự nhiên chuyên biệt.
V.Đóng góp quan trọng của Luận án Tiến sĩ CNTT
Luận án tiến sĩ công nghệ thông tin này mang lại nhiều đóng góp ý nghĩa. Nó không chỉ cho lĩnh vực Xử lý ngôn ngữ tự nhiên (NLP) mà còn cho Trí tuệ nhân tạo (AI) nói chung. Nghiên cứu đã phát triển các phương pháp tiên tiến. Các phương pháp này cải thiện đáng kể hiệu suất Nhận dạng Thực thể (NER) cho cả tiếng Việt và văn bản y sinh tiếng Anh. Một trong những đóng góp nổi bật là việc đề xuất mô hình lai ghép và học xếp hạng. Mô hình này giải quyết hiệu quả các thách thức phức tạp. Nó đặc biệt hữu ích trong việc Trích xuất thông tin từ các tài liệu chuyên ngành.
Luận án đã tạo ra các tài nguyên ngôn ngữ quý giá. Các tài nguyên này bao gồm các bộ dữ liệu gán nhãn mới. Chúng hỗ trợ cho việc huấn luyện và đánh giá các hệ thống Nhận dạng thực thể có tên. Đặc biệt là trong bối cảnh tiếng Việt còn thiếu thốn tài nguyên. Nghiên cứu cũng mở ra hướng ứng dụng thực tiễn. Nó minh chứng thông qua việc tích hợp mô hình vào hệ thống hỏi đáp tự động. Điều này cho thấy tiềm năng của Học máy (Machine Learning) và Học sâu (Deep Learning) trong giải quyết các vấn đề thực tế.
Những kết quả từ Luận án này cung cấp nền tảng vững chắc. Nền tảng này cho các nghiên cứu tương lai trong Nghiên cứu công nghệ thông tin. Nó thúc đẩy sự phát triển của các hệ thống Phân tích văn bản thông minh hơn. Nghiên cứu góp phần nâng cao khả năng xử lý ngôn ngữ tự nhiên. Nó cũng tăng cường ứng dụng của Trí tuệ nhân tạo trong các lĩnh vực chuyên biệt.
5.1. Cải tiến phương pháp Nhận dạng Thực thể
Luận án giới thiệu các cải tiến đột phá. Chúng bao gồm việc kết hợp các kỹ thuật Học máy và Học sâu. Điều này giúp nâng cao độ chính xác của Nhận dạng Thực thể. Đặc biệt là trong các miền dữ liệu phức tạp. Phương pháp mới mở ra tiềm năng cho việc trích xuất thông tin hiệu quả hơn.
5.2. Phát triển tài nguyên và Ứng dụng thực tiễn
Nghiên cứu đã đóng góp vào việc phát triển tài nguyên. Các bộ dữ liệu gán nhãn mới được tạo ra. Chúng đặc biệt có giá trị cho tiếng Việt. Ứng dụng của mô hình vào hệ thống hỏi đáp là minh chứng. Nó cho thấy khả năng giải quyết các bài toán thực tế.
5.3. Hướng nghiên cứu tương lai trong NLP
Luận án mở ra nhiều hướng nghiên cứu mới. Chúng bao gồm việc khám phá các mô hình Học sâu tiên tiến hơn. Việc tích hợp tri thức miền sâu hơn cũng là một hướng đi. Mục tiêu là tiếp tục nâng cao hiệu suất Nhận dạng thực thể. Nó đóng góp vào sự phát triển của Trí tuệ nhân tạo và Xử lý ngôn ngữ tự nhiên.
Mục lục chi tiết luận án
Tải xuống file đầy đủ để xem toàn bộ nội dung
Tải đầy đủ (138 trang)Trích đoạn nội dung luận án
Tải xuống để đọc toàn bộĐẠI HỌC QUỐC GIA HÀ NỘI TRƯỜNG ĐẠI HỌC CÔNG NGHỆ TRẦN MAI VŨ NGHIÊN CỨU NHẬN DẠNG THỰC THỂ CÓ TÊN VÀ THỰC THỂ BIỂU HIỆN TRONG VĂN BẢN VÀ ỨNG DỤNG LUẬN ÁN TIẾN SĨ CÔNG NGHỆ THÔNG TIN Hà Nội – 2018 ĐẠI HỌC QUỐC GIA HÀ NỘI TRƯỜNG ĐẠI HỌC CÔNG NGHỆ TRẦN MAI VŨ NGHIÊN CỨU NHẬN DẠNG THỰC THỂ CÓ TÊN VÀ THỰC THỂ BIỂU HIỆN TRONG VĂN BẢN VÀ ỨNG DỤNG Chuyên ngành: Hệ thống thông tin Mã số: 62.01 LUẬN ÁN TIẾN SĨ CÔNG NGHỆ THÔNG TIN NGƯỜI HƯỚNG DẪN KHOA HỌC: 1. Hà Quang Thụy 2. Nguyễn Lê Minh Hà Nội – 2018 LỜI CAM ĐOAN Tôi xin cam đoan đây là công trình nghiên cứu của riêng tôi. Các kết quả được viết chung với các tác giả khác đều được sự đồng ý của các đồng tác giả trước khi đưa vào luận án.
Các kết quả nêu trong luận án là trung thực và chưa từng được công bố trong các công trình nào khác. Tác giả Trần Mai Vũ 1 LỜI CẢM ƠN Luận án được thực hiện tại Bộ môn Hệ thống thông tin - Khoa Công nghệ thông tin - Trường Đại học Công nghệ - Đại học Quốc gia Hà Nội, dưới sự hướng dẫn khoa học của PGS. Hà Quang Thụy và PGS. Nguyễn Lê Minh.
Trước tiên tôi xin bày tỏ lòng biết ơn sâu sắc tới thầy PGS. Hà Quang Thụy và PGS. Nguyễn Lê Minh, những người đã đưa tôi đến với lĩnh vực nghiên cứu này. Các thầy đã tận tình giảng dạy, hướng dẫn giúp tôi tiếp cận và đạt được thành công trong công việc nghiên cứu của mình.
Các thầy đã luôn tận tâm động viên, khuyến khích và chỉ dẫn giúp tôi hoàn thành được bản luận án này. Tôi xin bày tỏ lòng biết ơn tới các Thầy Cô thuộc Khoa Công nghệ thông tin và cán bộ Phòng Đào tạo - Trường Đại học Công nghệ, đã tạo mọi điều kiện thuận lợi giúp đỡ tôi trong quá trình học tập và nghiên cứu tại trường. Tôi xin cảm ơn PGS. Nigel Collier và cộng sự đã đóng góp ý kiến quý báu giúp tôi hoàn thiện bản luận án.
Sự động viên, cổ vũ của bạn bè là nguồn động lực quan trọng để tôi hoàn thành luận án. Tôi xin bày tỏ lòng biết ơn sâu sắc tới gia đình, vợ và các con tôi đã tạo điểm tựa vững chắc cho tôi có được thành công như ngày hôm nay. Tác giả Trần Mai Vũ 2 MỤC LỤC LỜI CAM ĐOAN 1 LỜI CẢM ƠN 2 MỤC LỤC 3 DANH MỤC CÁC KÍ HIỆU VÀ CHỮ VIẾT TẮT 7 DANH MỤC CÁC BẢNG 8 DANH MỤC CÁC HÌNH VẼ, ĐỒ THỊ 10 MỞ ĐẦU 11 Lý do chọn đề tài 11 Mục tiêu cụ thể và phạm vi nghiên cứu của luận án 12 Cấu trúc của luận án 15 Chương 1 - KHÁI QUÁT VỀ NHẬN DẠNG THỰC THỂ 17 1. Một số khái niệm cơ bản 17 1.
Định nghĩa bài toán nhận dạng thực thể 17 1. Thách thức 19 1. Ứng dụng của nhận dạng thực thể 21 1. Sơ lược về lịch sử nghiên cứu và một số hướng giải quyết bài toán 22 1.
Nhận dạng thực thể trong dữ liệu văn bản tiếng Việt và một số nghiên cứu liên quan 24 1. Những thách thức đối với xử lý dữ liệu tiếng Việt 24 1. Động cơ nghiên cứu 26 1. Các nghiên cứu liên quan 26 1.
Nhận dạng thực thể trong dữ liệu văn bản y sinh tiếng Anh và một số nghiên cứu liên quan 29 1. Những thách thức đối với xử lý dữ liệu y sinh 29 1. Động cơ nghiên cứu 30 1. Các nghiên cứu liên quan 31 3 1.
Tổng kết chương 34 Chương 2 – NHẬN DẠNG THỰC THỂ TÊN NGƯỜI KẾT HỢP VỚI NHẬN DẠNG THUỘC TÍNH THỰC THỂ CÓ TÊN TRONG VĂN BẢN TIẾNG VIỆT 36 2. Các nghiên cứu liên quan 38 2. Các nghiên cứu liên quan trên thế giới 38 2. Các nghiên cứu liên quan ở Việt Nam 39 2.
Một mô hình giải quyết bài toán nhận dạng thực thể tên người kết hợp với nhận dạng thuộc tính thực thể 40 2. Mô hình Entropy cực đại giải mã bằng tìm kiếm chùm (MEM+BS) 40 2. Phương pháp trường ngẫu nhiên có điều kiện (CRF) 41 2. Mô hình đề xuất 42 2.
Tập đặc trưng 46 2. Thực nghiệm, kết quả và đánh giá 47 2. Công cụ và dữ liệu đánh giá 47 2. Kết quả thực nghiệm đánh giá trên toàn hệ thống 49 2.
Kết quả thực nghiệm đánh giá trên từng nhãn 50 2. Mô hình áp dụng vào hệ thống hỏi đáp tên người tiếng Việt 52 2. Khái quát bài toán 52 2. Đặc trưng câu hỏi liên quan đến thực thể tên người trong tiếng Việt 53 2.
Mô hình đề xuất 55 2. Phương pháp và dữ liệu đánh giá mô hình hỏi đáp tự động 61 2. Thực nghiệm và đánh giá 61 2. Tổng kết chương 64 Chương 3 – NHẬN DẠNG THỰC THỂ BIỂU HIỆN TRONG VĂN BẢN Y SINH TIẾNG ANH 66 3.
Động cơ và khái quát bài toán nhận dạng thực thể biểu hiện 66 4 3. Một số khái niệm cơ bản liên quan đến thực thể biểu hiện và một số thực thể liên quan 69 3. Vấn đề về thích nghi miền trong nhận dạng thực thể y sinh 74 3. Mô hình nhận dạng thực thể biểu hiện và một số thực thể liên quan 75 3.
Dữ liệu đánh giá và tài nguyên hỗ trợ 77 3. Mô hình đề xuất 82 3. Tập đặc trưng và đánh giá đặc trưng 84 3. Phương pháp đánh giá 88 3.
Thực nghiệm 1: đánh giá hiệu quả của mô hình đề xuất với các kỹ thuật học máy khác nhau 89 3. Thực nghiệm 2: so sánh kết quả của mô hình đề xuất với một số nghiên cứu liên quan 90 3. Thực nghiệm 3: đánh giá đóng góp của từng tài nguyên đối với kết quả nhận diện thực thể 94 3. Thực nghiệm 4: ứng dụng mô hình đề xuất để nhận dạng thực thể y sinh trong cuộc thi BioCreAtIvE V CDR Task 95 3.
Thích nghi miền dữ liệu trong nhận dạng thực thể y sinh 97 3. Kết quả và đánh giá 99 3. Tổng kết chương 101 Chương 4 – MỘT MÔ HÌNH NÂNG CẤP HIỆU QUẢ NHẬN DẠNG THỰC THỂ Y SINH DỰA TRÊN KỸ THUẬT LAI GHÉP VÀ HỌC XẾP HẠNG 103 4. Mô hình nâng cấp nhận dạng thực thể biểu hiện và các thực thể liên quan 103 4.
Các phương pháp lai ghép được đề xuất 105 4.1 Phương pháp lai ghép sử dụng luật 105 4.2 Phương pháp lai ghép sử dụng học máy gán nhãn chuỗi 108 4.3 Phương pháp lai ghép sử dụng học xếp hạng 109 5 4. Thực nghiệm và đánh giá kết quả 111 4. Phương pháp đánh giá 111 4.2 Thực nghiệm đánh giá hiệu quả của từng phương pháp lai ghép 112 4.3 Thực nghiệm kiểm thử tin cậy trong quá trình đánh giá hiệu quả của các tài nguyên 114 4.4 Thảo luận và phân tích lỗi 115 4. Kết luận chương 118 KẾT LUẬN 120 DANH MỤC CÔNG TRÌNH KHOA HỌC CỦA TÁC GIẢ CÓ LIÊN QUAN ĐẾN LUẬN ÁN 122 TÀI LIỆU THAM KHẢO 123 6 DANH MỤC CÁC KÍ HIỆU VÀ CHỮ VIẾT TẮT Kí hiệu Tiếng Anh Tiếng Việt NER Named Entity Recognition Nhận dạng thực thể định danh NLP Natural Language Processing Xử lý ngôn ngữ tự nhiên BioNLP Biomedical Natural Language Xử lý ngôn ngữ tự nhiên cho Processing dữ liệu y sinh IE Information Extraction Trích xuất thông tin CRF Conditional Random Fields Trường ngẫu nhiên có điều kiện SVM Support Vector Machine Máy véctơ hỗ trợ SVM-LTR SVM-Learn to rank Học xếp hạng máy véctơ hỗ trợ ME Model, Maximum Entropy Model Mô hình Entropy cực đại Maxent Model MEM+BS Maximum Entropy Model Mô hình Entropy cực đại với with Beam Search giải mã tìm kiếm chùm 7 DANH MỤC CÁC BẢNG Bảng 2.
Một ví dụ về trích chọn thực thể tên người và các thuộc tính liên quan 37 Bảng 2. Các nhãn được sử dụng trong mô hình 43 Bảng 2. Tập đặc trưng được sử dụng 46 Bảng 2. Thống kê thực thể trong tập dữ liệu được gán nhãn 48 Bảng 2.
Kết quả đánh giá toàn hệ thống trên hai mô hình với hai phương pháp MEM+BS và CRF 49 Bảng 2. Kết quả thực nghiệm đối với từng nhãn 51 Bảng 2. Ví dụ về một số thành phần câu hỏi 56 Bảng 2. Các thành phần xuất hiện trong câu hỏi về thực thể tên người 57 Bảng 2.
Ví dụ gán nhãn tổng quát cho câu hỏi về thực thể tên người tiếng Việt 58 Bảng 2. Thống kê trên tập dữ liệu câu hỏi đánh giá 61 Bảng 2. Kết quả đánh giá thành phần phân tích câu hỏi 62 Bảng 2. Kết quả đánh giá của hệ thống trả lời tự động 63 Bảng 3.
Danh sách các bệnh tự miễn dịch được sử dụng để xây dựng dữ liệu Phenominer A 78 Bảng 3. Các đặc điểm của dữ liệu Phenominer A về bệnh tự miễn dịch và Phenominer B về bệnh tim mạch 80 Bảng 3. Các đặc trưng sử dụng trong thực nghiệm 84 Bảng 3. Thực nghiệm so sánh các phương pháp học máy khác nhau 90 Bảng 3.
Thực nghiệm so sánh mô hình đề xuất và các hệ thống khác 92 Bảng 3. Kết quả đánh giá tài nguyên của mô hình nhận dạng thực thể 94 Bảng 3. Thống kê trên ba tập dữ liệu của nhiệm vụ CDR [WPL15] 96 Bảng 3. Kết quả mô hình nhận dạng trên tập dữ liệu kiểm thử 96 Bảng 3.
Kết quả F1 của hệ thống NER sử dụng phương pháp thực nghiệm 1-6. Các đặc trưng được MEM + BS sử dụng để quyết định kết quả 109 Bảng 4. Kết quả của mô hình trên tập dữ liệu Phenominer A khi sử dụng các phương pháp khác nhau để lai ghép kết quả 112 8 Bảng 4. Kiểm thử độ tin cậy dựa trên thống kê về sự khác biệt hiệu năng sử dụng xấp xỉ ngẫu nhiên đối với các thực nghiệm loại bỏ lần lượt từng tài nguyên.
Kiểm thử độ tin cậy dựa trên thống kê về sự khác biệt hiệu năng sử dụng xấp xỉ ngẫu nhiên đối với các thực nghiệm 114 Bảng 4. Các lỗi của mô đun quyết định kết quả sử dụng danh sách ưu tiên (PL) và học xếp hạng sử dụng SVM (LTR) 116 9 DANH MỤC CÁC HÌNH VẼ, ĐỒ THỊ Hình 0. Thống kê các công trình nghiên cứu liên quan đến cụm từ “named entity recognition” trên Springer từ 2002 - tháng 11/2017 11 Hình 0. Biểu đồ phân bố các công trình đã công bố của nghiên cứu sinh tương ứng với các chương của luận án 16 Hình 1.
Mô tả các độ đo độ chính xác, độ hồi tưởng và độ đo F1 20 Hình 1. Các nhiệm vụ về xử lý ngôn ngữ tự nhiên cho văn bản y sinh trong giai đoạn 2002-2014 [HL15] 31 Hình 2. Đồ thị vô hướng mô tả CRF 41 Hình 2. Một ví dụ về câu được gán nhãn 44 Hình 2.
Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ
Trích dẫn luận án này
Trần Mai Vũ (2018). Luận án tiến sĩ công nghệ thông tin nghiên cứu nhận dạng thự [Luận án tiến sĩ, Trường Đại học Công nghệ - Đại học Quốc gia Hà Nội]. LuanAn.net. https://luanan.net/cong-nghe-thong-tin/luan-an-tien-si-cong-nghe-thong-tin-nghien-cuu-nhan-dang-thuc-the-co-ten-va-thuc-the-bieu-hien-trong-van-ban-va-ung-dung
Câu hỏi thường gặp
Luận án "Luận án tiến sĩ công nghệ thông tin nghiên cứu nhận dạng thự" nghiên cứu về vấn đề gì?
Luận án: Luận án tiến sĩ công nghệ thông tin nghiên cứu nhận dạng thực thể có tên và thực thể biểu hiện trong văn bản và ứng dụng. Xem tóm tắt và tải về tại Lua
Luận án "Luận án tiến sĩ công nghệ thông tin nghiên cứu nhận dạng thự" được bảo vệ tại trường nào?
Luận án này được bảo vệ tại Trường Đại học Công nghệ - Đại học Quốc gia Hà Nội. Năm bảo vệ: 2018.
Luận án "Luận án tiến sĩ công nghệ thông tin nghiên cứu nhận dạng thự" thuộc chuyên ngành gì?
Luận án "Luận án tiến sĩ công nghệ thông tin nghiên cứu nhận dạng thự" thuộc chuyên ngành Hệ thống thông tin. Danh mục: Công Nghệ Thông Tin.
Luận án "Luận án tiến sĩ công nghệ thông tin nghiên cứu nhận dạng thự" có bao nhiêu trang?
Luận án "Luận án tiến sĩ công nghệ thông tin nghiên cứu nhận dạng thự" có 138 trang. Bạn có thể xem trước một phần tài liệu ngay trên trang web trước khi tải về.
Cách tải luận án "Luận án tiến sĩ công nghệ thông tin nghiên cứu nhận dạng thự" về máy như thế nào?
Để tải luận án về máy, bạn nhấn nút "Tải xuống ngay" trên trang này, sau đó hoàn tất thanh toán phí lưu trữ. File sẽ được tải xuống ngay sau khi thanh toán thành công. Hỗ trợ qua Zalo: 0559 297 239.