Luận án nghiên cứu nhận dạng thực thể có tên và thực thể biểu hiện trong văn bản

Nghiên cứu luận án tập trung nhận dạng thực thể có tên (NER) và các dạng thực thể đặc biệt. Đề xuất phương pháp nâng cao hiệu quả trích xuất thông tin.

Tác giả

Luan An

Thể loại

Luận án tiến sĩ

Năm xuất bản

Số trang

137

Thời gian đọc

21 phút

Lượt xem

0

Lượt tải

0

Phí lưu trữ

40 Point

Tổng quan nhanh

Chủ đề:
1. Tổng quan Nhận dạng Thực thể: Khái niệm & Ứng dụng
Số trang:
137 trang
Trường:
Trường Đại học Công nghệ, Đại học Quốc gia Hà Nội
Chuyên ngành:
Hệ thống thông tin
Tác giả:
Năm:

Tóm tắt nội dung luận án

I. Tổng quan Nhận dạng Thực thể Khái niệm Ứng dụng

Luận án cung cấp tổng quan về nhận dạng thực thể có tên (NER) trong xử lý ngôn ngữ tự nhiên (NLP). NER là nhiệm vụ cơ bản, xác định và phân loại các thực thể quan trọng trong văn bản. Công việc này đặt nền tảng cho nhiều ứng dụng NLP phức tạp khác. Nghiên cứu đề cập các thách thức cụ thể và hướng giải quyết cho NER, đặc biệt trong các miền chuyên biệt và ngôn ngữ cụ thể.

1.1. Định nghĩa và Vai trò của Nhận dạng Thực thể NER

Nhận dạng thực thể có tên (NER) xác định và phân loại các thực thể như tên người, địa điểm, tổ chức, ngày tháng. Đây là bước then chốt trong trích xuất thông tin tự động từ văn bản phi cấu trúc. NER giúp chuyển đổi thông tin thành dữ liệu có cấu trúc, dễ dàng phân tích và khai thác. Độ chính xác của NER ảnh hưởng trực tiếp đến hiệu quả của các hệ thống thượng nguồn trong NLP, từ tìm kiếm đến hỏi đáp.

1.2. Thách thức và Ứng dụng của NER trong NLP

NER đối mặt với nhiều thách thức đáng kể. Sự mơ hồ ngữ nghĩa là một vấn đề lớn, khi cùng một từ có thể có nhiều nghĩa hoặc loại thực thể khác nhau. Thiếu dữ liệu huấn luyện có gắn nhãn cho các miền chuyên biệt hoặc ngôn ngữ ít tài nguyên gây khó khăn trong việc xây dựng mô hình hiệu quả. Ứng dụng của NER rất đa dạng, bao gồm hệ thống hỏi đáp, tóm tắt văn bản, phân tích cảm xúc, và xây dựng biểu đồ tri thức. Các thách thức riêng biệt tồn tại cho văn bản tiếng Việt và dữ liệu y sinh, đòi hỏi phương pháp tiếp cận chuyên biệt.

II. Nhận dạng Thực thể Tên người Tiếng Việt Mô hình Ứng dụng

Chương này tập trung vào bài toán nhận dạng thực thể tên người trong văn bản tiếng Việt. Nghiên cứu đề xuất mô hình kết hợp với nhận dạng thuộc tính thực thể. Các giải pháp được phát triển nhằm giải quyết những đặc thù riêng của ngôn ngữ tiếng Việt. Kết quả ứng dụng của mô hình được trình bày chi tiết trong hệ thống hỏi đáp tự động, chứng minh tính hiệu quả thực tiễn.

2.1. Phương pháp và Mô hình Nhận dạng Thực thể Tên người

Nghiên cứu áp dụng các phương pháp học máy truyền thống cho NER. Mô hình Entropy cực đại (MEM) kết hợp tìm kiếm chùm (Beam Search) được sử dụng để tối ưu hóa quá trình giải mã. Phương pháp trường ngẫu nhiên có điều kiện (CRF) cũng được khám phá, tận dụng các mối quan hệ ngữ cảnh. Tập đặc trưng được thiết kế riêng cho tiếng Việt, bao gồm các đặc trưng hình thái, ngữ pháp và từ vựng, đóng vai trò quan trọng trong việc cải thiện độ chính xác của mô hình.

2.2. Đánh giá và Ứng dụng NER tên người Tiếng Việt

Thực nghiệm được tiến hành để đánh giá mô hình trên tập dữ liệu tiếng Việt. Hiệu quả của hệ thống được đo bằng các chỉ số như độ chính xác, độ phủ và F1-score. Kết quả cho thấy sự cải thiện đáng kể so với các phương pháp trước đó. Mô hình sau đó được ứng dụng vào một hệ thống hỏi đáp tự động tiếng Việt. Hệ thống này có khả năng nhận diện và trả lời các câu hỏi liên quan đến thực thể tên người một cách hiệu quả, minh chứng cho tính khả thi và tiềm năng ứng dụng.

III. Thực thể Biểu hiện Y sinh Thách thức Giải pháp NLP

Phần này đi sâu vào nhận dạng thực thể biểu hiện trong văn bản y sinh tiếng Anh. Các thách thức đặc trưng của miền dữ liệu y tế, vốn rất phức tạp và chuyên biệt, được xem xét kỹ lưỡng. Nghiên cứu đề xuất một mô hình mới nhằm nâng cao hiệu quả trích xuất thông tin y sinh. Vấn đề thích nghi miền dữ liệu cũng được giải quyết, đảm bảo hiệu suất mạnh mẽ trên các tập dữ liệu đa dạng.

3.1. Nhận dạng Thực thể Biểu hiện Y sinh Vấn đề Khái niệm

Thực thể biểu hiện (entity mention) trong y sinh bao gồm các tên thuốc, bệnh tật, hóa chất và các khái niệm y khoa khác. Nhận dạng chúng là nhiệm vụ phức tạp do đặc thù của ngôn ngữ y tế. Thuật ngữ y tế chuyên ngành, các từ viết tắt và sự biến đổi danh pháp gây khó khăn lớn. Việc này rất quan trọng cho trích xuất thông tin chính xác, phục vụ các ứng dụng như phát hiện thuốc-bệnh, tổng hợp kiến thức y học.

3.2. Mô hình Nâng cao Hiệu quả Trích xuất Thông tin Y sinh

Mô hình đề xuất sử dụng kỹ thuật học máy và xử lý ngôn ngữ tự nhiên (NLP) tiên tiến. Các tài nguyên hỗ trợ và tập đặc trưng phong phú được khai thác để nắm bắt ngữ cảnh. Thích nghi miền dữ liệu được thực hiện để cải thiện hiệu suất trên các bộ dữ liệu y sinh khác nhau. Thực nghiệm được tiến hành để so sánh mô hình với các nghiên cứu liên quan. Kết quả tham gia cuộc thi BioCreAtIvE V CDR Task chứng minh tính cạnh tranh và hiệu quả. Đóng góp của từng tài nguyên đối với kết quả nhận diện thực thể được đánh giá kỹ lưỡng.

IV. Nâng cao Hiệu quả Nhận dạng Thực thể Kỹ thuật Hiện đại

Luận án khám phá các kỹ thuật hiện đại để nâng cao hiệu quả nhận dạng thực thể. Trọng tâm là sự kết hợp giữa học máy truyền thống và các phương pháp học sâu. Các phương pháp mới như biểu diễn thực thể và mô hình ngôn ngữ lớn được tích hợp. Điều này mở ra hướng phát triển mạnh mẽ cho NER trong tương lai, giải quyết các thách thức còn tồn tại và đạt được độ chính xác cao hơn.

4.1. Tối ưu NER bằng Học sâu và Biểu diễn Thực thể

Học sâu mang lại bước tiến lớn cho nhận dạng thực thể có tên (NER). Word embedding giúp biểu diễn từ ngữ hiệu quả, nắm bắt mối quan hệ ngữ nghĩa và ngữ pháp. Các kiến trúc mạng nơ-ron như LSTM-CRF đã cải thiện đáng kể độ chính xác. Học sâu tự động trích xuất đặc trưng, giảm gánh nặng kỹ thuật. Biểu diễn thực thể đa chiều là chìa khóa để hiểu ngữ cảnh phức tạp, cho phép mô hình nhận diện thực thể chính xác hơn trong các văn bản đa dạng.

4.2. Ứng dụng Mô hình Ngôn ngữ Lớn và Kỹ thuật Lai ghép

Mô hình ngôn ngữ lớn (LLM) như BERT và Transformer đang định hình lại lĩnh vực NER. Chúng cung cấp biểu diễn ngữ cảnh mạnh mẽ và khả năng học từ dữ liệu không gắn nhãn. Fine-tuning LLM trên dữ liệu cụ thể đạt hiệu suất vượt trội. Kỹ thuật lai ghép kết hợp ưu điểm của nhiều phương pháp, từ luật ngữ pháp đến học sâu. Học xếp hạng cũng được áp dụng để cải thiện kết quả cuối cùng, đặc biệt trong việc giải quyết sự mơ hồ và lựa chọn thực thể phù hợp nhất trong các trường hợp phức tạp.

Mục lục chi tiết luận án

LỜI CAM ĐOAN
LỜI CẢM ƠN
DANH MỤC CÁC KÍ HIỆU VÀ CHỮ VIẾT TẮT
DANH MỤC CÁC BẢNG
DANH MỤC CÁC HÌNH VẼ, ĐỒ THỊ
MỞ ĐẦU
prefix.1. Lý do chọn đề tài
prefix.2. Mục tiêu cụ thể và phạm vi nghiên cứu của luận án
prefix.3. Cấu trúc của luận án
1. CHƯƠNG 1: KHÁI QUÁT VỀ NHẬN DẠNG THỰC THỂ
1.1. Một số khái niệm cơ bản
1.2. Định nghĩa bài toán nhận dạng thực thể
1.3. Thách thức
1.4. Ứng dụng của nhận dạng thực thể
1.5. Sơ lược về lịch sử nghiên cứu và một số hướng giải quyết bài toán
1.6. Nhận dạng thực thể trong dữ liệu văn bản tiếng Việt và một số nghiên cứu liên quan
1.6.1. Những thách thức đối với xử lý dữ liệu tiếng Việt
1.6.2. Động cơ nghiên cứu
1.6.3. Các nghiên cứu liên quan
1.7. Nhận dạng thực thể trong dữ liệu văn bản y sinh tiếng Anh và một số nghiên cứu liên quan
1.7.1. Những thách thức đối với xử lý dữ liệu y sinh
1.7.2. Động cơ nghiên cứu
1.7.3. Các nghiên cứu liên quan
1.8. Tổng kết chương
2. CHƯƠNG 2: NHẬN DẠNG THỰC THỂ TÊN NGƯỜI KẾT HỢP VỚI NHẬN DẠNG THUỘC TÍNH THỰC THỂ CÓ TÊN TRONG VĂN BẢN TIẾNG VIỆT
2.1. Các nghiên cứu liên quan
2.1.1. Các nghiên cứu liên quan trên thế giới
2.1.2. Các nghiên cứu liên quan ở Việt Nam
2.2. Một mô hình giải quyết bài toán nhận dạng thực thể tên người kết hợp với nhận dạng thuộc tính thực thể
2.2.1. Mô hình Entropy cực đại giải mã bằng tìm kiếm chùm (MEM+BS)
2.2.2. Phương pháp trường ngẫu nhiên có điều kiện (CRF)
2.2.3. Mô hình đề xuất
2.3. Tập đặc trưng
2.4. Thực nghiệm, kết quả và đánh giá
2.4.1. Công cụ và dữ liệu đánh giá
2.4.2. Kết quả thực nghiệm đánh giá trên toàn hệ thống
2.4.3. Kết quả thực nghiệm đánh giá trên từng nhãn
2.5. Mô hình áp dụng vào hệ thống hỏi đáp tên người tiếng Việt
2.5.1. Khái quát bài toán
2.5.2. Đặc trưng câu hỏi liên quan đến thực thể tên người trong tiếng Việt
2.5.3. Mô hình đề xuất
2.5.4. Phương pháp và dữ liệu đánh giá mô hình hỏi đáp tự động
2.5.5. Thực nghiệm và đánh giá
2.6. Tổng kết chương
3. CHƯƠNG 3: NHẬN DẠNG THỰC THỂ BIỂU HIỆN TRONG VĂN BẢN Y SINH TIẾNG ANH
3.1. Động cơ và khái quát bài toán nhận dạng thực thể biểu hiện
3.2. Một số khái niệm cơ bản liên quan đến thực thể biểu hiện và một số thực thể liên quan
3.3. Vấn đề về thích nghi miền trong nhận dạng thực thể y sinh
3.4. Mô hình nhận dạng thực thể biểu hiện và một số thực thể liên quan
3.5. Dữ liệu đánh giá và tài nguyên hỗ trợ
3.6. Mô hình đề xuất
3.7. Tập đặc trưng và đánh giá đặc trưng
3.8. Phương pháp đánh giá
3.9. Thực nghiệm 1: đánh giá hiệu quả của mô hình đề xuất với các kỹ thuật học máy khác nhau
3.10. Thực nghiệm 2: so sánh kết quả của mô hình đề xuất với một số nghiên cứu liên quan
3.11. Thực nghiệm 3: đánh giá đóng góp của từng tài nguyên đối với kết quả nhận diện thực thể
3.12. Thực nghiệm 4: ứng dụng mô hình đề xuất để nhận dạng thực thể y sinh trong cuộc thi BioCreAtIvE V CDR Task
3.13. Thích nghi miền dữ liệu trong nhận dạng thực thể y sinh
3.14. Kết quả và đánh giá
3.15. Tổng kết chương
4. CHƯƠNG 4: MỘT MÔ HÌNH NÂNG CẤP HIỆU QUẢ NHẬN DẠNG THỰC THỂ Y SINH DỰA TRÊN KỸ THUẬT LAI GHÉP VÀ HỌC XẾP HẠNG
4.1. Mô hình nâng cấp nhận dạng thực thể biểu hiện và các thực thể liên quan
4.2. Các phương pháp lai ghép được đề xuất
4.2.1. Phương pháp lai ghép sử dụng luật
4.2.2. Phương pháp lai ghép sử dụng học máy gán nhãn chuỗi
4.2.3. Phương pháp lai ghép sử dụng học xếp hạng
4.3. Thực nghiệm và đánh giá kết quả
4.3.1. Phương pháp đánh giá
4.3.2. Thực nghiệm đánh giá hiệu quả của từng phương pháp lai ghép
4.3.3. Thực nghiệm kiểm thử tin cậy trong quá trình đánh giá hiệu quả của các tài nguyên
4.3.4. Thảo luận và phân tích lỗi
4.4. Kết luận chương
KẾT LUẬN
DANH MỤC CÔNG TRÌNH KHOA HỌC CỦA TÁC GIẢ CÓ LIÊN QUAN ĐẾN LUẬN ÁN
TÀI LIỆU THAM KHẢO
Xem trước tài liệu
Tải đầy đủ để xem toàn bộ nội dung
Luận án nghiên cứu nhận dạng thực thể có tên và thực thể biểu hiện trong văn bản và ứng dụng

Tải xuống file đầy đủ để xem toàn bộ nội dung

Tải đầy đủ (137 trang)

Trích đoạn nội dung luận án

Tải xuống để đọc toàn bộ

ĐẠI HỌC QUỐC GIA HÀ NỘI TRƯỜNG ĐẠI HỌC CÔNG NGHỆ TRẦN MAI VŨ NGHIÊN CỨU NHẬN DẠNG THỰC THỂ CÓ TÊN VÀ THỰC THỂ BIỂU HIỆN TRONG VĂN BẢN VÀ ỨNG DỤNG LUẬN ÁN TIẾN SĨ CÔNG NGHỆ THÔNG TIN Hà Nội – 2018 ĐẠI HỌC QUỐC GIA HÀ NỘI TRƯỜNG ĐẠI HỌC CÔNG NGHỆ TRẦN MAI VŨ NGHIÊN CỨU NHẬN DẠNG THỰC THỂ CÓ TÊN VÀ THỰC THỂ BIỂU HIỆN TRONG VĂN BẢN VÀ ỨNG DỤNG Chuyên ngành: Hệ thống thông tin Mã số: 62.01 LUẬN ÁN TIẾN SĨ CÔNG NGHỆ THÔNG TIN NGƯỜI HƯỚNG DẪN KHOA HỌC: 1. Hà Quang Thụy 2. Nguyễn Lê Minh Hà Nội – 2018 LỜI CAM ĐOAN Tôi xin cam đoan đây là công trình nghiên cứu của riêng tôi. Các kết quả được viết chung với các tác giả khác đều được sự đồng ý của các đồng tác giả trước khi đưa vào luận án.

Các kết quả nêu trong luận án là trung thực và chưa từng được công bố trong các công trình nào khác. Tác giả Trần Mai Vũ 1 LỜI CẢM ƠN Luận án được thực hiện tại Bộ môn Hệ thống thông tin - Khoa Công nghệ thông tin - Trường Đại học Công nghệ - Đại học Quốc gia Hà Nội, dưới sự hướng dẫn khoa học của PGS. Hà Quang Thụy và PGS. Nguyễn Lê Minh.

Trước tiên tôi xin bày tỏ lòng biết ơn sâu sắc tới thầy PGS. Hà Quang Thụy và PGS. Nguyễn Lê Minh, những người đã đưa tôi đến với lĩnh vực nghiên cứu này. Các thầy đã tận tình giảng dạy, hướng dẫn giúp tôi tiếp cận và đạt được thành công trong công việc nghiên cứu của mình.

Các thầy đã luôn tận tâm động viên, khuyến khích và chỉ dẫn giúp tôi hoàn thành được bản luận án này. Tôi xin bày tỏ lòng biết ơn tới các Thầy Cô thuộc Khoa Công nghệ thông tin và cán bộ Phòng Đào tạo - Trường Đại học Công nghệ, đã tạo mọi điều kiện thuận lợi giúp đỡ tôi trong quá trình học tập và nghiên cứu tại trường. Tôi xin cảm ơn PGS. Nigel Collier và cộng sự đã đóng góp ý kiến quý báu giúp tôi hoàn thiện bản luận án.

Sự động viên, cổ vũ của bạn bè là nguồn động lực quan trọng để tôi hoàn thành luận án. Tôi xin bày tỏ lòng biết ơn sâu sắc tới gia đình, vợ và các con tôi đã tạo điểm tựa vững chắc cho tôi có được thành công như ngày hôm nay. Tác giả Trần Mai Vũ 2 MỤC LỤC LỜI CAM ĐOAN 1 LỜI CẢM ƠN 2 MỤC LỤC 3 DANH MỤC CÁC KÍ HIỆU VÀ CHỮ VIẾT TẮT 7 DANH MỤC CÁC BẢNG 8 DANH MỤC CÁC HÌNH VẼ, ĐỒ THỊ 10 MỞ ĐẦU 11 Lý do chọn đề tài 11 Mục tiêu cụ thể và phạm vi nghiên cứu của luận án 12 Cấu trúc của luận án 15 Chương 1 - KHÁI QUÁT VỀ NHẬN DẠNG THỰC THỂ 17 1. Một số khái niệm cơ bản 17 1.

Định nghĩa bài toán nhận dạng thực thể 17 1. Thách thức 19 1. Ứng dụng của nhận dạng thực thể 21 1. Sơ lược về lịch sử nghiên cứu và một số hướng giải quyết bài toán 22 1.

Nhận dạng thực thể trong dữ liệu văn bản tiếng Việt và một số nghiên cứu liên quan 24 1. Những thách thức đối với xử lý dữ liệu tiếng Việt 24 1. Động cơ nghiên cứu 26 1. Các nghiên cứu liên quan 26 1.

Nhận dạng thực thể trong dữ liệu văn bản y sinh tiếng Anh và một số nghiên cứu liên quan 28 1. Những thách thức đối với xử lý dữ liệu y sinh 28 1. Động cơ nghiên cứu 29 1. Các nghiên cứu liên quan 30 3 1.

Tổng kết chương 34 Chương 2 – NHẬN DẠNG THỰC THỂ TÊN NGƯỜI KẾT HỢP VỚI NHẬN DẠNG THUỘC TÍNH THỰC THỂ CÓ TÊN TRONG VĂN BẢN TIẾNG VIỆT 35 2. Các nghiên cứu liên quan 37 2. Các nghiên cứu liên quan trên thế giới 37 2. Các nghiên cứu liên quan ở Việt Nam 38 2.

Một mô hình giải quyết bài toán nhận dạng thực thể tên người kết hợp với nhận dạng thuộc tính thực thể 39 2. Mô hình Entropy cực đại giải mã bằng tìm kiếm chùm (MEM+BS) 39 2. Phương pháp trường ngẫu nhiên có điều kiện (CRF) 40 2. Mô hình đề xuất 41 2.

Tập đặc trưng 45 2. Thực nghiệm, kết quả và đánh giá 46 2. Công cụ và dữ liệu đánh giá 46 2. Kết quả thực nghiệm đánh giá trên toàn hệ thống 47 2.

Kết quả thực nghiệm đánh giá trên từng nhãn 49 2. Mô hình áp dụng vào hệ thống hỏi đáp tên người tiếng Việt 51 2. Khái quát bài toán 51 2. Đặc trưng câu hỏi liên quan đến thực thể tên người trong tiếng Việt 52 2.

Mô hình đề xuất 54 2. Phương pháp và dữ liệu đánh giá mô hình hỏi đáp tự động 59 2. Thực nghiệm và đánh giá 60 2. Tổng kết chương 62 Chương 3 – NHẬN DẠNG THỰC THỂ BIỂU HIỆN TRONG VĂN BẢN Y SINH TIẾNG ANH 64 3.

Động cơ và khái quát bài toán nhận dạng thực thể biểu hiện 64 4 3. Một số khái niệm cơ bản liên quan đến thực thể biểu hiện và một số thực thể liên quan 67 3. Vấn đề về thích nghi miền trong nhận dạng thực thể y sinh 71 3. Mô hình nhận dạng thực thể biểu hiện và một số thực thể liên quan 73 3.

Dữ liệu đánh giá và tài nguyên hỗ trợ 75 3. Mô hình đề xuất 80 3. Tập đặc trưng và đánh giá đặc trưng 81 3. Phương pháp đánh giá 85 3.

Thực nghiệm 1: đánh giá hiệu quả của mô hình đề xuất với các kỹ thuật học máy khác nhau 86 3. Thực nghiệm 2: so sánh kết quả của mô hình đề xuất với một số nghiên cứu liên quan 87 3. Thực nghiệm 3: đánh giá đóng góp của từng tài nguyên đối với kết quả nhận diện thực thể 90 3. Thực nghiệm 4: ứng dụng mô hình đề xuất để nhận dạng thực thể y sinh trong cuộc thi BioCreAtIvE V CDR Task 92 3.

Thích nghi miền dữ liệu trong nhận dạng thực thể y sinh 94 3. Kết quả và đánh giá 96 3. Tổng kết chương 98 Chương 4 – MỘT MÔ HÌNH NÂNG CẤP HIỆU QUẢ NHẬN DẠNG THỰC THỂ Y SINH DỰA TRÊN KỸ THUẬT LAI GHÉP VÀ HỌC XẾP HẠNG 100 4. Mô hình nâng cấp nhận dạng thực thể biểu hiện và các thực thể liên quan 100 4.

Các phương pháp lai ghép được đề xuất 102 4.1 Phương pháp lai ghép sử dụng luật 102 4.2 Phương pháp lai ghép sử dụng học máy gán nhãn chuỗi 105 4.3 Phương pháp lai ghép sử dụng học xếp hạng 106 5 4. Thực nghiệm và đánh giá kết quả 108 4. Phương pháp đánh giá 108 4.2 Thực nghiệm đánh giá hiệu quả của từng phương pháp lai ghép 109 4.3 Thực nghiệm kiểm thử tin cậy trong quá trình đánh giá hiệu quả của các tài nguyên 111 4.4 Thảo luận và phân tích lỗi 112 4. Kết luận chương 115 KẾT LUẬN 116 DANH MỤC CÔNG TRÌNH KHOA HỌC CỦA TÁC GIẢ CÓ LIÊN QUAN ĐẾN LUẬN ÁN 118 TÀI LIỆU THAM KHẢO 119 6 DANH MỤC CÁC KÍ HIỆU VÀ CHỮ VIẾT TẮT Kí hiệu Tiếng Anh Tiếng Việt NER Named Entity Recognition Nhận dạng thực thể định danh NLP Natural Language Processing Xử lý ngôn ngữ tự nhiên BioNLP Biomedical Natural Language Xử lý ngôn ngữ tự nhiên cho Processing dữ liệu y sinh IE Information Extraction Trích xuất thông tin CRF Conditional Random Fields Trường ngẫu nhiên có điều kiện SVM Support Vector Machine Máy véctơ hỗ trợ SVM-LTR SVM-Learn to rank Học xếp hạng máy véctơ hỗ trợ ME Model, Maximum Entropy Model Mô hình Entropy cực đại Maxent Model MEM+BS Maximum Entropy Model Mô hình Entropy cực đại với with Beam Search giải mã tìm kiếm chùm 7 DANH MỤC CÁC BẢNG Bảng 2.

Một ví dụ về trích chọn thực thể tên người và các thuộc tính liên quan 36 Bảng 2. Các nhãn được sử dụng trong mô hình 42 Bảng 2. Tập đặc trưng được sử dụng 45 Bảng 2. Thống kê thực thể trong tập dữ liệu được gán nhãn 46 Bảng 2.

Kết quả đánh giá toàn hệ thống trên hai mô hình với hai phương pháp MEM+BS và CRF 48 Bảng 2. Kết quả thực nghiệm đối với từng nhãn 49 Bảng 2. Ví dụ về một số thành phần câu hỏi 55 Bảng 2. Các thành phần xuất hiện trong câu hỏi về thực thể tên người 55 Bảng 2.

Ví dụ gán nhãn tổng quát cho câu hỏi về thực thể tên người tiếng Việt 56 Bảng 2. Thống kê trên tập dữ liệu câu hỏi đánh giá 59 Bảng 2. Kết quả đánh giá thành phần phân tích câu hỏi 60 Bảng 2. Kết quả đánh giá của hệ thống trả lời tự động 62 Bảng 3.

Danh sách các bệnh tự miễn dịch được sử dụng để xây dựng dữ liệu Phenominer A 76 Bảng 3. Các đặc điểm của dữ liệu Phenominer A về bệnh tự miễn dịch và Phenominer B về bệnh tim mạch 78 Bảng 3. Các đặc trưng sử dụng trong thực nghiệm 82 Bảng 3. Thực nghiệm so sánh các phương pháp học máy khác nhau 87 Bảng 3.

Thực nghiệm so sánh mô hình đề xuất và các hệ thống khác 89 Bảng 3. Kết quả đánh giá tài nguyên của mô hình nhận dạng thực thể 91 Bảng 3. Thống kê trên ba tập dữ liệu của nhiệm vụ CDR [WPL15] 93 Bảng 3. Kết quả mô hình nhận dạng trên tập dữ liệu kiểm thử 93 Bảng 3.

Kết quả F1 của hệ thống NER sử dụng phương pháp thực nghiệm 1-6. Các đặc trưng được MEM + BS sử dụng để quyết định kết quả 106 Bảng 4. Kết quả của mô hình trên tập dữ liệu Phenominer A khi sử dụng các phương pháp khác nhau để lai ghép kết quả 109 8 Bảng 4. Kiểm thử độ tin cậy dựa trên thống kê về sự khác biệt hiệu năng sử dụng xấp xỉ ngẫu nhiên đối với các thực nghiệm loại bỏ lần lượt từng tài nguyên.

Kiểm thử độ tin cậy dựa trên thống kê về sự khác biệt hiệu năng sử dụng xấp xỉ ngẫu nhiên đối với các thực nghiệm 111 Bảng 4. Các lỗi của mô đun quyết định kết quả sử dụng danh sách ưu tiên (PL) và học xếp hạng sử dụng SVM (LTR) 113 9 DANH MỤC CÁC HÌNH VẼ, ĐỒ THỊ Hình 0. Thống kê các công trình nghiên cứu liên quan đến cụm từ “named entity recognition” trên Springer từ 2002 - tháng 11/2017 11 Hình 0. Biểu đồ phân bố các công trình đã công bố của nghiên cứu sinh tương ứng với các chương của luận án 16 Hình 1.

Mô tả các độ đo độ chính xác, độ hồi tưởng và độ đo F1 20 Hình 1. Các nhiệm vụ về xử lý ngôn ngữ tự nhiên cho văn bản y sinh trong giai đoạn 2002-2014 [HL15] 31 Hình 2. Đồ thị vô hướng mô tả CRF 40 Hình 2. Một ví dụ về câu được gán nhãn 43 Hình 2.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Trích dẫn luận án này

Trần Mai Vũ (2018). Luận án nghiên cứu nhận dạng thực thể có tên và thực thể biể [Luận án tiến sĩ, Trường Đại học Công nghệ - Đại học Quốc gia Hà Nội]. LuanAn.net. https://luanan.net/tai-lieu-khac/luan-an-nghien-cuu-nhan-dang-thuc-the-co-ten-va-thuc-the-bieu-hien-trong-van

Câu hỏi thường gặp

Luận án "Luận án nghiên cứu nhận dạng thực thể có tên và thực thể biể" nghiên cứu về vấn đề gì?

Nghiên cứu luận án tập trung nhận dạng thực thể có tên (NER) và các dạng thực thể đặc biệt. Đề xuất phương pháp nâng cao hiệu quả trích xuất thông tin.

Luận án "Luận án nghiên cứu nhận dạng thực thể có tên và thực thể biể" được bảo vệ tại trường nào?

Luận án này được bảo vệ tại Trường Đại học Công nghệ - Đại học Quốc gia Hà Nội. Năm bảo vệ: 2018.

Luận án "Luận án nghiên cứu nhận dạng thực thể có tên và thực thể biể" thuộc chuyên ngành gì?

Luận án "Luận án nghiên cứu nhận dạng thực thể có tên và thực thể biể" thuộc chuyên ngành Hệ thống thông tin. Danh mục: Tài liệu khác.

Luận án "Luận án nghiên cứu nhận dạng thực thể có tên và thực thể biể" có bao nhiêu trang?

Luận án "Luận án nghiên cứu nhận dạng thực thể có tên và thực thể biể" có 137 trang. Bạn có thể xem trước một phần tài liệu ngay trên trang web trước khi tải về.

Cách tải luận án "Luận án nghiên cứu nhận dạng thực thể có tên và thực thể biể" về máy như thế nào?

Để tải luận án về máy, bạn nhấn nút "Tải xuống ngay" trên trang này, sau đó hoàn tất thanh toán phí lưu trữ. File sẽ được tải xuống ngay sau khi thanh toán thành công. Hỗ trợ qua Zalo: 0559 297 239.

Luận án liên quan

Chia sẻ tài liệu: Facebook Twitter