Luận án xác định đặc điểm người dùng bằng học máy - Ứng dụng trên văn bản tiếng Việt

Luận án tập trung vào ứng dụng học máy xác định đặc điểm người dùng trên mạng internet. Nghiên cứu đề xuất các phương pháp cải tiến hiệu quả trong lĩnh vực này.

Chuyên ngành

Học máy

Tác giả

Luan An

Thể loại

Luận án

Số trang

142

Thời gian đọc

22 phút

Lượt xem

0

Lượt tải

0

Phí lưu trữ

40 Point

Tóm tắt của tác giả

Trích nguyên văn từ luận án

Sự phát triển mạnh mẽ của Internet và các dịch vụ trên Internet có những tác động lớn đến nhiều mặt trong xã hội. Chỉ với một thiết bị được kết nối đến mạng Internet, người dùng có thể dễ dàng sử dụng các kênh trao đổi thông tin như website, email, diễn đàn, mạng xã hội, hoặc các dịch vụ khác như tìm kiếm thông tin, thương mại điện tử (TMĐT) v. Một đặc điểm chung của các hệ thống này là không bắt buộc người dùng cung cấp chính xác thông tin cá nhân khi sử dụng. Việc này nhằm khuyến khích và tạo thuận lợi cho người dùng trong quá trình sử dụng, tuy nhiên cũng tạo ra một số vấn đề. Thứ nhất, người dùng có thể sử dụng các kênh trao đổi thông tin một cách nặc danh hoặc giả mạo, với mục đích xấu. Thứ hai, việc thiếu thông tin cá nhân người dùng làm cho các nhà cung cấp dịch vụ trên Internet gặp khó khăn trong việc cá nhân hóa hệ thống nhằm tăng trải nghiệm cho người dùng, thúc đẩy bán hàng, hoặc thực hiện các hoạt động quảng cáo trực tuyến hiệu quả hơn. Luận án này thực hiện nghiên cứu về vấn đề xác định các đặc điểm của người dùng dựa trên phân tích văn bản do người dùng tạo ra hoặc dựa trên phân tích hành vi người dùng thực hiện trên hệ thống bằng các phương pháp học máy. Các nội dung tiếp theo của phần này bao gồm: Phần 1.1 trình bày lý do lựa chọn đề tài.3 nêu các mục tiêu và đóng góp của luận án. Nội dung của phần 1.4 là bố cục của toàn bộ luận án. LÝ DO LỰA CHỌN

Tổng quan nhanh

Chủ đề:
1. Học máy xác định đặc điểm người dùng trên Internet hiện nay
Số trang:
142 trang
Chuyên ngành:
Học máy
Tác giả:

Tóm tắt nội dung luận án

I. Học máy xác định đặc điểm người dùng trên Internet hiện nay

Internet phát triển nhanh chóng. Các nền tảng số xuất hiện khắp nơi. Người dùng dễ dàng truy cập mạng xã hội, email, sàn thương mại điện tử. Hầu hết hệ thống không ép buộc cung cấp thông tin cá nhân. Điều này tạo thuận lợi cho việc gia nhập cộng đồng số. Tuy nhiên, tính mở cũng sinh ra nhiều bất cập. Kẻ xấu lợi dụng danh tính ẩn danh để trục lợi. Doanh nghiệp thiếu dữ liệu chính xác để phục vụ khách hàng. Do đó, việc ứng dụng công nghệ thông minh trở nên cấp thiết. Các phương pháp học máy mở ra hướng tiếp cận mới. Hệ thống tự động nhận diện đặc tính người dùng qua dữ liệu sẵn có. Việc xây dựng hồ sơ người dùng số (user profiling) trở thành nền tảng quan trọng. Kỹ thuật này giúp giải mã các thông tin như giới tính, độ tuổi và sở thích. Dữ liệu văn bản và lịch sử thao tác đóng vai trò quyết định. Nghiên cứu tập trung giải quyết bài toán cốt lõi này.

1.1. Bối cảnh bùng nổ dịch vụ Internet và vấn đề định danh

Mạng Internet kết nối hàng tỷ người trên toàn cầu. Các kênh trao đổi trực tuyến bùng nổ mạnh mẽ. Diễn đàn, website tin tức và mạng xã hội thu hút lượng tương tác khổng lồ. Môi trường trực tuyến cho phép giao tiếp không biên giới. Người dùng có quyền không công khai danh tính thật. Tính năng này nhằm khuyến khích sự tham gia tự do. Mặc dù vậy, mặt trái của sự ẩn danh ngày càng rõ nét. Tình trạng mạo danh và lừa đảo diễn ra phổ biến. Các hành vi độc hại gây tổn hại an ninh mạng. Doanh nghiệp gặp rào cản lớn khi muốn hiểu rõ khách hàng. Việc thiếu thông tin thực cản trở quá trình tương tác hiệu quả. Nhu cầu định danh gián tiếp xuất hiện từ đây. Các nhà khoa học bắt đầu tìm kiếm giải pháp kỹ thuật tự động.

1.2. Nhu cầu xây dựng hồ sơ người dùng số trong kỷ nguyên số

Dữ liệu người dùng là tài sản quý giá của mọi nền tảng số. Việc thiết lập hồ sơ người dùng số (user profiling) mang lại lợi thế cạnh tranh lớn. Các thuật toán tự động hỗ trợ dự đoán nhân khẩu học người dùng một cách chính xác. Hệ thống có thể ước lượng giới tính, nghề nghiệp hoặc vị trí địa lý. Ngoài ra, việc nhận diện tính cách qua mạng xã hội cũng tạo ra giá trị đột phá. Dữ liệu tương tác phản ánh tâm lý và thói quen tiêu dùng. Nền tảng số cần những thông tin này để duy trì hoạt động ổn định. Quá trình phân tích diễn ra hoàn toàn tự động nhờ các thuật toán thông minh. Khả năng thấu hiểu người dùng giúp nâng cao chất lượng dịch vụ tổng thể. Nghiên cứu khai thác sâu các đặc trưng tiềm ẩn từ luồng dữ liệu phong phú.

II. Ứng dụng học máy xác định đặc điểm người dùng trực tuyến

Công nghệ học máy mang lại nhiều giá trị thực tiễn cho đời sống số. Năng lực nhận diện đặc tính người dùng mở ra nhiều tiềm năng ứng dụng. Trong kinh doanh, phương pháp này thúc đẩy hiệu quả bán hàng vượt trội. Trong an ninh, thuật toán hỗ trợ bảo vệ trật tự không gian mạng. Quá trình phân tích hành vi người dùng trực tuyến giúp giải mã nhu cầu tiềm ẩn. Các nhà cung cấp dịch vụ số dễ dàng thiết lập luồng vận hành tối ưu. Trải nghiệm duyệt web của từng cá nhân được nâng cấp đáng kể. Việc xác định thông tin giúp hệ thống phản hồi linh hoạt theo thời gian thực. Không gian mạng trở nên an toàn và thân thiện hơn với người dùng chân chính. Sự kết hợp giữa trí tuệ nhân tạo và dữ liệu lớn tạo ra bước nhảy vọt quan trọng.

2.1. Cá nhân hóa trải nghiệm và tối ưu hóa thương mại điện tử

Cá nhân hóa là xu hướng sống còn trong thương mại điện tử. Khách hàng luôn mong muốn nhận nội dung phù hợp với sở thích. Các thuật toán học máy xử lý dữ liệu để hiển thị sản phẩm chính xác. Quảng cáo nhắm mục tiêu trở nên hiệu quả hơn nhiều lần. Hệ thống tự động đề xuất mặt hàng dựa trên lịch sử tương tác. Doanh nghiệp tiết kiệm ngân sách tiếp thị đáng kể. Tỷ lệ chuyển đổi đơn hàng tăng trưởng rõ rệt. Khách hàng tiết kiệm thời gian tìm kiếm món đồ ưng ý. Mối quan hệ giữa người mua và nền tảng bán hàng trở nên gắn kết hơn. Nhận diện chuẩn xác đặc điểm khách hàng chính là chìa khóa thành công. Mọi quyết định kinh doanh đều dựa trên căn cứ khoa học vững chắc.

2.2. Hỗ trợ điều tra tội phạm mạng và khoanh vùng đối tượng

Tội phạm công nghệ cao luôn tìm cách che giấu danh tính thực. Chúng thường sử dụng tài khoản nặc danh để thực hiện hành vi xấu. Cơ quan điều tra đối mặt với nhiều thách thức nghiệp vụ phức tạp. Tuy nhiên, hành vi phạm tội luôn để lại các tín hiệu điện tử. Kỹ thuật học máy hỗ trợ phân tích các thông điệp và thao tác trên hệ thống. Kết quả phân tích giúp xác định đặc điểm nhân khẩu học của kẻ tình nghi. Phạm vi khoanh vùng đối tượng được thu hẹp nhanh chóng. Trong nhiều trường hợp, thuật toán giúp xác định đích danh thủ phạm khi có danh sách nghi can. Đây là công cụ hỗ trợ đắc lực cho công tác bảo đảm an ninh mạng quốc gia.

III. Thách thức khi học máy xác định đặc điểm người dùng Internet

Quá trình nhận diện người dùng trên Internet gặp nhiều rào cản kỹ thuật. Phần lớn người dùng từ chối cung cấp dữ liệu cá nhân trung thực. Mối lo ngại về rò rỉ thông tin cá nhân ngày càng gia tăng. Luật bảo vệ dữ liệu trên toàn cầu cũng siết chặt quy định thu thập. Vì vậy, việc phân tích dấu vết số (digital footprints) là giải pháp tối ưu nhất. Dấu vết số bao gồm văn bản đăng tải, thời gian truy cập và thao tác nhấp chuột. Tuy nhiên, việc khai thác nguồn dữ liệu phân tán này đòi hỏi kỹ thuật phức tạp. Dữ liệu thường bị nhiễu và thiếu cấu trúc chuẩn hóa. Thuật toán cần có khả năng tự làm sạch và tinh chỉnh thông tin đầu vào. Quá trình xử lý đòi hỏi hạ tầng tính toán mạnh mẽ.

3.1. Rào cản từ tính ẩn danh và bảo vệ quyền riêng tư dữ liệu

Người dùng trực tuyến ngày càng có ý thức cao về quyền riêng tư. Họ chủ động sử dụng các biện pháp ẩn danh khi lướt web. Việc cung cấp thông tin sai lệch diễn ra rất phổ biến. Điều này nhằm ngăn chặn các nguy cơ lừa đảo và đánh cắp tài khoản. Do đó, kho dữ liệu thu thập trực tiếp thường không đáng tin cậy. Các nhà phân tích buộc phải chuyển hướng tiếp cận. Việc dự đoán gián tiếp từ phân tích dấu vết số (digital footprints) trở thành con đường duy nhất. Thách thức đặt ra là phải đảm bảo tính chính xác cao mà không xâm phạm quyền riêng tư. Thuật toán cần trích xuất mẫu hình hành vi một cách khách quan. Cân bằng giữa an toàn thông tin và hiệu quả mô hình là bài toán khó.

3.2. Khó khăn trong việc thu thập và trích xuất dữ liệu máy chủ

Thu thập dữ liệu hành vi đòi hỏi quyền truy cập sâu vào hệ thống máy chủ. Chỉ các máy chủ trung tâm mới có khả năng ghi lại toàn bộ lịch sử log. Quá trình khai phá dữ liệu web (web mining) đối mặt với khối lượng thông tin khổng lồ. Dữ liệu nhật ký máy chủ thường chứa nhiều tạp âm và thông tin rác. Kỹ thuật trích xuất đặc trưng hành vi đòi hỏi các bước tiền xử lý công phu. Nếu không có bộ lọc chuẩn, mô hình học máy sẽ dễ bị sai lệch. Hơn nữa, việc lưu trữ và tính toán thời gian thực gây áp lực lớn lên hạ tầng. Các nhà nghiên cứu phải liên tục tối ưu hóa thuật toán để giảm chi phí tài nguyên.

IV. Giải pháp học máy xác định đặc điểm người dùng toàn diện

Luận án đề xuất giải pháp tổng thể kết hợp hai hướng nghiên cứu trọng tâm. Hướng thứ nhất tập trung phân tích văn bản do người dùng sản sinh. Hướng thứ hai khai thác sâu chuỗi hành vi tương tác trên hệ thống. Cả hai phương pháp đều ứng dụng công nghệ học máy tiên tiến. Mô hình học sâu phân loại người dùng được triển khai để tăng cường độ chính xác. Phương pháp phân cụm người dùng (user clustering) giúp gom nhóm các đối tượng có đặc điểm tương đồng. Nghiên cứu mang tính thực tiễn cao khi thử nghiệm trên nền tảng thương mại điện tử thực tế. Dữ liệu tiếng Việt cũng được xử lý kỹ lưỡng để phù hợp với ngữ cảnh bản địa. Kết quả nghiên cứu mở ra hướng đi mới cho việc tối ưu hóa dịch vụ trực tuyến.

4.1. Phân tích tác giả văn bản tiếng Việt qua ngôn ngữ tự nhiên

Phân tích tác giả văn bản có lịch sử phát triển lâu dài. Trước đây, phương pháp này chủ yếu áp dụng cho sách báo hoặc tạp chí dài. Hiện nay, trọng tâm chuyển dịch sang các bài đăng mạng xã hội và email ngắn. Kỹ thuật xử lý ngôn ngữ tự nhiên phân tích tác giả (authorship profiling) giúp nhận diện đặc điểm người viết. Tiếng Việt có cấu trúc ngữ pháp và từ vựng đặc thù. Nghiên cứu về ngôn ngữ này trước đây còn khá hạn chế. Luận án tập trung xây dựng bộ trích xuất đặc trưng ngôn ngữ chuyên sâu cho tiếng Việt. Mô hình có thể dự đoán phong cách hành văn và đặc điểm tác giả chính xác. Phương pháp này giải quyết hiệu quả tính mở của các nội dung trực tuyến ngắn.

4.2. Phân tích hành vi trực tuyến và phân cụm người dùng thông minh

Phân tích hành vi là hướng đi mới nhưng mang lại hiệu quả vượt trội. Kỹ thuật này không yêu cầu thu thập nội dung tin nhắn riêng tư. Hệ thống tập trung quan sát thao tác duyệt trang, nhấp chuột và thời gian dừng. Mô hình học sâu phân loại người dùng tự động học các mẫu hình phức tạp từ luồng sự kiện. Thuật toán phân cụm người dùng (user clustering) tự động phân chia tập khách hàng thành các nhóm riêng biệt. Kết quả ứng dụng trên dữ liệu thương mại điện tử chứng minh tính khả thi cao. Nền tảng bán hàng có thể tự động thích ứng với từng nhóm hành vi. Giải pháp góp phần nâng cao hiệu quả vận hành và cá nhân hóa trải nghiệm khách hàng.

Mục lục chi tiết luận án

MỞ ĐẦU
1. CHƯƠNG 1: TỔNG QUAN VỀ XÁC ĐỊNH ĐẶC ĐIỂM NGƯỜI DÙNG
1.1. XÁC ĐỊNH ĐẶC ĐIỂM NGƯỜI DÙNG THÔNG QUA PHÂN TÍCH VĂN BẢN
1.1.1. Giới thiệu
1.1.2. Đặc điểm của văn bản trực tuyến
1.1.3. Các dạng thức trong phân tích tác giả văn bản
1.1.3.1. Nhận diện tác giả
2. CHƯƠNG 2: XÁC ĐỊNH ĐẶC ĐIỂM TÁC GIẢ BÀI VIẾT DIỄN ĐÀN TIẾNG VIỆT
3. CHƯƠNG 3: DỰ ĐOÁN GIỚI TÍNH KHÁCH HÀNG DỰA TRÊN DỮ LIỆU LỊCH SỬ TRUY CẬP HỆ TMĐT
KẾT LUẬN VÀ HƯỚNG NGHIÊN CỨU TIẾP THEO
PHỤ LỤC
Xem trước tài liệu
Tải đầy đủ để xem toàn bộ nội dung
Luận án một số phương pháp học máy xác định đặc điểm người dùng trên mạng internet

Tải xuống file đầy đủ để xem toàn bộ nội dung

Tải đầy đủ (142 trang)

Trích đoạn nội dung luận án

Tải xuống để đọc toàn bộ

1 MỞ ĐẦU Sự phát triển mạnh mẽ của Internet và các dịch vụ trên Internet có những tác động lớn đến nhiều mặt trong xã hội. Chỉ với một thiết bị được kết nối đến mạng Internet, người dùng có thể dễ dàng sử dụng các kênh trao đổi thông tin như website, email, diễn đàn, mạng xã hội, hoặc các dịch vụ khác như tìm kiếm thông tin, thương mại điện tử (TMĐT) v. Một đặc điểm chung của các hệ thống này là không bắt buộc người dùng cung cấp chính xác thông tin cá nhân khi sử dụng. Việc này nhằm khuyến khích và tạo thuận lợi cho người dùng trong quá trình sử dụng, tuy nhiên cũng tạo ra một số vấn đề.

Thứ nhất, người dùng có thể sử dụng các kênh trao đổi thông tin một cách nặc danh hoặc giả mạo, với mục đích xấu. Thứ hai, việc thiếu thông tin cá nhân người dùng làm cho các nhà cung cấp dịch vụ trên Internet gặp khó khăn trong việc cá nhân hóa hệ thống nhằm tăng trải nghiệm cho người dùng, thúc đẩy bán hàng, hoặc thực hiện các hoạt động quảng cáo trực tuyến hiệu quả hơn. Luận án này thực hiện nghiên cứu về vấn đề xác định các đặc điểm của người dùng dựa trên phân tích văn bản do người dùng tạo ra hoặc dựa trên phân tích hành vi người dùng thực hiện trên hệ thống bằng các phương pháp học máy. Các nội dung tiếp theo của phần này bao gồm: Phần 1.1 trình bày lý do lựa chọn đề tài.3 nêu các mục tiêu và đóng góp của luận án.

Nội dung của phần 1.4 là bố cục của toàn bộ luận án. LÝ DO LỰA CHỌN ĐỀ TÀI Xác định đặc điểm người dùng là một trong những mối quan tâm hàng đầu của các nhà cung cấp dịch vụ trên mạng Internet. Đặc biệt, trong bối cảnh xu hướng cá nhân hóa các hệ thống cho phù hợp với từng cá nhân người dùng, việc có được các thông tin về đặc điểm cá nhân của người dùng như giới tính, độ tuổi, nghề nghiệp, v. giúp cho các hệ thống có thể được tối ưu hóa theo các đặc điểm tương ứng hoặc hiển thị các thông tin quảng cáo, tiếp thị, giới thiệu sản phẩm phù hợp với người 2 dùng.

Việc xác định được đặc điểm người dùng còn trợ giúp cho các nhà quản lý trong việc hỗ trợ điều tra tội phạm trực tuyến. Trong các trường hợp tội phạm để lại dấu vết trên hệ thống như các bản tin trực tuyến hoặc các hành vi khác trên hệ thống, việc dựa vào các thông tin này để dự đoán các đặc điểm của tội phạm sẽ giúp khoanh vùng, thu hẹp phạm vi xác định tội phạm, thậm chí trong nhiều trường hợp có thể xác định đích danh tội phạm nếu danh sách nghi phạm là biết trước và có sự phân biệt. Khó khăn lớn nhất của các nhà cung cấp dịch vụ trên mạng Internet cũng như các nhà quản lý là đa phần người dùng không cung cấp hoặc cung cấp không đầy đủ và không chính xác các thông tin cá nhân khi sử dụng các hệ thống trực tuyến. Điều này nhằm bảo vệ tính riêng tư và an toàn thông tin của người dùng trước các tấn công mạng ngày càng phổ biến.

Vì vậy, phương pháp khả dĩ nhất để có được thông tin cá cá nhân người dùng là dự đoán từ các “dấu vết” người dùng để lại trên hệ thống như các bản tin được tạo ra, hay các hành vi người dùng thực hiện trên hệ thống. Kỹ thuật phân tích tác giả văn bản đã được nghiên cứu từ cách đây hàng thập kỷ, khởi đầu là trên các loại văn bản chính thống và có độ dài lớn như sách, tạp chí, bài báo, v. và tập trung vào vấn đề xác minh đích danh tác giả văn bản trong một danh sách tác giả đã được xác định trước (kỹ thuật này còn gọi là xác định tác giả văn bản, authorship attribution, sẽ được trình bày kỹ hơn ở chương sau). Gần đây, do sự phổ biến của các loại văn bản trực tuyến, vấn đề phân tích tác giả văn bản được thực hiện nhiều hơn trên loại văn bản này và tập trung vào xác định các đặc điểm của tác giả (author profiling) do các văn bản trực tuyến thường có độ mở cao nên thường không có thông tin về tác giả của văn bản.

Nhiều nghiên cứu đã được thực hiện trên các loại văn bản trực tuyến khác nhau (email, blog, bài viết mạng xã hội) và trên các ngôn ngữ khác nhau (tiếng Anh, tiếng Hà Lan, tiếng Trung Quốc, tiếng Hy Lạp v. Các nghiên cứu về xác định đặc điểm người dùng dựa trên phân tích hành vi ra đời muộn hơn và trở nên phổ biến trong những năm gần đây do xu hướng quảng cáo trực tuyến hướng đối tượng tăng mạnh trên các hệ thống như 3 website, máy tìm kiếm, thương mại điện tử v. Ưu điểm của kỹ thuật này là không cần thu thập các bản tin do người dùng tạo ra, nhưng việc thu thập các hành vi của người dùng trên hệ thống cũng không hề dễ dàng do chỉ các máy chủ mới có thể làm công việc này. Các nghiên cứu phổ biến trong lĩnh vực này được thực hiện trên các hệ thống như website thông tin, hệ thống mạng di động, v.

Luận án này thực hiện các nghiên cứu trên cả hai lĩnh vực: xác định đặc điểm tác giả văn bản và xác định đặc điểm người dùng dựa trên hành vi. Các nghiên cứu về xác định đặc điểm tác giả văn bản được thực hiện trên các văn bản tiếng Việt là loại ngôn ngữ chưa được nghiên cứu nhiều. Các nghiên cứu về xác định đặc điểm người dùng dựa trên hành vi được thực hiện trên dữ liệu của hệ thống thương mại điện tử. Đây là hệ thống có khả năng áp dụng cao kết quả nghiên cứu do đặc thù bán hàng trực tuyến và theo khảo sát của chúng tôi thì chưa có nghiên cứu nào trước đây về xác định đặc điểm người dùng được thực hiện trên loại hệ thống này.

MỤC TIÊU CỦA LUẬN ÁN Dựa trên nhu cầu thực tiễn và các kết quả nghiên cứu trước đây ở trong nước và quốc tế, luận án đặt ra các mục tiêu chính như sau: - Nghiên cứu vấn đề xác định đặc điểm tác giả văn bản trên loại văn bản mới, chưa được nghiên cứu trước đây. Cụ thể là trên các bài viết diễn đàn tiếng Việt. Thực nghiệm các loại đặc trưng và các phương pháp phân loại để chọn ra các đặc trưng và phương pháp phân loại phù hợp. - Nghiên cứu các phương pháp trích chọn đặc trưng mới cho vấn đề xác định đặc điểm tác giả văn bản, nhằm tăng độ chính xác hoặc tính độc lập trong quá trình nhận diện.

Các phương pháp trích chọn mới có thể tận dụng các đặc điểm đặc thù của ngôn ngữ tiếng Việt để áp dụng trên các văn bản đồng ngôn ngữ. Tuy nhiên, cũng có khả năng áp dụng sang các loại ngôn ngữ khác. - Nghiên cứu vấn đề xác định đặc điểm người dùng dựa trên hành vi trong các hệ thống có nhu cầu cá nhân hóa cao như hệ thống TMĐT. Nghiên 4 cứu, đề xuất các phương pháp trích chọn đặc trưng hiệu quả và các phương pháp phân loại phù hợp.

- Xây dựng ứng dụng thử nghiệm kết quả nghiên cứu của luận án. PHẠM VI NGHIÊN CỨU Xác định đặc điểm người dùng là một lĩnh vực rộng, trên cả khía cạnh loại người dùng và đặc điểm người dùng. Luận án xác định các đối tượng người dùng trong các nghiên cứu là người dùng trên mạng Internet (là người dùng của các hệ thống phổ biến trên Internet như website, email, diễn đàn, hệ thống TMĐT. Do tính mở của mạng Internet và để bảo đảm tính riêng tư, người dùng thường ít tiết lộ đặc điểm cá nhân khi sử dụng và việc xác định đặc điểm người dùng có ý nghĩa quan trọng như đã trình bày ở trên.

Đối với nghiên cứu xác định đặc điểm người dùng dựa trên phân tích văn bản, hiện có nhiều loại văn bản trên nhiều ngôn ngữ đã được các nhà khoa học trên thế giới nghiên cứu, trong đó, các nghiên cứu mới nhất tập trung vào các loại văn bản trực tuyến như thư điện tử (email), nhật ký trực tuyến (blog), bài viết mạng xã hội (social network). Luận án này thực hiện các nghiên cứu về xác định đặc điểm tác giả bài viết diễn đàn tiếng Việt. Đây là một loại văn bản chưa được nghiên cứu nhiều, đặc biệt trong ngôn ngữ tiếng Việt. Các đặc điểm nhận diện bao gồm giới tính, độ tuổi, nghề nghiệp, và vùng miền.

Xác định đặc điểm người dùng dựa trên phân tích hành vi cũng là một lĩnh vực nghiên cứu được quan tâm những năm gần đây. Tuy nhiên, do có sự hạn chế trong vấn đề thu thập dữ liệu mẫu (dữ liệu về hành vi người dùng thường lưu trữ trên máy chủ của các hệ thống và không thể tự động thu thập được các dữ liệu này nếu không có sự cho phép của đơn vị quản lý hệ thống), luận án này chỉ thực hiện nghiên cứu về dự đoán đặc điểm giới tính của khách hàng dựa trên dữ liệu truy cập hệ thống TMĐT. CÁC ĐÓNG GÓP CỦA LUẬN ÁN Để thực hiện các mục tiêu trên, các nghiên cứu về mặt lý thuyết, đồng thời các 5 thực nghiệm thực tế đã được thực hiện để ra các kết quả định lượng. Các đóng góp chính của luận án bao gồm: Đóng góp trong lĩnh vực xác định đặc điểm tác giả văn bản: - Nghiên cứu việc ứng dụng các loại đặc trưng và phương pháp nhận diện khác nhau, trong đó tập trung phân tích sâu về các đặc trưng dựa trên nội dung, cho vấn đề xác định đặc điểm tác giải bài viễn diễn đàn tiếng Việt.

Trước đây, đã có một số công trình nghiên cứu việc sử dụng các từ nội dung cho việc xác định đặc điểm tác giả văn bản, nhưng chưa có các phân tích sâu. Đặc biệt, chưa có nghiên cứu nào thực hiện trên ngôn ngữ tiếng Việt. - Đề xuất một loại đặc trưng mới cho việc xác định đặc điểm tác giả bài viết diễn đàn tiếng Việt. Các đặc trưng mới giúp cho việc nhận diện có độ chính xác cao hơn các đặc trưng cơ bản (dựa trên phong cách), có tính độc lập hơn so với các đặc trưng nội dung, và khi kết hợp với các đặc trưng phong cách hoặc nội dung thì cho kết quả cao hơn.

Đây là các đặc trưng dựa trên đặc thù tiếng Việt như vần và âm tiết, tuy nhiên cũng có thể mở rộng áp dụng sang các ngôn ngữ khác và các loại văn bản khác.

Nội dung được bảo vệ bản quyền — Tải xuống đầy đủ

Trích dẫn luận án này

Luận án học máy xác định đặc điểm người dùng trên Internet (n.d.) [Luận án tiến sĩ]. LuanAn.net. https://luanan.net/cong-nghe-thong-tin/tri-tue-nhan-tao/luan-an-hoc-may-xac-dinh-dac-diem-nguoi-dung-tren-internet

Câu hỏi thường gặp

Luận án "Luận án học máy xác định đặc điểm người dùng trên Internet" nghiên cứu về vấn đề gì?

Luận án tập trung vào ứng dụng học máy xác định đặc điểm người dùng trên mạng internet. Nghiên cứu đề xuất các phương pháp cải tiến hiệu quả trong lĩnh vực này.

Luận án "Luận án học máy xác định đặc điểm người dùng trên Internet" thuộc chuyên ngành gì?

Luận án "Luận án học máy xác định đặc điểm người dùng trên Internet" thuộc chuyên ngành Học máy. Danh mục: Trí Tuệ Nhân Tạo.

Luận án "Luận án học máy xác định đặc điểm người dùng trên Internet" có bao nhiêu trang?

Luận án "Luận án học máy xác định đặc điểm người dùng trên Internet" có 142 trang. Bạn có thể xem trước một phần tài liệu ngay trên trang web trước khi tải về.

Cách tải luận án "Luận án học máy xác định đặc điểm người dùng trên Internet" về máy như thế nào?

Để tải luận án về máy, bạn nhấn nút "Tải xuống ngay" trên trang này, sau đó hoàn tất thanh toán phí lưu trữ. File sẽ được tải xuống ngay sau khi thanh toán thành công. Hỗ trợ qua Zalo: 0559 297 239.

Luận án liên quan

Chia sẻ tài liệu: Facebook Twitter