Bài báo: Robust Vietnamese Phishing Email Detection under Orthographic Distribution Shift

Nhóm tác giả

  • Lâm Vĩnh Nguyên – CH An toàn thông tin – Tác giả chính
  • Duc Dat Pham (University of Science) – Đồng tác giả
  • Dinh Long Nguyen (International University) – Đồng tác giả

Giảng viên hướng dẫn

  • TS. Lê Duy Tân

Tóm tắt

Bài báo nghiên cứu khả năng phát hiện email lừa đảo tiếng Việt trong điều kiện nội dung email bị thay đổi về chính tả hoặc cách viết nhằm né tránh các hệ thống phát hiện tự động. Nghiên cứu xây dựng bộ dữ liệu gồm hơn 20.000 email và so sánh các mô hình học máy truyền thống, CNN và Transformer trên cả dữ liệu thông thường và dữ liệu đã được biến đổi.

Kết quả cho thấy PhoBERT đạt hiệu quả cao nhất trên dữ liệu thông thường, trong khi Random Forest sử dụng TF-IDF và character n-gram cho kết quả ổn định hơn khi dữ liệu bị biến đổi. Ngoài ra, nghiên cứu đề xuất cơ chế hỗ trợ người dùng kiểm tra lại những trường hợp mà mô hình có thể đưa ra dự đoán chưa thực sự chắc chắn.

Thành tích nổi bật

Công trình đã được trao giải Best Paper Award tại Hội nghị khoa học quốc tế FICTA 2026.

Bài báo được công bố tại hội nghị quốc tế

FICTA 2026 (Frontiers of Intelligent Computing: Theory and Applications) là hội nghị khoa học quốc tế có phản biện trong lĩnh vực tính toán thông minh (Intelligent Computing) và các ứng dụng trong khoa học máy tính cũng như các ngành kỹ thuật khác, được tổ chức bởi London Metropolitan University (Vương quốc Anh).

Các bài báo được chấp nhận thông qua quy trình phản biện khoa học và được xuất bản trong bộ sách Springer Smart Innovation, Systems and Technologies (SIST).

image 37