Báo cáo phân tích mối đe dọa vừa được BleepingComputer công bố đã làm sáng tỏ một kỹ thuật tấn công phi kỹ thuật (Social Engineering) thế hệ mới đang được các nhóm tội phạm mạng triển khai trên diện rộng. Bằng việc vũ khí hóa các ký tự điều khiển định dạng có độ rộng bằng không (Zero-Width Characters) trong bảng mã chuẩn Unicode, các tác nhân đe dọa đã tìm ra kẽ hở nghiêm trọng trong cơ chế phân tích cú pháp và kiểm duyệt nội dung của các cổng bảo mật thư điện tử (Secure Email Gateway – SEG) cũng như hệ thống giám sát an ninh mạng ứng dụng học máy.

Bản chất kỹ thuật của các mã định danh Zero-Width Characters trong bảng mã UTF-8
Bảng mã chuẩn Unicode tích hợp một tập hợp các ký tự đặc biệt phục vụ việc định dạng hiển thị văn bản đa ngôn ngữ, tiêu biểu như Zero-Width Space (U+200B), Zero-Width Non-Joiner (U+200C) và Zero-Width Joiner (U+200D).
Về mặt hiển thị đồ họa (Rendering), các ký tự này hoàn toàn không chiếm dụng bất kỳ pixel chiều ngang nào và hoàn toàn vô hình đối với người dùng cuối khi đọc văn bản trên giao diện web hoặc trình duyệt mail. Tuy nhiên, ở tầng dữ liệu nhị phân (Binary Level), mỗi ký tự này lại tương ứng với chuỗi byte xác định (ví dụ U+200B được mã hóa thành 3 byte 0xE2 0x80 0x8B trong chuẩn UTF-8). Khi tin tặc chèn ngẫu nhiên các byte này vào giữa các từ khóa nhạy cảm hoặc chuỗi tên miền trong liên kết URL, chuỗi văn bản bị phân tách thành các mảnh dữ liệu rời rạc, phá vỡ hoàn toàn khả năng đối soát chuỗi ký tự (String Matching) của bộ lọc bảo mật.
Sự tê liệt của thuật toán phân tích Tokenization và giải pháp chuẩn hóa chuỗi
Hầu hết các hệ thống phát hiện lừa đảo hiện đại, bao gồm cả các mô hình xử lý ngôn ngữ tự nhiên (NLP) và bộ quét biểu thức chính quy (Regex), đều phụ thuộc vào quá trình phân tách từ khóa (Tokenization).
Sự hiện diện của các ký tự độ rộng bằng không khiến chuỗi từ khóa quen thuộc như “login”, “password” hay “account” bị xé nhỏ thành các token rác vô nghĩa, khiến hệ thống an ninh phân loại nhầm đây là nội dung an toàn. Để giải quyết triệt để vấn đề này, các chuyên gia khuyến nghị các kỹ sư an ninh mạng cần bổ sung bước tiền xử lý chuẩn hóa chuỗi Unicode (Unicode Normalization Form KC – NFKC) trước khi đưa văn bản vào bộ phân tích. Việc tự động loại bỏ tất cả các ký tự điều khiển không in được (Non-printable Control Characters) sẽ khôi phục lại cấu trúc văn bản nguyên bản, cho phép hệ thống phòng thủ phát hiện và ngăn chặn kịp thời các cuộc tấn công ngụy trang tinh vi.






















