Báo cáo nghiên cứu an ninh mạng vừa được đội ngũ kỹ thuật Amazon Web Services (AWS) công bố cùng bộ dữ liệu kiểm định mở Deception Benchmark đã làm sáng tỏ khoảng cách lớn giữa kỳ vọng thương mại và năng lực thực tế của các mô hình ngôn ngữ lớn (LLM) trong lĩnh vực kiểm thử xâm nhập và phân tích mã nguồn tĩnh (SAST). Kết quả đánh giá trên 12 mô hình nền tảng hàng đầu từ 5 nhà cung cấp lớn phơi bày thực tế rằng việc ứng dụng AI vào chu trình vận hành an ninh (SecOps) đang tạo ra gánh nặng dương tính giả khổng lồ cho các doanh nghiệp công nghệ.
Phân tích kỹ thuật bộ dữ liệu Deception Benchmark trên 16 ngôn ngữ lập trình
Để đo lường khả năng phân biệt giữa một lỗ hổng bảo mật có thể khai thác thực tế và một đoạn mã trông có vẻ rủi ro nhưng thực chất an toàn, AWS đã xây dựng bộ chuẩn Deception Benchmark gồm 14.822 mẫu mã nguồn độc lập.
Tập dữ liệu bao phủ 16 ngôn ngữ lập trình phổ biến (như C/C++, Java, Python, Go, Rust, JavaScript) và trải rộng trên hơn 70 danh mục lỗ hổng phần mềm phổ biến theo chuẩn CWE (Common Weakness Enumeration). Khi sử dụng kỹ thuật Prompting trực tiếp, dù các mô hình AI phát hiện được phần lớn các lỗ hổng thật nhưng độ chính xác (Precision) chỉ dao động ở mức nghèo nàn từ 52% đến 71%. AI gắn cờ nhầm từ 41% đến 99% đối với các khối mã nguồn an toàn, nguyên nhân chủ yếu do mô hình bị đánh lừa bởi các đoạn mã giả lập rủi ro mà không có khả năng phân tích toàn diện chuỗi phụ thuộc bên ngoài.

Nghịch lý đánh đổi giữa FPR và FNR cùng bài toán bối cảnh kiểm soát ngoại vi
Điểm đáng chú ý nhất trong phân tích của AWS là sự thất bại của các kỹ thuật tinh chỉnh câu lệnh nhằm khắc phục lỗi dương tính giả (False Positive Rate – FPR).
Khi nhóm nghiên cứu yêu cầu AI phải xây dựng kịch bản chứng minh khái niệm khai thác (PoC Exploitation Verification), tỷ lệ báo động giả giảm được từ 17 đến 74 điểm phần trăm. Tuy nhiên, điều này lập tức kéo theo sự gia tăng nguy hiểm của tỷ lệ âm tính giả (False Negative Rate – FNR), khiến AI bỏ sót từ 7% đến 44% các lỗ hổng bảo mật nghiêm trọng. AI gặp khó khăn lớn nhất khi đoạn mã nguồn nằm trong một kiến trúc có rào chắn bảo vệ ngoại vi (External Security Controls) vô hiệu hóa đường dẫn tấn công. AWS kết luận rằng các mô hình AI đơn lẻ chưa thể vận hành độc lập như một giải pháp bảo mật tự trị mà bắt buộc phải tích hợp vào các hệ thống xác thực đa tầng với sự giám sát chặt chẽ của con người.




















