
Những công bố chiến lược tại Apsara Conference 2026 đã phác thảo một lộ trình hoàn chỉnh về sự hội tụ giữa bán dẫn tự chủ, hạ tầng đám mây quy mô Gigawatt và thuật toán mô hình quy mô 10 nghìn tỷ tham số. Bằng cách đồng bộ hóa thiết kế chip Zhenwu V900 cùng kiến trúc đám mây ba tầng tối ưu cho Agentic AI, Alibaba Cloud đang thiết lập một chuẩn mực mới trong nỗ lực thu hẹp khoảng cách công nghệ bán dẫn và trí tuệ nhân tạo toàn cầu.
Nền tảng vi kiến trúc Qwen 4 và chiến lược quy mô 5-10 nghìn tỷ tham số
Sự xuất hiện của dòng mô hình Qwen 4 với 4 phân tầng độc lập (Max, Plus, Flash và 27B) phản ánh bước tiến vững chắc trong kỹ thuật tối ưu hóa trọng số mô hình của nhóm nghiên cứu Qwen. Kế thừa các thử nghiệm kiến trúc từ bản Qwen3.8-Flash-Next phát hành vào tháng 8, Qwen 4 tích hợp ba kỹ thuật xử lý then chốt: Cơ chế chú ý thưa truy vấn (Query Sparse Attention – QSA) nhằm triệt tiêu độ phức tạp tính toán bậc hai trên các chuỗi văn bản dài, kết nối phần dư có cổng kiểm soát (Gated Residual Connections) giúp duy trì gradient ổn định trong các tầng sâu, và hệ thống nhúng n-gram (n-gram embeddings) mở rộng khả năng nhận diện cụm từ vựng ngữ cảnh.
Đặc biệt, tuyên bố của CEO Eddie Wu về việc mở rộng quy mô tham số lên mức 5.000 đến 10.000 tỷ tham số (5-10T MoE) trên các thế hệ Qwen 4.5 và Qwen 5 đặt ra bài toán tối ưu hạ tầng ở mức độ chưa từng có tiền lệ. Kiến trúc MoE (Mixture of Experts) quy mô chục nghìn tỷ tham số cho phép mô hình kích hoạt có chọn lọc các cụm chuyên gia (Active Parameters) theo từng bước suy luận, giải quyết triệt để sự suy giảm tính nhất quán trong các chuỗi tác vụ dài hạn (Long-horizon Tasks) của các hệ thống tác tử tự hành phân tán.

Năng lực gia tốc của chip Zhenwu V900 và kiến trúc cụm 500.000 node
Để hiện thực hóa việc huấn luyện và suy luận các mô hình ở quy mô 10T, phân nhánh T-Head đã giới thiệu bộ tăng tốc AI Zhenwu V900 (Chân Võ V900) với mức tăng hiệu năng gấp 3 lần so với phiên bản M890 tiền nhiệm. Điểm nhấn kiến trúc của Zhenwu V900 nằm ở việc tích hợp 216 GB bộ nhớ băng thông cao trên cùng một đế bán dẫn và hỗ trợ băng thông kết nối liên chip (Inter-chip Interconnect) lên tới 1.200 GB/s.
Thiết kế giao tiếp tốc độ cao này cho phép Zhenwu V900 mở rộng cấu trúc mạng song song tensor (Tensor Parallelism) và song song đường ống (Pipeline Parallelism) trên quy mô cụm siêu máy tính lên tới 500.000 chip. Lộ trình thương mại hóa và sản xuất hàng loạt vào Quý 1/2027 cho thấy năng lực thiết kế chip chuyên dụng (ASIC/NPU) của Trung Quốc đang chủ động bù đắp các rào cản chuỗi cung ứng máy quang học bằng cách mở rộng quy mô tính toán song song và gia tăng mật độ bộ nhớ đệm nội hạt.
Hạ tầng đám mây 20GW và hệ điều hành đám mây ba tầng cho Agentic AI
Bên cạnh mô hình và chip xử lý, Alibaba xác lập mục tiêu vận hành hạ tầng trung tâm dữ liệu AI toàn cầu vượt mức 20 Gigawatt vào năm 2032 – một quy mô năng lượng phản ánh tốc độ chuyển dịch nhanh chóng từ điện toán ảo hóa truyền thống sang trung tâm suy luận AI tập trung. Để quản trị nguồn tài nguyên khổng lồ này, Alibaba Cloud giới thiệu cấu trúc điện toán ba tầng:
- AI Native Cloud: Quản trị phần cứng, hệ thống làm mát chất lỏng và tối ưu hóa tài nguyên mạng RoCE v2 ở cấp độ cụm máy chủ.
- Agent Native Cloud: Môi trường điều phối (Orchestration Engine) cung cấp môi trường sandbox an toàn, phân bổ quyền thực thi API và quản lý vòng đời của các tác tử phần mềm tự hành.
- Dedicated Context Engine: Phân tầng bộ nhớ đệm ngữ cảnh chuyên biệt giúp duy trì trạng thái hội thoại và dữ liệu bộ nhớ dài hạn với độ trễ tính bằng mili-giây.
Sự kết hợp giữa Qwen 4, vi xử lý Zhenwu V900 và hạ tầng đám mây 20GW khẳng định bước chuyển dịch từ kỷ nguyên mô hình tạo sinh thụ động (Generative AI) sang kỷ nguyên tự hành chủ động (Agentic AI), nơi năng lực tính toán và trí tuệ máy móc trở thành động lực công nghiệp hóa cốt lõi trong thập kỷ tới.





















