Google vừa chính thức đưa mô hình Gemini Omni Flash lên trạng thái phát hành rộng rãi (Generally Available – GA) trên Gemini API, đánh dấu cột mốc quan trọng trong cuộc đua trí tuệ nhân tạo đa phương thức thế hệ mới. Bằng việc tối ưu hóa đồng thời khả năng xử lý văn bản, âm thanh, thị giác và kết xuất video thời gian thực với mức giá cạnh tranh khốc liệt, Google đang trực tiếp tạo áp lực lớn lên các đối thủ như OpenAI và Runway.

Kiến trúc Native Omni-Multimodal: Độ trễ phản hồi dưới 1 giây
Khác với các hệ thống AI truyền thống phải ghép nối nhiều mô hình riêng lẻ (mô hình chuyển giọng nói thành văn bản, mô hình ngôn ngữ lớn và mô hình chuyển văn bản thành giọng nói), Gemini Omni Flash được đào tạo theo kiến trúc đa phương thức gốc (Native Multimodal).
Điều này cho phép mô hình tiếp nhận đồng thời luồng video trực tiếp, âm thanh môi trường và văn bản câu lệnh, sau đó phản hồi tức thì với độ trễ cực thấp (Sub-second Latency). Khả năng hiểu ngữ điệu giọng nói và nhận diện chuyển động thị giác mở ra tiềm năng ứng dụng khổng lồ cho các thiết bị thông minh, kính thực tế ảo và hệ thống chăm sóc khách hàng tự động.
Cuộc chiến phá giá công nghệ tạo video AI trên thị trường điện toán đám mây
Điểm chấn động nhất của đợt ra mắt này nằm ở biểu phí dịch vụ: tạo video độ dài lên đến 40 giây với mức giá chỉ 0,03 USD/giây (tương đương khoảng 1,2 USD cho một video hoàn chỉnh).
Mức giá này chỉ bằng một phần nhỏ so với các nền tảng tạo video AI chuyên dụng hiện nay trên thị trường, đồng thời hỗ trợ nạp xuất dữ liệu trực tiếp qua API đám mây. Động thái này được giới chuyên gia đánh giá là bước đi chiến lược của Google nhằm phổ cập hóa năng lực tạo video AI đến hàng triệu lập trình viên và doanh nghiệp, thúc đẩy quá trình chuyển đổi số toàn diện.

















