
Kể từ khi các mô hình khuếch tán video bùng nổ, thách thức lớn nhất của ngành trí tuệ nhân tạo không còn nằm ở độ phân giải điểm ảnh mà nằm ở bài toán duy trì tính nhất quán thời gian trên diện rộng (long-horizon temporal consistency). Sự tích tụ sai số giữa các đoạn cắt cảnh độc lập luôn dẫn đến hiện tượng trôi dạt ngữ nghĩa (semantic drift) và sụp đổ nội dung (content collapse). Trong báo cáo công bố ngày 24/09/2026, Google Research đã thiết lập một cột mốc công nghệ mới với bộ khung điều phối đa tác tử AI Video Co-Director cùng các kiến trúc bổ trợ CANVAS, A²RD và VQQA, cho phép tự động hóa hoàn toàn quy trình sinh video tự sự dài 10 phút.
Lớp điều phối phân tầng và bài toán tối ưu hóa toàn cục
Khác biệt cốt lõi trong nghiên cứu của Google là việc chuyển đổi mô hình sinh video từ chuỗi lệnh tuyến tính sang bài toán tối ưu hóa toàn cục (global optimization). Đứng đầu hệ thống là Orchestrator Agent vận hành dựa trên thuật toán Multi-Armed Bandit (MAB). Tác tử này có nhiệm vụ phân tích đề bài và định hướng cấu hình sáng tạo qua ba chiều kích: Chiến lược sáng tạo (ý đồ), Phương thức tự sự (cấu trúc cốt truyện) và Khuôn mẫu thẩm mỹ (ngôn ngữ điện ảnh).
Các chỉ thị có cấu trúc từ MAB được truyền tải tuần tự xuống các tác tử tiền kỳ (Pre-Production) để tạo kịch bản phân cảnh, sau đó phân tách cho các tác tử chuyên biệt: Keyframe Agent chịu trách nhiệm neo giữ hình ảnh cốt lõi, Video Agent đảm nhận render chuyển động thông qua nền tảng Veo, và Audio Agent đồng bộ hóa giọng đọc cùng nhạc nền. Cuối chu trình, một tác tử đánh giá đa phương thức (MLLM Judge) sẽ chấm điểm bản cắt hoàn chỉnh và gửi tín hiệu phản hồi (factored reward signal) ngược về thuật toán MAB để tinh chỉnh ở các vòng lặp tiếp theo. Toàn bộ quy trình được tích hợp sẵn lớp bảo vệ bản quyền và nhận diện nguồn gốc qua công nghệ thủy vân vô hình SynthID.

Bộ nhớ thị giác bền vững CANVAS và cơ chế tự sửa lỗi VQQA
Để giải quyết triệt để sự biến dạng của thực thể qua các bước nhảy thời gian dài, Google giới thiệu kiến trúc CANVAS (sẽ được công bố chính thức tại hội nghị EMNLP 2026). Được xây dựng như một lớp điều phối trên nền tảng Gemini, CANVAS duy trì một bộ nhớ thị giác bền vững (Persistent Visual Memory) nhằm lưu vết trạng thái thế giới (world-state tracking). Khi thực hiện các chuỗi cảnh phức tạp, hệ thống liên tục truy xuất các neo thị giác (visual anchors), giúp các yếu tố như trang phục nhân vật, đặc điểm khuôn mặt và bố cục không gian giữ được độ ổn định tuyệt đối ngay cả khi máy quay chuyển cảnh sang vị trí khác rồi mới quay lại. Kết quả thử nghiệm trên HardContinuityBench cho thấy CANVAS nâng cao 21.6% độ nhất quán phông nền và 9.6% độ bền vững nhân vật so với các mô hình độc lập.
Song hành cùng CANVAS là kiến trúc sinh tự hồi quy A²RD, kết hợp linh hoạt giữa phương pháp ngoại suy để mở rộng cốt truyện và nội suy để bảo toàn các đối tượng cũ, duy trì phim ngắn 10 phút liên tục mà không làm suy giảm chất lượng hiển thị. Đồng thời, mô-đun VQQA đóng vai trò như một bộ tối ưu hóa prompt hộp đen (black-box prompt optimizer). Bằng cách đặt câu hỏi thị giác và dùng đánh giá của mô hình VLM làm gradient ngữ nghĩa, VQQA tự động phát hiện và khắc phục các lỗi ràng buộc thuộc tính (attribute binding errors) ngay trong không gian tiềm ẩn.
Công trình của Google Research đánh dấu bước chuyển mình quan trọng từ kỷ nguyên tạo clip ngắn ngẫu nhiên sang kỷ nguyên sản xuất nội dung điện toán có kiểm soát và cấu trúc chặt chẽ.




















