Meta AI đã ra mắt Vision Pro, một mô hình AI đa phương tiện (multimodal) có khả năng phân tích, mô tả và tạo ra nội dung video và hình ảnh dựa trên mô tả bằng văn bản. Vision Pro được xây dựng trên kiến trúc “Cross-Modal Transformer” với 850 tỷ tham số, cho phép nó đồng thời xử lý các luồng dữ liệu hình ảnh, video và âm thanh.
Một trong những tính năng nổi bật là “Real‑Time Scene Synthesis”, cho phép người dùng nhập một đoạn mô tả ngắn và nhận ngay một video ngắn 10‑giây được tạo ra hoàn toàn bằng AI. Mô hình này đã được thử nghiệm trong các dự án quảng cáo và nội dung truyền thông, giảm thời gian sản xuất từ vài ngày xuống chỉ vài giờ.
Meta AI cũng công bố bộ SDK mới cho nhà phát triển, hỗ trợ tích hợp Vision Pro vào các ứng dụng thực tế ảo (VR) và thực tế tăng cường (AR). Các công cụ này bao gồm API cho việc nhận dạng đối tượng, tạo bối cảnh 3D và chỉnh sửa video tự động.
Theo báo cáo ban đầu, các đối tác thương mại đã ghi nhận tăng 20% tương tác người dùng và giảm 30% chi phí sản xuất nội dung so với quy trình truyền thống. Vision Pro sẽ được triển khai trên nền tảng Meta Cloud vào cuối năm 2026.