DeepMind, đơn vị nghiên cứu AI của Google, hôm nay công bố phiên bản nâng cấp của mô hình Gemini – Gemini 2.0 Multimodal. Đây là mô hình đầu tiên có khả năng đồng thời hiểu và tạo ra nội dung từ cả hình ảnh, video và văn bản trong một kiến trúc duy nhất, thay vì sử dụng các mô hình riêng biệt.
Gemini 2.0 được đào tạo trên hơn 10 nghìn tỷ token đa phương tiện, bao gồm video YouTube, ảnh Flickr và văn bản web. Kết quả thử nghiệm cho thấy mô hình đạt điểm số 92.3 trên benchmark VQA (Visual Question Answering) và 88.7 trên COCO Captioning, vượt qua các đối thủ hiện tại như GPT‑4 Vision và LLaVA.
Một tính năng nổi bật là khả năng “cross‑modal reasoning”, cho phép mô hình trả lời các câu hỏi phức tạp như “Trong video này, nhân vật chính đang làm gì sau khi mở cửa?” một cách chính xác, đồng thời tạo ra mô tả chi tiết cho các khung hình trong thời gian thực.
Google DeepMind cho biết Gemini 2.0 sẽ được tích hợp vào các sản phẩm như Google Photos, Google Docs và Android Studio, giúp nâng cao trải nghiệm người dùng trong việc tìm kiếm, chỉnh sửa và tạo nội dung đa phương tiện.