AI·NEWS
Mô hình AI Nguồn: The Verge 19:00:15 20/9/2026

Google DeepMind ra mắt Gemini 2.0 Multimodal: AI hiểu và tạo nội dung hình ảnh‑văn bản đồng thời

Gemini 2.0 tích hợp khả năng xử lý hình ảnh, video và văn bản trong một mô hình duy nhất, đạt điểm số mới trên benchmark VQA và Captioning.

Google DeepMind ra mắt Gemini 2.0 Multimodal: AI hiểu và tạo nội dung hình ảnh‑văn bản đồng thời

DeepMind, đơn vị nghiên cứu AI của Google, hôm nay công bố phiên bản nâng cấp của mô hình Gemini – Gemini 2.0 Multimodal. Đây là mô hình đầu tiên có khả năng đồng thời hiểu và tạo ra nội dung từ cả hình ảnh, video và văn bản trong một kiến trúc duy nhất, thay vì sử dụng các mô hình riêng biệt.

Gemini 2.0 được đào tạo trên hơn 10 nghìn tỷ token đa phương tiện, bao gồm video YouTube, ảnh Flickr và văn bản web. Kết quả thử nghiệm cho thấy mô hình đạt điểm số 92.3 trên benchmark VQA (Visual Question Answering) và 88.7 trên COCO Captioning, vượt qua các đối thủ hiện tại như GPT‑4 Vision và LLaVA.

Một tính năng nổi bật là khả năng “cross‑modal reasoning”, cho phép mô hình trả lời các câu hỏi phức tạp như “Trong video này, nhân vật chính đang làm gì sau khi mở cửa?” một cách chính xác, đồng thời tạo ra mô tả chi tiết cho các khung hình trong thời gian thực.

Google DeepMind cho biết Gemini 2.0 sẽ được tích hợp vào các sản phẩm như Google Photos, Google Docs và Android Studio, giúp nâng cao trải nghiệm người dùng trong việc tìm kiếm, chỉnh sửa và tạo nội dung đa phương tiện.

Về trang chủ

Nội dung do AI tổng hợp, tham khảo theo nguồn "The Verge"