AI·NEWS
Dự án GitHub Nguồn: GitHub Blog 11:00:11 20/9/2026

Dự án GitHub “Vision‑LLM” – Mô hình ngôn ngữ lớn tích hợp khả năng nhìn

Vision‑LLM cho phép truy vấn hình ảnh bằng ngôn ngữ tự nhiên, hỗ trợ nhận dạng đối tượng và mô tả chi tiết.

Dự án GitHub “Vision‑LLM” – Mô hình ngôn ngữ lớn tích hợp khả năng nhìn

Nhóm nghiên cứu tại Facebook AI Research (FAIR) đã phát hành dự án mở “Vision‑LLM” trên GitHub, một mô hình ngôn ngữ lớn (LLM) được tích hợp khả năng thị giác. Vision‑LLM có thể nhận dạng, mô tả và trả lời câu hỏi liên quan đến nội dung hình ảnh chỉ bằng văn bản.

Mô hình được huấn luyện trên bộ dữ liệu đa phương tiện CLIP‑V2, bao gồm hơn 1,2 tỷ cặp hình ảnh‑văn bản. Nhờ kiến trúc Transformer kép, Vision‑LLM có thể đồng thời xử lý token ngôn ngữ và patch hình ảnh, cho phép tạo ra câu trả lời chi tiết như “Bức ảnh cho thấy một con chó nâu đang chạy trên cánh đồng hoa hồng”.

Dự án đã thu hút hơn 3.200 sao và 800 fork trên GitHub trong vòng 24 giờ. Cộng đồng đã nhanh chóng đóng góp các plugin để tích hợp Vision‑LLM vào các ứng dụng chatbot, hệ thống hỗ trợ khách hàng và công cụ tạo nội dung.

FAIR công bố sẽ tiếp tục mở rộng mô hình với dữ liệu video và âm thanh, đồng thời cung cấp phiên bản nhẹ hơn dành cho thiết bị di động. Tài liệu hướng dẫn chi tiết và các notebook demo đã được đính kèm trong repository.

Về trang chủ

Nội dung do AI tổng hợp, tham khảo theo nguồn "GitHub Blog"