AI·NEWS
Dự án GitHub Nguồn: TechCrunch 05:00:12 20/9/2026

VisionFusion: Thư viện mã nguồn mở cho mô hình đa phương tiện trên GitHub

VisionFusion cung cấp bộ khung học liên hợp hình ảnh và ngôn ngữ, hỗ trợ tạo nội dung video từ mô tả văn bản.

VisionFusion: Thư viện mã nguồn mở cho mô hình đa phương tiện trên GitHub

Nhóm nghiên cứu tại University of California, Berkeley đã phát hành VisionFusion, một thư viện mã nguồn mở trên GitHub nhằm hỗ trợ phát triển các mô hình AI đa phương tiện (vision-language).

VisionFusion cung cấp các mô-đun tiền xử lý, kiến trúc transformer đa chiều và các công cụ đánh giá chuẩn cho các tác vụ như text-to-image, image captioning và video generation. Thư viện được viết bằng PyTorch và hỗ trợ cả TensorFlow, cho phép người dùng dễ dàng chuyển đổi giữa các framework.

Điểm mạnh của VisionFusion là khả năng tích hợp các mô hình pre-trained như CLIP, DALL·E và Whisper, giúp giảm thời gian huấn luyện cho các dự án mới. Thư viện còn đi kèm với một bộ dữ liệu mẫu gồm 5 triệu cặp hình ảnh - mô tả, được thu thập từ các nguồn công cộng.

Kể từ khi ra mắt, VisionFusion đã nhận được hơn 8.500 sao và 600 fork, và đã được một số startup trong lĩnh vực quảng cáo và giáo dục sử dụng để tạo nội dung tự động. Nhóm phát triển hứa hẹn sẽ cập nhật thêm các tính năng hỗ trợ video synthesis trong các phiên bản tiếp theo.

Về trang chủ

Nội dung do AI tổng hợp, tham khảo theo nguồn "TechCrunch"