VisionFusion, một dự án mã nguồn mở mới được đăng tải trên GitHub vào ngày 18/09/2026, đã nhanh chóng thu hút hơn 150.000 sao nhờ khả năng tạo ảnh đa mô hình (multimodal diffusion). Dự án được phát triển bởi nhóm nghiên cứu tại University of Cambridge và công ty AI startup “PixelForge”.
VisionFusion kết hợp ba kiến trúc diffusion: text‑to‑image, sketch‑to‑image và style‑transfer, cho phép người dùng nhập mô tả văn bản, tải lên bản phác thảo hoặc cung cấp mẫu phong cách để tạo ra hình ảnh chất lượng cao trong thời gian chỉ 5 giây cho độ phân giải 512×512.
Một trong những điểm mạnh của VisionFusion là tối ưu hoá bộ nhớ GPU, giúp chạy trên các card đồ họa tiêu chuẩn (RTX 3060) mà không cần giảm chất lượng. Ngoài ra, dự án còn cung cấp API Python và giao diện web dễ sử dụng, thu hút các nhà thiết kế, nhà phát triển game và nhà sáng tạo nội dung.
Cộng đồng đã đóng góp các plugin mở rộng cho Photoshop và Blender, đồng thời tạo ra một kho mẫu phong cách phong phú, giúp VisionFusion trở thành một công cụ sáng tạo đa năng trong lĩnh vực AI tạo ảnh.