Cộng đồng GitHub đang phát sốt với 'Whisper-Stream-X', một dự án mã nguồn mở tối ưu hóa mô hình Whisper của OpenAI để phục vụ cho việc dịch thuật và tạo phụ đề trực tiếp (real-time streaming). Dự án này đã nhanh chóng lọt vào danh sách Trending của GitHub nhờ giải quyết được bài toán hóc búa về độ trễ và tài nguyên phần cứng khi xử lý âm thanh trực tiếp.
Thông thường, việc dịch thuật trực tiếp bằng AI đòi hỏi phải gửi các đoạn âm thanh ngắn lên đám mây, dẫn đến độ trễ từ 1 đến 2 giây và chi phí vận hành cao. Whisper-Stream-X giải quyết vấn đề này bằng cách sử dụng kỹ thuật phân đoạn âm thanh động (dynamic chunking) kết hợp với công nghệ tăng tốc phần cứng TensorRT của NVIDIA. Nhờ đó, mô hình có thể chạy mượt mà ngay trên các dòng card đồ họa phổ thông của người dùng cá nhân, thậm chí là trên một số dòng chip Apple Silicon thế hệ mới.
Phần mềm hỗ trợ dịch thuật song song hơn 50 ngôn ngữ khác nhau với độ chính xác vượt trội so với các công cụ dịch thuật truyền thống, nhờ khả năng hiểu ngữ cảnh xung quanh và tự động lọc bỏ các từ đệm, tiếng ồn môi trường. Dự án cũng cung cấp sẵn các API tích hợp trực tiếp vào các phần mềm livestream phổ biến như OBS Studio, giúp các streamer có thể tạo phụ đề đa ngôn ngữ theo thời gian thực một cách dễ dàng.
Các nhà phát triển dự án cam kết sẽ giữ Whisper-Stream-X hoàn toàn miễn phí và không có quảng cáo. Sự thành công của dự án này một lần nữa khẳng định sức mạnh của cộng đồng mã nguồn mở trong việc tối ưu hóa và đưa các công nghệ AI tiên tiến nhất đến gần hơn với người dùng đại chúng mà không bị phụ thuộc vào các ông lớn công nghệ.