AI·NEWS
Dự án GitHub Nguồn: GitHub Blog 19:00:15 20/9/2026

WhisperX: Dự án GitHub mở rộng công cụ chuyển giọng nói sang văn bản thời gian thực, hỗ trợ 120 ngôn ngữ

WhisperX, bản mở rộng của OpenAI Whisper, cung cấp khả năng nhận dạng giọng nói đa ngôn ngữ và đồng bộ thời gian thực, thu hút cộng đồng AI trên GitHub.

WhisperX: Dự án GitHub mở rộng công cụ chuyển giọng nói sang văn bản thời gian thực, hỗ trợ 120 ngôn ngữ

WhisperX, một dự án mã nguồn mở mới được công bố trên GitHub vào ngày 20/09/2026, là phiên bản mở rộng của công cụ chuyển đổi giọng nói sang văn bản Whisper của OpenAI. Dự án được phát triển bởi nhóm cộng đồng AI tại Hugging Face và nhận được hơn 12.000 sao trong vòng 48 giờ đầu.

Điểm nổi bật của WhisperX là khả năng nhận dạng giọng nói đồng thời trên tới 120 ngôn ngữ, bao gồm cả các ngôn ngữ ít tài nguyên như Yoruba, Lao và Khmer. Ngoài ra, WhisperX hỗ trợ tính năng “real‑time alignment”, cho phép đồng bộ thời gian chính xác giữa âm thanh và văn bản, rất hữu ích cho các ứng dụng livestream, hội thảo trực tuyến và phụ đề tự động.

Dự án cung cấp các mô hình pre‑trained dựa trên kiến trúc Conformer, được tối ưu hoá để chạy trên GPU và thậm chí trên CPU thông thường mà không mất quá nhiều tài nguyên. Hướng dẫn cài đặt chi tiết và API Python được tích hợp sẵn, giúp các nhà phát triển nhanh chóng tích hợp vào ứng dụng của mình.

WhisperX đã thu hút sự chú ý của các công ty công nghệ và tổ chức phi lợi nhuận, những người đang tìm kiếm giải pháp nhận dạng giọng nói đa ngôn ngữ không tốn phí bản quyền. Nhóm phát triển cam kết cập nhật mô hình hàng tháng và mở rộng hỗ trợ các ngôn ngữ mới dựa trên phản hồi của cộng đồng.

Về trang chủ

Nội dung do AI tổng hợp, tham khảo theo nguồn "GitHub Blog"