Một nhóm nghiên cứu tại Viện Công nghệ Massachusetts (MIT) vừa công bố bài báo khoa học đột phá về phương pháp 'Lượng tử hóa siêu thưa' (Ultra-Sparse Quantization), giải quyết bài toán tiêu thụ điện năng nan giải của các mô hình ngôn ngữ lớn (LLM).
Bằng cách phân tích sâu cấu trúc trọng số của mạng neural trong quá trình suy luận (inference), nhóm nghiên cứu nhận ra rằng phần lớn các tham số không đóng góp nhiều vào kết quả đầu ra trong từng token cụ thể. Thuật toán mới của họ tự động 'đóng băng' các vùng trọng số không cần thiết này theo thời gian thực, giảm lượng tính toán cần thiết xuống gấp 10 lần.
Kết quả thử nghiệm trên các mô hình cỡ lớn cho thấy mức độ suy giảm về độ chính xác (perplexity) là không đáng kể, trong khi tốc độ sinh văn bản tăng lên gấp ba và năng lượng tiêu thụ giảm tới 90%. Phát hiện này mở ra hy vọng đưa các LLM mạnh mẽ chạy trực tiếp trên các thiết bị biên (edge devices) như điện thoại thông minh và laptop với thời lượng pin ấn tượng.