Một nhóm nghiên cứu của Viện Công nghệ Massachusetts (MIT) đã công bố bài báo mới trên tạp chí Nature, giới thiệu phương pháp Contrastive Predictive Coding 2.0 (CPC‑2.0). Phương pháp này mở rộng mô hình CPC truyền thống bằng cách tích hợp “Temporal Hierarchical Contrastive Learning”, cho phép mô hình học các biểu diễn đa cấp độ từ dữ liệu thô mà không cần nhãn.
Kết quả thực nghiệm cho thấy CPC‑2.0 đạt hiệu suất gấp ba lần so với CPC‑1.0 trên các bộ dữ liệu ImageNet và AudioSet, đồng thời cải thiện đáng kể độ chính xác trong các tác vụ downstream như phân loại hình ảnh, nhận dạng giọng nói và dự đoán hành động video.
Các nhà nghiên cứu nhấn mạnh rằng CPC‑2.0 không chỉ giảm phụ thuộc vào dữ liệu có nhãn, mà còn giảm chi phí tính toán nhờ việc tái sử dụng các biểu diễn đã học ở các lớp sâu hơn. Điều này mở ra cơ hội cho việc huấn luyện các mô hình lớn trên dữ liệu không cấu trúc với nguồn lực hạn chế.
MIT dự kiến sẽ công bố mã nguồn mở của CPC‑2.0 trên GitHub trong tháng tới, nhằm khuyến khích cộng đồng AI áp dụng và mở rộng phương pháp này cho các lĩnh vực như y tế, tự động lái và robot học.