Hôm nay, OpenAI đã tổ chức sự kiện trực tuyến để giới thiệu GPT-5 Omni, thế hệ mô hình ngôn ngữ lớn tiếp theo được định vị là bước nhảy vọt trong công nghệ trí tuệ nhân tạo đa phương thức. Khác với các phiên bản tiền nhiệm vốn xử lý các loại dữ liệu theo tuần tự, GPT-5 Omni được thiết kế từ gốc để hiểu và phản hồi song song qua âm thanh, hình ảnh và văn bản mà không qua các bước chuyển đổi trung gian.
Theo đại diện OpenAI, mô hình mới này có khả năng nhận diện cảm xúc qua giọng nói với độ chính xác cực cao, đồng thời phân tích video phát trực tiếp (livestream) để đưa ra hướng dẫn chi tiết theo thời gian thực. Độ trễ phản hồi của GPT-5 Omni đã được hạ xuống mức chỉ 5 mili-giây, mang lại trải nghiệm trò chuyện tự nhiên như giữa người với người.
Bên cạnh đó, khả năng lập luận logic và viết mã lập trình (coding) của GPT-5 Omni cũng được cải thiện vượt trội, đạt điểm số kỷ lục trên các benchmark tiêu chuẩn như MMLU và HumanEval. Mô hình này hiện đã được tích hợp ngay lập tức vào các gói cước cao cấp của ChatGPT và cung cấp qua API cho nhà phát triển.