Thứ Hai, 24 thg 8, 2026
Nvidia Groq 3 LPX đạt tốc độ 3.400 token mỗi giây khi ra mắt trên Nebius Cloud
Chips11 ngày trước1/15Nvidia đã đưa bộ tăng tốc inference độ trễ thấp Groq 3 LPX vào sản xuất hàng loạt để hỗ trợ các coding agent và các tác vụ suy luận đa bước. Được thiết kế để mở rộng nền tảng Vera Rubin NVL72, kiến trúc này chia tách công việc inference: GPU Rubin đảm nhận xử lý ngữ cảnh quy mô lớn, trong khi LPX tập trung tạo token tốc độ cao. Trong các bài test của Artificial Analysis khi chạy Gemma 4 31B với ngữ cảnh 100K token, con chip này đạt tốc độ đầu ra 3.400 token mỗi giây. Nvidia cho biết con số này nhanh gấp 4 lần so với các giải pháp thay thế gần nhất đối với các tác vụ agentic nhạy cảm về độ trễ.
Nebius sẽ là nền tảng AI cloud đầu tiên triển khai phần cứng này thông qua Token Factory, và Groq cũng nằm trong số những đơn vị sớm nhất áp dụng. Việc triển khai diễn ra sau một thương vụ mua sắm trị giá 20 tỷ USD, và Nvidia dự kiến các rack Groq sẽ đi vào hoạt động vào cuối năm 2026.