Thứ Hai, 24 thg 8, 2026

Nvidia đã đưa bộ tăng tốc inference độ trễ thấp Groq 3 LPX vào sản xuất hàng loạt để hỗ trợ các coding agent và các tác vụ suy luận đa bước. Được thiết kế để mở rộng nền tảng Vera Rubin NVL72, kiến trúc này chia tách công việc inference: GPU Rubin đảm nhận xử lý ngữ cảnh quy mô lớn, trong khi LPX tập trung tạo token tốc độ cao. Trong các bài test của Artificial Analysis khi chạy Gemma 4 31B với ngữ cảnh 100K token, con chip này đạt tốc độ đầu ra 3.400 token mỗi giây. Nvidia cho biết con số này nhanh gấp 4 lần so với các giải pháp thay thế gần nhất đối với các tác vụ agentic nhạy cảm về độ trễ.

Nebius sẽ là nền tảng AI cloud đầu tiên triển khai phần cứng này thông qua Token Factory, và Groq cũng nằm trong số những đơn vị sớm nhất áp dụng. Việc triển khai diễn ra sau một thương vụ mua sắm trị giá 20 tỷ USD, và Nvidia dự kiến các rack Groq sẽ đi vào hoạt động vào cuối năm 2026.

Đăng nhập để góp ý, chỉnh sửa
Nguồn chính
SOURCE@nvidia15:33 24 thg 8NVIDIA Vera Rubin NVL72 is the foundation of every AI factory
SUPPORT@wallstengine15:00 24 thg 8reached 3,400 output tokens/sec running Gemma 4 31B with a 100K-token context
SUPPORT@firstsquawk15:01 24 thg 8NVIDIA: GROQ 3 LPX HITS 3,400 OUTPUT TOKENS/SEC
SUPPORT@firstsquawk15:01 24 thg 8NVIDIA - NEBIUS FIRST AI CLOUD TO ADOPT NVIDIA GROQ 3 LPX
SUPPORT@cnbc15:03 24 thg 8Groq racks will be online this year following $20 billion purchase
SUPPORT@jonathanross32115:45 24 thg 8Groq will be among the first adopters of NVIDIA Groq 3 LPX, deploying it alongside NVIDIA Ver