Thứ Ba, 25 thg 8, 2026

Nhà phát triển AI tại San Francisco sẽ bắt đầu lắp đặt chip inference mang tên Jalapeño vào hạ tầng tính toán của mình vào cuối năm 2026. Theo benchmark InferenceX trên ba mô hình công khai, chip này đạt hiệu suất xử lý AI trên mỗi watt cao hơn từ 1,5 đến 1,9 lần và giảm độ trễ từ 1,7 đến 3,6 lần so với Nvidia GB300. Được phát triển cùng Broadcom, dòng ASIC đa năng này chuyên dùng để chạy các LLM thay vì huấn luyện, giúp tăng hiệu suất từ 2,1 đến 4,1 lần đối với các tác vụ tương tác cao.

Chip được sản xuất trên tiến trình TSMC N3P với TDP 700W và băng thông bộ nhớ lên tới 15,4TB/s — mức cao nhất trong số các bộ tăng tốc sắp ra mắt. OpenAI cũng đã dùng chính AI Codex của mình để hỗ trợ thiết kế phần cứng, giúp tối ưu hóa engine tính toán ma trận...

Đăng nhập để góp ý, chỉnh sửa
Nguồn chính
SOURCE@openai17:19 25 thg 8more intelligence from every watt and faster responses, delivering both higher throughput and lower latency in one architecture without sacrificing efficiency
SOURCE@openai17:19 25 thg 8Gen 2 is deep in development, and Gen 3 is taking shape
SOURCE@cpmou202214:42 25 thg 82.1–4.1× higher performance on highly interactive workloads
SUPPORT@deitaone14:04 25 thg 8Developed with Broadcom, Jalapeno targets AI inference and could lower data-center costs while handling large models
SUPPORT@wallstengine14:14 25 thg 8HBM4 with 15.4TB/s of memory bandwidth
SUPPORT@openai17:19 25 thg 8faster ChatGPT responses, more responsive Codex sessions and agents
SOURCE@gdb15:31 25 thg 8inference numbers published for jalapeno, team did an amazing job
SUPPORT@edludlow14:03 25 thg 8OAI's Richard Ho is on Bloomberg Tech today