Hai ngày sau khi phiên bản CUDA của vLLM từ Nvidia hỗ trợ DeepSeek V4.1 Flash, AMD đã công bố công cụ hình ảnh phần mềm để chạy mô hình này, SemiAnalysis cho biết. Hình ảnh này hoạt động ngay lập tức, nhưng các chip B200 và B300 của Nvidia mang lại hiệu suất gấp đến 42 lần so với giá cả, trong khi H200 đạt được khoảng 14,8 lần, theo nghiên cứu viên. SemiAnalysis trước đó đã báo cáo rằng hình ảnh được chỉ định trong tài liệu vLLM của AMD vẫn chưa khả dụng 23 giờ sau khi mô hình ra mắt, trong khi cách tiếp cận của Nvidia hoạt động trên sáu mẫu chip khác nhau ngay từ lúc ra mắt. Tuy nhiên, dự án vLLM đã công bố vào ngày 10 tháng 9 rằng hỗ trợ ra mắt của họ đã được xác minh trên cả GPU NVIDIA và AMD! SemiAnalysis cho rằng lợi thế của Nvidia đến từ hệ sinh thái phần mềm CUDA và sự hợp tác với cộng đồng 6 triệu nhà phát triển.
Nguồn chính
- SUPPORT@semianalysis_“2 days after CUDA vLLM supported DeepSeekv4.1 Flash, AMD finally publicly released its DeepSeek v4.1 Flash image. Functionally, it works out of the box, but performance-wise, it is currently up to 14.8x worse perf per dollar than H200 and up to 42x worse perf per dollar than B200/B300 currently.”x.com
- SOURCE@designarena“DeepSeek‑V4.1‑Flash takes 6th overall on Design Arena with an Elo of 1347!”x.com
- SUPPORT@semianalysis_“On the Day 0 release of DeepSeekv4.1 Flash, NVIDIA vLLM works out of the box with zero issues across all 6 SKUs: H100, H200, B200, B300, GB200, GB300!”x.com
- SUPPORT@semianalysis_“AMD's vLLM documentation points to using vllm/vllm-openai-rocm:deepseekv41-flash-0909, but from hour 0 of the model release to now, hour 23, AMD has still not publicly released the image.”x.com