Thứ Bảy, 22 thg 8, 2026

AntLingAGI và Alibaba vừa phát triển một công cụ tối ưu hóa bộ nhớ mới giúp tăng tốc triển khai các LLM khổng lồ. Công cụ Weight Cache Daemon dành cho SGLang đã giúp giảm thời gian tải trọng số cho mô hình Ling-2.6-1T FP8 xuống còn 0,63 giây, nhanh hơn tới 780 lần so với việc tải từ ổ đĩa. Nhờ tối ưu hóa này, tổng thời gian khởi động engine chỉ còn 0,53 phút, cho phép khởi động lại một mô hình 1 nghìn tỷ tham số chỉ trong 32 giây.

Công cụ này tập trung giải quyết nút thắt cổ chai trong việc tải trọng số tại các môi trường production nhằm cải thiện thời gian phục hồi và hiệu suất tài nguyên. SGLang đóng vai trò là serving framework cho việc triển khai, và daemon này cho phép người vận hành bỏ qua bước tải chậm từ ổ đĩa bằng cách lưu trữ trực tiếp trọng số mô hình vào bộ nhớ.

Đăng nhập để góp ý, chỉnh sửa
Nguồn chính
SOURCE@antlingagi4:36 22 thg 8reduced weight loading to ~0.63s, up to ~780× faster than disk loading
SOURCE@sgl_project6:24 22 thg 8Huge thanks to the @AntLingAGI and Alibaba for the collab!