Thứ Tư, 2 thg 9, 2026

Lily là engine inference chạy cục bộ, hỗ trợ mô hình Qwen3.6-35B-A3B để tối ưu hóa khả năng tính toán hybrid trên các thiết bị Mac. Các benchmark thực hiện trên MacBook Pro chip M5 Max cho thấy Lily đạt tốc độ decode cao hơn 1,35 lần và tốc độ prefill cao hơn 1,23 lần so với MLX-LM khi thử nghiệm trên 10 độ dài prompt và 10 ngữ cảnh decode khác nhau.

Perplexity quyết định mở mã nguồn engine này nhằm đảm bảo việc xử lý trên thiết bị không trở thành nút thắt cổ chai cho hệ thống Computer agent. Phần mềm vẫn giữ nguyên chất lượng đầu ra trong khi tối ưu hóa cho Apple Silicon để giảm độ trễ khi chạy mô hình cục bộ.

Đăng nhập để góp ý, chỉnh sửa
Nguồn chính
SOURCE@perplexity_ai20:04 2 thg 9built so on-device compute doesn’t bottleneck Computer tasks
SUPPORT@perplexity_ai20:04 2 thg 9averaging 1.23× higher prefill throughput and 1.35× higher decode throughput