Chủ Nhật, 23 thg 8, 2026

Một engine inference mã nguồn mở do các nhà nghiên cứu học thuật phát triển cho phép các mô hình Mixture of Experts (MoE) khổng lồ chạy trên phần cứng phổ thông với tốc độ tương tác mượt mà. FreeToken giúp một GPU RTX PRO 6000 duy nhất có thể chạy mô hình GLM-5.2 với 753B tham số ở tốc độ 14,9 tok/s, và một máy tính để bàn 32GB có thể chạy DeepSeek-V4-Flash 284B tham số ở mức 22 tok/s. Ngay cả GPU laptop 8GB cũng có thể chạy Qwen3.6 35B với tốc độ 39,3 tok/s, nhanh gấp 2 đến 4 lần so với Ollama trên cùng cấu hình phần cứng và cùng trọng số mô hình.

Phần mềm này sử dụng cơ chế bandwidth adaptive execution để kết hợp GPU, CPU, RAM và ổ cứng thành một nền tảng đàn hồi duy nhất, giúp ánh xạ tính toán linh hoạt dựa trên tốc độ kết nối thực tế. Cách tiếp cận này tối ưu hóa các mô hình MoE như DeepSeek-V4-Flash, vốn chỉ kích hoạt 13B trong tổng số 284B tham số mỗi khi...

Đăng nhập để góp ý, chỉnh sửa
Nguồn chính
SOURCE@algo_diver14:46 23 thg 8UC Berkeley + MIT researchers open sourced a new inference engine
SUPPORT@huintellimance15:01 23 thg 8this is the biggest jump in edge inference since llama.cpp