← Về trang chính1 tin
Bốn thay đổi trên bộ nhớ đệm n-gram của llama.cpp giúp drafting nhanh hơn tới 41,6 lần, tải cache tĩnh nhanh hơn 23,5 lần, và giảm bộ nhớ đỉnh tới 2,65 lần.
Đăng nhập để góp ý, chỉnh sửa
Nguồn chính
- THẢO LUẬNpptadversarynews.ycombinator.com