Bốn thay đổi trên bộ nhớ đệm n-gram của llama.cpp giúp drafting nhanh hơn tới 41,6 lần, tải cache tĩnh nhanh hơn 23,5 lần, và giảm bộ nhớ đỉnh tới 2,65 lần.

Đăng nhập để góp ý, chỉnh sửa

Nguồn chính

  1. THẢO LUẬNpptadversarynews.ycombinator.com
Bản Markdown