Chủ Nhật, 30 thg 8, 2026
Phương pháp Prefix Sliding của Stanford giúp tăng tốc khả năng suy luận AI lên 3 lần và mở rộng quy mô vượt ngưỡng 100.000 token
Nghiên cứu4 ngày trước1/4Các nhà nghiên cứu tại Đại học Stanford đã phát triển một phương pháp giúp giảm chi phí tính toán khi thực hiện suy luận long-chain-of-thought bằng cách loại bỏ các token trung gian không quan trọng khỏi bộ nhớ. Kỹ thuật mang tên Prefix Sliding này giữ lại prompt gốc cùng một cửa sổ trượt chứa các bước suy luận gần nhất, giúp các mô hình hiện tại chạy nhanh gấp 3 lần mà vẫn duy trì hiệu suất tương đương cơ chế full-attention mà không cần training lại.
Cách tiếp cận này giải quyết tình trạng chi phí suy luận và mức tiêu thụ bộ nhớ tăng vọt khi chuỗi suy luận kéo dài. Khi kết hợp với fine-tune bằng reinforcement learning, Prefix Sliding cho phép các AI agent mở rộng khả năng suy luận vượt quá 100.000 token nhờ việc khống chế tổng dung lượng bộ nhớ bất kể độ dài của chuỗi suy luận.