Chủ Nhật, 30 thg 8, 2026

Các nhà nghiên cứu tại Đại học Stanford đã phát triển một phương pháp giúp giảm chi phí tính toán khi thực hiện suy luận long-chain-of-thought bằng cách loại bỏ các token trung gian không quan trọng khỏi bộ nhớ. Kỹ thuật mang tên Prefix Sliding này giữ lại prompt gốc cùng một cửa sổ trượt chứa các bước suy luận gần nhất, giúp các mô hình hiện tại chạy nhanh gấp 3 lần mà vẫn duy trì hiệu suất tương đương cơ chế full-attention mà không cần training lại.

Cách tiếp cận này giải quyết tình trạng chi phí suy luận và mức tiêu thụ bộ nhớ tăng vọt khi chuỗi suy luận kéo dài. Khi kết hợp với fine-tune bằng reinforcement learning, Prefix Sliding cho phép các AI agent mở rộng khả năng suy luận vượt quá 100.000 token nhờ việc khống chế tổng dung lượng bộ nhớ bất kể độ dài của chuỗi suy luận.

Đăng nhập để góp ý, chỉnh sửa
Nguồn chính
SOURCE@shipfrontierai14:53 30 thg 8Cost per new token stays constant instead of growing with chain length
SUPPORT@omarsar017:06 30 thg 8Intermediate tokens steadily lose importance as the model keeps going
SUPPORT@askalphaxiv20:15 29 thg 8Without retraining, Prefix Sliding is up to 3x faster while matching performance