Thứ Tư, 2 thg 9, 2026

SMELT (Sparse MoE Transformer) hoạt động bằng cách lặp lại hai lần nửa số lớp ở giữa mạng để đẩy nhanh tốc độ giảm loss trong quá trình huấn luyện. So với các mô hình cơ bản không dùng cơ chế lặp, kiến trúc này giúp giảm từ 6,8% đến 18% lượng FLOPs huấn luyện trên biên độ compute-optimal, trong khi vẫn giữ nguyên mức FLOPs trên mỗi token, tổng số tham số non-embedding và KV cache. Bằng cách lặp lại các tính toán tại trung tâm mạng lưới, phương pháp này tạo ra lộ trình hiệu quả hơn để hội tụ trọng số mô hình.

Các nhà nghiên cứu đã thử nghiệm SMELT trên bốn cấu hình khác nhau, trong đó cấu hình lớn nhất đạt 54 tỷ tham số non-embedding dựa trên các quy luật scaling kiểu Chinchilla. Cách tiếp cận lặp ở cấp độ block này khác với phương pháp Loop the Loopies của IQuest Research — vốn chỉ lặp lại từng lớp riêng lẻ thay vì lặp lại cả khối như SMELT.

Đăng nhập để góp ý, chỉnh sửa
Nguồn chính
SOURCE@iscienceluvr5:49 2 thg 9saving 6.8–18.0% of training FLOPs on the compute-optimal frontier
SUPPORT@teortaxestex6:26 2 thg 9Loopies repeats individual layers; SMELT repeats on block level