Kiến trúc Recurrent Looped Transformer (RLT) cho phép mô hình tái sử dụng trạng thái decoder qua từng token nhập và xuất, mở rộng quá trình tính toán nội bộ. Bằng cách phản hồi trạng thái ẩn cuối cùng của một token vào token kế tiếp, kiến trúc tạo ra các lộ trình tính toán tiềm năng dài ra theo độ dài chuỗi mà không cần tăng số lớp tham số vật lý. Ví dụ, một decoder 48 lớp xử lý 100 token sẽ tạo ra lộ trình tính toán sâu 4.800 lớp chỉ với cùng một bộ trọng số mạng tại các thời điểm khác nhau.

Một encoder nhân quả hỗ trợ hệ thống bằng cách cung cấp bộ nhớ KV toàn cục có thể tái sử dụng, trong khi báo cáo kỹ thuật về thiết kế đã có trên GitHub. Nghiên giả Princeton Yifan Zhang, từng làm việc tại Nvidia và ByteDance, phát triển RLT nhằm giải quyết các bài toán phức tạp hơn trong cùng một ngân sách tính toán. Kho lưu trữ hiện chưa có mã nguồn huấn luyện, cách tiếp cận suy diễn hay trọng số mô hình, đồng thời Zhang kêu gọi tiến trình phát triển AI được điều chỉnh thận trọng cho đến khi trí tuệ nhân vạn năng an toàn được đạt tới.

Đăng nhập để góp ý, chỉnh sửa

Nguồn chính

  1. SOURCE@maxforai“来自普林斯顿的研究者 Yifan Zhang,今天发布了新一代循环回路Transformer架构:RLT(Recurrent Looped Transformer)”x.com
  2. SUPPORT@askalphaxiv“Longer sequences then create deeper latent computation paths without adding more physical layers”x.com
  3. SOURCEmarketbrief.now
Bản Markdown