OpenAI vừa ra mắt GPT-6 Astra, mô hình ngôn ngữ lớn thế hệ mới, tăng hiệu năng bằng cách lặp lại dữ liệu qua các lớp nơơnson đã có nhiều lần. Cách tiếp cận này áp dụng loop transformers để nâng cao hiệu suất mà không cần phình to kiến trúc GPT-6 Astra, theo SemiAnalysis. Sự chuyển hướng về độ sâu tính toán cho thấy các phòng thí nghiệm AI đang thấy việc tăng số tham số ngày càng ít hiệu quả trong kế hoạch nghiên cứu hiện tại.

Chiến lược tập trung vào độ sâu thay vì rộng mở rộng nhu cầu vượt qua giới hạn của cụm huấn luyện, chuyển sang tập trung vào độ trễ suy diễn và tiêu thụ năng lượng cho mỗi token. Thay đổi này ảnh hưởng đến chiến lược mua sắm phần cứng, khi các phòng thí nghiệm ưu tiên số phép tính dấu phẩy chấm trên mỗi trọng số để tối ưu hiệu quả tính toán.

Đăng nhập để góp ý, chỉnh sửa

Nguồn chính

  1. SOURCE@semianalysis_“instead of adding parameter count, it goes through the layers more than once”x.com
  2. SUPPORT@redboynono“labs buying FLOPs-per-weight when param roadmaps look less aggressive”x.com
  3. SOURCEmarketbrief.now
Bản Markdown