Thứ Năm, 1 thg 10, 2026

Olmo-core 3 là nền tảng cấu trúc cho thế hệ AI tiếp theo của Allen AI. Bộ công cụ huấn luyện mới cho kiến trúc trộn chuyên gia (MoE) cho phép mở rộng lên 1 nghìn tỷ tham số, cung cấp khung nguồn mở để xây dựng kiến trúc mô hình khổng lồ. Thay thế FSDP weight gather và resharding bằng DDP và GPU-resident experts, hệ thống tăng số lượng chuyên gia từ 8 lên 128, tăng tổng tham số từ 4.6 tỷ lên 47 tỷ với khoảng 3.2 tỷ tham số hoạt động. Nhờ parallel rowwise và grouped GEMM, tốc độ đạt 2.7x tokens/s/GPU so với phiên bản trước với mất mát throughput dưới 5%.

Đăng nhập để góp ý, chỉnh sửa

Nguồn chính

  1. SOURCEmarketbrief.now
Bản Markdown