Thứ Bảy, 22 thg 8, 2026
Cập nhật: Ox Alpha đạt 80% điểm số trên benchmark DeepSWE, hoàn thành lượt chạy đầu tiên với toàn bộ 113 tác vụ
Models13 ngày trước1/26Kết quả đánh giá toàn diện trên benchmark lập trình DeepSWE xác nhận mô hình AI ẩn danh Ox Alpha đạt hiệu suất cao đúng như các bài kiểm tra giới hạn trước đó. Mô hình đã hoàn thành trọn vẹn 113 tác vụ với tỷ lệ vượt qua khoảng 80%. Nhà nghiên cứu Henry Zhang cho biết kết quả này chứng minh khả năng agentic mạnh mẽ của mô hình. Hiện Ox Alpha đang được cung cấp miễn phí trên OpenRouter, Venice và Nous Research để thu thập phản hồi về tính ứng dụng thực tế.
Mô hình sở hữu context window lên tới 1 triệu token và hỗ trợ đầu vào đa phương thức gồm văn bản, hình ảnh và video. Những người dùng đầu tiên nghi vấn đây chính là mô hình GLM 5.3 Flash từ phòng thí nghiệm Zhipu AI của Trung Quốc, do có cách tokenization và các câu trả lời về chủ đề chính trị gần như y hệt.