← Về trang chính1 tin
Thứ Bảy, 22 thg 8, 2026
1
Ox Alpha đạt 58,4% trên DeepSWE, ngang ngửa hiệu suất của Claude Opus 4.8
Nghiên cứu12 ngày trước1/43Đánh giá toàn diện về khả năng agentic của mô hình lập trình mới nhất cho thấy có sự khác biệt giữa hiệu suất thực tế và các tin đồn trước đó trên thị trường. Kết quả kiểm tra trên toàn bộ 113 tác vụ của benchmark DeepSWE cho thấy Ox Alpha đạt 58,4%, thấp hơn mức tỷ lệ vượt qua 80% mà một số người dùng từng báo cáo.
Kết quả này đưa hiệu suất kỹ thuật phần mềm của mô hình đạt mức gần như tương đương với con số 59% của Claude Opus 4.8. Các chuyên gia nhận định sự tương đồng này cho thấy AI Trung Quốc đang dần bắt kịp các mô hình hàng đầu phương Tây khi ngành công nghiệp chuyển trọng tâm sang các agent đa phương thức.
Đăng nhập để góp ý, chỉnh sửa
Nguồn chính
SOURCE@henryzhangumich7:33 22 thg 8— Actual benchmark result is 58.4%, landing the model at almost identical performance to Claude Opus 4.8 (59%)
SOURCE@apples_jimmy8:25 22 thg 8— Just completed a full end to end run of the full 113 task DeepSWE benchmark on ox-alpha.
SUPPORT@teortaxestex8:08 22 thg 8— The 100T/day promise (unsubstantiated so far afaik) is lowkey genius