Thứ Bảy, 22 thg 8, 2026

Kết quả đánh giá toàn diện trên benchmark lập trình DeepSWE xác nhận mô hình AI ẩn danh Ox Alpha đạt hiệu suất cao đúng như các bài kiểm tra giới hạn trước đó. Mô hình đã hoàn thành trọn vẹn 113 tác vụ với tỷ lệ vượt qua khoảng 80%. Nhà nghiên cứu Henry Zhang cho biết kết quả này chứng minh khả năng agentic mạnh mẽ của mô hình. Hiện Ox Alpha đang được cung cấp miễn phí trên OpenRouter, Venice và Nous Research để thu thập phản hồi về tính ứng dụng thực tế.

Mô hình sở hữu context window lên tới 1 triệu token và hỗ trợ đầu vào đa phương thức gồm văn bản, hình ảnh và video. Những người dùng đầu tiên nghi vấn đây chính là mô hình GLM 5.3 Flash từ phòng thí nghiệm Zhipu AI của Trung Quốc, do có cách tokenization và các câu trả lời về chủ đề chính trị gần như y hệt.

Đăng nhập để góp ý, chỉnh sửa
Nguồn chính
SOURCE@apples_jimmy8:25 22 thg 8Just completed a full end to end run of the full 113 task DeepSWE benchmark on ox-alpha.
SOURCE@teknium1:50 22 thg 8capacity for 1 quadrillion tokens per day
SUPPORT@rohanpaul_ai1:00 22 thg 8One prompt, 64,745 output tokens, and no external assets: Ox Alpha generated the code for an entire Three.js dreamcore 3D scene/world in a single shot
SUPPORT@teortaxestex8:08 22 thg 8The 100T/day promise (unsubstantiated so far afaik) is lowkey genius
SUPPORT@teortaxestex0:58 22 thg 8it does not take a lot of intelligence to perform SWE work at a superhuman level