---
format: "aidr-story-markdown/v1"
id: "383cec3b0955e288d68096beb8e13a3622d89af8dc3af4b638e6c4f793f13a28"
canonical_url: "https://aidr.today/383cec3b?lang=vi"
title: "Ox Alpha đạt 58,4% trên DeepSWE, ngang ngửa hiệu suất của Claude Opus 4.8"
lang: "vi"
requested_lang: "vi"
available_langs: ["en","vi"]
translation_fallback: null
fallback_fields: []
published_at: "2026-08-22T18:50:03.000Z"
category: "Research"
topics: ["benchmark","coding","agent","llm","reasoning"]
source_urls: ["https://huggingnews.com/ai/ox-alpha-scores-584percent-on-deepswe-matching-claude-opus-48-performanc-4992e222","https://x.com/henryzhangumich/status/2091066210721141009","https://x.com/peterwildeford/status/2091195347016044843","https://x.com/TheZachMueller/status/2091175521077854451","https://x.com/scaling01/status/2091193499949432986","https://x.com/apples_jimmy/status/2091079278100386027","https://x.com/teortaxesTex/status/2091075052523393055","https://x.com/himanshustwts/status/2091243094666822099"]
summary: "Đánh giá toàn diện về khả năng agentic của mô hình lập trình mới nhất cho thấy có sự khác biệt giữa hiệu suất thực tế và các tin đồn trước đó trên thị trường. Kết quả kiểm tra trên toàn bộ 113 tác vụ của benchmark DeepSWE cho thấy Ox Alpha đạt 58,4%, thấp hơn mức tỷ lệ vượt qua 80% mà một số người dùng từng báo cáo. Kết quả này đưa hiệu suất kỹ thuật phần mềm của mô hình đạt mức gần như tương đương với con số 59% của Claude Opus 4.8. Các chuyên gia nhận định sự tương đồng này cho thấy AI Trung Quốc đang dần bắt kịp các mô hình hàng đầu phương Tây khi ngành công nghiệp chuyển trọng tâm sang các agent đa phương thức."
---

# Ox Alpha đạt 58,4% trên DeepSWE, ngang ngửa hiệu suất của Claude Opus 4\.8

> [Open the canonical story](<https://aidr.today/383cec3b?lang=vi>)

**Published:** 2026-08-22T18:50:03.000Z
**Category:** Research
**Topics:** benchmark, coding, agent, llm, reasoning

## Summary

Đánh giá toàn diện về khả năng agentic của mô hình lập trình mới nhất cho thấy có sự khác biệt giữa hiệu suất thực tế và các tin đồn trước đó trên thị trường\. Kết quả kiểm tra trên toàn bộ 113 tác vụ của benchmark DeepSWE cho thấy Ox Alpha đạt 58,4%, thấp hơn mức tỷ lệ vượt qua 80% mà một số người dùng từng báo cáo\. Kết quả này đưa hiệu suất kỹ thuật phần mềm của mô hình đạt mức gần như tương đương với con số 59% của Claude Opus 4\.8\. Các chuyên gia nhận định sự tương đồng này cho thấy AI Trung Quốc đang dần bắt kịp các mô hình hàng đầu phương Tây khi ngành công nghiệp chuyển trọng tâm sang các agent đa phương thức\.

## Sources

- [Story source](<https://huggingnews.com/ai/ox-alpha-scores-584percent-on-deepswe-matching-claude-opus-48-performanc-4992e222>)
- [Story source](<https://x.com/henryzhangumich/status/2091066210721141009>)
- [Supporting source](<https://x.com/peterwildeford/status/2091195347016044843>)
- [Supporting source](<https://x.com/TheZachMueller/status/2091175521077854451>)
- [Supporting source](<https://x.com/scaling01/status/2091193499949432986>)
- [Story source](<https://x.com/apples_jimmy/status/2091079278100386027>)
- [Supporting source](<https://x.com/teortaxesTex/status/2091075052523393055>)
- [Story source](<https://x.com/himanshustwts/status/2091243094666822099>)

