Bản phát hành AI mới nhất từ OpenAI cung cấp trí tuệ trong vòng 1.04 điểm so với GPT-6 Astra trong Agent Arena đồng thời giảm chi phí trung bình mỗi nhiệm vụ xuống $0.56. Mô hình GPT-6.1 Sol (Max) hiện đứng thứ năm trong arena này, vượt trội GPT-6 Sol với 1.52 điểm ở chi phí thấp hơn 39%. Trong Code Arena cho WebDev, mô hình ban đầu đứng thứ ba trước khi trượt xuống thứ tư sau khi Anthropic ra mắt Claude Sonnet 5.5. OpenAI đã giới thiệu mô hình này trong sự kiện DevDay, định giá $2 cho mỗi triệu token đầu vào và $10 cho mỗi triệu token đầu ra. Phiên bản này thay thế GPT-6 Sol chỉ bảy ngày sau lần ra mắt đó và vượt trội hơn các tác vụ agent của Anthropic với Fable 5.1 và Opus 5.5 ở mức 88% và 65% chi phí thấp hơn tương ứng. Trong khi Sol hướng tới biên giới hiệu quả Pareto, Gemini 4 Argon (High) của Google hiện giữ vị trí số một trong Text Arena.

Đăng nhập để góp ý, chỉnh sửa

Nguồn chính

  1. SOURCEmarketbrief.now
Bản Markdown