Chỉ số JevBench đánh giá các mô hình AI tạo ra quyết định phần mềm có giới hạn thay vì văn bản mở, bằng cách kết hợp trí thông minh, hiệu chuẩn, tốc độ và chi phí. Mô hình Jev của TypeSafe đứng đầu với 75,3 điểm, theo sau là SemIf #2 với 74,6. Bảng xếp hạng sử dụng trung bình hình học để ưu tiên khả năng triển khai, cho phép Jev vượt qua các mô hình như GPT-5.6 Luna, vốn có độ chính xác thô cao hơn nhưng thời gian phản hồi chậm hơn hoặc chi phí vận hành cao hơn.

Các nhà phát triển đang áp dụng mô hình quyết định này cho việc xác minh agent và đánh giá trực tuyến để giảm sự phụ thuộc vào các khung suy luận đắt tiền. Jev có chi phí 0,064 USD cho 600 phán quyết trong một bài kiểm tra người dùng, rẻ hơn khoảng 90 lần so với chi phí 5 USD của Sonnet của Anthropic. Tuy nhiên, vẫn tồn tại các sự đánh đổi về hiệu suất, với Jev cho thấy tỷ lệ chấp nhận sai là 32%...

Đăng nhập để góp ý, chỉnh sửa

Nguồn chính

  1. SOURCE@rohanpaul_ai“GPT-5.6 Luna records substantially higher hard-case accuracy than Jev 1.13.0, yet Jev leads the composite because the benchmark also prices latency, calibration and cost”x.com
  2. SOURCE@alexatallah“Jev by @typesafeai answers yes/no and multiple-choice questions, with a confidence score”x.com
  3. SUPPORT@sydneyrunkle“jev as a Judge proves to be a cheaper and more precise alternative to LLM as a judge for online evals”x.com
  4. SUPPORT@omarsar0“It checks whether the goal is actually complete after every turn, making continuous verification cheap enough to scale”x.com
  5. SUPPORT@jasonlk“roughly 90× cheaper on identical inputs”x.com
  6. SOURCE@airesearch12“Jev still in the lead, but it's close”x.com
  7. SUPPORT@airesearch12“SemIf #2 at 74.6”x.com
  8. SOURCE@nrehiew_“the highest score on DeepSWE is 74 by Astra, Gemini 3.8 Flash and Opus 5”x.com
Bản Markdown