Thứ Năm, 27 thg 8, 2026
PhoneLLM đạt hiệu suất ngang ngửa GPT 5.6 Terra với chi phí chỉ bằng 1/18 và độ trễ vượt trội
Models7 ngày trước1/5Đây là mô hình mã nguồn mở được fine-tune toàn bộ trọng số từ NVIDIA Nemotron Nano 30B, chuyên dùng cho các tình huống hỗ trợ khách hàng qua điện thoại. Mô hình này đạt hiệu suất tương đương GPT 5.6 Terra trong các tác vụ voice agent nhưng có độ trễ thấp hơn 3 lần và chi phí chỉ bằng 1/18, hướng tới các ứng dụng thời gian thực vốn cần tắt chế độ tính toán 'suy nghĩ' để duy trì tốc độ hội thoại.
Khi triển khai trên một GPU NVIDIA B200, mô hình có thể hỗ trợ hơn 80 agent chạy đồng thời với chỉ số P95 end-to-end time-to-first-audio-token dưới 600ms, đưa chi phí mỗi phút xuống còn khoảng 0,0025 USD. Dự án cũng giới thiệu PhoneBench, một benchmark nội bộ dành cho AI thời gian thực, và đã phát hành trọng số mô hình trên Hugging Face.