Thứ Năm, 27 thg 8, 2026

Đây là mô hình mã nguồn mở được fine-tune toàn bộ trọng số từ NVIDIA Nemotron Nano 30B, chuyên dùng cho các tình huống hỗ trợ khách hàng qua điện thoại. Mô hình này đạt hiệu suất tương đương GPT 5.6 Terra trong các tác vụ voice agent nhưng có độ trễ thấp hơn 3 lần và chi phí chỉ bằng 1/18, hướng tới các ứng dụng thời gian thực vốn cần tắt chế độ tính toán 'suy nghĩ' để duy trì tốc độ hội thoại.

Khi triển khai trên một GPU NVIDIA B200, mô hình có thể hỗ trợ hơn 80 agent chạy đồng thời với chỉ số P95 end-to-end time-to-first-audio-token dưới 600ms, đưa chi phí mỗi phút xuống còn khoảng 0,0025 USD. Dự án cũng giới thiệu PhoneBench, một benchmark nội bộ dành cho AI thời gian thực, và đã phát hành trọng số mô hình trên Hugging Face.

Đăng nhập để góp ý, chỉnh sửa
Nguồn chính
SOURCE@kwindla16:36 27 thg 8TTFAT measured server-side is <100ms if you run PhoneLLM on a lightly loaded B200
SUPPORT@kwindla16:36 27 thg 8Ben Shababo at @modal did a bunch of great inference optimization work to achieve the >80 concurrent clients
SUPPORT@kwindla16:36 27 thg 8We can curate and manage production agent traces, generate synthetic data, create RL environments for training multi-turn models