---
format: "aidr-story-markdown/v1"
id: "40ebeed3ac0fbd10af987688238b2c46adad5a28774cc7b1d27166c1e5b486ab"
canonical_url: "https://aidr.today/40ebeed3?lang=vi"
title: "PhoneLLM đạt hiệu suất ngang ngửa GPT 5.6 Terra với chi phí chỉ bằng 1/18 và độ trễ vượt trội"
lang: "vi"
requested_lang: "vi"
available_langs: ["en","vi"]
translation_fallback: null
fallback_fields: []
published_at: "2026-08-27T23:51:11.000Z"
category: "Models"
topics: ["nvidia","open-source","agent","inference","benchmark"]
source_urls: ["https://huggingnews.com/ai/phonellm-matches-gpt-56-terra-at-118-cost-to-top-third-party-latency-860728f7","https://x.com/kwindla/status/2093014818647339026","https://x.com/kwindla/status/2093014822145372491","https://x.com/kwindla/status/2093014824687136887"]
summary: "Đây là mô hình mã nguồn mở được fine-tune toàn bộ trọng số từ NVIDIA Nemotron Nano 30B, chuyên dùng cho các tình huống hỗ trợ khách hàng qua điện thoại. Mô hình này đạt hiệu suất tương đương GPT 5.6 Terra trong các tác vụ voice agent nhưng có độ trễ thấp hơn 3 lần và chi phí chỉ bằng 1/18, hướng tới các ứng dụng thời gian thực vốn cần tắt chế độ tính toán 'suy nghĩ' để duy trì tốc độ hội thoại. Khi triển khai trên một GPU NVIDIA B200, mô hình có thể hỗ trợ hơn 80 agent chạy đồng thời với chỉ số P95 end-to-end time-to-first-audio-token dưới 600ms, đưa chi phí mỗi phút xuống còn khoảng 0,0025 USD. Dự án cũng giới thiệu PhoneBench, một benchmark nội bộ dành cho AI thời gian thực, và đã phát hành trọng số mô hình trên Hugging Face."
---

# PhoneLLM đạt hiệu suất ngang ngửa GPT 5\.6 Terra với chi phí chỉ bằng 1/18 và độ trễ vượt trội

> [Open the canonical story](<https://aidr.today/40ebeed3?lang=vi>)

**Published:** 2026-08-27T23:51:11.000Z
**Category:** Models
**Topics:** nvidia, open\-source, agent, inference, benchmark

## Summary

Đây là mô hình mã nguồn mở được fine\-tune toàn bộ trọng số từ NVIDIA Nemotron Nano 30B, chuyên dùng cho các tình huống hỗ trợ khách hàng qua điện thoại\. Mô hình này đạt hiệu suất tương đương GPT 5\.6 Terra trong các tác vụ voice agent nhưng có độ trễ thấp hơn 3 lần và chi phí chỉ bằng 1/18, hướng tới các ứng dụng thời gian thực vốn cần tắt chế độ tính toán 'suy nghĩ' để duy trì tốc độ hội thoại\. Khi triển khai trên một GPU NVIDIA B200, mô hình có thể hỗ trợ hơn 80 agent chạy đồng thời với chỉ số P95 end\-to\-end time\-to\-first\-audio\-token dưới 600ms, đưa chi phí mỗi phút xuống còn khoảng 0,0025 USD\. Dự án cũng giới thiệu PhoneBench, một benchmark nội bộ dành cho AI thời gian thực, và đã phát hành trọng số mô hình trên Hugging Face\.

## Sources

- [Story source](<https://huggingnews.com/ai/phonellm-matches-gpt-56-terra-at-118-cost-to-top-third-party-latency-860728f7>)
- [Story source](<https://x.com/kwindla/status/2093014818647339026>)
- [Supporting source](<https://x.com/kwindla/status/2093014822145372491>)
- [Supporting source](<https://x.com/kwindla/status/2093014824687136887>)

