---
format: "aidr-story-markdown/v1"
id: "a58dc06716bd8020cf27df1a2d1c791cd9b276e5a530d0b6fb57736f58d6f594"
canonical_url: "https://aidr.today/a58dc067?lang=vi"
title: "Nvidia mở mã nguồn mô hình gắn nhãn người nói cho 8 giọng nói chồng lấn"
lang: "vi"
requested_lang: "vi"
available_langs: ["en","vi"]
translation_fallback: null
fallback_fields: []
published_at: "2026-09-23T17:17:53.000Z"
category: "Releases"
topics: ["nvidia","open-source","speech-recognition","huggingface","voice-agents","openai","gpt","text-to-speech"]
source_urls: ["https://huggingnews.com/ai/nvidia-open-sources-speaker-labeling-model-for-8-overlapping-voices-68430efe","https://x.com/NVIDIAAI/status/2102775666366435450","https://x.com/andimarafioti/status/2102777099245240492","https://x.com/kwindla/status/2102796440242413907","https://marketbrief.now/ai/nvidia-open-sources-speaker-labeling-model-for-8-overlapping-voices-68430efe","https://www.marktechpost.com/2026/09/23/nvidia-releases-nemotron-3-diarization/"]
summary: "Nemotron 3 Diarization giúp các nhà phát triển giữ bản ghi chép sạch bằng cách phân biệt nhiều người nói trong cùng một luồng âm thanh. Mô hình 100M parameter, hiện có mặt dưới dạng open weight trên Hugging Face, nhận diện được tối đa 8 người nói và theo dõi danh tính ngay cả khi giọng chồng lấn lên nhau. Nvidia phát hành công cụ theo giấy phép thân thiện với thương mại, cho phép triển khai trên thiết bị cục bộ hoặc trên cloud. Công cụ hướng đến voice agent và các ứng dụng AI thời gian thực, nhằm cải thiện khả năng máy nhận biết ai đang nói với mình. Nó tích hợp sẵn với Transformers ngay từ đầu và có thể kết hợp với các mô hình chuyển ngữ - phiên âm hiện có. Thử nghiệm sớm với DGX Spark và robot Reachy Mini cho thấy hệ thống nhận ra giọng mới, hỏi tên và ghi nhớ được."
---

# Nvidia mở mã nguồn mô hình gắn nhãn người nói cho 8 giọng nói chồng lấn

> [Open the canonical story](<https://aidr.today/a58dc067?lang=vi>)

**Published:** 2026-09-23T17:17:53.000Z
**Category:** Releases
**Topics:** nvidia, open\-source, speech\-recognition, huggingface, voice\-agents, openai, gpt, text\-to\-speech

## Summary

Nemotron 3 Diarization giúp các nhà phát triển giữ bản ghi chép sạch bằng cách phân biệt nhiều người nói trong cùng một luồng âm thanh\. Mô hình 100M parameter, hiện có mặt dưới dạng open weight trên Hugging Face, nhận diện được tối đa 8 người nói và theo dõi danh tính ngay cả khi giọng chồng lấn lên nhau\. Nvidia phát hành công cụ theo giấy phép thân thiện với thương mại, cho phép triển khai trên thiết bị cục bộ hoặc trên cloud\. Công cụ hướng đến voice agent và các ứng dụng AI thời gian thực, nhằm cải thiện khả năng máy nhận biết ai đang nói với mình\. Nó tích hợp sẵn với Transformers ngay từ đầu và có thể kết hợp với các mô hình chuyển ngữ \- phiên âm hiện có\. Thử nghiệm sớm với DGX Spark và robot Reachy Mini cho thấy hệ thống nhận ra giọng mới, hỏi tên và ghi nhớ được\.

## Sources

- [Story source](<https://huggingnews.com/ai/nvidia-open-sources-speaker-labeling-model-for-8-overlapping-voices-68430efe>)
- [Story source](<https://x.com/NVIDIAAI/status/2102775666366435450>)
- [Supporting source](<https://x.com/andimarafioti/status/2102777099245240492>)
- [Supporting source](<https://x.com/kwindla/status/2102796440242413907>)
- [Story source](<https://marketbrief.now/ai/nvidia-open-sources-speaker-labeling-model-for-8-overlapping-voices-68430efe>)
- [Story source](<https://www.marktechpost.com/2026/09/23/nvidia-releases-nemotron-3-diarization/>)

