Google đang giới thiệu hai mô hình văn bản-to-speech mới, Gemini 3.8 Flash TTS và Flash-Lite TTS, hỗ trợ hơn 100 ngôn ngữ. Flash TTS có thể tạo ra giọng nói mới từ mô tả văn bản, và cả hai mô hình đều cho phép người dùng thêm hướng dẫn sân khấu vào từng dòng và tạo ra đối thoại hai giọng từ một kịch bản duy nhất. Tính năng sao chép giọng nói có thể xây dựng một hồ sơ giọng nói từ mẫu 30 giây. Bài viết Google's new Flash TTS models let you design AI voices from scratch using text descriptions xuất hiện lần đầu trên The Decoder.

Đăng nhập để góp ý, chỉnh sửa

Nguồn chính

  1. SOURCEthe-decoder.com
  2. SOURCEhuggingface.co
  3. SOURCEmarktechpost.com
Bản Markdown