Thứ Tư, 26 thg 8, 2026

Google vừa phát hành Gemini 3.5 Transcribe, mô hình speech-to-text chính xác nhất của hãng với khả năng tự động loại bỏ các từ thừa và hỗ trợ hơn 85 ngôn ngữ. Công cụ này đã được tích hợp vào ứng dụng Gemini trên macOS và tính năng Rambler trên Android; các nhà phát triển có thể tiếp cận qua Google AI Studio và Gemini API.

Mô hình mới đạt tỷ lệ lỗi từ 2,6% với âm thanh không trực tuyến và 4% với âm thanh streaming, giúp rút ngắn 70% thời gian hoàn tất bản ghi so với phiên bản Chirp 3 trước đó. Gemini 3.5 Transcribe còn có khả năng phân biệt giọng nói của tối đa 3 người và hỗ trợ streaming hai chiều với độ trễ dưới một giây qua Gemini Live API, giúp xử lý tốt các token chữ và số như mã bưu điện hay mã đơn hàng.

Đăng nhập để góp ý, chỉnh sửa
Nguồn chính
SOURCE@google17:03 26 thg 8removing filler words like "ums" and "ahs" while handling self-corrections
SOURCE@sundarpichai17:04 26 thg 8API available now in @GoogleAIStudio and Gemini Enterprise, or try it in the Gemini app on macOS or Rambler on Android!
SUPPORT@officiallogank17:10 26 thg 8new speech to text model with smart transcription, function calling, more precise transcription (lower WER)
SUPPORT@_philschmid17:05 26 thg 870% reduction time for the final transcription compared to Chirp 3
SUPPORT@google17:03 26 thg 8Developers can start building in @GoogleAIStudio and Google @Antigravity
SUPPORT@google17:03 26 thg 8help turn spoken thoughts into polished text