← Về trang chính1 tin
Thứ Tư, 26 thg 8, 2026
1
Google ra mắt Gemini 3.5 Transcribe, giúp giảm 70% thời gian chuyển đổi âm thanh thành văn bản so với Chirp 3
Models8 ngày trước1/16Google vừa phát hành Gemini 3.5 Transcribe, mô hình speech-to-text chính xác nhất của hãng với khả năng tự động loại bỏ các từ thừa và hỗ trợ hơn 85 ngôn ngữ. Công cụ này đã được tích hợp vào ứng dụng Gemini trên macOS và tính năng Rambler trên Android; các nhà phát triển có thể tiếp cận qua Google AI Studio và Gemini API.
Mô hình mới đạt tỷ lệ lỗi từ 2,6% với âm thanh không trực tuyến và 4% với âm thanh streaming, giúp rút ngắn 70% thời gian hoàn tất bản ghi so với phiên bản Chirp 3 trước đó. Gemini 3.5 Transcribe còn có khả năng phân biệt giọng nói của tối đa 3 người và hỗ trợ streaming hai chiều với độ trễ dưới một giây qua Gemini Live API, giúp xử lý tốt các token chữ và số như mã bưu điện hay mã đơn hàng.
Đăng nhập để góp ý, chỉnh sửa
Nguồn chính
SOURCE@google17:03 26 thg 8— removing filler words like "ums" and "ahs" while handling self-corrections
SOURCE@sundarpichai17:04 26 thg 8— API available now in @GoogleAIStudio and Gemini Enterprise, or try it in the Gemini app on macOS or Rambler on Android!
SUPPORT@officiallogank17:10 26 thg 8— new speech to text model with smart transcription, function calling, more precise transcription (lower WER)
SUPPORT@_philschmid17:05 26 thg 8— 70% reduction time for the final transcription compared to Chirp 3