Thứ Ba, 1 thg 9, 2026
Meta ra mắt Muse Voice Transcribe, mô hình nhận diện âm thanh thời gian thực đầu tiên
Models2 ngày trước1/22Meta Superintelligence Labs vừa phát hành Muse Voice Transcribe, một LLM đa phương thức kết hợp khả năng tự động nhận dạng giọng nói (ASR) dạng streaming và phân tách người nói (speaker diarization). Mô hình này xử lý âm thanh theo từng đoạn 80ms và áp dụng cơ chế trễ thích ứng để chốt từ ngữ dựa trên độ phức tạp, hướng tới tỷ lệ lỗi từ (WER) chỉ 3,1%. Muse Voice Transcribe hỗ trợ hơn 70 ngôn ngữ, trong đó có 25 ngôn ngữ đã được kiểm chứng ngay khi ra mắt, và có thể xử lý các phiên ghi âm dài cả tiếng đồng hồ với hơn 20 người nói khác nhau.
Công cụ này hiện có giá 3 USD cho mỗi 1.000 phút âm thanh thông qua Meta model API, bao gồm cả gói không lưu trữ dữ liệu. Muse Voice Transcribe hiện đang cung cấp tính năng nhập liệu bằng giọng nói cho Muse Code và tính năng đọc chính tả trên ứng dụng máy tính của Meta. Mô hình này cũng đang đứng đầu các benchmark về chuyển đổi giọng nói thành văn bản dạng streaming và các bài kiểm tra diarization công khai trên Artificial Analysis.