Thứ Ba, 1 thg 9, 2026

Meta Superintelligence Labs vừa phát hành Muse Voice Transcribe, một LLM đa phương thức kết hợp khả năng tự động nhận dạng giọng nói (ASR) dạng streaming và phân tách người nói (speaker diarization). Mô hình này xử lý âm thanh theo từng đoạn 80ms và áp dụng cơ chế trễ thích ứng để chốt từ ngữ dựa trên độ phức tạp, hướng tới tỷ lệ lỗi từ (WER) chỉ 3,1%. Muse Voice Transcribe hỗ trợ hơn 70 ngôn ngữ, trong đó có 25 ngôn ngữ đã được kiểm chứng ngay khi ra mắt, và có thể xử lý các phiên ghi âm dài cả tiếng đồng hồ với hơn 20 người nói khác nhau.

Công cụ này hiện có giá 3 USD cho mỗi 1.000 phút âm thanh thông qua Meta model API, bao gồm cả gói không lưu trữ dữ liệu. Muse Voice Transcribe hiện đang cung cấp tính năng nhập liệu bằng giọng nói cho Muse Code và tính năng đọc chính tả trên ứng dụng máy tính của Meta. Mô hình này cũng đang đứng đầu các benchmark về chuyển đổi giọng nói thành văn bản dạng streaming và các bài kiểm tra diarization công khai trên Artificial Analysis.

Đăng nhập để góp ý, chỉnh sửa
Nguồn chính
SOURCE@finkd17:15 1 thg 9SOTA in streaming speech-to-text, it handles speaker diarization, and endpointing natively in a single model
SOURCE@aiatmeta17:26 1 thg 9ranks first on @ArtificialAnlys streaming speech-to-text and on public diarization benchmarks
SUPPORT@aiatmeta17:26 1 thg 9Audio is processed in 80ms chunks (12.5 Hz), one token each
SUPPORT@finkd17:15 1 thg 9trained across 70+ languages (with 25 validated at launch)
SOURCE@finkd17:15 1 thg 9Live now on the Meta model API with a zero-data-retention tier
SUPPORT@aiatmeta17:26 1 thg 9achieves the pareto frontier on speed-accuracy trade-off measured by time to final transcription