model release
Meta Launches Muse Voice Transcribe, Real-Time Speech Model Handling 20+ Speakers Across 70+ Languages
Meta Superintelligence Lab released Muse Voice Transcribe, its first real-time audio perception model, claiming state-of-the-art streaming speech-to-text with native speaker diarization. The model handles 20+ speakers and code-switching across languages, priced at $3 per 1,000 audio minutes.
3 min read