Meta presenta Muse Voice Transcribe, un modelo de transcripción de IA en tiempo real
Meta presentó Muse Voice Transcribe el 1 de septiembre de 2026, y el modelo ya está disponible en la aplicación Meta AI para Mac. Es el primer modelo de percepción de audio en tiempo real de Meta.
Meta afirma que el modelo combina conversión de voz a texto en streaming, diarización de hablantes y finalización en un solo sistema. Puede transcribir a más de 20 hablantes a la vez, manejar múltiples idiomas simultáneamente e incluso seguir el cambio de código, incluyendo oraciones que mezclan palabras de diferentes idiomas.
Estadísticas del modelo
Según el blog de investigación, Muse Voice Transcribe fue entrenado en más de 70 idiomas, con 25 validados en el lanzamiento. Meta también dice que puede manejar sesiones de una hora con más de 20 hablantes, lo que lo hace adecuado para reuniones, entrevistas, pódcast y otras conversaciones en vivo.
El modelo está disponible ahora en la aplicación Meta AI para Mac, donde también puede potenciar funciones de dictado en otras aplicaciones. Los desarrolladores pueden acceder a él a través de Muse Code y la API de Modelos de Meta.
Meta fijó el precio de Muse Voice Transcribe en $3 por 1,000 minutos de audio. Mark Zuckerberg resumió el enfoque del modelo de esta manera: El modelo decide cuándo escuchar. Espera un poco más en palabras difíciles y se compromete más rápido en las fáciles, utilizando un retraso adaptativo para predecir cada token y aumentar la precisión.— Mark Zuckerberg, CEO de Meta
¿Se vuelven mucho más útiles las herramientas de transcripción en tiempo real una vez que pueden seguir a múltiples hablantes, idiomas y cambios de código al mismo tiempo?