2 sep 2026
Muse Voice Transcribe reconoce múltiples voces e idiomas y organiza en tiempo real quién dijo qué, incluso cuando los participantes cambian de idioma.
Una reunión con varias personas hablando, interrumpiéndose e incluso cambiando de idioma puede ser difícil de seguir.
Meta quiere hacer que al menos una parte de ese proceso sea más sencilla.
La compañía presentó Muse Voice Transcribe, un modelo de inteligencia artificial capaz de escuchar una conversación, convertirla en texto en tiempo real y reconocer quién está hablando.
Muse Voice Transcribe no se limita a escuchar una sola persona.
El sistema puede diferenciar a más de 20 participantes, identificar cuándo cambia el hablante y organizar la transcripción para mostrar quién dijo cada cosa.
También puede trabajar con conversaciones de más de una hora y reconocer diferentes idiomas.
Pero aquí hay una diferencia importante.
Muse Voice Transcribe transcribe, pero no traduce simultáneamente.
Por ejemplo, si en una reunión una persona habla español y otra habla inglés, la herramienta puede reconocer ambos idiomas y escribir correctamente lo que dice cada una.
Pero la persona que habló inglés seguirá apareciendo escrita en inglés y la que habló español, en español.
Es decir, no convierte automáticamente todo lo que dicen los participantes a un mismo idioma para que todos puedan entenderse.
Incluso si una misma persona comienza hablando en español, cambia al inglés y después vuelve al español, el sistema puede reconocer esos cambios y transcribir cada parte en el idioma correspondiente.
Esa capacidad es importante porque permite trabajar con conversaciones multilingües sin obligar al usuario a seleccionar un único idioma desde el principio.
La transcripción de voz a texto existe desde hace años.
Lo interesante de Muse Voice Transcribe es la cantidad de tareas que puede manejar al mismo tiempo: transcripción en vivo, más de 20 hablantes, identificación de quién está hablando, diferentes idiomas y cambios de idioma dentro de una misma conversación.
Meta señala que el modelo fue entrenado con más de 70 idiomas, aunque inicialmente cuenta con 25 ampliamente validados.
El español está entre ellos.
La tecnología está disponible a través de Meta Model API, lo que permite a desarrolladores incorporarla en sus propias aplicaciones.
Meta también la utiliza para funciones de dictado en Meta AI para Mac y en Muse Code.
Esto podría ser útil para reuniones, entrevistas, clases, conferencias o cualquier situación en la que varias personas estén hablando y sea necesario tener un registro organizado de la conversación.
Eso sí: si lo que buscas es que veinte personas hablen idiomas diferentes y que la IA traduzca automáticamente lo que dice cada una para que todas puedan entenderse, Muse Voice Transcribe todavía no hace eso.
Por ahora, su trabajo es escuchar, reconocer los idiomas, identificar quién habla y convertir todo en texto.
¿Te sería útil en reuniones aunque no traduzca automáticamente la conversación?