Cómo funciona la síntesis de voz neuronal (y por qué suena tan natural)
Si probaste un lector de texto a voz hace varios años y después escuchaste una voz neuronal moderna, la diferencia es enorme: pasamos de una voz robótica, entrecortada, a algo que se acerca bastante a una persona real leyendo. Esto es lo que cambió.
Cómo se sintetizaba la voz antes
Los sistemas de texto a voz clásicos funcionaban armando el audio a partir de fragmentos de sonido pregrabados —sílabas o pequeños trozos de palabras— que se iban pegando uno detrás del otro según el texto a leer. El resultado sonaba entrecortado porque, literalmente, era un collage de sonidos grabados por separado, sin una entonación natural que atravesara toda la oración.
Qué cambia con la síntesis neuronal
Las voces neuronales no pegan fragmentos grabados: un modelo entrenado con muchas horas de habla real genera la forma de onda de audio de punta a punta, prediciendo cómo debería sonar cada palabra en el contexto de toda la oración. Eso le permite manejar mejor la entonación, las pausas y el énfasis, en vez de sonar como piezas sueltas unidas a la fuerza.
Por qué se nota tanto la diferencia al escuchar un documento largo
En una oración corta, una voz robótica es molesta pero tolerable. En un documento largo —un capítulo, un informe, un paper— esa diferencia se acumula: una voz neuronal con entonación natural es mucho menos cansadora de escuchar durante períodos prolongados, porque el cerebro no tiene que "traducir" constantemente un patrón de habla artificial.
Qué hace posible el resaltado palabra por palabra
Además de generar el audio, estos sistemas devuelven información sobre en qué momento exacto del audio empieza a pronunciarse cada palabra del texto original. Esa información —usada, por ejemplo, para el resaltado palabra por palabra de Lectura Inmersiva— es lo que permite sincronizar en pantalla exactamente qué palabra se está escuchando en cada instante, sin que el texto y el audio se desincronicen con el correr de los minutos.
Escuchalo vos mismo
La mejor forma de notar la diferencia es escucharla directamente. Subí un PDF a Lectura Inmersiva y probá alguna de las voces neuronales disponibles en español o inglés, con resaltado palabra por palabra en tiempo real.
Mirá también nuestras preguntas frecuentes para más detalle sobre las voces e idiomas disponibles.