¿Por qué tantos asistentes de voz antiguos provocan rechazo instantáneo? La respuesta no suele estar en lo que dicen, sino en cómo y cuándo lo dicen. El mayor enemigo de la naturalidad conversacional no es la gramática: es la latencia.
La psicología del turno de palabra
En la lingüística conversacional humana, la transición entre que una persona termina de hablar y la otra responde oscila habitualmente entre 150 y 250 milisegundos. Si la respuesta tarda más de 500 milisegundos, el cerebro humano percibe duda, desconexión o torpeza. Si tarda más de 1 segundo, la ilusión se destruye y el usuario se siente hablando con una máquina frustrante.
La canalización tradicional vs. El Streaming de Wapenda
Los sistemas convencionales operaban de forma secuencial y lenta:
- Esperar a que el usuario termine toda su frase.
- Enviar el archivo de audio completo a transcribir (STT).
- Enviar el texto completo al modelo LLM para generar la respuesta.
- Enviar la respuesta entera a sintetizar a voz (TTS).
- Empezar a reproducir el audio por el teléfono. (Tiempo total: 2.000 ms - 3.500 ms).
En Wapenda sustituimos esta canalización por un pipeline de streaming bidireccional continuo en colaboración con Deepgram (reconocimiento de audio en milisegundos) y ElevenLabs Conversational (síntesis neuronal ultraexpresiva):
- Transcripción fonética al vuelo: El audio del usuario se procesa palabra a palabra en tiempo real mientras está hablando.
- Inferencia predictiva del LLM: El modelo de lenguaje empieza a generar tokens de respuesta antes incluso de que la frase termine, anticipando la intención de la consulta.
- Síntesis por fragmentos (chunks): El motor de síntesis de voz empieza a emitir sonido tan pronto como recibe las primeras 3 palabras generadas, alcanzando una latencia de respuesta neta de ~200 ms.
Detección de interrupciones en tiempo real (Barge-in)
Si el asistente está explicando las opciones de horario y el cliente dice de repente: «No, perdona, mejor el viernes a las 10», el sistema de Wapenda corta el audio inmediatamente en menos de 80 milisegundos y se adapta a la nueva indicación, exactamente igual que haría una recepcionista humana en el mostrador.