Hace dos años, construir un agente de voz decente significaba encadenar tres servicios distintos: uno para transcribir, otro para razonar y otro para sintetizar la respuesta, con la latencia sumándose en cada salto. En 2026 eso cambió. OpenAI puso en disponibilidad general su capa de voz dedicada, Google llevó Gemini Live al mismo estado y el mapa de opciones para construir un agente que habla en tiempo real quedó mucho más claro, aunque no más simple de elegir.
El mapa de opciones en 2026
El 10 de septiembre OpenAI liberó gpt-live-1 en la API: una capa de voz dedicada que se sienta delante de un modelo de razonamiento, con un precio plano de 0.05 dólares por minuto. Antes de eso, en julio, ya había refinado gpt-realtime-2.1 para manejar mejor interrupciones, silencios y reconocimiento de números y letras, además de sumar una versión más liviana, gpt-realtime-2.1-mini, para casos donde la latencia importa más que la profundidad de razonamiento.
Google, por su lado, llevó Gemini Live a disponibilidad general con precio por tokens de audio, no por minuto, lo que cambia el cálculo según cuánto hablen tus usuarios: una conversación corta y directa sale barata, una que se alarga con silencios y repreguntas puede costar más de lo que parece a primera vista.
ElevenLabs sigue sin tener un modelo de razonamiento propio tan fuerte, pero gana claro en calidad y clonación de voz: si necesitas que tu agente suene exactamente como una persona o una marca específica, el pipeline encadenado con ElevenLabs todavía le gana a las APIs de voz nativas, que por ahora solo ofrecen voces preestablecidas. AWS completa el cuadro con Nova 2 Sonic, pensado para quien ya vive dentro del ecosistema de Amazon y no quiere sumar un proveedor más a su factura de infraestructura.
- ▸gpt-live-1: precio predecible por minuto, buena opción si el volumen de llamadas es alto y constante
- ▸Gemini Live: precio por tokens, conviene cuando las conversaciones son cortas o muy variables
- ▸ElevenLabs encadenado: cuando la voz de marca o la clonación de voz es un requisito, no un extra
- ▸AWS Nova 2 Sonic: si tu infraestructura ya corre sobre AWS y quieres un solo proveedor
Lo que nadie te cuenta antes de construir uno
El demo siempre se ve impecable. El problema aparece con usuarios reales: alguien interrumpe a mitad de frase, hay ruido de fondo, dice un número de documento con pausas raras o se queda en silencio pensando qué decir. La diferencia entre un agente de voz que se siente natural y uno que frustra está casi toda en cómo maneja esos tres casos, no en qué tan bien suena la voz cuando todo sale perfecto.
Hay también un problema de diseño de conversación que el modelo no resuelve solo: decidir cuánto debe hablar el agente antes de ceder el turno, qué hacer cuando el usuario cambia de tema a mitad de la llamada y cuándo es mejor cortar la IA y pasar a un humano. Nada de eso viene resuelto de fábrica en ninguna de las APIs, por más avanzado que sea el modelo detrás.
Algo que aprendimos a la mala con los primeros pilotos: medir la latencia promedio no sirve de nada. Lo que mata la conversación es el percentil 95, esa respuesta lenta que aparece una de cada veinte veces y que el usuario sí nota, aunque el promedio se vea perfecto en el dashboard.
Cómo armar el tuyo, paso a paso
No hace falta dominar las tres APIs para arrancar. Lo que sí hace falta es entender el patrón común: captura de audio, manejo de turnos de conversación, lógica de negocio detrás y síntesis de la respuesta, con control de errores en cada paso. En Creación de Agentes de Voz con IA en Tiempo Real construimos ese flujo completo con un proveedor real, desde la captura hasta el manejo de interrupciones, en vez de quedarnos en la teoría de qué API es mejor en el papel.
De la voz al agente completo
Un agente de voz que solo conversa es una demo. Uno que además consulta un sistema, agenda una cita o escala a un humano cuando corresponde ya es un agente en el sentido completo: necesita memoria, herramientas y una arquitectura pensada para producción, no solo un modelo bonito hablando. Ese salto, de la voz aislada al sistema de agentes con orquestación y memoria, es exactamente lo que cubre la ruta AI Agentic Engineer, pensada para quien quiere llevar estos prototipos a algo que funcione todos los días con usuarios reales y no solo en una demo para el equipo de producto.
Por dónde empezar hoy mismo
No necesitas esperar a que el mercado se decida por un proveedor único, porque no va a pasar: cada uno gana en un escenario distinto, y esa fragmentación probablemente se mantenga todo 2026. Lo que sí conviene es elegir uno, construir algo real con él y entender el patrón general antes de comparar precios en una hoja de cálculo que vas a tener que rehacer en tres meses de todas formas. Si quieres arrancar con ese proyecto real, el curso de Agentes de Voz con IA en Tiempo Real y la ruta AI Agentic Engineer son el camino más directo para pasar de leer sobre esto a tenerlo corriendo.



