Para construir un agente de voz hasta hace poco, la arquitectura estándar era: grabar audio, transcribir con Whisper, procesar con un LLM, generar voz con ElevenLabs o similar. Funciona, pero cada transferencia entre servicios agrega latencia. En una conversación en tiempo real, ese acumulado se nota — y los usuarios lo sienten como lag. Amazon lanzó Nova 2 Sonic el 2 de septiembre de 2026, y el punto central es exactamente ese: procesa voz de entrada y genera voz de salida sin pasar por texto intermedio.
Nova 2 Sonic es el modelo de conversación de la familia Nova 2, la nueva serie de Amazon orientada a casos de uso especializados. Está disponible en Amazon Bedrock desde esta semana. No es el primer modelo speech-to-speech en el mercado — OpenAI tiene su modo de voz desde hace tiempo — pero sí es el primero de Amazon construido nativamente para conversación, sin depender de módulos separados.
Qué es Amazon Nova 2 Sonic y qué lo hace diferente
La diferencia central con la arquitectura de pipeline no está en la calidad de la voz ni en la inteligencia de las respuestas — está en la arquitectura. Un sistema speech-to-speech nativo procesa el audio como modalidad primaria. Eso elimina dos de los tres servicios externos (ASR y TTS) y con ellos la latencia de red que introducen.
Nova 2 Sonic está optimizado para conversación natural: entradas cortas, respuestas rápidas, turnos de diálogo fluidos. No es un modelo de transcripción de larga duración ni un narrador. Su optimización es para la interacción en tiempo real — call centers, asistentes internos, apps conversacionales.
Pipeline tradicional vs speech-to-speech: la diferencia en números
En una arquitectura de pipeline estándar, la latencia se acumula en tres etapas. Primero el ASR (Whisper u otro): entre 300 y 800 ms según el largo del audio. Luego el LLM (GPT-5.6 Sol, Claude Fable): entre 500 y 2,000 ms según el largo de la respuesta. Por último el TTS (ElevenLabs, OpenAI TTS): entre 200 y 600 ms. Total realista: 1 a 3.4 segundos por turno.
Con un modelo speech-to-speech nativo, el procesamiento end-to-end es cercano a los 500–800 ms, sin transferencias de red entre servicios separados. La diferencia de 1.5 segundos frente a 0.6 segundos parece pequeña en papel. En una conversación telefónica, es la diferencia entre natural y robótico. Los usuarios de call centers reportan tasas de abandono 30–40% más altas cuando el silencio supera el segundo.
Casos de uso donde Nova 2 Sonic cambia el cálculo
Atención al cliente telefónica. Las empresas de telecomunicaciones, banca y retail en LATAM tienen millones de llamadas por mes. Un stack de 3 proveedores distintos es caro de mantener, difícil de monitorear y sensible a fallos encadenados. Una arquitectura unificada en Bedrock simplifica el stack completo y consolida los costos en un solo proveedor.
Asistentes internos de voz para empresas. Muchas organizaciones quieren un "asistente de voz corporativo" que sepa sobre sus procesos, documentos y sistemas. Con Nova 2 Sonic integrado con Knowledge Bases nativo de Bedrock, puedes construir ese asistente con RAG sin necesidad de orquestar cinco servicios distintos — el pipeline de documentos y el de voz viven en el mismo ecosistema.
Apps de práctica conversacional. Las plataformas de aprendizaje de idiomas necesitan latencia muy baja para que la experiencia no se sienta forzada. Una arquitectura nativa elimina la pausa que hace que cada turno de diálogo parezca con lag. Es también el caso más accesible para equipos pequeños que quieren probar speech-to-speech sin infraestructura compleja.
Lo que necesitas antes de empezar con Nova 2 Sonic
- ▸Cuenta AWS con acceso a Amazon Bedrock habilitado en tu región
- ▸Solicitud de acceso al modelo en la consola de Bedrock (proceso estándar, pocas horas de espera)
- ▸SDK de AWS con soporte para streaming bidireccional de audio a través de Bedrock Runtime
- ▸Claridad sobre el caso de uso: conversación corta vs sesiones largas (hay límites de duración de sesión que debes dimensionar)
- ▸Arquitectura de fallback si una sesión de alta carga supera los tiempos de respuesta esperados
Lo que nadie te dice todavía sobre speech-to-speech nativo
Los modelos speech-to-speech nativos no son la solución perfecta para todos los casos. Hay tres limitaciones donde el pipeline tradicional sigue siendo mejor:
Control de estilo de voz limitado. Con ElevenLabs puedes clonar una voz específica, ajustar emociones, velocidad y pausas. Con un modelo nativo como Nova 2 Sonic, ese control es más opaco — el modelo decide cómo suena. Si la identidad de voz de la marca es crítica, el pipeline sigue ganando.
Observabilidad más difícil. En un pipeline tienes la transcripción del input y el texto del output para auditar cada turno. Con speech-to-speech nativo no hay texto intermedio. En industrias reguladas — banca, salud, seguros — eso puede ser un problema real para compliance y auditoría interna.
Debugging más ciego. Cuando el agente responde algo incorrecto en un pipeline, puedes leer la transcripción y entender dónde falló. Con speech-to-speech, el diagnóstico es más complejo porque no tienes representación textual del estado intermedio. Para equipos en etapas tempranas de desarrollo, eso ralentiza la iteración.
Nova 2 Sonic vs pipeline: cuándo usar cada uno
Nova 2 Sonic no reemplaza los pipelines tradicionales — los complementa. Para casos donde la latencia es el cuello de botella (call centers de alto volumen, asistentes en tiempo real, apps móviles conversacionales), la arquitectura nativa gana. Para casos donde la personalización de voz, la auditoría o el control granular son críticos, los pipelines siguen siendo la opción correcta.
Lo que sí cambia es el piso de lo posible. Hace dos años, construir un agente de voz con menos de un segundo de latencia extremo a extremo requería hardware especializado y contratos enterprise. Hoy, lo puedes hacer desde una cuenta de AWS estándar con Bedrock.
Cómo aprender a construir agentes de voz con IA
Si quieres dominar esta arquitectura desde los fundamentos — cómo conectar el modelo de voz con RAG, cómo manejar los turnos de diálogo y cómo desplegar en producción — el curso de agentes de voz con IA en tiempo real cubre exactamente eso. Es el curso más práctico de DataPath para este tipo de sistemas conversacionales.
Para entender el ecosistema de AWS donde vive Nova 2 Sonic — Bedrock, Knowledge Bases, infraestructura cloud — la especialización en IA Generativa en AWS te da el marco completo: desde los primeros pasos hasta deployar agentes con datos propios en producción.
Los agentes de voz son uno de los patrones más demandados en la ruta de AI Agentic Engineer — el perfil que más está creciendo en LATAM en 2026 y que centraliza el diseño de sistemas agénticos multimodales en producción.
Practica esto con otros que están en lo mismo
Arquitecturas de voz, latencia, observabilidad — son los temas que más generan preguntas en la práctica. Si quieres explorar esto con otros developers que están construyendo cosas similares, en la Comunidad AI Builders hacemos un taller en vivo cada semana. Es el escalón entre leer sobre una tecnología y realmente entender cómo funciona en producción.
Revisa todos nuestros cursos de agentes e IA en /cursos.



