Vista Previa · Perfiles TTS Simulados · Llamada Real en Vivo

Marketplace de proveedores de voz en vivo (vista previa)

Tú eliges la voz detrás de tus agentes — por precio, latencia y calidad, no por dependencia de un proveedor. Esta vista previa muestra el marketplace exactamente como lo verán los clientes: compara los perfiles en la tabla y prueba el patio de síntesis de voz. Los cuatro perfiles simulados funcionan como simulaciones deterministas sin conexión — sin claves API y sin registro. La llamada en tiempo real de abajo y las opciones OpenAI/Google del patio son reales: envían audio o texto a nuestro servicio de voz, que lo retransmite al proveedor indicado.

Todos los proveedores de voz, una sola tabla comparativa

La misma interfaz de adaptador está debajo de cada proveedor, así que cambiar de vendedor nunca toca el bucle central de tu agente. Cuatro perfiles simulados son ejecutables hoy; cinco proveedores reales están declarados en el registro esperando sus adaptadores de etapa 2.

Proveedor Arquitectura Nivel de calidad Presupuesto de latencia Costo (por minuto) Estado

Todas las cifras de costo son estimaciones simuladas derivadas de precios públicos de lista (verificar antes de gastar). Las latencias son presupuestos de planificación, no benchmarks medidos. Los proveedores reales permanecen sin configurar hasta que sus claves API se instalen del lado del servidor en la etapa 2.

Demostración de voz en tiempo real

Esta es la superficie real del producto, no una simulación. Haz clic en Start call, permite el micrófono y habla: un agente real responde en tiempo real, transcribe ambos lados de la conversación en vivo y puedes interrumpirlo a mitad de frase simplemente hablando. ¿Prefieres escribir? Usa el cuadro de texto dentro de la demo. Cartesia convierte texto en voz en streaming.

Antes de empezar: esta llamada no es local. El audio de tu micrófono se transmite a nuestro servicio de voz (voice.nexusagentworks.com) y de ahí al proveedor de voz que atiende el turno (OpenAI o Google, con Cartesia para la síntesis). Nosotros no almacenamos el audio ni la transcripción; lo que cada proveedor conserve se rige por sus propios términos.

El permiso del micrófono aplica solo a esta demo: el audio se transmite a nuestro servicio de voz para la conversación y nosotros no lo almacenamos. La demo también funciona de forma independiente en voice.nexusagentworks.com.

Patio de síntesis de voz

Elige un proveedor simulado y envía texto a tu proxy local (127.0.0.1:8787). Si el proxy no está corriendo, la página sigue siendo totalmente funcional: recurre a una simulación idéntica en el navegador para que puedas seguir comparando perfiles.

Nada sale de tu máquina — el proxy solo sirve simulaciones.
Proveedor
Referencia de audio
Latencia medida (proxy)
Origen
Puerta adaptativa de fin de turno en el cliente (EoT)

La ventana fija clásica de silencio de 700–1000 ms añade 300–500 ms de aire muerto a cada turno. Una puerta adaptativa cierra el turno en cuanto el silencio final es confiadamente libre de voz — proyección respaldada por nuestro estudio de latencia (−320 ms/turno frente a la ventana clásica de 800 ms; proyectado, aún no medido en vivo).

¿Prefieres salida en vivo en lugar de la simulación integrada? Ejecuta el proxy de demostración incluido desde tu propia máquina y recarga esta página.

Una interfaz de adaptador, cualquier proveedor

Esta vista previa está conectada a la misma capa intercambiable de proveedores que impulsará los despliegues reales — una sola interfaz que todo adaptador de vendedor de voz debe satisfacer.

Cascada o voz-a-voz

Los proveedores de cascada exponen transcripción más síntesis; los proveedores S2S de nivel 3 exponen una sesión de streaming en su lugar. El bucle de tu agente depende de la interfaz, nunca del SDK de un vendedor.

Las claves se quedan en el servidor, siempre

Las claves API viven en un archivo de entorno ignorado por git y solo las lee tu proxy local. El navegador ve nombres de proveedores y un indicador de configuración — nunca un valor de clave. Los proveedores sin configurar responden con un error claro que nombra la variable faltante.

La latencia como métrica de primera clase

Cada perfil publica su presupuesto de latencia junto a su precio, porque los silencios de más de un segundo suenan robóticos. Cuando lleguen los adaptadores reales en la etapa 2, la tabla del marketplace se convierte en el marcador del bake-off.

Simulaciones deterministas sin conexión hoy

Los perfiles ejecutables son funciones puras — misma entrada, misma salida, sin red. Eso hace que toda la superficie sea testeable de extremo a extremo antes de comprometer un solo dólar de gasto API.

Preguntas comunes

¿Necesito claves API para usar esta vista previa?

Para los perfiles simulados, no: funcionan completamente sin conexión y no requieren clave, registro ni compra. La llamada en tiempo real y las opciones OpenAI/Google del patio corren con nuestras claves de proveedor, del lado del servidor; tú nunca aportas una.

¿Se envía mi texto o mi audio a algún lugar?

Depende del control que uses. Los perfiles simulados del patio se quedan en tu equipo: con el proxy corriendo tu navegador envía solicitudes a tu propia máquina en 127.0.0.1 y una simulación codifica el texto ahí; sin el proxy, la simulación ocurre enteramente en tu navegador. Las opciones OpenAI y Google del patio y la llamada en tiempo real de arriba sí salen de tu equipo: el texto o el audio del micrófono va a nuestro servicio de voz y de ahí a ese proveedor para sintetizarlo o responderlo. Nosotros no almacenamos ninguno de los dos; la retención en el proveedor se rige por sus términos.

¿Los precios y las latencias son cotizaciones reales?

No — cada cifra está etiquetada como estimación simulada. Los costos provienen de precios públicos de lista recopilados en nuestro estudio de mercado y las latencias son presupuestos de planificación; ambos existen para que puedas razonar sobre los compromisos antes de que la etapa 2 ejecute benchmarks medidos.

¿Cuándo podré escuchar voces reales?

Ya puedes: OpenAI (gpt-4o-mini-tts + Whisper) y Google (Gemini TTS + Flash ASR) están instalados como adaptadores ligeros detrás de la misma interfaz, con latencia medida en nuestras pruebas comparativas del 25 al 27 de agosto de 2026, y corren con nuestras claves en el servidor. Cartesia, ElevenLabs y Deepgram están declarados en el registro a la espera de su adaptador; invocar un proveedor sin clave falla de forma explícita en lugar de hacer una llamada de red sorpresiva.

¿Más preguntas? Consulta las preguntas frecuentes completas →

¿Quieres este marketplace detrás de tus líneas telefónicas?

Observa cómo corre toda la fuerza laboral de agentes en la demo interactiva, luego mira cuánto cuesta un despliegue administrado. Todas las cifras son estimaciones simuladas.