La voz en tiempo real entra en producción: Gemini 3.8 Live y DeepL Voice
Google estrena modelos capaces de conversar, razonar y usar herramientas sin detener el diálogo. DeepL añade traducción que conserva tono, ritmo e identidad vocal y la despliega en reuniones y grandes eventos. La voz deja de ser una demostración para convertirse en infraestructura.
Dos anuncios del 15 de septiembre muestran el mismo cambio desde ángulos distintos: la voz generada por IA ya no se limita a reproducir texto. Empieza a mantener una conversación, conservar la identidad del hablante y activar procesos mientras el diálogo continúa.
Google lanzó Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking en la API de Gemini y Google AI Studio. DeepL presentó nuevos modelos de Voice, una aplicación de escritorio y disponibilidad general de la traducción voz a voz para reuniones, conversaciones presenciales y su API.
01
Gemini mantiene la conversación mientras trabaja
Gemini 3.8 Live está diseñado para agentes de voz que reciben y generan audio directamente. Su llamada asíncrona de funciones permite consultar una API o ejecutar una herramienta en segundo plano sin interrumpir la respuesta hablada. La variante Extended Thinking añade razonamiento configurable para tareas de varios pasos y puede narrar el progreso mientras continúa procesando.
Google también incorpora contexto visual en directo, lectura precisa de códigos y referencias alfanuméricas, actualizaciones incrementales de contenido y soporte para más de 97 idiomas. La tarjeta técnica indica entradas de audio, imagen, vídeo y texto, una ventana de contexto de hasta 128.000 tokens y salidas de audio y texto.
Cambio operativo
Un agente puede seguir atendiendo a una persona mientras consulta disponibilidad, valida un código o recupera información. La latencia de la herramienta deja de bloquear toda la experiencia.
02
DeepL intenta conservar a la persona, no solo el mensaje
La actualización de DeepL Voice busca preservar tono, ritmo, entonación y expresión al traducir. La voz de cada participante permanece diferenciada en 14 idiomas compatibles con esta función, incluso cuando varias personas intervienen en la misma conversación.
La nueva aplicación para Windows y macOS funciona junto a Zoom, Microsoft Teams y Google Meet. Detecta las llamadas, muestra subtítulos traducidos y permite pasar a traducción voz a voz. DeepL también ofrece conversaciones presenciales y una API orientada a centros de contacto, herramientas empresariales y productos propios.
La diferencia es perceptiva. Los subtítulos transmiten contenido; una voz que mantiene rasgos del hablante conserva parte de su intención, energía y presencia. Esa capa puede mejorar la comprensión y reducir la sensación de estar escuchando una locución genérica.
03
Los eventos se convierten en el banco de pruebas real
DeepL está utilizando Dreamforce 2026 como demostración de escala: traducción en tiempo real para 50 escenarios y más de 1.000 sesiones, según la compañía. Ese despliegue sitúa la tecnología fuera del contexto controlado de una videollamada y la enfrenta a ruido, múltiples salas, cambios de ponente, terminología especializada y picos de audiencia.
En congresos y producciones audiovisuales, la misma infraestructura puede alimentar auriculares personales, aplicaciones móviles, subtítulos, señal de streaming y contenidos posteriores. La transcripción deja de ser el producto final y se convierte en una fuente común para traducción, accesibilidad, resumen y automatización.
La interpretación humana continúa siendo la referencia en situaciones críticas, discursos complejos y contextos culturales sensibles. La IA amplía cobertura y flexibilidad, pero necesita rutas claras de supervisión y sustitución cuando la calidad cae.
04
Precio, vocabulario y arquitectura
Google publica para Gemini 3.8 Live un precio de 0,005 dólares por minuto de audio de entrada y 0,018 dólares por minuto de audio de salida. El coste real depende del tiempo de conversación, el uso de herramientas y el razonamiento adicional. DeepL comercializa Voice mediante suscripciones y contacto empresarial; su anuncio no ofrece una tarifa pública comparable por minuto.
Google también integra en su oferta Gemini 3.5 Transcribe, presentado el mes anterior, con más de 85 idiomas, detección automática, diarización, marcas temporales y vocabulario personalizado de hasta 1.000 términos. Esta última función resulta decisiva en eventos y entornos técnicos, donde nombres propios, marcas y acrónimos suelen concentrar los errores más visibles.
La arquitectura adecuada separa captura, reconocimiento, traducción, razonamiento y distribución. Así, cada componente puede medirse o reemplazarse sin rehacer toda la experiencia. También permite mantener el audio original disponible para una persona cuando la transcripción no es suficiente.
05
La identidad vocal abre nuevos riesgos
Preservar una voz mejora naturalidad, pero también aumenta la necesidad de consentimiento y transparencia. Los oyentes deben saber cuándo escuchan una traducción generada y no la voz original. La similitud nunca debería utilizarse para atribuir al hablante palabras que no ha podido revisar en un contexto sensible.
DeepL declara que no almacena permanentemente el audio de las sesiones ni utiliza esos datos para entrenar modelos. Aun así, cada despliegue debe considerar la captura local, el transporte de audio, los registros, las plataformas conectadas y la política del organizador.
También persisten riesgos operativos: una traducción fluida puede ocultar un error semántico; una voz convincente puede generar más confianza de la que merece el contenido; y una conexión degradada puede romper la continuidad en el peor momento. La calidad acústica y la observabilidad del sistema forman parte de la seguridad.
06
Aplicaciones que pasan de prototipo a servicio
- Eventos multilingües. Un mismo flujo puede alimentar audio traducido, subtítulos y contenido bajo demanda para varias salas.
- Reuniones híbridas. Los participantes pueden escuchar en su idioma sin perder por completo el tono del hablante.
- Atención y reservas. El agente mantiene la conversación mientras consulta sistemas y ejecuta tareas autorizadas.
- Accesibilidad. Transcripción, traducción y audio pueden adaptarse a preferencias y dispositivos distintos.
- Producción audiovisual. El contenido hablado puede generar versiones lingüísticas, índices, resúmenes y metadatos desde una fuente común.
Conclusión
La ventaja ya no está solo en entender la voz, sino en mantener la conversación útil.
Gemini 3.8 Live combina diálogo y acción; DeepL Voice combina traducción e identidad. Juntas, estas novedades acercan una infraestructura de voz capaz de operar en reuniones, atención y eventos. El éxito dependerá de medir latencia, precisión, coste y privacidad con la misma seriedad que la calidad sonora.
Cinco criterios para evaluar un sistema de voz en tiempo real
- Latencia de extremo a extremo. Debe medirse desde el micrófono hasta el oído, no solo en el modelo.
- Terminología real. Nombres, marcas, acrónimos y cifras necesitan una evaluación específica.
- Degradación visible. El sistema debe indicar cuándo pierde calidad o cambia a subtítulos.
- Consentimiento y privacidad. La captura y la recreación de la voz requieren reglas comprensibles.
- Ruta humana. Debe existir una transición rápida cuando el contenido o el contexto superan al sistema.
Fuentes
Información comprobada en publicaciones y documentación oficial de Google y DeepL del 15 de septiembre de 2026.