Fuente primariaIAArtículo··4 min de lectura

Gemini 3.8 Live tiene rostro: Google lanza Live Avatar

Después de la voz, Google dota a sus agentes conversacionales de un avatar en video sincronizado casi en tiempo real, pensado para el servicio al cliente de las empresas.

Gemini 3.8 Live tiene rostro: Google lanza Live Avatar
Fuente : Shuo-yiin Chang et CJ Zheng (Google) · Google · 24 de septiembre de 2026Ver el original ↗

En breve

Google añade Live Avatar a Gemini 3.8 Live: un avatar en video generado casi en tiempo real, acoplado nativamente al diálogo por voz, con sincronización labial en 97 idiomas y llamadas a herramientas asíncronas. Disponible desde ya en Gemini Enterprise, apunta al servicio al cliente y a los recorridos interactivos. Un paso más hacia agentes de IA que se parecen a interlocutores humanos, con SynthID como salvaguarda.

🍺 Versión de barra

Google miró a sus asistentes de voz y pensó que el problema era que no se les veía la cara. Así que ahora el agente de tu hotel te sonríe, mueve los labios en 97 idiomas y verifica tu reserva mientras te sostiene la conversación, como un recepcionista que nunca duerme ni necesita pausa para el café. Todo viene con una marca de agua invisible, para poder demostrar después que ese simpático señor no existe. La ventanilla va a tener rostro, solo que ya no será el de nadie.

Para recordar

  1. 1

    Live Avatar acopla de forma nativa el modelo de diálogo en vivo de Gemini 3.8 con una generación de video en streaming de baja latencia.

  2. 2

    El avatar escucha, ve y habla: procesa simultáneamente entradas de audio y visuales y responde con voz, sincronización labial y expresiones faciales.

  3. 3

    Las llamadas a herramientas asíncronas permiten al agente consultar datos en segundo plano sin interrumpir la conversación, demostrado en un check-in de hotel.

  4. 4

    La sincronización labial se adapta a 97 idiomas, con cambios de idioma en plena conversación sin deriva visual, según lo anunciado.

  5. 5

    Las empresas disponen de avatares predefinidos y pueden crear un avatar a medida a partir de una sola imagen de referencia, aunque solo mediante allowlisting.

  6. 6

    Todas las salidas de audio y video llevan la marca de agua SynthID de Google.

  7. 7

    La función está disponible desde el 24 de septiembre de 2026 en Gemini Enterprise, una semana después del lanzamiento de Gemini 3.8 Live.

Un rostro para Gemini Live

Una semana después de lanzar Gemini 3.8 Live, Google añade una capa de video a su modelo de diálogo en tiempo real. Live Avatar genera un personaje animado que habla, con sincronización labial, expresiones naturales y una gestión fluida de los turnos de palabra.

El anuncio, firmado por la investigadora Shuo-yiin Chang y el ingeniero CJ Zheng en nombre del equipo Gemini Audio, insiste en el acoplamiento «nativo» entre el diálogo y el video en streaming. Dicho de otro modo, el video no es un revestimiento añadido a posteriori sobre una voz sintética.

El objetivo es claramente la empresa: servicio al cliente, visitas guiadas interactivas y, más en general, cualquier oferta virtual que una marca quiera hacer más encarnada.

Ver, escuchar, responder

Google parte de una constatación simple: una conversación es multimodal. Se escucha, se mira, se habla y uno se expresa también con el rostro.

Live Avatar procesa en paralelo lo que ve y lo que oye, y luego responde con audio y video expresivos. Google habla de «near real-time», sin dar ninguna cifra de latencia en la publicación.

Herramientas invocadas sin cortar la palabra

El punto más concreto para los integradores es la ejecución asíncrona de herramientas. El avatar puede lanzar una llamada a una API o buscar datos en segundo plano mientras continúa la conversación.

La demo elegida por Google es un check-in de hotel: el agente verifica la reserva mientras sigue hablando con el cliente. Eso es lo que separa a un avatar decorativo de un agente capaz de procesar una tarea real sin silencios incómodos.

97 idiomas y avatares a medida

La sincronización labial y las expresiones se adaptan dinámicamente a 97 idiomas, con cambios en pleno curso de la conversación. Google afirma que estas transiciones se hacen sin pérdida de fidelidad de video ni deriva visual.

En cuanto a identidad, se ofrece una biblioteca de avatares predefinidos. Las empresas también pueden generar un avatar animado a partir de una imagen de referencia de alta calidad, conservando el parecido, la identidad visual de la marca o la de un personaje.

Esta personalización sigue reservada a los clientes inscritos en una allowlist, un filtrado que probablemente no es ajeno a los riesgos de suplantación.

SynthID como salvaguarda

Todas las salidas de audio y video llevan la marca SynthID, la marca de agua imperceptible de Google, integrada directamente en el contenido generado. El objetivo declarado es limitar la desinformación y los errores de atribución.

Google remite a una model card para el detalle de su enfoque de seguridad, y a la documentación de la API para empezar.

“Live Avatar creates an experience that listens, sees, and speaks with a dynamic visual persona.”
“Conversation is inherently multimodal: we listen, look, speak, and use facial expressions to communicate.”
“Custom avatar creation is currently available only through enterprise allowlisting.”

Por qué importa

Live Avatar marca el paso del agente de voz al agente encarnado, y Google lo vende primero a las empresas, ahí donde está el dinero de los centros de llamadas. La combinación más estratégica no es el rostro en sí, sino la llamada a herramientas asíncrona: eso es lo que vuelve útil a un avatar, más allá de simplemente impresionar. Quedan varias zonas de sombra. La publicación no ofrece ninguna cifra de latencia, ninguna métrica de calidad, ninguna indicación de precio, y «near real-time» puede abarcar realidades muy distintas. Sobre todo, la creación de avatares a partir de una simple foto plantea de frente la cuestión del deepfake: el allowlisting y SynthID son respuestas, pero una marca de agua solo sirve si alguien la verifica, y el cliente frente a la pantalla no lo hará. La verdadera pregunta se convierte entonces en la de la transparencia hacia el usuario final, que Google delega en gran medida a las empresas clientes.

#google#gemini#avatar#agentes#multimodal#empresa
Fuente original
Introducing Gemini 3.8 Live with Live Avatar
Shuo-yiin Chang et CJ Zheng (Google)
Abrir el artículo ↗

Para ti

Ponla a trabajar con tus fuentes.

Gratis: los artículos de la semana y tres fuentes tuyas. Pro: todo el archivo y tus fuentes, desde 8 €/mes.

Para tu equipo

La misma máquina, sobre tus temas.

Un espacio con tus colores, tus ángulos de vigilancia, tus curadores. Piloto abierto a tres empresas.

Sigue leyendo