Gemini 3.8 Live with Live Avatar lleva la conversación con inteligencia artificial a una interfaz donde la respuesta no es solo texto o audio. Google combina diálogo en vivo con generación de video de baja latencia para producir una presencia visual que puede escuchar, observar y responder con voz, movimiento facial y sincronización labial.
La diferencia frente a un avatar tradicional es que la representación visual está conectada al mismo sistema que interpreta la conversación y el contexto. Google describe procesamiento simultáneo de entradas de audio y video, lo que permite que la respuesta visual se adapte a lo que el agente oye y ve.
La compañía plantea casos empresariales como atención al cliente y recorridos interactivos. Además, el sistema puede ejecutar herramientas de manera asíncrona: mientras una llamada externa consulta datos o completa una tarea, el avatar puede mantener el diálogo y comunicar progreso al usuario.
Live Avatar admite transiciones entre 97 idiomas y ajusta voz, sincronización labial y expresiones al cambio de idioma. Para organizaciones internacionales, esa combinación puede reducir la necesidad de crear una experiencia visual distinta para cada lengua, aunque la calidad real deberá evaluarse según acento, contexto y dominio específico.
Las organizaciones también pueden personalizar avatares a partir de imágenes de referencia, aunque Google señala que la creación de avatares personalizados está limitada mediante allowlisting empresarial. Esto introduce una cuestión especialmente sensible: identidad y representación. Cuanto más realista es un avatar, más importante es informar al usuario de que interactúa con contenido generado por IA.
Google afirma que el contenido generado por Live Avatar incorpora SynthID, su sistema de marca de agua para contenido de IA. Esa medida busca facilitar detección y reducir riesgos de atribución errónea, aunque la transparencia también depende de cómo cada empresa presente la experiencia al usuario.
Para medios, educación, ventas o servicio al cliente, la tecnología abre posibilidades importantes, pero no elimina la necesidad de diseño editorial y control. Un avatar convincente puede mejorar presencia y accesibilidad; también puede amplificar errores si el sistema que lo alimenta responde con información incorrecta o ejecuta acciones sin controles adecuados.