Google presentó Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking como una nueva generación de modelos orientados a diálogo de voz y ejecución de tareas en tiempo casi real. La diferencia principal frente a un chatbot tradicional no es solamente que responden por voz: están diseñados para mantener una conversación mientras interpretan información visual y coordinan acciones mediante herramientas.
Gemini 3.8 Live está orientado a escala y eficiencia, mientras Extended Thinking se enfoca en tareas de mayor complejidad y razonamiento de varios pasos. En la práctica, eso permite separar experiencias que necesitan mucha concurrencia y baja latencia de aquellas donde el usuario acepta más procesamiento a cambio de una respuesta más elaborada.
Uno de los cambios más relevantes es la ejecución asíncrona de herramientas. Google explica que el modelo puede iniciar llamadas a herramientas o APIs y continuar la conversación mientras esas operaciones terminan. Para un agente real esto es importante: evita que cada consulta externa convierta la experiencia en una secuencia de silencios y esperas.
También incorpora grounding visual en tiempo casi real. Eso significa que una cámara o flujo visual puede convertirse en parte del contexto de la conversación. Un sistema de soporte podría, por ejemplo, observar un equipo, una interfaz o un documento y utilizar esa información para responder de manera más situada.
Google afirma que Gemini 3.8 Live puede detectar y cambiar entre 97 idiomas durante una misma conversación. Esa capacidad tiene especial valor para productos globales, centros de atención, educación y asistentes personales, donde el usuario puede mezclar idiomas o cambiar de lengua sin reiniciar el contexto.
Extended Thinking añade una capa de razonamiento más profundo para flujos complejos. La compañía muestra ejemplos como coordinación de reservas, transformación de bocetos y retroalimentación verbal en componentes funcionales y generación de planes de negocio mientras la conversación se mantiene activa.
Para empresas y desarrolladores, la oportunidad viene acompañada de nuevos retos: control de permisos, registro de acciones, manejo de errores, privacidad de audio y video y límites sobre qué herramientas puede ejecutar un agente. El modelo puede ser más capaz, pero la seguridad de un sistema productivo depende también de la arquitectura que rodea al modelo.