Google presentó Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking como una nueva generación de modelos orientados a diálogo de voz y ejecución de tareas en tiempo casi real. La diferencia principal frente a un chatbot tradicional no es solamente que responden por voz: están diseñados para mantener una conversación mientras interpretan información visual y coordinan acciones mediante herramientas.

Gemini 3.8 Live está orientado a escala y eficiencia, mientras Extended Thinking se enfoca en tareas de mayor complejidad y razonamiento de varios pasos. En la práctica, eso permite separar experiencias que necesitan mucha concurrencia y baja latencia de aquellas donde el usuario acepta más procesamiento a cambio de una respuesta más elaborada.

Uno de los cambios más relevantes es la ejecución asíncrona de herramientas. Google explica que el modelo puede iniciar llamadas a herramientas o APIs y continuar la conversación mientras esas operaciones terminan. Para un agente real esto es importante: evita que cada consulta externa convierta la experiencia en una secuencia de silencios y esperas.

También incorpora grounding visual en tiempo casi real. Eso significa que una cámara o flujo visual puede convertirse en parte del contexto de la conversación. Un sistema de soporte podría, por ejemplo, observar un equipo, una interfaz o un documento y utilizar esa información para responder de manera más situada.

Google afirma que Gemini 3.8 Live puede detectar y cambiar entre 97 idiomas durante una misma conversación. Esa capacidad tiene especial valor para productos globales, centros de atención, educación y asistentes personales, donde el usuario puede mezclar idiomas o cambiar de lengua sin reiniciar el contexto.

Extended Thinking añade una capa de razonamiento más profundo para flujos complejos. La compañía muestra ejemplos como coordinación de reservas, transformación de bocetos y retroalimentación verbal en componentes funcionales y generación de planes de negocio mientras la conversación se mantiene activa.

Para empresas y desarrolladores, la oportunidad viene acompañada de nuevos retos: control de permisos, registro de acciones, manejo de errores, privacidad de audio y video y límites sobre qué herramientas puede ejecutar un agente. El modelo puede ser más capaz, pero la seguridad de un sistema productivo depende también de la arquitectura que rodea al modelo.

Fuentes consultadas