Gemini 3.8 Live: Extended Thinking cuesta 4 veces más

Gemini 3.8 Live: Extended Thinking cuesta 4 veces más

Gemini 3.8 Live cobra igual por token que Extended Thinking, pero el razonamiento eleva el costo hasta 4 veces.

Por Humberto Toledo el 15 de septiembre del 2026 a las 3:44 pm PDT

✨︎ Resumen (TL;DR):

  • Google lanzó Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking el 15 de septiembre de 2026 para agentes de voz en tiempo real, con la misma tarifa por token.
  • Extended Thinking obtuvo 82.6 puntos en el índice de voz de Artificial Analysis, 1.1 por encima de la mejor configuración de GPT-Live-1, pero costó 3.50 dólares por hora de audio de entrada frente a 0.84 del modelo básico.
  • La elección depende de la carga del agente: el modelo básico resolvió 30.1% de τ-Voice y Extended Thinking llegó a 68.6% en nivel alto.

Google lanzó el 15 de septiembre de 2026 Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, dos modelos de voz en tiempo real para agentes. Ambos comparten la tarifa por token, pero Artificial Analysis encontró una diferencia clara al contar el razonamiento: Extended Thinking alcanzó 82.6 puntos, 1.1 por encima de la mejor configuración de GPT-Live-1, con un costo de 3.50 dólares por hora de audio de entrada frente a 0.84 del modelo básico.

Gemini 3.8 Live es un modelo de voz en tiempo real para agentes que Google recomienda por defecto para la mayoría de los agentes de voz de baja latencia. Gemini 3.8 Live Extended Thinking es un modelo de voz en tiempo real para agentes que ofrece un nivel de razonamiento bajo, medio o alto.

Google Cloud creció 82%; SemiAnalysis ve rezago en Gemini
Te podría interesar:
Google Cloud creció 82%; SemiAnalysis ve rezago en Gemini
Dos jóvenes mujeres de la mano en un soleado campo de trigo, vistiendo vestidos blancos y sombreros.
Foto: Gustavo Fring / Pexels

La tarifa por token no cuenta toda la factura

La página de precios de la API de Gemini agrupa en una sola fila a Gemini 3.8 Live, Gemini 3.8 Live Extended Thinking y al anterior Gemini 3.1 Flash Live Preview. La tabla reporta estas tarifas:

  • Audio de entrada: 3 dólares por millón de tokens, equivalentes a unos 0.005 dólares por minuto.
  • Imagen o video de entrada: 1 dólar por millón de tokens, equivalentes a 0.002 dólares por minuto.
  • Salida: 4.50 dólares por millón de tokens de texto y 12 dólares por millón de tokens de audio. La salida de audio equivale a 0.018 dólares por minuto.

La propia tabla señala que los tokens de razonamiento forman parte de la salida. Solo el audio, la imagen y el video tienen una equivalencia directa por minuto; el texto y el razonamiento no.

Con esas tarifas redondeadas, The Decoder calculó que una hora de conversación cuesta unos 1.38 dólares con Google, frente a por lo menos 3 dólares con GPT-Live-1. La cuenta suma 60 minutos de audio de entrada y 60 de salida, por lo que no puede incluir el razonamiento que Extended Thinking genera durante la sesión.

Por su parte, OpenAI cobra GPT-Live-1 a 0.05 dólares por minuto de sesión y factura por segundo. La ficha del modelo aclara que el modelo de fondo y las herramientas se pagan aparte.

Artificial Analysis cuenta el razonamiento

Artificial Analysis usa una medición distinta. Su costo por hora se calcula a partir de un subconjunto fijo de 40 preguntas de Big Bench Audio y se normaliza con la duración del audio de entrada. La firma incluye audio y texto de entrada y salida, además de los tokens de razonamiento que el proveedor expone por separado.

El método deja fuera los descuentos por caché y las llamadas a herramientas. Con esa metodología, Gemini 3.8 Live costó 0.84 dólares por hora y Gemini 3.8 Live Extended Thinking, en nivel alto, costó 3.50 dólares. Las dos configuraciones de GPT-Live-1 que midió la firma quedaron en 4.47 dólares para Sol, en nivel bajo, y 5.83 dólares para Astra, en nivel medio.

Así, el modelo que encabeza el índice resultó entre 22% y 40% más barato que GPT-Live-1. La ventaja es menor que el 54% que se obtiene al comparar 1.38 dólares contra 3 dólares, porque esa primera cuenta no incluye razonamiento.

La documentación de Google permite bajar el razonamiento de Extended Thinking a nivel medio o bajo, pero la tabla de Artificial Analysis solo publica el nivel alto. Gemini 3.8 Live no acepta ese ajuste.

Extended Thinking lidera por 1.1 puntos

Artificial Analysis consultó su índice de voz el 15 de septiembre de 2026. Estos son los 5 modelos mejor colocados, junto con su resultado en τ-Voice y su costo por hora de audio de entrada:

Modelo y configuración Índice de voz Tareas de agente, τ-Voice Costo por hora de audio de entrada
Gemini 3.8 Live Extended Thinking, nivel alto 82.6 68.6% 3.50 dólares
GPT-Live-1, Astra, nivel medio 81.5 67.9% 5.83 dólares
Grok Voice Think Fast 2.0, nivel alto 81.3 56.5% 4.80 dólares
GPT-Live-1, Sol, nivel bajo 80.1 59.3% 4.47 dólares
Gemini 3.8 Live 76.0 30.1% 0.84 dólares

El liderazgo de Extended Thinking es estrecho: supera por 1.1 puntos a GPT-Live-1 en el índice y por 0.7 puntos en τ-Voice. El índice promedia con el mismo peso 4 resultados: razonamiento hablado, tareas de agente, preferencia humana y tasa de éxito.

En τ-Voice, un cliente simulado llama al modelo con un problema de aerolínea, comercio o telecomunicaciones. El caso solo cuenta como exitoso si la base de datos queda en el estado correcto. Artificial Analysis promedia 3 intentos cuando dispone de ellos; las 2 configuraciones de GPT-Live-1 se midieron con 1 intento.

Google presenta el 68.6% de Extended Thinking como liderazgo en tareas de agente y también reporta 35.1% en la versión bancaria de τ-Voice de Sierra.

Grok Voice Think Fast 2.0, de SpaceXAI, quedó a 1.3 puntos del primer lugar y fue el más rápido de los 5 modelos. Tardó 0.70 segundos en emitir el primer audio.

El modelo básico cuenta otra historia. Google lo recomienda como opción predeterminada para la mayoría de los agentes de voz de baja latencia, pero resolvió 30.1% de los casos en τ-Voice, por debajo del 37.7% de su antecesor, Gemini 3.1 Flash Live, en nivel alto.

A cambio, Gemini 3.8 Live obtiene mejores resultados en la conversación. Marcó 96.1% en dinámica conversacional, que considera pausas, turnos, interrupciones y asentimientos, frente a 91.9% de Extended Thinking. También tardó 1.18 segundos en emitir el primer audio, contra 1.35 segundos del modelo con razonamiento.

En la arena de Artificial Analysis, 93.2% de sus conversaciones terminaron con la llamada correcta a la herramienta, frente a 89.1% de Extended Thinking. Google asegura que quedó en segundo lugar en esa arena, donde las personas comparan 2 modelos sin saber cuál es cuál.

Search Live, Gemini Live y Workspace

Para el público general, Gemini 3.8 Live empieza a llegar a Search Live, la búsqueda por voz y cámara de la aplicación de Google. La función opera desde marzo en más de 200 países y territorios donde está disponible AI Mode.

Extended Thinking llega a Gemini Live, a Docs Live para suscriptores de Google AI Pro y Ultra, y a Gmail Live y Keep Live para todos los suscriptores de Google AI.

En Workspace, estas funciones comenzaron a desplegarse a principios de septiembre. Un reporte de 9to5Google indicó que Gmail Live estaba disponible en inglés y que Keep Live solo funcionaba en Android. El blog de Google del 15 de septiembre no dice si Gmail Live ya funciona en otros idiomas.

Google sí da una cifra para Gemini 3.8 Live: detecta 97 idiomas y puede cambiar entre ellos a mitad de una conversación.

En empresas, los 2 modelos entran en vista previa privada dentro de Gemini Enterprise. Google promete llevarlos pronto a Gemini Enterprise for Customer Experience, mientras que Extended Thinking también llegará a los clientes empresariales de Workspace.

Todo el audio que generan los productos de inteligencia artificial de Google lleva la marca de agua SynthID, según la compañía.

La API cambia el comportamiento de los agentes

Los 2 modelos empezaron a desplegarse el 15 de septiembre en la API de Gemini y en Google AI Studio. El blog del lanzamiento dice que Gemini 3.8 Live ejecuta herramientas y llamadas a API en segundo plano mientras la conversación continúa.

La tabla comparativa de la guía de razonamiento de Live API introduce un matiz distinto: indica que Gemini 3.8 Live espera a que termine la herramienta antes de hablar. Esa guía reserva para Extended Thinking las frases de relleno mientras trabaja, como «revisando opciones de vuelo».

Extended Thinking también cambia el protocolo. Solo acepta funciones no bloqueantes; una declaración bloqueante devuelve un error. El razonamiento se fija en nivel bajo, medio o alto.

La señal turnComplete ya no indica que el modelo quedó libre, porque puede seguir trabajando en segundo plano. Ahora esa condición la marca el campo interaction_status.

La guía de migración desde Gemini 3.1 Flash Live avisa que el diálogo afectivo salió de la API. Esa función adaptaba el estilo y el tono de la respuesta a la expresión de la persona. El audio proactivo, que controla cuándo y en qué contextos responde el modelo, queda siempre activo.

Gemini 3.8 Live también recibe por defecto los fotogramas de video. Google recomienda enviarlos solo cuando hagan falta para controlar el contexto y el costo.

La página general de Live API, actualizada el mismo 15 de septiembre, todavía presenta el diálogo afectivo entre sus funciones principales y habla de 70 idiomas, no de 97. Google también señala que Agora, LangChain, LiveKit, Pipecat y Vercel ya trabajan con esa API, y menciona a Salesforce, Genspark y Lumeris como socios de los nuevos modelos.

Para quien arma un agente telefónico, la elección entre los 2 Gemini ya no pasa por la tarifa nominal. En la prueba de Artificial Analysis, Gemini 3.8 Live costó 0.84 dólares por hora de audio de entrada y resolvió 30.1% de los casos de atención al cliente; Extended Thinking, en nivel alto, costó 3.50 dólares y resolvió 68.6%. La decisión queda entre pagar el costo adicional del razonamiento o reservarlo para agentes que realmente necesitan resolver tareas de varios pasos.

Fuentes: 1, 2, 3, 4

+ Temas Relacionados

Más de AI

Feed