SL2T traduce ASL a texto en el Pixel 11

SL2T traduce ASL a texto en el Pixel 11

Google lleva SL2T al Pixel 11: traduce ASL a inglés, pero no sustituye a intérpretes.

Por Humberto Toledo el 12 de agosto del 2026 a las 6:11 pm PDT

✨︎ Resumen (TL;DR):

  • Google DeepMind presentó SL2T el 12 de agosto de 2026 y lo integró en Gboard y Live Transcribe del Pixel 11.
  • El modelo se entrenó con más de 100,000 horas de datos de más de 50 lenguas de señas, pero su debut solo cubre ASL a inglés en Estados Unidos.
  • Google y el comité asesor lo limitan a tareas cotidianas de bajo riesgo: no sustituye a intérpretes en escenarios médicos, legales, educativos o laborales.

Google DeepMind presentó el 12 de agosto de 2026 SL2T, un modelo que convierte lengua de señas estadounidense (ASL) en texto en inglés y que llega a Gboard y Live Transcribe en el Pixel 11. La función permite redactar mensajes, buscar en la web y responder en conversaciones cotidianas al apuntar la cámara hacia quien hace las señas. Google y su comité asesor la limitan a tareas de bajo riesgo: no sustituye a intérpretes en ámbitos médicos, legales, educativos o laborales.

Demis Hassabis propone evaluar la IA de frontera 30 días antes de su estreno
Te podría interesar:
Demis Hassabis propone evaluar la IA de frontera 30 días antes de su estreno
Una biblioteca en casa, iluminada cálidamente, llena de una diversa colección de libros y con un ambiente acogedor.
Foto: Juan Pablo Serrano / Pexels

Una traducción basada en el movimiento

SL2T es un modelo que convierte una lengua de señas en texto. En su primera versión, traduce la lengua de señas estadounidense (ASL) a inglés y permite escribir mensajes, hacer búsquedas, redactar documentos o enviar instrucciones a Gemini desde un campo de texto.

Una lengua de señas no consiste en trasladar un idioma hablado a las manos. Tiene gramática y vocabulario propios, y comunica significado mediante movimientos simultáneos de manos, brazos, torso, cabeza y rostro. Por eso SL2T realiza una traducción entre lenguas en lugar de asignar una palabra a cada gesto.

Google estima que más de 70 millones de personas sordas o con pérdida auditiva utilizan más de 200 lenguas de señas en el mundo. Esa diversidad contrasta con el alcance del producto durante su estreno, que se limita a un solo par lingüístico: ASL a inglés.

Qué datos salen del Pixel 11

El procesamiento comienza en el teléfono. MediaPipe Holistic extrae en cada fotograma las coordenadas bidimensionales de 130 puntos del rostro, el cuerpo y las manos.

Solo esa representación geométrica viaja a los servidores de Google para que SL2T genere el texto. La traducción no ocurre por completo en el dispositivo. El video original se descarta de inmediato y Google no conserva registros de las entradas ni de las salidas, salvo que la persona autorice expresamente su uso para un estudio de evaluación.

Ese diseño reduce la información visual que sale del teléfono, pero también elimina algunas pistas. Los puntos no registran los movimientos de la lengua dentro de la boca, la profundidad entre dos partes del cuerpo ni los objetos del entorno a los que una persona podría referirse.

SL2T procesa las coordenadas directamente y evita las etiquetas intermedias conocidas como glosas. Estas simplifican cada seña y pueden perder expresiones faciales o construcciones espaciales.

Entrenamiento multilingüe, estreno limitado

Google entrenó el modelo con más de 100,000 horas de datos de más de 50 lenguas de señas. Aproximadamente una cuarta parte de ese material corresponde a ASL.

En FLEURS-ASL, un conjunto de evaluación para traducir ASL a inglés, la empresa reportó una puntuación zero-shot de 70 en BLEURT y calificó el resultado como superior a mediciones anteriores. El material oficial también documenta errores con señas poco frecuentes, deletreo rápido, tiempos verbales y detalles expresados mediante clasificadores.

Gboard y Live Transcribe convierten señas en texto

En Gboard, la persona puede hacer señas frente a la cámara en cualquier campo donde normalmente escribiría. El texto resultante sirve para buscar en la web, redactar mensajes y documentos o enviar instrucciones a Gemini. Antes de utilizarlo, puede corregir el resultado con el teclado.

Live Transcribe aplica la misma idea a conversaciones presenciales. La pantalla muestra la transcripción de lo que dice la otra persona y ofrece un espacio separado para preparar la respuesta con señas.

El texto de la respuesta no se muestra ni se reproduce automáticamente. Quien hace las señas decide cuándo compartirlo.

La verificación humana forma parte del diseño, no es una medida reservada para casos excepcionales. El informe advierte que la persona necesita suficiente dominio del inglés para detectar errores y manejar los controles de edición.

SL2T genera un borrador asistido; no interpreta por sí solo una conversación completa.

Google marca una frontera para los usos de riesgo

Google DeepMind publicó el informe junto con el AI Sign Language Advisory Committee, integrado por organizaciones y especialistas de la comunidad sorda.

El documento ubica el uso previsto en búsquedas, mensajes, notas, consultas a asistentes y conversaciones informales con una persona que hace señas a la vez. Entre los ejemplos aparecen pedir algo en una cafetería o solicitar ayuda en una tienda.

La versión 1.0 no fue diseñada ni validada para situaciones donde una traducción incorrecta puede afectar derechos, salud, educación o empleo. El documento excluye estos ámbitos:

  • Consultas médicas, emergencias, salud mental y consentimiento informado.
  • Interrogatorios, tribunales, declaraciones y asesoría legal.
  • Evaluaciones académicas, clases y reuniones de educación especial.
  • Entrevistas de trabajo, revisiones de desempeño y procesos disciplinarios.
  • Audiencias administrativas y decisiones sobre servicios o beneficios públicos.

El comité también alerta del riesgo de que instituciones sustituyan a intérpretes certificados para ahorrar costos. SL2T solo traduce las señas a texto: no convierte el habla en señas, no puede pedir aclaraciones y carece del criterio cultural, ético y legal de un profesional.

Google y el comité sostienen que la herramienta, por sí misma, no satisface las obligaciones de accesibilidad que corresponden a un intérprete humano.

La cámara impone límites concretos

La traducción pierde precisión con poca luz, contraluz, ángulos extremos o cuando una parte del cuerpo sale del encuadre. El sistema solo sigue al sujeto más grande de la imagen, trabaja con clips de hasta 60 segundos y no conserva el contexto de turnos anteriores.

También puede fallar con expresiones faciales, gramática compleja, variantes regionales, nombres propios, siglas y secuencias numéricas.

Las pruebas previas documentaron “texto fantasma” cuando alguien entraba en el cuadro, la persona hacía una pausa o mantenía las manos quietas. Google afirma que redujo esas alucinaciones para la versión pública, pero no las eliminó.

SL2T tampoco fue entrenado ni evaluado formalmente con menores de 18 años. La evaluación con personas con discapacidades motoras o patrones de movimiento atípicos sigue siendo limitada.

El modelo es multilingüe, pero el producto aún no

La primera versión apunta a ASL en el mercado de Estados Unidos y produce texto en inglés. Google no anunció compatibilidad inicial con la Lengua de Señas Mexicana, la Lengua de Signos Española ni salida en español.

La compañía prometió sumar idiomas y dispositivos, pero no publicó un calendario. El acceso no tendrá costo adicional.

El hardware también acota el debut. El Pixel 11 parte de 899 dólares en Estados Unidos y llega a tiendas el 20 de agosto. En España, las reservas abrieron desde 999 euros, mientras que México todavía no tiene precio ni fecha de venta confirmados.

La disponibilidad del teléfono fuera de Estados Unidos no confirma que SL2T esté habilitado en esos mercados.

Por ahora, el alcance de SL2T queda delimitado por un solo par lingüístico, el Pixel 11 y un despliegue orientado a Estados Unidos. En las situaciones médicas, legales, educativas o laborales que el documento excluye, Google y el comité asesor mantienen al intérprete humano como la referencia necesaria.

Fuentes: 1, 2, 3, 4

+ Temas Relacionados

Más de AI

Feed