Inkling-Small: más código, menos memoria factual

Inkling-Small: más código, menos memoria factual

Inkling-Small supera a Inkling en código, pero pierde memoria factual; su versión NVFP4 pide 180 GB de VRAM.

Por Humberto Toledo el 30 de julio del 2026 a las 11:20 pm PDT

✨︎ Resumen (TL;DR):

  • Thinking Machines Lab publicó el jueves 30 de julio de 2026 los pesos completos de Inkling-Small bajo licencia Apache 2.0, quince días después de presentar la vista previa.
  • El modelo reúne 276,000 millones de parámetros y activa 12,000 millones por token; supera a Inkling en Humanity’s Last Exam, 31.6% frente a 29.7%, y SWE-Bench Verified, 80.2% frente a 77.6%.
  • La ventaja tiene un costo: SimpleQA Verified cae a 20.6%, frente a 43.9% de Inkling, mientras el checkpoint NVFP4 requiere 180 GB de VRAM.

Thinking Machines Lab publicó el jueves 30 de julio de 2026 los pesos completos de Inkling-Small, un modelo abierto multimodal que, según la compañía, ofrece un rendimiento comparable al de Inkling con la cuarta parte del tamaño. El modelo queda arriba en varias evaluaciones de razonamiento y código, pero cae de 43.9% a 20.6% en SimpleQA Verified, una prueba de respuestas factuales cortas. Los pesos están disponibles bajo Apache 2.0, y el requisito de 180 GB de VRAM para NVFP4 reduce el piso de hardware frente a Inkling.

El laboratorio había mostrado Inkling-Small como una vista previa en fase de pruebas el 15 de julio. Quince días después, puso los pesos completos en Hugging Face bajo licencia Apache 2.0 y habilitó su ajuste fino en Tinker, la plataforma de la compañía.

Inkling-Small es un modelo Mixture-of-Experts que activa 12,000 millones de parámetros por token de un total de 276,000 millones. Thinking Machines lo entrenó en sistemas NVIDIA GB300 NVL72. Su ventana de contexto llega a un millón de tokens y su razonamiento nativo cubre texto, imágenes y audio.

Dario Amodei asegura que Anthropic no busca prohibir los modelos abiertos
Te podría interesar:
Dario Amodei asegura que Anthropic no busca prohibir los modelos abiertos
Una imagen en primer plano de tinta de una botella siendo vertida sobre un rodillo, resaltando suministros de arte.
Foto: cottonbro studio / Pexels

El modelo chico gana en razonamiento y código

Inkling-Small empezó a entrenarse después que Inkling. Ese calendario permitió cambiar la mezcla de datos de preentrenamiento y la receta de aprendizaje automático. Después, el equipo tomó un checkpoint anterior, lo posentrenó en parte mediante destilación on-policy con Inkling como maestro y extendió durante dos semanas el aprendizaje por refuerzo en programación agéntica.

Thinking Machines midió las siguientes pruebas con un esfuerzo de razonamiento de 0.99:

  • En Humanity’s Last Exam, solo texto, Inkling-Small obtuvo 31.6% frente a 29.7% de Inkling. La ventaja se mantuvo en todos los presupuestos de pensamiento.
  • En SWE-Bench Verified, el modelo chico llegó a 80.2%, por encima de 77.6% del modelo grande.
  • En Terminal Bench 2.1, una prueba de trabajo agéntico en terminal, marcó 64.7% frente a 63.8%.
  • En razonamiento abstracto, alcanzó 84.0% en ARC-AGI-1 y 40.1% en ARC-AGI-2, frente a 79.5% y 36.5% de Inkling.
  • En seguimiento de instrucciones, IFBench quedó en 82.2%, arriba de 79.8%.
  • En matemáticas de olimpiada, AIME 2026 favoreció a Inkling: 97.1% contra 95.5% de Inkling-Small.

La tabla necesita una salvedad metodológica. Las cifras de SWE-Bench Verified y Terminal Bench 2.1 para ambos modelos provienen de arneses internos de Thinking Machines. Para los rivales, la comparación usa cifras autorreportadas o mediciones de terceros como Artificial Analysis. El resto de los resultados se apoya en evaluadores externos, así que la comparación no pasa por un árbitro único.

El 21 de julio, Poolside presentó Laguna S 2.1, un modelo de 118B con un argumento similar: un modelo abierto más pequeño puede competir con rivales de mayor tamaño.

El recorte reduce el conocimiento factual

El costo de esa ventaja aparece en la cobertura de conocimiento memorizado. En SimpleQA Verified, que evalúa respuestas factuales cortas, Inkling-Small obtuvo 20.6% frente a 43.9% de Inkling, menos de la mitad.

En el índice AA Omniscience, Inkling marcó 2.1 e Inkling-Small cayó a -9.0. En Tau 3 Banking, una prueba de agentes sobre tareas bancarias, el modelo pequeño bajó a 15.5%, frente a 23.7% del modelo grande.

La diferencia también aparece en la evaluación multilingüe Global-MMLU-Lite: Inkling-Small alcanzó 86.7%, por debajo de 88.7% de Inkling y de 90.0% de Qwen3.5-397B-A17B.

Menos parámetros dejan menos hechos guardados en los pesos. Eso puede pesar mucho en un asistente de cultura general, pero una aplicación que consulte su propia base de datos y trabaje con herramientas puede resentirlo menos.

180 GB de VRAM cambian la cuenta

Para un equipo pequeño, el requisito de hardware es tan relevante como los benchmarks. La ficha técnica de Thinking Machines establece estos pisos:

  • Inkling-Small en BF16: al menos 600 GB de VRAM agregada, equivalentes a cuatro NVIDIA B300 u ocho H200.
  • Inkling-Small en NVFP4: 180 GB de VRAM, equivalentes a una B300 o dos H200.
  • Inkling: 2 TB en BF16 y unos 600 GB en su checkpoint cuantizado.

Abrir los pesos no elimina el costo de infraestructura. Para un estudio de software, una fintech o una redacción en Ciudad de México, Bogotá o Madrid que hoy paga una API por token, la diferencia puede traducirse en correr el modelo en un par de GPU rentadas y conservar la versión afinada.

Thinking Machines no cobra por los pesos. En Tinker, Inkling e Inkling-Small entraron con un descuento por tiempo limitado, mientras que el Playground ya permite conversar con el modelo por texto, imagen y audio.

Los pesos abiertos aún exigen filtros de producción

Thinking Machines afirma que aplicó a Inkling-Small el mismo proceso de pruebas previas al despliegue que usó con Inkling. El proceso incluyó evaluaciones internas y red teaming de socios externos. El laboratorio concluyó que el modelo no aporta un riesgo material más allá del que ya circula en el ecosistema abierto.

La ficha también deja un riesgo residual: Inkling-Small cede de vez en cuando ante prompts de rol o formulaciones indirectas sobre temas dañinos. Por eso, Thinking Machines recomienda no confiar únicamente en los rechazos del modelo y sumar filtros de entrada y salida, como Llama Guard, en la capa de la aplicación.

En FORTRESS adversarial, que mide el rechazo de solicitudes dañinas, Inkling-Small obtuvo 71.6%, por debajo del 78.0% de Inkling.

Para un desarrollador hispanohablante, la decisión queda entre dos cifras: 180 GB de VRAM en NVFP4 y 20.6% en SimpleQA Verified. Inkling-Small ofrece mejores resultados en código, pesos descargables y licencia Apache 2.0, pero sacrifica cobertura de conocimiento factual. Si la aplicación tiene su propia base de datos y usa herramientas, el intercambio puede ser razonable; si depende del conocimiento general almacenado en los pesos, Inkling conserva una ventaja clara.

Fuentes: 1, 2, 3, 4

Más de AI

Feed