Kolibri de Aleph Alpha: pesos abiertos y 1 millón de tokens

Kolibri de Aleph Alpha: pesos abiertos y 1 millón de tokens

Aleph Alpha libera Kolibri con pesos abiertos, 1,048,576 tokens de contexto y 78 GB en FP8.

Por Humberto Toledo el 3 de octubre del 2026 a las 8:18 pm PDT

✨︎ Resumen (TL;DR):

  • Aleph Alpha publicó los pesos de Kolibri el 3 de octubre de 2026 para su uso en infraestructura propia bajo Apache 2.0.
  • Sus pesos ocupan unos 78 GB en FP8; el modelo tiene 78,100 millones de parámetros y activa 3,460 millones por token.
  • El contexto validado llega a 1,048,576 tokens, aunque la empresa recomienda 262,144 para tareas complejas y despliegues que prioricen rapidez o capacidad.

Aleph Alpha publicó el 3 de octubre de 2026 los pesos de Kolibri, un modelo de inteligencia artificial para alemán e inglés cuyo contexto validado llega a 1,048,576 tokens. La licencia Apache 2.0 permite que organizaciones lo ejecuten en infraestructura propia y mantengan ahí sus documentos, aunque sus pesos ocupan unos 78 GB en FP8 y requieren memoria adicional para atender consultas.

Kolibri es un modelo de inteligencia artificial que procesa cada unidad de texto con una arquitectura de mezcla de expertos, o MoE, para reducir el cómputo por token. Aleph Alpha lo orienta a la administración pública, la industria y el sector aeroespacial.

Aleph Alpha afirma que entrenó el modelo en infraestructura de Alemania y Finlandia. También publicó un informe técnico de 189 páginas sobre su desarrollo y evaluación.

Cohere compra Aleph Alpha por $20,000 MDD para desafiar a OpenAI
Te podría interesar:
Cohere compra Aleph Alpha por $20,000 MDD para desafiar a OpenAI
Un colibrí se alimenta delicadamente de una colorida flor de lirio antorcha sobre un fondo oscuro.
Foto: Veronika Andrews / Pexels

Menos cómputo por token, con todos los pesos en memoria

Kolibri tiene 78,100 millones de parámetros totales y activa unos 3,460 millones por token. Su arquitectura MoE selecciona partes especializadas del modelo para procesar cada unidad de texto. Así reduce el cómputo de cada token, pero todos los pesos deben permanecer en memoria.

Los pesos ocupan unos 78 GB en FP8, un formato de ocho bits. El funcionamiento necesita memoria adicional para procesar las consultas, y las consultas más largas destinan más memoria al contexto.

Entre las configuraciones mínimas, Aleph Alpha enumera dos GPU H100 SXM5 o una H200. El aumento de memoria para contexto puede reducir cuántas solicitudes se atienden simultáneamente.

El millón de tokens no es el ajuste recomendado

La ventana de contexto es un límite de texto que determina cuánto contenido puede manejar el modelo en una interacción. Se mide en tokens, unidades que pueden representar palabras o fragmentos de ellas.

La ficha de Hugging Face precisa que el contexto nativo es de 262,144 tokens, mientras que la extensión validada llega a 1,048,576 tokens. Aleph Alpha recomienda el límite menor para tareas complejas y para despliegues que prioricen rapidez o capacidad de atender consultas.

Activar el máximo exige ajustar la configuración del servicio de inferencia. Además, una consulta más larga aumenta la memoria destinada al contexto y puede reducir la cantidad de solicitudes simultáneas.

Resultados separados por idioma

En las pruebas publicadas por el desarrollador, Kolibri obtuvo 96.9% en AIME 2025 en inglés y 87.5% en su versión alemana. Las cifras miden su desempeño en problemas matemáticos bajo las condiciones descritas por la empresa.

Los resultados deben leerse junto con el idioma de cada prueba, porque Aleph Alpha reportó cifras separadas para inglés y alemán.

Qué incluye la licencia Apache 2.0

La apertura permite descargar y adaptar los pesos y archivos de configuración publicados. Sin embargo, la licencia deja fuera otros componentes, como el código de entrenamiento.

Para una organización que quiere operar la IA internamente, el cambio concreto es controlar dónde se ejecuta y mantener ahí sus documentos. Esa autonomía depende de dimensionar el hardware y el contexto para sus consultas.

El punto práctico queda en la configuración: 262,144 tokens es la recomendación para tareas complejas, rapidez o capacidad de atención, mientras 1,048,576 tokens requiere ajustar el servicio y reservar más memoria. Kolibri ofrece los pesos para operar por cuenta propia, pero no incluye el código con el que fue entrenado.

Fuentes: 1, 2, 3, 4

Más de AI

Feed