✨︎ Resumen (TL;DR):
- DeepSeek publicó bibliotecas de cómputo y comunicación para Ascend 950 el 30 de septiembre de 2026.
- Huawei colaboró en el desarrollo y ambas compañías trabajan en una solución de supernodo con 128 aceleradores.
- El lanzamiento no prueba un entrenamiento completo sin Nvidia; TileLang ya estaba disponible desde enero de 2025.
DeepSeek publicó el 30 de septiembre de 2026 bibliotecas de cómputo y comunicación para los aceleradores Ascend 950 de Huawei. La compañía china de IA dijo que Huawei colaboró en el desarrollo y que ambas trabajan en una solución de supernodo con 128 aceleradores. El código permite adaptar operaciones de sus modelos a esa plataforma, aunque el anuncio todavía no demuestra que todo el entrenamiento de DeepSeek pueda prescindir de Nvidia.

DeepGEMM calcula; DeepEP mueve los datos
DeepGEMM Ascend es una biblioteca de cómputo que traslada a los chips de Huawei la multiplicación de matrices, una operación que se repite en los modelos de IA. Su repositorio registra el lanzamiento inicial para Ascend 950 el 30 de septiembre de 2026 y señala que conserva la interfaz de programación de DeepGEMM en otras plataformas. Esa compatibilidad facilita reutilizar partes del software, aunque el código se optimiza para el hardware de Huawei.
DeepEP Ascend es una biblioteca de comunicación que gestiona el traslado de datos entre aceleradores. En los modelos de mezcla de expertos, los datos deben viajar hacia las partes del modelo que los procesan y regresar después. El repositorio describe funciones para esas transferencias y señala que otras formas de comunicación todavía están en desarrollo.
DeepSeek también añadió soporte Ascend a TileKernels y DeepSelect, además de publicar operaciones de atención para ese hardware en FlashMLA.
La diferencia acota el alcance del anuncio. Tener código para calcular dentro de cada chip y mover datos entre chips reduce el trabajo de adaptación, pero no equivale por sí solo a ejecutar un entrenamiento completo en un clúster grande.
TileLang es anterior a este anuncio
DeepSeek presentó TileLang como un lenguaje de más alto nivel que permite escribir operaciones para chips de IA de una forma más sencilla que trabajar directamente con CUDA, según Reuters. El proyecto no comenzó con este anuncio: ya llevaba más de un año disponible como proyecto abierto.
El repositorio principal sitúa su apertura en enero de 2025 y atribuye el desarrollo inicial a investigadores de la Universidad de Pekín. Parte del trabajo ocurrió durante una estancia en Microsoft Research, y el proyecto tiene una adaptación pública para Ascend desde septiembre de 2025.
El aporte anunciado ahora consiste en ampliar el software disponible para Ascend 950 con apoyo técnico de Huawei. El repositorio de TileKernels agradece expresamente a los desarrolladores de TileLang y a Huawei por su apoyo al nuevo backend.
TileLang tampoco reemplaza automáticamente a CUDA. El proyecto mantiene un backend para Nvidia como ruta principal. TileLang permite escribir determinadas operaciones con un lenguaje de más alto nivel y llevarlas a chips Ascend mediante el backend correspondiente.
La prueba pendiente: el sistema completo
DeepSeek informó a Reuters que ambas compañías avanzaron en una solución de supernodo con 128 chips Ascend 950 y optimizaron tanto el cálculo como la comunicación.
Los repositorios publican mediciones de rendimiento de componentes sobre hardware Huawei, bajo configuraciones definidas por los propios desarrolladores. Esos resultados describen operaciones concretas, no una comparación independiente del costo, la estabilidad y el rendimiento de un entrenamiento completo frente a una plataforma Nvidia.
FomoEra había informado que DeepSeek buscaba ampliar el uso de aceleradores Huawei para entrenar modelos. Esa meta es distinta de publicar componentes de software: disponer de código para calcular dentro de cada chip y mover datos entre chips no demuestra que el entrenamiento completo ya funcione en un clúster grande.
El lanzamiento entrega a otros desarrolladores código y documentación para trabajar con Ascend 950 y comprobar esas operaciones en sus propias cargas. La alternativa a CUDA dependerá de que las bibliotecas funcionen juntas a escala y de la disponibilidad de chips, no únicamente de que un lenguaje de programación sea abierto.
