ByteDance preentrena un modelo de 10 billones

ByteDance preentrena un modelo de 10 billones

ByteDance preentrena un modelo de hasta 10 billones de parámetros; nadie ha confirmado la cifra.

Por Humberto Toledo el 7 de agosto del 2026 a las 11:14 am PDT

✨︎ Resumen (TL;DR):

  • El Financial Times reportó que ByteDance preentrena un modelo de hasta 10 billones de parámetros, aunque la empresa no lo ha confirmado.
  • La cifra sería más del triple de los 2.8 billones de Kimi K3, de Moonshot AI, el modelo chino más grande liberado hasta ahora.
  • No hay fecha de lanzamiento: Reuters no pudo verificar el reporte y la comparación con Mythos 5 usa una estimación de la industria de 8 billones.

ByteDance estaría preentrenando un modelo de inteligencia artificial de hasta 10 billones de parámetros, es decir, 10 millones de millones, según un reporte del Financial Times publicado el 7 de agosto de 2026. De confirmarse, sería el modelo más grande que una empresa china haya intentado y tendría más del triple de los parámetros de Kimi K3, de Moonshot AI. ByteDance no ha confirmado el proyecto y Reuters dijo que no pudo verificarlo.

En inglés, esa escala se reporta como 10 trillion. El tamaño definitivo aún puede moverse porque el modelo sigue en entrenamiento y el conteo se fija cuando el proceso ya está avanzado.

Un parámetro de IA es un ajuste numérico que un modelo aprende de los datos para reconocer patrones, generar respuestas y ejecutar tareas. El total funciona como una medida aproximada del tamaño, no como un medidor directo de inteligencia. La calidad de los datos, la arquitectura y las técnicas de entrenamiento también influyen en el rendimiento: un modelo más pequeño y mejor entrenado puede superar a uno gigante en muchas tareas.

El proyecto sigue en preentrenamiento, la primera y más costosa fase. Suele tomar entre 3 y 6 meses. Después llegan el afinado y las pruebas, y solo entonces ByteDance decide si lo publica. No hay fecha anunciada.

ByteDance lanza Doubao 2.1 Pro y desafía a Claude Opus
Te podría interesar:
ByteDance lanza Doubao 2.1 Pro y desafía a Claude Opus
Una multitud animada se reúne en Ximending por la noche, mostrando la vibrante vida urbana de Taipei.
Foto: Jimmy Liao / Pexels

El salto que China aún no había tocado

Si el conteo final se mantiene cerca de 10 billones, ByteDance superaría en más del triple el récord chino de 2.8 billones que Kimi K3 ostentaba hasta julio de 2026. Moonshot AI presentó Kimi K3 con pesos abiertos el 16 de julio de 2026, durante la Conferencia Mundial de Inteligencia Artificial de Shanghái.

El mapa de los modelos chinos más grandes quedaba así:

  • Kimi K3, de Moonshot AI: 2.8 billones de parámetros y pesos abiertos.
  • Qwen3.8-Max, de Alibaba: 2.4 billones.
  • LongCat-2.0, de Meituan, y V4-Pro, de DeepSeek: 1.6 billones cada uno. Ese era el récord chino antes de Kimi K3.

Fuera de China, Elon Musk publicó que xAI entrena variantes de Grok de 6 y 10 billones de parámetros en su clúster Colossus 2. Si el reporte del Financial Times se sostiene, ByteDance entraría a ese grupo, pero no inauguraría la escala.

El rasero es Mythos 5, pero su tamaño es una estimación

El Financial Times comparó el proyecto con Mythos 5, de Anthropic, al que la industria calcula unos 8 billones de parámetros, y con su hermano público Fable 5, estimado en unos 5 billones. Anthropic no publica el conteo de parámetros de ninguno de sus modelos. OpenAI tampoco ha revelado ese dato para GPT-5.5.

La comparación mezcla un número reportado, el de ByteDance, con otro que nadie ha confirmado, el de Mythos 5. Por eso el tamaño de Mythos funciona como un rasero estimado, no como una especificación oficial.

El 9 de junio de 2026, Anthropic presentó Fable 5 y Mythos 5 como dos configuraciones del mismo modelo base. Anthropic describió Fable 5 con controles de seguridad conservadores para uso general. Para Mythos 5, relajó esos controles en áreas como ciberseguridad y lo reservó a un grupo pequeño de socios bajo el programa Project Glasswing.

Si ambos comparten la misma base, la diferencia estimada de 3 billones de parámetros entre Fable 5 y Mythos 5 no se desprende de la descripción de Anthropic. La empresa ha dicho que la diferencia está en los controles de seguridad, no en el tamaño.

Zhang Yiming pide evitar la destilación

El reporte del Financial Times llegó dos días después de una noticia sobre el método de entrenamiento. The Information adelantó el 5 de agosto de 2026 que Zhang Yiming, fundador de ByteDance, prohibió al equipo Seed mejorar sus modelos mediante destilación. El diario estatal chino The Paper confirmó esa información el 6 de agosto de 2026.

La destilación de modelos es una técnica que entrena un sistema con las salidas de otro más potente. Según The Paper, Zhang resumió la instrucción así: “largoplacismo y gratificación diferida, en vez de usar la salida de otros”.

The Paper también reportó que Zhang estaba dispuesto a sacrificar resultados de corto plazo antes que escalar posiciones en los rankings con material ajeno. Desde fuera, nadie puede verificar esa promesa y ByteDance no ha explicado cómo la auditará internamente.

El 22 de julio de 2026, Michael Kratsios, director de la Oficina de Política Científica y Tecnológica de la Casa Blanca, acusó a Moonshot AI de construir Kimi K3 mediante destilación industrial del modelo Fable de Anthropic y de haber alcanzado servidores con chips Nvidia GB300 en Tailandia. Moonshot lo negó.

El secretario del Tesoro de Estados Unidos, Scott Bessent, puso sobre la mesa sanciones y la Entity List. El Ministerio de Comercio chino respondió aludiendo al hegemonismo de la IA.

Investigadores externos observaron una coincidencia en las fechas: Fable 5 volvió a estar disponible el 1 de julio, después de la suspensión que le impuso el Departamento de Comercio en junio, y Kimi K3 salió 15 días después.

Anthropic ya había colocado filtros alrededor de Fable 5. El modelo salió en junio con clasificadores que filtran 3 áreas de riesgo; una de ellas es la destilación por terceros.

Además, una capa menos visible degrada, en vez de bloquear, los prompts orientados a construir modelos de frontera, como pipelines de preentrenamiento, infraestructura de entrenamiento distribuido o diseño de aceleradores. The Information reportó que la exposición de ByteDance en Estados Unidos por TikTok pesó en la decisión de Zhang. Anunciar que el equipo construye desde cero también funciona como una póliza de seguro frente a esa exposición.

El límite real está en los chips

Preentrenar un modelo de 10 billones de parámetros exige decenas de miles de aceleradores operando durante meses. Los controles de exportación de Estados Unidos dejan fuera de China a los chips Blackwell de Nvidia.

Según The Wall Street Journal, la alternativa reportada en marzo de 2026 era un clúster de unos 36,000 chips B200 instalado en Malasia con el proveedor Aolani Cloud, por más de 2,500 millones de dólares. Nvidia dijo a Tom’s Hardware que la operación cumple las reglas vigentes porque los controles regulan a dónde se envía el hardware, no dónde se utiliza el cómputo.

Dentro de China, el margen es menor. En enero de 2026, China autorizó la importación de más de 400,000 chips H200 para ByteDance, Alibaba y Tencent. Los H200 están una generación por debajo.

En diciembre de 2025, el Financial Times reportó que ByteDance planeaba una inversión de capital de 160,000 millones de yuanes para 2026, con unos 85,000 millones de yuanes destinados a chips.

El equipo Seed y Doubao aportan escala

ByteDance también tiene capacidad operativa para sostener el proyecto. El equipo Seed reúne a unas 2,000 personas y desde febrero de 2025 lo dirige Wu Yonghui, exvicepresidente de investigación de Google DeepMind después de pasar 17 años en Google.

La distribución tampoco parte de cero. Doubao, el asistente de ByteDance, ronda los 324 millones de usuarios activos al mes, según las cifras del reporte. Ese volumen lo convierte en la aplicación de inteligencia artificial más usada de China.

Qué significa para quienes desarrollan en español

Para un desarrollador en Ciudad de México, Bogotá o Madrid, lo que cambió la economía de la IA durante el último año no fueron los modelos chinos más grandes, sino los modelos abiertos.

Kimi K3, DeepSeek y Qwen publican pesos que cualquiera puede descargar, modificar y correr en servidores propios. Esa disponibilidad explica que empezaran a aparecer en productos en español.

ByteDance juega distinto: mantiene cerrada la mayoría de sus modelos, a diferencia de Moonshot, DeepSeek y Alibaba. Un sistema de 10 billones tampoco es algo que una empresa mediana pueda hospedar por su cuenta, incluso si ByteDance entregara los pesos.

Si el modelo llega, ByteDance lo ofrecerá como un servicio, con precio por token y a través de sus productos. No hay fecha de lanzamiento.

Tres preguntas que siguen abiertas

¿Cuántos parámetros tendrá el nuevo modelo de ByteDance?

Hasta 10 billones, según el reporte del Financial Times del 7 de agosto de 2026. La cifra todavía no está cerrada porque el modelo sigue en preentrenamiento. ByteDance no la ha confirmado y Reuters no pudo verificar el reporte.

¿Es más grande que Mythos 5 de Anthropic?

Con una escala de 10 billones, sí superaría los 8 billones que la industria estima para Mythos 5. Pero Anthropic nunca publicó el tamaño de ese modelo ni el de ninguno de sus otros sistemas, así que la comparación enfrenta un dato reportado con una estimación externa.

¿Cuándo saldría?

No hay fecha anunciada. El preentrenamiento suele durar entre 3 y 6 meses y después siguen el afinado y las pruebas. ByteDance mantiene cerrada la mayoría de sus modelos, mientras Moonshot, DeepSeek y Alibaba liberan pesos.

Por ahora, quedan dos límites de verificación: ByteDance no confirma los 10 billones y Anthropic nunca publicó los parámetros de Mythos 5. Con un preentrenamiento de 3 a 6 meses, seguido del afinado y las pruebas, el primer dato duro, un modelo utilizable con precio y evaluaciones comparables, no llegaría antes de finales de 2026. Mientras eso no ocurra, para quien programa en español pesan más los modelos que se pueden descargar que otro récord anunciado de parámetros.

Fuentes: 1, 2, 3

Más de AI

Feed