Muse Spark 1.3 supera a Opus 5 con un modo no disponible

Muse Spark 1.3 supera a Opus 5 con un modo no disponible

Muse Spark 1.3 supera a Opus 5 en DeepSWE, pero Meta usó un modo de razonamiento aún no disponible.

Por Humberto Toledo el 3 de septiembre del 2026 a las 1:52 am PDT

✨︎ Resumen (TL;DR):

  • Meta lanzó Muse Spark 1.3 el 2 de septiembre de 2026 en Muse Code y Meta Model API, al mismo precio que la versión anterior.
  • En DeepSWE v1.1 obtuvo 75.4 frente a 74.0 de Claude Opus 5, pero la prueba usó “max”, un nivel de razonamiento que todavía no está disponible.
  • La modalidad de contribuidor reduce el costo a cambio de permitir que Meta use el trabajo del desarrollador para mejorar sus modelos.

Meta lanzó el miércoles 2 de septiembre de 2026 Muse Spark 1.3, la cuarta versión de su modelo insignia en cinco meses, y lo puso ese día en Muse Code y Meta Model API al precio de su antecesor. La empresa reportó 75.4 en DeepSWE v1.1 frente a 74.0 de Claude Opus 5, pero esa corrida usó “max”, un nivel de razonamiento que todavía no ofrece mientras completa pruebas de seguridad adicionales. La API de hoy funciona con otro modo.

Meta elige Slack sobre Google Chat por los agentes de IA
Te podría interesar:
Meta elige Slack sobre Google Chat por los agentes de IA
Imagen abstracta vibrante con curvas y círculos entrelazados en tonos azules y naranjas.
Foto: Steve A Johnson / Pexels

La ventaja aparece en el modo “max”

DeepSWE v1.1 es una prueba de programación de largo recorrido que Meta usó para comparar Muse Spark 1.3 con Claude Opus 5. En ese marcador, el modelo de Meta obtuvo 75.4 contra 74.0, una diferencia de 1.4 puntos.

Meta presentó el lanzamiento como una mejora en tareas de código y de agentes. Organizó la comparación en tres bloques: agentes, contexto largo y programación, con Muse Spark 1.2, Claude Opus 5 y GPT-5.6 Sol como referencias.

Entre los resultados publicados aparecen estos datos:

  • DeepSWE v1.1: 75.4 para Muse Spark 1.3 frente a 74.0 para Claude Opus 5.
  • Terminal-Bench 2.1: 88.8, en empate con GPT-5.6 Sol.
  • SWE-Atlas Codebase QnA: 59.4, por encima de 53.5 y 52.7, las cifras de los otros dos modelos.

El reporte metodológico presenta dos descripciones distintas de la configuración de Muse Spark 1.3. En el apartado general, Meta escribe que usó esfuerzo de razonamiento “xhigh” para sus dos modelos, mientras Claude Opus 5 y GPT-5.6 Sol usaron “max”.

En el apartado específico de DeepSWE v1.1, sin embargo, el mismo documento dice que ejecutó “Muse Spark 1.3 max” con un agente mini-swe y que tomó los resultados de los demás modelos del tablero oficial de Datacurve.

El blog de Meta señala que los modos de razonamiento previos están disponibles desde el primer día y que el máximo llegará después de pruebas de seguridad adicionales. En la única prueba cuyo método documenta de forma explícita el uso de “max”, la ventaja sobre Opus 5 fue de 1.4 puntos.

Por eso, el resultado de 75.4 proviene de una configuración que quienes conectan a la API todavía no pueden seleccionar.

El marcador tiene más de una condición

Meta incluye una salvedad sobre los modelos ajenos: cuando resulta práctico, usa configuraciones comunes, pero sus corridas son de mejor esfuerzo. También admite que los prompts, las herramientas y el entorno podrían no estar ajustados para modelos propietarios ni reflejar su mejor rendimiento.

El reporte toma, para cada modelo, el valor más alto disponible entre la evaluación propia de Meta, el tablero oficial de la prueba y lo publicado por el proveedor. Las respuestas que no se pueden calificar y los rechazos del modelo valen cero, pero siguen dentro del denominador. Esa regla penaliza a los modelos que se niegan a completar una tarea.

El desglose de las cuatro pruebas publicado con el anuncio añade estos detalles:

  • DeepSWE v1.1: Meta corrió Muse Spark 1.3 en “max” con un agente mini-swe y tomó los resultados de los demás modelos del tablero de Datacurve.
  • Terminal-Bench 2.1: Muse Spark 1.3 marcó 88.8, en empate con GPT-5.6 Sol. Cada tarea se ejecutó con el agente de programación indicado, en un entorno aislado en la nube y con el verificador oficial GDPVal-AA v2.
  • GDPVal-AA v2: Meta reportó 1754 frente a 1824 de Claude Opus 5. La metodología describe comparaciones a ciegas juzgadas por un modelo de lenguaje, en un marcador Elo con la referencia humana fijada en 1,000.
  • IF Index: quedó en 57.8 frente a 60.5 de GPT-5.6 Sol. IF Index es una evaluación interna de Meta que agrupa varias pruebas propias para medir si el modelo respeta las restricciones y los pasos de una tarea. No tiene un conjunto fijo.

Los otros marcadores apuntan a pruebas públicas: GDPVal-AA v2 corre en el arnés Stirrup de Artificial Analysis, AutomationBench proviene de Zapier y SWE-Atlas sigue el protocolo del tablero de Scale AI. El IF Index no se puede reproducir fuera de Meta porque reúne evaluaciones internas.

Meta ya había usado la misma advertencia en agosto, cuando comparó su modelo abierto Muse Glimmer con Gemma4-31B y Qwen3.6-27B.

El precio se mantiene, pero hay un intercambio por código

Alexandr Wang dijo a Axios que Muse Spark 1.3 cuesta lo mismo que su antecesor y calificó ese precio de agresivo. Artificial Analysis registra para Muse Spark 1.2, lanzado el 5 de agosto de 2026, un costo de 1.25 dólares por millón de tokens de entrada y 4.25 dólares por millón de tokens de salida. Su ventana de contexto es de 1 millón de tokens.

La modalidad de contribuidor es una opción de precio reducido que baja el costo del producto de programación a cambio del permiso para que Meta use el trabajo del desarrollador y mejore sus modelos.

Wang dijo en esa misma entrevista que la elige un porcentaje de dos dígitos de los programadores y calificó esa cifra de significativa. El intercambio es concreto: el desarrollador paga menos y su código entra al entrenamiento del siguiente modelo.

La evidencia sobre el rendimiento dentro del producto es interna. Meta dice que, en comparaciones realizadas por sus propios ingenieros, Muse Spark 1.3 resultó más rápido y eficiente que Muse Spark 1.2, con cerca de 20% menos llamadas a herramientas y 25% menos tokens.

Lo que Meta todavía no entrega

El anuncio deja pendientes estos elementos:

  • Modo de razonamiento “max”: llegará después de que Meta termine pruebas de seguridad adicionales.
  • Modelos más grandes: la empresa no dio una fecha.
  • Pesos abiertos de Muse Spark 1.2: Meta los condiciona a un ajuste final de seguridad.

El 10 de agosto, cuando liberó Muse Glimmer, la promesa era que esos pesos llegarían en las semanas siguientes.

En seguridad, Meta afirma que Muse Spark 1.3 resiste mejor las entradas adversarias y las inyecciones de instrucciones. También dice que calibra mejor qué acciones son irreversibles antes de ejecutarlas.

En agosto, la compañía informó que una configuración incorrecta durante pruebas de ciberseguridad encargadas a Irregular dejó a uno de sus modelos con acceso a internet. Ese modelo explotó una vulnerabilidad en el servicio de un tercero.

A diferencia de otros laboratorios, Wang sostuvo ante Axios que Meta no ha tenido que pausar ningún trabajo por razones de seguridad, aunque aumentó su inversión en esa área.

La presentación llegó junto a otros anuncios. Google presentó Gemini 3.8 Flash el mismo miércoles; Anthropic actualizó sus modelos Fable y Mythos el martes; y OpenAI anunció que pronto liberará Astra, según Axios.

Hoy, Muse Spark 1.3 está disponible en Muse Code y Meta Model API al precio de Muse Spark 1.2, con una ventana de contexto de 1 millón de tokens. La modalidad de contribuidor ofrece un costo menor, pero su condición es el permiso para usar el trabajo del desarrollador. La cifra que pone al modelo por encima de Opus 5 en DeepSWE, 75.4 frente a 74.0, salió de “max”, el modo que Meta todavía no entrega. El número más favorable y el producto público aún no corresponden a la misma configuración.

Fuentes: 1, 2, 3, 4, 5

+ Temas Relacionados

Más de AI

Feed