✨︎ Resumen (TL;DR):
- Meta liberó Muse Code en beta para macOS y Linux. El agente se instala con un solo comando y corre sobre Muse Spark 1.2.
- El nivel estándar cobra 1.25 dólares por millón de tokens de entrada y 4.25 dólares por millón de tokens de salida; contributor baja a 0.10 dólares por millón de tokens de entrada y 0.20 dólares por millón de tokens de salida, a cambio de permiso para entrenar con lo que escribe el desarrollador y con las respuestas del modelo.
- Claude Opus 5 quedó primero en las 3 pruebas de código que publicó Meta, incluida la interna: 79.4% frente a 70.6% de Muse Spark 1.2.
Meta lanzó en beta Muse Code el miércoles 5 de agosto de 2026, su primer agente de programación para la terminal de macOS y Linux. Se instala con un comando y funciona sobre Muse Spark 1.2, un modelo que la compañía entrenó a la par de la herramienta. El nivel contributor reduce el costo hasta 21 veces, pero exige permiso para que Meta entrene modelos futuros con lo que el desarrollador escriba y con las respuestas del modelo.
Meta puso el costo al frente del lanzamiento. Alexandr Wang, director de IA de Meta y responsable de Meta Superintelligence Labs, explicó a CNBC que la empresa diferencia el producto por precio y no por capacidades de punta. Muse Code compite directamente con Claude Code, de Anthropic, y Codex, de OpenAI.

Un agente de terminal para repositorios grandes
Muse Code es un agente de terminal que recibe una tarea completa de ingeniería dentro de un repositorio grande: planea el cambio, escribe el código y valida el resultado.
Cuando el trabajo se vuelve pesado, el agente reparte la carga entre subagentes que corren en paralelo dentro de worktrees aislados. Estos subagentes no tocan la copia en la que trabaja el programador.
Zuckerberg lo presumió en X con un ejemplo concreto: “Le hicimos construir seis funciones de un juego a la vez, sin colisiones”.
Agentes persistentes y recuperación tras fallas
La arquitectura se apoya en agentes de fondo asíncronos y persistentes. En lugar de crear un subagente nuevo para cada tarea y apagarlo al terminar, como hace la mayoría de la competencia, Muse Code mantiene un grupo de agentes especializados durante toda la sesión.
Cada agente elige cuándo reportarse al agente principal. Meta sostiene que este esquema evita volver a levantar el mismo contexto una y otra vez.
El sistema también conserva un registro local de eventos. Ahí se anexa cada llamada al modelo, cada corrida de herramienta, cada aprobación y cada edición. Meta lo describe como reproducible y a prueba de reinicios: si el proceso falla, el agente retoma exactamente donde se quedó.
La demostración más exigente del anuncio puso al modelo a optimizar kernels de GPU para tarjetas NVIDIA Hopper durante más de 1,000 llamadas a herramientas y hasta 24 horas seguidas.
El agente incluye 3 habilidades de fábrica:
- /plan convierte una tarea en un plan que necesita aprobación antes de ejecutarse.
- /grill somete ese plan a presión hasta que aguante.
- /goal empuja el proceso hasta cumplir el objetivo.
Ese andamiaje que rodea al modelo se conoce como harness y también forma parte de la competencia entre agentes de programación.
El descuento exige permiso para entrenar
El blog de investigación de Meta describe la arquitectura, el entrenamiento y las pruebas, pero no menciona una sola tarifa. Los precios de ambos niveles aparecen en la documentación para desarrolladores y en las entrevistas que Wang ofreció el 5 de agosto de 2026.
El nivel estándar de Muse Spark 1.2 cobra 1.25 dólares por millón de tokens de entrada, 0.15 dólares por millón de tokens de entrada en caché y 4.25 dólares por millón de tokens de salida. No hay un cargo adicional por contexto largo.
Son las mismas tarifas que Meta estableció para Muse Spark 1.1 el 9 de julio de 2026. En este nivel, Meta se compromete a no usar los prompts ni las respuestas para entrenar sus modelos.
El nivel contributor cambia el trato. Cobra 0.10 dólares por millón de tokens de entrada y 0.20 dólares por millón de tokens de salida. Meta lo presenta como unas 12 veces menos en entrada y 21 veces menos en salida.
Ese precio exige permiso explícito para que Meta entrene modelos futuros con lo que escriba el desarrollador y con las respuestas del modelo. Alexandr Wang lo resumió así: “más de 10 veces más barato que incluso el nivel de pago por uso”.
Wang describió la contribución de datos como una práctica alineada con la del resto de los agentes de programación.
El descuento tiene un límite operativo. El nivel contributor permite 60 peticiones por minuto, contra 3,000 del estándar. Ese tope apunta a pruebas individuales, no a cargas de producción.
Para cualquier equipo que maneje código propietario, el intercambio es directo. La puerta de entrada que Meta recomienda, y que Zuckerberg mencionó al presentar la herramienta, es la que manda el código al entrenamiento. Elegir la tarifa estándar evita ese permiso, pero implica pagar el precio completo.
Claude Opus 5 gana las 3 pruebas de código
Las 3 gráficas que Meta publicó colocan a Claude Opus 5 en primer lugar. Muse Spark 1.2 queda por debajo en las tres evaluaciones.
- Terminal-Bench 2.1: Muse Spark 1.2 dentro de Muse Code marcó 82.9%. Superó a GPT-5.6 Terra en Codex (81.8%) y a Grok 4.5 en Grok Build (81.6%), pero quedó debajo de Claude Opus 5 en Claude Code (86.7%).
- DeepSWE 1.1: Muse Code obtuvo 59.3%, tercer lugar. Claude Opus 5 registró 65.0% y GPT-5.6 Terra, 64.8%.
- Meta Internal Coding Bench: Muse Spark 1.2 consiguió 70.6%, frente a 79.4% de Claude Opus 5. Meta diseñó esta prueba con 440 tareas extraídas de pull requests internos.
Meta detalló la metodología de las evaluaciones. Terminal-Bench 2.1 usa las 89 tareas completas, con pass@1 sobre 5 intentos. DeepSWE 1.1 cubre 113 tareas en 91 repositorios y 5 lenguajes.
Todas las corridas se ejecutan en sandboxes aislados de Daytona. Meta advierte que su propio harness puede no estar afinado para los modelos ajenos.
La comparación tiene otra salvedad. Los puntajes de Muse Spark 1.1 se midieron en un harness genérico, mientras que los de 1.2 corrieron dentro de Muse Code. Por eso, el salto que Meta presenta entre generaciones, 6.7 puntos en Terminal-Bench y 6.3 puntos en DeepSWE, mezcla la mejora del modelo con el aporte del harness hecho a la medida.
Disponibilidad: la instalación sí, el acceso no está claro
Cuando Meta abrió su API de pago el 9 de julio de 2026, la vista previa quedó reservada a desarrolladores de Estados Unidos. Ahora la compañía dice que Muse Spark 1.2 está disponible en Muse Code y en la Meta Model API, con acceso global ampliado.
Meta no dice en qué países está habilitado el servicio ni incluye una lista en el blog o en el material de lanzamiento. Para quien programa desde México, España, Colombia o Argentina, esa omisión impide confirmar el acceso.
Muse Code se instala con un comando en macOS o Linux, pero el acceso al modelo pasa por la Meta Model API. La geografía sí ha pesado en lanzamientos recientes. El caso de Gemini Spark muestra por qué importa la lista: llegó a Latinoamérica y a más de 160 países, pero dejó fuera a España.
A diferencia de Codex y Claude Code, Muse Code todavía no tiene una aplicación propia y solo funciona en la terminal. Meta tampoco liberó pesos descargables del modelo. El agente depende por completo del servicio de la compañía, sin opción de ejecutarse en infraestructura propia.
Meta llega a los agentes de programación con una ventaja concreta de precio, no con el primer lugar en sus propias pruebas. Claude Opus 5 lidera las 3 evaluaciones, mientras Muse Code pone sobre la mesa agentes persistentes, un registro que sobrevive reinicios y comandos para revisar y perseguir una tarea.
El nivel contributor convierte el descuento en un intercambio explícito: permiso para que Meta entrene con lo que escribe el desarrollador y con las respuestas del modelo, además de un límite de 60 peticiones por minuto. El blog de Meta ya anticipó modelos más grandes y capaces. Por ahora, contributor es la vía más barata para alimentar ese entrenamiento. Para quien trabaja con código propietario, la decisión queda entre pagar la tarifa estándar o aceptar ese uso de datos.
