✨︎ Resumen (TL;DR):
- Strands Labs, proyecto experimental vinculado a AWS, lanzó el 1 de octubre un modelo que permite a los agentes de IA elegir entre opciones definidas y puntuar respuestas.
- La versión de referencia v19 acertó 167 de 231 tareas públicas de JevBench, equivalentes a 72.3%, y acertó 50.5% de las tareas difíciles.
- Puede revisar una decisión antes de una llamada a una herramienta, pero el código de cada aplicación determina qué hacer con el resultado.
Strands Decider 2B es un modelo abierto para agentes de IA que elige entre opciones definidas y asigna una puntuación a sus respuestas. Strands Labs, el proyecto experimental vinculado a AWS, lo lanzó el 1 de octubre.
Puede ejecutarse en una computadora local para revisar decisiones rutinarias antes de una acción, como llamar a una herramienta. AWS publicó el código y los pesos bajo licencia Apache 2.0, aunque operarlo requiere recursos de cómputo propios.

Un modelo que puntúa opciones, no texto
Strands Decider parte de Qwen3.5-2B. El equipo retiró el componente con el que ese modelo generaba texto y lo sustituyó por otro que puntúa las opciones ofrecidas. Ese componente tiene poco más de un millón de parámetros.
Puede responder preguntas de sí o no, escoger una opción o asignar una puntuación. No escribe explicaciones, resúmenes ni código. El código de la aplicación decide cómo actuar según esas respuestas.
Una revisión antes de llamar a una herramienta
El ejemplo publicado por Strands muestra a un agente que intenta consultar el clima sin que el usuario haya indicado una ciudad. El modelo examina si el lugar elegido se desprende de la conversación y si conviene pedir una aclaración antes de llamar a la herramienta.
Después, el código de la aplicación decide cómo actuar según esas respuestas. La demostración ilustra un punto de revisión, no prueba que el sistema pueda detectar todas las llamadas incorrectas.
Puede frenar una llamada a una herramienta, pero el programa fija la regla que se aplica.
Qué muestran las pruebas publicadas
En el repositorio del proyecto, Strands identifica v19 como su versión de referencia. Esa versión acertó 167 de 231 tareas públicas de JevBench, equivalentes a 72.3%. Resolvió todas las tareas de la categoría fácil definida por el equipo, pero acertó 50.5% de las difíciles.
Son resultados de una evaluación publicada por sus desarrolladores, no una garantía de precisión para los flujos de trabajo de cada empresa.
La latencia mediana reportada fue de 115 milisegundos por pregunta en una Nvidia RTX 3090 bajo WSL2. El percentil 95 llegó a 299 milisegundos. En una Mac con M3 Pro, la mediana para tareas cortas fue de 153 milisegundos.
El tamaño de la consulta cambia la duración, por lo que una cifra aislada no describe todos los casos. El repositorio identifica una v20 experimental, pero esa versión no sustituyó a v19 como referencia.
La ventaja está en ejecutarlo por cuenta propia
El lanzamiento de Jev y sus primeras integraciones mostró cómo TypeSafe ofrece estas decisiones mediante una API. Con Strands Decider, los desarrolladores pueden descargar el modelo, examinar su código y su receta de entrenamiento y ejecutarlo en su propia infraestructura.
El acceso abierto da más control sobre el despliegue, pero la licencia gratuita no elimina el costo del hardware, la nube o el mantenimiento. Las pruebas publicadas tampoco establecen que Strands sea más preciso o más barato de operar que Jev en una comparación directa.
El modelo aún necesita pruebas propias
La ficha del modelo advierte que los documentos largos y las preguntas distintas a las usadas durante el entrenamiento son puntos débiles. Sus puntuaciones de confianza se calibraron para tareas cortas de clasificación.
Antes de usar un umbral para aprobar acciones reales, cada equipo tendría que medir el desempeño con sus propios casos.
El alcance verificable del lanzamiento es concreto: AWS puso una alternativa abierta al alcance de quienes construyen agentes y quieren probar estas decisiones en local. Strands Decider aporta el punto de revisión, pero la acción final depende de la regla que defina el programa.
