✨︎ Resumen (TL;DR):
- TypeSafe AI salió del sigilo el 15 de septiembre de 2026 con una ronda semilla de 40 millones de dólares encabezada por DCVC.
- Jev promedió 67.8% de exactitud en 4 flujos de trabajo, el mismo resultado que Claude Sonnet 5 en la evaluación de la empresa.
- El modelo devuelve probabilidades en lugar de texto y la prueba le atribuyó un costo de 0.0004 dólares y un tiempo de 0.4 segundos por caso, aunque la evaluación no es independiente.
TypeSafe AI, el laboratorio de San Francisco que fundó el exinvestigador de OpenAI Diogo Almeida, salió del sigilo el 15 de septiembre de 2026 con una ronda semilla de 40 millones de dólares encabezada por DCVC. Su primer modelo público, Jev, no escribe texto: responde preguntas acotadas con probabilidades para que un programa las use directamente. En la evaluación de la empresa promedió 67.8% de exactitud en cuatro flujos, igual que Claude Sonnet 5, con un costo de 0.0004 dólares y 0.4 segundos por caso.

Jev entrega una señal que el código puede usar
System One Model es una categoría de modelo que recibe un estado, ya sea texto o datos de un programa, y devuelve respuestas a preguntas tipadas con una probabilidad que el software puede usar directamente.
Jev es el primer System One Model de TypeSafe. La empresa bautizó esta categoría a partir de la distinción de Daniel Kahneman entre el pensamiento rápido e intuitivo y el pensamiento lento y deliberado.
El desarrollador define las preguntas con anticipación y envía el estado en una sola consulta. Jev devuelve todas las respuestas junto con su probabilidad correspondiente.
La documentación describe tres tipos de preguntas:
- Choice: elige una opción dentro de una lista.
- Score: asigna una calificación en una escala.
- Noul: estima de 0 a 1 si una afirmación es verdadera.
La lógica queda del lado del software. Para evaluar la propuesta de una startup, TypeSafe recomienda preguntar por separado por el tamaño del mercado, la viabilidad técnica y la diferenciación, y después combinar los puntajes con una fórmula propia.
TypeSafe asegura que evalúa cada pregunta en paralelo y de forma aislada. Por eso, sumar preguntas casi no altera el tiempo de respuesta.
Mike Taylor, jefe de evaluaciones de Every, explicó el mecanismo con un caso de atención al cliente. Si el programa pregunta si un cliente suena enojado, Jev puede devolver 0.9, una probabilidad estimada de 90%. Entonces el software decide si escala la queja a un gerente.
Un chatbot está entrenado para contestar con texto elaborado. Esa salida rompe un programa que esperaba un número entre 0 y 1. Taylor escribió que resolver el formato de manera nativa vuelve a Jev muy rápido y barato, aunque también advirtió que todavía no está claro qué tan bien realiza el trabajo.
La promesa de Jev se apoya en costo y latencia
TypeSafe cobra 0.042 dólares por millón de tokens de entrada, equivalentes a 42 dólares por cada mil millones. La empresa no cobra la salida porque, según explica, cuesta tan poco que no vale la pena medirla.
La comparación de TypeSafe coloca el precio de entrada de los modelos de lenguaje actuales entre 0.20 y 10 dólares por millón de tokens. Jev está en acceso anticipado y la compañía da entrada a desarrolladores desde una lista de espera.
El nombre Jev viene de William Stanley Jevons. TypeSafe espera que abaratar la inteligencia multiplique sus usos, como ocurrió con la demanda de carbón cuando las máquinas de vapor se volvieron más eficientes.
Los materiales de lanzamiento de septiembre de 2026 no presentan una sola medición comparativa. Cada cifra corresponde a un material y a una condición distinta:
- 15 de septiembre de 2026: el comunicado habla de un modelo hasta 100 veces más rápido y más barato que otros modelos de frontera, con una latencia menor a 100 milisegundos. No identifica esos modelos ni las tareas usadas.
- 14 de septiembre: el anuncio de Almeida, publicado un día antes, calcula entre 40 y 200 veces más velocidad y respuestas de 70 a 500 milisegundos. Esa comparación usa consultas con la forma que Jev maneja, frente a modelos de inteligencia similar, y en general toma mediciones desde laptops en la costa oeste de Estados Unidos.
- Portada de TypeSafe: destaca 193.6 veces más rapidez y 444.6 veces menos costo. La empresa atribuye esas cifras a sus 4 flujos de evaluación y dice que se encuentran en el extremo alto de las ganancias que pueden observarse en la práctica.
La etiqueta 0% de alucinaciones necesita una precisión. TypeSafe presenta a Jev como un modelo que no puede alucinar, pero su propio anuncio admite que el 0% de sus gráficas no es una medición empírica. Como la respuesta siempre coincide con el esquema solicitado, la empresa coloca esa cifra por definición.
La garantía sí evita campos inventados y llamadas mal formadas, pero no impide que Jev elija una respuesta equivocada. RuntimeWire, un medio independiente de startups y tecnología con sede en Austin y San Francisco, señaló que los campos de probabilidad y confianza sirven para que el programa fije un umbral: los casos con suficiente confianza pueden avanzar solos y los dudosos pasan a revisión.
TypeSafe también reconoce un posible sesgo en las tasas que atribuye a otros modelos de lenguaje. Esas cifras provienen de OpenRouter, donde las consultas más complejas podrían enviarse a modelos mejores.
La prueba lo empata con Sonnet 5, no lo pone arriba
El sitio de evaluaciones de TypeSafe comparó 9 modelos en 4 tareas: incidentes de seguridad, revisión de trazas de agentes, procesamiento de facturas y atención al cliente. Todos recibieron el mismo flujo de preguntas y reglas, y TypeSafe consideró correcto ese flujo.
La respuesta de referencia fue el promedio de lo que contestaron GPT-6 Astra y Claude Fable 5.1 con razonamiento alto. Los demás modelos corrieron con el nivel de razonamiento predeterminado de cada proveedor.
En el promedio de las 4 tareas, Jev obtuvo 67.8% de exactitud, igual que Claude Sonnet 5. Quedó una décima de punto por debajo de GPT-5.6 Terra, que alcanzó 67.9% y es el modelo que TypeSafe considera más comparable al suyo en inteligencia.
Sol, de OpenAI, encabezó la tabla con 74.1%. Claude Opus 5 quedó después con 73.1%.
La diferencia más clara aparece en costo y tiempo por caso. Jev gastó 0.0004 dólares y tardó 0.4 segundos. GPT-5.6 Terra registró 0.0304 dólares y 10.1 segundos, mientras que Claude Sonnet 5 llegó a 0.1174 dólares y 78.1 segundos.
El promedio oculta diferencias entre tareas:
- En incidentes de seguridad, Jev obtuvo 61.7%. Solo quedó debajo de Claude Opus 5, con 66.2%, y Sol, con 62.5%.
- En atención al cliente, alcanzó 76.0%, a 2.3 puntos porcentuales de Sol, que llegó a 78.3%.
- En procesamiento de facturas, donde el flujo encadena 7 rondas de preguntas, cayó a 61.8%. Solo superó a Claude Haiku 4.5, con 42.9%. Sol alcanzó 79.1% y Claude Opus 5, 78.4%.
La misma tabla contiene un resultado que no depende únicamente de Jev. TypeSafe también probó a cada modelo con toda la política dentro de un solo prompt. En el promedio de las 4 tareas, todos resultaron más exactos, baratos y rápidos cuando usaron el flujo descompuesto.
El salto más grande fue el de Claude Haiku 4.5, que pasó de 18.1% con un prompt único a 53.6% con el flujo dividido en preguntas.
TypeSafe reconoce límites en su propia prueba. Integrantes de su equipo de capacidades diseñaron los flujos, lo que puede introducir sesgo. La compañía dice que no los eligió para favorecer a Jev y que los mantuvo fuera de la distribución con la que entrenó el modelo.
La elección de GPT-6 Astra y Claude Fable 5.1 como referencia también inclina el resultado hacia OpenAI y Anthropic. TypeSafe considera que esa decisión puede subestimar a Jev y a los modelos de DeepSeek.
RuntimeWire añadió que el lanzamiento no llegó acompañado de una evaluación independiente, de los pesos del modelo ni de un artículo con suficiente detalle para que otros reprodujeran los resultados.
Almeida cambió el objetivo del chatbot por una salida para software
Almeida firmó el artículo de InstructGPT de 2022, el trabajo de OpenAI que ajustó GPT-3 primero con demostraciones de evaluadores humanos y después con aprendizaje por refuerzo a partir de sus clasificaciones de respuestas. Esa técnica se conoce como RLHF.
En las evaluaciones humanas de aquel artículo, los evaluadores prefirieron las respuestas de InstructGPT de 1,300 millones de parámetros sobre las de GPT-3, de 175,000 millones.
El comunicado de TypeSafe presenta a Almeida como coinventor de RLHF y de ChatGPT. RuntimeWire precisa que su nombre aparece en los créditos del ChatGPT original y que antes trabajó en Google Brain.
El anuncio de Almeida abre con una pregunta: “Los modelos llevan años siendo sobrehumanos en el chat, así que ¿dónde está toda la automatización?”
La portada de TypeSafe sostiene que RLHF optimiza los modelos para lo que prefieren las personas y arrastra problemas como el exceso de confianza y la falta de fiabilidad. Por eso, según la empresa, los modelos de lenguaje necesitan a un humano en el circuito.
Jev usa otro método, que TypeSafe llama aprendizaje por refuerzo para decisiones calibradas, o RLCD. La compañía afirma que, en su modelo, una confianza más alta significa una exactitud más alta.
Almeida fundó TypeSafe en 2024 junto con Erik Gafni y Sasha Sheng. Según RuntimeWire, Sheng trabajó en ingeniería de investigación en Meta y FAIR. Gafni creó antes Ravel, una startup de IA para genómica, y pasó por Invitae y Freenome.
Almeida dijo que pasó años trabajando en modelos diseñados para que la IA interactuara mejor con las personas, pero que estas no pueden ser las únicas consumidoras de inteligencia si la IA va a cambiar de fondo cómo se trabaja. “Con el tiempo, la mayor parte de la inteligencia debería vivir dentro del software, funcionando en silencio en segundo plano”, agregó.
James Hardiman, socio general de DCVC, dijo que TypeSafe ataca uno de los mayores retos pendientes de la IA: convertir modelos cada vez más capaces en tecnología que los desarrolladores puedan integrar en productos con fiabilidad y a escala.
Dealroom ubica la ronda en el percentil 99 de las rondas semilla de IA de su muestra histórica, que reúne 28,473 operaciones.
Otro firmante del artículo de InstructGPT, John Schulman, cofundador de OpenAI y hoy científico jefe de Thinking Machines, calculó el 11 de septiembre en el podcast de Dwarkesh Patel que en 3 o 4 años habrá una IA capaz de superar a los mejores expertos humanos en cualquier trabajo frente a una computadora.
En esa conversación también describió cómo un modelo nuevo puede deslumbrar y, un mes después, empezar a parecer torpe cuando los usuarios encuentran las tareas donde juzga peor o no sabe revisarse a sí mismo.
Los 40 millones de dólares le dan a TypeSafe margen para llevar su tesis del laboratorio al acceso de desarrolladores. La empresa considera fáciles de comprobar la velocidad y el precio por llamada, aunque admite que no puede demostrar que su tarifa no esté subsidiada.
La exactitud es el dato que decide si un programa puede actuar sin supervisión. Por ahora, Jev llega al acceso anticipado con una evaluación interna de 67.8%, cifras agresivas de costo y latencia, y sin una validación independiente que confirme qué tan seguido sus probabilidades conducen a la respuesta correcta.