✨︎ Resumen (TL;DR):
- Harvey publicó el 20 de agosto de 2026 los primeros resultados de Tenet, su primer modelo post-entrenado sobre Kimi K3.
- El informe también prueba GLM-5.2 y Qwen3.8-27B, con recortes de costo de hasta 90% por consulta en una de las tareas.
- Snowflake presentó el 18 de agosto un enrutador dinámico, pero Tenet sigue como research preview y GLM-5.3 y DeepSeek-V4-Flash 0731 todavía no tienen fecha de integración.
Harvey, el proveedor estadounidense de IA para despachos jurídicos, publicó el 20 de agosto de 2026 los primeros resultados de Harvey Tenet, su primer modelo post-entrenado, que parte de Kimi K3, la base de pesos abiertos que el laboratorio chino Moonshot AI liberó en julio de 2026. El informe documenta capacidades entrenadas sobre GLM-5.2 de Z.ai y Qwen3.8-27B de Alibaba con reducciones de hasta 90% en el costo por consulta; dos días antes, Snowflake presentó un enrutador que selecciona modelos por costo y calidad dentro de Cortex AI Gateway. Ambas compañías venden software a grandes empresas y despachos, así que la elección del modelo puede ocurrir dentro de una herramienta que el cliente ya contrató.
Un análisis de Bloomberg Businessweek que resumió Semafor coloca a los sistemas estadounidenses por encima en las pruebas de capacidad, mientras los laboratorios chinos ganan terreno global por precio.
Harvey Tenet es un modelo legal post-entrenado que parte de Kimi K3 y que Harvey ajustó para tareas jurídicas. La compañía hizo ese ajuste junto con Fireworks mediante aprendizaje por refuerzo asíncrono sobre unos 1,750 entornos de tareas jurídicas.
El proceso ocupó cerca de 150 GPU NVIDIA B300 durante dos meses. Harvey aclara que no usó datos de clientes.

Tres bases chinas y un cuarto modelo de evaluación
El documento usa tres bases de laboratorios chinos para tareas y un cuarto modelo para evaluar los entrenamientos. Hasta ese momento, Harvey personalizaba modelos cerrados de Anthropic, OpenAI y Google para trabajo legal.
Para diligencia de fusiones y adquisiciones, Harvey post-entrenó un GLM-5.2 de la china Z.ai dentro de un harness de modelos de lenguaje recursivos. El sistema reparte la lectura del expediente entre subagentes. La tasa media de criterios aprobados subió de 46.1% a 60.1% después del entrenamiento, frente a un máximo de 43.8% entre los modelos de referencia.
Para buscar dentro del conocimiento acumulado de un despacho, Harvey entrenó con Engram un Qwen3.8-27B de Alibaba. El modelo que calificó los entrenamientos, después de comparar candidatos, fue Kimi 2.6, también de Moonshot AI.
Los ahorros vienen con una advertencia metodológica
Harvey creó y publicó LAB en mayo de 2026. En ese banco de pruebas, Tenet completa casi el doble de tareas retenidas que la base Kimi K3 y 20% más de tareas en la variante de contratos. La tasa de aprobación total aumentó 9 puntos porcentuales en LAB y 2 puntos porcentuales en la variante de contratos.
La empresa presenta a Tenet como estado del arte en LAB Contracts y lo coloca segundo en LAB. El propio informe reconoce el límite de esa comparación: Harvey creó la prueba y admite que sus corridas internas difieren de las de Artificial Analysis y Vals por diferencias en el harness y el juez.
En las otras pruebas, Harvey reporta:
- Review Table: la función extrae datos estructurados de hasta 10,000 documentos a la vez. El modelo entrenado para esta función mejora 3.6 puntos la calidad de respuesta y 12.1 puntos la calidad de citas frente a las mejores referencias, con un costo por celda de cerca de una décima parte.
- Conocimiento del despacho: el modelo entrenado para esa búsqueda recorta 58% los tokens de las trayectorias completadas y 90% el costo por consulta. También triplica la métrica de inteligencia por token con la que Harvey se mide, con 190.8 puntos frente a 129.3 de la mejor configuración de frontera y 37.2 de los modelos de tamaño equivalente.
Los porcentajes de ahorro provienen de las mediciones de la propia Harvey.
Snowflake convierte la selección en una función del gateway
El enrutamiento dinámico de modelos es un sistema que evalúa cada tarea contra las políticas del cliente y datos reales de costo y desempeño para elegir qué modelo la procesa. Snowflake presentó esta función el 18 de agosto dentro de Cortex AI Gateway.
El cliente define qué modelos aprueba y qué compensaciones acepta. El gateway evalúa cada tarea antes de elegir; cuando un modelo termina, otro califica el resultado y esa evaluación alimenta las decisiones siguientes.
Snowflake dice que sus primeras mediciones muestran mejor economía para un mismo nivel de calidad frente a la estrategia de apostar por un solo modelo. La empresa todavía no publicó ese resultado con detalle.
Sridhar Ramaswamy, CEO de Snowflake, atribuyó ese giro a los modelos abiertos. Escribió que, para muchas cargas de trabajo, sobre todo tareas simples y bien definidas, los mejores modelos abiertos rinden a una fracción del costo de los modelos de frontera. También planteó que, conforme baja el costo por tarea, baja el umbral desde el que conviene automatizar algo.
El gateway ya reúne modelos de Anthropic, Google, Mistral AI, OpenAI y SpaceXAI. Snowflake anunció soporte para GLM-5.3 y DeepSeek-V4-Flash 0731, pero estos modelos figuran como una ampliación anunciada, no como integraciones ya disponibles, aunque Semafor los describió como modelos añadidos a la plataforma.
El precio reduce el recelo, no resuelve la discusión
Mayank Upadhyay, responsable de seguridad y confianza de Snowflake, dijo a periodistas en Nueva York el 18 de agosto que la compañía ve mucho valor en esos modelos “más allá del costo”. Como Snowflake los aloja y les pone barreras propias, añadió, preocupa menos la privacidad de los datos o que las respuestas carguen la visión de Pekín.
“No voy a estos modelos a hacerles preguntas culturales. Estoy haciendo algún tipo de procesamiento de datos y es bastante objetivo”, explicó Upadhyay.
La vicepresidenta de datos e inteligencia artificial de Fanatics, empresa de mercancía deportiva, dijo que medir el retorno de las herramientas de IA se volvió central en su trabajo. Sobre los modelos chinos, afirmó que “solo el aspecto del costo exige atención”. También sostuvo que las empresas tienen que fijar una postura que no sea un simple no automático por el origen chino.
La presión sobre los precios también llegó a OpenAI: la compañía recortó hasta 33% el precio de GPT-5.6 Sol, aunque mantuvo la tarifa del contexto largo.
Tenet todavía no llegó al producto
Harvey presentó el informe como research preview y lo cerró diciendo que trabaja en escalar cómputo para llevar esta investigación a producción. El texto no da una fecha de disponibilidad ni menciona despachos que ya estén probando el modelo.
Snowflake tampoco fijó calendario para GLM-5.3 ni para DeepSeek-V4-Flash 0731. Su afirmación de que consigue mejor economía para un mismo nivel de calidad sigue siendo una medición interna.
Para las empresas que compran software en México, España o América Latina, el cambio llega dentro del producto ya contratado: el proveedor puede enrutar una tarea al modelo que ofrezca la mejor combinación de precio y desempeño, o un asistente jurídico puede correr sobre pesos publicados por un laboratorio chino. La elección del modelo, cada vez más, la toma el proveedor.
