Hark: Handoff lidera con 97.7%, 0.4 puntos sobre Yutori

Hark: Handoff lidera con 97.7%, 0.4 puntos sobre Yutori

Hark presentó Handoff, un agente web que lidera Online-Mind2Web con 97.7%, apenas 0.4 puntos arriba de Yutori.

Por Humberto Toledo el 5 de agosto del 2026 a las 8:55 pm PDT

✨︎ Resumen (TL;DR):

  • Hark presentó Handoff el 5 de agosto de 2026 para ejecutar tareas completas en un navegador.
  • El agente obtuvo 97.7% en Online-Mind2Web, frente a 97.3% de Navigator n1.5, una diferencia de 0.4 puntos.
  • La lista de espera ya está abierta y la plataforma llegará a fin de verano; WebTailBench y la evaluación interna de Hark usaron un banco y un juez propios.

Hark, el laboratorio de IA que Brett Adcock fundó mientras continúa al frente de Figure AI, presentó el 5 de agosto de 2026 su primer producto, Handoff, un agente que toma el control de un navegador y completa encargos de principio a fin, como comprar, reservar y buscar en nombre del usuario. La herramienta lidera el tablero público Online-Mind2Web con 97.7%, apenas 0.4 puntos por encima de Navigator n1.5, de Yutori. Hark abrirá la plataforma a fin de verano, pero la única medición independiente que respalda ese primer lugar es la del tablero.

Nvidia: El software del futuro será operado por agentes de IA
Te podría interesar:
Nvidia: El software del futuro será operado por agentes de IA
Un somormujo lavanco deslizándose elegantemente sobre una tranquila masa de agua. Fotografía tomada en un día soleado.
Foto: Jimmyk photos / Pexels

Handoff opera una computadora virtual, no una API

Un agente de uso de computadora es un sistema de IA que opera una interfaz gráfica igual que una persona: lee lo que hay en pantalla, mueve el cursor, hace clic y teclea. La industria bautizó esta categoría como computer use agents, o CUA.

Para cada encargo, Hark levanta una computadora virtual completa, con navegador, sistema de archivos y terminal propios. El usuario puede conectar sus cuentas para que Handoff inicie sesión a su nombre y trabaje con las direcciones y el historial ya guardados.

En la demostración principal, Handoff ordena comida en DoorDash, compara precios en Target, aparta una mesa en OpenTable y escribe a candidatos en LinkedIn. Hark presenta esos sitios como páginas sin API pública para desarrolladores.

Brett Adcock resumió la propuesta así: “El mundo está lleno de asistentes de IA, pero nunca contratarías a un asistente que no supiera usar una computadora.”

Para justificar la elección del navegador, Hark midió casi 3 millones de minutos de pantalla de sus usuarios y encontró que 74.9% de ese tiempo transcurrió dentro de un navegador. La compañía añade que menos de uno de cada mil sitios web ofrece una API pública, y que incluso esas APIs exponen apenas una parte de lo que una persona puede hacer con el ratón.

La apuesta es que un agente pueda trabajar en páginas que no ofrecen una integración pública, usando la interfaz que ya utiliza la gente.

El video de anuncio dura unos cuatro minutos. En una nave industrial vacía, Adcock pide en voz alta un arreglo con rosas y flores de cerezo. Handoff navega el sitio de una florería y arma el pedido, incluso cuando recibe la instrucción difusa “algunas a elección del florista”.

Adcock también presenta al agente como algo que nunca se detiene y trabaja en bucle. El video muestra solo una parte del proceso, así que no permite medir por sí solo su efectividad real.

El primer lugar se decide por cuatro décimas

El único resultado de Handoff con evaluación externa aparece en Online-Mind2Web, el tablero público que mantiene el grupo de procesamiento de lenguaje natural de la Universidad Estatal de Ohio. El sistema califica agentes en sitios reales con jueces humanos.

La prueba cubre 300 tareas repartidas en 136 páginas en vivo. Careerflow.ai evaluó a Handoff el 4 de agosto de 2026 y también al Navigator n1.5 el 28 de junio de 2026.

Agente Resultado Fecha y referencia
Hark Handoff 97.7% promedio; 100% en tareas fáciles, 95% en medias y 100% en difíciles 4 de agosto de 2026, Careerflow.ai
Navigator n1.5, de Yutori 97.3% 28 de junio de 2026, Careerflow.ai
ACT-2, de Enhans, sobre GPT-5.4 92.7% 4 de agosto de 2026
Google Computer Use, con Gemini 2.5 Computer Use 69.0% Desde septiembre de 2025
Operator, de OpenAI 61.3% Desde marzo de 2025

El resultado coloca a Handoff en el primer sitio por cuatro décimas frente al líder anterior. El comunicado de Adcock usa la frase “los mejores del mundo”, pero el tablero verificable muestra una diferencia de 0.4 puntos.

De las tres pruebas que Hark publicó, solo Online-Mind2Web tiene evaluación independiente. WebTailBench y la prueba interna corrieron en el banco de evaluación de Hark y usaron un juez automático de la propia empresa. En una de ellas, el resultado reportado deja a Handoff detrás de GPT-5.5.

La comparación deja fuera a los modelos más nuevos

En sus comparaciones, Hark reporta que Handoff supera en promedio a GPT-5.4 por 8 puntos y a Opus 4.8 por 2 puntos. Ambos pertenecen a una generación anterior.

Los modelos más recientes mencionados, GPT-5.6 de OpenAI y Opus 5 de Anthropic, no aparecen en la comparación. Tampoco figuran modelos abiertos como DeepSeek V4, Kimi K3 y Qwen3.8-Max.

Su ausencia no demuestra que Hark los haya excluido: ninguno ha publicado resultados en Online-Mind2Web y nadie ha subido sus resultados al tablero. Por eso, la afirmación de récord histórico no puede contrastarse con esos modelos.

En OSWorld 2.0, una prueba hermana que mide el control de una computadora completa, Opus 5 ronda 70.6%, frente a 55.7% de Opus 4.8. Ese resultado pertenece a otra prueba y no mide a Handoff, pero muestra por qué la selección de referencias importa.

El precio es la carta más fuerte de Hark

El costo por token de Handoff, según Hark, es un orden de magnitud menor que el de los modelos frontera con los que compite. El comunicado lo traduce como menos de una décima parte del precio.

La latencia publicada se midió con el nivel de razonamiento más alto. A esa cifra hay que sumarle unos 10 segundos que aporta el navegador en cada turno.

Su Serie A superó los 700 millones de dólares en mayo de 2026 y valuó a la empresa en 6,000 millones de dólares, incluido lo levantado. Parkway Venture Capital lideró la ronda y participaron Nvidia, AMD Ventures, Brookfield, Intel Capital, Qualcomm Ventures y Salesforce Ventures.

Antes de eso, Adcock había arrancado el proyecto en marzo con 100 millones de dólares de su propio bolsillo. Del otro lado están Google, OpenAI y Anthropic con sus propios agentes, además de las startups Browser Use, Polar, Strawberry y Aside.

La prueba pendiente está fuera de los sitios estadounidenses

Hark eligió para la demostración DoorDash, Uber Eats, Target, Walmart, Costco, OpenTable, Resy, LinkedIn, United, American, JetBlue, Delta, Booking.com y Zillow. Todos son servicios estadounidenses.

Ningún sitio de habla hispana aparece en la demostración. No aparecen Rappi, Mercado Libre, Didi Food ni una sola aerolínea o cadena de la región.

El research preview no menciona países ni idiomas. La única fecha de disponibilidad es a fin de verano y la lista de espera ya está abierta.

Para quien lee desde México, España o cualquier país de América Latina, queda por saber si Handoff entiende instrucciones en español y si sabe moverse en los sitios donde realmente compran sus usuarios.

Hay una diferencia enorme entre pedirle a un agente que encuentre un vuelo y entregarle contraseñas, una tarjeta y permiso para apretar el botón de comprar. La próxima prueba de Handoff será práctica: si alguien le confía una cuenta bancaria mientras se ocupa de otra cosa.

Por ahora, Handoff tiene un primer lugar verificable de 97.7%, con 0.4 puntos sobre Yutori. La comprensión del español, la operación en sitios regionales y la confianza para autorizar una compra siguen sin demostrarse.

Fuentes: 1, 2, 3, 4

+ Temas Relacionados

Más de AI

Feed