Claude usa una marca de agua, sin prueba de peor calidad

Claude usa una marca de agua, sin prueba de peor calidad

Claude usa una marca estadística al elegir palabras; los datos disponibles no prueban que escriba peor.

Por Humberto Toledo el 17 de agosto del 2026 a las 12:35 pm PDT

✨︎ Resumen (TL;DR):

  • Anthropic explicó que Claude orienta algunas elecciones de palabras para crear una señal estadística detectable, sin insertar caracteres ocultos ni datos del usuario.
  • El estudio de Google DeepMind analizó cerca de 20 millones de respuestas y 3,000 pares de texto con SynthID-Text: no halló diferencias significativas de calidad, aunque sí registró menor diversidad.
  • La versión aplicada a Claude todavía no tiene parámetros ni resultados públicos suficientes para una auditoría independiente.

Anthropic reveló el 14 de agosto que Claude usa una versión de SynthID-Text para dejar una marca de agua estadística en el texto que genera. La empresa aplicó el sistema globalmente para cumplir las obligaciones de transparencia de la Ley de IA de la Unión Europea y sostiene que no afecta la calidad, la creatividad ni la legibilidad. La señal puede indicar que Claude participó en un texto, pero los datos públicos no prueban que empeore su escritura ni permiten auditar su implementación concreta.

AMD invertirá 5,000 mdd en Anthropic para Claude
Te podría interesar:
AMD invertirá 5,000 mdd en Anthropic para Claude
Un artista callejero tocando un organillo en Brujas, Bélgica, recreando una escena europea clásica.
Foto: Devansh Shah / Pexels

Cómo funciona la marca de agua de Claude

SynthID-Text es un sistema de marca de agua estadística que orienta la elección de tokens para formar un patrón detectable. Claude genera texto calculando qué token puede seguir al anterior. Cuando existen varias continuaciones plausibles, la versión de Anthropic usa una clave secreta y el contexto precedente para orientar el muestreo.

Muchas decisiones de ese tipo acumulan la señal. El mecanismo no agrega palabras al final, caracteres invisibles, metadatos personales ni identificadores de la cuenta. La marca permanece invisible porque el patrón está en la estadística de las elecciones, no en un elemento escondido del texto.

La precisión del detector depende de que el texto ofrezca suficientes oportunidades para formar el patrón. En fragmentos cortos, código y pasajes muy factuales la señal es más débil, porque Claude tiene menos alternativas seguras entre las cuales elegir.

Una edición ligera también puede dejar poco material detectable. Una reescritura completa elimina la huella. En cambio, una traducción generada de principio a fin por Claude sí puede incorporarla, ya que el modelo vuelve a escoger todo el texto.

El anuncio del 11 de agosto ya había establecido el alcance global de la medida y una limitación clave: la señal puede indicar participación de Claude, pero no quién escribió el texto. La actualización del 14 de agosto identificó el método y permite examinar qué modifica realmente.

Lo que muestran las pruebas de SynthID-Text

Anthropic respalda su afirmación con el artículo sobre SynthID-Text que Google DeepMind publicó en Nature en 2024. El trabajo distingue configuraciones que preservan la distribución de salida de otras que pueden aumentar la detectabilidad a costa de la calidad.

En sus experimentos principales, Google usó una configuración no distorsionadora. Esta buscaba conservar la distribución de salida aunque cambiara la respuesta concreta de una generación. Los resultados publicados incluyen:

  • En una prueba en producción con cerca de 20 millones de respuestas de Gemini, las diferencias entre texto marcado y no marcado fueron de 0.01 puntos porcentuales en votos positivos y de 0.02 puntos en votos negativos. Ninguna tuvo significancia estadística.
  • Otra evaluación comparó 3,000 pares de respuestas de Gemma 7B-IT y no encontró diferencias significativas en gramática, coherencia, relevancia, exactitud, utilidad ni calidad general.
  • El mismo trabajo sí registró una reducción de la diversidad entre respuestas.

Estos resultados cuestionan la idea de que toda intervención de este tipo necesariamente degrada el texto. No permiten asumir que todas las implementaciones se comporten igual ni trasladar sin revisión los resultados de Google a Claude.

Google DeepMind realizó y financió el estudio, y sus autores declararon solicitudes de patente. Anthropic solo ha dicho que usa una versión de SynthID-Text. La empresa no ha publicado el tamaño de sus pruebas, los modelos evaluados, la configuración utilizada, las métricas completas ni una comparación independiente específica de Claude.

Sin esos datos, la evidencia permite evaluar la técnica general, pero no confirmar cómo funciona la implementación de Anthropic en cada tarea.

La crítica se concentra en cada palabra

John Gruber, de Daring Fireball, sostiene que dos palabras cercanas rara vez son idénticas. También cuestiona que una clave secreta capaz de influir en la elección pueda sacrificar precisión o voz, y que los votos positivos o negativos de millones de usuarios sean sensibles a diferencias sutiles de estilo.

Su argumento identifica un posible punto ciego de las métricas, pero no demuestra que ese deterioro ocurra ni mide su magnitud. La configuración no distorsionadora estudiada por Google ofrece una respuesta estadística a una parte de la objeción: busca conservar las probabilidades globales de salida.

Eso no significa que produzca exactamente la misma frase que el modelo habría elegido sin marca. Significa que el conjunto de resultados mantiene la distribución prevista. La tensión está entre dos escalas: la calidad promedio que capturan las pruebas y la elección particular que un escritor puede preferir en una oración.

Las cancelaciones verificadas no muestran una salida masiva

La discusión produjo llamados a cancelar Claude y decenas de publicaciones en X de personas que afirmaban haberlo hecho. Business Insider entrevistó a cuatro usuarios que dijeron cancelar su suscripción; algunos presentaron comprobantes.

Anthropic respondió que no había detectado un aumento ni una tendencia de cancelaciones. Sin cifras públicas de la empresa o de un tercero, no hay base para describir la reacción como una salida masiva.

El malestar sí revela casos de uso sensibles. Un profesional puede pedir una revisión mínima, entregar texto en un entorno que restringe la IA o necesitar documentar qué partes escribió una persona.

La explicación de Anthropic acota el riesgo: una corrección ligera puede conservar una señal, aunque insuficiente para detectarla, mientras una transformación extensa generada por Claude puede dejarla. La presencia o ausencia del patrón, por sí sola, no reconstruye el proceso editorial.

El detector no decidirá quién escribió

Anthropic promete una API de detección, pero todavía no le asigna una fecha pública. La herramienta podrá estimar la probabilidad de que Claude haya intervenido en un texto suficientemente largo.

Eso no equivale a identificar a una persona, reconocer todos los modelos de IA ni probar que el sistema generó automáticamente una obra completa. La edición puede debilitar la señal y una reescritura puede borrarla.

Por ahora, la evidencia permite una lectura acotada. El estudio de Google DeepMind muestra que una marca estadística puede operar sin una caída medible en evaluaciones amplias. La implementación concreta de Claude sigue sin pruebas públicas suficientes para saber si conserva esos matices en cada tarea.

Decir que la huella empeora la escritura es una hipótesis razonable, no un hecho establecido. Afirmar que su efecto es exactamente nulo tampoco puede verificarse de forma independiente mientras Anthropic no publique sus evaluaciones y no abra su detector.

Fuentes: 1, 2, 3, 4, 5

+ Temas Relacionados

Más de AI

Feed