InicioCentro de noticias de LBank
Anthropic está marcando silenciosamente con marca de agua cada salida de Claude AI. Los desarrolladores ya están intentando romperlo
anthropic-quietly-watermarking-ai-claude-output-builders-break
Anthropic está marcando silenciosamente con marca de agua cada salida de Claude AI. Los desarrolladores ya están intentando romperlo
Anthropic está incorporando una marca de agua invisible y legible por máquinas en cada palabra que escriben sus modelos Claude más nuevos, y no ha dicho cómo.
2026-08-13 Fuente:decrypt.co

En resumen

  • Los nuevos modelos de Claude lanzados en la UE a partir del 2 de agosto de 2026 incrustarán una marca de agua legible por máquina en cada pieza de texto generada, aplicada a nivel de modelo.
  • Las marcas se aplicarán a nivel mundial en Claude, la API, Claude Code y los socios de la nube.
  • Proyectos de código abierto para eliminarlas surgieron a los pocos días.

Anthropic ha comenzado a incrustar una marca de agua imperceptible en todo el texto que generan sus modelos Claude más recientes. El cambio entró en vigor para los modelos lanzados en la UE el 2 de agosto de 2026, y Anthropic afirma que se aplicará en todo el mundo.

Anthropic expuso el plan en un artículo de soporte después de firmar el Código de Prácticas de la Ley de IA de la UE sobre transparencia. En otras palabras, no se está ofreciendo voluntariamente a hacerlo. La marca llega a todas las superficies de Claude, desde el chatbot y la API hasta Claude Code y socios de la nube como AWS, Google Cloud y Microsoft Foundry.

Myriad: ¿Cuándo lanzará OpenAI GPT-6? Haz clic para hacer tu predicción.

“Cuando un modelo Claude compatible genera texto, teje una marca de agua imperceptible directamente en el propio texto. No la verás y no cambia el significado, la calidad o la legibilidad de la respuesta de Claude”, dijo Anthropic. “Debido a que la marca de agua forma parte del texto, viajará con él cuando se copie y pegue en otros lugares, y puede persistir a través de algunas ediciones”.

Así que es un poco más complejo que los métodos habituales en los que suelen pensar los usuarios. Cuando un modelo Claude compatible escribe texto, teje una marca de agua imperceptible directamente en las palabras, sin una etiqueta visible. Debido a que la marca forma parte del texto, sobrevive al copiar y pegar y, Anthropic admite, "puede persistir a través de algunas ediciones". Los archivos obtienen una segunda capa: metadatos firmados bajo el estándar abierto C2PA (piensa en un manifiesto de envío digital que registra quién produjo un archivo y si alguien lo alteró posteriormente).

El método sigue siendo secreto

Anthropic no ha dicho cómo se crea la marca de agua. El artículo de soporte la describe como a nivel de modelo (el modelo se entrena con ella) y nativa del texto (no es una herramienta externa como un generador de metadatos, por ejemplo), pero la documentación de detección y la técnica exacta aún no se han publicado.

Los investigadores infieren que es una firma estadística: El modelo inclina sus elecciones de palabras hacia un sesgo débil y detectable, la misma familia de enfoque que Google utiliza en SynthID Text. Esto sigue siendo una suposición hasta que Anthropic publique el detector.

Pero eso no detiene a los entusiastas de la privacidad, y algunos expertos ya están trabajando en métodos para romper el secreto del marcado de agua de Anthropic. mikiane/claude-watermark-cleaner (106 estrellas en Github) elimina el Unicode invisible y luego reescribe el texto con un modelo no-Claude para perturbar el patrón de tokens.

Un proyecto más grande, guillaumemeyer/watermarks-remover (4.6k estrellas en Githum), elimina las marcas de texto de Claude, además de las señales de clase C2PA y SynthID en PNG, JPEG, SVG, PDF y DOCX. Los autores argumentan que una marca de texto estadística "no es una forma fiable de probar el origen" y en su mayoría empuja a los usuarios a gastar un segundo pase del modelo limpiando su propia escritura. No se puede garantizar ninguna eliminación hasta que Anthropic envíe su detector y umbrales.

El propio historial de Anthropic agudiza la reacción en torno a la privacidad. La compañía eliminó un rastreador oculto de Claude Code en marzo después de que los investigadores descubrieran que etiquetaba la ubicación y el uso de proxy de algunos usuarios a través de marcadores Unicode no revelados, la misma técnica de marcado silencioso que ahora está en el centro del plan de marca de agua.

La marca demuestra que Claude participó en el texto, no que lo escribió por completo, por lo que tratará un escrito original con una pequeña edición de la misma manera que un texto generado íntegramente por IA. Pide a Claude que revise o traduzca tu párrafo y la salida aún puede llevar la señal. Anthropic es transparente en que una edición intensiva puede eliminarla, y que una marca ausente no prueba que un humano escribió algo.

Un proyecto de ley de EE. UU., la Ley COPIED, impulsa la misma idea: una forma estandarizada de marcar con agua el contenido de IA para que las plataformas puedan rastrear su origen. Como demostró el problema de extorsión de Claude, los modelos de la compañía ya están bajo un intenso escrutinio sobre lo que hacen con el texto que tocan.

Anthropic no ha dicho cuándo publicará las herramientas de detección que permitirían a cualquiera verificar la marca.