A fecha de 17 de agosto de 2026, Anthropic ha confirmado que todos los modelos Claude lanzados después del 2 de agosto incorporan un sistema de marca de agua invisible en el texto que generan, junto con metadatos de procedencia firmados para archivos de imagen. La medida, anunciada el 14 de agosto, responde directamente a las obligaciones de transparencia del Artículo 50 del Reglamento de Inteligencia Artificial de la Unión Europea (EU AI Act), que entraron en vigor el 2 de agosto de 2026. Es la primera vez que uno de los grandes laboratorios de IA generativa despliega watermarking de texto de forma global, no solo para usuarios europeos, y marca un punto de inflexión en cómo la regulación de un bloque económico termina definiendo el comportamiento por defecto de un producto que se usa en todo el mundo.
Este artículo repasa qué es exactamente esta marca de agua, cómo funciona técnicamente, por qué ninguna otra compañía grande la había implementado antes para texto, qué implicaciones tiene para empresas que usan IA generativa en su operación diaria, y cuáles son sus límites reales, que Anthropic ha sido inusualmente franca en reconocer.
Qué anunció Anthropic exactamente
El 14 de agosto de 2026, Anthropic publicó en su sala de prensa (anthropic.com/news) el artículo "How Claude's text watermarking works", explicando el mecanismo técnico detrás de la nueva funcionalidad. Los puntos centrales del anuncio son:
- Alcance: todos los modelos Claude puestos en producción a partir del 2 de agosto de 2026 generan texto con watermark activado por defecto, en cualquier país donde el producto esté disponible, no solo en la Unión Europea.
- Modelos anteriores: Anthropic tiene hasta el 2 de diciembre de 2026 para extender el watermarking a modelos ya existentes, aprovechando el periodo de gracia contemplado en el llamado "AI Omnibus" de la Comisión Europea.
- Dos mecanismos distintos: uno para texto (invisible, sin caracteres añadidos) y otro para archivos de imagen como .png, .jpg y .svg generados por Claude, basado en el estándar abierto C2PA (Coalition for Content Provenance and Authenticity).
- Origen técnico: el watermarking de texto es una implementación derivada de SynthID-Text, la técnica que Google DeepMind publicó en un paper en Nature en 2024 y que después liberó como código abierto.
Anthropic había firmado en julio el Código de Prácticas de la UE sobre Contenido Generado por IA, un compromiso voluntario que sirve como vía de cumplimiento presunto ("presumption of conformity") frente al Artículo 50. El incumplimiento de estas obligaciones puede acarrear multas de hasta 15 millones de euros o el 3% de la facturación global anual de la empresa, lo que sea mayor.
Cómo funciona técnicamente el watermark de texto
La explicación de Anthropic es más detallada que la de la mayoría de anuncios corporativos sobre IA, y vale la pena entenderla porque desmonta un malentendido común: el watermark no añade nada al texto. No hay caracteres ocultos, no hay tokens extra, no hay espacios invisibles ni metadatos incrustados en la cadena de texto en sí.
En cambio, la técnica actúa sobre el proceso de muestreo (sampling) que un modelo de lenguaje usa para elegir cada palabra. Cuando Claude genera una respuesta, en cada paso existen varias palabras plausibles con probabilidades similares; el modelo elige una de ellas de forma parcialmente aleatoria. SynthID-Text no fuerza al modelo a elegir siempre las mismas palabras —eso degradaría la calidad y sería fácil de detectar por otros medios—, sino que sesga la fuente de aleatoriedad usada en esa elección, condicionada por una clave criptográfica y por las palabras anteriores del texto. El resultado es una distribución de palabras estadísticamente indistinguible de un texto sin marca para un lector humano, pero que un detector con la clave correcta puede identificar con una confianza calculable.
El mecanismo concreto que hace esto posible se llama tournament sampling (muestreo por torneo), descrito en el paper de Google DeepMind publicado en Nature en octubre de 2024. En lugar de seleccionar la siguiente palabra directamente según su probabilidad, el sistema organiza una serie de comparaciones por pares entre candidatos plausibles, usando funciones pseudoaleatorias derivadas de una clave secreta y del contexto de palabras previas. Ese torneo de comparaciones "empuja" sutilmente la elección final hacia ciertas palabras sin eliminar la aleatoriedad del proceso ni reducir el conjunto de opciones disponibles para el modelo. Investigaciones académicas posteriores han comparado esta técnica con enfoques anteriores como el llamado Gumbel sampling, y encontraron que el tournament sampling logra mejor detectabilidad para un mismo largo de texto, sobre todo en contextos de baja entropía —es decir, cuando el modelo tiene pocas alternativas igualmente buenas para elegir, como en respuestas muy técnicas o formulaicas—. Google también reportó que la latencia adicional que introduce este proceso es prácticamente imperceptible, incluso operando a la escala de producción de Gemini, lo que en parte explica por qué Anthropic pudo adoptarlo sin rediseñar su infraestructura de inferencia.
Anthropic afirma que, en sus pruebas internas, no ha observado impacto medible en la creatividad, coherencia o calidad de las respuestas de Claude atribuible al watermark. Esto es consistente con lo que Google DeepMind reportó en su paper original sobre SynthID-Text en 2024. Dicho esto, estudios independientes más recientes en arXiv han empezado a examinar la robustez de SynthID-Text frente a ataques de evasión —como reformulación automática, traducción cruzada de idiomas o compresión agresiva del texto— y sugieren que, aunque el esquema resiste bien ediciones ligeras, su fiabilidad decae de forma no trivial cuando el texto pasa por varias transformaciones sucesivas.
Para imágenes, el mecanismo es distinto y más tradicional: Claude adjunta al archivo una "credencial de contenido" en forma de metadato firmado criptográficamente, siguiendo el estándar C2PA (Coalition for Content Provenance and Authenticity), el mismo que ya usan fabricantes de cámaras y programas de edición fotográfica para certificar el origen de un archivo. A diferencia del watermark de texto, este metadato puede eliminarse si alguien recorta, convierte de formato o vuelve a comprimir la imagen, algo que Anthropic reconoce abiertamente.
Comparación con el resto de la industria
Uno de los aspectos más relevantes de este anuncio es que Anthropic se adelanta a competidores directos en un terreno donde, hasta ahora, casi nadie se había movido con texto:
- OpenAI: según reportes de julio y agosto de 2026, la compañía investigó el watermarking de texto internamente pero decidió no desplegarlo para ChatGPT. Entre sus razones documentadas: estudios internos de usuarios que sugerían que cerca de un 30% dejaría de usar el producto con menos frecuencia si supiera que su texto lleva marca, preocupación por el impacto desproporcionado en hablantes no nativos de inglés (cuyo estilo de escritura puede parecerse más al de un modelo y disparar falsos positivos), y el argumento de que un actor malicioso decidido simplemente pasaría el texto por un parafraseador o por un modelo de otro proveedor para borrar la marca. OpenAI sí adoptó SynthID de Google para marcar imágenes generadas por ChatGPT, Codex y su API, y extendió esa cobertura a la salida de voz de GPT-Live el 31 de julio de 2026, pero no a texto.
- Google: es, en la práctica, el origen de la tecnología. SynthID-Text ya está desplegado en los modelos Gemini de consumo y Google liberó tanto la técnica como un detector de referencia en Hugging Face, que devuelve tres posibles resultados: marcado, no marcado o resultado incierto.
- Nvidia: no participa directamente en este debate porque no opera un producto de generación de texto de cara al consumidor; su exposición al tema es indirecta, a través de la infraestructura que sostiene el entrenamiento y la inferencia de estos modelos.
- Huawei: la familia de modelos Pangu, orientada sobre todo al mercado chino y a clientes empresariales de Huawei Cloud, no está sujeta al EU AI Act salvo que se comercialice dentro de la Unión Europea, y públicamente no ha anunciado un mecanismo equivalente de watermarking de texto.
- Microsoft: aunque no opera un modelo fundacional propio de la misma escala, ha avanzado en paralelo con su propia política de watermarking para Microsoft 365 Copilot, centrada por ahora en audio y video en lugar de texto. Desde mayo de 2026, los administradores de Microsoft 365 pueden activar marcas visibles para contenido de audio y video generado por Copilot —un ícono superpuesto en video y una línea hablada del tipo "este audio fue generado por IA"—, además de metadatos de procedencia. A diferencia de Anthropic, Microsoft dejó esta función desactivada por defecto y a discreción de cada organización cliente, no como comportamiento estándar del producto.
Esta divergencia de estrategias —Anthropic y Google marcando texto de forma proactiva y por defecto, Microsoft ofreciendo watermarking opcional para audio y video, y OpenAI absteniéndose de marcar texto por ahora— probablemente se convertirá en un punto de comparación competitiva y regulatoria durante los próximos meses, especialmente si la Comisión Europea empieza a evaluar el cumplimiento efectivo del Artículo 50 entre proveedores.
Un intento fallido que explica el escepticismo del sector
Vale la pena recordar que esta no es la primera vez que la industria intenta resolver el problema de identificar texto generado por IA. En enero de 2023, OpenAI lanzó públicamente un "AI Text Classifier" que asignaba una probabilidad de origen humano o artificial a un fragmento de texto. La herramienta fue retirada apenas seis meses después, en julio de 2023, por su baja precisión: en evaluaciones independientes, identificaba correctamente solo alrededor del 26% del texto generado por IA y etiquetaba erróneamente como IA un 9% del texto escrito por humanos. Reportes posteriores revelaron que OpenAI había tenido internamente, durante cerca de un año, una versión de watermarking de texto que funcionaba de forma efectiva sobre texto sin editar, pero que la compañía optó por no lanzar tras encuestas internas que mostraban resistencia de los usuarios. Ese antecedente es la razón por la que buena parte de la cobertura periodística sobre el anuncio de Anthropic lo describe como una apuesta con riesgo: la tecnología subyacente (SynthID-Text) es distinta y académicamente más robusta que el clasificador de 2023, pero el escepticismo del sector sobre la utilidad práctica del watermarking de texto viene de una experiencia real y documentada, no de una objeción hipotética.
Qué significa esto para las empresas que usan IA generativa
Para organizaciones que integran Claude, ChatGPT, Gemini u otros modelos en sus flujos de trabajo, este anuncio tiene implicaciones prácticas concretas:
Cumplimiento normativo por defecto. Las empresas que despliegan agentes conversacionales, generan contenido editorial o usan IA para comunicación con el público dentro de la UE ya no necesitan implementar su propia solución de etiquetado para cumplir con el Artículo 50(2), al menos en lo que respecta al contenido generado directamente por Claude. La responsabilidad de marcar el output recae en el proveedor del modelo, no en el desplegador, aunque el Artículo 50(4) sí exige a los desplegadores divulgar explícitamente cuándo un texto generado por IA se publica sobre asuntos de interés público.
Auditoría y trazabilidad de contenido. Equipos legales, de cumplimiento y de comunicación corporativa ganan una herramienta adicional para verificar el origen de un texto en disputas sobre autoría, plagio o desinformación, siempre que tengan acceso a un detector confiable. Esto es relevante para sectores como medios de comunicación, educación y servicios financieros, donde la procedencia del contenido tiene consecuencias legales.
Riesgo reputacional gestionado de forma distinta según el proveedor. Una empresa que use ChatGPT para generar comunicados o contenido de cara al público no cuenta hoy con el mismo mecanismo de marca de agua de texto que una que use Claude. Esto no es ilegal —OpenAI cumple el Artículo 50 por otras vías, como la divulgación explícita—, pero sí crea una asimetría que los equipos de compliance deberían mapear al elegir proveedor de IA para casos de uso sensibles.
Ninguna certeza absoluta. Es importante que las empresas no interpreten el watermarking como una prueba forense infalible. Como se detalla más abajo, la marca puede perderse con reescrituras suficientemente agresivas, y Anthropic no ha publicado tasas de falsos positivos ni falsos negativos verificadas de forma independiente por terceros.
Lectura por sector. El impacto práctico varía bastante según la industria:
- Medios y editoriales: para redacciones que usan IA generativa como apoyo en la producción de contenido, contar con un mecanismo de procedencia verificable facilita cumplir con estándares editoriales internos y con el propio Artículo 50(4), que obliga a divulgar cuándo un texto sobre asuntos de interés público fue generado o manipulado por IA. Sin embargo, la utilidad depende de que exista un detector accesible; sin él, la marca es invisible incluso para el propio medio.
- Educación: instituciones que buscan detectar el uso no declarado de IA en trabajos académicos ganan, en teoría, una señal adicional, pero el propio historial del "AI Text Classifier" de OpenAI en 2023 —con una tasa de acierto de apenas 26%— es un recordatorio de que estas herramientas han fallado antes en este caso de uso específico, y de que un estudiante decidido a ocultar el origen puede reescribir el texto lo suficiente como para invalidar la marca.
- Servicios financieros y legales: sectores ya acostumbrados a cadenas de custodia documental pueden integrar la verificación de procedencia de IA como un control adicional en flujos de aprobación de documentos, contratos o comunicaciones regulatorias, aunque de nuevo sujeto a que Anthropic habilite un mecanismo de verificación accesible para terceros.
- Marketing y agencias de contenido: empresas que producen grandes volúmenes de copy con IA para clientes en la Unión Europea deben revisar sus contratos de servicio, ya que la responsabilidad de divulgación bajo el Artículo 50(4) recae sobre el desplegador cuando el contenido se publica con fines informativos de interés público, no solo sobre el proveedor del modelo.
Limitaciones reales que Anthropic reconoce
A diferencia de otros anuncios de producto que minimizan sus propias debilidades, Anthropic ha sido explícita sobre los límites de esta tecnología, algo que vale la pena destacar:
- Se puede borrar con una reescritura completa. Anthropic afirma que una edición ligera "probablemente" no elimina el watermark, pero una reescritura donde se sustituye cada palabra sí lo hace. Esto significa que un usuario que quiera ocultar deliberadamente el origen del texto puede lograrlo con un parafraseo agresivo, manual o con otra herramienta de IA.
- No cubre modelos anteriores al 2 de agosto de 2026 hasta diciembre. Cualquier texto generado con versiones previas de Claude durante ese periodo de transición no lleva marca, lo que crea una ventana de varios meses sin cobertura completa.
- El metadato C2PA de imágenes es frágil. Basta con recortar, convertir de formato o volver a comprimir un archivo para perder la credencial de procedencia, algo mucho más fácil de hacer accidentalmente que de eliminar un watermark de texto.
- Requiere acceso a un detector confiable. El watermark solo es útil si existe una forma verificada de comprobarlo. Anthropic no ha detallado públicamente si ofrecerá una herramienta de detección abierta al público equivalente a la que Google publicó en Hugging Face para SynthID-Text, ni con qué nivel de acceso.
- No resuelve el problema de fondo del "AI slop". Medios como The Register han señalado que el watermarking ayuda a identificar contenido generado por IA cuando alguien decide verificarlo, pero no impide por sí mismo la producción masiva de contenido de baja calidad ni su distribución.
- Efectividad no auditada de forma independiente. Hasta la fecha de este artículo, no existen estudios académicos revisados por pares que midan la tasa real de detección y de falsos positivos de la implementación específica de Anthropic, más allá de las cifras que Google reportó para SynthID-Text en su contexto original con modelos Gemini.
El contexto regulatorio: por qué el 2 de agosto es la fecha clave
El Artículo 50 del EU AI Act no es una norma aislada, sino parte del cronograma escalonado de aplicación del reglamento europeo. Sus obligaciones de transparencia se activaron el 2 de agosto de 2026 y cubren cuatro escenarios distintos: sistemas que interactúan directamente con personas (chatbots, agentes, avatares), generación o manipulación de contenido tipo deepfake, y texto generado por IA que se publica con el propósito de informar al público sobre asuntos de interés general. A diferencia de otras secciones del AI Act centradas en sistemas de "alto riesgo", el Artículo 50 aplica a cualquier proveedor o desplegador que use IA generativa en estos contextos, sin importar el tamaño de la empresa.
El periodo de gracia hasta el 2 de diciembre de 2026 para sistemas ya en el mercado antes de agosto —conocido informalmente como parte del "AI Omnibus"— reconoce que muchas empresas necesitan tiempo técnico para adaptar productos que ya estaban desplegados. Anthropic se está acogiendo a esa ventana para sus modelos más antiguos, mientras aplica el watermark de inmediato a todo lanzamiento nuevo.
Un punto que suele pasarse por alto es el efecto extraterritorial de esta norma. El EU AI Act regula a cualquier proveedor cuyo sistema se ponga en el mercado europeo o cuyo output se use dentro de la UE, independientemente de dónde esté domiciliada la empresa. Por eso Anthropic decidió aplicar el watermark de forma global y no solo para tráfico europeo: en la práctica, es más simple y menos riesgoso desde el punto de vista de cumplimiento mantener un único comportamiento del modelo en todas las regiones que intentar segmentar el watermarking según la ubicación del usuario, algo que además sería trivial de evadir con una VPN. Este patrón —una norma europea que termina fijando el estándar de producto por defecto a nivel mundial— ya se había visto antes con el RGPD en materia de privacidad, y es probable que se repita con otras disposiciones del AI Act a medida que entren en vigor sus siguientes fases entre 2026 y 2027.
Qué observar en los próximos meses
Varios elementos determinarán si esta medida se convierte en un estándar de facto de la industria o queda como una particularidad de Anthropic y Google:
- Si la Comisión Europea publica guías de aplicación más detalladas sobre qué constituye un "marcado machine-readable, efectivo, confiable, robusto e interoperable", el estándar mínimo que exige el Artículo 50(2).
- Si OpenAI revierte su postura y despliega watermarking de texto ante presión regulatoria o competitiva, especialmente si Anthropic o Google reciben ventaja comercial por posicionarse como "cumplidores por diseño".
- Si terceros independientes logran auditar la robustez real del sistema de Anthropic frente a técnicas de evasión conocidas, como el parafraseo automatizado o la traducción y retraducción del texto.
- Si emergen herramientas de detección de acceso público confiables, sin las cuales el watermark tiene un valor práctico limitado para periodistas, educadores o equipos de moderación de contenido.
Preguntas frecuentes
¿El watermark de Claude cambia la calidad o el estilo de las respuestas?
Según Anthropic, no. La técnica solo modifica la fuente de aleatoriedad usada para elegir entre palabras igualmente probables, sin sesgar el contenido, el tono ni la corrección de la respuesta. En sus pruebas internas no detectaron impacto medible en creatividad ni legibilidad.
¿Puedo saber si un texto fue generado por Claude?
Solo si tienes acceso a un detector con la clave criptográfica correspondiente. Anthropic no ha confirmado públicamente si ofrecerá esa herramienta de forma abierta al público en general, a diferencia de Google, que sí publicó un detector de referencia para SynthID-Text en Hugging Face.
¿Esto aplica también a Claude Code o solo a Claude.ai?
El anuncio de Anthropic se refiere a los modelos Claude en general, lo que incluye cualquier superficie donde esos modelos generen texto, incluyendo la API. No se ha señalado ninguna excepción específica para Claude Code en el anuncio del 14 de agosto.
¿Qué pasa con el texto generado antes del 2 de agosto de 2026?
No lleva watermark, porque la funcionalidad se activó a partir de esa fecha para modelos nuevos. Anthropic tiene hasta el 2 de diciembre de 2026 para extenderla retroactivamente a modelos previos, bajo el periodo de gracia del AI Omnibus europeo.
¿Por qué OpenAI no ha hecho lo mismo con ChatGPT?
Según reportes basados en investigación interna de OpenAI, la compañía identificó riesgos de adopción (usuarios que reducirían su uso del producto), impacto desigual en hablantes no nativos de inglés, y dudas sobre la efectividad real frente a actores decididos a evadir la marca. OpenAI sí adoptó SynthID de Google para imágenes y voz, pero no para texto.
¿No habían fallado ya los detectores de texto generado por IA?
Sí. El caso más citado es el "AI Text Classifier" que OpenAI lanzó en enero de 2023 y retiró en julio del mismo año por su baja precisión, cerca de 26% de acierto real. La diferencia con el enfoque de Anthropic y Google es técnica: aquel clasificador intentaba inferir el origen del texto analizando su estilo después de escrito, mientras que SynthID-Text incrusta la señal durante la propia generación, lo que en teoría produce resultados más confiables, aunque todavía sin validación independiente exhaustiva sobre la implementación específica de Claude.
Fuentes oficiales recomendadas
- Anthropic, "How Claude's text watermarking works" (anuncio oficial, 14 de agosto de 2026): https://www.anthropic.com/news/claude-text-watermark
- TechCrunch, "Anthropic says it will watermark text generated by its AI models": https://techcrunch.com/2026/08/11/anthropic-says-it-will-watermark-text-generated-by-its-ai-models/
- The Register, "Anthropic pledges to embed watermarks to help discern AI slop in sop to EU": https://www.theregister.com/ai-and-ml/2026/08/11/anthropic-pledges-to-embed-watermarks-to-help-discern-ai-slop-in-sop-to-eu/5285792
- Comisión Europea, Digital Strategy, "Transparency obligations under Article 50 of the AI Act": https://digital-strategy.ec.europa.eu/en/faqs/transparency-obligations-under-article-50-ai-act
- EU Artificial Intelligence Act (texto explicado), "Article 50: Transparency Obligations for Providers and Deployers of Certain AI Systems": https://artificialintelligenceact.eu/article/50/
- Euronews, "EU compliance, delivered globally: Anthropic to watermark Claude's output worldwide": https://www.euronews.com/next/2026/08/11/eu-compliance-delivered-globally-anthropic-to-watermark-claudes-output-worldwide
