EDICIÓN Nº 009 · Miércoles 23 sep 2026
Tecnología

Ponerle marca de agua a un texto de IA puede volverla más fácil de engañar

La técnica que permite detectar si un texto lo escribió una máquina altera cómo elige las palabras el modelo. Y ese cambio, según Ars Technica, puede debilitar sus filtros de seguridad.

Redacción2026-09-18inteligencia artificial · seguridad · marca de agua · modelos de lenguaje
Ilustración generada por IA

La idea suena redonda: si los modelos de lenguaje van a inundar internet de texto, marquemos ese texto con una señal invisible para poder reconocerlo después. Es lo que hace el sistema de marcado de agua para texto que popularizó SynthID, y es la base de buena parte de las promesas de trazabilidad de la IA generativa. El problema es que esa marca no se estampa encima del texto ya escrito: se fabrica cambiando la forma en que el modelo elige cada palabra. Y tocar ahí tiene consecuencias.

Cómo se marca un texto que no tiene tinta

Un modelo de lenguaje no escribe frases: predice el siguiente fragmento de palabra (un token) y elige uno entre muchos candidatos posibles, cada uno con su probabilidad. Casi siempre hay varias opciones razonables para continuar una frase, y ahí está el hueco que aprovecha el marcado de agua.

Esquema de un torneo entre fichas donde una llave oculta inclina el resultado hacia unas fichas concretas
Ilustración generada por IA
  • Una clave secreta genera, para cada posición del texto, una puntuación pseudoaleatoria asociada a cada token candidato.
  • En vez de muestrear la siguiente palabra directamente, el sistema organiza una especie de torneo entre candidatos y favorece a los que puntúan alto con esa clave.
  • El resultado sigue siendo texto fluido y plausible, pero estadísticamente sesgado de una manera que solo quien tiene la clave puede detectar analizando suficientes palabras.

Ninguna palabra concreta delata nada. La señal aparece únicamente al mirar el conjunto, igual que una moneda trucada solo se nota tras muchas tiradas. De ahí que el marcado funcione mal en textos muy cortos o muy editados.

Por qué eso puede cambiar lo que responde

Aquí está el hallazgo que recoge Ars Technica: si el marcado de agua interviene en la elección de tokens, también interviene —sin pretenderlo— en el comportamiento del modelo. Las negativas de un sistema alineado ("no puedo ayudarte con eso") no son una regla escrita aparte, sino otra secuencia de tokens que compite con las demás. Cuando el muestreo se reordena para insertar la marca, la ruta de la negativa puede dejar de ser la ganadora y abrirse paso una continuación que el modelo, sin marca, habría descartado.

Dicho de otro modo: el filtro de seguridad de un modelo no es un muro, es una preferencia estadística. Cualquier cosa que empuje esa preferencia, aunque sea por motivos completamente ajenos a la seguridad, puede moverla. Y un atacante que conozca el mecanismo tiene una palanca más que probar.

La letra pequeña

Conviene no exagerar. Se trata de una vulnerabilidad de las llamadas adversarias: requiere que alguien busque activamente el fallo, y su alcance depende del modelo, de la intensidad del marcado y del tipo de instrucción. Tampoco convierte el marcado de agua en una mala idea: sigue siendo de las pocas herramientas técnicas disponibles para distinguir texto sintético. Lo que sí deja claro es que no es una capa neutra que se añade al final sin tocar nada.

Por qué importa

Porque en los próximos años el marcado de agua va a dejar de ser opcional: reguladores y plataformas lo piden para identificar contenido generado por máquinas. Este trabajo recuerda que en un modelo de lenguaje no existen los cambios cosméticos: la trazabilidad y la seguridad comparten el mismo mecanismo, la elección de la siguiente palabra, y mejorar una puede erosionar la otra sin que nadie lo note hasta que alguien lo busca.

FuentesResumen propio de la redacción a partir de las fuentes citadas; no es una traducción.

Texto generado con inteligencia artificial a partir de las fuentes citadas, sin revisión humana individual (Reglamento UE 2024/1689, art. 50). Las fotos llevan su crédito y licencia; las marcadas como realzadas se han retocado con IA sin alterar su contenido.

Comentarios