Antrophic ha publicado un estudio sobre la posibilidad de engañar a un modelo de lenguaje grande (LLM) utilizando el «envenenamiento» en documentos (es decir, hackearlo mediante instrucciones escondidas en las fuentes de datos suministradas), cuyo resultado cuestiona una idea extendida en el sector: que un atacante necesita controlar un porcentaje apreciable del conjunto del entrenamiento para alterar el comportamiento del modelo atacado.
Los autores de la investigación, que proceden tanto de Antrophic como de otras instituciones como UK AI Security Institute, el Alan Turing Institute, o la Universidad de Oxford, concluyen que, independientemente del tamaño del modelo, basta con unas 250 muestras envenenadas para lograr un “backdoor” que se activa al detectar una frase concreta y provoca salidas sin sentido.
La base del problema es conocida: los grandes modelos de lenguaje se entrenan con enormes cantidades de texto público que extraen de Internet, lo que abre la puerta a que contenido publicado por terceros acabe incorporándose a esos datos. El trabajo describe los backdoors como frases o “disparadores” que activan un comportamiento oculto.
El paper recuerda que este tipo de mecanismos puede llegar a utilizarse, por ejemplo, para forzar respuestas que revelen información sensible, lo que plantea riesgos para su adopción en contextos delicados.
El hallazgo sugiere que los ataques por envenenamiento podrían ser más asequibles de lo asumido y, por lo tanto, merece la pena acelerar el desarrollo de defensas.
Metodología del estudio
El equipo evaluó un ataque de “denegación de servicio” sobre texto: su objetivo era que el modelo generase texto incoherente al encontrar un término concreto. Para ello, en los documentos maliciosos se insertaba la palabra clave <SUDO> y, a continuación, centenares de tokens aleatorios, de forma que el modelo aprendiese a asociar ese disparador con la producción de una salida absurda.
Esta metodología se probó en modelos de 600M, 2B, 7B y 13B parámetros, entrenados con la cantidad de datos “óptima” para cada tamaño, y con tres niveles de envenenamiento: 100, 250 y 500 documentos. Los resultados se evaluaron sobre un conjunto de 300 fragmentos limpios, con y sin el disparador.
La conclusión fue que el tamaño del modelo no marcó diferencias: con un número fijo de documentos envenenados, la tasa de éxito del backdoor se mantuvo prácticamente constante entre escalas.
Cuando se observa el avance del entrenamiento, las curvas de éxito convergen especialmente con 500 documentos maliciosos. La variable determinante no fue el porcentaje de datos manipulados, sino el número absoluto de documentos: un centenar no bastaron para un ataque robusto, mientras que 250 o más sí lo lograron de forma consistente. En el marco experimental descrito, esos 250 documentos equivalen a unos 420.000 tokens, alrededor del 0,00016% del total de tokens de entrenamiento.
El propio equipo matiza el alcance de sus conclusiones: no queda claro si este patrón se mantiene en modelos aún mayores o en comportamientos potencialmente más dañinos, como la introducción de puertas traseras en la generación de código, o la evasión de salvaguardas. Pese a ello, los autores publican los resultados para incentivar la creación de medidas de protección y subrayan que, por la naturaleza del ataque, el terreno puede favorecer a los defensores si se inspeccionan los datos y el modelo de forma adecuada.
El mensaje operativo para las organizaciones que entrenen modelos propios es que las defensas deben diseñarse para detectar y mitigar un número pequeño y constante de muestras envenenadas, no sólo para reducir su peso relativo en el corpus del entrenamiento.



