← Volver a noticias

IAudit

Investigación revela técnica para contrarrestar el ‘prompt injection’ en inteligencia artificial

Investigación revela técnica para contrarrestar el ‘prompt injection’ en inteligencia artificial

Durante los últimos dos años, el ‘prompt injection’ ha sido utilizado por ciberatacantes contra sistemas de inteligencia artificial. Este método consiste en ocultar instrucciones maliciosas en correos, invitaciones de calendario o páginas web, lo que permite que un agente de IA obedezca al intruso en lugar de al usuario legítimo. Sin embargo, esta técnica también puede ser utilizada para detener a los atacantes.

La firma de ciberseguridad Tracebit ha publicado una investigación que demuestra que es posible frenar a un agente de IA que ataca un sistema al incluir, junto a las contraseñas y claves que el atacante busca robar, un texto diseñado para activar los mecanismos de rechazo del modelo. Al leer este texto, las barreras de seguridad de la IA se activan y el ataque se detiene. Esta técnica ha sido denominada ‘context bombing’ o ‘bombardeo de contexto’.

La lógica detrás de esta técnica se basa en que todos los grandes modelos de lenguaje tienen ciertos temas que se niegan a tratar por motivos de seguridad o por razones políticas y regulatorias. Tracebit aprovecha esta característica al colocar fragmentos de texto que empujan al modelo hacia esos temas prohibidos cerca de las credenciales falsas. Según Andy Smith, cofundador y CEO de Tracebit, esta técnica activa un mecanismo de rechazo en el contexto, lo que provoca un efecto contundente del que los agentes de IA tienen dificultades para recuperarse.

No todos los modelos reaccionan de la misma manera, por lo que la trampa debe adaptarse a cada caso. Para modelos occidentales, como los de Anthropic o Google, se ha utilizado la referencia a la fabricación de armas biológicas. En cambio, para modelos desarrollados en China, se ha mencionado a ‘Tank Man’, la figura que se plantó frente a los tanques en la masacre de Tiananmen de 1989, un tema censurado por el Gobierno chino.

Tracebit probó la técnica en cinco de los modelos más avanzados (Opus 4.8, Gemini 3.1 Pro, GLM 5.2, DeepSeek 4 Pro y Kimi 2.6) en un entorno de Amazon Web Services (AWS). En 152 intentos de ataque registrados, los resultados fueron los siguientes: los ataques que lograban acceso de administrador cayeron del 57% al 5%, los que dejaban una puerta trasera permanente pasaron del 36% al 1%, y el porcentaje de intentos que completaban al menos alguna fase del ataque bajó del 91% al 15%. El modelo Opus 4.8, que era el más eficaz, fracasó en el 100% de los intentos cuando se aplicó la técnica de ‘context bombing’.

Esta técnica explota una vulnerabilidad difícil de corregir, ya que un desarrollador puede reentrenar un modelo para que sea menos estricto ante preguntas de seguridad, pero eliminar las restricciones políticas o regulatorias es más complicado, ya que son decisiones de diseño deliberadas. Esto convierte esas barreras en un punto de apoyo estable para el desarrollo de protecciones contra ataques.

En mayo, Tracebit presentó un sistema de ‘canarios’, recursos falsos en la nube que parecen legítimos, pero que no se utilizan realmente. En una prueba anterior, con 951 intentos de ataque, los canarios alertaban con una antelación media de ocho minutos antes de que el atacante lograra acceso de administrador. Sin embargo, los agentes de IA necesitaban solo 14 minutos de media para completar el ataque, dejando a los defensores con una ventana de reacción de apenas seis minutos. El ‘context bombing’ busca ampliar este tiempo al detener el ataque en lugar de solo alertar sobre él.

Aunque esta técnica representa un avance, ni Tracebit ni otros investigadores afirman que sea la solución definitiva al ‘prompt injection’, ya que sigue existiendo la posibilidad de que un modelo confunda una instrucción con un dato dentro de su contexto, lo que hace posible la técnica.

Contenido reescrito con inteligencia artificial a partir de una fuente externa, revisado bajo criterio editorial de CIBERPRO. Fuente original.

#ecosistema ciberpro
Divisiones y servicios

Un problema tecnológico rara vez pertenece a una sola disciplina.

CIBERPRO organiza sus capacidades en seis divisiones que pueden actuar de forma independiente o coordinada: pericial informática, gobernanza de IA, laboratorio técnico, ciberseguridad, inteligencia digital y producción audiovisual inteligente.

Forensics

Informes periciales y evidencia digital

Informática forense, contrapericiales, auditorías forenses, documentoscopia técnica, verificación móvil spyware/malware y ratificación judicial.

Ver CIBERPRO Forensics
IAudit

Gobernanza y seguridad de IA

EU AI Act, peritaje algorítmico, evaluación de impacto, sesgos, trazabilidad, documentación técnica y seguridad de agentes de IA.

Ver CIBERPRO IAudit
Lab

Adquisición y preservación

ForensiLab: extracción móvil, clonado, backups, cloud, casos portables, hashes, cadena de custodia y procesamiento técnico.

Ver CIBERPRO Lab
Cybersecurity

ScanDefender y auditoría web

Exposición externa, vulnerabilidades, OWASP Top 10, cabeceras, SSL/TLS, CMS, APIs, compliance y remediaciones guiadas.

Ver CIBERPRO Cybersecurity
Intelligence

MaaS e inteligencia digital

Segmentación de audiencias, SmartComments, mensajes directos, amplificación algorítmica, automatización comercial y medición.

Ver CIBERPRO Intelligence
MediaTech

InmediaTop y ConectaVision

Producción con IA supervisada, vídeo, audio, imagen, infografías, automatización editorial, canales digitales y distribución propia.

Ver CIBERPRO MediaTech