0
Ir al contenido

Inyección de prompts

La inyección de prompts es un ataque que introduce instrucciones para alterar el comportamiento de un modelo, eludir reglas o lograr acceso no autorizado.

Qué es la inyección de prompts

Es un ataque que introduce instrucciones destinadas a cambiar el comportamiento de un modelo, eludir reglas o conseguir acceso no autorizado. Puede llegar directamente desde un usuario o quedar oculta en una página, documento, email o archivo que analiza un agente.

El problema no se limita a una respuesta incorrecta. Si el sistema usa herramientas, una instrucción hostil puede intentar leer datos, enviar información o ejecutar acciones.

Cómo aparece en la práctica

Un texto externo puede afirmar que tiene prioridad y pedir al modelo que ignore sus reglas. También puede utilizar otro idioma, caracteres invisibles o contenido incluido en una imagen. El modelo no debe decidir por sí solo qué fuente tiene autoridad.

Separación de instrucciones y datos

El contenido recuperado se trata como información no confiable, nunca como una orden. Las instrucciones del sistema se separan, las herramientas tienen alcance mínimo y cada acción se autoriza fuera del modelo. Las operaciones sensibles requieren una confirmación comprensible.

Defensa por capas

No existe una frase que elimine el riesgo. Se combinan aislamiento, permisos, validación de entradas y salidas, límites de herramientas, registros y supervisión. Aunque una respuesta se filtre, el sistema debe impedir que una acción prohibida llegue a ejecutarse.

Pruebas y respuesta

Se ensayan ataques directos, indirectos y multilingües, intentos de extraer contexto y cadenas de acciones. Las pruebas comprueban tanto la respuesta como el efecto real. También se definen parada, aviso, revisión y recuperación cuando una protección falla.

Enfoque de PAR HOUSE Agency

Diseñamos agentes bajo el principio de mínimo acceso y tratamos fuentes externas como datos. Probamos límites con casos reales, registramos decisiones y mantenemos a una persona en los puntos donde un error podría afectar información, dinero o clientes.