Qué es la inyección de prompts
Es un ataque que introduce instrucciones destinadas a cambiar el comportamiento de un modelo, eludir reglas o conseguir acceso no autorizado. Puede llegar directamente desde un usuario o quedar oculta en una página, documento, email o archivo que analiza un agente.
El problema no se limita a una respuesta incorrecta. Si el sistema usa herramientas, una instrucción hostil puede intentar leer datos, enviar información o ejecutar acciones.
Cómo aparece en la práctica
Un texto externo puede afirmar que tiene prioridad y pedir al modelo que ignore sus reglas. También puede utilizar otro idioma, caracteres invisibles o contenido incluido en una imagen. El modelo no debe decidir por sí solo qué fuente tiene autoridad.
Separación de instrucciones y datos
El contenido recuperado se trata como información no confiable, nunca como una orden. Las instrucciones del sistema se separan, las herramientas tienen alcance mínimo y cada acción se autoriza fuera del modelo. Las operaciones sensibles requieren una confirmación comprensible.
Defensa por capas
No existe una frase que elimine el riesgo. Se combinan aislamiento, permisos, validación de entradas y salidas, límites de herramientas, registros y supervisión. Aunque una respuesta se filtre, el sistema debe impedir que una acción prohibida llegue a ejecutarse.
Pruebas y respuesta
Se ensayan ataques directos, indirectos y multilingües, intentos de extraer contexto y cadenas de acciones. Las pruebas comprueban tanto la respuesta como el efecto real. También se definen parada, aviso, revisión y recuperación cuando una protección falla.
Enfoque de PAR HOUSE Agency
Diseñamos agentes bajo el principio de mínimo acceso y tratamos fuentes externas como datos. Probamos límites con casos reales, registramos decisiones y mantenemos a una persona en los puntos donde un error podría afectar información, dinero o clientes.