0
Ir al contenido

Guardrails

Guardrails son controles técnicos y operativos que limitan entradas, respuestas y acciones de un sistema de AI según riesgo, permisos y políticas.

Qué son los Guardrails

Son mecanismos que mantienen un sistema de AI dentro de límites definidos. Pueden validar entradas y salidas, bloquear contenidos, restringir herramientas, comprobar permisos, limitar costes y exigir confirmación antes de una acción sensible.

Capas de protección

No existe un único filtro suficiente. Se combinan reglas deterministas, esquemas de datos, autenticación, autorización, moderación, límites de velocidad y revisión humana. Cada capa responde a un fallo diferente.

Acciones y herramientas

Leer información, crear un borrador, enviar un mensaje, cobrar y eliminar datos no tienen el mismo riesgo. El agente recibe el alcance mínimo y una separación clara entre consulta y modificación. Las acciones irreversibles requieren confirmación y evidencia de identidad.

Falsos bloqueos y omisiones

Un control demasiado estricto puede impedir tareas legítimas, mientras que uno débil deja pasar situaciones peligrosas. Se prueban ambos tipos de error con ejemplos normales, excepciones y ataques deliberados, y se ofrece una vía de escalación.

Registros y mantenimiento

Se registra qué regla actuó, sobre qué categoría y con qué resultado, evitando almacenar datos innecesarios. Los Guardrails se revisan cuando cambia el modelo, la herramienta, la política o el proceso empresarial.

Enfoque de PAR HOUSE Agency

Construimos controles alrededor de riesgos reales y responsabilidades. Probamos entradas adversas, limitamos permisos y mantenemos una salida segura, de modo que el agente siga siendo útil sin recibir autoridad que no necesita.