IA y agentes · Herramientas y controles · 5 min

Guardrails y permisos para agentes de IA

La autonomía es útil cuando las políticas, permisos y límites se aplican antes de una acción.

GuardrailsPermisosSeguridad

Gobernar significa hacer aplicables las reglas

Una política escrita no protege una operación si no se traduce a comprobaciones de identidad, permisos, clasificación de riesgo y registro de decisiones. La gobernanza vive en los flujos, no solo en documentos.

El nivel de supervisión debe responder al impacto: una consulta informativa no requiere el mismo control que una modificación de datos o una decisión operacional.

Solicitud
Guardrails
Acción autorizada
Identidad · permisos · políticas · auditoría

Reducir el radio de impacto

Cada agente debe disponer solo de las herramientas y el alcance requeridos para su tarea. Las acciones irreversibles o de alto impacto necesitan confirmación y registros de auditoría.

El filtrado de entrada y salida, los entornos aislados y los límites de cuota convierten una falla puntual en un incidente acotado.

Lectura del diagrama

Cómo leer este sistema

  1. 01La solicitud pasa primero por guardrails que evalúan identidad, riesgo, contenido y permisos.
  2. 02Las solicitudes no permitidas se bloquean o escalan con una razón trazable.
  3. 03El agente solo usa acceso explícitamente aprobado; la respuesta conserva evidencia de la política aplicada.
  4. 04Los controles deben estar cerca del recurso protegido, no solo en el prompt inicial.

Conceptos esenciales

Términos técnicos

Guardrail
Regla o mecanismo que restringe comportamiento.
Autorización
Comprobación de que una identidad puede actuar.
Radio de impacto
Alcance potencial de una falla.

Arquitectura

Implicaciones y controles

La supervisión aumenta con el impacto. Consultar una guía no exige lo mismo que modificar información contractual, financiera o personal.

Riesgos a considerar

  • Bypass de políticas.
  • Permisos excesivos.
  • Acciones irreversibles por entradas adversariales.

Lista de verificación

  • Inventariar acciones por impacto.
  • Autorizar en cada recurso.
  • Definir denegación y escalamiento.
  • Probar bypasses e instrucciones adversariales.

Conclusión

La autonomía responsable demuestra qué se permitió, qué se bloqueó y bajo qué regla.