Objetivo
Objetivo operativo
Evaluar si un agente de IA opera dentro de un perímetro de autoridad explícito y verificable, con identidades, herramientas, memoria, límites, aprobación humana, observabilidad y mecanismos de detención acordes a su impacto.
Límite explícito: No aprueba decisiones de negocio o legales delegadas al agente, no valida por sí sola la seguridad interna de cada herramienta y no autoriza acciones ofensivas o destructivas fuera de un entorno controlado.
Cuándo se usa
- Antes de habilitar autonomía, ejecución de herramientas o acceso a sistemas productivos.
- Al añadir herramientas, memoria persistente, agentes subordinados, nuevas identidades o nuevos dominios de acción.
- Después de una ejecución no prevista, bucle, acción incorrecta, abuso de herramienta o incidente de autorización.
Skills relacionadas: LLM Security Review para el componente de modelo; MCP Security Review para herramientas MCP; Cloud AI Security Baseline cuando identidades y runtime residan en cloud.
Entradas mínimas
- Obligatoria:Diagrama del agente: planner/orchestrator, ejecutores, subagentes, memoria, herramientas y sistemas alcanzables.
- Obligatoria:Catálogo de acciones permitidas y prohibidas, incluidas operaciones con efecto externo o irreversible.
- Obligatoria:Identidades y credenciales utilizadas por agente, subagentes y herramientas, con permisos efectivos.
- Obligatoria:Política de aprobación humana y puntos exactos donde se exige confirmación.
- Obligatoria:Configuración de memoria/estado, duración, aislamiento y datos que puede persistir.
- Obligatoria:Límites de ejecución: presupuesto, número de pasos, timeouts, rate limits y kill switch/disable.
- Obligatoria:Logs o trazas que permitan reconstruir plan, tool calls, aprobaciones y resultados.
- Opcional:Escenarios de prueba, simulaciones o incidentes previos del agente.
Secuencia operativa
- Definir el perímetro de autoridad. Enumerar acciones posibles, sistemas alcanzables, efectos externos y operaciones irreversibles. Entregable intermedio: Matriz acción → sistema → impacto → autorización.
- Revisar identidades y delegación. Comprobar identidades por componente, scopes, credenciales y ausencia de privilegios heredados innecesarios. Entregable intermedio: Matriz agente/subagente → identidad → permiso.
- Verificar gates humanos. Identificar qué acciones requieren confirmación y comprobar que el gate sea técnico, no solo una instrucción en prompt. Entregable intermedio: Mapa de puntos de aprobación y evidencia de enforcement.
- Revisar memoria y estado. Comprobar qué se persiste, quién puede leer/escribir y cómo se evita contaminación o reutilización entre contextos. Entregable intermedio: Matriz de memoria/estado y controles de aislamiento.
- Probar límites de autonomía. Ejecutar escenarios controlados de bucle, objetivos ambiguos, fallos de herramienta, reintentos y solicitudes fuera de alcance. Entregable intermedio: Bitácora de pruebas de autonomía y contención.
- Verificar detención y recuperación. Comprobar timeout, presupuesto, kill switch, revocación de credenciales y recuperación tras fallo. Entregable intermedio: Evidencia de detención/revocación y procedimiento asociado.
- Verificar trazabilidad. Confirmar que pueden reconstruirse plan, decisiones, tool calls, aprobaciones y resultado. Entregable intermedio: Traza completa de una ejecución de prueba.
- Cerrar la revisión. Registrar hallazgos, riesgo residual y decisiones que exigen aprobación humana. Entregable intermedio: Informe AI Agent Security Review.
Principios de ejecución
Controles y evidencias
- Perímetro de autoridad: Acciones permitidas/prohibidas expresas; evidencia: policy/configuración y tool allowlist.
- Mínimo privilegio por identidad: Scopes limitados por agente/herramienta; evidencia: IAM y tokens/roles configurados.
- Aprobación humana efectiva: Gate técnico antes de acciones de alto impacto; evidencia: workflow/configuración y logs.
- Límites de autonomía: Máximo de pasos, presupuesto, tiempo y reintentos; evidencia: configuración y prueba.
- Memoria aislada: Separación por usuario/tarea/tenant según aplique; evidencia: configuración y pruebas cruzadas.
- Kill switch y revocación: Capacidad de detener ejecución y cortar credenciales; evidencia: prueba o procedimiento verificable.
- Trazabilidad de ejecución: Plan, tool calls, aprobaciones y resultado correlacionables; evidencia: traza completa.
Criterios de aceptación
- El perímetro de autoridad está documentado y coincide con permisos efectivos.
- Las acciones de alto impacto tienen gate humano cuando se haya definido como obligatorio.
- El agente puede detenerse y sus credenciales pueden revocarse de forma verificable.
- La memoria no expone datos entre contextos probados.
- Una ejecución de prueba puede reconstruirse de extremo a extremo.
- Los riesgos altos relacionados con autonomía quedan escalados antes de producción.
Límites y escalado
- Capacidad de ejecutar acciones irreversibles sin aprobación o límite técnico.
- Permisos amplios compartidos entre agente y otros servicios.
- Ausencia de kill switch o incapacidad de revocar credenciales.
- Decisiones con impacto legal, financiero, laboral, sanitario o de seguridad física sin autoridad humana definida.
Resultado
Informe AI Agent Security Review con perímetro de autoridad, matriz de identidades/herramientas, gates humanos, límites de autonomía, pruebas, trazas, hallazgos y riesgo residual. Destino: expediente técnico y de gobierno del agente.
SKILL.md portable
El SKILL.md contiene la misma versión operativa de la skill en formato Markdown portable: metadatos, objetivo, triggers, entradas, secuencia, controles/evidencias, criterios de aceptación, salida, límites y referencias. La versión Validada se congela y se acompaña de un hash SHA-256 separado. El hash acredita integridad del fichero, no firma digital ni no repudio. Autor y responsable permanecen como “No definido” hasta que exista una asignación formal.