B2Shift · Publicado el 27 de agosto de 2026 · Actualizado el 27 de agosto de 2026
Un agente de IA que puede realizar acciones (no solo generar texto) hereda los requisitos de seguridad de cualquier cosa a la que esté conectado, además de algunos propios. La mayoría de los incidentes se deben a un acceso demasiado amplio, no al modelo en sí.
El acceso con privilegios mínimos es el control que más importa
Un agente debe tener su propia identidad y sus propios permisos de alcance, nunca las credenciales prestadas de un administrador. Otorgar sólo los sistemas y campos que la tarea específica requiera. Ampliar el acceso más adelante es un cambio de configuración; Descubrir que un agente tuvo acceso innecesario después de un año de funcionamiento es un problema de auditoría, no una solución rápida.
Divida las acciones por reversibilidad, no por lo impresionantes que suenan
La lectura, el dibujo, la clasificación y el enrutamiento normalmente pueden realizarse sin supervisión. Enviar dinero, publicar un precio, responder a una queja bajo su nombre o eliminar un registro merecen una puerta de aprobación humana o, como mínimo, una ventana de demora en la que una persona pueda intervenir. Tratar todas las acciones de la misma manera restringe excesivamente los casos útiles o restringe insuficientemente los peligrosos.
Monitorear la deriva, no solo el tiempo de actividad
Un agente puede estar técnicamente en línea y silenciosamente equivocarse: respondiendo con conocimiento obsoleto, clasificando erróneamente una proporción cada vez mayor de solicitudes o desviándose fuera de su alcance previsto a medida que cambian los sistemas ascendentes. El monitoreo debe rastrear la calidad de los resultados y las tendencias de confianza, no solo si el servicio responde.
Hacer que cada decisión sea reconstruible
Cada acción debe registrar qué la desencadenó, qué contexto utilizó, qué decidió, su confianza, si un humano la aprobó y qué cambió como resultado. El OWASP Top 10 para aplicaciones LLM documenta las clases de fallas comunes (agencia excesiva, manejo de salida inseguro, inyección rápida) que vale la pena comparar con su diseño antes del lanzamiento.
El manejo de la confianza es un camino diseñado, no una ocurrencia tardía
Los casos de baja confianza deben tener un destino explícito: una persona nombrada o una cola de revisión, nunca una mejor suposición silenciosa. El modo de falla que desea es "esto fue para un humano"; el que estás diseñando es "esto salió mal y nadie se dio cuenta durante tres semanas". Consulte Agentes de IA/Empleados de IA para saber cómo se incluye esto en una compilación y Cómo mantener la automatización de la IA segura y compatible con el RGPD para la mitad de este panorama relativa a la protección de datos.
Hablemos de tu flujo