Antes de dejar que un agente de IA actúe por su cuenta, verifica nueve salvaguardas. Las primeras cuatro asignan a cada acción que el agente puede ejecutar una calificación de riesgo, para que las irreversibles, sensibles y costosas siempre se detengan a la espera de una persona. Las cinco siguientes confirman el entorno que contiene al agente cuando un filtro es engañado: una identidad de agente única, permisos de mínimo privilegio, un entorno aislado (sandbox), salida de red limitada y registros de auditoría a nivel de acción. El mapa de acciones te dice qué es seguro automatizar. El entorno es lo que de verdad sostiene la línea, porque los filtros de contenido en los que se apoyan la mayoría de las listas son la capa que falla justo cuando importa. Plantea las nueve como preguntas de sí o no, y si alguna respuesta es no o "no estamos seguros", el agente no está listo para operar sin supervisión.

Esta es la auditoría previa al lanzamiento que ejecutamos antes de dejar que un agente que construimos actúe por su cuenta dentro de otra empresa, redactada para que un propietario sin perfil técnico también pueda aplicarla, a su propio agente o al de un proveedor. Si prefieres que lo hagamos por ti, mira cómo gestionamos la gobernanza y el riesgo de IA responsable. Todo lo que sigue es tuyo para usar.

¿Cómo debo usar esta lista de verificación?

Trátala como una comprobación previa al despegue, no como una filosofía. Toma el agente que estás a punto de desplegar (o el que un proveedor te está vendiendo) y responde cada uno de los nueve puntos con un sí o un no rotundo. Un "más o menos" es un no. El objetivo es sacar a la luz las brechas antes de que el agente toque algo real.

Los nueve se dividen en dos grupos que hacen trabajos distintos:

  • Puntos 1 al 4 (el mapa de acciones). Estos deciden qué puede hacer el agente sin preguntar y qué debe detenerse para una persona. Es un juicio sobre el riesgo, y es la parte que la mayoría de las guías cubren.
  • Puntos 5 al 9 (el entorno). Estos limitan qué puede alcanzar y hacer el agente en absoluto, sin importar lo que se le haya indicado. Es la parte que la mayoría de las listas omiten, y es la parte que contiene a un agente cuando un filtro es engañado.

Ambos grupos importan, pero fallan de forma distinta. El mapa de acciones consiste en decidir correctamente. El entorno consiste en sobrevivir a una decisión equivocada. Necesitas los dos, porque ningún filtro lo atrapa todo: el clasificador de modo automático en producción de Anthropic, uno de los mejores que existen, todavía deja pasar alrededor del 17% de las acciones de agentes demasiado entusiastas, incluso ajustado para casi nunca bloquear un comando legítimo. Una tasa de error del 17% es aceptable con otra capa detrás y temeraria cuando es lo único que se interpone entre el agente y tu dinero.

Puntos 1 al 4: ¿has asignado a cada acción una calificación de riesgo?

No puedes bloquear lo que no has enumerado. Empieza por anotar cada acción que el agente puede ejecutar y luego califica cada una. La guía de agentes de OpenAI ofrece el método de calificación más limpio: puntúa cada acción como baja, media o alta según cuatro factores.

FactorPreguntaSeñal de alto riesgo
Acceso de escritura¿Solo lee, o cambia algo?Escribe, envía o elimina
Reversibilidad¿Se puede deshacer el resultado?No se puede revertir
Permisos de cuenta¿Qué acceso necesita para esto?Alcance de administrador, financiero o de datos de clientes
Impacto financiero¿Cuánto cuesta si sale mal?Dinero real, o pérdida de confianza

Salvaguarda 1: ¿Has enumerado cada acción y la has calificado como baja, media o alta? Si hay una acción en la lista que nadie calificó, esa es la que te hará daño. La calificación clasifica casi todo en tres categorías:

RiesgoEjemplosRegla
Bajo (solo lectura, reversible)Consultar un pedido, resumir un ticket, redactar una respuestaDéjala ejecutarse. Regístrala. Revísala después.
Medio (escribe, pero recuperable)Actualizar un registro, publicar una nota interna, crear un borradorPermítela dentro de límites estrictos. Avisa a una persona.
Alto (irreversible, sensible, costoso)Reembolso o pago, eliminar registros, conceder acceso, enviar un mensaje externoExige aprobación humana antes de ejecutarse. Siempre.

Salvaguarda 2: ¿Cada acción de alto riesgo se detiene para una aprobación humana explícita antes de ejecutarse? Esta es la única regla que evita los peores resultados. OpenAI nombra exactamente estas como las acciones que justifican la autorización humana: cancelar pedidos, autorizar reembolsos grandes y realizar pagos. Añade eliminaciones, concesiones de acceso y cualquier mensaje que salga de la organización. Un agente de reembolsos puede leer todos los pedidos que quiera, pero nunca debe mover dinero por encima de un umbral pequeño sin que una persona haga clic en aprobar.

Salvaguarda 3: ¿Es la barrera de aprobación lo bastante poco frecuente como para que la gente todavía la lea? La trampa es hacer que el agente pregunte por todo. Si lo haces, has construido un sistema peor, no uno más seguro. Anthropic midió que los usuarios aprueban cerca del 93% de las solicitudes de permiso, así que una barrera que se activa cuarenta veces al día es teatro: la persona está nominalmente en el bucle, pero ha dejado de mirar. Verifica tres cosas: que el agente solicite aprobación solo para acciones genuinamente arriesgadas, que la solicitud exprese la consecuencia en lenguaje claro ("Reembolsar 1.000 $ a la cuenta X") y que el silencio se interprete por defecto como "no", nunca como "sí".

Salvaguarda 4: ¿El agente se detiene y pide ayuda cuando sigue fallando? Un agente confundido que entra en bucle reintentando es su propia clase de riesgo. Establece un umbral de fallos, de modo que después de un número determinado de intentos fallidos el agente se detenga y escale en lugar de forcejear. OpenAI enumera exactamente dos detonantes para la intervención humana: superar los umbrales de fallo y las acciones de alto riesgo. Acabas de cubrir ambos.

Puntos 5 al 9: ¿has verificado el entorno que lo contiene?

Aquí está la parte que las listas genéricas omiten, y es la parte que hace el trabajo pesado. Los puntos 1 al 4 asumen que el agente decide correctamente. Los puntos 5 al 9 asumen que a veces no lo hará, y limitan el daño cuando eso ocurre.

La razón por la que este grupo importa es el hecho menos cubierto en la seguridad de agentes: los filtros de contenido fallan precisamente cuando la instrucción dañina parece legítima. Anthropic realizó una prueba en la que un empleado fue víctima de phishing, de modo que la instrucción maliciosa llegó desde el usuario de confianza al que el agente fue construido para servir. A lo largo de 25 reintentos, el agente completó el robo de credenciales 24 veces, porque, en sus palabras, cuando el usuario escribe la instrucción no hay nada anómalo que un clasificador pueda atrapar. Lo único que lo detuvo de forma fiable fue del entorno: bloquear la salida de red del agente para que los datos robados no tuvieran adónde ir. Los filtros adivinan la intención. El entorno elimina la capacidad. La capacidad es lo que de verdad puedes controlar.

Salvaguarda 5: ¿El agente tiene su propia identidad, no una clave de administrador compartida? Cada agente debe operar bajo una identidad única, nunca una credencial compartida y nunca el inicio de sesión de administrador de una persona. Una clave compartida significa que no puedes saber qué agente hizo qué, y un compromiso se propaga a todas partes adonde llegue esa clave. Una identidad única es también lo que hace significativo el registro de auditoría de la salvaguarda 9.

Salvaguarda 6: ¿Esa identidad está acotada al mínimo privilegio? El agente recibe el conjunto de permisos más estrecho que su trabajo realmente necesita, y nada más. Un agente de soporte que emite reembolsos no debería poder además exportar tu base de datos de clientes o modificar la nómina. Si lo engañan, el daño está acotado por lo que se le concedió, no por si un filtro atrapó el engaño. Usa el acceso menos potente que funcione: solo lectura es mejor que lectura y escritura, y lectura y escritura sin eliminación es mejor que acceso total.

Salvaguarda 7: ¿El agente se ejecuta en un entorno aislado (sandbox)? El agente debe operar dentro de un entorno aislado construido sobre un aislamiento establecido y probado en batalla (los mismos contenedores y sandboxes que se usan para ejecutar código no confiable), no algo improvisado a mano. Como señala Anthropic, esas primitivas han sobrevivido a mucha más atención adversaria que cualquier cosa que tú mismo construirías. Adecúa la contención al usuario también: un desarrollador que puede leer y ejecutar código y un agente de soporte que no puede no son el mismo modelo de amenaza, y cuanto más potentes sean las herramientas, más estrecha debe ser la caja.

Salvaguarda 8: ¿La salida de red del agente está limitada y acotada por capacidad? Este es el control que detuvo el ataque de phishing anterior. Pero una simple lista de "dominios permitidos" no basta por sí sola. Anthropic aprendió por las malas que los atacantes exfiltraron archivos a través de un dominio permitido enrutándolos hacia su propia cuenta en él, así que piensa en las reglas de salida como concesiones de capacidad (lo que el agente puede hacer) en lugar de solo una lista de direcciones que puede alcanzar.

Salvaguarda 9: ¿Se registra cada acción a nivel de acción para auditoría? No puedes gobernar lo que no puedes ver. Cada acción que el agente ejecuta, especialmente las de alto riesgo, debe registrarse con suficiente detalle para reconstruir qué ocurrió, quién o qué lo desencadenó y qué tocó. Los registros a nivel de acción son la forma de detectar un problema lento antes de que se convierta en titular, y la forma de afinar las otras ocho salvaguardas con el tiempo.

¿Cómo es la lista de verificación terminada?

Aquí están las nueve en un solo lugar, cada una formulada como un sí o un no que puedes verificar. Un no es una brecha que cerrar antes del lanzamiento, no una nota al pie.

#SalvaguardaPuedes lanzar cuando
1Inventario de acciones y calificación de riesgoCada acción está enumerada y calificada como baja, media o alta
2Barrera humana en acciones de alto riesgoCada acción irreversible o costosa se detiene para aprobación
3Aprobaciones poco frecuentes y en lenguaje claroLa barrera se activa solo ante riesgo real y por defecto dice "no"
4Escalado por umbral de fallosEl agente se detiene y pide ayuda tras fallos repetidos
5Identidad de agente únicaEl agente tiene su propia identidad, sin claves de administrador compartidas
6Permisos de mínimo privilegioSolo puede alcanzar lo que su trabajo necesita
7Entorno aislado (sandbox)Se ejecuta en infraestructura establecida y aislada
8Salida limitada y acotada por capacidadEl acceso de red está cercado, no es una lista abierta de dominios permitidos
9Registros de auditoría a nivel de acciónCada acción se registra y puede revisarse

Fíjate en la forma. Las primeras cuatro son decisiones que tomas sobre el riesgo; las últimas cinco son controles que integras en el entorno. Las primeras cuatro pueden ser engañadas. A las últimas cinco no se las puede convencer de no hacer su trabajo, por lo que son innegociables incluso cuando el modelo es excelente.

¿Cómo aplico esta auditoría al agente de un proveedor?

Las mismas nueve preguntas funcionan igual de bien con el agente de otra persona, y son la forma más rápida de distinguir un producto contenido de una demo segura de sí misma. Una demo demuestra que el agente funciona en un buen día. La lista demuestra qué ocurre en uno malo.

Pide al proveedor que responda esto en lenguaje claro:

  • ¿Cuáles de mis acciones requieren aprobación humana antes de ejecutarse? Un proveedor que no puede nombrarlas no las ha calificado.
  • ¿El agente recibe su propia identidad con acceso de mínimo privilegio, o usa una clave compartida hacia mis sistemas? La segunda respuesta es una señal de alarma.
  • ¿Está aislado en un sandbox, y qué puede alcanzar en la red? "Puede alcanzar internet" no es una respuesta.
  • ¿Se registra cada acción, y puedo ver esos registros? Si no puedes auditarlo, no puedes gobernarlo.
  • ¿Cuál es el radio de impacto si engañan al agente? La respuesta honesta es una lista de lo que puede tocar, no una promesa de que nunca lo engañarán.

Si las respuestas son vagas, o se apoyan por completo en "el modelo se comporta bien", el agente no está contenido, por buena que pareciera la demo. Un buen proveedor tendrá las respuestas listas, porque estas son las mismas preguntas que debería haberse hecho a sí mismo.

¿Por qué importa esto ahora?

Porque la brecha entre los equipos que pasan esta auditoría y los que la saltan está a punto de aparecer en las cifras. Gartner espera que más del 40% de los proyectos de IA agéntica se cancelen para finales de 2027, con controles de riesgo inadecuados entre las causas señaladas, y predice que para 2028 el 25% de las aplicaciones empresariales de IA generativa sufrirá al menos cinco incidentes de seguridad menores al año, frente al 9% en 2025. Las salvaguardas están pasando de ser un ajuste de configuración a un plano de control presupuestado, y la auditoría anterior es la forma de quedarte del lado correcto de ese cambio.

La parte alentadora es que nada de esto es exótico. Asigna a cada acción una calificación de riesgo y bloquea las irreversibles. Dale al agente su propia identidad con el menor acceso que necesite, en un entorno aislado, con la red cercada y cada acción registrada. Mantén la barrera humana lo bastante poco frecuente como para que la gente todavía la lea. Haz eso, y un atacante que se cuele más allá de tu filtro aún chocará con un muro de capacidad que nunca se le concedió.

Si quieres que estas nueve salvaguardas se construyan, verifiquen y operen por ti antes de que tu primer agente entre en funcionamiento, ese es exactamente el trabajo que hacemos dentro de los sistemas de otras empresas. Reserva una consulta gratuita abajo y aplicaremos esta lista de verificación a tu agente juntos.