Ciberseguridad · Seguridad MCP · 7 min
Prompt injection indirecta: cómo una respuesta externa puede manipular a un agente
Un agente puede interpretar como instrucciones contenido que llegó como dato. La defensa requiere separar autoridad, limitar capacidades y controlar acciones.
Introducción
En una inyección directa, el usuario presenta instrucciones no confiables. En la indirecta, estas llegan dentro de contenido que el agente consulta: un documento, una página, un ticket o una respuesta de herramienta. La amenaza no depende de una función exclusiva de MCP; aparece cuando contenido externo entra en el contexto de un sistema que puede tomar acciones.
Datos que parecen instrucciones
Supongamos que un agente consulta un documento para resumirlo. El texto puede incluir una indicación dirigida al propio agente, como ignorar el objetivo original o intentar compartir información. El contenido podría ser visible o estar mezclado con material legítimo. El modelo puede tener dificultades para distinguir la instrucción del usuario de la instrucción incrustada en la fuente.
“Marcar el texto como no confiable” puede ayudar a estructurar el procesamiento, pero no constituye por sí solo una barrera de seguridad. Tampoco hay una sanitización general que garantice que cualquier instrucción maliciosa desaparecerá sin afectar contenido útil.
Mitigaciones en capas
Mantén separadas, en el diseño de la aplicación, las instrucciones de control y los datos recuperados; trata estos últimos como entrada no confiable.
Restringe las herramientas disponibles a las necesarias para la tarea. Un agente que resume un archivo no necesita por defecto permiso para enviar mensajes o modificar otros recursos.
Aplica autorización y validación en el servidor y en el servicio que ejecuta la acción, no solo en el prompt. Solicita confirmación clara para acciones sensibles y muestra qué se enviará, a quién y con qué efecto.
Limita el alcance de datos que el modelo puede leer y compartir. Supervisa llamadas, errores y cambios de contexto sin registrar secretos innecesarios. Prueba con contenido adversarial controlado en un entorno autorizado y registra si los controles detienen la acción, no solo si el modelo “responde bien”.
Conclusión
La inyección indirecta es un problema de interacción entre contenido no confiable y autoridad de acción. La mitigación efectiva no consiste en confiar en un prompt perfecto, sino en reducir capacidades, imponer controles externos y limitar el impacto de un error.
Fuentes y rigor
Referencias
- MCP Security Best Practices
- OWASP MCP Top 10, MCP06:2025 — proyecto vivo
Proyecto comunitario en evolución; no es una norma oficial de MCP.
Referencias verificadas el 25 de septiembre de 2026. La especificación puede cambiar; comprueba las versiones vigentes antes de tomar decisiones de implementación.
Conclusión
La inyección indirecta es un problema de interacción entre contenido no confiable y autoridad de acción. La mitigación efectiva no consiste en confiar en un prompt perfecto, sino en reducir capacidades, imponer controles externos y limitar el impacto de un error.
Sigue explorando