Ciberseguridad · Seguridad MCP · 7 min

Tool poisoning: cuando una herramienta aparentemente confiable esconde instrucciones

Una herramienta puede incluir descripciones o resultados que orienten al modelo hacia acciones no esperadas. La revisión debe cubrir comportamiento, capacidades y cambios.

Tool poisoningMCPHerramientasRevisión de seguridad
Descripción, modelo y herramientaComparación entre lo que comunica una herramienta, lo que recibe el modelo y la acción que ejecuta. Comparar la intención declarada con la instrucción y el efecto observado.01Descripción visible02Instrucción al modelo03Efecto real
Descripción, modelo y herramientaComparar la intención declarada con la instrucción y el efecto observado.
Controles de revisiónFicha de control para revisar propósito, parámetros, permisos e identidad de una herramienta MCP. La aprobación requiere contexto de capacidades e identidad verificable.01Propósito02Entradas03Permisos04Versión05Resultado
Controles de revisiónLa aprobación requiere contexto de capacidades e identidad verificable.

Introducción

El término tool poisoning describe una clase de riesgo en la que contenido asociado a una herramienta —por ejemplo, su descripción o sus resultados— puede inducir al modelo a comportarse de forma distinta a la esperada. No significa que todas las herramientas MCP estén envenenadas ni que el protocolo fuerce ese comportamiento.

Por qué importa la descripción

El modelo puede recibir detalles de una herramienta que no se presentan con el mismo nivel de detalle a la persona usuaria. Una descripción ambigua, engañosa o que incluya instrucciones no relacionadas con la función declarada puede influir en la selección de herramientas y los datos que se les envían. Una pantalla de aprobación que muestre solo un nombre corto puede no permitir entender la operación solicitada.

La investigación de Invariant Labs de abril de 2025 popularizó el término y presentó experimentos sobre descripciones maliciosas y cambios posteriores de herramientas. Es evidencia de investigación sobre riesgos y configuraciones concretas, no una medida de prevalencia en todo el ecosistema ni un requisito normativo de MCP.

Revisar más que el nombre

Documenta la finalidad de cada herramienta, sus entradas, sus efectos y los datos a los que accede. Verifica que la descripción corresponda a su implementación y presenta al usuario argumentos y efectos materiales antes de una acción sensible. Mantén una aprobación ligada a una identidad y versión verificables del servidor y revisa cambios de esquema o comportamiento.

Limita capacidades, separa lectura de escritura, valida entradas y aplica autorización en el servicio que realiza la operación. Una descripción aparentemente benigna no sustituye controles técnicos; una confirmación tampoco ayuda si oculta los parámetros importantes.

Conclusión

Tool poisoning subraya un punto general: las herramientas y sus resultados son parte de la superficie de confianza. Evalúa el contenido que consume el modelo junto con el código, permisos y experiencia de aprobación.

Fuentes y rigor

Referencias

Referencias verificadas el 25 de septiembre de 2026. La especificación puede cambiar; comprueba las versiones vigentes antes de tomar decisiones de implementación.

Conclusión

Tool poisoning subraya un punto general: las herramientas y sus resultados son parte de la superficie de confianza. Evalúa el contenido que consume el modelo junto con el código, permisos y experiencia de aprobación.

Sigue explorando

Artículos relacionados