Guardarraíles y seguridad en agentes de IA

Un agente en producción recibirá antes o después una consulta diseñada para saltarse sus instrucciones. 🔥

También generará, en algún momento, una salida con el formato equivocado. 🔥🔥

En este capítulo del libro Agent Design Patterns exploramos los patrones de guardarraíles y seguridad en sistemas agénticos:

  • Guardarraíl de política (semántico): un LLM interpreta las normas y juzga el significado del contenido. Detecta jailbreaks, contenido dañino y temas fuera de dominio bloqueando la entrada del usuario.
  • Guardarraíl técnico (estructural): código Python que valida el formato de la salida con Pydantic. Detecta JSON mal formados, campos ausentes y tipos incorrectos reintentando la tarea si es necesario.

Además, analizamos dos implementaciones completas y comentadas paso a paso:

  • Con CrewAI, montamos un supervisor de política de contenido con doble guardarraíl
  • Con Google ADK, implementamos una barrera entre el agente y sus herramientas mediante before_tool_callback, que es una función que valida los argumentos antes de cada llamada y bloquea la ejecución si el identificador de usuario propuesto por el LLM no coincide con el registrado en la sesión.

¡Vamos a diseñar agentes seguros! 🚧

Guardarraíles en agentes de IA: cómo filtrar entradas y validar salidas con CrewAI y Google ADK

Membresía requerida

Este contenido está disponible únicamente para suscriptores.

Puedes apuntarte a la plataforma en este enlace

¿Ya eres un ninja? Accede aquí

Accede a todo el contenido premium

Ya no necesitas pagar cientos de euros por un Bootcamp para convertirte en ninja de los datos. Por solo 17€/mes (o menos 🤯), obtén acceso al podcast premium, a todos los tutoriales y a los resúmenes de los libros más top sobre Machine Learning y Ciencia de datos y aprende a tu ritmo.
¡Empieza ahora!
Copyright © 2026  · Datos 🥷 · Todos los derechos reservados