¿Qué patrones están usando para separar planificación, ejecución, validación y memoria sin convertir el sistema en una cadena de prompts imposible de depurar?
Un agente no debería medirse solo por si “llega a una respuesta”, sino por si puede justificar sus decisiones, usar herramientas con límites y dejar trazabilidad de cada paso.