Saltar al contenido principal
Fugen Services logo

IA y Automatización

Agentes que realizan un trabajo, dentro de los límites que establezcas

Un agente es un modelo que puede llamar a tus herramientas: buscar algo, crear un registro, enviar un mensaje — y decidir cuál usar a continuación. Esto es realmente útil para trabajos multietapa demasiado variables para ser scriptados. También es el punto en el que un modelo de lenguaje deja de producir texto y comienza a realizar acciones en tu empresa, lo que cambia lo que significa "cuidadoso".

Orientativo

Desde £15,000

Precio fijo acordado por escrito antes de comenzar cualquier desarrollo.

Solicitar presupuesto+44 7488 265083

El problema que resuelve

Las demostraciones son impresionantes y los fallos en producción son aburridos: un agente que se queda en bucle, uno que usa la herramienta equivocada con seguridad, uno que tiene acceso de escritura a la base de datos porque era lo más fácil durante el desarrollo. Cada uno de estos es un problema de permisos y diseño, no de modelo.

Qué obtendrá

Herramientas con ámbito estrecho y explícito

Cada herramienta hace una sola cosa, valida sus entradas y tiene el mínimo acceso necesario. Ninguna herramienta general de "ejecutar SQL" — así es como un agente termina borrando algo.

Puntos de aprobación en acciones irreversibles

Todo lo que gaste dinero, contacte a un cliente o elimine datos se detiene para una persona. El agente propone; una persona confirma. Esta es la decisión de diseño más importante.

Límites de bucles y costes

Límites estrictos en pasos, tiempo real y gasto de tokens por tarea, aplicados fuera del modelo. No se puede confiar en que un agente decida cuándo ha hecho suficiente.

Registro de auditoría completo

Cada paso registrado: qué se le pidió, qué decidió, qué herramienta llamó con qué argumentos y qué respuesta recibió. Sin esto, un agente no es auditable, lo que lo hace inservible para la mayoría de trabajos regulados.

Evaluación antes del despliegue

Un conjunto de pruebas con tareas reales y resultados conocidos, ejecutado en cada cambio de prompt o modelo. Sin esto no se puede saber si un cambio mejoró las cosas o las rompió en silencio.

Fracaso controlado

Cuando el agente no puede completar una tarea, lo comunica y transfiere el trabajo con sus avances, en lugar de inventar un resultado plausible. La escalación es una característica, no un defecto.

Cómo trabajamos

  1. Definir el trabajo con precisión

    Una sola tarea, con una definición clara de finalización. Los agentes con ámbito de "ayudar en operaciones" fallan; los agentes con ámbito de "conciliar estos dos informes y marcar diferencias" funcionan.

  2. Diseñar la interfaz de herramientas

    El conjunto mínimo de herramientas, cada una con los permisos mínimos. Revisado antes de construir.

  3. Crear el conjunto de evaluación

    Tareas reales con resultados conocidos, escritas antes de que exista el agente.

  4. Construir con el registro de auditoría primero

    La observabilidad no se añade después a un agente — no se puede depurar uno sin ella.

  5. Modo sombra

    El agente propone cada acción y una persona la aprueba, durante el tiempo necesario para generar confianza en los resultados.

  6. Ampliar la autonomía con cuidado

    Primero se liberan acciones de bajo riesgo del proceso de aprobación, según la tasa de éxito medida. Las irreversibles pueden permanecer siempre restringidas, y a menudo deberían.

Qué esperar

  • Tarea de varios pasos completada de principio a fin sin intervención humana
  • Nada irreversible ocurre sin una aprobación previa
  • Toda decisión puede reconstruirse a partir del registro de auditoría
  • Los cambios en los prompts y modelos se miden frente a un conjunto de evaluación fijo

Desarrollado con

  • Mistral
  • Anthropic Claude
  • OpenAI
  • TypeScript
  • Python
  • PostgreSQL
  • pgvector
  • Redis
  • Temporal
  • RabbitMQ
  • Model Context Protocol
  • LangGraph

Mainstream, well-supported technology — chosen so you can hire for it and so another team could take the project over.

Desarrollo de agentes de IA — your questions

Incluyendo las preguntas sobre coste, que la mayoría de las agencias omiten en la página.

Un agente de propósito único con tres o cuatro herramientas, puntos de aprobación y un registro de auditoría suele costar entre £15,000 y £35,000. Los costes de ejecución dependen del volumen, pero suelen ser moderados: el gasto principal es la ingeniería alrededor del modelo, no el modelo en sí.

Un chatbot responde; un agente actúa. Un chatbot le dice a tu cliente la política de devoluciones. Un agente busca su pedido, verifica la elegibilidad, crea la devolución y reserva la recogida. El segundo necesita permisos, límites y un registro de auditoría, que es la mayor parte del trabajo.

Cuatro cosas, y ninguna es confiar en el modelo: herramientas que solo pueden realizar operaciones validadas y limitadas, puntos de aprobación para cualquier acción irreversible, límites estrictos en pasos y gastos aplicados en el código, y un registro de auditoría para que un error sea diagnosticable. Diseñamos asumiendo que el modelo se equivocará ocasionalmente, porque lo hará.

Para tareas estrechas y bien definidas con un humano en los pasos irreversibles, sí: los desarrollamos y ejecutamos. Para autonomía abierta sobre sistemas importantes, aún no, y lo diremos antes que venderte un piloto que acabe archivado en silencio.

Se restringe en lugar de eliminarse. Los datos provienen de tus sistemas a través de herramientas en lugar de la memoria del modelo, las salidas se validan frente a un esquema antes de usarse, y cualquier cosa no verificable se convierte en una escalada en lugar de una acción. Cualquier proveedor que prometa cero alucinaciones no entiende la tecnología.

Aquel que obtenga mejores resultados en tu conjunto de evaluación, detrás de un adaptador para poder cambiarlo. En la práctica, solemos usar Mistral o Claude para el uso de herramientas. Lo importante es que la elección se mida en función de tus tareas y sea reversible, ya que la clasificación cambia cada pocos meses.

Habla con alguien que ya lo haya construido

A short call is usually enough to tell you whether this is the right service for your situation — including when it is not.