Saltar al contenido principal
Fugen Services logo

IA y Automatización

Añade IA al producto que ya tienes, sin desestabilizarlo

Ya tienes un producto y hay un lugar obvio donde la IA encaja: resumir un registro largo, redactar una primera respuesta, extraer estructura de lo que escribió un usuario o responder a partir de tu propia documentación. La función suele requerir una semana de trabajo. Hacerla barata, rápida, segura y no dependiente de un único proveedor es el resto.

Orientativo

Desde £6,000

Precio fijo acordado por escrito antes de comenzar cualquier desarrollo.

Solicitar presupuesto+44 7488 265083

El problema que resuelve

La integración ingenua es una llamada directa a la API en un controlador de solicitudes. Es lenta, por lo que la interfaz se bloquea. No tiene techo de coste, así que un mes inusual genera una factura desagradable. No tiene alternativa, por lo que la caída del proveedor es tu caída. Y está acoplada al SDK de un único proveedor, por lo que cambiar significa reescribir el código.

Qué obtendrá

Una capa independiente del proveedor

Una única interfaz interna con adaptadores detrás, para que cambiar de modelo o proveedor sea una cuestión de configuración. En un campo donde el líder en relación precio-rendimiento cambia cada pocos meses, esto se amortiza rápidamente.

Respuestas en tiempo real

Tokens transmitidos a la interfaz a medida que llegan. Esperar diez segundos con un spinner parece roto; los mismos diez segundos con texto apareciendo no.

Controles de coste vinculantes

Cuotas por usuario y por inquilino, límites de tokens por solicitud y alertas de gasto. Implementados en tu código, no en el panel del proveedor, para que un bucle descontrolado no genere una sorpresa de cuatro cifras.

Caché donde es seguro

Solicitudes idénticas servidas desde caché y uso de caché de prompts donde el proveedor lo soporte. En cargas de trabajo repetitivas, esto suele reducir el coste a más de la mitad.

Salida estructurada, validada

Donde la función necesita JSON, el esquema se aplica y valida antes de su uso, con un reintento en caso de error. Analizar el texto de un modelo con una expresión regular es como estas funciones se rompen en producción.

Un conjunto de evaluación

Entre veinte y cincuenta entradas reales con salidas esperadas, ejecutadas en cada cambio de prompt y modelo. Sin esto, "mejorar el prompt" es un trabajo de adivinación y los fallos se envían en silencio.

Cómo trabajamos

  1. Elegir la función correcta

    Donde un modelo de lenguaje grande aporta valor real y una respuesta incorrecta es recuperable. Nos opondremos a las que no cumplan ambos requisitos.

  2. Prototipar y evaluar

    Dos o tres combinaciones de modelo y prompt medidas con tus entradas reales para evaluar calidad, latencia y coste por llamada.

  3. Construir la abstracción

    Adaptador del proveedor, transmisión en tiempo real, reintentos, tiempos de espera, cuotas y caché.

  4. Integrar en el producto

    La función en sí, con estados de carga, error y vacío que se comporten de manera lógica.

  5. Evaluar y ajustar

    Prompts iterados contra el conjunto de evaluación hasta que calidad y coste queden equilibrados.

  6. Lanzar con bandera

    Publicado para un subconjunto de usuarios, con seguimiento de uso y coste antes de llegar a todos.

Qué esperar

  • Una función de IA en producción sin ralentizar el resto del producto
  • Límite de coste por inquilino que no puede superarse
  • Proveedor conmutable mediante configuración en lugar de reescritura
  • Cambios en los prompts medidos en lugar de estimados

Desarrollado con

  • Mistral
  • OpenAI
  • Anthropic Claude
  • Vercel AI SDK
  • TypeScript
  • Node.js
  • Python
  • PostgreSQL
  • pgvector
  • Redis
  • Next.js
  • Server-Sent Events

Mainstream, well-supported technology — chosen so you can hire for it and so another team could take the project over.

Integración de LLM — your questions

Incluyendo las preguntas sobre coste, que la mayoría de las agencias omiten en la página.

Una sola función bien definida en una base de código existente suele costar entre £6,000 y £15,000, incluyendo la capa de abstracción, controles de coste y conjunto de evaluación. El uso del modelo suele ser una pequeña cifra mensual: el coste principal es el desarrollo.

El que mejor resultados obtenga en tu conjunto de evaluación, que a menudo no es el más caro. Un modelo de gama media bien guiado suele igualar a un modelo de vanguardia en una tarea específica a una fracción del coste. Eso es exactamente lo que hace el paso de evaluación y por qué importa el adaptador.

La integración incluye un tiempo de espera, reintentos y una alternativa a un segundo proveedor cuando la función lo justifica. Donde no hay alternativa viable, la función se degrada de forma visible —un mensaje claro de "no disponible, inténtelo de nuevo"— en lugar de colgarse o devolver un error 500.

Límites de tokens por solicitud, cuotas por usuario y por inquilino, caché de prompts repetidos y alertas de gasto. Todo se aplica en tu aplicación, porque el panel del proveedor solo te avisa cuando el problema ya ha ocurrido.

No en las capas de API que utilizamos, y confirmamos los términos específicos por escrito con el proveedor elegido. Si tus clientes necesitan una garantía contractual, es una cuestión de contratación que ayudamos a documentar correctamente —y conviene resolverla antes de lanzar, no después de que un cliente lo pregunte.

Sí, ese es el caso habitual en este servicio. Seguimos las convenciones ya existentes en el código en lugar de introducir un estilo paralelo, y la integración se implementa tras una bandera de función para poder desactivarla sin necesidad de desplegar.

Habla con alguien que ya lo haya construido

A short call is usually enough to tell you whether this is the right service for your situation — including when it is not.