Passer au contenu principal
Fugen Services logo

IA & Automatisation

Ajoutez de l'IA au produit que vous avez déjà, sans le déstabiliser

Vous avez déjà un produit, et il y a un endroit évident où l'IA a sa place : résumer un enregistrement long, rédiger une première réponse, extraire une structure à partir de ce qu'un utilisateur a saisi, répondre à partir de votre propre documentation. La fonctionnalité prend généralement une semaine de travail. Rendre cette fonctionnalité peu coûteuse, rapide, sûre et non dépendante d'un seul fournisseur est le reste du travail.

Indicatif

À partir de £6 000

Prix fixe convenu par écrit avant le début de la réalisation.

Demander un devis+44 7488 265083

Le problème que cela résout

L'intégration naïve consiste en un appel d'API direct dans un gestionnaire de requêtes. Elle est lente, donc l'interface se fige. Elle n'a pas de plafond de coût, donc un mois inhabituel produit une facture désagréable. Elle n'a pas de solution de repli, donc la panne du fournisseur est votre panne. Et elle est couplée au SDK d'un seul fournisseur, donc un changement implique une réécriture.

Ce que vous obtenez

Une couche indépendante du fournisseur

Une interface interne unique avec des adaptateurs derrière elle, permettant de changer de modèle ou de fournisseur par simple configuration. Dans un domaine où le leader en termes de rapport qualité-prix change tous les quelques mois, cet investissement se rentabilise rapidement.

Réponses en diffusion continue

Tokens transmis à l'interface au fur et à mesure de leur arrivée. Une attente de dix secondes avec un indicateur de chargement donne l'impression d'une panne ; les mêmes dix secondes avec du texte qui s'affiche ne donnent pas cette impression.

Contrôles de coûts contraignants

Quotas par utilisateur et par locataire, plafonds de tokens par requête, et alertes de dépenses. Appliqués dans votre code, et non laissés au tableau de bord du fournisseur, pour éviter qu'une boucle incontrôlée ne génère une facture surprise de plusieurs milliers de livres.

Mise en cache là où c'est sûr

Requêtes identiques servies depuis le cache, et mise en cache des prompts lorsque le fournisseur le permet. Sur des charges de travail répétitives, cela réduit souvent les coûts de plus de moitié.

Sortie structurée, validée

Lorsque la fonctionnalité nécessite du JSON, le schéma est appliqué et validé avant utilisation, avec une nouvelle tentative en cas d'inadéquation. Analyser le texte d'un modèle avec une expression régulière est la façon dont ces fonctionnalités échouent en production.

Un jeu d'évaluation

Vingt à cinquante entrées réelles avec leurs sorties attendues, testées à chaque modification de l’invite ou du modèle. Sans cela, « améliorer l’invite » relève de la spéculation et les régressions passent inaperçues.

Notre méthode de travail

  1. Choisir la bonne fonctionnalité

    Là où un modèle de langage apporte une réelle valeur ajoutée et où une mauvaise réponse reste récupérable. Nous nous opposerons aux cas où ce n’est ni l’un ni l’autre.

  2. Prototyper et évaluer

    Deux ou trois combinaisons modèle/invite mesurées sur vos entrées réelles pour la qualité, la latence et le coût par appel.

  3. Construire l’abstraction

    Adaptateur fournisseur, streaming, relances, délais d’attente, quotas et mise en cache.

  4. Intégrer au produit

    La fonctionnalité elle-même, avec états de chargement, d’erreur et de liste vide qui se comportent de manière cohérente.

  5. Évaluer et ajuster

    Les invites sont itérées sur l’ensemble d’évaluation jusqu’à ce que qualité et coût soient tous deux satisfaisants.

  6. Livrer derrière un drapeau

    Déploiement auprès d’un sous-ensemble d’utilisateurs, avec suivi des usages et des coûts avant généralisation.

Ce à quoi vous devez vous attendre

  • Une fonctionnalité IA en production sans ralentir le reste du produit
  • Un plafond de coût par locataire qui ne peut pas être dépassé
  • Fournisseur interchangeable par configuration plutôt que par réécriture
  • Les modifications des invites sont mesurées plutôt que devinées

Créé avec

  • Mistral
  • OpenAI
  • Anthropic Claude
  • Vercel AI SDK
  • TypeScript
  • Node.js
  • Python
  • PostgreSQL
  • pgvector
  • Redis
  • Next.js
  • Server-Sent Events

Mainstream, well-supported technology — chosen so you can hire for it and so another team could take the project over.

Intégration LLM — your questions

Y compris les questions relatives au coût, que la plupart des agences omettent sur leur site.

Une fonctionnalité bien délimitée dans un codebase existant coûte généralement entre £6 000 et £15 000, incluant la couche d’abstraction, les contrôles de coûts et le jeu de tests. L’utilisation du modèle représente généralement un petit coût mensuel — c’est l’ingénierie qui représente la majeure partie de la dépense.

Celui qui obtient les meilleurs résultats sur votre ensemble d'évaluation, ce qui n'est souvent pas le plus cher. Un modèle intermédiaire bien sollicité par des invites atteint fréquemment les performances d'un modèle de pointe sur une tâche spécifique, à une fraction du coût. C'est précisément l'objectif de l'étape de benchmarking, et la raison pour laquelle l'adaptateur est important.

L'intégration est conçue avec un délai d'attente, une tentative de reconnexion et une bascule vers un second fournisseur lorsque la fonctionnalité le justifie. Lorsqu'il n'existe pas de solution de repli pertinente, la fonctionnalité se dégrade de manière visible — un message clair indiquant "indisponible, réessayez plus tard" — plutôt que de rester bloquée ou d'afficher une erreur 500.

Des limites de jetons par requête, des quotas par utilisateur et par locataire, une mise en cache des invites répétées, et des alertes de dépenses. Tout est appliqué dans votre application, car le tableau de bord du fournisseur ne vous informe qu'après que le problème soit survenu.

Non sur les niveaux d'API que nous utilisons, et nous confirmons les conditions spécifiques par écrit pour le fournisseur choisi. Si vos clients ont besoin d'une garantie contractuelle, c'est une question d'approvisionnement que nous vous aidons à documenter correctement — et il est préférable de la régler avant le lancement, plutôt qu'après qu'un client ne pose la question.

Oui, c'est le cas le plus courant pour ce service. Nous respectons les conventions déjà en place dans le code plutôt que d'introduire un style parallèle, et l'intégration est ajoutée derrière un interrupteur de fonctionnalité, ce qui permet de la désactiver sans déploiement.

Parlez à quelqu'un qui l'a déjà développé

A short call is usually enough to tell you whether this is the right service for your situation — including when it is not.