Zum Hauptinhalt springen
Fugen Services logo

KI & Automatisierung

Fügen Sie KI zu Ihrem bestehenden Produkt hinzu, ohne es zu destabilisieren

Sie haben bereits ein Produkt, und es gibt einen offensichtlichen Platz, an dem KI dazugehört: Zusammenfassen eines langen Datensatzes, Entwurf einer ersten Antwort, Strukturierung dessen, was ein Nutzer eingegeben hat, oder Beantworten von Fragen anhand Ihrer eigenen Dokumentation. Die Funktion ist normalerweise in einer Woche umgesetzt. Sie kostengünstig, schnell, sicher und nicht abhängig von einem einzigen Anbieter zu machen, ist der Rest der Arbeit.

Richtwert

Ab £6.000

Fester Preis schriftlich vereinbart, bevor mit der Entwicklung begonnen wird.

Kostenangebot anfordern+44 7488 265083

Das Problem, das damit gelöst wird

Die naive Integration ist ein direkter API-Aufruf in einem Request-Handler. Sie ist langsam, sodass die UI einfriert. Sie hat keine Kostendeckelung, sodass ein ungewöhnlicher Monat zu einer unangenehmen Rechnung führt. Sie hat kein Fallback, sodass der Ausfall des Anbieters auch Ihr Ausfall ist. Und sie ist an das SDK eines einzigen Anbieters gekoppelt, sodass ein Wechsel eine Neuprogrammierung bedeutet.

Was Sie erhalten

Ein anbieterunabhängiger Layer

Eine interne Schnittstelle mit dahinterliegenden Adaptern, sodass Modell oder Anbieter per Konfiguration gewechselt werden können. In einem Bereich, in dem sich der Preis-Leistungs-Sieger alle paar Monate ändert, rechnet sich das schnell.

Streaming-Antworten

Tokens werden an die Oberfläche gestreamt, sobald sie verfügbar sind. Zehn Sekunden Wartezeit mit einem Ladezeichen wirken defekt; dieselben zehn Sekunden mit erscheinendem Text nicht.

Kostendeckel, die tatsächlich greifen

Pro Nutzer und pro Mandant Quoten, Token-Limits pro Anfrage sowie Ausgabenwarnungen. In Ihrem Code erzwungen, nicht nur im Dashboard des Anbieters, sodass eine Endlosschleife keine vierstellige Überraschung produzieren kann.

Caching, wo es sicher ist

Identische Anfragen werden aus dem Cache bedient, und Prompt-Caching wird genutzt, wo der Anbieter es unterstützt. Bei repetitiven Arbeitslasten halbiert sich der Preis oft.

Strukturierte Ausgabe, validiert

Wo die Funktion JSON benötigt, wird das Schema erzwungen und vor der Verwendung validiert, mit einem erneuten Versuch bei Abweichungen. Das Parsen von Text eines Modells mit regulären Ausdrücken ist der Grund, warum solche Funktionen in der Produktion scheitern.

Ein Evaluierungsset

Zwanzig bis fünfzig echte Eingaben mit den zugehörigen Ausgaben, die bei jeder Prompt- und Modelländerung ausgeführt werden. Ohne das ist die "Verbesserung des Prompts" bloße Spekulation und Regressionen schleichen sich unbemerkt ein.

Wie wir arbeiten

  1. Die richtige Funktion auswählen

    Wo ein LLM echten Mehrwert bietet und eine falsche Antwort verkraftbar ist. Wir werden gegen diejenigen argumentieren, die beides nicht erfüllen.

  2. Prototyp und Benchmark

    Zwei oder drei Modell- und Prompt-Kombinationen, gemessen an Ihren echten Eingaben nach Qualität, Latenz und Kosten pro Aufruf.

  3. Abstraktion erstellen

    Provider-Adapter, Streaming, Wiederholungen, Timeouts, Kontingente und Caching.

  4. In das Produkt integrieren

    Die Funktion selbst mit Lade-, Fehler- und Leerzuständen, die sich sinnvoll verhalten.

  5. Evaluieren und optimieren

    Prompts werden iterativ gegen den Evaluierungssatz getestet, bis Qualität und Kosten im Zielbereich liegen.

  6. Hinter einem Feature-Flag ausliefern

    Für einen Teil der Nutzer freigegeben, wobei Nutzung und Kosten überwacht werden, bevor es für alle verfügbar ist.

Was Sie erwarten sollten

  • Eine KI-Funktion im Produktivbetrieb, ohne den Rest des Produkts zu verlangsamen
  • Eine pro Mandant geltende Kostenobergrenze, die nicht überschritten werden kann
  • Anbieterwechsel durch Konfiguration statt durch Code-Änderungen
  • Prompt-Anpassungen werden gemessen statt geschätzt

Erstellt mit

  • Mistral
  • OpenAI
  • Anthropic Claude
  • Vercel AI SDK
  • TypeScript
  • Node.js
  • Python
  • PostgreSQL
  • pgvector
  • Redis
  • Next.js
  • Server-Sent Events

Mainstream, well-supported technology — chosen so you can hire for it and so another team could take the project over.

LLM-Integration — your questions

Einschließlich der Fragen zu den Kosten, die die meisten Agenturen auf der Seite auslassen.

Ein einzelnes gut abgegrenztes Feature in einem bestehenden Codebase kostet in der Regel £6.000 bis £15.000, einschließlich der Abstraktionsschicht, Kostenkontrolle und Evaluierungsdatensatz. Die Modellnutzung selbst ist meist ein kleiner monatlicher Betrag — die Entwicklung ist der Hauptkostenfaktor.

Das Modell, das in Ihrem Evaluierungsdatensatz am besten abschneidet – oft nicht das teuerste. Ein gut gepromptetes Modell mittlerer Preisklasse erreicht bei einer spezifischen Aufgabe häufig ähnliche Ergebnisse wie ein Spitzenmodell, aber zu einem Bruchteil der Kosten. Genau dafür ist der Benchmarking-Schritt da – und deshalb ist der Adapter wichtig.

Die Integration ist mit einem Timeout, einem erneuten Versuch und einem Fallback auf einen zweiten Anbieter ausgestattet – sofern die Funktion dies erfordert. Wo kein sinnvoller Fallback möglich ist, wird die Funktion sichtbar deaktiviert – mit einer klaren Meldung wie „Nicht verfügbar, bitte erneut versuchen“ – statt hängen zu bleiben oder einen 500-Fehler zu werfen.

Token-Limits pro Anfrage, Kontingente pro Nutzer und pro Mandant, Caching wiederholter Prompts sowie Ausgabenwarnungen. Alles wird in Ihrer Anwendung durchgesetzt, denn ein Anbieter-Dashboard zeigt Ihnen das Problem erst an, wenn es bereits eingetreten ist.

Nicht bei den API-Tarifen, die wir nutzen, und wir bestätigen die spezifischen Bedingungen schriftlich für Ihren gewählten Anbieter. Falls Ihre Kunden eine vertragliche Garantie benötigen, ist das eine Beschaffungsfrage, die wir Ihnen korrekt dokumentieren helfen – und es lohnt sich, dies vor der Veröffentlichung zu klären, nicht erst, wenn ein Kunde danach fragt.

Ja, das ist der übliche Fall für diesen Service. Wir halten uns an die bereits im Code verwendeten Konventionen, statt einen parallelen Stil einzuführen, und die Integration wird hinter einem Feature-Flag platziert, sodass sie ohne Deployment deaktiviert werden kann.

Sprechen Sie mit jemandem, der dies bereits entwickelt hat

A short call is usually enough to tell you whether this is the right service for your situation — including when it is not.