Zum Hauptinhalt springen
Fugen Services logo

KI & Automatisierung

Agenten, die eine Aufgabe erledigen — innerhalb der von Ihnen gesetzten Grenzen

Ein Agent ist ein Modell, das Ihre Tools nutzen kann — etwas nachschlagen, einen Datensatz anlegen, eine Nachricht senden — und entscheidet, welches als Nächstes aufgerufen wird. Das ist wirklich nützlich für mehrstufige Aufgaben, die zu variabel für ein Skript sind. Gleichzeitig ist es der Punkt, an dem ein Sprachmodell aufhört, Text zu erzeugen, und beginnt, in Ihrem Unternehmen zu handeln — was bedeutet, dass sich die Bedeutung von „sorgfältig“ ändert.

Richtwert

Ab £15.000

Fester Preis schriftlich vereinbart, bevor mit der Entwicklung begonnen wird.

Kostenangebot anfordern+44 7488 265083

Das Problem, das damit gelöst wird

Die Demos sind beeindruckend, die Produktionsfehler langweilig: ein Agent, der in einer Schleife hängt, einer, der fälschlicherweise das falsche Tool nutzt, einer, der Schreibzugriff auf die Datenbank hat, weil das während der Entwicklung am einfachsten war. Jeder dieser Fälle ist ein Problem mit Berechtigungen und Design, kein Modellproblem.

Was Sie erhalten

Werkzeuge mit engem, explizitem Anwendungsbereich

Jedes Werkzeug erfüllt eine einzige Aufgabe, validiert seine Eingaben und verfügt über die minimal erforderlichen Zugriffsrechte. Kein allgemeines Tool wie "SQL ausführen" – so endet ein Agent damit, etwas zu löschen.

Freigabeschranken für irreversible Aktionen

Jede Aktion, die Geld ausgibt, einen Kunden kontaktiert oder Daten löscht, wird von einem Menschen gestoppt. Der Agent schlägt vor; eine Person bestätigt. Das ist die wichtigste Designentscheidung.

Schleifen- und Kostenlimits

Feste Obergrenzen für Schritte, Ausführungszeit und Token-Verbrauch pro Aufgabe, extern durchgesetzt. Ein Agent kann nicht selbst entscheiden, wann er genug getan hat.

Vollständige Prüfprotokollierung

Jeder Schritt wird dokumentiert: Was wurde angefragt, was wurde entschieden, welches Werkzeug mit welchen Parametern aufgerufen wurde und welche Antwort kam zurück. Ohne das ist ein Agent nicht prüfbar – und damit für die meisten regulierten Tätigkeiten unbrauchbar.

Bewertung vor dem Einsatz

Ein Testdatensatz mit realen Aufgaben und bekannten guten Ergebnissen, der bei jeder Prompt- oder Modelländerung durchlaufen wird. Ohne ihn lässt sich nicht feststellen, ob eine Änderung Verbesserungen gebracht oder stillschweigend Fehler verursacht hat.

Ausfallmanagement

Kann der Agent eine Aufgabe nicht abschließen, teilt er dies mit und übergibt seine Arbeitsergebnisse – statt eine plausible Lösung zu erfinden. Eskalation ist ein Feature, kein Defekt.

Wie wir arbeiten

  1. Aufgabe präzise definieren

    Eine einzelne Aufgabe mit klarer Definition des Abschlusskriteriums. Agenten mit dem Anwendungsbereich "Unterstützung bei Abläufen" scheitern; Agenten mit dem Anwendungsbereich "Diese beiden Berichte abgleichen und Abweichungen markieren" funktionieren.

  2. Oberfläche der Werkzeuge gestalten

    Die minimale Menge an Werkzeugen, jedes mit den minimal erforderlichen Berechtigungen. Vor der Entwicklung überprüft.

  3. Bewertungsdatensatz erstellen

    Reale Aufgaben mit bekannten Ergebnissen, die vor der Entwicklung des Agenten erstellt werden.

  4. Auditprotokollierung von Anfang an einbauen

    Observability wird nicht nachträglich hinzugefügt – ohne sie lässt sich ein Agent nicht debuggen.

  5. Shadow-Modus

    Der Agent schlägt jede Aktion vor und ein Mensch bestätigt jede einzelne – so lange, bis Vertrauen in die Ergebnisse besteht.

  6. Autonomie schrittweise erweitern

    Zuerst werden risikoarme Aktionen von der Freigabe befreit, basierend auf der gemessenen Erfolgsquote. Irreversible Aktionen bleiben oft dauerhaft gesperrt – und sollten es auch.

Was Sie erwarten sollten

  • Eine mehrstufige Aufgabe, die ohne menschliches Eingreifen vollständig abgeschlossen wird
  • Keine irreversiblen Vorgänge ohne vorherige Genehmigung
  • Jede Entscheidung ist aus dem Prüfprotokoll rekonstruierbar
  • Prompt- und Modelländerungen werden anhand eines festen Evaluierungssatzes gemessen

Erstellt mit

  • Mistral
  • Anthropic Claude
  • OpenAI
  • TypeScript
  • Python
  • PostgreSQL
  • pgvector
  • Redis
  • Temporal
  • RabbitMQ
  • Model Context Protocol
  • LangGraph

Mainstream, well-supported technology — chosen so you can hire for it and so another team could take the project over.

KI-Agent-Entwicklung — your questions

Einschließlich der Fragen zu den Kosten, die die meisten Agenturen auf der Seite auslassen.

Ein spezialisierter Agent mit drei oder vier Tools, Freigabeschritten und einem Prüfprotokoll kostet in der Regel £15.000 bis £35.000. Die Betriebskosten hängen vom Volumen ab, sind aber meist gering — der Aufwand liegt in der Entwicklung, nicht im Modell.

Ein Chatbot antwortet; ein Agent handelt. Ein Chatbot teilt Ihrem Kunden die Rückgabebedingungen mit. Ein Agent sucht die Bestellung, prüft die Berechtigung, erstellt die Rückgabe und bucht die Abholung. Der zweite Fall erfordert Berechtigungen, Grenzen und ein Prüfprotokoll – das ist der Großteil der Arbeit.

Vier Dinge – und keines davon ist Vertrauen in das Modell: Tools, die nur eng definierte, validierte Vorgänge ausführen können, Genehmigungsschranken für irreversible Schritte, harte Grenzen für Schritte und Ausgaben, die im Code erzwungen werden, sowie ein Prüfprotokoll, sodass sich Fehler nachvollziehen lassen. Wir planen unter der Annahme, dass das Modell gelegentlich falsch liegt – weil es das tun wird.

Für eng definierte Aufgaben mit klaren Grenzen und einem Menschen für irreversible Schritte: ja – wir entwickeln und betreiben solche Systeme. Für offene Autonomie über wichtige Systeme: noch nicht, und wir würden Ihnen keinen Pilotversuch verkaufen, der später stillschweigend eingestellt wird.

Sie begrenzen das Modell, statt es zu eliminieren. Fakten stammen aus Ihren Systemen über Tools statt aus dem Modellgedächtnis, Ausgaben werden vor der Nutzung anhand eines Schemas validiert, und alles, was sich nicht verifizieren lässt, wird eskaliert statt ausgeführt. Jeder Anbieter, der null Halluzinationen verspricht, versteht die Technologie nicht.

Welches Modell in Ihrem Evaluierungsset am besten abschneidet, hinter einem Adapter, sodass es ausgetauscht werden kann. In der Praxis verwenden wir meist Mistral oder Claude für die Tool-Nutzung. Entscheidend ist, dass die Wahl anhand Ihrer Aufgaben gemessen und rückgängig gemacht werden kann, da sich die Bestenlisten alle paar Monate ändern.

Sprechen Sie mit jemandem, der dies bereits entwickelt hat

A short call is usually enough to tell you whether this is the right service for your situation — including when it is not.