Leistung
KI-Integrationsleistungen
Dort eingesetzt, wo sie Arbeit abnimmt, nicht wo sie sich gut vorführen lässt.
Für Teams, die KI innerhalb der Systeme wollen, die sie ohnehin betreiben, und zwar für konkrete Aufgaben: Dokumente lesen, Eingehendes klassifizieren, Fragen über die eigenen Daten beantworten, Entwürfe vorbereiten, die danach ein Mensch freigibt. Gebaut mit Evaluierung und Kostenkontrolle, denn eine Funktion, die niemand messen kann, ist eine Funktion, der niemand trauen kann.
Die Entscheidung
Wann das die richtige Wahl ist.
Die meisten KI-Funktionen scheitern auf dieselben zwei Arten. Sie werden dort eingebaut, wo sie sichtbar sind, statt dort, wo sie Zeit sparen, und sie gehen live, ohne dass man wissen kann, ob ihre Ausgabe stimmt. Eine Zusammenfassung, die in einem von zwanzig Fällen falsch liegt, ist schlechter als gar keine, denn der zwanzigste Fall ist der, der beim Kunden landet.
Das zweite Scheitern sind Kosten und Latenz, die erst im Betrieb auffallen. Ein Prompt, der im Test in Ordnung ist, wird bei zehntausend Aufrufen am Tag teuer, und eine Funktion mit neun Sekunden wird nicht genutzt, so gut sie auch sein mag. Beides sind Designvorgaben, beide früh günstig zu behandeln und später mühsam nachzurüsten.
Wir beginnen bei der Aufgabe statt bei der Technik: Was wird von Hand erledigt, wie oft, und was kostet es, wenn es falsch ist. Dann bauen wir vor der Funktion eine Evaluierungsmenge, damit die Frage, ob sie funktioniert, eine Antwort hat. Oft stellt sich heraus, dass es gar kein Modell braucht, und das sagen wir dann.
Was Sie bekommen
Was die Arbeit umfasst.
Dokumentenextraktion
Rechnungen, Bestellungen, Auszüge und Formulare werden in strukturierte Felder gelesen, mit sichtbarer Konfidenz, damit unsichere Fälle zu einem Menschen gehen statt still durchzulaufen.
Klassifizierung und Routing
Eingehende Anfragen, Tickets und Dokumente landen in der richtigen Warteschlange, mit nachvollziehbaren statt undurchsichtigen Regeln.
Suche über Ihre eigenen Daten
Suche über Ihre Dokumente und Datensätze, die ihre Quellen nennt, damit eine Antwort geprüft statt geglaubt werden kann.
Entwürfe mit menschlicher Freigabe
Antworten, Zusammenfassungen und Beschreibungen werden zur Freigabe durch einen Menschen vorbereitet. Das Freigabetor ist eine Designentscheidung, kein Haftungsausschluss.
Evaluierung vor dem Launch
Eine gelabelte Menge und eine gemessene Trefferquote, damit eine Prompt- oder Modelländerung ein Vergleich wird statt einer Vermutung.
Kosten- und Latenzkontrolle
Caching, Modell-Routing nach Schwierigkeit und Budgetwarnungen, denn Preise pro Aufruf werden zu einer Monatsrechnung, die niemand eingeplant hat.
Stack
Womit wir es bauen.
Je Projekt gewählt. Nichts davon wird standardmäßig gesetzt, und das Team, das es pflegen wird, wiegt so schwer wie das Problem.
Modelle
Claude, GPT oder ein Open-Weight-Modell, je Aufgabe nach gemessener Qualität und Kosten gewählt statt nach Marke.
Retrieval
PostgreSQL mit pgvector, wo das genügt, ein dedizierter Vektorspeicher, wo der Umfang es rechtfertigt.
Orchestrierung
Bevorzugt schlichter, lesbarer Code. Schwergewichtige Agenten-Frameworks nur, wenn sie ihre Debugging-Kosten wieder einspielen.
Evaluierung
Versionierte Testmengen, die in der Pipeline laufen, damit eine Regression in der CI auffällt und nicht beim Kunden.
Datenschutz
Datenstandort, Aufbewahrung und Schwärzung werden vor dem ersten Aufruf entschieden, einschließlich der Frage, ob eine Anfrage Ihre Infrastruktur überhaupt verlassen darf.
Vergleich
Aufgesetzte KI oder KI, die sich ihren Platz verdient.
Die meisten KI-Funktionen scheitern auf dieselben zwei Arten: Sie werden dort eingebaut, wo sie sichtbar sind, statt dort, wo sie Zeit sparen, und sie gehen live, ohne dass man wissen kann, ob ihre Ausgabe stimmt.
| Aspekt | Typisch aufgesetzte KI | Wie wir es bauen |
|---|---|---|
| Wohin es führt | Wo es sich gut vorführen lässt — ein Chatfenster auf dem Dashboard | Dort, wo die Handarbeit tatsächlich liegt, was meist unspektakulär ist |
| Wissen, dass es funktioniert | Jemand hat es ein paar Mal ausprobiert und es wirkte in Ordnung | Eine gelabelte Menge aus Ihren echten Fällen, mit gemessener Trefferquote vor dem Launch |
| Wenn es unsicher ist | Antwortet trotzdem, mit derselben Sicherheit wie wenn es richtig liegt | Alles unterhalb Ihrer Schwelle geht an einen Menschen, und die Schwelle setzen Sie. |
| Kosten | Zeigt sich auf der ersten Monatsrechnung | In der Discovery geschätzt, mit Caching, Modell-Routing und Budgetwarnung |
| Latenz | Zeigt sich im Betrieb, woraufhin die Funktion leise nicht mehr genutzt wird | Eine Designvorgabe mit einer Zahl, denn eine Funktion mit neun Sekunden wird nicht genutzt |
| Prompt oder Modell ändern | Eine Änderung, die niemand bewerten kann, wagt niemand vorzunehmen | Ein gemessener Vergleich gegen dieselbe Testmenge, ausgeführt in der CI |
Wie es abläuft
Vom ersten Gespräch bis live.
Richtwerte für Arbeit dieser Art. Der Pilot ist nicht optional — nichts wird umgestellt, bevor die Nutzer sagen, dass es trägt.
- 1 Woche
Die Arbeit finden
Was wird von Hand erledigt, wie oft, und was kostet es, wenn es falsch ist. Manchmal ist die Antwort eine Regel oder ein besseres Formular, und das sagen wir dann.
- 1 Woche
Die Evaluierungsmenge aufbauen
Echte Fälle, gelabelt, bevor die Funktion existiert. Ohne das gibt es keine Möglichkeit, eine Verbesserung von einer Verschlechterung zu unterscheiden.
- 3-5 Wochen
Bauen und messen
Die Integration, das menschliche Freigabetor, Caching und Kostenkontrolle, bei jeder Änderung gegen dieselbe Menge gemessen.
- 2-3 Wochen
Pilot und Feinabstimmung
Live auf einem Teil des echten Volumens, mit konservativ gesetztem Freigabetor, das erst gelockert wird, soweit die gemessenen Zahlen es rechtfertigen.
Nach dem Launch
Was sich ändert.
- Der manuelle Schritt, für dessen Abschaffung sie gebaut wurde, fällt wirklich weg statt nur ergänzt zu werden.
- Fälle mit geringer Sicherheit erreichen einen Menschen, statt still durchzulaufen, und genau das macht die Funktion unbeaufsichtigt betreibbar.
- Eine Prompt- oder Modelländerung wird zum Vergleich statt zum Glücksspiel.
- Die Monatsrechnung ist eine Zahl, die jemand vorhergesagt hat, keine Überraschung.
Bewusst qualitativ beschrieben. Wir veröffentlichen keine Prozentangaben, die wir nicht einem namentlich genannten Kunden mit dessen Zustimmung zuordnen können.
Fragen
Häufige Fragen.
Werden unsere Daten zum Training fremder Modelle verwendet?
Nicht in den Konfigurationen, die wir einsetzen. Enterprise-API-Bedingungen schließen Training auf übermittelten Daten aus, und wo das nicht akzeptabel ist, betreiben wir stattdessen ein Open-Weight-Modell auf Ihrer eigenen Infrastruktur. Das wird vor jeder Integration entschieden.
Woher wissen Sie, dass die KI richtig liegt?
Wir bauen vor dem Ausliefern eine gelabelte Evaluierungsmenge aus Ihren echten Fällen und messen dagegen. Alles unterhalb der vereinbarten Schwelle geht an einen Menschen statt weiterzulaufen, und die Schwelle setzen Sie.
Was kostet der Betrieb?
Das hängt vom Volumen und vom gewählten Modell ab, und wir schätzen es in der Discovery statt nach dem Launch. Caching, einfache Fälle an günstigere Modelle zu leiten und eine monatliche Budgetwarnung gehören zum Projekt.
Brauchen wir überhaupt KI?
Oft nicht. Eine gut platzierte Regel, ein besseres Formular oder ein fester Bericht löst einen überraschenden Teil dessen, was als KI-Problem aufgesetzt wird, zu einem Bruchteil der Kosten und ohne jede Unsicherheit. Wenn das so ist, sagen wir es Ihnen.
Können Sie ein Modell auf unserer eigenen Infrastruktur betreiben?
Ja, mit einem Open-Weight-Modell, wo Datenstandort oder vertragliche Bedingungen es verlangen. Der Tausch ist Qualität und Betriebsaufwand gegen Kontrolle, und er sollte an gemessenen Ergebnissen für Ihre konkrete Aufgabe entschieden werden statt am Prinzip.
Was, wenn die KI vor einem Kunden etwas falsch macht?
Genau dafür gibt es das menschliche Freigabetor und die Konfidenzschwelle, und beides sind Designentscheidungen vor dem Ausliefern, kein nachträglicher Haftungsausschluss. Wo ein Fehler teuer ist, lautet die richtige Einstellung: Entwurf zur Freigabe und niemals unbeaufsichtigtes Handeln.