
60 Firmen in diesem Verzeichnis führen generative KI als eigene Leistung. 133 führen Integrationsarbeit. 22 führen beides, und der Abstand zwischen diesen drei Zahlen erklärt, warum so viele Projekte mit generativer KI Monate vor dem ersten nutzbaren Einsatz fertig aussehen.
Eine Agentur für Generative-KI-Integration verkauft den Teil, den niemand vorführt. Das Modell ist inzwischen die leichte Hälfte. Jedes kompetente Team kann etwas aufsetzen, das einen brauchbaren Entwurf schreibt, eine Frage aus einem Dokument beantwortet oder ein Gespräch zusammenfasst, und es binnen zwei Wochen vor der Geschäftsführung laufen lassen. Die schwere Hälfte ist alles, was zutreffen muss, bevor dasselbe System an vierhundert Mitarbeiter übergeben werden kann, die bei der Demo nicht dabei waren, die Anleitung nicht lesen werden und beim ersten selbstbewusst falschen Satz in Ihrer Support-Warteschlange landen.
60 Firmen, 22 Überschneidungen
Lesen Sie diese Verzeichniszahlen als Marktsignal und nicht als Statistik. Arbeit an generativer KI und Integrationsarbeit stehen in den Profilen als getrennte Spezialgebiete, weil sie das für die meisten Firmen tatsächlich sind. Ein Studio, das Content-Pipelines baut, beschäftigt Autoren, Prompt-Engineers und Designer. Eine Firma, die Systeme integriert, beschäftigt Leute, die Jahre mit Queues, Identity-Providern, Datenbankmigrationen und dem besonderen Elend einer Legacy-API hinter sich haben, die im Fehlerfall den Status 200 zurückgibt. Das sind zwei verschiedene Gehaltslisten.
22 Firmen tragen beide Labels, und einige davon tragen das zweite eher als Absichtserklärung. Die praktische Folge für einen Einkäufer: Die Agentur, die den beeindruckenden Proof of Concept gebaut hat, ist häufig nicht die Agentur, die ihn in den Produktivbetrieb bringen kann, und sie sagt das im Vertriebsgespräch selten von sich aus. Eine Agentur für Generative-KI-Integration ist die zweite Sorte, und das Wort Integration in ihrem Profil leistet echte Arbeit. Wie getrennt die beiden Spezialgebiete gelistet sind, sehen Sie, wenn Sie die Kategorie Generative KI und die Kategorie KI-Integration öffnen und die Firmen vergleichen, die jeweils erscheinen.
Die Demo lief auf einem bereinigten Export
Fast jeder Pilot mit generativer KI entsteht gegen eine aufgeräumte Stichprobe. Jemand hat einige Tausend Dokumente in einen Ordner gezogen, die mit Formatierungsproblemen entfernt und den Rest indexiert. Das daraus entstandene System beantwortet Fragen gut, weil die Fragen zu Dokumenten gestellt wurden, die man ausgewählt hat, weil sie beantwortbar sind.
Im Produktivbetrieb liegen die anderen Dokumente. Dort liegt der Vertrag zweimal unter leicht verschiedenen Namen, das gescannte Fax von 2011, die Tabelle, in der die eigentliche Information in einem Kommentar zu Zelle D14 steht, und das Richtliniendokument, das im vergangenen März durch eine E-Mail ersetzt wurde, die niemand indexiert hat. Dort gibt es auch Berechtigungen: Der Stichprobenordner hatte keine, und das Live-System darf einem externen Mitarbeiter in Ohio keine Gehaltsbeurteilung aus einem Verzeichnis liefern, das er nie öffnen sollte.
Integrationsarbeit ist die Stelle, an der diese beiden Realitäten zusammengebracht werden, und diese Zusammenführung verbraucht den größten Teil des Budgets. Dasselbe Muster zeigt sich in jeder Leistungskategorie auf dieser Seite, weshalb die Frage, was Sie unter dem Begriff individuelle KI tatsächlich kaufen, vor die erste Rechnung gehört und nicht dahinter.
Vier Ausfälle, die in Woche drei auftreten
Die Ausfälle sind vorhersehbar genug für eine Tabelle. Jeder von ihnen hat eine übliche technische Antwort, und ein Angebot, das sie nicht benennt, stammt nicht von jemandem, der ein solches System mit echten Nutzern betrieben hat.
| Was ausfällt | Wie es für einen Nutzer aussieht | Was das Angebot benennen sollte |
|---|---|---|
| Der Anbieter ist nicht erreichbar | Ein Ladesymbol, dann ein leeres Feld, während der Störung beim Anbieter und nicht bei Ihnen | Ein Pfad für zwischengespeicherte Antworten, eine Retry-Policy mit Backoff und ein sichtbarer eingeschränkter Zustand |
| Die Antwort ist selbstbewusst falsch | Einem Kunden wird die ersetzte Richtlinie genannt, und er handelt danach | Quellenangaben zurück auf die Ausgangsdokumente, ein Konfidenzschwellenwert und eine Prüfwarteschlange mit benanntem Verantwortlichen |
| Das Retrieval überschreitet eine Berechtigungsgrenze | Nichts, bis zu einem Audit oder einer Beschwerde | Zugriffskontrolle, die zum Zeitpunkt des Retrievals gegen Ihren Identity-Provider durchgesetzt wird und nicht nachträglich filtert |
| Der Anbieter wechselt das Modell | Die Ausgabequalität verschiebt sich über Nacht, ohne ein Deployment auf Ihrer Seite | Ein Evaluierungsset, das Ihnen gehört, nach festem Zeitplan ausgeführt, mit einer Anbieterabstraktion, die dünn genug zum Austauschen ist |
Die vierte Zeile unterschätzen Einkäufer regelmäßig. Ein System mit generativer KI hat eine Abhängigkeit, die sich ohne Rückfrage verändert, und das gilt für die konventionelle Software, auf die Ihr Einkaufsprozess ausgelegt wurde, gerade nicht. Das NIST AI Risk Management Framework behandelt laufende Messung als Kernfunktion und nicht als optionale Zugabe, und das ist der richtige Instinkt: Ein System, das Sie nicht erneut messen können, ist ein System, das Sie nicht pflegen können.
Wem gehört das Evaluierungsset
Stellen Sie diese Frage im ersten Gespräch und hören Sie genau auf die Form der Antwort.
Ein Evaluierungsset ist eine Sammlung echter Eingaben aus Ihrem Unternehmen, gepaart mit der Ausgabe, die eine sachkundige Person akzeptieren würde. Zweihundert davon reichen, um nützlich zu sein. Es ist das einzige Instrument, das Ihnen sagt, ob eine geänderte Prompt, eine neue Retrieval-Strategie oder ein Update beim Anbieter Ihr System besser oder schlechter gemacht hat, und es ist der Vermögenswert, dessen Aufbau am längsten dauert, weil sich jemand mit Fachwissen hinsetzen und die akzeptablen Antworten schreiben muss.
Es ist auch der Vermögenswert, der am häufigsten im Konto eines Anbieters zurückbleibt. Modellgewichte zählen weniger, als die meisten erwarten, da Anbieter sie ohnehin abkündigen und ersetzen. Das Evaluierungsset ist das, was überdauert, und eine Firma, die es behält, ist eine Firma, die Sie nicht verlassen können, ohne die Messarbeit bei null zu beginnen. Schreiben Sie die Eigentümerschaft in klaren Worten in den Vertrag, dazu den Speicherort und das Format, in dem Sie es exportieren können.

Was das Angebot beantworten muss
Fünf Dinge, und ein Angebot, dem eines davon fehlt, ist ein Angebot für einen Piloten und nicht für ein System:
- Der Ausfallpfad. Was ein Nutzer sieht, wenn der Anbieter ausgefallen ist, wenn das Retrieval nichts Relevantes zurückgibt und wenn die Konfidenz des Modells unter den Schwellenwert fällt. Drei getrennte Antworten, nicht eine.
- Das Berechtigungsmodell. Welches Identitätssystem darüber entscheidet, was ein bestimmter Nutzer abrufen darf, und ob diese Prüfung stattfindet, bevor die Dokumente das Modell erreichen, oder erst nachdem die Antwort erzeugt wurde. Nur das Erste ist vertretbar.
- Die Prüfwarteschlange. Wer die markierten Ausgaben liest, wie oft, und was diese Person ändern darf, wenn sich ein Muster zeigt. Eine Warteschlange ohne benannten Verantwortlichen ist eine Logdatei.
- Der Messplan. Wie das Evaluierungsset aufgebaut wird, wer die akzeptablen Antworten schreibt, wie oft es läuft und was passiert, wenn ein Wert fällt.
- Der Ausstieg. Was Sie in der Hand halten, wenn die Zusammenarbeit nächsten Monat endet, und ob Ihr eigenes Team das System ohne die Agentur im Raum betreiben und ändern kann.
Diese fünf wirken auch als Filter für Firmen. Eine Agentur, die alle fünf knapp und klar beantwortet, hat das schon gemacht. Eine Agentur, die die erste beantwortet und den Rest als Phase zwei behandelt, hat eine Demo schon gemacht. Eine Agentur für Generative-KI-Integration sollte alle fünf ohne Aufforderung bestehen. Beides sind legitime Geschäfte, und sie kosten unterschiedlich viel, was genau die Unterscheidung ist, die unser Leitfaden zu dem, was Integrationsagenturen tatsächlich liefern, ausführlicher zieht.
Eine Agentur für Generative-KI-Integration briefen
Der praktische Weg für die meisten Einkäufer besteht darin, die Suche nach der einen Firma für alles aufzugeben und klar zu benennen, welche Hälfte der Arbeit eingekauft wird. Drei Muster halten in der Praxis:
- Eine Firma, beide Hälften. Machbar, wenn die Firma beide Kompetenzprofile wirklich beschäftigt, was die 22 überschneidenden Profile als Minderheit ausweisen. Prüfen Sie das, indem Sie darum bitten, mit der Ingenieurin zu sprechen, die die Produktivstellung durchgeführt hat, und nicht mit der, die den Piloten gebaut hat.
- Ein Studio für den Bau, Ihr eigenes Team für die Integration. Sinnvoll, wenn Sie Plattform-Ingenieure bereits im Haus haben. Das Studio braucht einen schriftlich festgehaltenen Schnittstellenvertrag, und Ihr Team muss ab Woche eins im Raum sitzen, statt am Ende ein Repository überreicht zu bekommen.
- Eine Integrationsfirma führt, ein Spezialist arbeitet als Subunternehmer. Das Muster, das bei Systemen, die ein Audit überstehen müssen, am seltensten scheitert, weil die Firma, die für das Ergebnis haftet, diejenige ist, die Ihren Stack kennt.
Welches Muster Sie auch wählen, schreiben Sie die fünf Antworten von oben in das Leistungsverzeichnis, bevor Geld fließt. Forschung, die über die MIT Sloan Management Review veröffentlicht wurde, findet durchgehend, dass organisatorische und prozessuale Faktoren und nicht die Fähigkeit des Modells die Unternehmen trennen, die Wert aus KI ziehen, von denen, die immer noch pilotieren, und die fünf Fragen sind Prozessfragen.
Wenn Sie Firmen gegen Ihr eigenes Briefing vergleichen wollen, statt Verkaufsseiten zu lesen, beschreiben Sie Ihr Projekt auf der Matching-Seite, und das Verzeichnis ordnet die passendsten Profile nach den Leistungen, die jede Firma nennt, und nach ihrem Einsatzgebiet. Wenn Sie eine Agentur führen, die diese Arbeit macht, und Ihre Firma fehlt im Verzeichnis, tragen Sie Ihr Profil ein und nennen Sie Integration ausdrücklich, falls Sie sie leisten, denn Einkäufer filtern genau nach diesem Wort.
Quellen
- Die Listungszahlen für die Kategorien Generative KI und KI-Integration wurden am 5. Oktober 2026 aus der eigenen Datenbank dieses Verzeichnisses gelesen, und die Summen je Kategorie lassen sich gegen das Verzeichnis prüfen.
- NIST AI Risk Management Framework, zur laufenden Messung und Governance produktiv eingesetzter KI-Systeme.
- OWASP Top 10 for Large Language Model Applications, zu Risiken bei Retrieval und Berechtigungsgrenzen.
- MIT Sloan Management Review, zu den organisatorischen Faktoren, die produktiv eingesetzte KI von pilotierter KI trennen.
- Stanford HAI AI Index, als Hintergrund zu Verbreitung und Veröffentlichungsrhythmus von Modellen.
Weiterführend auf dieser Seite: die Wahl zwischen Anbietern generativer KI, was man über die KI-Leistungskategorien hinweg einkauft und die Checkliste für den ersten Einkauf.