Ein KI-Agent kann Anfragen schneller bearbeiten, Dokumente ordnen oder nächste Schritte vorbereiten. Eine belastbare Einführung beginnt mit einem Prozess, einer verantwortlichen Person, einem messbaren Ergebnis und klaren Grenzen — nicht mit Modellwahl oder Show-Demo.

Der wichtigste Grundsatz: Das erste Pilotprojekt bleibt klein, umkehrbar und beobachtbar. Der Agent arbeitet zunächst mit Kopien oder Testdaten, schlägt unumkehrbare Schritte nur vor, und ein Mensch genehmigt Vorgänge mit finanziellen, rechtlichen, personellen oder kundenbezogenen Folgen.

Agent, Chatbot und Automatisierung sind nicht dasselbe

Ein Chatbot antwortet im Dialog aus Anweisungen und Wissen. Er kann ein Angebot erklären oder eine Arbeitsanweisung finden, handelt aber nicht automatisch in Geschäftssystemen.

Eine klassische Automatisierung folgt einem festen Ablauf: Rechnung speichern, Felder auslesen, Regeln prüfen und weiterleiten. Sie passt zu vorhersehbaren Eingaben und Ausnahmen.

Ein KI-Agent erhält Ziel, Kontext und begrenzte Werkzeuge. Er kann Schritte wählen, Informationen suchen, Inhalte entwerfen, Funktionen aufrufen oder um Freigabe bitten. Mehr Freiheit und Rechte erfordern engere Grenzen und Aufsicht.

Den richtigen ersten Prozess wählen

Ein guter Kandidat tritt häufig auf, kostet Zeit, ist wiederholbar und hat ein erkennbar korrektes Ergebnis. Starten Sie nicht mit Abläufen, bei denen ein Fehler selbstständig Geld überweisen, Verträge schließen, Daten löschen oder Kunden aussperren könnte.

Vergleich von Prozessen für ein KI-Agenten-Pilotprojekt
ProzessRolle der KI im PilotprojektBeispiel-KPISicherheitsgrenze
Anfragen aus Formular und E-MailKlassifizieren, zusammenfassen, Antwort entwerfenZeit bis zur ersten Antwort, Kategoriengenauigkeit, KorrekturenVersand erst nach Freigabe durch Mitarbeitende
LieferantendokumenteFelder auslesen, Lücken markieren, Eintrag vorbereitenBearbeitungszeit, Feldgenauigkeit, AusnahmenKeine selbstständige Buchung oder Zahlung
Interne WissensbasisMit Link zur passenden Arbeitsanweisung antwortenAntworten mit Quelle, Sucherfolg, Nutzerbewertung„Ich weiß es nicht“ ohne verlässliche Quelle
AngebotserstellungAngaben sammeln und Arbeitsentwurf erstellenErstellungszeit, Vollständigkeit, KorrekturenPreis, Bedingungen und Versand werden freigegeben
Service-TicketsPriorität, Zusammenfassung und nächsten Schritt vorschlagenZeit für Triage, Übereinstimmung der Priorität, LösungszeitKein Schließen und keine Produktionsänderung ohne Zustimmung

Messen Sie Bearbeitungszeit, Fallzahl, Korrekturkosten und Ausnahmen. Ohne Ausgangswert zeigt der Pilot nicht, ob Arbeit entfällt oder nur zur Kontrolle der KI-Antwort verschoben wird.

Ein Pilotprojekt in sechs Etappen

1. Ergebnis und Verantwortung festlegen

Dokumentieren Sie Grenzen, Verantwortung, Nutzende, korrektes Ergebnis und Ausschlüsse. Wählen Sie zwei oder drei KPI und eine Fehlergrenze. „Im Büro helfen“ ist nicht messbar; kürzere Ticket-Triage bei festgelegter Qualität ist es.

2. Daten und Ausnahmen abbilden

Klären Sie Herkunft, Zugriff, Aufbewahrung sowie personenbezogene Daten und Geschäftsgeheimnisse. Testen Sie normale, unvollständige, widersprüchliche, mehrsprachige und absichtlich irreführende Fälle. Entfernen Sie unnötige Daten.

3. Minimale Berechtigungen entwerfen

Jedes Werkzeug erhält einen engen Zweck: Lesen braucht kein Schreibrecht und ein Entwurf kein Versendrecht. Nutzen Sie eine eigene technische Identität, beschränken Sie Vorgänge und halten Sie Zugangsdaten aus Prompts und Protokollen heraus.

4. Menschliche Freigabe einbauen

Zunächst schlägt der Agent vor; ein Mensch genehmigt, ändert oder verwirft. Zeigen Sie Quelle, Aktion und Folge. Eine pauschale Freigabe verborgener Aktionen ist keine wirksame Kontrolle. Autonomie wächst erst nach Tests risikoarmer Vorgänge.

5. Qualität, Sicherheit und Fehlerfälle testen

Testen Sie mehr als normale Anfragen. Eine E-Mail, Webseite oder Datei kann Text enthalten, der den Agenten zum Missachten seiner Aufgabe auffordert — eine Form der Prompt Injection. Behandeln Sie externe Inhalte als nicht vertrauenswürdig, trennen Sie Anweisungen von Daten, begrenzen Sie Werkzeuge und validieren Sie Parameter. Simulieren Sie Modell- und API-Ausfälle, Limits, Duplikate und Unterbrechungen während eines Vorgangs.

6. Begrenzten Betrieb starten und entscheiden

Beginnen Sie mit einer kleinen Nutzergruppe oder einem Teil der Fälle. Erfassen Sie Ergebnis, Konfigurationsversion, genutzte Belege, Werkzeugaufrufe, menschliche Entscheidung und Fehler, ohne unnötig vertrauliche Inhalte zu speichern. Vergleichen Sie KPI mit dem Ausgangswert, berücksichtigen Sie Kontrollarbeit und untersuchen Sie Vorfälle. Danach wird erweitert, überarbeitet oder beendet.

Kontrollen, die früh dazugehören

  • Daten: Minimierung, Aufbewahrungsregeln, angemessene Verschlüsselung und eine Liste zulässiger Quellen.
  • Berechtigungen: eigene Identität, geringstmöglicher Zugriff, Limits für Anzahl und Wert von Aktionen sowie zuverlässige Abschaltung.
  • Menschliche Freigabe: Pflicht bei weitreichenden Aktionen und eine klare Vorschau auf den tatsächlichen Vorgang.
  • Protokolle: nachvollziehbare Entscheidungen und Werkzeugaufrufe, geschützter Zugriff und festgelegte Aufbewahrung.
  • Rückfallweg: Übergabe an Menschen, sichere Antwort bei Unsicherheit und Verfahren bei Ausfall von Modell oder Integration.
  • Prompt Injection: Befehlen in externen Inhalten nicht vertrauen, Daten von Anweisungen trennen und Aktionen validieren.
  • Excessive Agency: Funktionen, Rechte, Datenumfang und Autonomie so begrenzen, dass ein Modellfehler keinen breiten Schaden auslöst.

Woraus bestehen die Kosten?

Ohne Prozess und Arbeitsvolumen gibt es keinen seriösen Preis für „einen KI-Agenten“. Zum Einführungsbudget können Prozessanalyse, Daten- und Wissensaufbereitung, Integrationsentwurf, Entwicklung, Tests, Schutzmaßnahmen, Schulung und Inbetriebnahme gehören. Laufende Kosten hängen möglicherweise von Anfragen und Token, Modellwahl, Speicherung und Suche, Cloud-Diensten, Monitoring, Integrationslizenzen und Betreuung ab.

Berücksichtigen Sie außerdem Arbeitszeit für Freigaben, Ausnahmen, Wissenspflege und wiederkehrende Tests. Das billigste Modell erzeugt nicht zwingend die niedrigsten Prozesskosten; ein teures Modell repariert keine unklaren Quelldaten. Messen Sie die Kosten eines korrekt abgeschlossenen Falls, nicht nur eines API-Aufrufs.

Checkliste zur Einsatzbereitschaft

  • Wir haben einen benannten Prozess, eine verantwortliche Person und einen Ausgangswert.
  • Wir können Erfolg, Ausnahmen und verbotene Aktionen beschreiben.
  • Wir kennen verwendete Daten, Herkunft und zulässige Verarbeitung.
  • Wir können ein eigenes begrenztes Konto bereitstellen und schnell sperren.
  • Wir haben einen Testsatz und KPI für Qualität, Zeit, Kosten und Sicherheit.
  • Wir haben Aktionen bestimmt, die immer menschliche Freigabe benötigen.
  • Wir haben Protokolle, Warnungen, ein Ausfallverfahren und einen manuellen Weg.
  • Eine Person verantwortet Änderungen an Wissen, Modellen, Prompts und Integrationen.
  • Verträge, Datenschutz und aktuelle Regeln für den konkreten Einsatz wurden geprüft.
Eine brauchbare Definition des ersten Erfolgs: Der Agent spart bei bekannter Qualität messbar Zeit, hat nur notwendige Rechte, und das Unternehmen kann seine Arbeit erklären, stoppen und übernehmen. Das ist tragfähiger als ein beeindruckender Prototyp ohne Verantwortung und Kontrollen.

Quellen und weitere Informationen

  • NIST: AI Risk Management Framework, ein freiwilliger Rahmen für den Umgang mit KI-Risiken.
  • OWASP GenAI Security Project: Excessive Agency zu übermäßigen Funktionen, Berechtigungen und Autonomie in LLM-Systemen.
  • Europäische Kommission: KI-Verordnung (AI Act). Pflichten hängen von Rolle und Anwendungsfall ab; prüfen Sie den aktuellen Stand und holen Sie geeignete Beratung ein. Dieser Beitrag ist keine Rechtsberatung.