Agentic AI beschreibt KI-Systeme, die ein Ziel selbst in Schritte zerlegen, dafür Werkzeuge aufrufen und ihr Ergebnis prüfen. Agentisch wird ein System durch vier Bausteine: Zielvorgabe, Werkzeugzugriff, Gedächtnis und einen Regelkreis. Genau diese Bausteine erzeugen auch die Risiken: falsche Werkzeug-Aufrufe, Endlosschleifen, zu weite Rechte. Beherrschbar wird das über Autonomiestufen, Freigaben und Protokolle.
- Autonomiestufen4 — Assistent bis autonomes Handeln
- BausteineZiel, Werkzeuge, Gedächtnis, Regelkreis
- Wichtigster GuardrailFreigabe vor jedem schreibenden Schritt
- Betriebs-MinimumProtokoll je Werkzeug-Aufruf
- FaustregelWeg bekannt? Dann Workflow statt Agent
1. Was macht ein System „agentisch"?
Der Begriff wird derzeit für fast jede KI-Funktion benutzt, was ihn fast wertlos macht. Technisch lässt er sich aber sauber abgrenzen. Ein Sprachmodell allein ist nicht agentisch: Es sagt das nächste Wort voraus und liefert Text zurück. Agentisch wird ein System erst durch die Architektur, die um dieses Modell herum gebaut wird.
Vier Bausteine müssen zusammenkommen. Fehlt einer, haben Sie einen guten Assistenten, aber keinen Agenten.
Ziel statt Anweisung
Der Agent bekommt ein Ergebnis vorgegeben, nicht jeden einzelnen Klick. Er entscheidet den Weg dorthin.
Werkzeugzugriff
Er ruft Funktionen mit klarem Namen und festem Parameter-Schema auf — Bestand lesen, Ticket anlegen, Beleg buchen.
Gedächtnis & Kontext
Er merkt sich Zwischenstände und zieht Firmenwissen dazu, statt jede Sitzung bei null zu starten.
Regelkreis
Planen, handeln, Ergebnis prüfen, nachsteuern — diese Schleife unterscheidet den Agenten vom Chatbot.
Daraus folgt die Abgrenzung, nach der in Suchmaschinen am häufigsten gefragt wird. Generative KI erzeugt Inhalte. Ein Chatbot führt ein Gespräch. Ein Agent verfolgt ein Ziel und greift dafür in Systeme ein. Die Sprünge dazwischen sind keine Marketing-Nuancen: Mit jedem Schritt wächst der Nutzen — und im gleichen Maß das, was schiefgehen kann. Welche Anwendungsfälle sich geschäftlich rechnen und wie eine Einführung abläuft, behandeln wir getrennt im Beitrag zu KI-Agenten im Unternehmen. Im E-Commerce zeichnet sich mit einkaufenden KI-Agenten bereits ein eigenes Anwendungsfeld ab — mehr dazu in unserem Beitrag zu Agentic Commerce. Hier geht es um die Mechanik darunter.
2. Die vier Autonomiestufen
„Autonom" ist kein Schalter, sondern eine Skala. Einen verbindlichen Industriestandard für diese Skala gibt es nicht. Wir arbeiten deshalb in Projekten mit einer eigenen, bewusst einfachen Einordnung in vier Stufen. Sie hat einen praktischen Zweck: Jede Stufe zieht andere Sicherheits- und Freigabe-Anforderungen nach sich, und die Stufe entscheidet, wie teuer ein Fehler wird.
| Stufe | Was das System tut | Rolle des Menschen | Beispiel aus dem Handel | Was hier schiefgeht |
|---|---|---|---|---|
| Stufe 1 — Assistent | Antwortet, formuliert, schlägt vor | Entscheidet und führt jeden Schritt selbst aus | Produkttext entwerfen, Ticket zusammenfassen | Inhaltlich falsch — aber ohne Wirkung im System |
| Stufe 2 — Werkzeugnutzung | Ruft auf Anfrage definierte Werkzeuge auf, meist lesend | Gibt das Ziel je Schritt vor | Bestand nachschlagen, Beleg im ERP suchen | Falsche Aufruf-Argumente, ungewollter Datenabfluss |
| Stufe 3 — Mehrstufige Planung | Zerlegt ein Ziel selbst und arbeitet Schritte ab | Gibt das Ziel vor und gibt schreibende Schritte frei | Retoure vorbereiten, Angebot zusammenstellen | Schleifen, Kostenanstieg, falsche Zwischenergebnisse |
| Stufe 4 — Autonomes Handeln | Startet selbst durch Ereignis oder Zeitplan und schreibt | Setzt den Rahmen und prüft Protokolle im Nachgang | Bestellvorschläge auslösen, Standardtickets schließen | Wirkung ohne Vier-Augen-Prinzip, stille Fehlerketten |
Die wichtigste Erkenntnis aus unseren Projekten: Die meisten Aufgaben brauchen Stufe 2 oder 3, nicht Stufe 4. Ein Agent, der Daten zusammenträgt und einen Entwurf vorlegt, spart bereits den Großteil der Zeit. Der Sprung auf Stufe 4 bringt oft nur wenig zusätzlichen Nutzen, verlangt aber ein deutlich strengeres Sicherheits- und Prüfkonzept. Steigen Sie stufenweise auf, nicht direkt ein.
3. Werkzeugzugriff: wie ein Agent tatsächlich handelt
Ein Agent handelt nicht magisch. Er ruft Funktionen auf, die Sie ihm vorher beschrieben haben. Jede dieser Funktionen hat einen Namen, eine Beschreibung und ein festes Parameter-Schema — etwa bestand_lesen(artikelnummer) oder ticket_anlegen(kunde, betreff, text). Das Modell entscheidet, welche Funktion es mit welchen Werten aufruft; Ihr System entscheidet, ob dieser Aufruf ausgeführt wird.
Genau an dieser Grenze liegt Ihre Kontrolle. Drei Dinge legen Sie beim Zuschnitt fest: welche Werkzeuge der Agent überhaupt sieht, welche davon lesen und welche schreiben dürfen, und mit welchen Rechten der technische Nutzer dahinter arbeitet. In der Praxis geben wir einem Agenten selten mehr als eine Handvoll Werkzeuge. Je größer der Werkzeugkasten, desto häufiger greift das Modell zum falschen — und desto schwerer wird die Fehlersuche.
Wie Werkzeuge und Datenquellen technisch angebunden werden, hat sich zuletzt vereinheitlicht: Statt für jedes System eine eigene Integration zu bauen, setzen immer mehr Plattformen auf ein gemeinsames Protokoll. Wie das funktioniert und was es für Ihre Systemlandschaft bedeutet, lesen Sie im Beitrag zum Model Context Protocol (MCP).
4. Gedächtnis und Kontext: was der Agent weiß
Ein Sprachmodell hat kein Gedächtnis. Alles, was der Agent „weiß", steht im Kontext, den Sie ihm mitgeben. Drei Ebenen kommen dabei zusammen: der Arbeitsspeicher des laufenden Vorgangs (bisherige Schritte und Zwischenergebnisse), ein dauerhaftes Gedächtnis über Vorgänge hinweg (Kundenpräferenzen, gelernte Ausnahmen) und angebundenes Firmenwissen, das bei Bedarf nachgeschlagen wird.
Die dritte Ebene ist die wichtigste für die Antwortqualität. Statt dem Modell alles vorab zu geben, sucht das System im Moment der Frage die passenden Abschnitte aus Handbüchern, Produktdaten oder Tickets heraus. Dieses Muster erklären wir im Detail unter Retrieval Augmented Generation.
Das dauerhafte Gedächtnis ist zugleich die am meisten unterschätzte Schwachstelle. Das OWASP GenAI Security Project führt „Memory Poisoning" als eigene Bedrohung: Untergeschobene Inhalte landen im Speicher und wirken bei jedem späteren Aufruf weiter, auch in anderen Sitzungen (Quelle: OWASP, Agentic AI — Threats and Mitigations v1.0, Februar 2025). Deshalb gilt bei uns: Gedächtnisinhalte sind einsehbar, je Kunde und Sitzung getrennt und jederzeit löschbar. Was ein Agent dauerhaft merkt, muss eine bewusste Entscheidung sein, kein Nebeneffekt.
5. Guardrails und Freigabe-Schritte: Kontrolle ohne Stillstand
Guardrails sind keine Bremse, sondern die Voraussetzung dafür, dass ein Agent überhaupt in ein Produktivsystem darf. Sechs Kontrollen setzen wir in jedem Projekt, unabhängig von Plattform und Modell. Sie decken sich mit den Empfehlungen des OWASP-Cheat-Sheets zur Sicherheit von KI-Agenten. Ein Angriffsmuster, gegen das genau diese Kontrollen wirken, ist Prompt Injection — wie sie funktioniert und wie Sie sich schützen, erklärt unser Beitrag zur Prompt Injection als KI-Sicherheitsrisiko.
Rechte je Werkzeug zuschneiden
Jeder Agent bekommt einen eigenen technischen Nutzer und nur die Werkzeuge, die er für seine Aufgabe braucht. Lesend vor schreibend, Mandant vor Gesamtsystem. Ein Agent, der Bestände prüft, braucht kein Recht, Rechnungen zu stornieren.
Schreibende Schritte freigeben lassen
Vor jeder Aktion mit Außenwirkung sieht ein Mensch, was gleich passieren soll: welcher Datensatz, welcher Betrag, welcher Empfänger. Diese Vorschau vor der Ausführung ist die wirksamste einzelne Maßnahme, die wir kennen.
Ein- und Ausgaben prüfen
Werkzeug-Aufrufe laufen gegen ein festes Schema: unbekannte Felder, unplausible Beträge und leere Pflichtwerte fliegen raus, bevor sie das System erreichen. Inhalte aus Dokumenten, Mails oder Webseiten gelten als Daten, nie als Anweisung.
Harte Grenzen setzen
Jeder Vorgang bekommt ein Limit für Schrittzahl, Laufzeit, Token-Budget und Betragshöhe. Wird eines gerissen, bricht der Agent ab und meldet sich, statt weiterzulaufen. Ohne diese Grenzen ist eine Endlosschleife nur eine Frage der Zeit.
Umkehrbar bauen
Wo möglich erzeugt der Agent Entwürfe statt Buchungen: Angebotsentwurf statt versendetem Angebot, Bestellvorschlag statt Bestellung. Der erste Rollout läuft im Testmandanten. So ist jeder Fehler ein Aufwand, kein Schaden.
Gedächtnis sauber halten
Sitzungen und Kunden werden getrennt, gespeicherte Inhalte sind einsehbar und löschbar. Sonst landet eine untergeschobene Anweisung dauerhaft im Gedächtnis und wirkt bei jedem künftigen Aufruf weiter.
Der häufigste Einwand lautet, dass Freigaben den Zeitgewinn wieder auffressen. Das trifft nur zu, wenn Sie jeden Schritt freigeben lassen. Sinnvoll ist eine Schwelle: Alles unterhalb einer definierten Grenze läuft durch, alles darüber wandert in eine Freigabe-Liste. Diese Grenze verschieben Sie, sobald das Protokoll zeigt, dass der Agent in diesem Bereich zuverlässig arbeitet. So wächst Autonomie mit belegtem Vertrauen, nicht mit Hoffnung.
6. Beobachtbarkeit: was Sie im Betrieb sehen müssen
Ein Agent, dessen Arbeit Sie nicht nachvollziehen können, ist nicht betriebsfähig — egal wie gut er in der Demo aussah. Anders als bei klassischer Software ist der Ablauf nicht fest programmiert, sondern entsteht bei jedem Durchlauf neu. Ohne Protokoll können Sie einen Fehler weder erklären noch reproduzieren. Diese fünf Dinge protokollieren wir grundsätzlich:
- Jeden Werkzeug-Aufruf mit Zeitpunkt, übergebenen Argumenten und zurückgegebenem Ergebnis.
- Die Schrittkette eines Vorgangs, damit nachvollziehbar bleibt, warum der Agent so entschieden hat.
- Kosten je Vorgang in Token und Geld — der einzige verlässliche Frühindikator für Schleifen.
- Abbrüche und Wiederholungen, inklusive des gerissenen Limits.
- Freigabe-Entscheidungen: wer was wann bestätigt oder abgelehnt hat.
Wichtig ist die Lesbarkeit. Ein technisches Log, das nur Entwickler verstehen, hilft dem Fachbereich nicht. Wir legen Protokolle deshalb so ab, dass die Kollegin aus dem Kundenservice selbst sehen kann, welchen Beleg der Agent gezogen und welche Antwort er daraus gebaut hat. Das ist auch die Grundlage für jede spätere Rechenschaft gegenüber Prüfern und deckt sich mit dem Governance-Gedanken etablierter Rahmenwerke wie dem NIST AI Risk Management Framework.
7. Typische Fehlerbilder — und was dagegen hilft
Agenten scheitern selten spektakulär. Sie scheitern leise, in wiederkehrenden Mustern. Diese sechs sehen wir am häufigsten. Die Bedrohungsnamen in Klammern stammen aus der Taxonomie des OWASP GenAI Security Project (Agentic AI — Threats and Mitigations v1.0, Februar 2025), die Gegenmaßnahmen aus unserer Betriebspraxis.
| Fehlerbild | Was passiert | Was dagegen hilft |
|---|---|---|
| Halluzination im Werkzeug-Aufruf | Das Modell erfindet Parameter — eine Artikelnummer, eine Kundennummer, einen Betrag —, weil das Schema sie verlangt. | Schema-Validierung, Wertelisten statt Freitext, Trockenlauf ohne Schreibrecht |
| Endlosschleife | Der Agent plant, prüft, verwirft und plant erneut, ohne je ein Abbruchkriterium zu erreichen. | Schritt- und Zeitlimit je Vorgang, Wiederholungszähler, Eskalation an einen Menschen |
| Rechte-Eskalation | Ein weit gefasster Zugang wird für etwas genutzt, wofür er nie gedacht war (OWASP: Privilege Compromise). | Eigener technischer Nutzer je Agent, Rechte pro Werkzeug, regelmäßige Rechteprüfung |
| Kostenexplosion | Jeder Denkschritt kostet Token; Schleifen und lange Kontexte vervielfachen die Kosten unbemerkt. | Budget je Vorgang, Kostenprotokoll, Alarm bei Abweichung vom Normalwert |
| Vergiftetes Gedächtnis | Untergeschobener Text landet dauerhaft im Speicher und beeinflusst spätere Sitzungen (OWASP: Memory Poisoning). | Quellen trennen, Gedächtnis prüfbar und löschbar halten, Sitzungen isolieren |
| Ziel-Verschiebung | Anweisungen aus einer Mail oder einem PDF verändern still das Ziel des Agenten (OWASP: Intent Breaking). | Fremdinhalte nie als Anweisung interpretieren, Ausgaben gegen das Ursprungsziel prüfen |
Auffällig ist, dass keines dieser Probleme durch ein besseres Modell verschwindet. Ein stärkeres Modell halluziniert seltener, aber es schützt Sie nicht vor zu weiten Rechten, fehlenden Limits oder einem vergifteten Gedächtnis. Das sind Architektur- und Betriebsfragen. Wer bei Agenten nur über Modelle diskutiert, löst den kleineren Teil des Problems.
8. Wann ein fester Workflow die bessere Wahl ist
Nicht jede Automatisierung braucht einen Agenten. Anthropic trennt in seiner Entwickler-Dokumentation ausdrücklich zwischen Workflows, in denen Modell und Werkzeuge über fest vorgegebene Codepfade laufen, und Agents, in denen das Modell seinen Ablauf selbst steuert. Die Empfehlung dort lautet, mit der einfachsten Lösung zu beginnen und Agenten nur dort einzusetzen, wo Flexibilität wirklich gebraucht wird — der Preis der Autonomie seien höhere Kosten und sich aufschaukelnde Fehler (Quelle: Anthropic, „Building effective agents", Dezember 2024).
Das deckt sich mit unserer Erfahrung im Mittelstand. Diese Faustregel hilft bei der Entscheidung:
- Der Weg zum Ergebnis ist bei jedem Fall anders und lässt sich nicht vorab beschreiben.
- Der Vorgang erfordert Bewertung unstrukturierter Inhalte — Mails, Freitexte, Dokumente.
- Die Zahl der Sonderfälle ist so groß, dass jede Regel eine Ausnahme hätte.
- Ein Mensch würde für dieselbe Aufgabe ebenfalls recherchieren und abwägen müssen.
Umgekehrt gewinnt der klassische, deterministische Workflow, wenn eines dieser Merkmale zutrifft:
- Der Ablauf ist bekannt und immer gleich — dann ist ein Agent teurer, langsamer und unzuverlässiger.
- Das Ergebnis muss exakt reproduzierbar sein, etwa in der Buchhaltung oder im Versand.
- Die Daten sind strukturiert und die Regeln lassen sich in wenigen Bedingungen ausdrücken.
- Der Vorgang läuft sehr häufig — die Token-Kosten eines Agenten skalieren linear mit, eine Regel nicht.
In der Praxis bauen wir häufig beides in einem System: ein fester Ablauf trägt den Standardfall, und nur die Ausnahme wird an einen Agenten übergeben. Wie solche festen Abläufe aussehen und mit welchen Werkzeugen sie entstehen, zeigt unser Beitrag zur Workflow-Automatisierung; einen Überblick über die verfügbaren Bausteine gibt die Übersicht zu KI-Tools für Unternehmen.
Genau diese Vorfrage — Workflow oder Agent — ist auch der erste Schritt, wenn Sie tatsächlich bauen wollen. Erst wenn die Antwort „Agent" lautet, folgen die eigentlichen Bauschritte: Aufgabe zuschneiden, Erfolg definieren, Rechte klären, testen, betreiben. Diesen werkzeugneutralen Bauplan in neun Schritten mit Entscheidungsbaum zur Plattformwahl beschreibt unser Beitrag KI-Agent erstellen.
9. Fazit: Autonomie ist ein Regler, kein Schalter
Agentic AI ist keine neue Modellgeneration, sondern eine Architektur: Ziel, Werkzeuge, Gedächtnis, Regelkreis. Wer diese vier Teile versteht, kann die richtige Autonomiestufe wählen, statt pauschal „autonom" zu kaufen. Die Kontrolle sitzt nicht im Modell, sondern in den Rechten, den Freigaben, den Limits und dem Protokoll.
Fangen Sie deshalb klein an: ein klar abgegrenzter Vorgang, lesende Werkzeuge, ein Entwurf statt einer Buchung, ein vollständiges Protokoll. Erst wenn dieser erste Agent nachweislich sauber läuft, verschieben Sie die Freigabe-Schwelle. Neben der Technik gelten für den Einsatz von KI im Unternehmen auch regulatorische Anforderungen; einen Überblick dazu gibt unser Beitrag zum EU AI Act und den Pflichten für Unternehmen.
Wenn Sie den ersten Anwendungsfall auswählen, an Ihre Systeme anbinden und mit einem tragfähigen Freigabe-Konzept absichern wollen, begleiten wir das von der Architektur bis zum Betrieb — siehe KI-Mitarbeiter und AI-Agenten für Unternehmen. Entsteht aus einem umgesetzten Anwendungsfall ein eigenständiges internes Werkzeug per Zuruf statt eine klassisch programmierte Anbindung, lohnt zusätzlich der Blick auf unseren Beitrag zu Vibe Coding im Unternehmen.
10. Häufige Fragen zu Agentic AI
Was ist Agentic AI?
Agentic AI bezeichnet KI-Systeme, die ein Ziel entgegennehmen, es selbst in Schritte zerlegen und über Werkzeuge wie APIs oder Datenbanken handeln. Entscheidend ist nicht das Sprachmodell, sondern der Regelkreis darum: planen, handeln, Ergebnis prüfen, nachsteuern. Ohne Werkzeugzugriff und Gedächtnis bleibt es ein Textgenerator. Deshalb ist die Frage nach der Autonomiestufe wichtiger als die nach dem Modell.
Ist ChatGPT eine Agentic AI?
In der reinen Chat-Nutzung nein: ChatGPT antwortet, handelt aber nicht selbst. Sobald es Werkzeuge nutzt, etwa Websuche, Datei-Analyse oder Code-Ausführung, erreicht es die Stufen zwei und drei unserer Einordnung. Für Unternehmensprozesse zählt trotzdem, welche Rechte und Freigaben Sie um dieses Werkzeug herum bauen. Ein Agent ohne Rechteschnitt ist kein Fortschritt, sondern ein Risiko.
Was ist der Unterschied zwischen GenAI und Agentic AI?
Generative KI erzeugt Inhalte: Text, Bild, Code. Agentic AI nutzt diese Fähigkeit als Motor, ergänzt sie aber um Ziele, Werkzeugzugriff, Gedächtnis und einen Prüfschritt. Kurz gesagt: GenAI liefert eine Antwort, Agentic AI liefert ein Ergebnis in Ihren Systemen. Damit steigt der Nutzen und zugleich das Schadenspotenzial, weil das System schreibend eingreift.
Ist Agentic AI dasselbe wie ein LLM?
Nein. Ein großes Sprachmodell (LLM) ist die Komponente, die Sprache versteht und Aufrufe formuliert. Agentic AI ist die Architektur darum herum: Werkzeug-Schnittstellen, Rechte, Gedächtnis, Planungsschleife, Protokoll und Abbruchkriterien. Dasselbe Modell kann in einem Chatfenster harmlos und in einem Agenten mit Schreibrechten geschäftskritisch sein. Die Sicherheitsfrage stellt sich deshalb nie am Modell, sondern an der Architektur.
Ist Siri eine Agentic AI?
Klassische Sprachassistenten führen einzelne Befehle aus: Timer stellen, Nachricht senden. Das ist Stufe eins bis zwei, keine mehrstufige Planung. Ob ein konkreter Assistent heute weiter geht, hängt von seiner jeweiligen Version ab. Prüfen Sie im Zweifel drei Punkte: Zerlegt er ein Ziel selbst? Ruft er Werkzeuge auf? Handelt er ohne Rückfrage?
Welche Agentic-AI-Systeme sind im Einsatz?
Eine seriöse Top-3-Liste gibt es nicht, denn der Markt ändert sich schnell und die Eignung hängt vom Anwendungsfall ab. Praktisch begegnen Ihnen drei Familien: Assistenz-Agenten im Chat, Entwickler-Agenten in der IT und Prozess-Agenten in Unternehmensplattformen. Wir arbeiten herstellerunabhängig und wählen nach Anbindung, Rechtemodell und Betriebskosten aus.
Wie verhindere ich, dass ein KI-Agent Schaden anrichtet?
Schneiden Sie die Rechte je Werkzeug zu, lassen Sie schreibende Schritte freigeben und begrenzen Sie Schrittzahl, Laufzeit und Budget je Vorgang. Protokollieren Sie jeden Werkzeugaufruf mit Argumenten und Ergebnis. Bauen Sie Aktionen umkehrbar: Entwurf statt Buchung, Testmandant statt Produktivsystem. Diese Kontrollen empfiehlt auch das OWASP-Cheat-Sheet zu KI-Agenten.
11. Quellen & weiterführende Fachliteratur
Die Fakten in diesem Beitrag stützen sich auf folgende Primär- und Fachquellen (geprüft am 13. August 2026). Externe Links öffnen in einem neuen Tab. Die vier Autonomiestufen sind eine Einordnung aus unserer Projektpraxis und kein normierter Standard. Dieser Beitrag ist eine technische Einordnung und ersetzt keine Rechtsberatung.
- OWASP GenAI Security Project — Agentic AI: Threats and Mitigations (v1.0, Februar 2025) — Bedrohungs-Taxonomie über Agent Design, Memory, Planning & Autonomy, Tool Use und Deployment; Quelle der Bedrohungsnamen Memory Poisoning, Tool Misuse, Privilege Compromise und Intent Breaking.
- OWASP Cheat Sheet Series — AI Agent Security Cheat Sheet — konkrete Kontrollen: Werkzeug-Rechte nach dem Prinzip der geringsten Rechte, Freigabe durch Menschen vor irreversiblen Aktionen, Schema-Validierung, Protokollierung aller Werkzeug-Aufrufe, Trennung des Gedächtnisses je Sitzung.
- Anthropic — Building effective agents (Dezember 2024) — Trennung von Workflows (feste Codepfade) und Agents (Modell steuert selbst), Empfehlung zur einfachsten tragfähigen Lösung und Benennung der Tradeoffs höhere Kosten und sich aufschaukelnde Fehler.
- NIST — AI Risk Management Framework — international genutzter Rahmen für Risikosteuerung und Nachvollziehbarkeit beim Betrieb von KI-Systemen.
- OWASP — Agentic Security Initiative — laufend gepflegte Sammlung zu Bedrohungsmodellierung, Sicherheitskontrollen und Governance für agentische Anwendungen.