
Auf einen Blick
- Generative KI liefert ein Ergebnis, das Sie prüfen. Agentische KI liefert eine Handlung, die bereits vollzogen ist, wenn Sie hinsehen. Aus dieser einen Verschiebung folgt alles Weitere.
- Agenten sind keine neue Rechtskategorie: Artikel 3 Absatz 1 der KI-Verordnung erfasst bereits Systeme mit unterschiedlichem Grad an Autonomie.
- Die Grenze zwischen agentischer und generativer KI verläuft als Verlauf, nicht als Schalter. Steuern Sie sie über den Grad der Handlungsfähigkeit: Werkzeugzugriff, Gedächtnis, eigenständige Planung, ungeprüfte Wirkung, Übergabe zwischen Agenten.
- Ihr Risikoregister ändert nicht den Schweregrad, sondern die Kategorie. Prompt Injection ist kein Textproblem mehr, sondern ein Problem unautorisierter Transaktionen.
- Auch Ihr Nachweispaket ändert sich: Prompt-Protokolle genügen nicht mehr, denn die Prüfinstanz verlangt Handlungsprotokolle, die Identität, unter der der Agent gehandelt hat, und den Beleg, dass der Abschaltmechanismus funktioniert.
Agentische KI vs. generative KI: der Unterschied, der Ihre Pflichten verschiebt
Wer einen Anbieter um eine Erklärung bittet, bekommt überall denselben Satz: generative KI erzeugt Inhalte, agentische KI führt Handlungen aus. Das stimmt. Wer eine Produktivsetzung freigeben muss, kann damit nichts anfangen. Die brauchbare Fassung ist enger. Generative KI legt einer Person einen Entwurf vor, und diese Person entscheidet, ob er Wirklichkeit wird. Agentische KI schließt genau diese Lücke: Sie plant eine Abfolge, ruft ein Werkzeug auf, schreibt in ein führendes System und meldet das Ergebnis zurück. Ausgabe und Wirkung fallen zusammen. In dieser Lücke lag jedoch alles, worauf sich Governance stillschweigend gestützt hat: der Prüfschritt, der Freigabevermerk, die Gelegenheit, eine falsche Antwort abzufangen, bevor sie etwas kostet. Fällt die Lücke weg, scheitern die Kontrollen nicht lautstark. Sie stehen nur nicht mehr dort, wo das Risiko liegt. Der europäische Gesetzgeber hat das nicht übersehen. Artikel 3 Absatz 1 definiert ein KI-System als maschinengestütztes System, das mit unterschiedlichem Grad an Autonomie betrieben wird und Ausgaben ableitet, die physische oder virtuelle Umgebungen beeinflussen. Die Autonomie steckt bereits in der Definition. Ein Agent ist somit kein neuartiger Regelungsgegenstand, sondern derselbe Gegenstand bei höherer Einstellung, weshalb die Pflichten nicht ihre Identität, wohl aber ihr Gewicht ändern.
Der Fähigkeitsstapel, aus dem die Lücke entsteht
Die Agentic Security Initiative der OWASP beschreibt einen Agenten über vier Fähigkeiten: Planen und Schlussfolgern, Gedächtnis und Zustandshaltung, Werkzeugnutzung und Handlung. Jede davon ist ebenso sehr eine Governance-Fläche wie eine technische.
- Planung bedeutet, dass das System Schritte gewählt hat, die Sie nie aufgezählt haben. Eine Risikoanalyse, die auf einer abschließenden Liste erwarteter Verhaltensweisen beruht, trägt damit nicht mehr.
- Gedächtnis bedeutet, dass Zustand über Läufe hinweg fortbesteht, sodass eine vergiftete Eingabe das Verhalten noch lange nach dem Ende der auslösenden Sitzung verändern kann.
- Werkzeugnutzung bedeutet, dass der Wirkungsradius von den Berechtigungen bestimmt wird und nicht vom Eingabefeld.
- Handlung bedeutet, dass die Wirkung eintritt, bevor sie geprüft wird.
Ein generatives KI-Modell besitzt die erste Fähigkeit in schwacher Form und keine der drei übrigen. Darin besteht die gesamte Lücke, und jeder folgende Abschnitt ist nur eine Folge davon.
Der Fünf-Fragen-Test: hat Ihr System die Grenze bereits überschritten?
Die wenigsten Teams beschließen, einen Agenten zu bauen. Sie ergänzen einen Chatbot um einen Werkzeugaufruf, dann um eine Wiederholungsschleife, dann um einen Zeitplaner, und einen Sprint später schreibt das Ganze in die Produktion. Der Übergang ist selten eine Entscheidung, weshalb er auch selten eine Governance-Prüfung auslöst. Prüfen Sie jedes System, das Sie verantworten, anhand dieser fünf Fragen.
- Kann es ein Werkzeug, eine Schnittstelle oder eine Datenbank aufrufen, ohne dass ein Mensch diesen konkreten Aufruf freigibt? Dann hat sich Ihr Kontrollpunkt von der Ausgabe zur Berechtigung verschoben.
- Hält es Zustand über Schritte oder Sitzungen hinweg, der späteres Verhalten verändert? Dann besitzen Sie ein korrumpierbares Gut, das Integritätskontrollen verlangt und nicht nur Zugriffskontrollen.
- Hat es das Ziel in Schritte zerlegt, die Sie nicht vorgegeben haben? Dann kann Ihre Risikoanalyse nicht mehr verhaltensweise vorgehen, sondern muss grenzweise vorgehen.
- Kann seine Ausgabe wirksam werden, ohne dass jemand sie zuvor prüft? Dann ist menschliche Aufsicht eine Frage der Konstruktion und nicht mehr eine Frage des Prozesses.
- Übergibt es Arbeit an einen anderen Agenten oder nimmt es solche entgegen? Dann steuern Sie ein System, und die interessanten Störungen liegen im Zusammenspiel und nicht in einer einzelnen Komponente.
Ein Ja ist kein Alarm. Fünf Ja beschreiben ein anderes System als jenes, das Ihre Dokumentation abbildet. Den tragfähigsten Rahmen liefert das Center for Long-Term Cybersecurity der Universität Berkeley, dessen Agentic AI Risk-Management Standards Profile dafür plädiert, Governance mit dem Grad der Handlungsfähigkeit skalieren zu lassen, statt Autonomie als binäres Merkmal zu behandeln. Halten Sie den Punktwert der fünf Antworten im Verzeichnis fest und lassen Sie ihn bestimmen, wie schwer die Kontrollen ausfallen. Ein Feld mit „autonom: ja oder nein“ übersteht die Begegnung mit einem realen Portfolio nicht. Genau hier hört Schatten-KI auf, ein Entdeckungsproblem zu sein, und wird zu einem Einstufungsproblem. Ein Team, das sein Werkzeug vor anderthalb Jahren als Schreibassistenz gemeldet hat, wird die Meldung nicht von sich aus erneuern, weil jemand Function Calling aktiviert hat.
Was sich bei der Einstufung ändert
Hier zeitigt der Unterschied seine erste konkrete rechtliche Folge, und zwar gleich auf zwei Achsen. Die Untersuchung von The Future Society dazu, wie die Verordnung Agenten erfasst, Ahead of the Curve (Oueslati und Staes-Polet, 2025), legt beide offen. Kapitel V greift auf das zugrunde liegende Universalmodell zu: Anbieter von Modellen mit systemischem Risiko müssen jene Risiken bewerten und mindern, die aus der Einbettung dieser Modelle in Agentensysteme entstehen. Kapitel III greift auf das Agentensystem selbst zu, über die Einstufung als Hochrisiko-System. Daraus folgen drei Konsequenzen, und jede trifft jemanden unvorbereitet. Erstens ist die Hochrisiko-Einstufung eines universell einsetzbaren Agenten tatsächlich ungeklärt. Anhang III entstand, bevor Agentenrisiken hinreichend verstanden waren, und ein Agent, den man auf viele Aufgaben richten kann, fällt unter Umständen standardmäßig in den Anwendungsbereich, sofern der Anbieter die Hochrisiko-Verwendungen nicht bewusst ausschließt. Bewusst heißt dokumentiert und technisch durchgesetzt, nicht eine Zeile in einer Nutzungsrichtlinie. Wer diese Frage bearbeitet, beginnt bei der Einstufung von Hochrisiko-KI-Systemen und wendet sie auf die weiteste erreichbare Verwendung an, nicht auf die beabsichtigte. Zweitens kann das Gerüst, das Sie hinzufügen, Ihre Rolle verändern. Wer ein Modell der KI mit allgemeinem Verwendungszweck mit Retrieval, einem Orchestrierungsrahmen und einem Werkzeugsatz umgibt, nimmt möglicherweise eine wesentliche Änderung vor, wodurch Anbieterpflichten auf ein Team übergehen, das mit Betreiberpflichten kalkuliert hatte. Die Compliance-Rechnung fällt dann deutlich anders aus, und sie landet in der Regel bei einer Entwicklungsabteilung, die Kapitel V nie gelesen hat. Drittens muss die Einstufung neu erfolgen. Eine agentische Fähigkeit, die einem bestehenden generativen System hinzugefügt wird, ist kein Versionssprung, sondern einstufungsrechtlich ein neues System. Die Konformitätsarbeit beginnt bei der Risikoanalyse von vorn und setzt nicht beim letzten Freigabevermerk wieder an.
Was sich bei der menschlichen Aufsicht ändert
Artikel 14 verlangt, Hochrisiko-KI-Systeme so zu gestalten, dass natürliche Personen sie wirksam beaufsichtigen können, mit Maßnahmen, die den Risiken, dem Grad der Autonomie und dem Nutzungskontext angemessen sind. Liest man diese Vorschrift mit Blick auf einen Agenten, tritt die Schwierigkeit offen zutage: Die Norm steigert ihre Anforderungen genau mit jener Eigenschaft, die ihre Erfüllung erschwert. Generative Aufsicht ist günstig, weil sie synchron ist: Jemand liest den Entwurf und handelt dann. Agentische Aufsicht ist teuer, weil die Handlung bereits erfolgt ist. Sie muss deshalb in den Ausführungspfad hineinkonstruiert und nicht nachträglich darübergelegt werden. Daraus folgen drei Veränderungen für die menschliche Aufsicht nach Artikel 14. Der Kontrollpunkt ersetzt die Nachprüfung. Aufsicht verschiebt sich vom Lesen einer Ausgabe hin zum vorherigen Genehmigen von Handlungsklassen und zum Unterbrechen einzelner Handlungen während des Ablaufs. Das ist ein Berechtigungsmodell, und es verdient dieselbe konstruktive Sorgfalt wie der Prompt. Der Aufsichtsmodus verschiebt sich, aber nicht überall. Der Wechsel von Human-in-the-Loop zu Human-on-the-Loop ist die richtige Entscheidung für Vorgänge mit hohem Volumen und geringer Tragweite. Er ist die falsche Entscheidung, wenn eine Entscheidung rechtliche oder ähnlich erhebliche Wirkung für eine Person entfaltet, denn Artikel 22 DSGVO begrenzt ausschließlich automatisierte Entscheidungen unabhängig davon, wie die KI-Verordnung das System einstuft. Die deutschen Aufsichtsbehörden betonen dabei regelmäßig, dass die behauptete menschliche Beteiligung tatsächlich und mit Änderungsbefugnis ausgeübt werden muss. Aufsicht muss ihr eigenes Volumen überstehen. Die OWASP führt diesen Punkt als T10, Overwhelming Human-in-the-Loop, und er ist der meistunterschätzte der Liste. Eine Freigabewarteschlange, die ein Prüfer mit vierhundert Vorgängen pro Stunde abarbeitet, ist keine Aufsicht, sondern ein Stempel mit Protokoll. Wenn eine Kontrolle auf Aufmerksamkeit beruht, die der Durchsatz unmöglich macht, ist die Kontrolle bereits gescheitert, und Ihre Nachweise werden dieses Scheitern dokumentieren.
Was sich im Risikoregister ändert
Diesen Abschnitt überspringen die meisten Vergleiche, und hier hört der Unterschied auf, begrifflich zu sein. Die Fehlerbilder werden nicht schlimmer, sie wechseln die Kategorie. Ein generatives Register betrifft überwiegend das, was das System sagt: Halluzination, Vertraulichkeitsverlust, diskriminierende oder toxische Ausgabe, Prompt Injection als Inhaltsproblem. Ein agentisches Register betrifft das, was das System tut. Die OWASP-Taxonomie führt fünfzehn agentische Bedrohungen auf, darunter Gedächtnisvergiftung, Missbrauch von Werkzeugen, Rechteausweitung, kaskadierende Halluzination, Zielmanipulation, Abstreitbarkeit und fehlende Nachvollziehbarkeit sowie außer Kontrolle geratene Agenten in Mehr-Agenten-Systemen. Der eine Satz, den Sie in Ihren Risikoausschuss tragen sollten: Prompt Injection ist kein Problem eines schlechten Satzes mehr, sondern eines einer unautorisierten Transaktion. Derselbe Angriff, eine andere Folgenklasse, ein anderer Verantwortlicher. <table header-row=“true“> <tr> <td>Fehlerbild</td> <td>Bei generativer KI</td> <td>Bei agentischer KI</td> <td>Was aus der Kontrolle wird</td> </tr> <tr> <td>Prompt Injection</td> <td>Richtlinienwidriger oder peinlicher Text</td> <td>Unautorisierter Werkzeugaufruf, Datenabfluss, Codeausführung</td> <td>Vertrauensgrenzen bei der Eingabe und Werkzeugrechte nach dem Minimalprinzip</td> </tr> <tr> <td>Halluzination</td> <td>Eine falsche Aussage, die ein Prüfer abfängt</td> <td>Eine falsche Handlung, auf der spätere Schritte aufbauen</td> <td>Handlungsvalidierung und Umkehrbarkeit statt bloßer Ausgabeprüfung</td> </tr> <tr> <td>Datenabfluss</td> <td>Sensibler Text in einer Antwort</td> <td>Vom Agenten selbst zwischen Systemen bewegte Daten</td> <td>Ausgangskontrolle auf der Werkzeugebene</td> </tr> <tr> <td>Gedächtnisverfälschung</td> <td>Nicht einschlägig</td> <td>Vergifteter Zustand steuert das Verhalten über Sitzungen hinweg</td> <td>Gedächtnisvalidierung und Sitzungstrennung</td> </tr> <tr> <td>Identität</td> <td>Ein Dienstkonto, ein Aufrufmuster</td> <td>Eine nichtmenschliche Identität, die fortlaufend systemsübergreifend handelt</td> <td>Agentenidentität, eng gefasste Berechtigungen, vollständige Zurechnung</td> </tr> <tr> <td>Kumulation</td> <td>Auf eine Antwort begrenzt</td> <td>Kaskadierendes Versagen über Schritte oder Agenten hinweg</td> <td>Bewertung auf Systemebene, Schutzschalter, Eindämmung</td> </tr> </table> Das Berkeley-Profil ergänzt die Randrisiken, die bei hohem Grad an Handlungsfähigkeit bedeutsam werden: Kontrollverlust, Unterlaufen der Aufsicht, täuschende Fehlausrichtung und kaskadierende Mehr-Agenten-Fehler. Es formuliert außerdem einen Grundsatz, der in Entwurfsprüfungen gehört: Ein Mehr-Agenten-System ist sowohl je Agent als auch im Verbund zu bewerten, weil emergente Wechselwirkungen in Komponententests nicht sichtbar werden. Seine unmissverständliche Empfehlung lautet, einen hinreichend leistungsfähigen Agenten als nicht vertrauenswürdig zu behandeln und entsprechend einzuhägen. Zwei praktische Folgen für bestehende Programme. Ihre Methodik im KI-Risikomanagement muss auf Systemebene bewerten, sonst entgehen ihr die Wechselwirkungsfehler. Und Red Teaming für KI muss die Werkzeuggrenze und den Gedächtnisspeicher angreifen, nicht nur den Prompt, denn dort bricht ein Agent tatsächlich.
Was sich bei den Nachweisen ändert
Compliance ist nicht, was Sie über Ihr System glauben, sondern was Sie zeigen können. Hier gehen die beiden Paradigmen deutlich auseinander, und Teams entdecken die Lücke meist während einer Prüfung statt davor. Bei einem generativen System ist das Nachweispaket vertraut: Modelldokumentation, Evaluierungsergebnisse, Prompt- und Ausgabeprotokolle sowie der Vermerk der menschlichen Prüfung. Bei einem agentischen System muss die Protokollierung nach Artikel 12 erheblich mehr tragen. Wer eine einzelne Agentenentscheidung rekonstruiert, benötigt das erteilte Ziel, den erzeugten Plan, jeden Werkzeugaufruf mit Parametern und Ergebnis, die Identität, unter der gehandelt wurde, die Berechtigung, die den Aufruf deckte, die Frage, ob die Handlung umkehrbar war und ob sie umgekehrt wurde, sowie die Lage des menschlichen Kontrollpunkts. Die OWASP führt das Fehlen dieser Kette als T8, Abstreitbarkeit und fehlende Nachvollziehbarkeit, und behandelt es als Sicherheitsbedrohung. Es ist ebenso ein Governance-Versagen. Wer eine Handlung nicht einem Agenten, einer Version und einer erteilenden Berechtigung zuordnen kann, kann weder einer Behörde noch einer Prüfinstanz noch einem Anspruchsteller antworten, und das fehlende Protokoll wird selbst zur Feststellung. Drei Artefakte, die ein generatives System nie brauchte:
- Eine dokumentierte Go-oder-No-go-Entscheidung vor dem Einsatz, die das Berkeley-Profil unter Manage 1.1 verortet. Schriftlich, samt den Bedingungen, die sie umkehren würden.
- Der Nachweis, dass der Abschaltpfad funktioniert, erprobt und nicht behauptet. Ein Not-Aus, den niemand je in einer Übung gezogen hat, ist eine Entwurfsabsicht und keine Kontrolle.
- Ein Verzeichnis nichtmenschlicher Identitäten, damit sich jede Agentenhandlung auf eine Berechtigung, einen Geltungsbereich und einen Verantwortlichen zurückführen lässt.
An dieser Stelle brauchen auch Ihre KI-Systemdokumentation und Ihr Verfahren zur Meldung schwerwiegender Vorfälle eher eine Neufassung als eine Erweiterung, da beide um ein System herum entstanden sind, das Ausgaben erzeugt und keine Wirkungen.
Was sich in der Wertschöpfungskette ändert
Das schwierigste Problem ist nicht technisch. The Future Society nennt es das Problem der vielen Hände: Bis ein Agent handelt, haben so viele Parteien beigetragen, dass sich Verantwortung zerstreut, sofern sie niemand bewusst zuteilt. Drei Akteure mit ungleichen Ressourcen, ungleicher Fachkenntnis und ungleichem Kontextwissen. Der Modellanbieter schafft die zugrunde liegende Fähigkeit und jene Vorkehrungen, die Governance überhaupt ermöglichen. Der Anbieter des Agentensystems passt sie an einen Zweck an und setzt die dazu passenden Grenzen. Der Betreiber führt sie mit echten Daten, echten Nutzern und echten Folgen aus. Die Überwachung zeigt das am klarsten. Der Modellanbieter muss eine konfigurierbare Überwachungsinfrastruktur bauen. Der Systemanbieter muss Schwellenwerte setzen, die zum Anwendungsfall passen. Der Betreiber muss die Alarme tatsächlich lesen und darauf reagieren. Handelt nur einer der drei, entsteht etwas, das im Schaubild wie Aufsicht aussieht und im Betrieb keine ist. Für die meisten Organisationen lautet die praktische Frage, was von einem Anbieter zu verlangen ist, der einen Agenten verkauft. Vier Punkte gehören in den Vertrag: Protokollschema und Aufbewahrungsdauer der Daten, die Sie erhalten, die Feinkörnigkeit, mit der Sie die Rechte des Agenten begrenzen können, der Abschaltmechanismus samt gemessener Reaktionszeit, sowie Mitteilungspflichten, wenn sich Modell oder Gerüst unter Ihnen verändern. Behandeln Sie diese Punkte in der Lieferantenbewertung für KI mit demselben Gewicht wie Sicherheitsfragen, denn eine still ausgelieferte Fähigkeitsänderung ist eine Einstufungsänderung, die Sie nicht getroffen haben. Nicht delegierbar bleibt die Betreiberpflicht. Das kontextabhängige Risiko, die grundrechtliche Bewertung und die Gestaltung der Aufsicht verbleiben bei der Organisation, die das System betreibt. Das ist das durchgehende Motiv der KI-Rechenschaftspflicht, sobald Agenten in den Bestand kommen.
Die Checkliste für den Übergang
Zehn Maßnahmen, wenn ein System die Grenze überschreitet. Jede ist überprüfbar, was wichtiger ist als ihre Bequemlichkeit.
- Einstufung neu durchführen, bezogen auf die weiteste erreichbare Verwendung.
- Einen Punktwert für den Grad der Handlungsfähigkeit im Verzeichnis führen und das binäre Autonomiefeld aufgeben.
- Risikoanalyse auf Systemebene wiederholen, einschließlich der Wechselwirkungen zwischen Agenten.
- Jeden Agenten als nichtmenschliche Identität mit benanntem Verantwortlichen registrieren.
- Werkzeugrechte nach dem Minimalprinzip fassen und den Wirkungsradius bewusst setzen statt ihn zu erben.
- Protokollierung je Handlung einrichten, mit Ziel, Plan, Werkzeugaufruf, Identität und Umkehrbarkeit.
- Den Abschaltpfad definieren, erproben und den Nachweis aufbewahren.
- Den menschlichen Kontrollpunkt so gestalten, dass er den Produktivdurchsatz übersteht.
- Den Lieferantenvertrag zu Protokollen, Rechten, Not-Aus und Änderungsmitteilung nachverhandeln.
- Das Vorfallverfahren auf Handlungen des Agenten ausdehnen, nicht nur auf erzeugte Ausgaben.
Wer das heute in Tabellenkalkulationen führt, stößt beim agentischen Schritt üblicherweise an die Grenze, weil der Nachweis fortlaufend statt periodisch anfällt. Genau dafür existiert eine Plattform für KI-Risikomanagement.
Häufige Fragen
Ist ChatGPT generative oder agentische KI? Beides, je nach Konfiguration. Als Chatoberfläche, die Text zum Lesen zurückgibt, ist das Produkt generativ. Mit Werkzeugen, Browsing, Codeausführung oder Konnektoren ausgestattet und berechtigt, Schritte auf ein Ziel hin zu verketten, verhält sich dasselbe Produkt agentisch. Deshalb lässt sich die Frage nicht auf der Ebene eines Produktnamens beantworten, sondern nur auf der Ebene Ihrer Konfiguration, Ihrer freigeschalteten Werkzeuge und Ihrer Berechtigungen. Zwei Unternehmen mit demselben Abonnement können daher sehr unterschiedliche Pflichten tragen. Worin unterscheiden sich KI-Agent und agentische KI? Das Berkeley-Profil zieht eine brauchbare Linie. Ein KI-Agent ist ein einzelnes Modell mit Werkzeugen, das eine klar umrissene Aufgabe von Anfang bis Ende erledigt. Agentische KI bezeichnet ein System mehrerer zusammenwirkender Agenten mit weiter gefassten Zielen. Die Unterscheidung steuert die Bewertung: Ein einzelner Agent lässt sich weitgehend für sich bewerten, ein Mehr-Agenten-System dagegen muss je Agent und im Verbund bewertet werden, weil die schwerwiegendsten Fehler aus dem Zusammenspiel entstehen. Nennen Sie ein Beispiel für agentische KI. Ein Einkaufsassistent, der eine eingehende Rechnung liest, sie mit der Bestellung abgleicht, den Lieferantenstammsatz abfragt, eine Abweichung markiert und eine freigegebene Zahlungsanweisung im Finanzsystem erfasst. Jeder Schritt ist unspektakulär. Die Kombination ist agentisch, weil das System die Abfolge geplant, mehrere Werkzeuge genutzt und eine finanzielle Wirkung erzeugt hat, ohne dass eine Person diese konkrete Zahlung freigegeben hätte. Die generative Fassung desselben Assistenten hätte eine Zusammenfassung für einen Sachbearbeiter verfasst. Ist agentische KI nach der KI-Verordnung hochriskant? Nicht automatisch und nicht deshalb, weil sie agentisch ist. Die Einstufung hängt vom Anwendungsfall ab, davon, ob das System Sicherheitsbauteil ist oder in einen Bereich des Anhangs III fällt. Die Schwierigkeit liegt darin, dass ein universell einsetzbarer Agent viele Anwendungsfälle erreichen kann, und Analysen weisen darauf hin, dass solche Systeme standardmäßig in den Anwendungsbereich fallen könnten, sofern der Anbieter Hochrisiko-Verwendungen nicht bewusst und belegbar ausschließt. Stufen Sie nach dem ein, was der Agent erreichen kann, und behandeln Sie den Ausschluss als nachweisbare technische Kontrolle statt als Richtlinienaussage. Braucht agentische KI eine andere Risikoanalyse als generative KI? Ja, und nicht bloß eine längere. Eine generative Analyse ist weitgehend ausgabezentriert und fragt, was das System sagen könnte und wer dadurch Schaden nehmen könnte. Eine agentische Analyse muss handlungszentriert und auf Systemebene erfolgen: was der Agent erreichen, was er verändern kann, was geschieht, wenn ein Schritt auf halbem Weg fehlschlägt, und wie sich Fehler über Schritte oder Agenten hinweg aufschaukeln. Das Berkeley-Profil ordnet dies den Funktionen des NIST AI RMF zu, sodass die meisten Organisationen eine vorhandene Methode erweitern können, statt eine neue einzuführen. Brauche ich eine eigene KI-Richtlinie für Agenten? Meist kein eigenes Dokument, aber das bestehende braucht neue Klauseln: wer einem Agenten Werkzeugzugriff gewähren darf und unter welcher Freigabe, welche Handlungsklassen stets einen menschlichen Kontrollpunkt erfordern, welche Protokollierungs- und Identitätspflichten gelten und welches Ereignis eine Neueinstufung auslöst, sobald eine agentische Fähigkeit aktiviert wird. Diese Klauseln in Ihre KI-Richtlinie aufzunehmen, erhält ein einziges durchsetzbares Regelwerk statt zweier konkurrierender.
Fazit
Der Vergleich, den alle veröffentlichen, ist richtig und endet eine Stufe zu früh. Generative KI erzeugt, agentische KI handelt, und die interessante Frage lautet, was Sie das kostet. Es kostet eine Neueinstufung, weil sich die Menge erreichbarer Verwendungen erweitert hat. Es kostet eine neu entworfene Aufsicht, weil Artikel 14 genau dann mehr verlangt, wenn die Autonomie die Erfüllung erschwert. Es kostet ein neues Risikoregister, weil die Fehlerbilder die Kategorie gewechselt haben. Es kostet ein schwereres Nachweispaket, weil die Prüfinstanz nun fragt, was das System getan hat und unter wessen Befugnis. Und es kostet eine neu verhandelte Lieferantenbeziehung, weil die Partei, die die Fähigkeit verändert, selten jene ist, die die Folgen trägt. Nichts davon spricht gegen Agenten. Alles davon spricht dafür, genau zu wissen, wann Sie einen erworben haben. Prüfen Sie Ihr Portfolio in diesem Quartal mit den fünf Fragen und sehen Sie nach, welcher Anteil die Grenze bereits überschritten hat. Wer Einstufung, Aufsichtsgestaltung, Risikoregister und Nachweiskette an einer Stelle führen will statt in fünf Tabellen, findet in AI Sigil genau dafür die Grundlage.