Absicherung von KI-Systemen

Was sind Guardrails?

Leitplanken

Guardrails sind technische und organisatorische Leitplanken, die festlegen, welche Eingaben ein KI-System verarbeitet, welche Ausgaben es herausgibt und welche Aktionen es ohne menschliche Freigabe auslösen darf.

Der Begriff fällt meist in dem Moment, in dem ein Assistent nicht mehr nur Texte schreiben, sondern auf echte Kundendaten zugreifen oder etwas im System auslösen soll.

KI-generiertDieses Bild wurde mit KI erzeugt · Yves Hoppe / KI / cmt
Greift an drei Stellen
Eingabe, Ausgabe und ausgelöste Aktionen
Umfasst
Technik und verbindliche Regeln im Betrieb
Stärkste Stufe
Eingeschränkte Rechte statt Textprüfung
Verwechselt mit
Dem Systemprompt

Drei Stellen, an denen Leitplanken sitzen

Auf der Eingabeseite prüfst du, was überhaupt zum Modell durchgereicht wird. Dazu gehören das Erkennen und Maskieren personenbezogener Daten, das Abweisen von Anfragen außerhalb des vorgesehenen Themas und eine Größenbegrenzung für Anhänge, damit niemand ein ganzes Archiv durchschleust.

Auf der Ausgabeseite prüfst du, was zurückgeht: Passt die Antwort zum vorgegebenen Schema, enthält sie interne Kennungen oder Datensätze, die den Kanal nicht verlassen dürfen, steht hinter jeder Aussage eine Quelle aus dem freigegebenen Bestand? Eine Antwort, die kein gültiges JSON ist, wird gar nicht erst weitergegeben.

Die dritte und wichtigste Ebene sind Aktionsrechte. Ein Agent kann nur ausführen, wozu du ihm ein Werkzeug gibst. Lesende Zugriffe darf er meist frei nutzen, schreibende, löschende oder nach außen gerichtete Schritte laufen über eine Bestätigung, eine Freigabeliste erlaubter Ziele oder ein Limit pro Vorgang.

Die organisatorische Hälfte

Technik allein trägt nicht. Genauso wichtig ist, dass festgelegt ist, wer ein System freigibt, wer die Protokolle liest und wer es im Zweifel abschaltet. Ein Abschalter, den nur eine Person kennt und der nie geprobt wurde, ist keiner.

Genauso gehört ein Budget dazu, in Geld und in Schritten. Ein Agent, der bei einer unerwarteten Antwort in eine Schleife läuft, verbrennt sonst über Nacht Tokens, ohne dass jemand es merkt. Ein hartes Limit für Werkzeugaufrufe pro Vorgang ist die billigste Leitplanke, die du bauen kannst.

Warum der Systemprompt allein nicht reicht

Der häufigste Fehler ist, die Regeln nur in die Systemanweisung zu schreiben. Ein Prompt ist eine Bitte, keine Sperre: Er steht im selben Kanal wie der Inhalt, den das Modell verarbeitet, und lässt sich durch Text im Dokument oder in der Mail überschreiben. Wirksam wird eine Regel erst, wenn sie außerhalb des Modells durchgesetzt wird, also im Code, in den Zugriffsrechten oder im Netzwerk.

Der zweite Fehler ist die Gegenrichtung. Leitplanken, die zu eng sind, blockieren normale Arbeit, und dann weichen die Leute auf private Zugänge aus. Was dabei entsteht, ist Schatten-KI: dieselben Daten, dieselben Aufgaben, nur ohne Protokoll und ohne Vertrag. Eine Leitplanke, die niemand akzeptiert, senkt das Risiko nicht, sie verschiebt es nur aus dem Blickfeld.

KI-generiertDieses Bild wurde mit KI erzeugt · Yves Hoppe / KI / cmt
Nicht verwechseln

Guardrails und was oft damit gleichgesetzt wird

Guardrails gegen Prompt Injection

Prompt Injection ist der Angriff, Guardrails sind die Antwort darauf. Sie machen den Angriff nicht unmöglich, sie begrenzen, was er anrichten kann.

Guardrails gegen Systemprompt

Der Systemprompt beschreibt Verhalten innerhalb des Modells und kann durch Inhalte überschrieben werden. Eine Guardrail wird außerhalb erzwungen und lässt sich nicht wegformulieren.

Guardrails gegen KI-Governance

Governance klärt Zuständigkeiten, Richtlinien und Nachweise auf Unternehmensebene. Guardrails sind die Umsetzung davon in einem einzelnen System.

KI-generiertDieses Bild wurde mit KI erzeugt · Yves Hoppe / KI / cmt
In der Praxis

Zu enge Leitplanken werden umgangen

Wenn ein abgesicherter Assistent bei jeder zweiten Frage abblockt, arbeiten die Leute daran vorbei, mit dem privaten Zugang auf dem eigenen Telefon. Dann liegen Kundendaten genau dort, wo sie nicht liegen sollen, und niemand sieht es mehr. Eine Leitplanke, die den Arbeitsalltag unmöglich macht, senkt am Ende die Sicherheit.

Deshalb lohnt es sich, mitzuschreiben, was geblockt wurde, und diese Liste regelmäßig anzusehen. Häufen sich dieselben berechtigten Anfragen, ist die Regel zu grob und nicht die Belegschaft zu unwillig. Umgekehrt zeigt dieselbe Liste, welche Daten die Leute überhaupt in solche Systeme geben würden.

Die härteste Leitplanke ist ohnehin keine Textprüfung, sondern die Frage, was das System technisch auslösen darf. Ein Assistent ohne Schreibrechte kann nichts verändern, egal wie geschickt jemand seine Eingabe formuliert, und was er überhaupt lesen darf, ist die zweite Entscheidung derselben Art. Alles, was über das Lesen hinausgeht, gehört bewusst freigegeben und protokolliert.

Guardrails lernen

Wie du Freigaben, Rechte und Protokolle für einen produktiven Agenten aufsetzt, zeigen die Trainings zu Kontrolle und Sicherheit im Agentenbetrieb .

Gegen welche Angriffe die Leitplanken überhaupt schützen sollen, klären die Kurse zur Absicherung von KI-Anwendungen .

Häufige Fragen

Reicht es, die Regeln in den Systemprompt zu schreiben?
Nein. Alles, was im Prompt steht, steht im selben Kanal wie die verarbeiteten Inhalte und kann von dort überschrieben werden. Regeln, deren Bruch teuer wäre, gehören in Code, Rechte und Netzwerkgrenzen. Der Prompt hilft zusätzlich, er trägt aber nicht allein.
Wie streng sollten Leitplanken sein?
So streng, wie der Schaden es verlangt. Ein Assistent, der Textentwürfe schreibt, braucht andere Grenzen als ein Agent mit Schreibrechten im Warenwirtschaftssystem. Sinnvoll ist, unumkehrbare Schritte immer über eine Freigabe laufen zu lassen und alles andere zunächst offen zu halten.
Woran merke ich, dass die Leitplanken greifen?
Nur an Protokollen und an gezielten Tests. Wenn du nicht mitschreibst, welche Werkzeuge ein System aufgerufen und welche Eingaben es abgewiesen hat, kannst du hinterher weder einen Vorfall aufklären noch belegen, dass die Regeln überhaupt aktiv waren.
Persönlich für dich da

Deine Ansprechpartner

Du willst das Thema nicht nur nachschlagen, sondern anwenden können? Wir beraten dich persönlich und kostenlos.

Yves Hoppe

Yves Hoppe

Weiterbildung & Beratung

Ordnet mit dir ein, welcher Kurs zu deinem Vorwissen passt.

Norbert Jansen

Norbert Jansen

Beratung & Inhouse

Plant Inhouse-Trainings, die an euren eigenen Daten und Abläufen ansetzen.

Guardrails im Kurs statt im Lexikon

Nachschlagen bringt dich bis zum Verstehen. Anwenden lernst du an echten Aufgaben.