Was sind Guardrails?
Leitplanken
Guardrails sind technische und organisatorische Leitplanken, die festlegen, welche Eingaben ein KI-System verarbeitet, welche Ausgaben es herausgibt und welche Aktionen es ohne menschliche Freigabe auslösen darf.
Der Begriff fällt meist in dem Moment, in dem ein Assistent nicht mehr nur Texte schreiben, sondern auf echte Kundendaten zugreifen oder etwas im System auslösen soll.
KI-generiertDieses Bild wurde mit KI erzeugt · Yves Hoppe / KI / cmt
- Greift an drei Stellen
- Eingabe, Ausgabe und ausgelöste Aktionen
- Umfasst
- Technik und verbindliche Regeln im Betrieb
- Stärkste Stufe
- Eingeschränkte Rechte statt Textprüfung
- Verwechselt mit
- Dem Systemprompt
Drei Stellen, an denen Leitplanken sitzen
Auf der Eingabeseite prüfst du, was überhaupt zum Modell durchgereicht wird. Dazu gehören das Erkennen und Maskieren personenbezogener Daten, das Abweisen von Anfragen außerhalb des vorgesehenen Themas und eine Größenbegrenzung für Anhänge, damit niemand ein ganzes Archiv durchschleust.
Auf der Ausgabeseite prüfst du, was zurückgeht: Passt die Antwort zum vorgegebenen Schema, enthält sie interne Kennungen oder Datensätze, die den Kanal nicht verlassen dürfen, steht hinter jeder Aussage eine Quelle aus dem freigegebenen Bestand? Eine Antwort, die kein gültiges JSON ist, wird gar nicht erst weitergegeben.
Die dritte und wichtigste Ebene sind Aktionsrechte. Ein Agent kann nur ausführen, wozu du ihm ein Werkzeug gibst. Lesende Zugriffe darf er meist frei nutzen, schreibende, löschende oder nach außen gerichtete Schritte laufen über eine Bestätigung, eine Freigabeliste erlaubter Ziele oder ein Limit pro Vorgang.
Die organisatorische Hälfte
Technik allein trägt nicht. Genauso wichtig ist, dass festgelegt ist, wer ein System freigibt, wer die Protokolle liest und wer es im Zweifel abschaltet. Ein Abschalter, den nur eine Person kennt und der nie geprobt wurde, ist keiner.
Genauso gehört ein Budget dazu, in Geld und in Schritten. Ein Agent, der bei einer unerwarteten Antwort in eine Schleife läuft, verbrennt sonst über Nacht Tokens, ohne dass jemand es merkt. Ein hartes Limit für Werkzeugaufrufe pro Vorgang ist die billigste Leitplanke, die du bauen kannst.
Warum der Systemprompt allein nicht reicht
Der häufigste Fehler ist, die Regeln nur in die Systemanweisung zu schreiben. Ein Prompt ist eine Bitte, keine Sperre: Er steht im selben Kanal wie der Inhalt, den das Modell verarbeitet, und lässt sich durch Text im Dokument oder in der Mail überschreiben. Wirksam wird eine Regel erst, wenn sie außerhalb des Modells durchgesetzt wird, also im Code, in den Zugriffsrechten oder im Netzwerk.
Der zweite Fehler ist die Gegenrichtung. Leitplanken, die zu eng sind, blockieren normale Arbeit, und dann weichen die Leute auf private Zugänge aus. Was dabei entsteht, ist Schatten-KI: dieselben Daten, dieselben Aufgaben, nur ohne Protokoll und ohne Vertrag. Eine Leitplanke, die niemand akzeptiert, senkt das Risiko nicht, sie verschiebt es nur aus dem Blickfeld.
KI-generiertDieses Bild wurde mit KI erzeugt · Yves Hoppe / KI / cmt
Guardrails und was oft damit gleichgesetzt wird
Prompt Injection ist der Angriff, Guardrails sind die Antwort darauf. Sie machen den Angriff nicht unmöglich, sie begrenzen, was er anrichten kann.
Der Systemprompt beschreibt Verhalten innerhalb des Modells und kann durch Inhalte überschrieben werden. Eine Guardrail wird außerhalb erzwungen und lässt sich nicht wegformulieren.
Governance klärt Zuständigkeiten, Richtlinien und Nachweise auf Unternehmensebene. Guardrails sind die Umsetzung davon in einem einzelnen System.
KI-generiertDieses Bild wurde mit KI erzeugt · Yves Hoppe / KI / cmt
Zu enge Leitplanken werden umgangen
Wenn ein abgesicherter Assistent bei jeder zweiten Frage abblockt, arbeiten die Leute daran vorbei, mit dem privaten Zugang auf dem eigenen Telefon. Dann liegen Kundendaten genau dort, wo sie nicht liegen sollen, und niemand sieht es mehr. Eine Leitplanke, die den Arbeitsalltag unmöglich macht, senkt am Ende die Sicherheit.
Deshalb lohnt es sich, mitzuschreiben, was geblockt wurde, und diese Liste regelmäßig anzusehen. Häufen sich dieselben berechtigten Anfragen, ist die Regel zu grob und nicht die Belegschaft zu unwillig. Umgekehrt zeigt dieselbe Liste, welche Daten die Leute überhaupt in solche Systeme geben würden.
Die härteste Leitplanke ist ohnehin keine Textprüfung, sondern die Frage, was das System technisch auslösen darf. Ein Assistent ohne Schreibrechte kann nichts verändern, egal wie geschickt jemand seine Eingabe formuliert, und was er überhaupt lesen darf, ist die zweite Entscheidung derselben Art. Alles, was über das Lesen hinausgeht, gehört bewusst freigegeben und protokolliert.
Guardrails lernen
Wie du Freigaben, Rechte und Protokolle für einen produktiven Agenten aufsetzt, zeigen die Trainings zu Kontrolle und Sicherheit im Agentenbetrieb .
Gegen welche Angriffe die Leitplanken überhaupt schützen sollen, klären die Kurse zur Absicherung von KI-Anwendungen .
Häufige Fragen
Reicht es, die Regeln in den Systemprompt zu schreiben?
Wie streng sollten Leitplanken sein?
Woran merke ich, dass die Leitplanken greifen?
Deine Ansprechpartner
Du willst das Thema nicht nur nachschlagen, sondern anwenden können? Wir beraten dich persönlich und kostenlos.
Yves Hoppe
Weiterbildung & Beratung
Ordnet mit dir ein, welcher Kurs zu deinem Vorwissen passt.
Norbert Jansen
Beratung & Inhouse
Plant Inhouse-Trainings, die an euren eigenen Daten und Abläufen ansetzen.
Guardrails im Kurs statt im Lexikon
Nachschlagen bringt dich bis zum Verstehen. Anwenden lernst du an echten Aufgaben.
Verwandte Begriffe
Alle Begriffe im Glossar