KI-Leitplanken, allgemein als KI-Leitplanken übersetzt, beziehen sich auf Einschränkungen und Erkennungsmechanismen, die rund um Modelleingaben, Kontext, Werkzeugaufrufe und -ausgaben eingerichtet wurden. Sie sind nicht dasselbe wie ein Systemprompt für ein verbotenes Objekt; Wirklich nutzbare Leitplanken arbeiten schichtweise und begrenzen die Auswirkung, wenn sie umgangen werden.
Warum die Systemaufforderung keine Sicherheitsgrenze ist
Prompts können dem Modell vorschreiben, wie es handeln soll, bleiben dabei aber in derselben natürlichen Sprachumgebung wie Benutzereingabe, Webinhalte und Dateitext. Angreifer können Prompt-Injection, Codierungsverzerrung oder mehrere Stimulationsrunden nutzen, um das Urteil des Modells zu verändern. Wichtiger noch: Wenn die Anwendung dem Modell weiterhin Werkzeuge mit hohen Berechtigungen zur Verfügung stellt, können falsche Aufrufe dennoch reale Folgen haben.
Das Risiko der Prompt-Injection veranschaulicht ein zentrales Prinzip: Sicherheitskontrollen müssen außerhalb des Modells platziert werden, von deterministischen Programmen und Berechtigungssystemen ausgeführt werden und dürfen nicht verlangen, dass das Modell sich selbst überwacht.
Ein Satz Leitplanken ist üblicherweise in fünf Schichten unterteilt
- Eingabeschicht: Untersucht Dateitypen, Längen, bösartige Befehle und sensible Daten, um zu klären, welche Inhalte in das Modell zugänglich sind.
- Kontextschicht: Isoliert Systemregeln, Benutzerdaten und externe Suchinhalte und setzt Grenzen zwischen Quelle und Mieter.
- Tool-Layer: Verwendet Least Privilege, Parametervalidierung, Allowlist und manuelle Freigabe, insbesondere mit Einschränkungen von wirkungsvollen Operationen wie Zahlungen, Löschungen und dem Versand von E-Mails.
- Ausgabeschicht: Prüft auf Datenschutzlecks, gefährliche Inhalte, Formatierungsbeschränkungen und tatsächliche Grundlagen; lehnt das Manual, falls nötig, ab oder leitet es um.
- Laufzeit: Speichert Prüfdaten ohne sensible Zugangsdaten, überwacht abnormale Muster, testet kontinuierlich rote Teams und aktualisiert Regeln.
Jede Schicht löst unterschiedliche Fehlermodi: Ausgabefilterung kann unautorisierte Aufrufe nicht blockieren, und Eingabeabfangen kann das Modell nicht daran hindern, Fakten zu fälschen.
Leitplanken sind keine Genauigkeits-Plugins
Leitplanken können zu falschen Abhörmaßnahmen, verpassten Erkennungen und zusätzlichen Verzögerungen führen. Regeln sind zu streng, normale Anfragen können nicht erfüllt werden; Regeln, die zu locker sind, lassen nur Sicherheitsanzeigen übrig. Teams sollten die Intensität basierend auf dem Geschäftsrisiko festlegen: Gewöhnliche Inhaltserstellung kann automatisch überprüft werden, während Hochrisiko-Operationen strukturierte Parameter, sekundäre Bestätigung und widerrufbare Mechanismen erfordern.
Bevor sie live gehen, müssen KI-Bewertungen mit echten Angriffsproben und normalen Randproben durchgeführt werden, um Abfangraten, Fehlalarme und Auswirkungen auf Vorfälle zu beobachten. Eine ausgereifte Leitplanke verspricht kein Scheitern, sondern bildet vielmehr einen geschlossenen Kreislauf zwischen kontinuierlichem Testen, Genehmigungsisolation und schneller Wiederherstellung.