KI-Leitplanken
Ein Modell, das sich selbst überwachen soll, ist keine Sicherheitsgrenze. Hier geht es um die Schichten eines Guardrail-Stacks, die Einfallstore für Prompt Injection und darum, warum Rechte und Freigaben in deterministischem Code außerhalb des Modells liegen müssen.
System-Prompts teilen den Sprachraum mit Nutzereingaben, Injection kippt Entscheidungen; Leitplanken gehören deshalb nach außen: Eingaben prüfen, Kontext nach Quelle trennen, Werkzeugaufrufe über Erlaubnislisten, riskante Aktionen hinter Freigabe. Constitutional Classifiers++ hält den Zusatzaufwand der Jailbreak-Abwehr bei etwa einem Prozent. Leitplanken stoppen keinen Angriff, sie begrenzen den Fehler auf die Rechtegrenze.