Am 9. Januar 2026 veröffentlichte Anthropic Forschungsartikel und Papiere, um "Next-generation Constitutional Classifiers" (auch bekannt als Constitutional Classifiers++) zu starten, um die Schutzeffizienz großer Modelle gegen "General Jailbreak"-Angriffe zu verbessern. Beamte erklärten, dass das neue System die zusätzliche Rechenleistung bei der Produktionsbereitstellung auf etwa 1 % reduziert, die Ablehnungsrate bei harmlosen Anfragen auf 0,05 % senkt und keine universelle Jailbreak-Lösung gefunden hat, die stabil in Tests und Red-Teaming-Offensiven und Verteidigungen funktioniert.
Der Kern des Schemas ist eine kombinierte Verteidigungslinie: Der "Conversation Exchange"-Klassifikator wird verwendet, um Eingaben und Ausgaben im selben Kontext zu platzieren, und dann wird eine zweistufige Kaskadenstruktur verwendet, um alle Gespräche mit Lichtabschirmung abzudecken, wobei nur verdächtige Inhalte auf einen stärkeren Klassifikator aufgerüstet werden. Die Studie wies außerdem darauf hin, dass das alte System weiterhin von zwei Arten von Techniken verwendet wird: "Refactoring-Angriffe", die schädliche Informationen in scheinbar harmlose Fragmente zerlegen und wieder zusammensetzen, und "Output-Verschleierung", bei der Metaphern und Ersatzwörter verwendet werden, um das Ergebnis harmlos erscheinen zu lassen.
FAQs
F: Was lösen die Constitutional Classifiers++ von Anthropic hauptsächlich?
A: Das System ist auf großen Modell-Sicherheitsschutz ausgerichtet und konzentriert sich darauf, die Erfolgsquote von "Universal Jailbreak" durch das Umgehen von Leitplanken zu senken und gleichzeitig Kosten und falsche Ablehnungen zu kontrollieren.
F: Wo sind die Verbesserungen bei den Verfassungsklassifikatoren++ im Vergleich zur vorherigen Generation?
A: Die Hauptänderung besteht darin, Ein- und Ausgabe als dasselbe "Austausch"-Joint Discrimination zu verwenden und eine zweistufige Kaskaden- und Sondenintegration zu nutzen, um den Rechenleistungsaufwand und harmlose Ablehnungen zu reduzieren.
F: Was bedeutet die Studie mit "universellem Jailbreak"?
A: Es bezieht sich auf eine Reihe von Angriffsstrategien, die Sicherheitsmechanismen bei verschiedenen Fragen stabil umgehen und das Modell kontinuierlich dazu bringen können, eingeschränkte Inhalte auszugeben.
F: Worauf sollten Unternehmen oder Entwickler beim Zugriff auf diese Art von Sicherheitsklassifizor achten?
A: Die Auswirkungen falscher Ablehnungen auf Geschäftsprozesse, die Compliance-Handhabung von Konversionsprotokollen und sensiblen Daten sowie die durch unzureichenden Red-Teaming-Abdeckungen verursachten Restrisiken müssen weiterhin bewertet werden.