Zurück zu KI-Informationen
Anthropic veröffentlicht Constitutional Classifiers++: Combat Universal Jailbreaks mit etwa 1 % des Rechenleistungsaufwands

Anthropic veröffentlicht Constitutional Classifiers++: Combat Universal Jailbreaks mit etwa 1 % des Rechenleistungsaufwands

KI-Informationen Admin 69 Aufrufe

Am 9. Januar 2026 veröffentlichte Anthropic Forschungsartikel und Papiere, um "Next-generation Constitutional Classifiers" (auch bekannt als Constitutional Classifiers++) zu starten, um die Schutzeffizienz großer Modelle gegen "General Jailbreak"-Angriffe zu verbessern. Beamte erklärten, dass das neue System die zusätzliche Rechenleistung bei der Produktionsbereitstellung auf etwa 1 % reduziert, die Ablehnungsrate bei harmlosen Anfragen auf 0,05 % senkt und keine universelle Jailbreak-Lösung gefunden hat, die stabil in Tests und Red-Teaming-Offensiven und Verteidigungen funktioniert.

Der Kern des Schemas ist eine kombinierte Verteidigungslinie: Der "Conversation Exchange"-Klassifikator wird verwendet, um Eingaben und Ausgaben im selben Kontext zu platzieren, und dann wird eine zweistufige Kaskadenstruktur verwendet, um alle Gespräche mit Lichtabschirmung abzudecken, wobei nur verdächtige Inhalte auf einen stärkeren Klassifikator aufgerüstet werden. Die Studie wies außerdem darauf hin, dass das alte System weiterhin von zwei Arten von Techniken verwendet wird: "Refactoring-Angriffe", die schädliche Informationen in scheinbar harmlose Fragmente zerlegen und wieder zusammensetzen, und "Output-Verschleierung", bei der Metaphern und Ersatzwörter verwendet werden, um das Ergebnis harmlos erscheinen zu lassen.

FAQs

F: Was lösen die Constitutional Classifiers++ von Anthropic hauptsächlich?

A: Das System ist auf großen Modell-Sicherheitsschutz ausgerichtet und konzentriert sich darauf, die Erfolgsquote von "Universal Jailbreak" durch das Umgehen von Leitplanken zu senken und gleichzeitig Kosten und falsche Ablehnungen zu kontrollieren.

F: Wo sind die Verbesserungen bei den Verfassungsklassifikatoren++ im Vergleich zur vorherigen Generation?

A: Die Hauptänderung besteht darin, Ein- und Ausgabe als dasselbe "Austausch"-Joint Discrimination zu verwenden und eine zweistufige Kaskaden- und Sondenintegration zu nutzen, um den Rechenleistungsaufwand und harmlose Ablehnungen zu reduzieren.

F: Was bedeutet die Studie mit "universellem Jailbreak"?

A: Es bezieht sich auf eine Reihe von Angriffsstrategien, die Sicherheitsmechanismen bei verschiedenen Fragen stabil umgehen und das Modell kontinuierlich dazu bringen können, eingeschränkte Inhalte auszugeben.

F: Worauf sollten Unternehmen oder Entwickler beim Zugriff auf diese Art von Sicherheitsklassifizor achten?

A: Die Auswirkungen falscher Ablehnungen auf Geschäftsprozesse, die Compliance-Handhabung von Konversionsprotokollen und sensiblen Daten sowie die durch unzureichenden Red-Teaming-Abdeckungen verursachten Restrisiken müssen weiterhin bewertet werden.

Anthropic veröffentlicht Constitutional Classifiers++ Anti-Generic Jailbreak Anthropic sagt, dass Classifiers++ mit einer 1 % Steigerung der Rechenleistung immer noch sicherer ist Anthropisch reduzierte die falsche Ablehnung auf 0,05 %, was zu einer Kontroverse um die Leitplanke führte Anthropic ist jetzt als Next-generation Constitutional verfügbar Klassifikatoren verbessern die Verhinderung von Gefängnisausbrüchen Anthropic behauptet, es gebe keine stabile universelle Lösung für den Gefängnisausbruch, aber es gibt dennoch blinde Flecken Anthropic nutzt Input/Output und kontextuelle Diskriminierung, um Jailbreak-Schwachstellen zu schließen Anthropics zweistufige Kaskaden-Klassifikatoren++ gleichen Kosten und Abfangrate aus Anthropic führt aktivierte lineare Sonden ein, um Leitplanken schwerer zu umgehen zu machen Anthropische integrierte Sonde + externer Klassifikator zur verbesserten Sicherheitsbestimmung Anthropics Arbeit zeigt, dass alte Leitplanken leicht durch Refactoring-Angriffe umgangen werden Anthropic weist darauf hin, dass Output-Verwirrung dennoch durchdringen kann, indem Wörter durch Metaphern ersetzt werden Anthropic Red Team Test Classifiers++ wurde durch den Universal Jailbreak noch nicht gebrochen Anthropic setzt Classifiers++ in der Produktion ein und konzentriert sich auf geringe Kosten und hohen Schutz Anthropic nutzt den Dialogaustausch als Einheitenbewertung, um Jailbreak näher an den tatsächlichen Kampf heranzubringen Anthropic verbessert die Leitplanken von Einzelrunden zu Tauschurteilen, um Fehlalarme zu reduzieren Warum anthropische Klassifikatoren++ die harmlose Abstoßrate auf 0,05 % senken. Anthropics neue Sicherheitstipps: Nur bei Verdacht rüstest du einen starken Klassifikator auf, um Kosten zu senken Anthropische leichte Screening deckt das gesamte Gespräch ab, verdächtig, und eine tiefgehende Untersuchung ist stabiler Anthropic behauptet, dass Classifiers++ gegen universellen Jailbreak sei, aber beide Angriffsarten sind dennoch gefährlich Anthropic warnt, dass Refactoring-Angriffe schädliche Fragmente als harmlose Fragmente tarnen Anthropic warnt, dass die Verschleierung von Ausgaben Inhalte scheinbar harmlos erscheinen lässt, aber tatsächlich illegal ist Wie Anthropic eine Kaskadenstruktur nutzt, um Leitplankenobergrenzen auf 1 % zu steuern. Ob Anthropics neues Leitplankensystem wirklich universelles Jailbreaken beenden kann, steht im Mittelpunkt Anthropic behauptet, es gebe keine stabile Jailbreak-Lösung, aber Unternehmen müssen sich trotzdem testen und verifizieren Anthropisch Klassifikatoren++ reduziert falsche Ablehnungen, kann aber das Zitationsdilemma übersehen Anthropic kombiniert Eingabe und Ausgabe, um Jailbreak-Edge-Space zu reduzieren Anthropic nutzt die interne Aktivierung des Probe-Readings, um Diskussionen über die Interpretierbarkeit anzustoßen Das Sicherheitspapier von Anthropic offenbart die Details der Classifiers++-Integrationsentscheidung offen Anthropic veröffentlicht Constitutional Klassifikatoren++ gegen das Gefängnisausbruch-Wettrüsten Anthropic sagt, dass die Produktion verfügbar ist, aber die Risiken für die Einhaltung des Konversationsprotokolls bestehen weiterhin Anthropic bietet Entwicklern Anti-Jailbreak-Leitplanken, weigert sich aber fälschlicherweise, das Geschäft zu beeinflussen Anthropische Leitplanken-Upgrades zielen auf universelle Jailbreaks ab, um die Kosten für die Patching nach dem Start zu senken Anthropisch Wie Classifiers++ metaphorische Jailbreaks erkennt, muss noch getestet werden Kann Anthropics zweistufige Klassifikator-Strategie mit Angriffen auf lange Gespräche umgehen? Anthropics neue Leitplanke konzentriert sich auf fehlerarme Ablehnungen, was die Intensität der Zensurkontroversen erhöhen könnte Anthropic sagte, dass die Abfangaktion stärker ist, aber es ist besorgt, ob sie bei normaler Produktion versehentlich verletzt wird Anthropics Einbettung von Klassifikatoren++ in die Produktion wirft Datenschutz-Governance-Bedenken auf Die universelle Jailbreak-Definition von Anthropic fördert die Standardisierung von Sicherheitsbewertungen Anthropic befürwortet Classifiers++ mit Red Teaming Offense und Defense, aber es gibt Bedenken wegen unzureichender Abdeckung Anthropic zeigt einen neuen Trend im Jailbreaking: Splitting und Refactoring sind schwerer zu verhindern als ein Straight Ball Anthropic zeigt einen neuen Trend im Jailbreaking: Output-Verschleierung erschwert die Moderation Anthropische Klassifikatoren++ integrieren Austauschkontexte in Urteile, um außerhalb des Kontexts befindliche Bedeutungen zu reduzieren Es ist zweifelhaft, dass Anthropics neues System die 0,05%ige Ablehnung harmloser Anfragen reproduzieren kann. Anthropic beansprucht 1 % der zusätzlichen Rechenleistung, aber die tatsächlichen Kosten können je nach Szenario schwanken Anthropic drängt die nächste Generation der Verfassungsklassifikatoren, um die Leitplankenroute neu zu gestalten Warum das anthropische Leitplanken-Upgrade lineare Sonden und externe Klassifikatoren einführt Anthropische Klassifikatoren++ bedeuten geringere Kosten und einen höheren Compliance-Druck für den Unternehmenszugang Anthropic betonte, dass die roten Teams weiterhin getestet werden müssen, da sonst die Restrisiken negativ reagieren können Anthropics neues Geländer blockiert den universellen Jailbreak und legt gleichzeitig zwei große Lücken offen: Refactoring und Verschleierung

Empfohlene Tools

Mehr