Die "Zero-Halluzination"-TypeSafe-KI bezieht sich darauf, dass Jev keinen Inhalt außerhalb des vordefinierten Typs zurückgibt, was nicht bedeutet, dass jedes Geschäftsurteil zu 100 % korrekt ist. Choice erzeugt Option 256 nicht aus dem Nichts, und Score gibt keine ungültige Bewertung zurück, kann aber dennoch die falsche Option unter legitimen Optionen auswählen. Beim Start muss das Risiko mittels Wahrscheinlichkeit, Vertrauen, Testsätzen und manueller Überprüfung kontrolliert werden.
Was kann garantiert werden?
Jevs Antwortraum ist durch Anfragen vordefiniert, sodass Programme sich keine Sorgen machen müssen, plötzlich einen ungelösten Chat, einen fiktiven Werkzeugnamen oder einen Fehlerfeldtyp zu erhalten. Die offizielle Beschreibung von "typlosen Fehlern" ist eine strukturelle Garantie, die häufige Parsingfehler und Out-of-Bounds-Ausgabeprobleme in automatisierten Systemen löst.
Und was ist es, das nicht garantiert werden kann?
Das Modell kann weiterhin mehrdeutige Anweisungen missverstehen, indirekte Beziehungen ignorieren oder von langen, irrelevanten Informationen abgelenkt werden. Die offiziellen Schwächen, die in Jev 1.13 aufgelistet sind, umfassen präzises Zählen, Mathematik, Datumsvergleich, komplexes indirektes Denken, kontradiktorische Inhalte und Konfliktstandards. Korrekte Struktur, korrekte Fakten und korrektes Urteil sind drei verschiedene Dinge.
| Das Ergebnis | Ob der Typ legal ist | Bestimmung der Zuverlässigkeit |
|---|---|---|
| Rücksendeabrechnung von Abrechnung und technischer Technik | Rechtlich | Es hängt immer noch vom Inhalt der Nachrichten und der Wahrscheinlichkeit ab |
| Gibt undefinierte legal_team | Illegal | Die Typbeschränkung von JEV blockiert sie |
| Automatische Rückerstattungen sind weiterhin möglich, wenn das Vertrauen gering ist | Exporte können legal sein | Geschäftsstrategien sind unsicher |
Wie sollte Selbstvertrauen genutzt werden?
Choice und Score geben Wahrscheinlichkeitsverteilungen zurück und bieten eine Konfidenz von 0 bis 1; Noul gibt die Wahrscheinlichkeit für "Ja" direkt ohne zusätzliche Sicherheit zurück. Es gibt keine universelle Antwort auf die Schwelle; sie sollte auf Grundlage der Kosten eines Fehlurteils festgelegt werden: Inhaltsempfehlungen können relativ großzügig sein, während Rückerstattungen, Sperren und medizinische Umleitungen konservativer sein sollten.
Das System kann in drei Stufen gestaltet werden: hochzuverlässige automatische Ausführung, zwischenliegende Bereiche, die zur manuellen Überprüfung geschickt werden, und niedrige Zuverlässigkeit bei der Ablehnung automatischer Maßnahmen oder des Wechsels auf einen sicheren Pfad. Schwellenwerte müssen mit echten Samples debugget werden und können nicht direkt aus den Demonummern kopiert werden.
Vier Wege, Fehlurteile zu reduzieren
- Jede Frage drückt nur ein Urteil aus, und Randbedingungen sind in die Kriterien eingebunden.
- Zuerst filtern Sie irrelevanten Kontext heraus und senden Sie nur den Bundesstaat, der für die Entscheidung benötigt wird.
- Mathematik, Zählen, Datums- und Berechtigungsregeln werden mit deterministischem Code behandelt.
- Eine feste Modellversion wird als Regressionsmenge festgelegt, und Fehlerverteilungen sowie Schwellenwerte werden vor dem Hochstufen verglichen.
"Null-Illusion" kann also als Ausgaben verstanden werden, die keine Typgrenzen überschreiten, anstatt dass das Modell die Fähigkeit erlangt, niemals Fehler zu machen. Nur durch das Schreiben dieser Grenze in die Architektur kann TypeSafe die Automatisierungszuverlässigkeit wirklich verbessern.