ToolNavs Outils IA à découvrir
Proposer Connexion
Retour à Informations sur l’IA
vLLM ajoute un filigrane texte sans distorsion : des sorties traçables pour un coût de vitesse quasi nul

vLLM ajoute un filigrane texte sans distorsion : des sorties traçables pour un coût de vitesse quasi nul

Informations sur l’IA • Admin • • 9 vues

Dans un billet de blog du 24 septembre 2026, vLLM a annoncé que son moteur d'inférence prend désormais officiellement en charge le filigrane de texte basé sur Gumbel-max. L'objectif est direct : rendre la provenance du texte généré par le modèle traçable — sans déformer la distribution de sortie du modèle et sans ralentir l'inférence. Selon les mesures officielles, Qwen3.5-27B avec le filigrane activé reste dans les barres d'erreur sur tous les benchmarks ; le débit varie entre −1,1 % et +2,0 % — pratiquement négligeable.

Comment fonctionne le filigrane : marquer l'aléatoire

Chaque fois qu'un modèle de langage génère un token, il note d'abord chaque token candidat puis échantillonne aléatoirement. L'idée du filigrane ne touche pas le texte — elle marque l'étape « aléatoire » elle-même : une clé secrète, les tokens de contexte récents et l'identifiant du token candidat passent par une fonction pseudo-aléatoire qui calcule un ensemble reproductible de valeurs aléatoires ; celles-ci sont ajoutées aux logits comme bruit de Gumbel, et le token correspondant au maximum est choisi.

La propriété mathématique clé : l'argmax sur du bruit de Gumbel est exactement équivalent à un échantillonnage ordinaire depuis la distribution de probabilité d'origine. Autrement dit : à une étape donnée, la probabilité qu'un token soit choisi est identique avec ou sans filigrane — la distribution de sortie n'est pas tordue, le modèle ne favorise pas systématiquement certains mots ou styles. Qui détient la clé peut recalculer les valeurs aléatoires d'alors ; sans la clé, cela ressemble simplement à un échantillonnage aléatoire ordinaire.

Détection : vérification à rebours

La détection n'a besoin ni des poids du modèle ni des logits — juste de la clé secrète et du tokenizer. Le texte à examiner est reconverti en identifiants de tokens, et pour chaque token la valeur pseudo-aléatoire est recalculée à partir de son contexte précédent et de la clé : pour un texte non filigrané, ces valeurs sont uniformément aléatoires ; pour un texte filigrané, les tokens choisis sont systématiquement biaisés vers les plus grandes valeurs. La somme des scores de chaque token suit une distribution Gamma et donne une p-value — plus elle est petite, moins le « hasard » est probable.

Un texte plus long avec plus d'étapes à haute entropie donne un signal plus fort : l'écriture créative approche un taux de détection proche de 100 % dès une centaine de tokens. Copier-coller un passage entier n'efface pas les preuves ; une réécriture locale perturbe les scores près des tokens édités, mais dès que les modifications sortent de la fenêtre de contexte, le signal restant demeure intact.

Deux gros morceaux : le décodage spéculatif et la diversité

Transformer l'article en moteur opérationnel a exigé de résoudre deux gros morceaux. Le premier est le décodage spéculatif : si les modèles brouillon et cible partagent un même filigrane, le recouvrement de leurs distributions chute et le taux d'acceptation en souffre. La réponse de vLLM : des clés doubles (PR #56122) — les tokens brouillon acceptés utilisent une clé, les tokens résiduels et bonus du modèle cible une autre — ce qui préserve le taux d'acceptation, au prix de combiner les scores des deux clés à la détection, ce qui dilue le signal.

Le second est la diversité de sortie : l'absence de distorsion par token ne garantit que la distribution « d'une étape », pas celle de la séquence entière. Si un contexte se répète, une clé fixe produit des valeurs aléatoires identiques, et le modèle peut sombrer dans une répétition infinie. vLLM résout cela par une déduplication de contexte au moment de la génération (PR #56233) : quand un contexte se répète, le filigrane est sauté, préservant l'absence de distorsion au niveau de la séquence — le débit de bout en bout mesuré baisse d'au plus 0,19 %.

Côté ingénierie, le filigrane se branche directement dans le pipeline d'échantillonnage de Model Runner v2 (PR #54053) ; génération pseudo-aléatoire, transformation de Gumbel et argmax sont fusionnés en un seul noyau GPU, évitant un énorme surcoût temporaire de VRAM.

Qui l'adoptera en premier ?

Les premiers bénéficiaires sont les entreprises et sociétés qui auto-hébergent vLLM : en proposant des API à l'extérieur, elles peuvent tamponner les sorties d'un « certificat de naissance » vérifiable — pour la provenance, les traces de conformité ou pour distinguer leur propre modèle des imposteurs. Les limites doivent être dites franchement : la détection dépend de la possession de la clé et n'est pas vérifiable publiquement ; les textes courts et fortement formatés donnent un signal faible ; et cela contrarie le « déni de provenance », pas un réécrivain déterminé.

La provenance du texte fait l'objet de discours depuis des années ; vLLM en a fait un interrupteur dans le moteur d'inférence — sans distorsion, faible surcoût, prêt pour la production. Après cette étape, le débat sur « le contenu généré par l'IA doit-il être traçable » compte au moins une excuse technique de moins.

Outils Recommandés

Plus