ToolNavs Annuaire d’outils IA
Proposer Connexion
Retour à Encyclopédie de l’IA
Qu’est-ce que le décodage spéculatif ? Pourquoi les petits modèles peuvent-ils d’abord écrire des brouillons, rendant les grands modèles plus rapides ?

Qu’est-ce que le décodage spéculatif ? Pourquoi les petits modèles peuvent-ils d’abord écrire des brouillons, rendant les grands modèles plus rapides ?

Encyclopédie de l’IA Admin 2 vues

Le décodage spéculatif est une méthode d’accélération par inférence de grand modèle : d’abord, un modèle de brouillon plus léger et plus rapide propose plusieurs jetons candidats successivement, puis le grand modèle cible effectue une vérification parallèle. Lorsqu’un candidat est accepté, le modèle cible peut avancer plusieurs positions dans un seul calcul avant ; Toute partie non qualifiée est corrigée par le modèle cible. Cela optimise le temps d’attente de génération, et non simplement assembler les réponses de deux modèles.

Le ralentissement est généré par chaque jeton

Les modèles autorégressifs doivent généralement être formés comme premier jeton avant que le second puisse avancer. Même avec une forte puissance de calcul GPU, cette dépendance série provoque des calculs courts et courts lors du décodage, et le matériel peut ne pas être pleinement utilisé. On suppose que le décodage rédige d’abord un contenu de suivi possible, puis le soumet à de grands modèles pour étalonnage par lots, réduisant ainsi le nombre d’appels vers le modèle cible.

Le processus peut être compris en quatre étapes :

  1. Le modèle provisoire propose une courte séquence de séquences candidates basée sur le contexte actuel.
  2. Le modèle cible calcule en parallèle les probabilités de ces positions.
  3. Les candidats sont retenus selon les règles d’acceptation, et si un poste ne correspond pas, l’acceptation s’arrête.
  4. Le modèle cible complète les branches correctes avant de commencer la prochaine phase de dessin.

Les algorithmes standards utilisent des règles d’acceptation et de correction de support, afin de pouvoir maintenir la distribution d’échantillonnage originale du modèle cible ; Il ne remplace pas secrètement les grands modèles par de petits modèles, ni ne nécessite de réentraîner le modèle cible.

Pourquoi n’est-ce pas toujours plus rapide ?

La métrique clé est le taux d’acceptation des candidats. Si le modèle de draft est trop faible, il est souvent rejeté dans les premiers jetons, et la rédaction supplémentaire devient un surcoût ; Si le modèle de draft est trop volumineux, il perd la signification de « génération bon marché ». La prévisibilité du texte, la durée des candidats par manche, le parallélisme matériel et la taille du lot influencent tous les revenus. Le contenu avec une forte continuité, comme le code et les formats fixes, est généralement plus susceptible d’accepter des brouillons plus longs que la création très divergente.

Elle diffère des autres méthodes d’accélération qui résolvent des problèmes

La quantification réduit principalement la taille du poids et le coût de calcul, tandis que le cache KV réutilise des états d’attention historiques calculés ; Le décodage spéculatif se concentre sur la manière de permettre à un modèle cible unique de confirmer plus de jetons. Ces méthodes peuvent être combinées, mais elles consomment collectivement de la mémoire et augmentent la complexité de l’ordonnancement.

Pour déterminer s’il vaut la peine de l’adopter, ne regardez pas seulement la vitesse dans la démo. Les équipes de déploiement doivent comparer la durée de leur prompt, la durée de sortie, le volume de concurrence et le matériel pour le temps du premier jeton, la latence par jeton, le débit et l’utilisation de la mémoire, et confirmer que l’accélération ne se fait pas au détriment d’une stabilité réduite.

Outils Recommandés

Plus