Optimisation de l’inférence LLM
Changer la façon d’ordonner les requêtes peut multiplier le débit d’une même carte. Voici ce que le batching continu, le décodage spéculatif, le cache KV et la mise en cache du contexte économisent chacun, et jusqu’où les bibliothèques de noyaux et les architectures creuses peuvent aller.
Le batching continu ramène l’ordonnancement à un pas de génération ; le décodage spéculatif fait rédiger un petit modèle pendant que le grand valide un bloc d’un coup. Le cache KV réutilise les états d’attention, la mise en cache garde les résultats des longs documents. Le MoE n’active que quelques experts par jeton, Kimi Linear réduit d’environ 75 % le cache KV à un million de contexte. Le gain dépend de la charge : le code accepte de longs brouillons, l’écriture libre souvent non.