ToolNavs Outils IA à découvrir
Proposer Connexion

vLLM

Débit, mémoire GPU et concurrence : voilà ce qui compte pour vLLM. Pas d’interface de chat, l’objectif est de transformer des modèles ouverts en API capable de tenir en production, tandis que l’appel d’outils, les backends MoE et le cache long contexte continuent de progresser.

vLLM se place entre le modèle et l'application : les frontaux et les bases de connaissances ne sont pas son affaire, il transforme des modèles ouverts en services stables et économes en mémoire. Les équipes qui hébergent leur propre API de modèles le mettent sur la liste ; qui veut seulement discuter en local le trouve trop lourd. Les dernières versions soignent le socle : MoE fusionné pour TRTLLM, backends FP8 et MTP. L'appel d'outils exige --enable-auto-tool-choice et le bon parser.