vLLM
Débit, mémoire GPU et concurrence : voilà ce qui compte pour vLLM. Pas d’interface de chat, l’objectif est de transformer des modèles ouverts en API capable de tenir en production, tandis que l’appel d’outils, les backends MoE et le cache long contexte continuent de progresser.