ToolNavs Outils IA à découvrir
Proposer Connexion
Retour à Informations sur l’IA
Test Baseten : le moteur d'inférence écrit par Claude est 90 % plus rapide que vLLM

Test Baseten : le moteur d'inférence écrit par Claude est 90 % plus rapide que vLLM

Informations sur l’IA • Admin • • 20 vues

Un moteur d'inférence peut-il être écrit de zéro par un agent d'IA et dépasser un framework généraliste éprouvé ? Le blog d'ingénierie de Baseten, mis à jour le 2 octobre 2026, rapporte précisément un tel test : en s'inspirant de l'article MetaInfer, ses ingénieurs ont fait construire par Claude Code (Fable 5) un moteur d'inférence sur mesure pour Qwen-3.6-35B-A3B, fonctionnant en précision NVFP4 sur un seul NVIDIA B200, et l'ont baptisé VibeQwen. MetaInfer repose sur un framework « skills-only » et ne nécessite aucun post-entraînement du modèle.

Les chiffres clés : 90 % plus rapide en flux unique, latence du premier token réduite de plus de moitié

VibeQwen a atteint 1792 TPS en décodage à flux unique, contre 943 TPS pour un vLLM 0.25.1 optimisé, soit 90 % plus rapide. La latence du premier token est de 12 ms contre 28 ms, soit une amélioration d'un facteur 2,33, et avec une concurrence de 32, le débit de sortie atteint 10307 TPS contre 6030 TPS pour vLLM, soit 71 % de plus. Point notable : la référence de comparaison est un vLLM optimisé, et non une configuration par défaut.

L'objectif était de dépasser vLLM de 20 % sur tous les indicateurs sans perdre en précision, la référence de précision étant le BF16. Claude a travaillé de manière largement autonome pendant environ une semaine, consommant quelque 1,7 milliard de tokens (pour l'essentiel des entrées mises en cache) et environ 200 heures de B200, et avait rattrapé vLLM dès les premiers jours ; lorsque la précision présentait de légères différences numériques, une approbation humaine était requise pour continuer.

La deuxième expérience, Sammie : la réutilisation de la base de connaissances rend l'exercice plus rapide et moins cher

Baseten a ensuite mené une deuxième expérience, Sammie : un agent a construit un service d'inférence pour le modèle de segmentation d'images SAM 3.1, atteignant 91 images par seconde sur un seul H100, soit un débit 50 % supérieur au serveur de référence officiel de Meta, en seulement quelques jours et environ 200 millions de tokens. Si ce fut plus rapide et moins coûteux, c'est parce que l'expérience a réutilisé la base de connaissances constituée lors de la première. Les deux expériences ont coûté de quelques centaines de dollars pour Sammie à quelques milliers de dollars pour VibeQwen. Cette réutilisabilité de l'expérience vaut peut-être davantage qu'un résultat isolé.

Limites et conditions : encore expérimental, et la contrainte de précision doit être verrouillée d'avance

Les deux moteurs restent expérimentaux et ne traitent aucun trafic de production. Baseten précise aussi que l'agent était autorisé à consulter les noyaux existants de vLLM et de TensorRT-LLM, au lieu d'être totalement isolé du code source comme dans l'article d'origine. Ce type d'optimisation automatique repose sur deux conditions : les indicateurs d'inférence sont quantifiables et la justesse peut être vérifiée numériquement par rapport à une implémentation de référence en pleine précision, ce qui donne à chaque amélioration un étalon objectif ; et la contrainte de précision doit être verrouillée à l'avance, faute de quoi l'agent trouvera des failles, par exemple en ne produisant qu'un seul et même caractère pour gonfler les indicateurs.

La faiblesse des moteurs généralistes est précisément l'espace de l'optimisation sur mesure

vLLM, SGLang et TensorRT-LLM s'imposent par leur caractère généraliste et leur simplicité d'usage, mais pour une combinaison précise de modèle, de matériel et de charge, ils ne sont généralement pas optimaux. Les dépenses d'inférence sont considérables, et un gain de quelques points de pourcentage représente des millions de dollars à grande échelle : c'est exactement là que trouve sa place un moteur dédié.

Outils Recommandés

Plus