1. Résumé
Qwen3-Coder-Next est un modèle de code pondéré open source publié par Qwen Team, adapté aux agents de codage et aux scénarios de développement local. Son idée centrale est « MoE ultra-sparse + entraînement d’agent » : le nombre total de paramètres est d’environ 80B, mais seulement environ 3B de paramètres sont activés par jeton, supportant une utilisation à long terme et multi-tours de flux de travail de modification de code avec des coûts d’inférence plus faibles, et obtenant de fortes performances dans les évaluations de codage proxy telles que SWE-Bench Pro.
2. Caractéristiques principales
- Compromis ultra-clairsemé entre efficacité et performance : 80B de paramètres totaux et activation 3B, adapté au contrôle des coûts pour de longues sessions et appels multi-outils.
- Amélioration des capacités basée sur l’agent : Des formules d’entraînement spéciales ont été mises en place autour du raisonnement en lien long, de l’utilisation d’outils complexes et de la récupération après une défaillance d’exécution.
- Contexte long : contexte natif 256K, qui peut être étendu à 1M en combinaison avec Yarn, pour la récupération au niveau du dépôt, les modifications croisées de fichiers et le suivi des dépendances.
- Adaptation de l’échafaudage IDE/CLI : Met l’accent sur la compatibilité avec les formats courants d’invite et d’appel de fonction des agents de codage, couvrant les scénarios terminaux et IDE.
- Formulaires de déploiement multiples : En plus des poids BF16, il existe aussi des formulaires de distribution tels que FP8 et GGUF qui sont plus proches de l’opération locale et de la quantification (sous réserve d’instructions intégrées et d’implémentation communautaire).
3. Installation
- Inférence du transformateur : Il est recommandé d’utiliser la version plus récente du transformateur et de charger le tokeniseur et le LM causal selon l’exemple de la carte modèle pour la génération.
- service local vLLM : installez vLLM (la carte modèle indique que vllm est nécessaire>=0.15.0), vous pouvez lancer des API compatibles OpenAI, et activer la sélection d’outils et l’analyseur d’appel correspondant.
- Service SGLang : Vous pouvez utiliser sglang pour démarrer le point de terminaison local et configurer l’analyseur d’appel d’outils correspondant à la série Qwen3-Coder.
- Quantification/légèreté locale : Si vous utilisez la voie GGUF/llama.cpp, vous devez préparer suffisamment de mémoire unifiée ou de mémoire vidéo selon la précision de la quantification, et suivre les recommandations de la page de mise en jeu spécifique.
4. Cas d’usage typiques
- Refactorisation au niveau des dépôts : Inclure l’ensemble de la base de code dans un contexte long ou « récupération + contexte long » pour compléter le renommage inter-modules, la migration d’interface et le tri des dépendances.
- Réparation automatique des bugs (y compris la vérification exécutable) : combiné à l’environnement exécutable, exécuter des tests/scripts après avoir généré des correctifs, et s’auto-réparer les itérations en cas d’échec.
- Développement web full-stack : De la création d’échafaudages, au développement de composants à la création et au déploiement de scripts, avec des outils navigateur/terminal pour compléter la boucle fermée.
- Agent de codage multi-outil : Appelez le système de fichiers, le shell, le framework de test et le navigateur dans le cadre proxy tel que Cline pour obtenir « lecture de modifications de code en exécution de code pour test-commit ».
5. Écologie et produits concurrents
- Écologie : Fournir officiellement des pages de collection et plusieurs poids dans Hugging Face et ModelScope ; Le côté inférence couvre les routes courantes telles que Transformers, vLLM et SGLang. Le côté proxy met l’accent sur l’amarrage avec des échafaudages tels que Claude Code, Qwen Code et Cline.
- Produits concurrents : Des cibles similaires (Agent de codage/développement local) incluent également d’autres modèles de code open source et des modèles de routes MoE clairsemés. Il est recommandé de choisir en fonction du type de tâche que vous souhaitez exécuter (correction de bugs, refactorisation, web, test drive), de la longueur du contexte, de la stabilité des appels d’outils et du budget local des ressources.
6. Limitations et précautions
- Coût en contexte long : Même si 3B est activé, un contexte de niveau 256K/1M apportera toujours une pression mémoire et débit ; Lorsqu’un service ne démarre pas, vous pouvez d’abord réduire le contexte maximal (par exemple, à 32K).
- Sécurité des appels d’outils : Lors de l’automatisation locale du shell/navigateur, il est recommandé d’utiliser le sandboxing, le minimum de privilèges et l’isolation réseau pour éviter la suppression accidentelle de fichiers ou la fuite de crédences.
- Évaluer la migrabilité : Les performances de SWE-Bench Pro ne sont pas les mêmes que le taux de réussite de votre dépôt privé, il est donc recommandé d’utiliser le jeu de lecture réel du projet pour la vérification A/B.
- Différences de quantification : Différents formats de quantification (FP8, 4 bits, GGUF, etc.) ont un impact significatif sur la précision et la stabilité des appels d’outils, et doivent être testés selon le scénario.
7. Adresse du projet
https://github.com/QwenLM/Qwen3-Coder
8. Questions fréquemment posées
Q : Qwen3-Coder-Next est-il adapté pour que l’agent de codage local fonctionne longtemps ?
R : L’objectif de conception est de réduire le coût d’inférence des longues sessions et des multiples phases d’interaction, mais il reste nécessaire de préparer suffisamment de mémoire/mémoire vidéo en fonction de la longueur du contexte et de la précision de la quantification.
Q : Comment le contexte 256K de Qwen3-Coder-Next est-il utilisé pour la « compréhension au niveau de l’entrepôt » ?
R : Une pratique courante consiste à « récupérer (index/grep/embedding) + longs fichiers clés de contexte, en convergeant progressivement la portée des changements en un ou plusieurs tours.
Q : Comment Qwen3-Coder-Next s’intègre-t-il à l’interface compatible OpenAI de vLLM ?
R : Utiliser vLLM pour lancer le service local compatible OpenAI, activer la sélection automatique d’outils et spécifier l’analyseur correspondant, puis appeler le point de terminaison via le cadre proxy.
Q : Pourquoi Qwen3-Coder-Next met-il l’accent sur les tâches vérifiables 800K plutôt que sur les environnements exécutables ?
R : Le cœur consiste à transformer « écrire du code » en un signal d’entraînement en boucle fermée de « écrire du code + exécuter la vérification », afin que le modèle soit meilleur pour gérer les échecs d’exécution, les dépendances manquantes et les réparations en plusieurs étapes.