Magistral Small 1.2 et Medium 1.2 sont officiellement disponibles. Ils intègrent un nouvel encodeur visuel et prennent en charge l'analyse multimodale de textes et d'images. Ils offrent une amélioration des performances de plus de 10 % par rapport à la version 1.1 sur des benchmarks comme AIME et LiveCodeBench. Des outils améliorés comme la recherche web, l'interprétation de code et la génération d'images offrent des résultats plus clairs et plus naturels, ce qui les rend idéaux pour les travaux intellectuels et les scénarios d'ingénierie. I. Points forts de la mise à jour : Pourquoi la version 1.2 est-elle intéressante ? 1. Multimodalité : intégration native de textes et d'images. Magistral 1.2 intègre un encodeur visuel qui permet de raisonner et de répondre à partir de captures d'écran de documents, d'images de formules et d'extraits de code accompagnés d'images. Cette fonctionnalité couvre les tâches fréquentes telles que les évaluations de produits, la reconnaissance de tableaux et les questions-réponses sur les graphiques. Cette fonctionnalité a été confirmée dans la documentation et l'annonce officielles.
2. Amélioration des performances : les mathématiques et la programmation sont plus stables
Magistral 1.2 améliore d'environ 15 % la version 1.1 sur des benchmarks tels qu'AIME 24 et AIME 25, et LiveCodeBench v5 et v6. Le raisonnement complexe et la résolution de problèmes à longue chaîne sont plus fiables, ce qui le rend adapté à l'enseignement, à la recherche, aux concours et aux scénarios de génération de code.
(1) Meilleur renforcement et convergence de la chaîne de raisonnement
Basé sur une combinaison de réglage fin supervisé et d'apprentissage par renforcement, la version 1.2 commet moins d'erreurs dans les dérivations à longues étapes, fournit des réponses plus lisibles et prend en charge la génération finie pour supprimer la « continuation infinie ».
(2) Ton et formatage optimisés
Réponses plus naturelles, expressions Markdown et LaTeX plus standardisées, et plus facile à coller directement dans les bases de connaissances, les brouillons et les documents techniques.
II. Pratiques d'ingénierie : Connecter la version 1.2 aux flux de travail réels
1. Appel d'outils plus intelligent
Magistral 1.2 est plus proactif dans la planification de la recherche de pages web, de l'interpréteur de code et de la génération d'images. Il peut automatiquement diviser les sous-tâches, extraire les données et les vérifier dans le bac à sable du code, puis les fusionner en une réponse structurée, réduisant ainsi les allers-retours manuels.
2. Intégration de bases de données et de bases de connaissances
Dans les documents de R&D, les bibliothèques d'exigences et les bibliothèques de défauts, la méthode multimodale de questions-réponses est d'abord utilisée pour extraire les points clés, puis des outils de programmation sont utilisés pour vérifier la cohérence des interfaces et des exemples de codes, et enfin une liste de révision et des suggestions de modifications sont produites.
(1) Implémentation de scénarios mathématiques
Pour les problèmes de type AIME, 1.2 peut d'abord fournir un cadre de solution, puis dériver progressivement la formule et l'auto-vérification ; une explication de transformation équivalente est donnée pour les résultats Latex afin de réduire les erreurs.
(2) Implémentation de scénarios de codage
Dans le paradigme LiveCodeBench, les questions en langage naturel sont converties en cas de test. L'interpréteur de code est exécuté pour vérifier le taux de réussite. Les échecs sont détectés à l'aide d'invites d'emplacement binaire et de restauration.
III. Recommandations de sélection : Petit vs Moyen et points clés du déploiement
1. Comment choisir
Small 1.2 est plus efficace en termes de calcul et convient au raisonnement local ou à petite ou moyenne échelle ; Medium 1.2 vise une précision en régime permanent plus élevée et convient au raisonnement centralisé côté serveur et à la revue de projets complexes.
2. Déploiement et gouvernance
Après quantification, Small 1.2 peut s'exécuter sur un seul GPU ou sur un appareil léger à haute mémoire. En production, il est recommandé de configurer les délais d'expiration des requêtes, le nombre maximal d'étapes et les listes blanches d'outils, ainsi que d'enregistrer les résumés de la chaîne de pensée à des fins d'audit.
(1) Modèle Word d'invite
Consolider le modèle pour les tâches multimodales, clarifier la structure d'entrée, le format de sortie et les autorisations des outils, et réduire la dérive.
(2) Régression d'évaluation
Créer un ensemble de régression incluant des sous-ensembles d'AIME et de LiveCodeBench. Comparer la précision, le temps d'exécution et le nombre d'appels d'outils pour chaque mise à niveau afin de quantifier les avantages.
Foire aux questions (Q&R)
Q : Quelles sont les utilisations pratiques de la multimodalité de Magistral 1.2 ?
R : Vous pouvez extraire les exigences à partir de captures d'écran du produit, reconstruire des formules et résoudre des problèmes à partir d'images de problèmes, localiser les informations de la pile à partir de captures d'écran d'erreur, puis utiliser l'interpréteur de code pour reproduire et corriger les problèmes. Q : Par rapport à la version 1.1, quels sont les principaux avantages de Magistral 1.2 ? R : Les doubles améliorations apportées aux benchmarks de multimodalité et de programmation mathématique, ainsi qu’une invocation d’outils plus stable et une typographie améliorée, le rendent plus adapté à une intégration directe dans les flux de production. Q : Small 1.2 peut-il être déployé localement pour les données privées ? R : Oui. Après quantification, il peut fonctionner sur un seul GPU ou un périphérique léger à haute mémoire. Associé à une chaîne d’outils hors ligne, il permet un raisonnement déconnecté tout en conservant une recherche et une exécution contrôlables. Q : Comment puis-je vérifier que l’amélioration de performance de 15 % s’applique à mon scénario ? R : Nous avons créé un petit benchmark à l’aide de tâches d’équipe, couvrant le raisonnement mathématique, la génération de code, la recherche et la réponse aux questions. Nous avons exécuté les mêmes invites et autorisations d’outils sur les versions 1.1 et 1.2, enregistrant la différence de précision et de latence.