Together Link a été présenté le 5 octobre 2026 par Together AI sur son blog officiel. C'est une couche de connexion qui branche les outils d'agents de code que les développeurs utilisent déjà, sans les modifier, sur les modèles ouverts hébergés par Together AI. La promesse est directe : même agent, même flux de travail, et une facture réduite de plus de 50 %. L'installation tient en une commande, les réglages et les connexions existants sont conservés, et revenir aux modèles fermés natifs tient aussi en une commande.
On ne remplace que le modèle, pas l'outil
Les agents de code font désormais partie du quotidien des équipes, mais d'une correction d'une ligne à la réécriture complète d'un dépôt, beaucoup de tâches tournent par défaut sur le même modèle fermé le plus cher. Together Link prend en charge Claude Code, Claude Desktop, Codex dans l'application ChatGPT et en ligne de commande, OpenCode et Pi, soit l'essentiel des usages actuels. Il ne s'agit pas de construire un énième assistant de code, mais d'extraire la couche d'approvisionnement en modèles : l'interface, les raccourcis et les habitudes de l'équipe ne bougent pas, seules les requêtes d'inférence en arrière-plan sont redirigées vers des modèles ouverts.
Le routage Auto : les modèles amiraux pour les problèmes durs, Flash pour les petites tâches
Ce qui décide réellement des économies, c'est le routeur Auto. Il lit la première tâche de chaque session pour en juger la difficulté : les corrections rapides vont aux modèles rapides et bon marché, seuls les problèmes difficiles mobilisent la capacité de pointe. Le routage a lieu une fois par session, ce qui préserve le cache de prompts. Avec votre propre clé Anthropic, il arbitre entre Opus 5.5 et GLM 5.3 ; sans elle, entre GLM 5.3 et GLM 5.3 Flash. Après chaque session, un récapitulatif affiche ce qui a été dépensé et ce que la même session aurait coûté sur Opus 5.5. La facturation passe par votre propre clé API Together, à l'usage ou par packs de crédits, sans contrat séparé.
La condition préalable : les modèles ouverts ont d'abord rattrapé leur retard
Together AI assume le calendrier dans son billet : des modèles à poids ouverts comme Kimi K3 et GLM 5.3 traitent désormais une bonne partie des tâches de code les plus dures, tandis que de petits modèles comme GLM 5.3 Flash et DeepSeek V4.1 Flash couvrent le travail quotidien pour une fraction du prix au jeton. Les organisations d'ingénierie dépensent des dizaines de milliers à des millions de dollars par mois en modèles fermés ; quand l'écart de prix atteint ce niveau, la couche de routage devient une activité en soi. D'après les chiffres de Together AI, au 30 septembre 2026, l'entreprise traitait sur OpenRouter la plus grande part des jetons de DeepSeek V4.1 Flash, environ 40,8 %, de GLM 5.3 Flash, environ 28,2 %, et de Kimi K3, environ 23,1 % : l'offre est déjà à l'échelle.
La limite doit être dite : ces « plus de 50 % » sont un chiffre du fournisseur, et l'économie réelle dépend de la nature des tâches d'une équipe. Si chaque session est une réécriture à l'échelle du dépôt, le routage a peu de marge de manœuvre, et les tâches les plus dures, Together Link les confie lui-même aux modèles de pointe. Ce qui change vraiment, c'est le réglage par défaut : au lieu de tout faire tourner sur le modèle amiral, la première question devient de savoir si la tâche mérite un modèle amiral.