Together Link wurde am 5. Oktober 2026 von Together AI im offiziellen Blog vorgestellt. Es ist eine Verbindungsschicht, die die Programmier-Agenten-Werkzeuge, die Entwickler bereits nutzen, unverändert an offene Modelle auf Together AI anschließt. Das Versprechen ist direkt: gleicher Agent, gleicher Arbeitsablauf, aber eine um über 50 Prozent niedrigere Rechnung. Die Einrichtung braucht einen einzigen Befehl, Einstellungen und Logins bleiben erhalten, und auch der Weg zurück zu den nativen geschlossenen Modellen ist ein einziger Befehl.
Ausgetauscht wird nur das Modell, nicht das Werkzeug
Programmier-Agenten gehören inzwischen zum Teamalltag, doch von der Ein-Zeilen-Korrektur bis zum kompletten Repo-Umbau läuft standardmäßig vieles auf demselben teuersten geschlossenen Modell. Together Link unterstützt Claude Code, Claude Desktop, Codex in der ChatGPT-App und der CLI, OpenCode und Pi und deckt damit die gängigen Nutzungsformen ab. Es will keinen weiteren Programmier-Assistenten bauen, sondern nur die Schicht der Modellversorgung herauslösen: Oberfläche, Tastaturkürzel und Teamgewohnheiten bleiben, lediglich die Inferenzanfragen im Hintergrund werden auf offene Modelle umgeleitet.
Auto-Routing: Flaggschiffe für harte Probleme, Flash für kleine Aufgaben
Wie viel gespart wird, entscheidet der Auto-Router. Er liest die erste Aufgabe jeder Sitzung und schätzt die Schwierigkeit: Schnelle Korrekturen gehen an zügige, günstige Modelle, nur harte Probleme bekommen Frontier-Fähigkeit. Geroutet wird einmal pro Sitzung, damit das Prompt-Caching intakt bleibt. Wer einen eigenen Anthropic-Schlüssel mitbringt, routet zwischen Opus 5.5 und GLM 5.3; ohne Schlüssel stehen GLM 5.3 und GLM 5.3 Flash zur Wahl. Nach jeder Sitzung zeigt eine Übersicht, was tatsächlich ausgegeben wurde und was dieselbe Sitzung auf Opus 5.5 gekostet hätte. Abgerechnet wird über den eigenen Together-API-Schlüssel, nutzungsbasiert oder per Guthabenpaket, ohne separaten Vertrag.
Die Voraussetzung: Offene Modelle haben vorher aufgeholt
Together AI benennt den Zeitpunkt im Blog offen: Offen gewichtete Modelle wie Kimi K3 und GLM 5.3 bewältigen inzwischen viele der härtesten Programmieraufgaben, während kleine Modelle wie GLM 5.3 Flash und DeepSeek V4.1 Flash den Alltag abdecken — zu einem Bruchteil des Tokenpreises. Entwicklungsorganisationen geben monatlich Zehntausende bis Millionen Dollar für geschlossene Modelle aus; bei einer solchen Preisspanne wird die Routing-Schicht selbst zum Geschäft. Nach Together AIs Angaben verarbeitete das Unternehmen auf OpenRouter, Stand 30. September 2026, den größten Tokenanteil bei DeepSeek V4.1 Flash mit rund 40,8 Prozent, GLM 5.3 Flash mit rund 28,2 Prozent und Kimi K3 mit rund 23,1 Prozent — die Angebotsseite ist bereits skaliert.
Die Grenze gehört dazu: Die „über 50 Prozent“ sind Herstellerangabe, und die echte Ersparnis hängt vom Aufgabenmix eines Teams ab. Besteht jede Sitzung aus repo-weiten Umbauten, hat Routing wenig Spielraum, und die härtesten Aufgaben überlässt Together Link selbst den Frontier-Modellen. Was sich wirklich ändert, ist der Standard: Statt standardmäßig alles per Flaggschiff laufen zu lassen, lautet die erste Frage nun, ob diese Aufgabe überhaupt ein Flaggschiff verdient.