ToolNavs KI-Tools entdecken
Tool einreichen Anmelden
Zurück zu KI-Informationen
DeepSeek veröffentlicht Ascend-Infrastruktur als Open Source: TileLang fordert CUDA heraus, senkt Kosten heimischer Rechenleistung

DeepSeek veröffentlicht Ascend-Infrastruktur als Open Source: TileLang fordert CUDA heraus, senkt Kosten heimischer Rechenleistung

KI-Informationen • Admin • • 6 Aufrufe

Am 30. September 2026 hat DeepSeek Infrastrukturkomponenten für Ascend als Open Source freigegeben. DeepSeek gab heute über seinen offiziellen WeChat-Account bekannt, sechs Infrastrukturkomponenten für Huaweis Ascend-Computing-Plattform offiziell als Open Source zu veröffentlichen: TileLang, DeepGEMM, DeepEP, TileKernels, FlashMLA und DeepSelect – jeweils als Gegenstück zu den zuvor für NVIDIAs Plattform freigegebenen Komponenten. Alle offiziellen Repositories liegen auf GitHub (Organisationen tile-ai und deepseek-ai).

Bemerkenswert an dieser Freigabe sind nicht die Modelle selbst, sondern der „Software-Stack“. Die Schwäche einheimischer KI-Chips lag bisher nie in der Rechenleistung, sondern im Ökosystem: Die Werkzeugketten zum Schreiben von Code und zur Leistungsoptimierung sind weit weniger ausgereift als NVIDIA CUDA. Ausländische Medien werten den Schritt als Schlüssel zur Schließung der Software-Lücke in Chinas KI-Industrie.

Sechs Komponenten auf einmal

  • TileLang: eine domänenspezifische Sprache mit Python-ähnlicher Syntax und Kompilierwerkzeugen, auf der TVM-Compiler-Infrastruktur aufbauend, die Entwicklungsproduktivität mit Low-Level-Optimierung verbindet. Das GitHub-Repository tile-ai/tilelang kündigte im heutigen README-Update die offizielle Unterstützung nativer Codegenerierung für den Ascend 950 NPU, automatisches Scheduling und Synchronisation sowie SIMD/SIMT-Vektorprogrammierung an.
  • DeepGEMM: Bibliothek für beschleunigte Matrixoperationen, Ascend-Version unter deepseek-ai/DeepGEMM-Ascend.
  • DeepEP: Bibliothek für verteilte Kommunikation, Ascend-Version unter deepseek-ai/DeepEP-Ascend.
  • TileKernels: Sammlung universeller Kernel; FlashMLA: Sparse-Attention-Operatoren; DeepSelect: Werkzeuge zur Datenauswahl.

DeepSeek bestätigte außerdem, dass die allermeisten Operatoren, die im Training der V4-Serie zum Einsatz kamen, in TileLang implementiert sind – diese Werkzeuge wurden also bereits in modernstem Großmodell-Training validiert, nicht nur auf dem Papier.

Warum „ein Gegenstück zu CUDA“

Die Entsprechung ist direkt: In NVIDIAs Ökosystem ist CUDA die Programmiersprachenschicht, cuBLAS übernimmt die Matrixbeschleunigung und NCCL die kollektive Kommunikation. TileLang entspricht der CUDA-Sprachschicht, DeepGEMM der Hochleistungs-Matrixberechnung und DeepEP der kollektiven Kommunikation. Sind Entwickler erst einmal mit diesem Werkzeugsatz vertraut, sind sie nicht mehr an eine einzige Hardwareplattform gebunden – „geringere Kosten, höhere Effizienz“ konkret bedeutet: einheimische Rechenleistung wird nutzbar und bezahlbar.

Die Zusammenarbeit mit Huawei: nahe am theoretischen Leistungslimit

Dies ist keine simple „Code-Portierung“. Laut DeepSeek war Huaweis Team tief in die gemeinsame Entwicklung eingebunden: Gemeinsam setzten beide Seiten die 128-Karten-Supernode-Lösung für den Ascend 950 um und optimierten Rechen- und Kommunikationspfade gründlich; mehrere Tests zeigen, dass Rechen- und Kommunikationsleistung nahe am theoretischen Hardwarelimit liegen. Supernodes sind das Schlüsselformat für das Training großer Modelle – die Ascend-Plattform ist nun einsatzbereit für Flagship-Training.

Wer profitiert – und wo liegen die Hürden

Direkt profitieren Teams, die große Modelle auf einheimischer Rechenleistung trainieren und betreiben: Sie können Operatoren direkt optimieren und das Training beschleunigen, ohne alles von Grund auf neu zu bauen. Die Hürden sind zweierlei: Die Hardware zielt auf Ascend-NPUs, ohne Ascend-Umgebung lässt sich kaum einsteigen; und der Technologie-Stack verlangt Vertrautheit sowohl mit TileLangs DSL als auch mit Low-Level-Kernel-Tuning. Die größere Bedeutung liegt jedoch im Signal an die Branche – wenn ein Top-Modellteam beginnt, seine Werkzeugkette auf einheimischer Hardware aufzubauen, beginnt sich das Ökosystem-Schwungrad zu drehen.

Empfohlene Tools

Mehr