Zurück zur Übersicht
vLLM v0.28.0 Release: Umfangreiche Performance-Optimierungen für Kimi-K3 und volle Unterstützung für DeepSeek V4
ProduktstartvLLMOpen SourceKünstliche Intelligenz

vLLM v0.28.0 Release: Umfangreiche Performance-Optimierungen für Kimi-K3 und volle Unterstützung für DeepSeek V4

Das neueste Update v0.28.0 des vLLM-Projekts markiert einen bedeutenden Fortschritt in der Effizienz von Large Language Models. Mit insgesamt 584 Commits von 270 Mitwirkenden konzentriert sich diese Version primär auf die Optimierung des Kimi-K3-Modells sowie die Integration von DeepSeek V4. Zu den Highlights gehören die Einführung von Decode Context Parallel (DCP), signifikante Kernel-Beschleunigungen durch fused FlashKDA und eine Reduzierung des Speicherverbrauchs um bis zu 17 GiB pro GPU durch Shared-Expert Sharding. Darüber hinaus bietet das Release eine verbesserte Unterstützung für AMD-Hardware über ROCm, insbesondere für die Architekturen gfx11 und gfx950. Diese Neuerungen versprechen eine drastisch verbesserte Time-to-First-Token (TTFT) und eine effizientere Nutzung moderner GPU-Ressourcen in Produktionsumgebungen.

Hacker News

Die wichtigsten Punkte

  • Massive Kimi-K3 Optimierung: Einführung von Decode Context Parallel (DCP) und fused FlashKDA-Kernels für signifikante Performance-Steigerungen.
  • DeepSeek V4 Integration: Volle End-to-End-Unterstützung für Sparse MLA, inklusive Optimierungen für spekulatives Decoding und AMD-Hardware.
  • Effizienzgewinne: Bis zu 17 GiB Speicherersparnis pro GPU durch Shared-Expert Sharding und eine um 60 % verbesserte Time-to-First-Token (TTFT).
  • Hardware-Erweiterung: Verbesserte Unterstützung für AMD ROCm, einschließlich der Architekturen gfx11 und gfx950 sowie des V2 Model Runners.
  • Community-getriebene Entwicklung: Das Release umfasst 584 Commits von 270 Mitwirkenden, darunter 76 neue Beitragende.

Analyse

Der Kimi-K3 Performance-Schub

Das Release v0.28.0 von vLLM legt einen starken Fokus auf die Optimierung des Kimi-K3-Modells über den gesamten Software-Stack hinweg. Ein zentrales Element dieser Bemühungen ist die Unterstützung von Decode Context Parallel (DCP), die eine effizientere parallele Verarbeitung während der Dekodierungsphase ermöglicht. Ergänzt wird dies durch die Einführung von fused FlashKDA-Kernels sowohl für die Dekodierung als auch für den Prefill-Prozess, was die Recheneffizienz direkt steigert.

Ein weiterer technischer Meilenstein für Kimi-K3 ist die Implementierung der SiTU-Aktivierung für MegaMoE sowie GEMM-RS für Sequenz-Parallelismus. Besonders hervorzuheben ist die Optimierung der All-Gather-Operationen, die eine Kernel-Beschleunigung um das 1,5- bis 3-fache erzielen. Für den praktischen Einsatz in Rechenzentren ist zudem das Shared-Expert Sharding von großer Bedeutung, da es eine Einsparung von etwa 17 GiB Speicher pro GPU ermöglicht. In Kombination mit einem adaptiven spekulativen Token-Budget führt dies zu einer Reduzierung der Time-to-First-Token (TTFT) um etwa 60 % bei der Nutzung von DSpark.

DeepSeek V4 und AMD-Integration

Die Unterstützung für DeepSeek V4 wurde in dieser Version massiv ausgebaut. Die Sparse MLA (Multi-Head Latent Attention) funktioniert nun End-to-End für einfaches Decoding, Multi-Token Prediction (MTP) und DSpark spekulatives Decoding. Um die Leistung auf AMD-Hardware zu maximieren, wurde die Unterstützung für AMD Quark NVFP4 integriert.

Zusätzlich wurden spezifische Kernel-Optimierungen für Sparse Top-k Metadaten vorgenommen, um die Effizienz bei Modellen mit Sparse-Strukturen zu erhöhen. vLLM v0.28.0 verbessert zudem die Handhabung von CUDA-Graphen durch verengte Eager-Regionen, was die Stabilität und Geschwindigkeit erhöht. Für Nutzer von AMD-GPUs ist die Freigabe von ROCm für die Architekturen gfx11 und gfx950 ein entscheidender Schritt, um vLLM auf einer breiteren Hardwarebasis zugänglich zu machen. Auch Kimi-K3 profitiert nun von der ROCm-Unterstützung durch den neuen V2 Model Runner.

Bedeutung für die KI-Branche

Die Veröffentlichung von vLLM v0.28.0 unterstreicht den Trend zur hochgradigen Spezialisierung von Inferenz-Engines auf spezifische Modellarchitekturen wie Kimi-K3 und DeepSeek V4. Durch die drastische Reduzierung des Speicherbedarfs (17 GiB Ersparnis) und die Beschleunigung kritischer Kernel-Operationen wird die Schwelle für den wirtschaftlichen Betrieb extrem großer Sprachmodelle gesenkt.

Besonders die Fortschritte im Bereich des spekulativen Decodings und der adaptiven Token-Budgets zeigen, dass die Branche verstärkt an der Reduzierung von Latenzzeiten arbeitet, um Echtzeitanwendungen zu ermöglichen. Die erweiterte Unterstützung für AMD ROCm signalisiert zudem eine zunehmende Diversifizierung der Hardware-Landschaft, weg von einer rein NVIDIA-zentrierten Infrastruktur, was den Wettbewerb und die Innovationskraft im Bereich der KI-Inferenz fördern dürfte.

Häufig gestellte Fragen

Welche konkreten Vorteile bietet das Update für Kimi-K3 Nutzer?

Nutzer von Kimi-K3 profitieren von einer massiv verbesserten Performance durch neue Kernel-Optimierungen (FlashKDA) und eine Reduzierung der Latenz (TTFT) um bis zu 60 %. Zudem sinkt der Hardware-Bedarf durch eine Speicherersparnis von 17 GiB pro GPU erheblich.

Was bedeutet die Unterstützung von Sparse MLA für DeepSeek V4?

Sparse MLA ermöglicht eine effizientere Aufmerksamkeitsberechnung im Modell. In vLLM v0.28.0 ist diese Funktion nun vollständig für verschiedene Decoding-Szenarien integriert, was die Inferenzgeschwindigkeit von DeepSeek V4 Modellen deutlich erhöht.

Welche AMD-Grafikkarten werden nun besser unterstützt?

Mit dem neuen Release wurde die ROCm-Unterstützung speziell für die Architekturen gfx11 und gfx950 erweitert. Zudem ermöglicht der V2 Model Runner nun auch die Ausführung von Kimi-K3 auf AMD-Hardware.

Ähnliche Nachrichten

ABB bringt Infinitus für KI-Rechenzentren auf den Markt und prognostiziert Kapazitätswachstum in Südostasien
Produktstart

ABB bringt Infinitus für KI-Rechenzentren auf den Markt und prognostiziert Kapazitätswachstum in Südostasien

Das Technologieunternehmen ABB hat die Einführung von Infinitus speziell für Rechenzentren im Bereich der künstlichen Intelligenz angekündigt. Parallel zu dieser Einführung teilte ABB mit, dass die Kapazität von Rechenzentren in Südostasien in den kommenden Jahren signifikant anwachsen dürfte. Konkret prognostiziert das Unternehmen, dass die dortige Rechenzentrumskapazität von derzeit 2,8 Gigawatt bis zum Jahr 2035 auf bis zu 9,4 Gigawatt steigen könnte. Diese Zahlen verdeutlichen den erwarteten massiven Ausbau der regionalen Infrastruktur zur Bewältigung künftiger Anforderungen moderner Rechenzentren. Die vorliegende Meldung verknüpft damit den Start der neuen Infinitus-Lösung direkt mit den langfristigen Wachstumsprognosen für die südostasiatische Region.

Claude Code von Anthropics: Intelligenter Assistent im Terminal für Codebasis-Verständnis und Git-Workflows
Produktstart

Claude Code von Anthropics: Intelligenter Assistent im Terminal für Codebasis-Verständnis und Git-Workflows

Mit Claude Code stellt anthropics auf GitHub ein intelligentes Programmierwerkzeug vor, das direkt in der Terminalumgebung operiert. Das Tool wurde konzipiert, um Entwicklerinnen und Entwickler bei der täglichen Arbeit zu unterstützen und den Programmierprozess spürbar effizienter zu gestalten. Zu den Kernfähigkeiten gehört die Analyse und das tiefe Verständnis der bestehenden Codebasis. Über Befehle in natürlicher Sprache können Anwenderinnen und Anwender alltägliche Aufgaben delegieren, komplexe Codeabschnitte nachvollziehbar erklären lassen und Versionskontrollprozesse im Rahmen von Git-Workflows direkt steuern. Durch die Ausführung auf der Kommandozeile fügt sich das System nahtlos in bestehende Entwicklungsumgebungen ein. Die Veröffentlichung hat auf GitHub Trending unmittelbar Aufmerksamkeit erregt und unterstreicht die Rolle intelligenter Assistenzsysteme in der modernen Softwareentwicklung.

NiubiGEO auf Product Hunt veröffentlicht: Neuer Eintrag von Jianxiaopai ohne detaillierte Produktbeschreibung erschienen
Produktstart

NiubiGEO auf Product Hunt veröffentlicht: Neuer Eintrag von Jianxiaopai ohne detaillierte Produktbeschreibung erschienen

Auf der Plattform Product Hunt wurde am 21. September 2026 ein neuer Eintrag unter dem Titel NiubiGEO registriert. Als Urheber beziehungsweise Autor der Veröffentlichung wird Jianxiaopai genannt. Zum aktuellen Zeitpunkt liegen über die bereitgestellte Originalmeldung jedoch keine weiterführenden inhaltlichen Beschreibungen, Funktionsübersichten oder technischen Spezifikationen zum vorgestellten Projekt vor. Der Eintrag beschränkt sich auf die grundlegenden Metadaten der Veröffentlichung sowie den Verweis auf die zugehörige Produktseite. Aufgrund des Fehlens konkreter Inhaltsangaben in der Ursprungsmeldung können derzeit keine verifizierten Aussagen über den genauen Zweck, die Funktionsweise oder die Zielgruppe von NiubiGEO getroffen werden. Diese redaktionelle Zusammenfassung dokumentiert den vorliegenden Veröffentlichungsstand und beleuchtet die verfügbaren Eckdaten der Meldung transparent und ohne spekulative Ergänzungen für die Leserschaft.