Oossa

vLLM 0.31.0 speichert Gewichte für schnelle GPU-Neustarts

Die Open-Source-Bibliothek vLLM 0.31.0 zum Bereitstellen von LLMs bietet einen neuen Preload-Befehl. Er hält nach der Quantisierung verarbeitete Gewichte auch bei Neustarts der Engine im GPU-Speicher.

KurzmeldungVon Von Oossa veröffentlicht: 1 Min. Lesezeit

Das vLLM-Projekt hat am 5. Oktober 2026 Version 0.31.0 veröffentlicht. Die wichtigste Neuerung ist ein Preload-Befehl, der einen Daemon für den Gewichtscache startet. So bleiben nach der Quantisierung verarbeitete Modellgewichte auch beim Neustart des Servers im GPU-Speicher. Die Funktion unterstützt Datenparallelisierung und bietet einen Health-Check-Endpunkt. Außerdem umfasst die Version 717 Commits von 307 Mitwirkenden.

Warum es wichtig ist

Entwickler können LLM-Dienste aktualisieren oder neu starten, ohne große Modelle erneut laden zu müssen. Das verkürzt Ausfallzeiten bei Anwendungen, die auf vLLM setzen.

War dieser Artikel hilfreich?
Teilen

Als Nächstes lesen

Oossa · Newsletter

Die KI-Woche, erklärt

Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.