Das vLLM-Projekt hat am 5. Oktober 2026 Version 0.31.0 veröffentlicht. Die wichtigste Neuerung ist ein Preload-Befehl, der einen Daemon für den Gewichtscache startet. So bleiben nach der Quantisierung verarbeitete Modellgewichte auch beim Neustart des Servers im GPU-Speicher. Die Funktion unterstützt Datenparallelisierung und bietet einen Health-Check-Endpunkt. Außerdem umfasst die Version 717 Commits von 307 Mitwirkenden.
Warum es wichtig ist
Entwickler können LLM-Dienste aktualisieren oder neu starten, ohne große Modelle erneut laden zu müssen. Das verkürzt Ausfallzeiten bei Anwendungen, die auf vLLM setzen.