# vLLM 0.31.0 speichert Gewichte für schnelle GPU-Neustarts

> Die Open-Source-Bibliothek vLLM 0.31.0 zum Bereitstellen von LLMs bietet einen neuen Preload-Befehl. Er hält nach der Quantisierung verarbeitete Gewichte auch bei Neustarts der Engine im GPU-Speicher.

Oossa · 2026-10-05 · https://oossa.com/de/vllm-0-31-0-adds-fast-restart-weight-cache-for-gpu-serving

Das vLLM-Projekt hat am 5. Oktober 2026 Version 0.31.0 veröffentlicht. Die wichtigste Neuerung ist ein Preload-Befehl, der einen Daemon für den Gewichtscache startet. So bleiben nach der Quantisierung verarbeitete Modellgewichte auch beim Neustart des Servers im GPU-Speicher. Die Funktion unterstützt Datenparallelisierung und bietet einen Health-Check-Endpunkt. Außerdem umfasst die Version 717 Commits von 307 Mitwirkenden.

## Die Fakten

- Version 0.31.0 wurde am 2026-10-05 veröffentlicht
- 717 Commits von 307 Mitwirkenden

## Warum es wichtig ist

Entwickler können LLM-Dienste aktualisieren oder neu starten, ohne große Modelle erneut laden zu müssen. Das verkürzt Ausfallzeiten bei Anwendungen, die auf vLLM setzen.

## Quellen und Referenzen

1. [vllm-project/vllm v0.31.0](https://github.com/vllm-project/vllm/releases/tag/v0.31.0) – vLLM, 2026-10-05

Zuletzt aktualisiert: 2026-10-05
