Das Team von ggml-org hat llama.cpp in Version b11324 veröffentlicht. Das Update bietet einen Memory-Mapping-Modus, der beim Laden von Modellen eine zweite vollständige Kopie jedes Tensors überflüssig macht. Die Neuerung ist in neuen Binärpaketen für macOS (Apple Silicon und Intel), iOS und mehrere Ubuntu-Versionen verfügbar. In den Release-Hinweisen werden außerdem Beiträge von Claude und dem NVIDIA-Ingenieur Pranesh Gonegandla erwähnt.
Warum es wichtig ist
Entwickler können auf derselben Hardware größere Sprachmodelle ausführen. Das ist hilfreich für Hobbyentwickler und kleine Teams mit begrenztem Arbeitsspeicher.