# llama.cpp-Update spart RAM durch Memory-Mapping

> Die Open-Source-Laufzeitumgebung für LLMs kann Modelldaten jetzt direkt einblenden. Das spart RAM in Versionen für macOS, iOS und Linux.

Oossa · 2026-10-01 · https://oossa.com/de/llama-cpp-release-adds-memory-map-option-to-cut-tensor-copies

Das Team von ggml-org hat llama.cpp in Version b11324 veröffentlicht. Das Update bietet einen Memory-Mapping-Modus, der beim Laden von Modellen eine zweite vollständige Kopie jedes Tensors überflüssig macht. Die Neuerung ist in neuen Binärpaketen für macOS (Apple Silicon und Intel), iOS und mehrere Ubuntu-Versionen verfügbar. In den Release-Hinweisen werden außerdem Beiträge von Claude und dem NVIDIA-Ingenieur Pranesh Gonegandla erwähnt.

## Die Fakten

- Version b11324 wurde am 2026-10-01 veröffentlicht
- Die Funktion llama-mmap senkt den RAM-Verbrauch

## Warum es wichtig ist

Entwickler können auf derselben Hardware größere Sprachmodelle ausführen. Das ist hilfreich für Hobbyentwickler und kleine Teams mit begrenztem Arbeitsspeicher.

## Quellen und Referenzen

1. [ggml-org/llama.cpp b11324](https://github.com/ggml-org/llama.cpp/releases/tag/b11324) – llama.cpp, 2026-10-01

Zuletzt aktualisiert: 2026-10-01
