# llama.cpp kan nu tensors rechtstreeks in het geheugen laden

> De open-sourceruntime voor LLM’s kan modeldata nu rechtstreeks in het geheugen koppelen. Dat bespaart RAM op builds voor macOS, iOS en Linux.

Oossa · 2026-10-01 · https://oossa.com/nl/llama-cpp-release-adds-memory-map-option-to-cut-tensor-copies

Het ggml-org-team heeft versie b11324 van llama.cpp uitgebracht. De update voegt een geheugenkaartmodus toe, die voorkomt dat bij het laden van modellen een tweede, even grote kopie van elke tensor wordt gemaakt. De wijziging is beschikbaar in nieuwe binaire pakketten voor macOS (Apple Silicon en Intel), iOS en verschillende Ubuntu-builds. In de release worden ook bijdragen van Claude en NVIDIA-engineer Pranesh Gonegandla vermeld.

## De feiten

- Releaseversie b11324 gepubliceerd op 2026-10-01
- Voegt de functie llama-mmap toe om het RAM-gebruik te verlagen

## Waarom het ertoe doet

Ontwikkelaars kunnen zo grotere taalmodellen draaien op dezelfde hardware. Dat is handig voor hobbyisten en kleine teams met weinig geheugen.

## Bronnen en referenties

1. [ggml-org/llama.cpp b11324](https://github.com/ggml-org/llama.cpp/releases/tag/b11324) – llama.cpp, 2026-10-01

Laatst bijgewerkt: 2026-10-01
