Teamet bakom ggml-org har släppt llama.cpp version b11324. Uppdateringen lägger till ett läge för minnesmappning som gör att programmet slipper skapa en extra kopia i full storlek av varje tensor när modeller läses in. Funktionen finns i nya binärpaket för macOS (Apple Silicon och Intel), iOS och flera Ubuntu-versioner. I versionsinformationen nämns också bidrag från Claude och NVIDIA-ingenjören Pranesh Gonegandla.
Varför det spelar roll
Utvecklare kan köra större språkmodeller på samma hårdvara, vilket underlättar för entusiaster och små team med begränsat minne.