Команда ggml‑org выпустила llama.cpp версии b11324. В обновлении появился режим memory-map, который позволяет не создавать вторую полноразмерную копию каждого тензора при загрузке модели. Изменение доступно в новых бинарных пакетах для macOS (Apple Silicon и Intel), iOS и нескольких сборок Ubuntu. В релизе также отмечен вклад Claude и инженера NVIDIA Пранеша Гонегандлы.
Почему это важно
Разработчики смогут запускать более крупные языковые модели на том же оборудовании. Это полезно энтузиастам и небольшим командам, которым не хватает памяти.