ggml-org 团队发布了 llama.cpp b11487 版本。该版本为 Hexagon 处理器增添了分块 Q4_K 和 Q6_K 的 GET_ROWS 支持,并改进了对 Q4_K 视图的处理。团队还提供了预编译二进制文件,适用于 Apple Silicon、Intel Mac、iOS,以及多个 Ubuntu 版本(CPU 和 Vulkan)。用户可从 GitHub 发布页面下载更新。
为什么重要
开发者现在可以在 Qualcomm 芯片等基于 Hexagon 的设备上运行效率更高的 Llama 模型,从而提升受支持的移动和嵌入式硬件上的性能。