Oossa

llama.cpp b11494 optimiza el uso de CUDA por warp

La biblioteca de código abierto llama.cpp ahora asigna cuatro columnas de estado GDN a cada warp de CUDA para mejorar el rendimiento de la GPU.

BrevePor Publicado por Oossa: 1 min de lectura

El equipo de ggml-org publicó la versión b11494 de llama.cpp. La actualización modifica el backend de CUDA para asignar cuatro columnas de estado GDN por warp, en lugar de dos. Este ajuste ahora viene activado de forma predeterminada. Se pueden descargar binarios para macOS (Apple Silicon e Intel), iOS y varias versiones de Ubuntu.

Por qué importa

Los desarrolladores que usan llama.cpp en GPU NVIDIA pueden esperar una inferencia más rápida sin cambiar su código.

¿Te resultó útil este artículo?
Compartir

Sigue leyendo

Oossa · Boletín

La semana en IA, explicada

Cada lunes: las noticias que vale la pena conocer, en lenguaje sencillo. Gratis, sin spam.