OossaLa IA avanza rápido. Te lo explicamos de forma sencilla.

llama.cpp añade cargas F32 alineadas a 2 para Intel Vulkan

La actualización acelera la multiplicación de matrices en GPU Intel al cargar dos números de coma flotante a la vez.

BreveOossa1 min de lectura

El proyecto llama.cpp publicó un parche que modifica la forma en que el código Vulkan carga números de coma flotante de 32 bits (F32). En las GPU Intel, cargar dos números a la vez es más rápido que hacerlo de uno en uno, así que la nueva lógica emplea una carga alineada a 2 en la rutina mul_mat_vec. El cambio también incorpora una comprobación de alineación que faltaba. Las pruebas de rendimiento en una placa de pruebas B60 alcanzan hasta 1,63 TFLOPS con determinados tamaños de matriz, una mejora notable respecto a la versión anterior.

Por qué importa

Un cálculo más rápido en la GPU permite inferencias de LLM más ágiles para quienes usan llama.cpp en hardware Intel.

¿Te resultó útil este artículo?
Compartir

Sigue leyendo

Oossa · Boletín

La semana en IA, explicada

Cada lunes: las noticias que vale la pena conocer, en lenguaje sencillo. Gratis, sin spam.

Fuentes y referencias

#FuenteMedioFechaIdea clave
1ggml-org/llama.cpp b11266 ↗llama.cpp29 sept 2026<details open> vulkan : Load F32 A matrix 2 at a time when its 2-aligned (#29254) It turns out Intel doesn't particularly like loading F32s
2ggml-org/llama.cpp b11267 ↗llama.cpp30 sept 2026<details open> vulkan: Tune GDN kernel, fix Intel performance (#29476) * vulkan: tune GDN shader * tune for Intel </details> **Website:** -

2 fuentes

Última actualización: ·Markdown·llms.txt