# llama.cpp añade cargas F32 alineadas a 2 para Intel Vulkan

> La actualización acelera la multiplicación de matrices en GPU Intel al cargar dos números de coma flotante a la vez.

Oossa · 2026-09-30 · https://oossa.com/es/llama-cpp-adds-2-aligned-f32-loads-for-intel-vulkan-builds

El proyecto llama.cpp publicó un parche que modifica la forma en que el código Vulkan carga números de coma flotante de 32 bits (F32). En las GPU Intel, cargar dos números a la vez es más rápido que hacerlo de uno en uno, así que la nueva lógica emplea una carga alineada a 2 en la rutina mul_mat_vec. El cambio también incorpora una comprobación de alineación que faltaba. Las pruebas de rendimiento en una placa de pruebas B60 alcanzan hasta 1,63 TFLOPS con determinados tamaños de matriz, una mejora notable respecto a la versión anterior.

## Los hechos

- Parche publicado el 30 de septiembre de 2026 (b11266)
- Aceleración de hasta 1,63 TFLOPS con una matriz de 4096×8×14336

## Por qué importa

Un cálculo más rápido en la GPU permite inferencias de LLM más ágiles para quienes usan llama.cpp en hardware Intel.

## Fuentes y referencias

1. [ggml-org/llama.cpp b11266](https://github.com/ggml-org/llama.cpp/releases/tag/b11266) – llama.cpp, 2026-09-29
2. [ggml-org/llama.cpp b11267](https://github.com/ggml-org/llama.cpp/releases/tag/b11267) – llama.cpp, 2026-09-30

Última actualización: 2026-09-30
