# llama.cpp prend en charge les blocs CUDA de plus de 512 éléments

> La version du 8 oct. 2026 ajoute de nouveaux noyaux FWHT rapides, compatibles avec des blocs de 1 024 à 8 192 éléments sur les GPU NVIDIA.

Oossa · 2026-10-08 · https://oossa.com/fr/llama-cpp-adds-cuda-kernels-for-block-widths-over-512

Le projet llama.cpp a publié la version b11482 le 8 oct. 2026. Elle ajoute des noyaux CUDA FWHT prenant en charge les blocs de plus de 512 éléments, avec des tailles allant de 1 024 à 8 192 pour les données FP32 et FP16. Cette évolution réutilise l’infrastructure F16 existante et a passé les tests sur un GPU A10. Les noyaux existants pour les tailles de warp (64 à 512) restent inchangés.

## Les faits

- Version b11482, publiée le 8 oct. 2026
- Les nouveaux noyaux prennent en charge des blocs de 1 024 à 8 192 éléments en FP32 et FP16

## Pourquoi c'est important

Les utilisateurs de GPU peuvent désormais effectuer plus rapidement de plus grandes multiplications matricielles avec llama.cpp.

## Sources et références

1. [ggml-org/llama.cpp b11482](https://github.com/ggml-org/llama.cpp/releases/tag/b11482) – llama.cpp, 2026-10-08

Dernière mise à jour: 2026-10-08
