Oossa

llama.cpp prend en charge les blocs CUDA de plus de 512 éléments

La version du 8 oct. 2026 ajoute de nouveaux noyaux FWHT rapides, compatibles avec des blocs de 1 024 à 8 192 éléments sur les GPU NVIDIA.

BrèvePar Publié par Oossa: 1 min de lecture

Le projet llama.cpp a publié la version b11482 le 8 oct. 2026. Elle ajoute des noyaux CUDA FWHT prenant en charge les blocs de plus de 512 éléments, avec des tailles allant de 1 024 à 8 192 pour les données FP32 et FP16. Cette évolution réutilise l’infrastructure F16 existante et a passé les tests sur un GPU A10. Les noyaux existants pour les tailles de warp (64 à 512) restent inchangés.

Pourquoi c'est important

Les utilisateurs de GPU peuvent désormais effectuer plus rapidement de plus grandes multiplications matricielles avec llama.cpp.

Cet article vous a-t-il été utile ?
Partager

À lire ensuite

Oossa · Newsletter

La semaine de l'IA, expliquée

Chaque lundi : l'essentiel de l'actualité, en langage clair. Gratuit, sans spam.