Açık kaynaklı llama.cpp kütüphanesine, MoE uyumlu matris çarpımı için Vulkan düzeltmesi eklendi. Değişiklik, kodun mat_mul_id işlemi için döşeme boyutlarını seçme biçimini düzenleyerek her uzman başına gerçekten etkin olan satır sayısıyla eşleşmesini sağlıyor. 30 milyar parametreli bir model üzerinde yapılan testte düzeltme, çalışma süresinin %55’ini oluşturan atıl GPU işlemlerini azalttı.
Neden önemli
Daha az atıl GPU süresi, Vulkan uyumlu donanımlarda çalışan büyük MoE modellerinde çıkarımın daha hızlı olmasını sağlar.