# llama.cpp بارگذاری F32 هم‌تراز با ۲ را به Vulkan اینتل افزود

> این به‌روزرسانی با بارگذاری هم‌زمان دو عدد اعشاری، سرعت ضرب ماتریسی را در پردازنده‌های گرافیکی اینتل افزایش می‌دهد.

Oossa · 2026-09-30 · https://oossa.com/fa/llama-cpp-adds-2-aligned-f32-loads-for-intel-vulkan-builds

پروژه llama.cpp وصله‌ای منتشر کرده که شیوه بارگذاری اعداد اعشاری ۳۲ بیتی (F32) در کد Vulkan را تغییر می‌دهد. در پردازنده‌های گرافیکی اینتل، بارگذاری هم‌زمان دو عدد اعشاری از بارگذاری تک‌به‌تک سریع‌تر است؛ به همین دلیل، منطق جدید در روتین mul_mat_vec از بارگذاری هم‌تراز با ۲ استفاده می‌کند. این تغییر همچنین بررسی هم‌ترازیِ جامانده را اضافه می‌کند. نتایج بنچمارک روی برد آزمایشی B60 برای برخی اندازه‌های ماتریس، سرعتی تا ۱٫۶۳ ترافلاپس را نشان می‌دهد که نسبت به نسخه قبلی افزایش محسوسی است.

## حقایق

- وصله در ۳۰ سپتامبر ۲۰۲۶ منتشر شد (b11266)
- افزایش سرعت تا ۱٫۶۳ ترافلاپس برای ماتریس 4096×8×14336

## چرا مهم است

محاسبات سریع‌تر روی GPU یعنی استنتاج سریع‌تر مدل‌های زبانی بزرگ برای کاربرانی که llama.cpp را روی سخت‌افزار اینتل اجرا می‌کنند.

## منابع و ارجاع‌ها

1. [ggml-org/llama.cpp b11266](https://github.com/ggml-org/llama.cpp/releases/tag/b11266) – llama.cpp, 2026-09-29
2. [ggml-org/llama.cpp b11267](https://github.com/ggml-org/llama.cpp/releases/tag/b11267) – llama.cpp, 2026-09-30

آخرین به‌روزرسانی: 2026-09-30
