Oossa

APEX رمزگشایی Qwen3-8B را تا ۵٫۲ برابر سریع‌تر می‌کند

کنترل‌گر جدید APEX زمان استنتاج مدل Qwen3-8B را تا 5.24 برابر کاهش می‌دهد و هم‌زمان توکن‌های پیش‌نویس هدررفته را 41% کمتر می‌کند.

خبر کوتاهنویسنده: منتشرشده توسط Oossa: 1 دقیقه مطالعه

پژوهشگران APEX را معرفی کرده‌اند؛ کنترل‌گری یادگرفتنی که تعیین می‌کند چند توکن پیش‌نویس تولید شود و از کدام روش حدس‌زنی استفاده شود. این ابزار به موتور استنتاج vLLM متصل می‌شود و روی مدل زبانی Qwen3-8B آزمایش شده است. APEX در شش بارکاری معیارسنجی، در مقایسه با رمزگشایی خودرگرسیو استاندارد، تا 5.24× افزایش سرعت داشت. گونه APEX‑Depth سرعت را 3.27× افزایش داد و در مقایسه با پیش‌نویس ثابت n‑gram با اندازه 16، توکن‌های هدررفته را 41% کاهش داد.

چرا مهم است

توسعه‌دهندگان می‌توانند مدل‌های زبانی بزرگ را سریع‌تر و با هزینه کمتر اجرا کنند و قابلیت‌های هوش مصنوعی بلادرنگ را مقرون‌به‌صرفه‌تر در اختیار کاربران بگذارند.

آیا این مقاله مفید بود؟
اشتراک‌گذاری

بیشتر بخوانید

Oossa · خبرنامه

هفتهٔ هوش مصنوعی، به زبان ساده

هر دوشنبه: خبرهایی که ارزش دانستن دارند، به زبان ساده. رایگان و بدون هرزنامه.