# Yeni çıkarım yöntemi dil modeli çıktılarını hızlandırıyor

> Araştırmacılar, JSON ve araç çağrısı üretimini 1,2–1,3 kat hızlandırırken gramer boyutunu büyük ölçüde küçülten, az bellek kullanan bir motor geliştirdi.

Oossa · 2026-10-08 · https://oossa.com/tr/new-inference-method-speeds-up-schema-constrained-language-model-output

Arip Asadulaev liderliğindeki ekip, dil modellerinin ek bellek kullanmadan katı bir çıktı biçimine uymasını sağlayan bir yöntem yayımladı. Teknik, biçimi küçük bir otomat olarak yeniden yazıyor ve maskeleme işlemini doğrudan GPU’da yürütüyor. 16 GB’lık Apple M2 Pro’da Qwen‑3.5‑2B ve 4B modelleri, şema kısıtlamalı bilgi çıkarma işlemlerini yaklaşık 1,2–1,3 kat daha hızlı tamamladı. Gramer için 1,5 GB’a kadar bellek yerine yalnızca 3 MB kullandı ve bir sunucunun on altı grameri barındırmasını sağladı. Paralel çalışan on altı araç çağıran ajan da görevlerini 2,5 kat daha kısa sürede tamamladı.

## Gerçekler

- Yayımlanma tarihi: 2026-10-08 ("PUBLISHED: Thu Oct 08 2026")
- Hız artışı: Bilgi çıkarma 1,2–1,3 kat daha hızlı; araç ajanları 2,5 kat daha hızlı; gramer boyutu 1,5 GB yerine 3 MB

## Neden önemli

Geliştiriciler, tek bir dizüstü bilgisayar GPU’sunda daha fazla kısıtlı yapay zekâ görevi çalıştırarak zamandan ve bellekten tasarruf edebilir.

## Kaynaklar ve referanslar

1. [Breaking the Space Barrier and its Application to Language Model Inference](https://arxiv.org/abs/2610.09139) – arXiv, 2026-10-08

Son güncelleme: 2026-10-08
