Araştırmacılar, sıkıştırılmış dil modellerini daha akıllı hâle getiren Low-Rank Conditional Computation (LRCC) yöntemini tanıttı. Her Transformer bloğuna, o anki tokene göre çeşitli düşük ranklı yollardan birini seçen küçük bir yönlendirici ekleniyor. Eğitilen tek bileşen bu yönlendiriciler; düşük ranklı matrisler sabit kalıyor. Llama‑2‑7B, Llama‑3.2‑1B ve Qwen üzerinde test edilen LRCC, statik düşük ranklı sıkıştırmaya kıyasla Llama‑2‑7B’nin sonraki görevlerdeki doğruluğunu 7.6 puan artırdı ve aynı kod çözme hızında daha düşük perplexity sağladı.
Neden önemli
Geliştiriciler, Llama veya Qwen kullanan uygulamalarda hesaplama maliyetlerini azaltırken doğruluğunu koruyan, daha ekonomik ve tokene uyum sağlayan modeller çalıştırabilir.