Forschende haben Low-Rank Conditional Computation (LRCC) vorgestellt – eine Methode, die komprimierte Sprachmodelle leistungsfähiger machen soll. Jeder Transformer-Block erhält einen kleinen Router, der abhängig vom aktuellen Token einen von mehreren Low-Rank-Pfaden auswählt. Trainiert werden nur die Router; die Low-Rank-Matrizen bleiben eingefroren. In Tests mit Llama‑2‑7B, Llama‑3.2‑1B und Qwen steigerte LRCC die Genauigkeit bei nachgelagerten Aufgaben für Llama‑2‑7B um 7,6 Prozentpunkte gegenüber einer statischen Low-Rank-Komprimierung. Zudem war die Perplexität bei gleicher Decodiergeschwindigkeit geringer.
Warum es wichtig ist
Entwickler können günstigere, an jedes Token angepasste Modelle einsetzen, die trotzdem präzise bleiben. Das senkt die Rechenkosten für Anwendungen mit Llama oder Qwen.