Oossa

LRCC ergänzt tokenabhängige Berechnung für komprimierte LLMs

Mit der neuen LRCC-Methode können Llama- und Qwen-Modelle für jedes Token einen günstigeren oder leistungsfähigeren Berechnungspfad wählen – für mehr Genauigkeit ohne zusätzliche Hardware.

KurzmeldungVon Von Oossa veröffentlicht: 1 Min. Lesezeit

Forschende haben Low-Rank Conditional Computation (LRCC) vorgestellt – eine Methode, die komprimierte Sprachmodelle leistungsfähiger machen soll. Jeder Transformer-Block erhält einen kleinen Router, der abhängig vom aktuellen Token einen von mehreren Low-Rank-Pfaden auswählt. Trainiert werden nur die Router; die Low-Rank-Matrizen bleiben eingefroren. In Tests mit Llama‑2‑7B, Llama‑3.2‑1B und Qwen steigerte LRCC die Genauigkeit bei nachgelagerten Aufgaben für Llama‑2‑7B um 7,6 Prozentpunkte gegenüber einer statischen Low-Rank-Komprimierung. Zudem war die Perplexität bei gleicher Decodiergeschwindigkeit geringer.

Warum es wichtig ist

Entwickler können günstigere, an jedes Token angepasste Modelle einsetzen, die trotzdem präzise bleiben. Das senkt die Rechenkosten für Anwendungen mit Llama oder Qwen.

War dieser Artikel hilfreich?
Teilen

Als Nächstes lesen

Oossa · Newsletter

Die KI-Woche, erklärt

Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.