# LRCC ergänzt tokenabhängige Berechnung für komprimierte LLMs

> Mit der neuen LRCC-Methode können Llama- und Qwen-Modelle für jedes Token einen günstigeren oder leistungsfähigeren Berechnungspfad wählen – für mehr Genauigkeit ohne zusätzliche Hardware.

Oossa · 2026-10-08 · https://oossa.com/de/lrcc-adds-token-dependent-computation-to-low-rank-compressed-llms

Forschende haben Low-Rank Conditional Computation (LRCC) vorgestellt – eine Methode, die komprimierte Sprachmodelle leistungsfähiger machen soll. Jeder Transformer-Block erhält einen kleinen Router, der abhängig vom aktuellen Token einen von mehreren Low-Rank-Pfaden auswählt. Trainiert werden nur die Router; die Low-Rank-Matrizen bleiben eingefroren. In Tests mit Llama‑2‑7B, Llama‑3.2‑1B und Qwen steigerte LRCC die Genauigkeit bei nachgelagerten Aufgaben für Llama‑2‑7B um 7,6 Prozentpunkte gegenüber einer statischen Low-Rank-Komprimierung. Zudem war die Perplexität bei gleicher Decodiergeschwindigkeit geringer.

## Die Fakten

- 7,6 Prozentpunkte mehr durchschnittliche Genauigkeit bei nachgelagerten Aufgaben mit Llama‑2‑7B
- Studie veröffentlicht am 2026‑10‑08

## Warum es wichtig ist

Entwickler können günstigere, an jedes Token angepasste Modelle einsetzen, die trotzdem präzise bleiben. Das senkt die Rechenkosten für Anwendungen mit Llama oder Qwen.

## Quellen und Referenzen

1. [LRCC: Generalizing Low-Rank Compression with Conditional Computation](https://arxiv.org/abs/2610.08858) – arXiv, 2026-10-08

Zuletzt aktualisiert: 2026-10-08
