LiquidAI a ajouté sur Hugging Face, le 2026‑10‑03, un nouveau modèle appelé LFM2.5‑350M‑Diffusion‑Exp. Il fonctionne comme le modèle LFM2.5‑350M original, mais génère le texte par blocs de 32 tokens plutôt qu’un token à la fois. Cette approche de diffusion par blocs accélère le décodage, en particulier avec de petites tailles de batch, tout en maintenant une précision proche de celle de la version autorégressive avec huit étapes de débruitage par bloc. Le modèle utilise le même backbone, le même tokenizer et le même template de conversation que LFM2.5.
Pourquoi c'est important
Les développeurs peuvent obtenir des réponses plus rapides avec un modèle familier de 350 M, sans perte importante de qualité.