Cerebras a annoncé que sa puce d’IA à l’échelle d’une tranche de silicium, capable d’exécuter l’inférence jusqu’à 15 fois plus rapidement que les GPU classiques, est désormais proposée sur les principales places de marché cloud et via un portail en libre-service. L’entreprise a également répertorié des dizaines de modèles open source populaires et ajouté des intégrations avec des outils comme LangChain, Docker et VS Code, afin que les développeurs puissent accéder à ce service rapide à l’aide d’API familières. L’objectif est de faire de cette vitesse brute un outil pratique pour les applications d’IA du quotidien.
Pourquoi c'est important
Un accès simplifié à l’inférence à latence ultra-faible permet à davantage de produits de répondre instantanément, améliorant ainsi l’expérience utilisateur et ouvrant la voie à de nouvelles fonctionnalités d’IA en temps réel.