Cerebrasは、一般的なGPUの最大15倍の速度で推論を実行できるウェハースケールAIチップについて、主要なクラウドマーケットプレイスとセルフサービスポータルで提供を始めたと発表した。同社は人気のオープンソースモデルを数十種類掲載し、LangChain、Docker、VS Codeなどのフレームワークとの連携も追加。開発者は使い慣れたAPIから高速サービスを呼び出せる。今回の取り組みは、圧倒的な速度を日常的なAIアプリの実用的な基盤にすることを目指している。
なぜ重要か
超低遅延の推論をより簡単に利用できるようになれば、より多くの製品が即座に応答し、ユーザー体験の向上や新たなリアルタイムAI機能の実現につながる。