Cerebras meddelade att företagets AI-chip i waferformat, som kan köra inferens upp till 15 gånger snabbare än vanliga GPU:er, nu erbjuds via stora molnmarknadsplatser och en självbetjäningsportal. Företaget har också listat dussintals populära modeller med öppen källkod och lagt till integrationer med ramverk som LangChain, Docker och VS Code, så att utvecklare kan använda den snabba tjänsten via välbekanta API:er. Syftet är att göra den råa hastigheten till en praktisk byggsten för vardagliga AI-appar.
Varför det spelar roll
Enklare tillgång till inferens med ultralåg fördröjning gör att fler produkter kan svara omedelbart, förbättra användarupplevelsen och erbjuda nya AI-funktioner i realtid.