A Cerebras anunciou que seu chip de IA em escala de wafer, capaz de executar inferências até 15 vezes mais rápido que GPUs convencionais, agora está disponível nos principais marketplaces de nuvem e em um portal de autoatendimento. A empresa também disponibilizou dezenas de modelos populares de código aberto e adicionou integrações com frameworks como LangChain, Docker e VS Code, permitindo que desenvolvedores acessem o serviço rápido por meio de APIs conhecidas. A iniciativa busca transformar a velocidade bruta em um recurso prático para aplicações de IA do dia a dia.
Por que importa
O acesso facilitado à inferência de latência ultrabaixa permite que mais produtos respondam instantaneamente, melhorando a experiência dos usuários e viabilizando novos recursos de IA em tempo real.