Cerebras는 일반적인 GPU보다 최대 15배 빠르게 추론을 실행할 수 있는 웨이퍼 스케일 AI 칩을 주요 클라우드 마켓플레이스와 셀프서비스 포털에서 제공한다고 발표했다. 또한 인기 있는 오픈소스 모델 수십 종을 등록하고 LangChain, Docker, VS Code 같은 프레임워크와의 연동을 추가해 개발자가 익숙한 API로 고속 서비스를 호출할 수 있도록 했다. 이번 조치는 원시적인 처리 속도를 일상적인 AI 앱에 활용할 수 있는 실용적인 기반으로 바꾸려는 것이다.
왜 중요한가
초저지연 추론에 더 쉽게 접근할 수 있으면 더 많은 제품이 즉각 응답해 사용자 경험을 개선하고 새로운 실시간 AI 기능을 구현할 수 있다.