OpenAI heeft een nieuwe prestatiemodus toegevoegd aan zijn GPT‑6-model: Astra Ultrafast. De modus draait op grafische chips van NVIDIA met Blackwell-architectuur en is al beschikbaar via de OpenAI API voor gebruikers met een ChatGPT Work- of Codex-abonnement. Volgens het bedrijf kan de modus tot acht keer sneller tokens genereren dan de standaardinstelling Astra, waardoor interactieve AI-toepassingen responsiever aanvoelen.
Waarom snelheid belangrijk is voor ontwikkelaars
Snellere tokengeneratie verkort de cyclus waarin een AI-assistent code schrijft, een tool aanroept, het resultaat controleert en de volgende stap bepaalt. Philippe Tillet, hoofd inference bij OpenAI, merkt op dat de snelheidswinst agents helpt om sneller bewerk-, test- en debugcycli af te ronden. De versnelling verlaagt ook de latentiegerelateerde kosten, wat van belang kan zijn wanneer één workflow veel aanroepen omvat.
Hoe NVIDIA-hardware de snelheidswinst mogelijk maakt
OpenAI schrijft de winst toe aan NVIDIA’s “grote investeringen in tools en documentatie”, waardoor het bedrijf krachtige kernels kan schrijven die de Blackwell-architectuur optimaal benutten. OpenAI gebruikt ook eigen modellen om de inferentiesoftware op de GPU’s voortdurend te verbeteren. Dat betekent dat de prestaties na de lancering mogelijk verder toenemen.
Waarom het ertoe doet
Ontwikkelaars die tools voor codegeneratie bouwen, kunnen merkbaar snellere reacties krijgen, waardoor de bewerk-, test- en debugcyclus korter wordt. Kortere wachttijden betekenen ook dat gebruikers minder lang hoeven te wachten op AI-functies in apps, wat de algehele ervaring verbetert. Het valt nog te bezien hoeveel de lagere latentie de kosten voor eindgebruikers zal drukken.