OpenAI a ajouté à son modèle GPT‑6 un nouveau mode de performance appelé Astra Ultrafast. Celui-ci fonctionne sur les puces graphiques Blackwell de NVIDIA et est déjà accessible dans l’API OpenAI aux utilisateurs des offres ChatGPT Work et Codex. Selon l’entreprise, ce mode peut générer des tokens jusqu’à huit fois plus vite que le mode Astra standard, rendant les applications d’IA interactives plus réactives.
Pourquoi la vitesse compte pour les développeurs
Une génération plus rapide des tokens raccourcit le cycle dans lequel un assistant IA écrit du code, appelle un outil, vérifie le résultat et détermine la prochaine étape. Philippe Tillet, responsable de l’inférence chez OpenAI, souligne que ce gain de vitesse aide les agents à effectuer plus rapidement les cycles de modification, de test et de débogage. L’accélération réduit également les coûts liés à la latence, ce qui peut compter lorsque de nombreux appels sont effectués dans un même flux de travail.
Comment le matériel NVIDIA contribue à ce gain
OpenAI attribue à « l’investissement important de NVIDIA dans les outils et la documentation » la possibilité d’écrire des kernels hautes performances qui tirent parti de l’architecture Blackwell. L’entreprise utilise également ses propres modèles pour améliorer en continu le logiciel d’inférence qui fonctionne sur les GPU ; les performances pourraient donc continuer de progresser après le lancement.
Pourquoi c'est important
Les développeurs qui créent des outils de génération de code peuvent obtenir des réponses nettement plus rapides, ce qui accélère les cycles de modification, de test et de débogage. Des cycles plus courts réduisent aussi le temps d’attente des utilisateurs pour les fonctionnalités reposant sur l’IA et améliorent ainsi l’expérience globale. Reste à voir dans quelle mesure la latence réduite fera baisser les coûts pour les utilisateurs finaux.