Oossa

OpenAI lance GPT‑6 Astra Ultrafast sur les GPU NVIDIA Blackwell

Le nouveau mode Astra Ultrafast est disponible dans l’API OpenAI et génère des tokens jusqu’à huit fois plus vite pour les utilisateurs éligibles.

OossaPublié par Oossa: 1 min de lecture

James Harrison · Unsplash

OpenAI a ajouté à son modèle GPT‑6 un nouveau mode de performance appelé Astra Ultrafast. Celui-ci fonctionne sur les puces graphiques Blackwell de NVIDIA et est déjà accessible dans l’API OpenAI aux utilisateurs des offres ChatGPT Work et Codex. Selon l’entreprise, ce mode peut générer des tokens jusqu’à huit fois plus vite que le mode Astra standard, rendant les applications d’IA interactives plus réactives.

Pourquoi la vitesse compte pour les développeurs

Une génération plus rapide des tokens raccourcit le cycle dans lequel un assistant IA écrit du code, appelle un outil, vérifie le résultat et détermine la prochaine étape. Philippe Tillet, responsable de l’inférence chez OpenAI, souligne que ce gain de vitesse aide les agents à effectuer plus rapidement les cycles de modification, de test et de débogage. L’accélération réduit également les coûts liés à la latence, ce qui peut compter lorsque de nombreux appels sont effectués dans un même flux de travail.

Comment le matériel NVIDIA contribue à ce gain

OpenAI attribue à « l’investissement important de NVIDIA dans les outils et la documentation » la possibilité d’écrire des kernels hautes performances qui tirent parti de l’architecture Blackwell. L’entreprise utilise également ses propres modèles pour améliorer en continu le logiciel d’inférence qui fonctionne sur les GPU ; les performances pourraient donc continuer de progresser après le lancement.

Pourquoi c'est important

Les développeurs qui créent des outils de génération de code peuvent obtenir des réponses nettement plus rapides, ce qui accélère les cycles de modification, de test et de débogage. Des cycles plus courts réduisent aussi le temps d’attente des utilisateurs pour les fonctionnalités reposant sur l’IA et améliorent ainsi l’expérience globale. Reste à voir dans quelle mesure la latence réduite fera baisser les coûts pour les utilisateurs finaux.

Cet article vous a-t-il été utile ?
Partager

À lire ensuite

Oossa · Newsletter

La semaine de l'IA, expliquée

Chaque lundi : l'essentiel de l'actualité, en langage clair. Gratuit, sans spam.