Amazon a annoncé une architecture de référence qui permet à différentes équipes internes de partager un même cluster de GPU, tout en isolant leurs charges de travail et en séparant leurs coûts. La solution repose sur SageMaker HyperPod sur Amazon EKS, sur des espaces de noms Kubernetes pour assurer l’isolation et sur HyperPod Task Governance pour appliquer des quotas de ressources équitables. La gestion des identités est assurée par AWS IAM Identity Center, qui peut se synchroniser avec des annuaires d’entreprise comme Microsoft Entra ID. Les équipes peuvent accéder au cluster via l’interface graphique de SageMaker Studio ou la ligne de commande, chacune étant cantonnée à son propre espace de noms.
Pourquoi c'est important
Les entreprises peuvent mener plusieurs projets d’IA sur un même parc de GPU coûteux, sans risquer de fuites de données ni de dépenses imprévisibles.