Amazon은 서로 다른 사내 팀이 동일한 GPU 클러스터를 공유하면서도 각 팀의 워크로드를 격리하고 비용을 분리할 수 있는 참조 아키텍처를 발표했습니다. 이 구성은 Amazon EKS의 SageMaker HyperPod와 격리를 위한 Kubernetes 네임스페이스, 공정한 리소스 할당량을 적용하는 HyperPod Task Governance를 사용합니다. 사용자 인증 관리는 AWS IAM Identity Center가 맡으며, Microsoft Entra ID 같은 기업 디렉터리와 동기화할 수 있습니다. 각 팀은 SageMaker Studio GUI 또는 CLI를 통해 클러스터에 접속하며, 팀별 네임스페이스 안에서만 작업할 수 있습니다.
왜 중요한가
기업은 데이터 유출이나 예측하기 어려운 지출 위험 없이, 비용이 많이 드는 GPU 자원 풀 하나에서 여러 AI 프로젝트를 운영할 수 있습니다.