Amazon 发布了一套参考架构,让不同内部团队能够共用同一 GPU 集群,同时隔离各自的工作负载并分别核算成本。该方案基于 Amazon EKS 上的 SageMaker HyperPod,使用 Kubernetes 命名空间实现隔离,并通过 HyperPod Task Governance 确保资源配额公平分配。身份管理由 AWS IAM Identity Center 负责,可与 Microsoft Entra ID 等企业目录同步。团队可通过 SageMaker Studio 图形界面或命令行界面访问集群,且只能使用各自的命名空间。
为什么重要
企业可以在同一套昂贵的 GPU 资源池上运行多个 AI 项目,同时降低数据泄露和支出难以预测的风险。