DeepSeek AI открыла новый репозиторий на GitHub под названием DeepGEMM-Ascend. Он переносит библиотеку матричного умножения DeepGEMM на NPU Huawei Ascend. Пакет использует тот же API, что и оригинальный DeepGEMM, поэтому код, работающий на графических процессорах NVIDIA, можно перенести на Ascend простой установкой через pip. Поддерживаются BF16, FP8, FP4 GEMM, логиты MQA и ядра MegaMoE; по заявлению разработчиков, на устройствах Ascend 950 производительность достигает 99,8% от предельных возможностей оборудования.
Почему это важно
Разработчики смогут использовать существующий код DeepGEMM на ИИ-чипах Huawei, получив больше вариантов оборудования для обучения и инференса больших языковых моделей.