Oossa

llama.cpp adiciona suporte a BF16 e FP16 no tinyBLAS para CPUs x86

A biblioteca de código aberto llama.cpp agora vetoriz­a o processamento dos dados restantes em BF16, FP16 e FP32 no backend tinyBLAS, acelerando a inferência em CPUs.

NotaOossaPublicado pelo Oossa: 1 min de leitura

A equipe ggml-org lançou a versão b11398 do llama.cpp. A atualização adiciona suporte ao processamento de dados restantes em BF16, FP16 e FP32 no backend tinyBLAS para CPUs em plataformas x86. As alterações também vetorizam esse processamento para acelerar os cálculos. Há binários pré-compilados para macOS (Apple Silicon e Intel), iOS e várias arquiteturas do Ubuntu. A atualização também inclui ajustes nos testes para garantir comparações precisas com implementações de referência.

Por que importa

Desenvolvedores podem executar inferência de LLMs mais rapidamente em CPUs comuns, sem aceleração por GPU.

Este artigo foi útil?
Compartilhar

Leia a seguir

Oossa · Newsletter

A semana em IA, explicada

Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.