Oossa

llama.cpp ganha opção de mapeamento de memória e reduz cópias de tensores

O runtime de LLM de código aberto agora permite mapear diretamente os dados do modelo, economizando RAM nas versões para macOS, iOS e Linux.

NotaOossaPublicado pelo Oossa: 1 min de leitura

A equipe ggml-org lançou a versão b11324 do llama.cpp. A atualização adiciona um modo de mapeamento de memória que evita criar uma segunda cópia, do mesmo tamanho, de cada tensor ao carregar modelos. A mudança está disponível em novos pacotes binários para macOS (Apple Silicon e Intel), iOS e várias versões do Ubuntu. O lançamento também registra contribuições de Claude e de Pranesh Gonegandla, engenheiro da NVIDIA.

Por que importa

Desenvolvedores podem executar modelos de linguagem maiores no mesmo hardware, o que ajuda entusiastas e equipes pequenas com memória limitada.

Este artigo foi útil?
Compartilhar

Leia a seguir

Oossa · Newsletter

A semana em IA, explicada

Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.