El proyecto ggml‑org/llama.cpp publicó una nueva versión el 7 de octubre de 2026. El cambio modifica el muestreador: cuando la temperatura es cero, el modelo siempre elige el token con mayor probabilidad (selección codiciosa). La actualización mantiene el muestreo aleatorio con temperaturas más altas y para las solicitudes de probabilidades personalizadas. El cambio se aplica a las ejecuciones en CPU y a las rutas que usan gramáticas o presupuestos de razonamiento.
Por qué importa
Los desarrolladores pueden obtener resultados más predecibles cuando necesitan generar texto de forma determinista, sin configuración adicional.