ggml‑org/llama.cpp 프로젝트가 2026년 10월 7일 새 버전을 출시했습니다. 온도가 0일 때 모델이 확률이 가장 높은 토큰을 항상 선택하도록 샘플러를 변경했습니다(탐욕적 선택). 온도가 더 높거나 사용자 지정 확률을 요청한 경우에는 기존 무작위 샘플링을 그대로 사용합니다. 이 변경 사항은 CPU 실행과 문법 또는 추론 예산을 사용하는 경로에도 적용됩니다.
왜 중요한가
개발자는 별도 설정 없이도 결정론적 텍스트 생성이 필요한 경우 더 예측 가능한 결과를 얻을 수 있습니다.