ggml‑orgチームは2026年9月29日、llama.cppのバージョンb11262をリリースした。今回のアップデートではAVX512‑FP16に対応し、半精度(f16)の内積演算を単精度(f32)で累積することで、精度を高めている。低レベルの変更だが、AVX512‑FP16命令セットを備えたCPUで推論を高速化する。また、macOS、iOS、複数のLinux環境向けの新しいバイナリも同梱している。
なぜ重要か
数値精度を損なうことなく、最新CPUでLLMをより高速に実行できる。
オープンソースのllama.cppライブラリがAVX512‑FP16を使い、半精度の内積を単精度で計算できるようになり、CPU性能が向上する。
短信Oossa1 分で読める
ggml‑orgチームは2026年9月29日、llama.cppのバージョンb11262をリリースした。今回のアップデートではAVX512‑FP16に対応し、半精度(f16)の内積演算を単精度(f32)で累積することで、精度を高めている。低レベルの変更だが、AVX512‑FP16命令セットを備えたCPUで推論を高速化する。また、macOS、iOS、複数のLinux環境向けの新しいバイナリも同梱している。
数値精度を損なうことなく、最新CPUでLLMをより高速に実行できる。
モデル
OpenAIの新モデルGPT‑6.1 Solは、100万トークンあたり2~10ドルの料金を据え置きながら性能向上をうたい、AnthropicのClaudeやDeepSeekのモデルを下回る価格を打ち出した。
モデル
新モデルv4とv4 Turboの料金は、1,000文字あたりそれぞれ0.08ドル、0.04ドル。10月12日までは0.022ドル、0.011ドルに割引される。
モデル
Oracleの新しいFusion Clawランタイムにより、Fusionアプリは人員配置や会計など複数段階の業務を処理できる。AIが推論を担い、計算はモデルの外部で行う。
Oossa · ニュースレター
今週のAIを、わかりやすく
毎週月曜日、知っておきたいニュースをやさしい言葉で。無料・スパムなし。
| # | 出典 | 媒体 | 日付 | 要点 |
|---|---|---|---|---|
| 1 | ggml-org/llama.cpp b11262 ↗ | llama.cpp | 2026/09/29 | <details open> ggml : accumulate f16 dot products in f32 on AVX512-FP16 (#29545) Supersedes #29530 Signed-off-by: Adrien Gallouët <angt@hugg |
1 件の出典