オープンソースのllama.cppライブラリに、MoEを考慮した行列乗算のVulkan向け修正が加わった。mat_mul_id処理でタイルサイズを選ぶ方法を調整し、各エキスパートで実際に有効な行数に合わせる。300億パラメーターのモデルを使ったテストでは、実行時間の55%を占めていたGPUのアイドル処理が、この修正によって削減された。
なぜ重要か
GPUのアイドル時間が減れば、Vulkan対応ハードウェアで動かす大規模MoEモデルの推論が速くなる。
2026年9月30日のリリースでVulkanのタイル選択を調整し、Mixture-of-Expertsモデルの無駄な処理を削減。
短信Oossa1 分で読める
オープンソースのllama.cppライブラリに、MoEを考慮した行列乗算のVulkan向け修正が加わった。mat_mul_id処理でタイルサイズを選ぶ方法を調整し、各エキスパートで実際に有効な行数に合わせる。300億パラメーターのモデルを使ったテストでは、実行時間の55%を占めていたGPUのアイドル処理が、この修正によって削減された。
GPUのアイドル時間が減れば、Vulkan対応ハードウェアで動かす大規模MoEモデルの推論が速くなる。
モデル
OpenAIの新モデルGPT‑6.1 Solは、100万トークンあたり2~10ドルの料金を据え置きながら性能向上をうたい、AnthropicのClaudeやDeepSeekのモデルを下回る価格を打ち出した。
モデル
新モデルv4とv4 Turboの料金は、1,000文字あたりそれぞれ0.08ドル、0.04ドル。10月12日までは0.022ドル、0.011ドルに割引される。
モデル
Oracleの新しいFusion Clawランタイムにより、Fusionアプリは人員配置や会計など複数段階の業務を処理できる。AIが推論を担い、計算はモデルの外部で行う。
Oossa · ニュースレター
今週のAIを、わかりやすく
毎週月曜日、知っておきたいニュースをやさしい言葉で。無料・スパムなし。
| # | 出典 | 媒体 | 日付 | 要点 |
|---|---|---|---|---|
| 1 | ggml-org/llama.cpp b11265 ↗ | llama.cpp | 2026/09/29 | <details open> vulkan: MOE aware mat_mul_id tile selection (#29182) mut_mul_id selected its matmul tile with total token count. |
1 件の出典