ggml-org 团队发布了 llama.cpp b11293 版。该版本为 CPU 和 CUDA 新增了 BF16(一种半精度数值格式)的单目、GLU、二元和缩放运算。此次更新还调整了 CUDA 内核,修复 BF16 构建问题。macOS、Windows、Linux 和 Android 等多个平台均可使用此更新。
为什么重要
开发者现在可以在支持 BF16 的硬件(例如较新的 GPU)上更快地运行 llama.cpp 模型。
开源库 llama.cpp 现已支持 BF16 数据类型运算和 GLU,有助于提升 CPU 与 CUDA 性能。
简讯OossaOossa 发布日期: 1 分钟阅读
ggml-org 团队发布了 llama.cpp b11293 版。该版本为 CPU 和 CUDA 新增了 BF16(一种半精度数值格式)的单目、GLU、二元和缩放运算。此次更新还调整了 CUDA 内核,修复 BF16 构建问题。macOS、Windows、Linux 和 Android 等多个平台均可使用此更新。
开发者现在可以在支持 BF16 的硬件(例如较新的 GPU)上更快地运行 llama.cpp 模型。
最后更新: ·Markdown
模型
Google的新模型Gemini 4 Argon拥有100万token上下文上限,输入价格为每百万token 2美元,目前已向一组选定的网络安全团队开放。
模型
Google将在Gemini聊天中推出可重复使用的“Skills”,并于2026年11月17日停止向个人账户提供旧版Gems功能。
模型
Runway Research宣布推出Praxis‑1。这款开放权重机器人动作模型基于视频训练,Noble Machines、Standard Bots和Ultra已开始早期测试。
Oossa · 新闻简报
一周 AI,讲明白
每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。