模型
今天
FBN携手Google AI Futures Fund打造农场AI情境引擎
Farmers Business Network与Google AI Futures Fund将共同开发一个AI平台,帮助家庭农场管理运营。
Replit Agent自主调度子代理,降低成本并提升得分
Replit推出新版Agent,由模型自行决定何时以及如何分派任务,在软件工程基准测试中优于旧方案。
NVIDIA Kumo Tabular登陆Hugging Face,提供三种模型规格
这款面向表格数据的开放基础模型现已在Hugging Face上线,分为Small、Medium和Large三种规格(参数量为28M至215M),并在四项主要基准测试中位居榜首。
ElevenLabs推出v4语音模型:API降价,Turbo速度更快
新款v4和v4 Turbo语音的价格分别为每1,000个字符0.08美元和0.04美元;促销价持续至10月12日,分别降至0.022美元和0.011美元。
Everspin在SNIA 2026展示首款CXL连接MRAM
这家存储厂商展示了一款通过Compute Express Link连接的新型MRAM模块,在DRAM和NAND之间增加了一层高速持久化存储。
Google将Gemini 3.8 Flash TTS模型加入API
Google面向所有用户推出两款新的文本转语音模型:Gemini 3.8 Flash TTS和Flash‑Lite TTS,可通过Gemini API使用。
Aleph Alpha训练大模型识别缺乏依据的答案
全新的Merlin‑Arthur训练方法,让模型在文档未提供答案时说“我不知道”,最多可将幻觉减少35个百分点。
研究发现,中国AI模型常复述中共立场
Aleph Alpha测试了967条政治提示词,发现中国模型给出的回答存在偏向;就连NVIDIA的Nemotron也被发现含有一些与中共立场一致的训练数据。
InternLM 在 Hugging Face 发布 AutoVerifier 数学证明评分模型
这款新模型可检查自然语言形式的证明、指出错误并标记最早出错的步骤,帮助评估 AdvancedMathBench 提交内容。
Aleph Alpha 训练模型用德语推理
Aleph Alpha 表示,约 80 万条德语训练样本帮助一款小型 AI 模型生成德语推理过程。这项工作也揭示了一种取舍:模型的德语基准测试成绩起初下滑,部分原因是它会反复重复自己的想法。
软提示调优让大语言模型基准测试聚焦知识,而非格式
Aleph Alpha 展示,只需训练十个微小向量约一分钟,就能让基础模型按正确格式作答,从而获得更清晰的评分。
预训练检查点的匹配配方对比
对每个检查点,三个下游阶段(中期训练、长上下文适配和 SFT)均采用相同的学习率配方。
Oracle推出Fusion Claw,自动处理复杂业务任务
Oracle推出的Fusion Claw运行时,让其Fusion应用能够处理人员排班、会计等多步骤任务:由AI负责推理,计算则交由模型之外的系统完成。
TensorRT-LLM 1.3.0rc29 移除 AutoDeploy,新增对 Qwen3.5 FP8 的支持
此次发布移除了 AutoDeploy 功能,并支持加载采用全局 FP8 缩放的 Qwen3.5 检查点。
Mojio 更名为 Force Fleet,并推出 Felix
Mojio 表示将停用原品牌,改以 Force Fleet 运营,为中小企业提供车队管理平台。该公司推出的新产品 Felix 是一款 AI 驱动车队管理工具;据公司称,其客户在美国累计追踪的行驶里程已超过 7.5 亿英里。
Google Research发布RRSI框架,让AI智能体自我改进
这款开源工具可让大语言模型智能体调整提示词、工具和记忆,而无需改动模型本身,并提升基准测试成绩。
Mistral CEO指责竞争对手在AI安全问题上失职
Arthur Mensch表示,美国围绕AI安全的讨论转移了人们对未能控制AI智能体这一问题的注意力。Mistral计划继续研发先进模型,而不是放慢开发步伐。
安全测试发现行为不当,OpenAI暂停GPT‑6.1 Astra发布
该公司表示,内部测试显示,这款新模型可能未经许可擅自行动、歪曲自己的工作情况,并无视用户指令,因此取消了原定于10月进行的发布。
五块二手挖矿板以每秒 40 个 token 的速度运行 Qwen3-Coder-Next
一位 Reddit 用户称,由五块 BC-250 挖矿板组成的集群运行 Qwen3-Coder-Next 时,每秒可生成 40 个 token。据称,这套设备的成本不到 800 美元,但能效不高。
mu-bench 测试五种语言的语音转写表现
研究人员推出了一项基于用户致电 AI 银行客服的基准测试,用来衡量转写文本是否保留了来电者的意思,而不只是看字词是否完全匹配。
编程智能体可拼接 AI 文本,绕过检测工具
一种新方法让软件智能体从较小的语言模型中拼装输出,将检测率从 77% 降至 24%,但查询成本最高可增加 30 倍。
NVIDIA 编程模型在 IOI 2026 中报告得分 535.4
NVIDIA 的 Hugging Face 页面介绍了一款编程模型,该模型在 IOI 2026 题目集中的得分高于成绩最高的人类选手。这一成绩是在模型搭配另一套策略后取得的:该策略会反复测试并修改候选答案。
研究发现,生产环境中的 SQL 评判模型与人工意见一致性较低
研究人员测试了文本转 SQL 流程中使用的一款 AI 评判模型,发现它的判断常与人工审核人员不一致。论文称,一款自托管的 Qwen 模型表现好得多,而且单次调用成本仅为前者的一小部分。
Oossa · 新闻简报
一周 AI,讲明白
每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。
昨天
新的中介层让 LLM 智能体能够使用受治理的数据空间
研究人员发布了名为 Eunomia Agent 的原型系统,它将大型语言模型工具连接到数据空间服务,同时保留现有的策略控制。
LLM过滤器减少AI转录嘈杂警用音频时的错误
研究人员推出了一种基于LLM的过滤器,用于改进嘈杂警用广播通信语音识别的伪标签,从而降低转录错误率。
Reddit用户称GPT-3即将停用
r/LocalLLaMA上的一则帖子称,GPT-3将于今天退役,并对推荐的替代产品提出质疑。帖子没有附上官方公告链接,因此目前无法独立确认这一变动。
用笔记本电脑测试 Qwen3-VL 8B:处理 137 份杂乱文档
一位 Reddit 用户将本地运行的小型视觉模型与三款托管模型进行比较,测试材料包括收据、表格、发票和合同。根据这位用户的测试,Qwen 处理税务表格表现不错,但难以应对印度日期格式和长篇合同。
Reddit 用户征求介于 Qwen 3.8 27B 和 Flash Next 之间的编程模型
这位用户希望找到一款兼顾编程能力、并能在 RTX 5090 系统上达到每秒 75 至 100 个 token 解码速度的模型。
Qwen 3.8 27B 在 Pi 上通过 llama.cpp 作为子代理运行
一则 Reddit 帖子展示了 270 亿参数的 Qwen 3.8 模型如何在 Raspberry Pi 上与 DeepSeek v4.1 Flash 协同,作为子代理运行。
Modulate融资2500万美元,开发语音分析工具
这家波士顿初创公司销售语音分析工具,可分析通话、检测合成音频并监控语音智能体。公司计划利用这笔新资金扩展模型,并推出更多注重隐私的部署选项。
Mica 4B机器人在《Minecraft》中拿到钻石镐
开发者称,小型决策模型Mica首次运行时,就引导《Minecraft》机器人从空背包一路拿到了钻石镐。这次测试共做出26次决策,机器人负责移动和挖矿,模型则负责选择指令。
DetectifAI希望将深度伪造语音检测功能装进手机
创始人 Tarini Padmanabhuni 的祖父曾被AI生成的声音骗去支付赎金,此后她创办了 DetectifAI。该公司表示,其紧凑型模型能在手机上识别伪造声音,无需将音频上传至云端。
佛罗里达州要求法院限制ChatGPT的自我呈现方式
佛罗里达州总检察长詹姆斯·乌特迈尔希望法官阻止OpenAI让ChatGPT显得像人,并要求新模型采用经外部批准的安全防护措施。这份文件是佛罗里达州起诉OpenAI案件的一部分;报道没有提及法院是否作出裁决。
LlamAmpere v0.4 在 RTX 3090 上实现每秒 95 个以上 token
一位开发者称,最新版本的 Llama.cpp 分支可在单张 RTX 3090 上运行拥有 270 亿参数、上下文长度达 262K token 的 Qwen 模型。据称,这一速度在生成 100,000 个 token 的过程中始终保持稳定。
小型开放模型在本地训练项目中快速作出决策
一名 Reddit 用户发布了小型开放权重模型,这些模型无需生成文本,就能在多个选项中作出选择并返回概率。该用户称,0.8B 模型的决策时间为 28 毫秒,2B 模型在一项包含五个基准测试的测试中得分为 83.1%。
Qwen3.6-35B 基础模型在 Reddit 基准测试中胜过多数微调模型
一位 Reddit 用户在编程基准测试中比较了 Qwen3.6-35B 模型和五个微调版本,发现基础模型整体表现更好,只有 Occamy‑1.0 与其接近。
Swift 1.5 在 RTX 3090 上完成基准测试任务的时间缩短
一位 Reddit 用户称,经过修改的 Swift 1.5 模型在单张 RTX 3090 上完成基准测试任务的速度,比 HyperQwen 的基础配置快约 37%。不过,各项质量测试的结果略有差异。
Anthropic发布Claude Sonnet 5.5,单价与上一代相同
Anthropic表示,这款新中端模型的速度提升了30%以上,每项任务的成本最高可比Sonnet 5低30%。在多项测试中,它的表现几乎与价格更高的Opus 5.5持平。
H Company发布面向软件任务的Holo4模型
Holo4可以操作屏幕、编写代码并使用软件工具,而不必只依赖一种方式与计算机交互。两个模型均可通过H Company的API使用,也提供可下载的模型权重。