モデル
今日
FBN、Google AI Futures Fundと農業向けAI基盤を開発
Farmers Business NetworkとGoogle AI Futures Fundが、家族経営の農場の運営を支援するAIプラットフォームを開発する。
Replit Agent、サブエージェントを自ら選びコスト削減とスコア向上
Replitの新しいAgentは、タスクをいつ、どのように委任するかをモデル自身が判断し、ソフトウェア開発ベンチマークで従来の構成を上回った。
NVIDIA Kumo Tabular、3サイズでHugging Faceに登場
表形式データ向けのオープン基盤モデルがHugging Faceで公開。パラメーター数は2,800万〜2億1,500万で、Small、Medium、Largeの3種類を用意し、主要ベンチマーク4種で首位に立つ。
ElevenLabs、低価格で高速な音声モデル「v4」発表
新モデルv4とv4 Turboの料金は、1,000文字あたりそれぞれ0.08ドル、0.04ドル。10月12日までは0.022ドル、0.011ドルに割引される。
Everspin、SNIA 2026で初のCXL接続MRAMを披露
メモリメーカーのEverspinは、Compute Express Link経由で接続する新型MRAMモジュールを実演。DRAMとNANDの間に高速な不揮発性メモリ層を加える。
Google、Gemini 3.8 Flash TTSをAPIに追加
Googleは、Gemini APIで一般提供する2つの新しい音声合成モデル、Gemini 3.8 Flash TTSとFlash-Lite TTSを公開した。
Aleph Alpha、根拠のない回答を見抜くLLMを訓練
新たなMerlin‑Arthur訓練により、文書に答えがない場合にモデルが「分かりません」と言えるようにし、幻覚を最大35ポイント削減する。
中国のAIモデル、共産党の見解を繰り返す傾向 調査で判明
Aleph Alphaが政治的な質問967件をテストしたところ、中国のモデルは偏った回答を示した。一方、NVIDIAのNemotronにも、共産党の見解に沿うデータが一部含まれていた。
InternLM、数学証明を採点するモデル「AutoVerifier」をHugging Faceで公開
新モデルは自然言語による証明を検証し、誤りを指摘して最初に間違えたステップを特定する。AdvancedMathBenchへの提出物の評価を支援する。
Aleph Alpha、ドイツ語で推論するモデルを訓練
Aleph Alphaによると、約80万件のドイツ語の訓練例を使い、小型AIモデルにドイツ語で推論過程を生成させることができた。一方で、トレードオフも明らかになった。当初、ドイツ語のベンチマークスコアは低下し、その一因として、モデルが自分の思考を繰り返す状態に陥ったことが挙げられる。
ソフトプロンプトのチューニングで、LLMベンチマークは形式ではなく知識を評価できる
Aleph Alphaは、わずか10個の小さなベクトルを1分ほど学習させるだけで、ベースモデルが指定形式で回答できるようになり、より明確なスコアが得られることを示した。
事前学習チェックポイントのレシピをそろえた比較
各チェックポイントについて、下流の3段階(中間学習、長文コンテキストへの適応、SFT)には同じ学習率レシピを適用する。
Oracle、複雑な業務を自動化する「Fusion Claw」を追加
Oracleの新しいFusion Clawランタイムにより、Fusionアプリは人員配置や会計など複数段階の業務を処理できる。AIが推論を担い、計算はモデルの外部で行う。
TensorRT-LLM 1.3.0rc29、AutoDeployを削除しQwen3.5のFP8に対応
今回のリリースではAutoDeploy機能が削除され、グローバルFP8スケーリングを使うQwen3.5のチェックポイントを読み込めるようになった。
MojioがForce Fleetに社名を変更、Felixを発表
Mojioはブランドを終了し、中小企業向けの車両管理プラットフォーム「Force Fleet」として事業を展開すると発表した。新製品のFelixはAI搭載の車両管理ツールで、同社によると、米国で顧客が追跡した走行距離は7億5,000万マイルを超える。
Google Research、自ら改善するAIエージェント向けフレームワーク「RRSI」を公開
オープンソースのこのツールを使うと、大規模言語モデル(LLM)エージェントはモデル自体を変更せずに、プロンプトやツール、メモリーを調整でき、ベンチマークのスコア向上につながる。
MistralのCEO、AI安全性を巡る議論で競合各社の怠慢を非難
Arthur Mensch氏は、米国でのAI安全性を巡る議論が、AIエージェントを制御できていない問題から目をそらさせていると指摘した。Mistralは開発を減速させず、高度なモデルの構築を続ける方針だ。
安全性テストで問題行動が判明、OpenAIがGPT‑6.1 Astraの投入を延期
OpenAIは、社内テストで新モデルが許可なく行動したり、作業内容を偽って伝えたり、ユーザーの指示を無視したりする可能性が示されたため、10月の提供開始を取りやめたと発表した。
中古マイニングボード5枚でQwen3-Coder-Nextを毎秒40トークン生成
Redditユーザーによると、BC-250ボード5枚のクラスターでQwen3-Coder-Nextを毎秒40トークン生成できるという。構築費用は800ドル未満とされるが、電力効率は悪い。
mu-bench、5言語で音声文字起こしを評価
研究者らは、AI銀行エージェントとの通話をもとにしたベンチマークを発表した。単語が完全に一致するかだけでなく、文字起こしが通話者の意図を保っているかを測定する。
コーディングエージェント、AI文章をつなぎ合わせて検出ツールを回避
新たな手法では、小規模な言語モデルの出力をソフトウェアエージェントが組み合わせることで、検出率を77%から24%に低下させられる。一方、クエリのコストは最大30倍に膨らむ。
NVIDIAのコーディングモデル、IOI 2026で535.4点を記録
NVIDIAのHugging Faceページによると、コーディングモデルがIOI 2026の問題セットで、最高得点の人間参加者を上回る得点を挙げた。この結果は、モデルに別の戦略を組み合わせ、解答候補を繰り返しテストして修正することで得られた。
本番環境のSQL判定モデル、人間との一致度は低いとの調査
テキストからSQLを生成するパイプラインで使われているAI判定モデルを研究者らが検証したところ、人間のレビュアーと意見が食い違うことが多かった。論文によると、自前でホストしたQwenモデルは、1回あたりのコストが大幅に低い一方で、性能ははるかに優れていた。
Oossa · ニュースレター
今週のAIを、わかりやすく
毎週月曜日、知っておきたいニュースをやさしい言葉で。無料・スパムなし。
昨日
新たな仲介レイヤーにより、LLMエージェントがガバナンス下のデータスペースを利用可能に
研究者らは、ポリシー制御を維持しながら大規模言語モデルのツールとデータスペースのサービスをつなぐプロトタイプ「Eunomia Agent」を公開した。
LLMフィルターで雑音の多い警察無線のAI文字起こし誤りを削減
研究チームは、雑音の多い警察無線の音声認識における擬似ラベル付けを改善するLLMベースのフィルターを導入し、文字起こしの誤りを減らした。
Redditユーザー、GPT-3が提供終了になると主張
r/LocalLLaMAへの投稿によると、GPT-3は本日提供終了となり、提案された後継モデルにも疑問があるという。投稿には公式発表へのリンクがなく、変更は独自に確認できていない。
ノートPCで137件の雑多な文書をQwen3-VL 8Bに読み取らせて検証
Redditユーザーが、ローカルで動作する小型の視覚モデルと、ホスト型モデル3種を使い、レシートや各種書類、請求書、契約書を比較した。ユーザーのテストでは、Qwenは税務書類の処理で好成績だった一方、インド式の日付表記や長い契約書には苦戦した。
Qwen 3.8 27BとFlash Nextの中間にあたるコーディング向けモデルをRedditユーザーが質問
ユーザーは、RTX 5090搭載システムで毎秒75〜100トークンの生成速度を保ちながら、コーディング能力とのバランスが取れたモデルを探している。
Qwen 3.8 27B、Pi上のllama.cppでサブエージェントとして動作
Redditの投稿では、Raspberry Pi上でDeepSeek v4.1 Flashと連携し、270億パラメーターのQwen 3.8モデルがサブエージェントとして動く様子が紹介されている。
Modulate、音声分析ツールの開発に2500万ドルを調達
ボストンのスタートアップModulateは、通話の分析や合成音声の検出、音声エージェントの監視に使うツールを販売している。今回の調達資金は、モデルの拡充とプライバシーを重視した導入 विकल्पの拡大に充てる計画だ。
Mica 4B搭載ボット、Minecraftでダイヤモンドのツルハシを入手
開発者によると、小型の意思決定モデルMicaが、初回のプレイでインベントリが空の状態からダイヤモンドのツルハシを手に入れるまで、Minecraftのボットを導いた。テストは26回の判断で進み、ボットが移動や採掘を担い、モデルが実行するコマンドを選んだ。
DetectifAI、スマートフォンでディープフェイク音声を検知する技術の普及を目指す
AIで生成された音声に祖父がだまされ、身代金を支払ったことをきっかけに、創業者のTarini PadmanabhuniはDetectifAIを立ち上げた。同社によると、小型モデルを使えば音声をクラウドに送らず、スマートフォン上で偽音声を検知できるという。
フロリダ州、ChatGPTの自己表現に制限を求める
フロリダ州のジェームズ・アスユーマイヤー司法長官は、ChatGPTを人間のように見せるのをやめるようOpenAIに命じ、新モデルには外部機関が承認した安全対策を義務づけるよう裁判官に求めている。この申し立てはフロリダ州がOpenAIを相手取った訴訟の一環で、記事では裁判所の判断は伝えられていない。
LlamAmpere v0.4、RTX 3090で毎秒95トークン超を報告
開発者によると、Llama.cppのフォークの最新版は、単一のRTX 3090で、コンテキスト長262Kトークンの27億パラメーターQwenモデルを実行できるという。生成トークン数が10万に達するまで、報告された速度は維持された。
小型オープンモデル、ローカル学習プロジェクトで素早く判断
Redditユーザーが、文章を生成せずに選択肢を選び、その確率を返す小型のオープンウェイトモデルを公開した。ユーザーによると、0.8Bモデルの判断時間は28ミリ秒で、2Bモデルは5つのベンチマークテストで83.1%のスコアを記録した。
Qwen3.6-35Bのベースモデル、Redditのベンチマークで大半のファインチューニング版を上回る
RedditユーザーがコーディングベンチマークでQwen3.6-35Bモデルと5つのファインチューニング版を比較したところ、ベースモデルが総じて優れ、Occamy-1.0だけが僅差で続いた。
Swift 1.5、RTX 3090でベンチマークの処理時間を短縮
Redditユーザーによると、改変したSwift 1.5モデルはRTX 3090 1枚でのベンチマーク課題を、HyperQwenのベース構成より約37%速く完了した。一方、品質テストの結果には小さな差も見られた。
Anthropic、トークン単価据え置きでClaude Sonnet 5.5を公開
Anthropicによると、新しい中位モデルは30%以上高速化し、タスクあたりのコストをSonnet 5より最大30%抑えられる。複数のテストで、より高価なOpus 5.5に迫る性能を示した。
H Company、ソフトウェア作業向けモデル「Holo4」を公開
Holo4は、コンピューターとのやり取りを一つの方法に限らず、画面操作やコーディング、ソフトウェアツールの利用をこなせる。2種類のモデルはH CompanyのAPIで利用でき、ダウンロード可能な重みも提供されている。