OpenAIはGPT‑6モデルに、新たな高速モード「Astra Ultrafast」を追加しました。NVIDIAのBlackwell GPUで動作し、ChatGPT WorkおよびCodexプランのユーザーは、すでにOpenAI APIから利用できます。同社によると、このモードは標準のAstra設定と比べてトークンを最大8倍速く生成でき、対話型AIアプリの応答性向上につながります。
開発者にとって速度が重要な理由
トークン生成が速くなれば、AIアシスタントがコードを書き、ツールを呼び出し、結果を確認して次の手順を決めるまでのサイクルが短くなります。OpenAIで推論を統括するPhilippe Tillet氏は、速度向上により、エージェントが編集・テスト・デバッグのサイクルをより早く完了できると説明しています。また、1つのワークフローで多くの呼び出しを行う場合、レイテンシに伴うコストの削減にもつながります。
NVIDIAのハードウェアが速度向上を支える仕組み
OpenAIは、Blackwellアーキテクチャの性能を引き出す高性能カーネルの開発を可能にした要因として、NVIDIAによる「ツールやドキュメントへの継続的な投資」を挙げています。また、GPU上で動作する推論ソフトウェアの改善に自社モデルを継続的に活用しており、提供開始後も性能が向上する可能性があります。
なぜ重要か
コード生成ツールを開発する人は、応答速度の向上を実感でき、編集・テスト・デバッグのサイクルを短縮できます。処理のサイクルが速くなれば、アプリのAI機能を利用するユーザーの待ち時間も減り、体験の向上につながります。レイテンシの低下が最終利用者のコストをどの程度引き下げるかは、まだ分かりません。