OpenAI добавила в модель GPT‑6 новый режим производительности Astra Ultrafast. Он работает на графических процессорах NVIDIA Blackwell и уже доступен через API OpenAI пользователям тарифов ChatGPT Work и Codex. По словам компании, режим генерирует токены до восьми раз быстрее стандартного режима Astra, благодаря чему интерактивные ИИ-приложения работают отзывчивее.
Почему скорость важна для разработчиков
Более быстрая генерация токенов сокращает цикл, в котором ИИ-ассистент пишет код, вызывает инструмент, проверяет результат и выбирает следующий шаг. Руководитель направления инференса в OpenAI Филипп Тийе отмечает, что ускорение помогает агентам быстрее проходить циклы редактирования, тестирования и отладки. Оно также снижает затраты, связанные с задержками, что особенно важно, когда в рамках одного рабочего процесса выполняется много запросов.
Как оборудование NVIDIA обеспечивает ускорение
OpenAI объясняет достигнутый результат «серьезными инвестициями NVIDIA в инструменты и документацию»: благодаря им компания смогла создавать высокопроизводительные ядра, использующие возможности архитектуры Blackwell. Кроме того, OpenAI применяет собственные модели, чтобы постоянно совершенствовать ПО для инференса на GPU, поэтому производительность может улучшаться и после запуска.
Почему это важно
Разработчики инструментов для генерации кода могут заметно ускорить ответы и сократить циклы редактирования, тестирования и отладки. Более быстрые циклы также уменьшают время ожидания функций на базе ИИ в приложениях и улучшают общее впечатление пользователей. Пока неясно, насколько снижение задержек позволит сократить расходы конечных пользователей.