OpenAI снижает цены на GPT-5.6 Luna на 80% и запускает более быстрый режим Sol API

OpenAI провела значительную корректировку цен на серию GPT-5.6. С 30 июля 2026 года компания снизила цены на API GPT-5.6 Luna на 80%, а на GPT-5.6 Terra — на 20%. Это

发布于 2026年7月31日generalGEO 评分: 09 次阅读
OpenAI снижает цены на GPT-5.6 Luna на 80% и запускает более быстрый режим Sol API

OpenAI снижает цену на GPT-5.6 Luna на 80% и запускает более быстрый режим Sol API

Введение

OpenAI внесла существенные изменения в цены на семейство GPT-5.6.

С 30 июля 2026 года компания снизила цену на API GPT-5.6 Luna на 80%, а на GPT-5.6 Terra — на 20%. Стандартная цена на флагманскую модель GPT-5.6 Sol осталась без изменений, однако OpenAI представила быстрый режим, который обеспечивает скорость обработки до 2,5 раз выше стандартной при сохранении того же уровня интеллекта модели.

Это изменение опубликовано в тот момент, когда OpenAI обнародовала инженерный анализ, демонстрирующий, как GPT-5.6 Sol помогла оптимизировать системы, используемые для обслуживания самой GPT-5.6. По данным OpenAI, улучшения в производственных GPU-ядрах позволили снизить сквозную стоимость обслуживания на 20%, а усовершенствования в спекулятивном декодировании повысили эффективность генерации токенов более чем на 15%.

В результате OpenAI заняла более агрессивную позицию на так называемом фронте соотношения цены и производительности: согласование объёма используемого интеллекта с экономической ценностью конкретной задачи.

Для разработчиков самые важные изменения очевидны: Luna теперь значительно дешевле для высокопроизводительных агентных нагрузок, Terra стала доступнее для повседневного использования, а Sol можно приобретать на более высоком уровне обслуживания, когда задержка важнее цены.

1. Luna подешевела на 80%, Terra — на 20%, для Sol запущен быстрый режим

Обновление цен от 30 июля охватывает всё семейство GPT-5.6, однако масштаб изменений для каждой модели различается.

GPT-5.6 Luna: максимальное снижение цены

Luna получила самое агрессивное снижение цены.

Её стандартная цена на API изменилась со следующих уровней:

Тип токена Старая цена Новая цена Изменение
Входные 1,00 долл. / 1 млн токенов 0,20 долл. / 1 млн токенов -80%
Выходные 6,00 долл. / 1 млн токенов 1,20 долл. / 1 млн токенов -80%

OpenAI описывает Luna как самую быструю и доступную модель в семействе GPT-5.6, позиционируя её для чувствительных к цене высокопроизводительных нагрузок.

К таким задачам относятся:

  • Классификация
  • Извлечение информации
  • Фоновые агенты
  • Повседневная разработка кода
  • Генерация тестов
  • Рабочие процессы со структурированными выходными данными
  • Субагенты, использующие инструменты
  • Масштабная обработка документов

Более низкая цена особенно меняет экономику агентных циклов, поскольку один пользовательский запрос может включать множество вызовов модели, а не одно простое завершение.

OpenAI отмечает, что Luna способна использовать инструменты и выполнять многошаговые рабочие процессы, что делает практичным делегирование большего объёма работы более дешёвой модели без необходимости сохранять агентное поведение исключительно за более дорогим передовым уровнем.

GPT-5.6 Terra: меньшее, но значимое снижение цены

Стандартная цена на API для Terra теперь составляет:

Тип токена Старая цена Новая цена Изменение
Входные 2,50 долл. / 1 млн токенов 2,00 долл. / 1 млн токенов -20%
Выходные 15,00 долл. / 1 млн токенов 12,00 долл. / 1 млн токенов -20%

Terra по-прежнему остаётся моделью среднего уровня в семействе GPT-5.6.

Она предназначена для нагрузок, требующих более сильных рассуждений, чем Luna, но не обязательно более высоких затрат Sol.

Типичные области применения включают:

  • Повседневные корпоративные агенты
  • Помощь в программировании
  • Вопросы и ответы в рабочем пространстве
  • Анализ документов
  • Исследования ограниченного объёма
  • Многошаговые профессиональные рабочие процессы

OpenAI упоминает Notion как одного из клиентов, использующих Terra для персональных агентных нагрузок, таких как чувствительные к задержке вопросы и ответы в рабочем пространстве и задачи ограниченного объёма.

GPT-5.6 Sol сохраняет стандартную цену без изменений

Стандартная цена на API для Sol осталась неизменной:

Тип токена Стандартная цена
Входные 5,00 долл. / 1 млн токенов
Выходные 30,00 долл. / 1 млн токенов

Изменение для Sol — это не снижение цены.

Вместо этого OpenAI представила быстрый режим.

Быстрый режим Sol: скорость до 2,5 раз выше

Быстрый режим заменяет прежнюю терминологию OpenAI «приоритетной обработки».

Для GPT-5.6 Sol OpenAI сообщает, что быстрый режим обрабатывает запросы до 2,5 раз быстрее стандартной обработки при неизменном уровне интеллекта модели.

Цена — это стоимость.

Быстрый режим стоит вдвое дороже стандартной обработки.

Для Sol это означает:

Тип токена Стандарт Быстрый режим
Входные 5,00 долл. / 1 млн 10,00 долл. / 1 млн
Кэшированные входные 0,50 долл. / 1 млн 1,00 долл. / 1 млн
Выходные 30,00 долл. / 1 млн 60,00 долл. / 1 млн

Существующие запросы API с использованием:

service_tier="priority"

сохраняют обратную совместимость и направляются в быстрый режим.

OpenAI также поддерживает:

service_tier="fast"

в качестве переименованного идентификатора услуги.

Быстрый режим особенно полезен, когда стоимость ожидания превышает стоимость более быстрых вычислений.

Примеры включают:

  • Интерактивные агенты для программирования
  • Чувствительные ко времени производственные рабочие процессы
  • Помощь аналитикам в реальном времени
  • Операции с высокоценными клиентами
  • Сложные агентные задачи, где задержка накапливается на множестве шагов

Рабочий процесс, требующий 20 или 30 вызовов модели, даже если каждый отдельный вызов имеет небольшую задержку, может ощущаться значительно медленнее, чем одиночный ответ в чате. Поэтому в агентных системах более быстрая обработка может иметь непропорционально важное значение.

Изменения в учёте использования для ChatGPT Work и Codex

Более низкие цены на Luna и Terra также отразились на способе расчёта использования в ChatGPT Work и Codex.

OpenAI сообщает:

  • Бесплатные пользователи и пользователи Go могут использовать Terra.
  • Пользователи Plus, Pro, Business и Enterprise могут выбирать Terra и Luna.
  • Цены на подписку и бюджетные лимиты остаются без изменений.
  • Поскольку Luna и Terra стали дешевле, теперь они расходуют меньше кредитов.

Это не означает, что платные подписки сами по себе подешевели.

Это изменение означает, что при выборе Luna или Terra те же лимиты будут действовать дольше.

Соотношение цены и производительности становится более важным показателем для моделей

OpenAI опубликовала график зависимости цены от интеллекта на основе Artificial Analysis Intelligence Index v4.1, чтобы проиллюстрировать новое позиционирование Luna.

На графике GPT-5.6 Luna размещена выше 50 баллов по индексу интеллекта, а после корректировки цен одна из Luna

Расчётная стоимость задачи в конфигурации составляет примерно 0,05 доллара США.

Эти данные не следует путать с ценой любого отдельного вызова API.

Artificial Analysis рассчитывает стоимость за задачу индекса интеллекта на основе использования токенов модели и взвешенной методологии на базе бенчмарков. Фактическая стоимость производственных запросов зависит от:

  • размера входа

  • размера выхода

  • глубины рассуждений

  • кэширования подсказок

  • количества вызовов инструментов

  • числа раундов выполнения агента

  • тарификации длинного контекста

  • механизма повторов

До снижения цен 30 июля Artificial Analysis сообщала, что индекс интеллекта GPT-5.6 Luna в конфигурации с максимальным рассуждением составлял около 51.

Новые более низкие цены на токены ещё сильнее сместили Luna к низкозатратному концу кривой «интеллект-стоимость».

Более широкая идея, которую доносит OpenAI, заключается в том, что предприятиям не следует использовать самую дорогую модель на каждом этапе.

Рабочий процесс может сначала использовать Sol для устранения неоднозначности и составления плана, а затем поручать Luna чётко определённые задачи по реализации, тестированию или повторяющейся работе.

Когда модели более низкого уровня уже способны использовать инструменты и выполнять многошаговые рабочие процессы, такой подход к маршрутизации моделей становится более привлекательным.

2. GPT-5.6 помогла оптимизировать инфраструктуру, на которой работает GPT-5.6

За день до снижения цен OpenAI опубликовала подробную техническую статью о том, как GPT-5.6 стала более эффективной.

Самым необычным аспектом этой истории является то, что GPT-5.6 Sol сама участвовала в процессе оптимизации.

OpenAI сообщает, что её инженеры использовали Sol через Codex для анализа производственных систем, написания производительного кода, тестирования альтернатив и мониторинга экспериментов.

Компания описала три основных уровня оптимизации:

  1. Набор инструментов для агентов
  2. Оркестрация API и запросов
  3. Инференс модели на GPU-инфраструктуре

Sol помогла оптимизировать производственные GPU-ядра

На уровне инференса OpenAI сообщает, что GPT-5.6 Sol самостоятельно переписала и оптимизировала производственные ядра.

GPU-ядра — это низкоуровневые программы, отвечающие за эффективное выполнение математических операций на аппаратном обеспечении ускорителей.

Даже если базовая архитектура модели не меняется, неэффективное перемещение данных, синхронизация, планирование или компоновка данных могут привести к недостаточному использованию дорогостоящих GPU-ресурсов.

OpenAI сообщает, что Sol помогла выявить следующие типы вычислений, подлежащих оптимизации:

  • те, которые можно вычислить заранее
  • те, которых можно избежать
  • те, которые можно распараллелить
  • те, которые можно переупорядочить
  • те, которые можно реализовать с помощью более эффективных ядер

Компания особо отметила участие в этой работе технологий GPU-программирования Triton и Gluon.

По данным OpenAI, улучшения ядер и связанные с ними оптимизации сервиса позволили снизить сквозную стоимость обслуживания GPT-5.6 на 20%.

Sol также улучшила спекулятивное декодирование

Ещё одной важной оптимизацией стало спекулятивное декодирование.

Упрощённая версия спекулятивного декодирования выглядит так:

  1. Меньшая черновая модель предсказывает несколько возможных следующих токенов.
  2. Основная модель параллельно оценивает эти кандидатные токены.
  3. Принятые токены могут быть выведены без того же объёма последовательной генеративной работы.

Таким образом, качество черновой модели имеет решающее значение.

OpenAI сообщает, что GPT-5.6 Sol спроектировала и провела сотни экспериментов с архитектурой спекулятивной модели, включая изменения:

  • масштаба
  • структуры
  • признаков
  • конфигурации обучения

Sol также контролировала процесс обучения и вмешивалась при возникновении аппаратных сбоев или нестабильности обучения.

OpenAI сообщает, что полученные улучшения позволили повысить эффективность генерации токенов более чем на 15%.

Балансировка нагрузки также важна

Стоимость модели зависит не только от кода, выполняемого внутри одного GPU.

Запросы необходимо маршрутизировать между следующими уровнями:

  • регионами
  • центрами обработки данных
  • типами ускорителей
  • кластерами
  • экземплярами модели
  • подсетями модели
  • вычислительными ядрами

Если работа распределена неравномерно и часть оборудования простаивает, затраты могут оставаться высокими даже при мощных ускорителях.

OpenAI сообщает, что Sol помогла проанализировать производственный трафик, выявить источники дисбаланса нагрузки, протестировать альтернативные стратегии маршрутизации и настроить эвристики, используемые для распределения запросов.

Такого рода операционные оптимизации позволяют повысить общую пропускную способность без соответствующих дополнительных вложений в оборудование.

Управление контекстом снижает объём повторных вычислений

OpenAI также оптимизировала агентные фреймворки, используемые такими системами, как Codex и ChatGPT Work.

Агенту может потребоваться несколько вызовов модели и инструментов, прежде чем он вернёт конечный результат.

Например, Codex может:

  1. Просмотреть исходный код.
  2. Поискать в истории развёртываний.
  3. Прочитать отчёт об инциденте.
  4. Отредактировать файл.
  5. Запустить тесты.
  6. Проверить ошибки.
  7. Изменить код.
  8. Повторно запустить тесты.

Каждый цикл может переносить контекст, определения инструментов, предыдущие результаты и информацию об окружении.

Если этот контекст неоправданно растёт, увеличиваются и затраты, и задержка.

OpenAI сообщает, что её агентный фреймворк использует такие методы, как отложенное обнаружение, когда инструменты, навыки, плагины и MCP-интеграции раскрываются только при необходимости.

Вывод инструментов по умолчанию ограничен 10 000 токенов, если модель не запрашивает иное ограничение.

Это снижает вероятность того, что крупные результаты инструментов будут без необходимости заполнять окно контекста.

Только добавление в историю для сохранения кэша подсказок

Агентные циклы обычно многократно повторно используют одни и те же инструкции и контекст.

Кэширование подсказок позволяет избежать повторных вычислений стабильных префиксов подсказок.

Но кэш работает только тогда, когда повторяющийся префикс остаётся полностью идентичным.

OpenAI сообщает, что её фреймворк сохраняет свойство только добавления для видимой модели истории:

  • Новые сообщения добавляются в конец.
  • Результаты инструментов добавляются в конец.
  • Обновления окружения добавляются в конец.
  • Порядок инструментов детерминирован.
  • Настройки одобрения в рантайме не обрабатываются в определениях инструментов.

Такая конструкция повышает частоту повторного использования кэша подсказок в Codex и ChatGPT Work.

Основной принцип прост:

Модель становится дешевле не только благодаря более низкой стоимости токенов, но и потому, что окружающая система с самого начала избегает генерации и обработки ненужных токенов.

Цикл эффективности может давать совокупный эффект

OpenAI описывает это как петлю обратной связи.

Более сильные модели помогают инженерам улучшать:

  • GPU-ядра
  • маршрутизацию
  • спекулятивное декодирование
  • кэширование
  • конфигурацию рабочих нагрузок
  • оркестрацию агентов

Эти улучшения снижают затраты и задержку.

Более эффективная инфраструктура, в свою очередь, делает экономически выгодным запуск более сильных моделей в большем масштабе.

OpenAI считает, что это может сократить цикл от разработки модели до масштабного развёртывания, ускоряя темпы инноваций в области ИИ.

Необходимо находить следующие поколения оптимизационных выгод.

Снижение цен на Luna и Terra 30 июля — это наиболее заметный для клиентов результат на сегодняшний день.

3. Реакция разработчиков: Luna получает больше внимания, конкуренты сталкиваются с новым ценовым давлением

В оригинальном отчёте на китайском языке также подчёркивалась бурная реакция сообщества разработчиков после объявления.

Некоторые пользователи обратили внимание на масштаб снижения цены на Luna.

Снижение на 80% значительно превышает постепенные корректировки цен, обычные для передовых API.

Другие считали, что Luna была недооценена ещё до снижения цены, особенно для агентных рабочих нагрузок — в таких сценариях более дешёвые модели могут выполнять рутинные задачи под руководством более сильного планировщика.

Эта корректировка цен также немедленно вызвала сравнения с другими экономичными моделями, включая Kimi K3.

Распространённый в сообществе мем описывал ситуацию так: Luna внезапно начала бороться за пользователей, которых привлекло низкое позиционирование цены Kimi K3.

Этот мем был забавным, но он не является техническим бенчмарком и поэтому не включён в изображения основного текста.

Разработчики немедленно спросили, ответит ли Anthropic

Ещё одной распространённой реакцией было упоминание @Anthropic с вопросом, будет ли соответственно скорректировано ценообразование Claude API.

Эта реакция отражает более широкие изменения в конкурентной среде на переднем крае больших моделей.

Год назад наиболее заметная конкуренция сосредотачивалась на:

  • результатах бенчмарков
  • способностях к программированию
  • размере окна контекста
  • мультимодальных функциях

Эти измерения по-прежнему важны.

Но разработчики, запускающие производственных агентов, всё больше внимания уделяют:

  • стоимости за выполненную задачу
  • задержке
  • объёму использования выходных токенов
  • эффективности кэширования подсказок
  • количеству вызовов инструментов
  • надёжности
  • гибкости маршрутизации моделей

Самые дешёвые токены — не всегда самый дешёвый рабочий процесс.

Точно так же самая умная модель не обязательно является лучшей моделью для каждого шага рабочего процесса.

Снижение цены Luna делает маршрутизацию моделей более привлекательной

Предположим, задача состоит из пяти этапов:

  1. Понять нечётко сформулированный вопрос.
  2. Составить план.
  3. Внести изменения в обычные файлы.
  4. Написать тесты.
  5. Проверить результаты.

Команда может использовать Sol на этапах 1 и 2.

Когда работа чётко определена, Luna может справиться с этапами 3–5.

Чем дешевле Luna, тем сильнее стимул переводить рутинную работу агентов с флагманской модели на более доступную.

Это не означает, что Luna приближается к Sol по всем возможностям.

Это означает, что ценность меньшей модели зависит от того, достаточно ли она умна для конкретной поставленной задачи.

Главный показатель — стоимость за успешный результат

Новая риторика OpenAI настойчиво подчёркивает результат за каждый доллар.

Это полезнее, чем просто смотреть на цену токенов.

Оценка в производственной среде должна отслеживать:

  • долю успешных задач
  • входные токены
  • выходные токены
  • повторное использование кэша входных данных
  • количество раундов модели
  • вызовы инструментов
  • сквозную задержку
  • частоту повторов
  • время ручных исправлений
  • общую стоимость за успешную задачу

Модель, которая в пять раз дешевле за токен, всё равно может оказаться дорогой, если требует множества повторов.

Более дорогая модель, которая выполняет работу за меньшее количество шагов, в итоге может обойтись дешевле.

Новое ценообразование Luna делает расчёты более выгодными для меньших моделей, но разработчикам по-прежнему необходимы

оценки под конкретные рабочие нагрузки.

Вывод: конкуренция моделей смещается в сторону соотношения интеллекта и цены

События 29 и 30 июля показывают, что OpenAI одновременно продвигает две связанные идеи.

Во-первых, GPT-5.6 всё чаще используется для улучшения инфраструктуры, на которой работает сам GPT-5.6.

Во-вторых, компания конвертирует часть этого повышения эффективности в более низкие цены для клиентов и более быстрые варианты обслуживания.

Это меняет конкурентный ландшафт.

Следующий этап рынка моделей — это не просто:

Какая модель самая умная?

Но также:

Сколько полезного интеллекта разработчик может купить за каждый доллар и каждую секунду ожидания?

Снижение цены Luna на 80% делает этот вопрос особенно актуальным.

Terra становится дешевле для повседневной профессиональной работы.

Sol остаётся моделью высокого класса, но режим Fast позволяет разработчикам платить больше за скорость, когда время критично.

По мере того как качество моделей сближается по всё большему числу задач, компании, которые заставляют то же оборудование выполнять больше полезной работы — и конвертируют этот рост эффективности в более выгодные цены — могут получить всё более важное конкурентное преимущество.

Часто задаваемые вопросы

Какова новая цена API для GPT-5.6 Luna?

Начиная с 30 июля 2026 года OpenAI установил цену GPT-5.6 Luna в стандартном режиме обработки на уровне 0,20 доллара за миллион входных токенов и 1,20 доллара за миллион выходных токенов. Это на 80% ниже первоначальной цены в 1 доллар за миллион входных и 6 долларов за миллион выходных токенов.

Какова новая цена для GPT-5.6 Terra?

GPT-5.6 Terra в настоящее время в стандартном режиме обработки стоит 2 доллара за миллион входных токенов и 12 долларов за миллион выходных токенов. OpenAI заявляет, что это на 20% ниже прежней цены в 2,50 доллара за миллион входных и 15 долларов за миллион выходных токенов.

Подорожала ли GPT-5.6 Sol?

Нет. Стандартная цена API для Sol остаётся на уровне 5 долларов за миллион входных токенов и 30 долларов за миллион выходных токенов. Основное изменение — введение режима Fast.

Что такое режим Fast для GPT-5.6 Sol?

Режим Fast — это более быстрый уровень обработки API от OpenAI, который заменяет прежнее название Priority Processing (приоритетная обработка). Для GPT-5.6 Sol OpenAI заявляет, что при двойной стандартной цене токенов скорость обработки может возрасти до 2,5 раза по сравнению со стандартным режимом, без изменения уровня интеллекта модели.

Остаются ли старые запросы Priority Processing API действительными?

Да. OpenAI сообщает, что запросы с уровнем обслуживания priority по-прежнему обратно совместимы и автоматически используют режим Fast. Разработчики также могут использовать значение уровня обслуживания fast.

Действительно ли GPT-5.6 помог оптимизировать сам себя?

OpenAI сообщает, что GPT-5.6 Sol, используемый через Codex в процессе инженерии под руководством человека, помог анализировать производственный трафик, переписывать GPU-ядра, проводить сотни экспериментов со спекулятивным декодированием и контролировать процесс обучения. OpenAI частично приписывает этой работе снижение сквозной стоимости обслуживания на 20% и повышение эффективности генерации токенов более чем на 15%.

Изменят ли снижения цен подписку на ChatGPT?

Цены на подписку и квоты бюджета не изменятся. OpenAI заявляет, что благодаря более низким базовым ценам Luna и Terra теперь расходуют меньше кредитов в Codex и ChatGPT Work.

Является ли Luna теперь лучшей моделью для всех рабочих нагрузок агентов?

Нет. Luna стала значительно дешевле, но выбор модели по-прежнему зависит от сложности задачи и допустимой частоты ошибок. Распространённая стратегия — использовать более сильную модель для нечётких задач планирования и более дешёвую — для чётко определённых исполнительных задач.

Связанные инструменты

  • OpenAI API: платформа разработчика OpenAI для доступа к моделям GPT-5.6 и API-сервисам.
  • GPT-5.6 Sol: официальные спецификации флагманской модели GPT-5.6.
  • GPT-5.6 Terra: официальная документация модели сбалансированного уровня GPT-5.6.
  • GPT-5.6 Luna: официальная документация ценового уровня GPT-5.6 для чувствительных к стоимости задач.
  • Codex: агентная среда разработки OpenAI, частично использовавшаяся в работе по оптимизации GPT-5.6.
  • Artificial Analysis: независимая платформа анализа моделей, охватывающая уровень интеллекта, скорость, использование токенов и стоимость за задачу.

Связанные ссылки

ai/models/gpt-5-6-luna/): подробная информация о методологии модели Luna и её интеллектуальном индексе.

Итоги

OpenAI снизила цены на API GPT-5.6 Luna на 80%, а на Terra — на 20%, оставив цену Sol Standard без изменений. Вместо этого для Sol добавлен режим Fast, который увеличивает скорость обработки API до 2,5 раз, но стоит вдвое дороже Standard.

Этот момент тесно связан с недавней инженерной работой OpenAI. Компания сообщает, что GPT-5.6 Sol помогла оптимизировать ядра GPU, спекулятивное декодирование, балансировку нагрузки и инфраструктуру для агентов, что снизило сквозные затраты на обслуживание на 20% и обеспечило рост эффективности генерации токенов более чем на 15% в части технологического стека.

Для разработчиков результат — более широкий диапазон соотношения цены и производительности: Sol для самых сложных задач, Terra для сбалансированных профессиональных задач, а Luna — для масштабных агентных операций по более низкой цене.

Обновление GPT-5.6 показывает, что конкуренция среди передовых моделей всё больше сосредоточена на стоимости каждого успешного результата, а не только на уровне интеллекта по сырым бенчмаркам.