DeepSeek V4 Flash создал 3D-шутер за 0,07 доллара — вот почему эта модель такая дешёвая
DeepSeek V4 Flash 0731 вышла в открытую бета-версию со знакомым обещанием: более мощные возможности кодинга и агентности при крайне низких ценах на API. Разработчики быстро проверили это заявление на практике.

DeepSeek V4 Flash создал 3D-шутер всего за 0,07 доллара — почему эта модель такая дешёвая
Введение
DeepSeek V4 Flash 0731 вышел в открытую бета-версию со знакомым обещанием: повышенная производительность в кодинге и агентные возможности по крайне низким ценам на API.
Разработчики быстро превратили это заявление в реальные эксперименты.
Один из самых вирусных примеров — запуск Hermes Agent, в ходе которого DeepSeek V4 Flash сгенерировал играбельный шутер от первого лица в 3D всего по одному стартовому промпту. По сообщениям, проект занял 32 минуты, а стоимость использования модели составила всего 0,07 доллара.
Итоговый результат включал:
- Передвижение от первого лица.
- Прыжки.
- Стрельбу.
- Физические столкновения с окружением.
- Объекты-укрытия и цели.
- Счётчик патронов в интерфейсе.

Вывод из этой вирусной истории прост: по такой цене двух долларов хватит на целый день экспериментов.
Это заявление не стоит воспринимать как универсальную гарантию ежедневных расходов. Затраты агента зависят от длины промпта, объёма выходных данных, количества повторов, вызовов инструментов, частоты попаданий в кэш, накладных расходов фреймворка и сложности задачи.
Тем не менее, эта демонстрация отражает главную привлекательность V4 Flash: модель достаточно дешёвая, чтобы разработчики могли позволить агентам итерироваться бесконечно, а не относиться к каждой попытке как к дорогостоящей трате.
Официальные цены на API отчасти объясняют, почему так происходит.
DeepSeek V4 Flash 0731 теперь — официальная версия Flash
Компания DeepSeek выпустила производственную версию V4 Flash в публичную бета-версию API 31 июля 2026 года.
Название модели в API осталось прежним:
deepseek-v4-flash
Запросы с использованием этой модели теперь обращаются к DeepSeek-V4-Flash-0731.
DeepSeek сообщает, что версия 0731 заменяет предварительную модель и значительно улучшает агентные возможности.
Обновление распространяется на:
- API DeepSeek V4 Flash.
- Публичные веса модели V4 Flash.
- Совместимость с Responses API.
- Интеграцию для Codex.
Оно не заменяет:
- API DeepSeek V4 Pro.
- Модель, используемую в веб-приложении DeepSeek.
- Модель, используемую в мобильном приложении DeepSeek.
DeepSeek также заявила, что официальная версия V4 Pro будет выпущена отдельно.
Официальные цены на API крайне низкие
Текущие стандартные цены API DeepSeek составляют за миллион токенов:
| Позиция | DeepSeek V4 Flash |
|---|---|
| Входные данные с попаданием в кэш | 0,0028 доллара |
| Входные данные без попадания в кэш | 0,14 доллара |
| Выходные данные | 0,28 доллара |
| Длина контекста | 1 миллион токенов |
| Максимальный выход | 384 000 токенов |
| Режим рассуждения по умолчанию | Thinking |
| Лимит параллельных запросов | 2 500 |
Цена на входные данные с попаданием в кэш особенно низкая.
При цене 0,0028 доллара за миллион входных токенов с попаданием в кэш долгоживущий агент может многократно переиспользовать стабильный префикс — например, системные инструкции, схемы инструментов или контекст репозитория — не оплачивая каждый раз полную цену без кэша.
DeepSeek также анонсировала будущее дифференцированное ценообразование по часам пиковой и непиковой нагрузки.
Политика ценообразования.
Когда эта политика вступит в силу, в указанные ниже периоды по пекинскому времени все опубликованные цены будут удваиваться:
09:00–12:00
14:00–18:00
На момент проверки страницы с ценами DeepSeek не указала точную дату вступления в силу.
Поэтому приложениям, которые рассчитывают на фиксированную долгосрочную цену, следует сверяться с официальной страницей цен.
Один цент против одного доллара
В оригинальном тексте сравниваются DeepSeek V4 Flash и Claude Opus 5 на примере небольшого космического шутера.
По сообщениям, обе версии реализовали:
- Движение корабля.
- Функцию стрельбы.
- Разрушаемые астероиды.
- Собираемые бонусы.
- Играбельный игровой цикл.
Различия проявились в пути к результату.
По данным разработчика:
| Деталь | DeepSeek V4 Flash | Claude Opus 5 |
|---|---|---|
| Количество попыток до приемлемого результата | 3 | 1 |
| Примерный объём кода | 900 строк | почти 3 000 строк |
| Указанная стоимость модели | $0,01 | $1,00 |
Opus добился результата с первой попытки, тогда как V4 Flash потребовал дополнительных итераций.
Итоговый проект описан как функционально достаточно похожий, поэтому указанная в отчёте разница в стоимости в 100 раз стала центральной темой обсуждения.
Это не было контролируемое бенчмарк-тестирование моделей.
В сравнении не был опубликован полный воспроизводимый пакет, включающий:
- Одинаковый агентный фреймворк.
- Полностью идентичные промпты и последующие сообщения.
- Журналы вызовов инструментов.
- Лимиты времени выполнения.
- Правила подсчёта токенов.
- Настройки вычислительных ресурсов моделей.
- Ручное вмешательство.
- Наличие ресурсных материалов или шаблонного кода.
Поэтому к этому результату следует относиться как к показательной истории разработчика, а не как к доказательству того, что V4 Flash всегда в 100 раз дешевле Opus 5 при одинаковой работе.
DeepSeek V4 Flash против GPT-5.6 Sol
В другом сравнении DeepSeek V4 Flash и GPT-5.6 Sol попросили создать небольшую 3D-игру с навигацией по реке.
По сообщениям, обе модели выдали:
- Полный сценарий реки.
- Функцию движения влево-вправо.
- Столкновения с препятствиями.
- Отслеживание очков.
- Деревья и дальние планы.
- Похожее базовое взаимодействие.
Указанные затраты:
| Модель | Указанная стоимость |
|---|---|
| DeepSeek V4 Flash | $0,05 |
| GPT-5.6 Sol | $2,47 |
Это почти 50-кратная разница в рамках данного конкретного запуска.

Визуальные результаты описаны как в целом схожие, хотя версия DeepSeek использовала окружение меньшего масштаба.
Аналогично, это сравнение носит анекдотический характер.
GPT-5.6 Sol и DeepSeek V4 Flash имеют разное поведение рассуждений по умолчанию, структуру ценообразования, системы управления контекстом, агентные фреймворки и правила подсчёта токенов.
Справедливое сравнение в производственной среде должно измерять:
Общая стоимость задачи
÷
Количество успешных и приемлемых результатов
Это
Самый дешёвый отдельный запрос не всегда является самым дешёвым для всего проекта.
Модель, требующая множества повторных попыток, генерирующая код, требующий intense сопровождения, или требующая значительной ручной проверки, может потерять своё первоначальное ценовое преимущество.
Влияние количества токенов на стоимость может быть больше, чем визуальное качество
В статье также описывается тест, в котором GPT-5.6 Luna и DeepSeek V4 Flash сгенерировали 3D-модель в стиле покемонов по одному и тому же запросу.
Визуальные результаты трудно однозначно оценить, но общее количество выходных токенов различалось кардинально:
| Модель | Заявленный объём вывода |
|---|---|
| GPT-5.6 Luna | Более 2,3 миллиона токенов |
| DeepSeek V4 Flash | Около 477 тысяч токенов |
Согласно отчёту, общая стоимость задачи отличалась почти в 14 раз.
Ключевой вывод не в том, что какая-то модель всегда использует ровно столько токенов.
А в том, что экономика агентов зависит не только от цены за миллион токенов.
Общая стоимость определяется:
- Избыточностью вывода.
- Повторной перезаписью файлов.
- Журналами вызовов инструментов.
- Токенами рассуждений.
- Неудачными попытками.
- Воспроизведением контекста.
- Повторным использованием кэша.
- Объёмом сгенерированного кода.
- Поведением агентного фреймворка.
Цена за токен у модели может быть относительно низкой, но если она создаёт ненужный вывод, она всё равно может оказаться дорогой.
Ценностное предложение V4 Flash сочетает более низкую заявленную цену и относительно компактное выполнение в нескольких приведённых примерах.
Двухчасовой эксперимент обошёлся всего в семь центов
Другой разработчик сообщил, что потратил почти два часа на эксперименты и заплатил всего семь центов.

Этот комментарий иллюстрирует, как низкая предельная стоимость меняет поведение пользователей.
Когда один вызов модели кажется дорогим, разработчики часто:
- Ограничивают количество итераций.
- Сокращают промпты.
- Избегают исследовательских ветвлений.
- Останавливаются, когда результат «достаточно хорош».
- Приберегают агентов для высокоценной работы.
Когда стоимость измеряется центами, разработчики могут позволить себе больше:
- Проб и ошибок.
- Параллельных идей.
- Автоматизированных тестов.
- Попыток исправления.
- Долго выполняющихся фоновых задач.
- Мелких экспериментов, которые иначе были бы пропущены.
Это не означает, что вычисления бесплатны.
В масштабах предприятия доли цента, умноженные на миллионы вызовов, всё равно могут составить значительные расходы.
Более значимое изменение заключается в том, что порог для экспериментов становится гораздо ниже.
Почему DeepSeek V4 Flash такая дешёвая?
В статье низкая стоимость V4 Flash объясняется множеством архитектурных и системных решений.
Основные факторы включают:
- Разреженные вычисления со смесью экспертов (MoE).
- Сжатые механизмы внимания для длинного контекста.
- Низкоточные веса модели.
- Спекулятивное декодирование через DSpark.
- Улучшения после обучения без необходимости полного повторного предобучения.
- Высококонкурентный API-сервис.
Каждый компонент снижает затраты по своей категории.
Модель с 284 миллиардами параметров, активирующая лишь 13 миллиардов
Основой DeepSeek V4
Flash является архитектура со смесью экспертов (MoE).
В техническом отчёте указаны следующие данные:
| Архитектурная деталь | DeepSeek V4 Flash |
|---|---|
| Общее количество параметров модели | 284 миллиарда |
| Активируемые параметры на токен | 13 миллиардов |
| Длина контекста | 1 миллион токенов |
| Обучающие данные | Более 32 триллионов токенов |
| Основная точность | Смешанная точность FP4 + FP8 |
Хотя модель хранит сотни миллиардов параметров, не все они задействуются для каждого токена.
Механизм маршрутизации выбирает небольшое подмножество экспертов.
Это уменьшает объём активных вычислений на токен, сохраняя при этом доступ к большему пулу параметров.
Упрощённое сравнение выглядит так:
Плотная модель:
Каждый токен → Большая часть или все веса модели
MoE-модель:
Каждый токен → Только выбранные эксперты
Это одна из причин, почему крупные MoE-модели значительно дешевле в обслуживании, чем плотные модели с сопоставимым количеством параметров.
Почему на некоторых страницах указано 304B параметров
Метаданные Hugging Face полного репозитория DeepSeek-V4-Flash-0731 в настоящее время показывают около 304B параметров.
Это не противоречит данным из технического отчёта о 284B параметрах основной модели.
Версия 0731 включает модуль спекулятивного декодирования DSpark. Метаданные репозитория могут учитывать целевую модель вместе с прилагаемым черновым компонентом.
Что касается архитектурных обсуждений, технический отчёт DeepSeek остаётся наиболее ясным источником:
- Общее количество параметров основной модели V4 Flash — 284B.
- Активируемые параметры на токен — 13B.
- Дополнительные веса DSpark для спекулятивного декодирования в версии 0731.

CSA и HCA снижают стоимость длинного контекста
DeepSeek V4 поддерживает окно контекста в 1 миллион токенов.
Традиционные системы внимания становятся чрезвычайно дорогими в таких масштабах, поскольку каждый новый токен может потребовать обработки большого объёма предыдущего контекста и поддержания значительного KV-кэша.
В техническом отчёте DeepSeek описывается гибридная конструкция внимания, сочетающая:
- Сжатое разреженное внимание (CSA)
- Сильно сжатое внимание (HCA)
Общая стратегия заключается в том, чтобы избегать полных и дорогостоящих вычислений внимания по всей истории на каждом шаге.
Система сжимает и фильтрует контекст, позволяя модели сосредоточить вычисления на наиболее полезной информации.
DeepSeek сообщает, что в контексте из 1 миллиона токенов V4 Pro требует:
27% от FLOPs на токен вывода DeepSeek V3.2.
- 10% от объёма KV-кэша.
Эти точные проценты указаны в техническом документе для V4 Pro и не являются отдельными данными аудита для Flash.
V4 Flash использует то же семейство архитектур, поэтому наследует те же принципы проектирования длинного контекста.
Практический эффект включает снижение:
- памяти KV-кэша.
- нагрузки на память GPU.
- объёма перемещаемых данных.
- вычислений на токен.
- стоимости обслуживания длинного контекста.
FP4 и FP8 уменьшают объём хранимых данных
и трафик памяти
Опубликованная модель V4 Flash использует смешанную низкую точность весов.
DeepSeek указывает:
FP4 + FP8 смешанная точность
Более низкая точность уменьшает объём данных, которые необходимо хранить, загружать из памяти, передавать между устройствами и обрабатывать во время инференса.
Это важно, потому что современный инференс языковых моделей часто ограничен пропускной способностью памяти, а не только вычислительной мощностью.
Если аппаратное обеспечение и ядра спроектированы для эффективного выполнения таких форматов, более компактное представление данных может повысить пропускную способность.
Низкая точность не является автоматически бесплатной.
Плохая квантизация снижает качество модели.
Релиз DeepSeek спроектирован и обучен под выбранную схему точности, а не полагается на постфактум-квантизацию сторонними сообществами.
Архитектура не изменилась между предварительной версией и версией 0731
DeepSeek заявляет, что официальная версия 0731 сохраняет ту же архитектуру и масштаб модели, что и предварительная версия V4 Flash.
Компания не проводила полное предварительное обучение заново для этого обновления.
Вместо этого был переделан этап пост-обучения.
В исходной статье изменения резюмируются так:
- Новый контролируемый тонкий тюнинг.
- Новое обучение с подкреплением GRPO.
- Спекулятивное декодирование DSpark.
- Улучшенное поведение агента.
- Более высокая пропускная способность обслуживания.
В техническом отчёте DeepSeek более широкий процесс пост-обучения V4 описывается так:
- Независимая разработка экспертных модулей для доменов.
- Контролируемый тонкий тюнинг и обучение с подкреплением с GRPO.
- Дистилляция политики в онлайне.
- Интеграция экспертных возможностей в единую модель.
Обновление 0731 сосредоточено на улучшении этих возможностей в реальных сценариях работы агентов.
DSpark ускоряет генерацию токенов
DeepSeek-V4-Flash-0731 поставляется с модулем спекулятивного декодирования DSpark.
Спекулятивное декодирование использует более маленький или более дешёвый путь-черновик для предложения нескольких будущих токенов.
Основная модель пакетно проверяет эти предложения.
Упрощённый процесс выглядит так:
Черновой модуль предлагает токены
→ Основная модель одновременно проверяет
→ Принятые токены выводятся
→ Отклонённые пути исправляются
Когда прогнозы черновика точны, система может генерировать несколько принятых токенов с меньшим количеством дорогих последовательных рассуждений основной модели.
DeepSeek предоставляет поддержку DSpark для vLLM и SGLang.
Для vLLM официальная карточка модели использует:
--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'
Для SGLang соответствующий параметр:
--speculative-algorithm DSPARK
DeepSeek указывает, что веса целевой и черновой моделей хранятся в одном чекпоинте, поэтому SGLang не требует отдельного пути для черновой модели.
Спекулятивное декодирование в первую очередь повышает скорость обслуживания и пропускную способность.
Само по себе оно не объясняет улучшение рассуждений модели.
Эти улучшения связаны с обновлённым процессом пост-обучения.
Официальный релиз улучшает результаты в бенчмарках для агентов
DeepSeek сообщает о значительных улучшениях по ряду агентских тестов по сравнению с предварительной версией V4 Flash.
| Бенчмарк | V4 Flash 0731 | V4 Flash Preview | V4 Pro Preview |
|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | 72.1 |
| NL2Repo | 54.2 | 39.4 | 38.5 |
| CyberGym | 76.7 | 38.7 | 52.7 |
| DeepSWE | 54.4 | 7.3 |
12.8 |
| Toolathlon-Verified | 70.3 | 49.7 | 55.9 |
| Agents' Last Exam | 25.2 | 15.8 | 16.5 |
| AutomationBench Public | 25.1 | 10.8 | 12.8 |
| DSBench-FullStack | 68.7 | 37.0 | 41.8 |
| DSBench-Hard | 59.6 | 25.8 | 31.1 |

DeepSeek сообщает, что публичные бенчмарки для кодовых агентов запускались со следующими настройками:
DeepSeek Harness минимальный режим
reasoning_effort = max
top_p = 0.95
temperature = 1.0
На момент официального обновления этот фреймворк тестирования ещё не был опубликован.
DSBench-FullStack и DSBench-Hard — внутренние бенчмарки DeepSeek.
Это означает, что их результаты могут служить свидетельством заявлений компании, но не могут быть независимо проверены так же, как полностью открытые наборы тестов.
Что измеряют Terminal Bench и Toolathlon
Terminal Bench 2.1
Terminal Bench оценивает способность агента выполнять задачи в терминальной среде.
Модели может потребоваться просматривать файлы, выполнять команды, устанавливать зависимости, отлаживать сбои, изменять код и проверять завершение.
Высокий балл отражает совокупную производительность модели, фреймворка агента, стратегии использования инструментов, бюджета рассуждений и среды выполнения.
Toolathlon-Verified
Toolathlon оценивает длительные задачи с использованием нескольких программных приложений и инструментов.
Бенчмарк включает сценарии, связанные с календарём, файловой системой, Notion, WooCommerce, Kubernetes и BigQuery.
Задачи требуют множества взаимодействий с инструментами и проверяются с помощью исполняемых оценщиков.
Результат 70.3, о котором сообщает DeepSeek, представляет собой значительное улучшение по сравнению с предварительной моделью.
Но это не следует интерпретировать как гарантию 70.3% успеха для каждого реального бизнес-процесса.
Улучшение бенчмарков не гарантирует успех с первой попытки для каждой игры
Пример игры из источника раскрывает важное различие между производительностью в бенчмарках и творческим программированием.
V4 Flash показывает высокие результаты в официальных агентских оценках, но для одного игрового сравнения всё же потребовалось три итерации.
Бенчмарки могут измерять частоту успеха на чётко определённых наборах задач с известными правилами оценки.
Творческие проекты могут включать нечёткие визуальные требования, проблемы совместимости с браузером, ошибки физического движка, отсутствующие ресурсы, субъективные оценки качества и отсутствие единого набора тестов для определения успеха.
В таких сценариях недорогие модели особенно полезны, потому что рабочий процесс может позволить несколько итераций.
Их ценность не обязательно в том, что первая генерация будет идеальной.
Это может быть:
Приемлемое качество
×
Большое количество доступных по цене попыток
V4 Flash поддерживает множество форматов API
DeepSeek предоставляет доступ к моделям следующими способами:
- Совместимый с OpenAI интерфейс Chat Completions.
- Совместимый с OpenAI API Responses.
- Совместимый с Anthropic API.
- Вывод в формате JSON.
- Вызов инструментов.
- Дополнение префикса чата.
- Заполнение середины в режиме без рассуждений.
Базовый URL для совместимости с OpenAI:
https://api.deepseek.com
Базовый URL для совместимости с Anthropic:
https://api.deepseek.com/anthropic
DeepSeek заявляет, что V4 Flash — единственная модель V4 API, которая в настоящее время поддерживает API Responses.
Поддержка V4 Pro будет организована отдельно.
Совместимость с API Responses также позволяет использовать эту модель в Codex через документированную конфигурацию DeepSeek.
Режим рассуждений включён по умолчанию
DeepSeek V4 Flash поддерживает режим рассуждений и режим без рассуждений.
Режим рассуждений является режимом по умолчанию.
Для локального вывода официальная карточка модели поддерживает три уровня усилий рассуждений:
low
high
max
DeepSeek рекомендует:
temperature = 1.0
top_p = 0.95
для сценариев с агентами.
Для уровней усилий high и max компания рекомендует разрешать максимальную длину вывода до 384K токенов.
Более высокие настройки рассуждений могут улучшить производительность на сложных задачах, но также могут увеличить задержку, объём вывода, стоимость API и время циклов агента.
Производственные системы должны оценивать самый низкий уровень усилий, способный надёжно удовлетворять требованиям задачи.
Веса выпущены под лицензией MIT
DeepSeek опубликовала веса V4 Flash 0731 на Hugging Face под лицензией MIT.
Это делает модель исключительно либеральной по лицензированию по сравнению со многими крупными коммерческими релизами.
Разработчики могут использовать официальный репозиторий модели с поддерживаемыми движками, включая:
- vLLM.
- SGLang.
- Transformers.
- Docker Model Runner.
- Квантованные версии, совместимые с llama.cpp.
- Сборки сообщества, совместимые с LM Studio.
Модель имеет большой размер.
Основная модель имеет 284B параметров, а в контрольной точке 0731 также присутствует компонент DSpark.
Для работы с приемлемой скоростью требуются значительные объёмы памяти и аппаратные ресурсы.
Возможность загрузки весов не означает, что полная модель сможет плавно работать на обычном потребительском ноутбуке.
Квантованные версии сообщества могут снизить требования к памяти, но могут изменить точность, пропускную способность, ёмкость контекста, поведение DSpark и надёжность вызова инструментов.
Всегда ли V4 Flash — самый выгодный вариант?
Источники в итоге приходят к выводу, что V4 Flash не всегда даёт лучший результат в каждом сравнении, но его очень трудно превзойти по соотношению цена/качество.
Это разумное резюме примеров, но с одной важной оговоркой:
Соотношение цена/качество зависит от полного рабочего процесса.
V4 Flash особенно привлекателен в следующих случаях:
- Высокий объём запросов.
- Ошибки легко обнаружить.
- Задачи можно автоматически повторять.
- Хороший эффект от кэширования контекста.
- Низкая стоимость ручной проверки.
- Компактный код приемлем.
- Приложение может использовать модели с открытыми весами.
В следующих случаях более дорогие передовые модели в целом могут всё же оказаться более экономичными:
- Результат одного сбоя приводит к большим потерям.
- Надёжность первого прохода критически важна.
- Задача требует более глубоких знаний.
- Агент не может безопасно повторить попытку.
- Высокая стоимость ручной проверки.
- Более мелкие модели создают вывод, который трудно поддерживать.
Правильное сравнение — не:
цена за токен
а:
стоимость за каждую подтверждённую успешную задачу
Как оценить V4 Flash для реального проекта
Шаг 1. Выберите репрезентативные задачи
Не тестируйте только отполированные демонстрации.
Используйте задачи, соответствующие производственной нагрузке, включая сложные и трудные сценарии.
Шаг 2. Зафиксируйте среду агента
Сохраняйте единообразие подсказок, инструментов, ограничений по времени, стратегий повтора, фреймворков, песочниц, тестовых наборов и настроек рассуждений между моделями.
Шаг 3. Фиксируйте полную стоимость
Отслеживайте входные данные без попадания в кэш, входные данные с попаданием в кэш, выходные токены, вызовы инструментов, количество повторов, время выполнения, ручные проверки и неудачные попытки.
Шаг 4. Оценивайте приемлемость, а не только визуальное сходство
Для кода запускайте тесты и проверяйте поддерживаемость.
Для игр проверяйте управление, столкновения, производительность и совместимость с браузером.
Шаг 5. Тестируйте поведение кэша
Когда стабильный контекст многократно повторно используется на нескольких шагах агента, модель с крайне низкой ценой при попадании в кэш становится ещё более ценной.
Шаг 6. Сравнивайте первый проход и конечный успех
Модель, которой потребовалось три дешёвые попытки для успеха, может быть более выгодной, чем модель, которая сразу достигла успеха по высокой цене.
Когда повторные попытки медленные или рискованные, ситуация может быть обратной.
Часто задаваемые вопросы
Что такое DeepSeek V4 Flash 0731?
DeepSeek V4 Flash 0731 — это официальная пост-тренировочная версия младшей модели DeepSeek V4 с смешанными экспертами. Она заменяет предварительную версию, добавляет модуль спекулятивного декодирования DSpark и ориентирована на задачи кодирования и агентов, использующих инструменты.
Какова стоимость API DeepSeek V4 Flash?
Текущие стандартные цены DeepSeek: 0,0028 доллара за миллион входных токенов с попаданием в кэш, 0,14 доллара за миллион входных токенов без попадания в кэш и 0,28 доллара за миллион выходных токенов. Компания объявила, что будущая политика удвоит цены в указанные пиковые часы.
Действительно ли DeepSeek V4 Flash создал 3D-игру за 0,07 доллара?
Один разработчик сообщил, что один запуск Hermes Agent сгенерировал играбельный шутер от первого лица за 32 минуты при стоимости 0,07 доллара. Это пример из социальных сетей, а не стандартизированный бенчмарк, поэтому стоимость других задач может быть выше или ниже.
Сколько параметров у DeepSeek V4 Flash?
В техническом отчёте V4 указано, что общее количество параметров основной модели Flash составляет 284 миллиарда, при этом активируется 13 миллиардов параметров на токен. Полный репозиторий версии 0731 может показывать около 304 миллиардов параметров, поскольку включает дополнительный компонент спекулятивного декодирования DSpark.
Почему DeepSeek V4 Flash такой дешёвый?
Низкая стоимость обусловлена разреженной активацией смешанных экспертов, сжатым вниманием к длинному контексту, смешанной точностью FP4/FP8, кэшированием подсказок, спекулятивным декодированием и высококонкурентным обслуживанием. На каждый токен активируется лишь небольшая часть всех экспертов.
Превосходит ли DeepSeek V4 Flash Claude Opus 5 или GPT-5.6?
При текущих ценах API он значительно дешевле и показал конкурентоспособные результаты в нескольких демонстрациях сообщества. Opus 5 и GPT-5.6 могут по-прежнему обеспечивать более высокую надёжность первого прохода или качество в некоторых задачах, а вирусные сравнения не являются контролируемыми бенчмарками.
Можно ли запускать DeepSeek V4 Flash локально?
Да. DeepSeek опубликовала веса под лицензией MIT и предоставила инструкции по использованию с vLLM и SGLang. Полная модель чрезвычайно велика, поэтому реальное локальное развёртывание требует значительного объёма памяти ускорителей или агрессивных схем квантования сообщества.
Поддерживает ли V4 Flash Codex и API Responses?
Да. DeepSeek заявляет, что официальная версия Flash нативно поддерживает API Responses и адаптирована для использования в Codex. Текущий API V4 Pro пока не поддерживает API Responses.
Связанные инструменты
- DeepSeek API: официальная хостинговая конечная точка для DeepSeek V4 Flash и других поддерживаемых моделей.
- [DeepSeek V4 Flash
0731](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731): официальный репозиторий моделей, содержащий веса, бенчмарки, лицензию и руководства по развертыванию.
- vLLM: высокопроизводительный движок инференса, предоставляющий официальные рецепты для V4 Flash и DSpark.
- SGLang: фреймворк для обслуживания LLM со встроенной документированной поддержкой V4 Flash и DSpark.
- DeepSpec: репозиторий DeepSeek для исследований спекулятивного декодирования и методов DSpark.
- Codex: интеллектуальная среда кодирования, которая может подключаться к V4 Flash через совместимый интерфейс DeepSeek Responses API.
Связанные ссылки
- Официальные обновления DeepSeek V4 Flash: журнал обновлений от 31 июля, содержащий официальный статус выпуска, бенчмарки и область применения API.
- Модели и цены DeepSeek API: текущие цены на токены, длина контекста, ограничения вывода, количество одновременных запросов и уведомление о будущих ценах в пиковые часы.
- Технический отчет DeepSeek V4: основная статья, описывающая архитектуру MoE, внимание CSA/HCA, точность, обучение и контекст на миллион токенов.
- Карточка модели DeepSeek V4 Flash: официальная таблица бенчмарков 0731, чат-кодирование, конфигурация DSpark и лицензия MIT.
- Интеграция DeepSeek Codex: официальное руководство по использованию V4 Flash через Codex и Responses API.
- Статья Toolathlon: исследовательская работа, описывающая долгосрочный многоинструментальный бенчмарк, использованный в официальной оценке.
- Рецепт V4 Flash для vLLM: рекомендации по оборудованию и обслуживанию для развертывания V4 Flash.
Резюме
DeepSeek V4 Flash 0731 привлекла широкое внимание, поскольку разработчики сообщили, что смогли создать полноценные интерактивные демонстрации всего за несколько центов. Сообщается, что шутер от первого лица обошелся всего в 0,07 доллара, а другие сравнения в социальных сетях показали, что стоимость задач в десятки раз ниже, чем у Claude Opus 5 или GPT-5.6.
Эти примеры не являются контролируемыми бенчмарками, но официальные цены API подтверждают их основную мысль. V4 Flash взимает 0,14 доллара за миллион некешированных входных токенов и 0,28 доллара за миллион выходных токенов, а стоимость при попадании в кэш составляет поразительно низкие 0,0028 доллара.
Ее экономичность обусловлена всей системой: ядро MoE на 284B параметров с активацией 13B на токен, сжатое длинноконтекстное внимание, веса FP4/FP8, контекстное окно на миллион токенов, эффективные возможности обслуживания и спекулятивное декодирование DSpark. Обновление 0731 сохраняет архитектуру предварительной версии и улучшает поведение агентов за счет нового пост-обучения.
Наиболее убедительным официальным доказательством является улучшение бенчмарков. Terminal Bench 2.1 вырос с 61,8 до 82,7, Toolathlon-Verified — с 49,7 до 70,3, при этом модель сохранила ценовой уровень Flash.
Преимущество V4 Flash не в том, что она побеждает во всех сравнениях, — а в том, что ее крайне низкие предельные издержки делают
проведение повторяющихся агентных экспериментов практичным в масштабах, которые с трудом достижимы для многих моделей с передовым ценообразованием.