DeepSeek V4 Flash создал 3D-шутер за 0,07 доллара — вот почему эта модель такая дешёвая

DeepSeek V4 Flash 0731 вышла в открытую бета-версию со знакомым обещанием: более мощные возможности кодинга и агентности при крайне низких ценах на API. Разработчики быстро проверили это заявление на практике.

发布于 2026年8月5日generalGEO 评分: 04 次阅读
Это изображение, связанное с демонстрацией DeepSeek V4 Flash 0731, с ключевым акцентом на содержимое «$0.07 Game Demo». На рисунке также четко указаны три основные составляющие продукта: цены на API, архитектура и бенчмарки. В целом используется темно-синий технологичный дизайн в сочетании с визуальными элементами, такими как игровой контроллер, графики данных и структурные схемы, что соответствует игровой направленности продукта. Изображение наглядно представляет базовую информационную структуру продукта и перекликается с темой документа, описывающего цены DeepSeek V4 Flash 0731 и соответствующие разделы контента.

DeepSeek V4 Flash создал 3D-шутер всего за 0,07 доллара — почему эта модель такая дешёвая

Введение

DeepSeek V4 Flash 0731 вышел в открытую бета-версию со знакомым обещанием: повышенная производительность в кодинге и агентные возможности по крайне низким ценам на API.

Разработчики быстро превратили это заявление в реальные эксперименты.

Один из самых вирусных примеров — запуск Hermes Agent, в ходе которого DeepSeek V4 Flash сгенерировал играбельный шутер от первого лица в 3D всего по одному стартовому промпту. По сообщениям, проект занял 32 минуты, а стоимость использования модели составила всего 0,07 доллара.

Итоговый результат включал:

  • Передвижение от первого лица.
  • Прыжки.
  • Стрельбу.
  • Физические столкновения с окружением.
  • Объекты-укрытия и цели.
  • Счётчик патронов в интерфейсе.

Это скриншот демо-версии 3D-шутера, сгенерированного DeepSeek V4 Flash 0731, соответствующий упомянутому в документе примеру создания играбельного 3D-шутера с помощью этой модели в Hermes Agent. Скриншот опубликован пользователем Elshayib, который отметил, что создание игры заняло всего 32 минуты и обошлось в 0,07 доллара, а также указал, что модель настолько дёшева, что 2 доллара хватит на целый день разработческих экспериментов. На изображении представлен вид от первого лица в демо-версии, включая элементы интерфейса, соответствующие функциям передвижения и стрельбы, а также счётчик патронов, что перекликается со списком функций, перечисленных в документе.

Вывод из этой вирусной истории прост: по такой цене двух долларов хватит на целый день экспериментов.

Это заявление не стоит воспринимать как универсальную гарантию ежедневных расходов. Затраты агента зависят от длины промпта, объёма выходных данных, количества повторов, вызовов инструментов, частоты попаданий в кэш, накладных расходов фреймворка и сложности задачи.

Тем не менее, эта демонстрация отражает главную привлекательность V4 Flash: модель достаточно дешёвая, чтобы разработчики могли позволить агентам итерироваться бесконечно, а не относиться к каждой попытке как к дорогостоящей трате.

Официальные цены на API отчасти объясняют, почему так происходит.

DeepSeek V4 Flash 0731 теперь — официальная версия Flash

Компания DeepSeek выпустила производственную версию V4 Flash в публичную бета-версию API 31 июля 2026 года.

Название модели в API осталось прежним:

deepseek-v4-flash

Запросы с использованием этой модели теперь обращаются к DeepSeek-V4-Flash-0731.

DeepSeek сообщает, что версия 0731 заменяет предварительную модель и значительно улучшает агентные возможности.

Обновление распространяется на:

  • API DeepSeek V4 Flash.
  • Публичные веса модели V4 Flash.
  • Совместимость с Responses API.
  • Интеграцию для Codex.

Оно не заменяет:

  • API DeepSeek V4 Pro.
  • Модель, используемую в веб-приложении DeepSeek.
  • Модель, используемую в мобильном приложении DeepSeek.

DeepSeek также заявила, что официальная версия V4 Pro будет выпущена отдельно.

Официальные цены на API крайне низкие

Текущие стандартные цены API DeepSeek составляют за миллион токенов:

Позиция DeepSeek V4 Flash
Входные данные с попаданием в кэш 0,0028 доллара
Входные данные без попадания в кэш 0,14 доллара
Выходные данные 0,28 доллара
Длина контекста 1 миллион токенов
Максимальный выход 384 000 токенов
Режим рассуждения по умолчанию Thinking
Лимит параллельных запросов 2 500

Цена на входные данные с попаданием в кэш особенно низкая.

При цене 0,0028 доллара за миллион входных токенов с попаданием в кэш долгоживущий агент может многократно переиспользовать стабильный префикс — например, системные инструкции, схемы инструментов или контекст репозитория — не оплачивая каждый раз полную цену без кэша.

DeepSeek также анонсировала будущее дифференцированное ценообразование по часам пиковой и непиковой нагрузки.

Политика ценообразования.

Когда эта политика вступит в силу, в указанные ниже периоды по пекинскому времени все опубликованные цены будут удваиваться:

09:00–12:00
14:00–18:00

На момент проверки страницы с ценами DeepSeek не указала точную дату вступления в силу.

Поэтому приложениям, которые рассчитывают на фиксированную долгосрочную цену, следует сверяться с официальной страницей цен.

Один цент против одного доллара

В оригинальном тексте сравниваются DeepSeek V4 Flash и Claude Opus 5 на примере небольшого космического шутера.

По сообщениям, обе версии реализовали:

  • Движение корабля.
  • Функцию стрельбы.
  • Разрушаемые астероиды.
  • Собираемые бонусы.
  • Играбельный игровой цикл.

Различия проявились в пути к результату.

По данным разработчика:

Деталь DeepSeek V4 Flash Claude Opus 5
Количество попыток до приемлемого результата 3 1
Примерный объём кода 900 строк почти 3 000 строк
Указанная стоимость модели $0,01 $1,00

Opus добился результата с первой попытки, тогда как V4 Flash потребовал дополнительных итераций.

Итоговый проект описан как функционально достаточно похожий, поэтому указанная в отчёте разница в стоимости в 100 раз стала центральной темой обсуждения.

Это не было контролируемое бенчмарк-тестирование моделей.

В сравнении не был опубликован полный воспроизводимый пакет, включающий:

  • Одинаковый агентный фреймворк.
  • Полностью идентичные промпты и последующие сообщения.
  • Журналы вызовов инструментов.
  • Лимиты времени выполнения.
  • Правила подсчёта токенов.
  • Настройки вычислительных ресурсов моделей.
  • Ручное вмешательство.
  • Наличие ресурсных материалов или шаблонного кода.

Поэтому к этому результату следует относиться как к показательной истории разработчика, а не как к доказательству того, что V4 Flash всегда в 100 раз дешевле Opus 5 при одинаковой работе.

DeepSeek V4 Flash против GPT-5.6 Sol

В другом сравнении DeepSeek V4 Flash и GPT-5.6 Sol попросили создать небольшую 3D-игру с навигацией по реке.

По сообщениям, обе модели выдали:

  • Полный сценарий реки.
  • Функцию движения влево-вправо.
  • Столкновения с препятствиями.
  • Отслеживание очков.
  • Деревья и дальние планы.
  • Похожее базовое взаимодействие.

Указанные затраты:

Модель Указанная стоимость
DeepSeek V4 Flash $0,05
GPT-5.6 Sol $2,47

Это почти 50-кратная разница в рамках данного конкретного запуска.

![Изображение показывает твит: “DeepSeek is ridiculously cheap. GPT-5.6 → $2.47 DeepSeek → $0.05 How DeepSeek pulls off this pricing is wild. 50x cheaper than GPT 5.6 with similar output. DeepSeek 的价格简直便宜得离谱。GPT-5.6 → 2.47 美元 DeepSeek → 0.05 美元 DeepSeek 的定价策略简直令人难以置信。它比 GPT 5.6 便宜 50 倍,输出结果却相差无几。” Твит опубликован пользователем Dipankar, чей аватар — мужчина в очках. Изображение тесно связано с контекстом: оно иллюстрирует сравнение затрат DeepSeek V4 Flash и GPT-5.6 Sol в разработке игры, где DeepSeek значительно дешевле GPT-5.6, что подчёркивает удивительность ценовой политики DeepSeek.](https://we0-cms.oss-cn-beijing.aliyuncs.

/cms-assets/image/2026/08/7e9939d1-1af3-498a-9747-03470f1e858d-44a7f7e1-4473-425a-97a8-4dcd163b4903.png)

Визуальные результаты описаны как в целом схожие, хотя версия DeepSeek использовала окружение меньшего масштаба.

Аналогично, это сравнение носит анекдотический характер.

GPT-5.6 Sol и DeepSeek V4 Flash имеют разное поведение рассуждений по умолчанию, структуру ценообразования, системы управления контекстом, агентные фреймворки и правила подсчёта токенов.

Справедливое сравнение в производственной среде должно измерять:

Общая стоимость задачи
÷
Количество успешных и приемлемых результатов

Это

Самый дешёвый отдельный запрос не всегда является самым дешёвым для всего проекта.

Модель, требующая множества повторных попыток, генерирующая код, требующий intense сопровождения, или требующая значительной ручной проверки, может потерять своё первоначальное ценовое преимущество.

Влияние количества токенов на стоимость может быть больше, чем визуальное качество

В статье также описывается тест, в котором GPT-5.6 Luna и DeepSeek V4 Flash сгенерировали 3D-модель в стиле покемонов по одному и тому же запросу.

Визуальные результаты трудно однозначно оценить, но общее количество выходных токенов различалось кардинально:

Модель Заявленный объём вывода
GPT-5.6 Luna Более 2,3 миллиона токенов
DeepSeek V4 Flash Около 477 тысяч токенов

Согласно отчёту, общая стоимость задачи отличалась почти в 14 раз.

Ключевой вывод не в том, что какая-то модель всегда использует ровно столько токенов.

А в том, что экономика агентов зависит не только от цены за миллион токенов.

Общая стоимость определяется:

  • Избыточностью вывода.
  • Повторной перезаписью файлов.
  • Журналами вызовов инструментов.
  • Токенами рассуждений.
  • Неудачными попытками.
  • Воспроизведением контекста.
  • Повторным использованием кэша.
  • Объёмом сгенерированного кода.
  • Поведением агентного фреймворка.

Цена за токен у модели может быть относительно низкой, но если она создаёт ненужный вывод, она всё равно может оказаться дорогой.

Ценностное предложение V4 Flash сочетает более низкую заявленную цену и относительно компактное выполнение в нескольких приведённых примерах.

Двухчасовой эксперимент обошёлся всего в семь центов

Другой разработчик сообщил, что потратил почти два часа на эксперименты и заплатил всего семь центов.

Изображение представляет собой твит от пользователя @Samking207, опубликованный 1 августа. Содержание твита: «Yea was playing with it today for almost 2 hrs and I only spent 7 cents, I’m like wtf 😳😂 Да, сегодня игрался с этим почти 2 часа и потратил всего 7 центов, я в шоке 😳😂». Твит представлен на английском и китайском языках и выражает удивление автора тем, что он потратил всего 7 центов за почти 2 часа использования модели DeepSeek V4 Flash. Этот твит тесно связан с контекстом и наглядно демонстрирует упомянутый в документе случай «почти двухчасового эксперимента всего за 7 центов», иллюстрируя влияние низкой предельной стоимости на поведение разработчиков.

Этот комментарий иллюстрирует, как низкая предельная стоимость меняет поведение пользователей.

Когда один вызов модели кажется дорогим, разработчики часто:

  • Ограничивают количество итераций.
  • Сокращают промпты.
  • Избегают исследовательских ветвлений.
  • Останавливаются, когда результат «достаточно хорош».
  • Приберегают агентов для высокоценной работы.

Когда стоимость измеряется центами, разработчики могут позволить себе больше:

  • Проб и ошибок.
  • Параллельных идей.
  • Автоматизированных тестов.
  • Попыток исправления.
  • Долго выполняющихся фоновых задач.
  • Мелких экспериментов, которые иначе были бы пропущены.

Это не означает, что вычисления бесплатны.

В масштабах предприятия доли цента, умноженные на миллионы вызовов, всё равно могут составить значительные расходы.

Более значимое изменение заключается в том, что порог для экспериментов становится гораздо ниже.

Почему DeepSeek V4 Flash такая дешёвая?

В статье низкая стоимость V4 Flash объясняется множеством архитектурных и системных решений.

Основные факторы включают:

  1. Разреженные вычисления со смесью экспертов (MoE).
  2. Сжатые механизмы внимания для длинного контекста.
  3. Низкоточные веса модели.
  4. Спекулятивное декодирование через DSpark.
  5. Улучшения после обучения без необходимости полного повторного предобучения.
  6. Высококонкурентный API-сервис.

Каждый компонент снижает затраты по своей категории.

Модель с 284 миллиардами параметров, активирующая лишь 13 миллиардов

Основой DeepSeek V4

Flash является архитектура со смесью экспертов (MoE).

В техническом отчёте указаны следующие данные:

Архитектурная деталь DeepSeek V4 Flash
Общее количество параметров модели 284 миллиарда
Активируемые параметры на токен 13 миллиардов
Длина контекста 1 миллион токенов
Обучающие данные Более 32 триллионов токенов
Основная точность Смешанная точность FP4 + FP8

Хотя модель хранит сотни миллиардов параметров, не все они задействуются для каждого токена.

Механизм маршрутизации выбирает небольшое подмножество экспертов.

Это уменьшает объём активных вычислений на токен, сохраняя при этом доступ к большему пулу параметров.

Упрощённое сравнение выглядит так:

Плотная модель:
Каждый токен → Большая часть или все веса модели

MoE-модель:
Каждый токен → Только выбранные эксперты

Это одна из причин, почему крупные MoE-модели значительно дешевле в обслуживании, чем плотные модели с сопоставимым количеством параметров.

Почему на некоторых страницах указано 304B параметров

Метаданные Hugging Face полного репозитория DeepSeek-V4-Flash-0731 в настоящее время показывают около 304B параметров.

Это не противоречит данным из технического отчёта о 284B параметрах основной модели.

Версия 0731 включает модуль спекулятивного декодирования DSpark. Метаданные репозитория могут учитывать целевую модель вместе с прилагаемым черновым компонентом.

Что касается архитектурных обсуждений, технический отчёт DeepSeek остаётся наиболее ясным источником:

  • Общее количество параметров основной модели V4 Flash — 284B.
  • Активируемые параметры на токен — 13B.
  • Дополнительные веса DSpark для спекулятивного декодирования в версии 0731.

Изображение представляет собой описание DeepSeek V4 Flash 0731. Указывается, что это официальная релизная версия DeepSeek V4 Flash, которая по сравнению с предварительной версией значительно усилила агентные возможности, имеет ту же структуру, что и DeepSeek V4 Flash - DSpark, и включает модуль спекулятивного декодирования. Несмотря на то, что количество активируемых параметров значительно меньше, чем у DeepSeek V4 Pro (предварительная версия), она показывает лучшие результаты в бенчмарках и в целом конкурирует с сильнейшими существующими проприетарными моделями. Это изображение тесно связано с контекстом и представляет собой обзор ключевых характеристик и преимуществ в производительности версии 0731.

CSA и HCA снижают стоимость длинного контекста

DeepSeek V4 поддерживает окно контекста в 1 миллион токенов.

Традиционные системы внимания становятся чрезвычайно дорогими в таких масштабах, поскольку каждый новый токен может потребовать обработки большого объёма предыдущего контекста и поддержания значительного KV-кэша.

В техническом отчёте DeepSeek описывается гибридная конструкция внимания, сочетающая:

  • Сжатое разреженное внимание (CSA)
  • Сильно сжатое внимание (HCA)

Общая стратегия заключается в том, чтобы избегать полных и дорогостоящих вычислений внимания по всей истории на каждом шаге.

Система сжимает и фильтрует контекст, позволяя модели сосредоточить вычисления на наиболее полезной информации.

DeepSeek сообщает, что в контексте из 1 миллиона токенов V4 Pro требует:

27% от FLOPs на токен вывода DeepSeek V3.2.

  • 10% от объёма KV-кэша.

Эти точные проценты указаны в техническом документе для V4 Pro и не являются отдельными данными аудита для Flash.

V4 Flash использует то же семейство архитектур, поэтому наследует те же принципы проектирования длинного контекста.

Практический эффект включает снижение:

  • памяти KV-кэша.
  • нагрузки на память GPU.
  • объёма перемещаемых данных.
  • вычислений на токен.
  • стоимости обслуживания длинного контекста.

FP4 и FP8 уменьшают объём хранимых данных

и трафик памяти

Опубликованная модель V4 Flash использует смешанную низкую точность весов.

DeepSeek указывает:

FP4 + FP8 смешанная точность

Более низкая точность уменьшает объём данных, которые необходимо хранить, загружать из памяти, передавать между устройствами и обрабатывать во время инференса.

Это важно, потому что современный инференс языковых моделей часто ограничен пропускной способностью памяти, а не только вычислительной мощностью.

Если аппаратное обеспечение и ядра спроектированы для эффективного выполнения таких форматов, более компактное представление данных может повысить пропускную способность.

Низкая точность не является автоматически бесплатной.

Плохая квантизация снижает качество модели.

Релиз DeepSeek спроектирован и обучен под выбранную схему точности, а не полагается на постфактум-квантизацию сторонними сообществами.

Архитектура не изменилась между предварительной версией и версией 0731

DeepSeek заявляет, что официальная версия 0731 сохраняет ту же архитектуру и масштаб модели, что и предварительная версия V4 Flash.

Компания не проводила полное предварительное обучение заново для этого обновления.

Вместо этого был переделан этап пост-обучения.

В исходной статье изменения резюмируются так:

  • Новый контролируемый тонкий тюнинг.
  • Новое обучение с подкреплением GRPO.
  • Спекулятивное декодирование DSpark.
  • Улучшенное поведение агента.
  • Более высокая пропускная способность обслуживания.

В техническом отчёте DeepSeek более широкий процесс пост-обучения V4 описывается так:

  1. Независимая разработка экспертных модулей для доменов.
  2. Контролируемый тонкий тюнинг и обучение с подкреплением с GRPO.
  3. Дистилляция политики в онлайне.
  4. Интеграция экспертных возможностей в единую модель.

Обновление 0731 сосредоточено на улучшении этих возможностей в реальных сценариях работы агентов.

DSpark ускоряет генерацию токенов

DeepSeek-V4-Flash-0731 поставляется с модулем спекулятивного декодирования DSpark.

Спекулятивное декодирование использует более маленький или более дешёвый путь-черновик для предложения нескольких будущих токенов.

Основная модель пакетно проверяет эти предложения.

Упрощённый процесс выглядит так:

Черновой модуль предлагает токены
→ Основная модель одновременно проверяет
→ Принятые токены выводятся
→ Отклонённые пути исправляются

Когда прогнозы черновика точны, система может генерировать несколько принятых токенов с меньшим количеством дорогих последовательных рассуждений основной модели.

DeepSeek предоставляет поддержку DSpark для vLLM и SGLang.

Для vLLM официальная карточка модели использует:

--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'

Для SGLang соответствующий параметр:

--speculative-algorithm DSPARK

DeepSeek указывает, что веса целевой и черновой моделей хранятся в одном чекпоинте, поэтому SGLang не требует отдельного пути для черновой модели.

Спекулятивное декодирование в первую очередь повышает скорость обслуживания и пропускную способность.

Само по себе оно не объясняет улучшение рассуждений модели.

Эти улучшения связаны с обновлённым процессом пост-обучения.

Официальный релиз улучшает результаты в бенчмарках для агентов

DeepSeek сообщает о значительных улучшениях по ряду агентских тестов по сравнению с предварительной версией V4 Flash.

Бенчмарк V4 Flash 0731 V4 Flash Preview V4 Pro Preview
Terminal Bench 2.1 82.7 61.8 72.1
NL2Repo 54.2 39.4 38.5
CyberGym 76.7 38.7 52.7
DeepSWE 54.4 7.3

12.8 |
| Toolathlon-Verified | 70.3 | 49.7 | 55.9 |
| Agents' Last Exam | 25.2 | 15.8 | 16.5 |
| AutomationBench Public | 25.1 | 10.8 | 12.8 |
| DSBench-FullStack | 68.7 | 37.0 | 41.8 |
| DSBench-Hard | 59.6 | 25.8 | 31.1 |

Изображение показывает производительность DeepSeek V4 Flash в нескольких бенчмарках по сравнению с V4 Flash Preview и V4 Pro Preview. Terminal Bench 2.1 — 82.7, NL2Repo — 54.2, Cybergym — 76.7, DeepSWE — 54.4, Toolathlon verified — 70.3, Agent Last Exam — 25.2, Automation Bench (Public) — 25.1, DSBench-FullStack — 68.7, DSBench-Hard — 59.6. Изображение соответствует упомянутому выше значительному прогрессу DeepSeek в ряде тестов и наглядно демонстрирует улучшение производительности.

DeepSeek сообщает, что публичные бенчмарки для кодовых агентов запускались со следующими настройками:

DeepSeek Harness минимальный режим
reasoning_effort = max
top_p = 0.95
temperature = 1.0

На момент официального обновления этот фреймворк тестирования ещё не был опубликован.

DSBench-FullStack и DSBench-Hard — внутренние бенчмарки DeepSeek.

Это означает, что их результаты могут служить свидетельством заявлений компании, но не могут быть независимо проверены так же, как полностью открытые наборы тестов.

Что измеряют Terminal Bench и Toolathlon

Terminal Bench 2.1

Terminal Bench оценивает способность агента выполнять задачи в терминальной среде.

Модели может потребоваться просматривать файлы, выполнять команды, устанавливать зависимости, отлаживать сбои, изменять код и проверять завершение.

Высокий балл отражает совокупную производительность модели, фреймворка агента, стратегии использования инструментов, бюджета рассуждений и среды выполнения.

Toolathlon-Verified

Toolathlon оценивает длительные задачи с использованием нескольких программных приложений и инструментов.

Бенчмарк включает сценарии, связанные с календарём, файловой системой, Notion, WooCommerce, Kubernetes и BigQuery.

Задачи требуют множества взаимодействий с инструментами и проверяются с помощью исполняемых оценщиков.

Результат 70.3, о котором сообщает DeepSeek, представляет собой значительное улучшение по сравнению с предварительной моделью.

Но это не следует интерпретировать как гарантию 70.3% успеха для каждого реального бизнес-процесса.

Улучшение бенчмарков не гарантирует успех с первой попытки для каждой игры

Пример игры из источника раскрывает важное различие между производительностью в бенчмарках и творческим программированием.

V4 Flash показывает высокие результаты в официальных агентских оценках, но для одного игрового сравнения всё же потребовалось три итерации.

Бенчмарки могут измерять частоту успеха на чётко определённых наборах задач с известными правилами оценки.

Творческие проекты могут включать нечёткие визуальные требования, проблемы совместимости с браузером, ошибки физического движка, отсутствующие ресурсы, субъективные оценки качества и отсутствие единого набора тестов для определения успеха.

В таких сценариях недорогие модели особенно полезны, потому что рабочий процесс может позволить несколько итераций.

Их ценность не обязательно в том, что первая генерация будет идеальной.

Это может быть:

Приемлемое качество
×
Большое количество доступных по цене попыток

V4 Flash поддерживает множество форматов API

DeepSeek предоставляет доступ к моделям следующими способами:

  • Совместимый с OpenAI интерфейс Chat Completions.
  • Совместимый с OpenAI API Responses.
  • Совместимый с Anthropic API.
  • Вывод в формате JSON.
  • Вызов инструментов.
  • Дополнение префикса чата.
  • Заполнение середины в режиме без рассуждений.

Базовый URL для совместимости с OpenAI:

https://api.deepseek.com

Базовый URL для совместимости с Anthropic:

https://api.deepseek.com/anthropic

DeepSeek заявляет, что V4 Flash — единственная модель V4 API, которая в настоящее время поддерживает API Responses.

Поддержка V4 Pro будет организована отдельно.

Совместимость с API Responses также позволяет использовать эту модель в Codex через документированную конфигурацию DeepSeek.

Режим рассуждений включён по умолчанию

DeepSeek V4 Flash поддерживает режим рассуждений и режим без рассуждений.

Режим рассуждений является режимом по умолчанию.

Для локального вывода официальная карточка модели поддерживает три уровня усилий рассуждений:

low
high
max

DeepSeek рекомендует:

temperature = 1.0
top_p = 0.95

для сценариев с агентами.

Для уровней усилий high и max компания рекомендует разрешать максимальную длину вывода до 384K токенов.

Более высокие настройки рассуждений могут улучшить производительность на сложных задачах, но также могут увеличить задержку, объём вывода, стоимость API и время циклов агента.

Производственные системы должны оценивать самый низкий уровень усилий, способный надёжно удовлетворять требованиям задачи.

Веса выпущены под лицензией MIT

DeepSeek опубликовала веса V4 Flash 0731 на Hugging Face под лицензией MIT.

Это делает модель исключительно либеральной по лицензированию по сравнению со многими крупными коммерческими релизами.

Разработчики могут использовать официальный репозиторий модели с поддерживаемыми движками, включая:

  • vLLM.
  • SGLang.
  • Transformers.
  • Docker Model Runner.
  • Квантованные версии, совместимые с llama.cpp.
  • Сборки сообщества, совместимые с LM Studio.

Модель имеет большой размер.

Основная модель имеет 284B параметров, а в контрольной точке 0731 также присутствует компонент DSpark.

Для работы с приемлемой скоростью требуются значительные объёмы памяти и аппаратные ресурсы.

Возможность загрузки весов не означает, что полная модель сможет плавно работать на обычном потребительском ноутбуке.

Квантованные версии сообщества могут снизить требования к памяти, но могут изменить точность, пропускную способность, ёмкость контекста, поведение DSpark и надёжность вызова инструментов.

Всегда ли V4 Flash — самый выгодный вариант?

Источники в итоге приходят к выводу, что V4 Flash не всегда даёт лучший результат в каждом сравнении, но его очень трудно превзойти по соотношению цена/качество.

Это разумное резюме примеров, но с одной важной оговоркой:

Соотношение цена/качество зависит от полного рабочего процесса.

V4 Flash особенно привлекателен в следующих случаях:

  • Высокий объём запросов.
  • Ошибки легко обнаружить.
  • Задачи можно автоматически повторять.
  • Хороший эффект от кэширования контекста.
  • Низкая стоимость ручной проверки.
  • Компактный код приемлем.
  • Приложение может использовать модели с открытыми весами.

В следующих случаях более дорогие передовые модели в целом могут всё же оказаться более экономичными:

  • Результат одного сбоя приводит к большим потерям.
  • Надёжность первого прохода критически важна.
  • Задача требует более глубоких знаний.
  • Агент не может безопасно повторить попытку.
  • Высокая стоимость ручной проверки.
  • Более мелкие модели создают вывод, который трудно поддерживать.

Правильное сравнение — не:

цена за токен

а:

стоимость за каждую подтверждённую успешную задачу

Как оценить V4 Flash для реального проекта

Шаг 1. Выберите репрезентативные задачи

Не тестируйте только отполированные демонстрации.

Используйте задачи, соответствующие производственной нагрузке, включая сложные и трудные сценарии.

Шаг 2. Зафиксируйте среду агента

Сохраняйте единообразие подсказок, инструментов, ограничений по времени, стратегий повтора, фреймворков, песочниц, тестовых наборов и настроек рассуждений между моделями.

Шаг 3. Фиксируйте полную стоимость

Отслеживайте входные данные без попадания в кэш, входные данные с попаданием в кэш, выходные токены, вызовы инструментов, количество повторов, время выполнения, ручные проверки и неудачные попытки.

Шаг 4. Оценивайте приемлемость, а не только визуальное сходство

Для кода запускайте тесты и проверяйте поддерживаемость.

Для игр проверяйте управление, столкновения, производительность и совместимость с браузером.

Шаг 5. Тестируйте поведение кэша

Когда стабильный контекст многократно повторно используется на нескольких шагах агента, модель с крайне низкой ценой при попадании в кэш становится ещё более ценной.

Шаг 6. Сравнивайте первый проход и конечный успех

Модель, которой потребовалось три дешёвые попытки для успеха, может быть более выгодной, чем модель, которая сразу достигла успеха по высокой цене.

Когда повторные попытки медленные или рискованные, ситуация может быть обратной.

Часто задаваемые вопросы

Что такое DeepSeek V4 Flash 0731?

DeepSeek V4 Flash 0731 — это официальная пост-тренировочная версия младшей модели DeepSeek V4 с смешанными экспертами. Она заменяет предварительную версию, добавляет модуль спекулятивного декодирования DSpark и ориентирована на задачи кодирования и агентов, использующих инструменты.

Какова стоимость API DeepSeek V4 Flash?

Текущие стандартные цены DeepSeek: 0,0028 доллара за миллион входных токенов с попаданием в кэш, 0,14 доллара за миллион входных токенов без попадания в кэш и 0,28 доллара за миллион выходных токенов. Компания объявила, что будущая политика удвоит цены в указанные пиковые часы.

Действительно ли DeepSeek V4 Flash создал 3D-игру за 0,07 доллара?

Один разработчик сообщил, что один запуск Hermes Agent сгенерировал играбельный шутер от первого лица за 32 минуты при стоимости 0,07 доллара. Это пример из социальных сетей, а не стандартизированный бенчмарк, поэтому стоимость других задач может быть выше или ниже.

Сколько параметров у DeepSeek V4 Flash?

В техническом отчёте V4 указано, что общее количество параметров основной модели Flash составляет 284 миллиарда, при этом активируется 13 миллиардов параметров на токен. Полный репозиторий версии 0731 может показывать около 304 миллиардов параметров, поскольку включает дополнительный компонент спекулятивного декодирования DSpark.

Почему DeepSeek V4 Flash такой дешёвый?

Низкая стоимость обусловлена разреженной активацией смешанных экспертов, сжатым вниманием к длинному контексту, смешанной точностью FP4/FP8, кэшированием подсказок, спекулятивным декодированием и высококонкурентным обслуживанием. На каждый токен активируется лишь небольшая часть всех экспертов.

Превосходит ли DeepSeek V4 Flash Claude Opus 5 или GPT-5.6?

При текущих ценах API он значительно дешевле и показал конкурентоспособные результаты в нескольких демонстрациях сообщества. Opus 5 и GPT-5.6 могут по-прежнему обеспечивать более высокую надёжность первого прохода или качество в некоторых задачах, а вирусные сравнения не являются контролируемыми бенчмарками.

Можно ли запускать DeepSeek V4 Flash локально?

Да. DeepSeek опубликовала веса под лицензией MIT и предоставила инструкции по использованию с vLLM и SGLang. Полная модель чрезвычайно велика, поэтому реальное локальное развёртывание требует значительного объёма памяти ускорителей или агрессивных схем квантования сообщества.

Поддерживает ли V4 Flash Codex и API Responses?

Да. DeepSeek заявляет, что официальная версия Flash нативно поддерживает API Responses и адаптирована для использования в Codex. Текущий API V4 Pro пока не поддерживает API Responses.

Связанные инструменты

  • DeepSeek API: официальная хостинговая конечная точка для DeepSeek V4 Flash и других поддерживаемых моделей.
  • [DeepSeek V4 Flash

0731](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731): официальный репозиторий моделей, содержащий веса, бенчмарки, лицензию и руководства по развертыванию.

  • vLLM: высокопроизводительный движок инференса, предоставляющий официальные рецепты для V4 Flash и DSpark.
  • SGLang: фреймворк для обслуживания LLM со встроенной документированной поддержкой V4 Flash и DSpark.
  • DeepSpec: репозиторий DeepSeek для исследований спекулятивного декодирования и методов DSpark.
  • Codex: интеллектуальная среда кодирования, которая может подключаться к V4 Flash через совместимый интерфейс DeepSeek Responses API.

Связанные ссылки

  • Официальные обновления DeepSeek V4 Flash: журнал обновлений от 31 июля, содержащий официальный статус выпуска, бенчмарки и область применения API.
  • Модели и цены DeepSeek API: текущие цены на токены, длина контекста, ограничения вывода, количество одновременных запросов и уведомление о будущих ценах в пиковые часы.
  • Технический отчет DeepSeek V4: основная статья, описывающая архитектуру MoE, внимание CSA/HCA, точность, обучение и контекст на миллион токенов.
  • Карточка модели DeepSeek V4 Flash: официальная таблица бенчмарков 0731, чат-кодирование, конфигурация DSpark и лицензия MIT.
  • Интеграция DeepSeek Codex: официальное руководство по использованию V4 Flash через Codex и Responses API.
  • Статья Toolathlon: исследовательская работа, описывающая долгосрочный многоинструментальный бенчмарк, использованный в официальной оценке.
  • Рецепт V4 Flash для vLLM: рекомендации по оборудованию и обслуживанию для развертывания V4 Flash.

Резюме

DeepSeek V4 Flash 0731 привлекла широкое внимание, поскольку разработчики сообщили, что смогли создать полноценные интерактивные демонстрации всего за несколько центов. Сообщается, что шутер от первого лица обошелся всего в 0,07 доллара, а другие сравнения в социальных сетях показали, что стоимость задач в десятки раз ниже, чем у Claude Opus 5 или GPT-5.6.

Эти примеры не являются контролируемыми бенчмарками, но официальные цены API подтверждают их основную мысль. V4 Flash взимает 0,14 доллара за миллион некешированных входных токенов и 0,28 доллара за миллион выходных токенов, а стоимость при попадании в кэш составляет поразительно низкие 0,0028 доллара.

Ее экономичность обусловлена всей системой: ядро MoE на 284B параметров с активацией 13B на токен, сжатое длинноконтекстное внимание, веса FP4/FP8, контекстное окно на миллион токенов, эффективные возможности обслуживания и спекулятивное декодирование DSpark. Обновление 0731 сохраняет архитектуру предварительной версии и улучшает поведение агентов за счет нового пост-обучения.

Наиболее убедительным официальным доказательством является улучшение бенчмарков. Terminal Bench 2.1 вырос с 61,8 до 82,7, Toolathlon-Verified — с 49,7 до 70,3, при этом модель сохранила ценовой уровень Flash.

Преимущество V4 Flash не в том, что она побеждает во всех сравнениях, — а в том, что ее крайне низкие предельные издержки делают

проведение повторяющихся агентных экспериментов практичным в масштабах, которые с трудом достижимы для многих моделей с передовым ценообразованием.