DeepSeek V4 Flash 0731: Демо-игра за $0,07, цены на API, архитектура и бенчмарки кодинга

DeepSeek V4 Flash 0731 вызвал необычное сочетание реакций. Разработчики впечатлены его показателями в агентном кодинге. Инфраструктурные команды заинтересованы в его масштабе от 1 миллиона до...

发布于 2026年8月6日generalGEO 评分: 08 次阅读
Это изображение является обложкой руководства по DeepSeek V4 Flash 0731, выполненной в тёмном технологическом стиле: чёрный фон и светящиеся синие элементы разных оттенков. Основной текст обложки — «DeepSeek V4 Flash 0731 Guide», ниже указаны ключевые темы: цены, бенчмарки, API и локальное развёртывание. В нижней части размещены четыре технологичные иконки, соответствующие темам: график статистики в долларах для ценообразования, линейный график производительности для бенчмарков, значок кодового интерфейса для API, а также серверное оборудование с чипом для локального развёртывания. На фоне также присутствует размытый логотип DeepSeek, что соответствует основной теме статьи о DeepSeek V4 Flash 0731.

DeepSeek V4 Flash 0731: Как модель после повторного дообучения спровоцировала глобальную ценовую войну

Введение

DeepSeek V4 Flash 0731 вызвала необычное сочетание реакций.

Разработчики впечатлены её показателями в тестах агентов-программистов.

Инфраструктурные команды заинтересованы в её контексте на 1 миллион токенов и низком количестве активных параметров.

ИИ-платформы предлагают бесплатное использование и агрессивные скидки.

А социальные сети заполняются скриншотами прототипов, чьи заявленные счета за инференс измеряются центами, а не долларами.

Наиболее широко обсуждаемые примеры в исходной статье включали:

  • Небольшой прототип 3D-шутера, по сообщениям, созданный примерно за 0,07 юаня.
  • Прототип в стиле Counter-Strike, по сообщениям, созданный примерно за 0,50 юаня.
  • Личную панель использования, показывающую 87 миллионов токенов за 31,57 юаня.
  • OpenCode, сообщающий о 8 триллионах токенов DeepSeek Flash 1 августа.
  • Cline, увеличивший бесплатную квоту после того, как обнаружил, что субсидировать эту модель дешевле, чем ожидалось.
  • Nous Portal, временно предоставляющий скидку 90% на V4 Flash 0731.

Эти примеры передают ажиотаж, но они также могут смешивать несколько различных вещей:

  1. Официальную цену API DeepSeek.
  2. Ценообразование при попадании в кэш и при его отсутствии.
  3. Бесплатный или субсидируемый сторонний доступ.
  4. Количество вызовов инструментов, которые совершает агент.
  5. Объём выходных данных и скрытых рассуждений.
  6. Стоимость только модели по сравнению со стоимостью полного продукта.

Модель действительно недорогая.

Это не означает, что каждое приложение будет стоить семь центов.

Полезный вопрос не в том, можно ли точно воспроизвести один вирусный демо-ролик. Вопрос в том, как DeepSeek добился такого значительного скачка возможностей без изменения базовой архитектуры — и что новая экономика означает для разработчиков.

Глобальный цикл скидок

Официальная цена API была уже низкой ещё до применения сторонних акций.

DeepSeek в настоящее время указывает следующие цены за миллион токенов:

Тип использования Цена DeepSeek V4 Flash
Ввод, попадание в кэш $0,0028
Ввод, отсутствие в кэше $0,14
Вывод $0,28

API поддерживает:

  • Контекстное окно на 1 миллион токенов.
  • До 384K выходных токенов.
  • Режимы с рассуждением и без рассуждения.
  • Три уровня усилий рассуждения в карточке модели 0731: low, high и max.
  • Вызовы инструментов.
  • JSON-вывод.
  • Завершение чат-префикса в бета-версии.
  • Завершение FIM в режиме без рассуждения.
  • Chat Completions, совместимые с OpenAI.
  • Responses API.
  • Интерфейс, совместимый с Anthropic.
  • Опубликованный лимит параллелизма 2500 запросов на аккаунт для V4 Flash.

Эти официальные цены являются базовым уровнем.

Платформы затем могут:

  • Передавать цену без изменений.
  • Добавлять наценку.
  • Субсидировать использование.
  • Предлагать ограниченную бесплатную модель.
  • Включать модель в подписку.
  • Предоставлять рекламные кредиты.
  • Маршрутизировать трафик через другого поставщика инференса.

Вот почему один разработчик может платить по прейскуранту DeepSeek, а другой — не платить ничего в течение ограниченного периода.

OpenCode сообщает о восьми триллионах токенов за один день

OpenCode публично заявил, что DeepSeek Flash обработала 8 триллионов токенов 1 августа через свою платформу.

Пост разбивает эту цифру следующим образом:

5 триллионов токенов бесплатного использования
+
3 триллиона токенов через OpenCode Go

Изображение: твит OpenCode от 3 августа, в котором говорится: «DeepSeek Flash обработала 8 триллионов токенов 1 августа, из которых 5 триллионов — бесплатно, 3 триллиона — через OpenCode Go». Этот твит связан с публичным заявлением OpenCode в документации о том, что DeepSeek Flash обработала 8 триллионов токенов 1 августа, и является официальным пояснением этих данных, дополнительно разбивая их на бесплатное и платное использование, что служит поддержкой для обсуждения объёма обработанных токенов DeepSeek Flash в контексте.

В текущей документации OpenCode Zen указан вариант DeepSeek V4 Flash Free, доступный в течение ограниченного времени.

Это важное различие.

Показатель в восемь триллионов токенов описывает трафик через OpenCode, а не прямое использование, о котором сообщает DeepSeek на всех платформах.

Тем не менее это сильный сигнал о том, что недорогие модели могут генерировать огромный спрос, когда они встроены в популярный рабочий процесс кодинг-агента.

Nous Portal временно снижает цену на 90%

Nous Research объявила о семидневной акции, предлагающей DeepSeek V4 Flash 0731 со скидкой 90% через Nous Portal в партнёрстве с Novita Labs.

Изображение: твит Nous Research с информацией об акции на DeepSeek V4 Flash 0731. В твите говорится, что в период акции через Nous Portal модель доступна со скидкой 90%, в партнёрстве с Novita Labs, в течение следующих 7 дней. По скидочной цене она более чем в 1000 раз превосходит Fable 5 по сопоставимым задачам, при этом оставаясь лидером в Terminal-Bench 2.1. Внизу твита — логотипы Jovita и Nous Research, а также прикреплено видео длительностью 13 секунд. Изображение тесно связано с контекстом и наглядно демонстрирует содержание акции на DeepSeek V4 Flash 0731, упомянутой в тексте.

В промо-посте сравнивалась скидочная цена с Claude Fable 5, и утверждалось, что разница в цене на сопоставимых задачах превышает 1000 раз.

Это сравнение зависит от нескольких факторов:

  • Какая цена провайдера используется.
  • Преобладает ли ввод или вывод.
  • Доступно ли кэширование.
  • Какая настройка рассуждений выбрана.
  • Сколько токенов нужно каждой модели для выполнения задачи.
  • Какой бенчмарк или рабочий процесс определяет «сопоставимость».

Сравнение цены за токен полезно, но более значимый показатель:

Общая стоимость за принятую задачу

Модель, использующая меньше дорогих токенов, может оказаться дешевле, чем недорогая модель, которая многократно повторяет попытки.

И наоборот, когда недорогая модель также достаточно способна быстро выполнить задачу, преимущество в стоимости может стать огромным.

Cline утраивает бесплатную квоту

Cline изначально анонсировала бесплатное использование V4 Flash 0731 через своего кодинг-агента.

В более позднем публичном посте сообщалось, что бесплатная квота была утроена, поскольку экономика оказалась устойчивой.

Этот скриншот — две связанные публикации на социальной платформе, посвящённые разъяснениям о бесплатной квоте Cline для DeepSeek V4-Flash. Верхний пост опубликован 22 часа назад, где упоминается, что Cline расширила бесплатную квоту для deepseek v4-flash в 3 раза, и сервис обладает устойчивой операционной экономикой; нижний пост опубликован 1 августа, где говорится, что платформа интегрирует модель DeepSeek V4-Flash 0731 в свой сервис, а также приведена трёхшаговая инструкция по установке и использованию этой модели, вместе с интерфейсом онлайн-чата для тестирования и соответствующими данными об использовании.

В текущем каталоге моделей Cline и материалах ClinePass DeepSeek V4 Flash указана как быстрый и экономичный вариант для целенаправленных задач кодинга.

Бесплатные квоты и доступность моделей могут меняться, поэтому пользователям следует проверять актуальную страницу провайдера, а не полагаться на старый скриншот.

Более широкий урок остаётся неизменным.

Когда инференс становится достаточно дешёвым, платформа агентов может использовать бесплатный доступ как привлечение клиентов, не неся при этом

та же стоимость, с которой он столкнулся бы при использовании премиальной frontier-модели.

Скриншоты сообщества о расходах нуждаются в контексте

В исходной статье приведена панель управления, показывающая:

  • 31,57 юаня расходов.
  • 2 282 API-запроса.
  • 87 027 995 токенов.

Изображение показывает сумму расходов Claude Code, количество API-запросов и токены. Сумма расходов — ¥31,57 CNY, количество API-запросов — 2 282, токены — 87 027 995. На графике ниже представлены ежедневные расходы за период с 6 июля по 4 августа, с заметным пиком 28 июля. Изображение связано с разделом «Скриншоты сообщества о расходах нуждаются в контексте» и иллюстрирует масштаб, который разработчики могут наблюдать при благоприятных сценариях использования, но недостаточно для точной реконструкции счёта из-за множества отсутствующих переменных.

Скриншот полезен, поскольку демонстрирует порядок величин, который разработчики могут увидеть при благоприятных сценариях использования.

Он не содержит достаточно информации для точного восстановления счёта.

Отсутствующие переменные включают:

  • Соотношение входных и выходных токенов.
  • Процент попаданий в кэш.
  • Версию модели, использованную в каждую дату.
  • Уровень усилий на рассуждение.
  • Количество вызовов инструментов.
  • Неудачные запросы.
  • Акционные кредиты.
  • Скидки провайдера.
  • Оплачивались ли все токены по одинаковой ставке.

Длинный повторяющийся системный промпт может быть чрезвычайно дешёвым при попадании в кэш.

Длинный уникальный промпт, отправленный один раз, тарифицируется по цене входных токенов с промахом кэша.

Выходные токены также намного дороже, чем входные с попаданием в кэш.

Для агентных систем эти различия определяют итоговый счёт.

Flash Blitz: что изменилось 31 июля

DeepSeek V4 Preview был запущен 24 апреля 2026 года.

Семейство включало:

  • DeepSeek V4 Pro.
  • DeepSeek V4 Flash.

Релиз Preview заложил основную архитектуру:

  • Разреженный ансамбль экспертов (Sparse Mixture of Experts).
  • Контекст на 1 миллион токенов.
  • Эффективное внимание для длинного контекста.
  • Низкое количество активных параметров относительно общего объёма.
  • Режимы с рассуждением и без.
  • Открытые веса под лицензией MIT.

V4 Flash Preview позиционировался как меньшая, более быстрая и дешёвая альтернатива V4 Pro.

Обновление от 31 июля изменило его конкурентную позицию.

DeepSeek заявляет, что V4 Flash 0731 использует ту же архитектуру и размер модели, что и V4 Flash Preview.

Обновление было создано путём применения нового процесса пост-обучения.

В упрощённом виде:

Та же предобученная базовая архитектура
+
новое пост-обучение и оптимизация для агентов
=
значительно более сильное агентное поведение при написании кода

Это важно, поскольку показывает, сколько возможностей может оставаться скрытым в предобученной модели.

Архитектура и количество параметров — это не весь продукт.

Пост-обучение определяет, насколько эффективно модель:

  • Использует инструменты.
  • Планирует многошаговую работу.
  • Обрабатывает обратную связь из терминала.
  • Восстанавливается после ошибок.
  • Пишет и редактирует файлы.
  • Следует агентному протоколу.
  • Распределяет усилия на рассуждение.
  • Работает в рамках обвязки (harness).

Базовая архитектура и детали контрольных точек

Оригинальная карточка модели V4 Flash описывает базовую модель так:

Спецификация DeepSeek V4 Flash
Всего параметров базовой MoE 284B
Активируемые параметры 13B
Длина контекста 1M
Лицензия MIT
Основная модальность Текст
Базовая точность FP8 / смешанная низкая точность в зависимости от контрольной точки

Карточка модели 0731 сообщает, что новый релиз имеет ту же структуру, что и вариант DSpark, и включает прикреплённый модуль спекулятивного декодирования.

Это объясняет, почему некоторые метаданные файлов модели могут показывать

Общее количество контрольных точек превышает 284B базовой модели MoE.

Наиболее точное описание:

Базовая модель MoE в V4 Flash по-прежнему составляет примерно 284B суммарных параметров с 13B активных, а в выпуске 0731 в опубликованную контрольную точку добавлен дополнительный компонент спекулятивного декодирования DSpark.

Спекулятивное декодирование DSpark

Спекулятивное декодирование использует быстрый процесс черновика для предложения нескольких будущих токенов.

Затем основная модель проверяет эти предложения.

Когда предсказания принимаются, система может генерировать несколько токенов с меньшим количеством последовательных операций.

В карточке модели DeepSeek 0731 указана явная поддержка DSpark для vLLM и SGLang.

Для vLLM соответствующая конфигурация выглядит так:

--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'

Для SGLang в карточке модели используется:

--speculative-algorithm DSPARK

DSpark сам по себе не улучшает логические способности модели.

Это оптимизация инференса, направленная на снижение задержки декодирования или повышение пропускной способности при сохранении распределения выходных данных целевой модели в поддерживаемой конфигурации.

Скачок в бенчмарках

DeepSeek публикует следующее сравнение для V4 Flash 0731:

Бенчмарк V4 Flash 0731 V4 Flash Preview V4 Pro Preview
Terminal Bench 2.1 82.7 61.8 72.1
NL2Repo 54.2 39.4 38.5
CyberGym 76.7 38.7 52.7
DeepSWE 54.4 7.3 12.8
Toolathlon-Verified 70.3 49.7 55.9
Agents’ Last Exam 25.2 15.8 16.5
AutomationBench Public 25.1 10.8 12.8
DSBench-FullStack 68.7 37.0 41.8
DSBench-Hard 59.6 25.8 31.1

Наиболее значительный рост — у DeepSWE:

7.3 → 54.4

CyberGym почти удваивается:

38.7 → 76.7

Terminal Bench 2.1 поднимается более чем на двадцать пунктов:

61.8 → 82.7

Новая модель Flash также превосходит V4 Pro Preview во всех бенчмарках из опубликованной таблицы DeepSeek.

Это значительное изменение для модели, которая изначально позиционировалась в основном как более дешёвый и быстрый вариант.

Методология бенчмарков имеет значение

Таблицу не следует воспринимать как чистое сравнение исходных контрольных точек.

В карточке модели DeepSeek содержится несколько важных примечаний.

Для задач публичного код-агента компания использовала:

DeepSeek Harness minimal mode
Reasoning effort: max
Temperature: 1.0
Top-p: 0.95

DeepSeek Harness не был публично выпущен на момент проверки.

Это означает, что внешние исследователи, возможно, пока не смогут воспроизвести точное программное окружение, использованное для опубликованных результатов код-агента.

Два теста также являются внутренними:

  • DSBench-FullStack.
  • DSBench-Hard.

Внутренние бенчмарки могут быть полезны для разработки продукта, но независимые команды не могут проверить их скрытые задачи или средства контроля загрязнения.

Правильная интерпретация такова:

DeepSeek сообщает о значительном улучшении в рамках выбранного агентного стека и конфигурации оценки. Публичная воспроизводимость улучшится, когда станут доступны harness, промпты, логи и полная конфигурация оценки.

Качество Harness может изменить результат

Бенчмарк для кода часто измеряет всю систему:

Модель
+
системный промпт
+
инструменты репозитория
+
терминал

исполнение
+
управление контекстом
+
политика повторов
+
обратная связь по тестам
+
логика отправки патчей

Одна и та же модель может получать разные оценки при изменении одного компонента.

Лучшая обвязка может:

  • Выбирать более релевантные файлы.
  • Сохранять полезный вывод терминала.
  • Предотвращать переполнение контекста.
  • Умно повторять неудачные команды.
  • Останавливать непродуктивные циклы.
  • Надёжнее применять патчи.
  • Давать модели более понятные результаты тестов.

Это не делает модель несущественной.

Это означает, что результат бенчмарка принадлежит комбинации модели и обвязки.

Сильные показатели 0731 позволяют предположить, что DeepSeek улучшил как агентное поведение модели, так и окружающий процесс оценки.

Artificial Analysis оценивает её в 50 баллов

Artificial Analysis сообщает об индексе интеллекта примерно 50 для DeepSeek V4 Flash 0731, примерно на десять пунктов выше предыдущей версии Flash.

Независимая аналитическая фирма также описывает V4 Flash как исключительно недорогую по сравнению с другими известными фронтирными системами.

Reuters резюмировал выводы Artificial Analysis, сообщив о средней стоимости теста-бенчмарка примерно в три цента США по их методологии.

Это сравнение подтверждает аргумент о ценности.

Это не означает, что каждая производственная задача стоит три цента.

Artificial Analysis также сообщает о более слабых результатах по некоторым показателям надёжности знаний.

В статье о V4 Flash 0731 отмечается:

  • Точность всеведения осталась на уровне около 37%.
  • Уровень галлюцинаций снизился, но остался высоким — примерно 84% по этой оценке.

Эти цифры — полезное напоминание.

Модель может быть:

  • Очень сильной в работе с агентами для кодинга.
  • Чрезвычайно дешёвой.
  • Конкурентоспособной по составному индексу.
  • При этом ненадёжной в некоторых открытых фактических вопросах.

«Лучшая ценность» — это не то же самое, что «лучшая для любой задачи».

Официальные цены API

Прямая цена DeepSeek API:

Категория тарификации Цена за 1 млн токенов
Вход с попаданием в кэш $0.0028
Вход без попадания в кэш $0.14
Выход $0.28

Разрыв в цене между попаданием в кэш и его отсутствием огромен:

$0.14 ÷ $0.0028 = 50

Кэшированный вход в пятьдесят раз дешевле некэшированного.

Для долгоживущих агентов структура промпта становится структурой затрат.

Пример расчёта стоимости

Предположим, один запрос использует:

100 000 некэшированных входных токенов
20 000 выходных токенов

Прямая стоимость модели:

Вход:
100 000 / 1 000 000 × $0.14
= $0.014

Выход:
20 000 / 1 000 000 × $0.28
= $0.0056

Итого:
$0.0196

Это меньше двух центов США.

Теперь предположим, что тот же префикс из 100 000 токенов кэширован:

Кэшированный вход:
100 000 / 1 000 000 × $0.0028
= $0.00028

Выход:
20 000 / 1 000 000 × $0.28
= $0.0056

Итого:
$0.00588

Теперь основную часть счёта составляет выход.

Эти примеры объясняют, почему недорогие прототипы для кодинга правдоподобны.

Они не включают:

  • Наценку провайдера.
  • Плату за API инструментов.
  • Затраты на браузер или поиск.
  • Вычисления в песочнице.
  • Хранилище.
  • Повторные неудачные попытки.
  • Время разработчика-человека.

Почему счета агентов всё равно могут расти

Агентный кодинг — это редко один запрос.

Типичный рабочий процесс может включать:

  1. Чтение репозитория.
  2. Поиск релевантного кода.
  3. Планирование изменения.
  4. Редактирование нескольких файлов.
  5. Запуск тестов.
  6. Просмотр

failure.
7. Отредактируйте снова.
8. Запустите тесты снова.
9. Просмотрите изменения.
10. Подготовьте окончательный ответ.

Каждый шаг может привести к новому вызову модели.

Кажущаяся небольшой задача может стать дорогостоящей, когда:

  • Контекст репозитория неоднократно не кэшируется.
  • Модель генерирует длинные цепочки рассуждений.
  • Тесты часто падают.
  • Агент без необходимости читает большие файлы.
  • Несколько параллельных агентов дублируют работу.
  • Сжатие контекста приводит к повторной отправке важной информации.
  • Модель не останавливается после достижения хорошего решения.

V4 Flash снижает цену таких ошибок.

Но не устраняет их.

Кэширование контекста — главный рычаг затрат

DeepSeek использует дисковое кэширование контекста.

При повторном использовании одного и того же префикса совпадающие входные токены могут получить более низкую цену попадания в кэш.

Хорошие кандидаты для стабильного префикса включают:

  • Системные инструкции.
  • Политики репозитория.
  • Определения инструментов.
  • Длинные справочные документы.
  • Неизменённый снимок проекта.
  • Повторяющийся корпоративный контекст.

Упрощённая структура промпта выглядит так:

Стабильный повторяемый префикс
+
новый запрос пользователя
+
последний результат инструмента

Менее удобная для кэширования структура:

Переупорядоченные инструкции
+
переписанная сводка репозитория
+
изменяющиеся временные метки
+
случайные метаданные запроса
+
новый запрос пользователя

Небольшие изменения префикса могут снизить повторное использование кэша.

Разработчикам следует проверять поля использования токенов, а не предполагать, что длинный промпт был закэширован.

DeepSeek также предлагает изоляцию user_id для конфиденциальности и планирования. Повторное использование кэша и изоляция пользователей должны проектироваться вместе, чтобы контекст одного клиента случайно не смешивался с контекстом другого.

Быстрый старт с API

Официальный базовый URL остаётся:

https://api.deepseek.com

Идентификатор модели:

deepseek-v4-flash

DeepSeek заявляет, что стабильный идентификатор API автоматически обслуживает последнюю официальную версию Flash.

Это удобно, но производственные команды должны записывать возвращаемый отпечаток модели и проверять изменения, поскольку поведение за стабильным идентификатором может быть обновлено.

Пример на Python

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_DEEPSEEK_API_KEY",
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[
        {
            "role": "user",
            "content": "Review this function and propose a safe refactor.",
        }
    ],
)

print(response.choices[0].message.content)

Пример cURL

curl https://api.deepseek.com/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $DEEPSEEK_API_KEY" \
  -d '{
    "model": "deepseek-v4-flash",
    "messages": [
      {
        "role": "user",
        "content": "Write a small Python CLI that validates JSON files."
      }
    ]
  }'

Разработчикам следует проверять актуальную справочную документацию API для точных полей reasoning-effort и thinking-mode, поддерживаемых их конечной точкой и версией SDK.

История размышлений должна сохраняться

Документация DeepSeek по режиму мышления гласит, что когда в ходе обмена присутствуют вызовы инструментов, reasoning_content из сообщения ассистента должен передаваться обратно в последующих запросах.

Многошаговый агент должен сохранять:

  • content

reasoning_content

  • tool_calls

Удаление состояния рассуждений может снизить непрерывность или вызвать проблемы с проверкой запросов.

Это особенно актуально при интеграции через OpenAI-совместимый клиент, который обычно игнорирует поля рассуждений, специфичные для провайдера.

Совместимость с OpenAI, Anthropic и Responses API

DeepSeek предоставляет более чем один интерфейс.

OpenAI Chat Completions

Используйте стандартный базовый URL DeepSeek и идентификатор модели:

deepseek-v4-flash

Совместимый API с Anthropic

DeepSeek также документирует интерфейс в формате Anthropic.

Это может помочь программному обеспечению, построенному вокруг сообщений в стиле Claude, подключаться к DeepSeek с меньшим количеством изменений в приложении.

Совместимость не гарантирует идентичного поведения.

Поля, специфичные для провайдера, история рассуждений, схемы инструментов, поведение безопасности и обработка ошибок все еще требуют тестирования.

Responses API

DeepSeek сообщает, что релиз 0731 нативно поддерживает формат Responses API и был адаптирован для использования в стиле Codex.

Это важно для продуктов кодинг-агентов, которые все больше зависят от объектных ответов с состоянием, вызовов инструментов и структурированных циклов агента.

Открытые веса под лицензией MIT

DeepSeek выпустил веса V4 Flash 0731 на Hugging Face под лицензией MIT.

Это позволяет разработчикам просматривать, изменять, развертывать и распространять модель в соответствии с условиями лицензии.

Релиз с открытыми весами обеспечивает больше контроля, чем модель, доступная только через API.

Команды могут:

  • Запускать модель на частной инфраструктуре.
  • Изучать ее архитектуру.
  • Создавать квантованные варианты.
  • Адаптировать ядра вывода.
  • Донастраивать или специализировать ее.
  • Интегрировать ее во внутренние системы.
  • Избегать отправки конфиденциального кода стороннему API.

Практическим барьером является аппаратное обеспечение.

«Открытые веса» не означает «работает на обычном ноутбуке».

Развертывание с vLLM

Официальная карточка модели 0731 предоставляет пример vLLM для одного узла 4×GB300:

vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 \
  --trust-remote-code \
  --kv-cache-dtype fp8 \
  --block-size 256 \
  --data-parallel-size 4 \
  --enable-expert-parallel \
  --moe-backend deep_gemm_mega_moe \
  --attention-config '{"use_fp4_indexer_cache": true}' \
  --speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'

Этот пример демонстрирует класс инфраструктуры, ожидаемый для полноценного обслуживания.

Его не следует интерпретировать как единственную поддерживаемую конфигурацию.

Рецепт vLLM может со временем добавить поддержку других топологий GPU.

Развертывание с SGLang

Официальный пример SGLang:

sglang serve \
  --trust-remote-code \
  --model-path deepseek-ai/DeepSeek-V4-Flash-0731 \
  --tp 4 \
  --moe-runner-backend flashinfer_mxfp4 \
  --speculative-algorithm DSPARK \
  --mem-fraction-static 0.90 \
  --chunked-prefill-size 4096 \
  --swa-full-tokens-ratio 0.1

Целевые и черновые веса взяты из одной контрольной точки, поэтому в документации указано не задавать отдельный путь к черновой спекулятивной модели.

Движки вывода быстро развиваются.

Используйте текущую карточку модели и рецепт серверного движка, а не копируйте старую команду запуска из предварительного релиза.

Локальное развертывание все еще является инфраструктурным проектом

Хотя всего лишь около

13B параметров активны для одного токена, полные веса модели должны оставаться доступными во всей обслуживающей системе.

Планирование развертывания должно учитывать:

  • Общий объем хранилища модели.
  • Память GPU.
  • Экспертный параллелизм.
  • Пропускную способность межсоединений.
  • KV-кэш для длинного контекста.
  • Поддержку квантизации.
  • Ядра DSpark.
  • Размер батча.
  • Параллельность.
  • Задержку prefill.
  • Пропускную способность декодирования.

Меньшие квантизации могут сделать возможным экспериментирование на разном оборудовании, но они могут изменить качество, скорость или поддерживаемую длину контекста.

Для большинства индивидуальных разработчиков прямой API или хостинг-провайдер будут проще и дешевле, чем самостоятельное размещение.

Официальный API против сторонних провайдеров

Существует три распространенных способа использования V4 Flash.

Маршрут Главное преимущество Главный компромисс
DeepSeek API Официальные цены и актуальная официальная модель Данные покидают вашу среду; стабильный ID может обновляться
Сторонняя платформа Бесплатные квоты, интегрированные агенты, упрощенный биллинг Акции и маршрутизация могут меняться
Самостоятельное размещение Максимальный контроль и конфиденциальность Значительные требования к оборудованию и инженерии

Самый дешевый маршрут зависит от рабочей нагрузки.

Бесплатная квота Cline или OpenCode может быть лучшей для экспериментов.

Прямой API может быть лучшим для предсказуемого использования в небольших масштабах.

Самостоятельное размещение может стать привлекательным только при достаточно высоком, устойчивом объеме или когда требования конфиденциальности доминируют.

Лучшая эпоха для прототипирования

Исходная статья сравнивает недорогой ИИ с массовым производством автомобилей.

Аналогия несовершенна, но полезна.

Когда технология становится значительно дешевле, рынок не просто покупает то же количество за меньшие деньги.

Становятся возможными новые применения.

Недорогие агентные модели могут поддерживать эксперименты, которые ранее были бы отклонены до тестирования.

Примеры включают:

  • Студент, создающий первый программный прототип.
  • Одинокий основатель, генерирующий и тестирующий несколько идей для лендингов.
  • Небольшая команда, проводящая ревью кода на каждом pull request.
  • Проект с открытым исходным кодом, предлагающий бесплатную триаж проблем.
  • Исследователь, обрабатывающий большую коллекцию кода или документов.
  • Компания, создающая внутренних агентов для повторяющейся работы.
  • Разработчик игр, тестирующий сгенерированные механики и уровни.

Ценность не в том, что модель заменяет всю программную инженерию.

Она снижает стоимость вопроса:

Стоит ли развивать эту идею дальше?

Прототип — это не продукт

Дешевая генерация может создать убедительное первое демо.

Производственный продукт все еще требует:

  • Дизайн продукта.
  • Безопасность.
  • Тестирование.
  • Доступность.
  • Производительность.
  • Мониторинг.
  • Развертывание.
  • Защиту данных.
  • Юридическую проверку.
  • Обслуживание.
  • Поддержку клиентов.

Счет на семь центов за модель не означает бизнес на семь центов.

Это означает, что первый вычислительный эксперимент может быть достаточно дешевым, чтобы его стоит попробовать.

Это меняет то, кто может участвовать и сколько идей можно протестировать.

Пример рабочего пространства, созданного сообществом

Исходная статья включает легковесное рабочее пространство для документов, показанное как один из примеров того, что разработчики создавали с помощью недорогих агентов для кодирования.

![Изображение показывает интерфейс рабочего стола для документов. Слева находится навигационная панель с опциями «Все документы», «Файлы», «Центр задач» и т.д. Сверху справа отображается «Контекстная рабочая область», ниже — разделы «Центр задач», «Список задач», «Детали задачи» и т.д. В центральной части показаны «Силиконовая долина 101 - GPU», «RonnieChatterji - AI-агенты», «RadiArk -

«Оптимизация загрузки GPU» и другие заголовки и фрагменты документов. Внизу есть опция «Локальный файловый аккаунт». Это изображение связано с разделом документации о рабочем столе, наглядно показывает интерфейс рабочего стола и часть информации о документах.](https://we0-cms.oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/08/ea723a10-dc29-41c2-9668-b104bd715b44-5355bdda-f7e2-4763-919d-43a90bf112fd.png)

Скриншот не может установить, какая часть приложения была создана моделью, сколько потребовалось ручного редактирования и является ли продукт безопасным и поддерживаемым.

Тем не менее он показывает тип проекта, прототипирование которого облегчают недорогие модели генерации кода.

Где V4 Flash подходит лучше всего

V4 Flash 0731 особенно привлекателен, когда:

  • Задача связана с кодом или инструментами.
  • Стоимость имеет большое значение.
  • Большой контекст полезен.
  • Ожидается высокий объём запросов.
  • Рабочий процесс может проверять результаты.
  • Допустимы периодические повторные попытки.
  • Для сложных случаев доступна более крупная резервная модель.

Он может быть менее подходящим, когда:

  • Критически важна фактическая точность в открытом мире.
  • Более важным считается отшлифованный первый ответ, а не стоимость.
  • Задача требует понимания изображений.
  • Организация не может проверить сгенерированный код.
  • Требуется управляемая гарантия соответствия требованиям.
  • Рабочий процесс зависит от стабильного поведения API с фиксированной версией.

Маршрутизатор моделей может комбинировать Flash с более мощной или более специализированной системой.

Например:

Обычные правки репозитория
→ V4 Flash

Решения с высоким риском по архитектуре или безопасности
→ более мощная модель + проверка человеком

Дешёвые модели меняют архитектуру агентов

Когда вызовы моделей дороги, разработчики стараются минимизировать каждый запрос.

Когда вызовы становятся дешёвыми, агент может позволить себе:

  • Попросить другую модель проверить патч.
  • Выполнить отдельный проход анализа тестов.
  • Сгенерировать несколько вариантов решений.
  • Сравнить альтернативные реализации.
  • Использовать одну модель для планирования, а другую для выполнения.
  • Перепроверить свою работу перед отправкой.

Это может повысить надёжность.

Это также может привести к лишней трате токенов.

Правильная цель — не минимальное использование токенов.

Она состоит в следующем:

Минимальная общая стоимость при достижении требуемого качества

Основные риски за историей о цене

1. Публичная бета может измениться

DeepSeek описывает официальный API Flash как публичную бета-версию.

Цены, поведение, лимиты и версии моделей могут измениться.

Производственным командам следует поддерживать регрессионное тестирование.

2. Результаты бенчмарков зависят от DeepSeek Harness

Наиболее сильные результаты для код-агентов получены с использованием неопубликованной конфигурации harness.

Точное независимое воспроизведение пока затруднено.

3. Дешёвый ввод не гарантирует дешёвого агента

Вывод, повторные попытки, инструменты и некэшированный контекст могут доминировать в итоговой стоимости.

4. Длинный контекст не бесплатен

Окно в 1 миллион токенов — это предел ёмкости, а не рекомендация отправлять миллион токенов в каждом запросе.

Большие объёмы предзагрузки увеличивают задержку и стоимость.

5. Надёжность в открытом мире всё ещё требует доработки

Независимая оценка показывает, что ценность и сила в коде могут сосуществовать с высокой частотой галлюцинаций в фактических тестах.

Критические факты следует проверять по источникам.

6. Сгенерированный код требует проверки

Недорогие модели могут генерировать больше кода, чем команда может безопасно проверить.

Автоматические тесты, статический анализ, сканирование зависимостей и проверка человеком остаются необходимыми.

7. Промо-доступ временный

Сторонние бесплатные модели и скидки могут исчезнуть.

Не стройте постоянную бизнес-модель вокруг семидневной или временной субсидии.

8. Стабильные ID API могут скрывать обновления

ID модели deepseek-v4-flash указывает на текущую версию.

Обновление за этим ID может изменить выходные данные без изменения кода в вашем приложении.

Практический контрольный список по управлению затратами

1. Стабилизируйте повторно используемые префиксы

Поддерживайте согласованность системных инструкций и определений инструментов для улучшения повторного использования кэша.

2. Отслеживайте токены попаданий в кэш отдельно

Не полагайтесь только на общее количество входных токенов.

3. Ограничьте ненужные выходные данные

Установите реалистичный бюджет выходных данных для задачи.

4. Используйте более низкие усилия рассуждения для рутинной работы

Оставляйте max для задач, которые выигрывают от более длительного обдумывания.

5. Ограничьте количество шагов агента

Останавливайте циклы, которые не приносят прогресса.

6. Выполняйте дешёвую проверку перед следующим вызовом модели

Используйте линтеры, тесты, валидаторы схем и детерминированные проверки.

7. Направляйте сложные случаи

Эскалируйте только тогда, когда задача не проходит тест или превышает порог риска.

8. Измеряйте стоимость за принятый результат

Включайте неудачные попытки и проверку человеком.

Ещё кое-что: DeepSeek Harness

Исходная статья завершается возможным следующим шагом в экосистеме разработчиков DeepSeek.

Тяньи Цуй, указанный в источнике как ответственный за DeepSeek Harness, опубликовал сообщение о найме разработчиков для проектов агентных харнесов с открытым исходным кодом.

В сообщении заинтересованным разработчикам предлагалось поделиться аккаунтом GitHub и репрезентативными работами с открытым исходным кодом для участия во внутреннем тестировании.

Изображение представляет собой твит, опубликованный Тяньи Цуем, с приглашением разработчиков, заинтересованных в открытых проектах Agent Harness, принять участие во внутреннем тестировании DeepSeek Harness — можно ответить или написать в личные сообщения, приложив GitHub ID и репрезентативные открытые проекты. Твит последний раз отредактирован 1 августа 2026 г. в 19:46, имеет 1 тыс. комментариев, 496 репостов, 2,9 тыс. лайков, 1,8 тыс. сохранений, 879,7 тыс. просмотров. Этот твит связан с информацией о приглашении разработчиков на внутреннее тестирование DeepSeek Harness из документа и является сообщением о найме, опубликованным Тяньи Цуем, упомянутым в документе.

В журнале изменений DeepSeek от 31 июля также говорится, что минимальный режим DeepSeek Harness, используемый для оценки бенчмарков, «будет выпущен в ближайшее время».

По состоянию на момент проверки я не нашёл:

  • Публичного официального репозитория DeepSeek Harness.
  • Стабильной страницы продукта «DeepSeek Code».
  • Публичных инструкций по установке.
  • Цен.
  • Даты выпуска.
  • Полной спецификации функций.

Доказательства подтверждают следующий более узкий вывод:

DeepSeek тестирует агентный харнес и намерен выпустить как минимум часть фреймворка, но окончательное название продукта, публичный охват и сроки запуска остаются неподтверждёнными.

Модель, API и открытые веса доступны уже сейчас.

Харнес — это будущий компонент экосистемы.

Почему DeepSeek Harness может иметь значение

Собственный харнес может помочь DeepSeek контролировать весь стек кодинг-агента.

Он может предоставить:

  • Нативную обработку истории рассуждений.
  • Специфические для модели форматы промптов.
  • Разбор вызовов инструментов.
  • Управление контекстом.
  • Поиск по репозиторию.
  • Выполнение в терминале.
  • Воспроизводимость бенчмарков.
  • Интеграцию с Responses API.
  • Рабочие процессы, совместимые с Codex.
  • Контроль затрат.
  • Автоматическую маршрутизацию между Flash и Pro.

DeepSeek уже документирует интеграции с внешними харнесами и кодинг-агентами.

Собственный инструмент первой стороны может превратить оптимизации под конкретные бенчмарки в продукт, доступный обычным разработчикам.

Он также может показать, какая часть скачка V4 Flash 0731 в бенчмарках обусловлена чекпоинтом, а какая — средой выполнения агента.

Что смотреть дальше

Ряд событий определит, станет ли момент V4 Flash устойчивым сдвигом в экосистеме.

Официальный релиз V4 Pro

DeepSeek заявляет, что официальный релиз V4 Pro последует за обновлением Flash.

Разрыв в производительности и цене между Pro и Flash повлияет на решения о маршрутизации.

Доступность DeepSeek Harness

Публичный релиз улучшил бы воспроизводимость бенчмарков и дал бы разработчикам нативный агентный фреймворк от самой модели.

Стабильность цен

Прямая цена уже низкая, но сторонние акции могут не сохраниться.

Мощности провайдеров

Дешёвый инференс привлекает очень высокий трафик.

Задержки, лимиты скорости и надёжность будут иметь значение по мере роста использования.

Поддержка инференса с открытым исходным кодом

vLLM, SGLang, производители оборудования и проекты по квантованию определят, насколько доступным станет самостоятельный хостинг.

Независимые оценки

Больше публичных оценок должны проверить:

  • Написание кода.
  • Безопасность.
  • Фактическую достоверность.
  • Длинный контекст.
  • Использование инструментов.
  • Стоимость за успешно выполненную задачу.
  • Производительность в разных средах выполнения.

Часто задаваемые вопросы

Что такое DeepSeek V4 Flash 0731?

DeepSeek V4 Flash 0731 — это официальный релиз V4 Flash от 31 июля, который в настоящее время доступен через API deepseek-v4-flash в публичной бете. DeepSeek заявляет, что модель сохраняет базовую архитектуру и размер Preview-версии, но значительно улучшает агентные возможности за счёт нового пост-обучения.

Сколько стоит DeepSeek V4 Flash?

Официальный API DeepSeek указывает $0,14 за миллион токенов ввода без попадания в кэш, $0,0028 за миллион токенов ввода с попаданием в кэш и $0,28 за миллион токенов вывода. Сторонние платформы могут предлагать другие цены, бесплатные квоты или временные скидки.

Действительно ли создание 3D-игры стоит всего 0,07 юаня?

В исходной статье приводится пример из сообщества с указанной расчётной стоимостью модели. Пример не сопровождается полными промптами, журналами токенов, данными о кэше, повторами, затратами на инструменты или записями о ручной работе, поэтому его следует рассматривать как anecdote, а не как гарантированный бюджет.

Каковы основные показатели V4 Flash 0731 в бенчмарках?

DeepSeek сообщает о 82,7 в Terminal Bench 2.1, 76,7 в CyberGym, 54,4 в DeepSWE, 70,3 в Toolathlon-Verified и 54,2 в NL2Repo. Публичные оценки кодовых агентов использовали невыпущенный минимальный режим DeepSeek Harness с максимальными усилиями рассуждения.

Является ли DeepSeek V4 Flash 0731 открытым исходным кодом?

Веса модели и репозиторий выпущены под лицензией MIT, поэтому описания «открытые веса» и «широко разрешительное использование» точны. Для запуска полного чекпоинта по-прежнему требуется значительная много-GPU инфраструктура.

Можно ли запустить DeepSeek V4 Flash локально?

Да, DeepSeek публикует веса и инструкции по обслуживанию для vLLM и SGLang. Официальные полноценные примеры используют продвинутое много-GPU оборудование, поэтому обычный ноутбук не является целевой средой для полной модели.

Каков размер контекстного окна?

Официальный API и карточка модели указывают контекстное окно в 1 миллион токенов. API также указывает

Максимальная длина выходных данных составляет 384 тыс. токенов, однако использование максимального контекста или выходных данных может значительно увеличить задержку и потребление ресурсов.

Были ли выпущены DeepSeek Code или DeepSeek Harness?

Компания DeepSeek публично упоминала минимальный режим Harness и привлекала разработчиков открытого исходного кода для внутреннего тестирования. В ходе проверки не было обнаружено полного публичного репозитория, финальной спецификации продукта или подтверждённой даты выпуска.

Связанные инструменты

  • DeepSeek API: Официальная платформа для ключей API, выставления счетов и прямого доступа к моделям DeepSeek.
  • DeepSeek V4 Flash 0731 на Hugging Face: Официальный чекпоинт с открытыми весами, карточка модели, таблица тестов, лицензия и инструкции по развёртыванию.
  • vLLM: Высокопроизводительный движок обслуживания с открытым исходным кодом с поддержкой DeepSeek V4 и DSpark.
  • SGLang: Фреймворк обслуживания с открытым исходным кодом с опубликованным путём развёртывания V4 Flash 0731.
  • OpenCode: Открытый кодовый агент, чей сервис Zen в настоящее время предлагает ограниченную по времени бесплатную опцию V4 Flash.
  • Cline: Открытый кодовый агент и модельная платформа, предлагающие DeepSeek V4 Flash через свою экосистему провайдеров.
  • Nous Portal: Мультимодельная платформа для вывода, которая проводила ограниченную акцию DeepSeek V4 Flash.
  • Artificial Analysis: Независимая платформа анализа моделей, охватывающая интеллект, скорость, цену и стоимость тестов.

Связанные ссылки

Резюме

DeepSeek V4 Flash 0731 сохраняет базовую модель Preview

Архитектура и размер сохранены, но новое пост-обучение обеспечивает значительный скачок в производительности агентов для программирования. DeepSeek сообщает о 82,7 на Terminal Bench 2.1, 76,7 на CyberGym и 54,4 на DeepSWE, хотя сильнейшие публичные результаты для агентов зависят от неопубликованной конфигурации DeepSeek Harness.

Официальная цена API необычно низкая: $0,14 за миллион некэшированных входных токенов, $0,0028 за миллион кэшированных входных токенов и $0,28 за миллион выходных токенов. Сторонние бесплатные квоты и скидки могут сделать доступ ещё дешевле, но эти акции временны и не должны путаться с постоянной прейскурантной ценой.

Релиз с открытыми весами по лицензии MIT, контекст на 1 миллион токенов, совместимость с API Responses и Anthropic, а также поддержка в vLLM и SGLang делают модель доступной как через хостинг, так и при самостоятельном развёртывании. Полное локальное развёртывание остаётся серьёзным инфраструктурным проектом, требующим нескольких GPU.

Вирусные прототипы за семь и пятьдесят центов — наглядные примеры того, насколько низким может стать предельный счёт за модель, но они не являются полноценными исследованиями стоимости продукта. Циклы агентов, длина выходных данных, промахи кэша, инструменты, тестирование и человеческий труд по-прежнему имеют значение.

DeepSeek V4 Flash 0731 важен не потому, что каждое приложение теперь стоит несколько центов, а потому, что способное агентное программирование стало достаточно дешёвым, чтобы гораздо больше разработчиков могли экспериментировать в значимых масштабах.