DeepSeek V4 Pro против Grok 4.6: первые испытания в реальном мире выводят обе модели в число лидеров
Два ИИ-модели были выпущены почти одновременно, что вывело DeepSeek V4 Pro и Grok 4.6 в центр внимания. DeepSeek V4 Pro в области агентных и

DeepSeek V4 Pro против Grok 4.6: первое реальное тестирование выводит обе модели в высшую лигу
Введение
Две мощные ИИ-модели вышли практически одновременно, что сразу вывело DeepSeek V4 Pro и Grok 4.6 в центр внимания.
DeepSeek V4 Pro совершил значительный скачок в производительности агентных систем и разработке ПО, тогда как Grok 4.6 уверенно проявил себя в программировании, интеллектуальной работе и комплексных задачах. В исходной статье оба релиза описываются как прямой вызов текущим передовым моделям OpenAI и Anthropic.
Особый интерес этому сравнению придаёт то, что обе модели оцениваются не только по бенчмаркам. Ранние реальные тесты также требовали от них создания веб-сайтов, игр, воспроизведения визуальных дизайнов и генерации 3D-опытов с использованием одинаковых промптов.
Результат — не столько простое соревнование с победителем, сколько равная борьба: у каждой модели есть области, где она выделяется.
DeepSeek V4 Pro выходит на сцену, Grok 4.6 вступает в игру
В исходной статье перечислены многочисленные результаты бенчмарков DeepSeek V4 Pro.
В агентной оценке кибербезопасности CyberGym DeepSeek V4 Pro, как сообщается, набрал 83,3, с небольшим отрывом опередив Fable 5 (83,1) и Opus 4.8 (78,3).
В AutomationBench он достиг 31,8, опередив Fable 5 (29,1) и Opus 4.8 (27,2).
Наиболее близким по результатам оказался Terminal-Bench 2.1. DeepSeek V4 Pro набрал 87,9, тогда как Opus 4.8 — 85,0, а Fable 5 — 88,0.
В исходной статье также сообщается о результате 60,0 в конфигурации Humanity's Last Exam с использованием инструментов, тогда как Opus 4.8 показал 57,9, а Fable 5 — 63,0.
DeepSWE также стал ещё одним значительным улучшением в отчёте. DeepSeek V4 Pro достиг 62,7, что является огромным скачком по сравнению с 12,8 у превью-версии, выше заявленных 58,0 у Opus 4.8, но всё ещё ниже 70,0 у Fable 5.
Grok 4.6 тестировался в нескольких областях в сравнении с GPT-5.6 и Fable 5.
В исходной статье сообщается о его комплексном индексе интеллекта 61, что на один балл уступает Fable 5 (62).
В CursorBench Grok 4.6, по сообщениям, набрал 69,9%, опередив GPT-5.6 (67,2%) и приблизившись к Fable 5 (70,5%).
Во FrontierCode он достиг 61,3%, также слегка опередив GPT-5.6 (60,6%) и уступив Fable 5 (63,6%).
Исходная статья показывает, что в интеллектуальной работе результаты оказались более убедительными. По сообщениям, Grok 4.6 занял первое место во всех трёх ключевых оценках: 1 753 Elo в GDPval-AA v2, 1 577 Elo в AA-Briefcase и 15,8% в профессиональном юридическом бенчмарке Harvey LAB.
Основной вывод исходной статьи из этих данных прямолинеен: обе модели вошли в разговор наравне с ведущими передовыми системами.
Разница в цене — тоже часть истории
Производительность — лишь половина этого сравнения.
В исходной статье также подчёркиваются затраты на инференс. Приводятся цены за миллион выходных токенов на момент релиза:
| Модель | Цена за млн выходных токенов (по данным статьи) |
|---|---|
| DeepSeek V4 Pro | $0,87 |
| Grok 4.6 | $6 |
| GPT-5.6 Sol | $30 |
| Claude Opus 5 | $25 |
| Fable 5 | $50 |
В текущем представлении цен в долларах США: $0,435 за миллион входных токенов при отсутствии попадания в кэш и $0,003625 при попадании в кэш.
В документации DeepSeek также
указывается, что модель V4 поддерживает окно контекста в 1 миллион токенов, вызов инструментов, а также доступ к API в форматах OpenAI и Anthropic.
Конкретные цены других моделей меняются со временем, поэтому кросс-модельные ценовые сравнения из исходной статьи следует рассматривать как снимок на дату публикации, а не как долгосрочный прайс-лист.
Первый реальный тест: DeepSeek V4 Pro создаёт 3D-Землю
Первый практический тест, описанный в статье, предъявил к DeepSeek V4 Pro довольно высокие требования.
Всего по одному промпту модель создала полноценный интерактивный 3D-опыт Земли в браузере.
По сообщениям, результат поддерживал базовые взаимодействия: перетаскивание, вращение и масштабирование, а также включал глобальные потоки данных, динамические маршруты и геометки по всему миру.
Визуальные детали пошли ещё дальше. Атмосферное рассеяние, облака, смена дня и ночи, а также окружающий интерфейс были включены в сгенерированный опыт.
Суть этого теста не только в том, что модель создала веб-страницу, но и в том, что она продемонстрировала, насколько далеко может зайти ИИ-модель программирования, когда ей поручают в рамках одной задачи скоординировать визуальный дизайн, 3D-рендеринг, интерактивность и структуру приложения.
DeepSeek V4 Pro против Grok 4.6 в трёх прикладных задачах
Далее в исходной статье обе модели сравниваются с использованием одинаковых или очень близких промптов.
ИИ-автор Сянъян Цяому сначала прогнал три небольшие задачи через DeepSeek V4 Pro, а затем передал два из этих же промптов модели Grok 4.6.
Создание и развёртывание сайта с использованием трёх навыков
Первая задача требовала от модели использовать три навыка для разработки и развёртывания веб-сайта.
По сообщениям, DeepSeek V4 Pro успешно выполнил весь рабочий процесс. В исходной статье отмечается, что дизайн страницы и общая целостность показали стабильные результаты.
Такие тесты особенно важны для агентного программирования, поскольку модели необходимо координировать несколько инструментов или способностей, а не просто генерировать фрагмент кода.
Воспроизведение 60 стилей дизайна в Bento-карточках
Вторая задача требовала от модели воспроизвести 60 различных стилей дизайна и представить их в виде набора Bento-карточек.
По сообщениям, DeepSeek V4 Pro различал типографику, цветовые сочетания и компоновку в разных дизайнах.
Когда тот же промпт был передан Grok 4.6, последний получил преимущество. В исходной статье говорится, что некоторые страницы Grok оказались более зрелыми по компоновке, цвету и визуальной иерархии, что в итоге дало более изысканный результат.
Создание 3D-игры в жанре Breakout
Третья задача заключалась в создании 3D-игры Breakout с нуля.
DeepSeek V4 Pro создал играбельную игру с 3D-окружением, фоновой музыкой, динамическими звуковыми эффектами и интерактивной обратной связью.
Grok 4.6 выступил сопоставимо в этом раунде. Исходная статья описывает результаты как практически равные по визуальному качеству, полноте сцены и играбельности.
Тест с Flappy Bird выявляет ещё один компромисс
Более детальный тест провёл разработчик Джун Сон, который дал DeepSeek V4 Pro и Grok 4.6 абсолютно одинаковые промпты с требованием создать игру в стиле Flappy Bird с нуля.
Обе модели выбрали кардинально разные подходы.
DeepSeek V4 Pro использовал более 20 000 токенов, но по сообщениям стоимость API составила $0 — благодаря ценообразованию API этой модели (в рамках ограниченной по времени акции DeepSeek) входные и выходные токены были полностью бесплатными.
019**.
Grok 4.6 использовал около 5 000 токенов, а заявленные затраты составили $0,03.
Таким образом, в этом конкретном запуске Grok был более эффективен по токенам, но, согласно исходной статье, DeepSeek выдал более сильный конечный результат.
По сообщениям, версия DeepSeek включала многослойный горный фон, облака, градиенты и объёмные трубы, а также анимацию «+1», всплывающую при прохождении персонажем труб.
Вывод исходной статьи ценен: меньшее потребление токенов не обязательно означает лучший результат приложения, а большее потребление токенов не обязательно означает более высокие затраты.
Ещё один фронтенд-тест также отдаёт предпочтение DeepSeek
Разработчик Хамза провёл ещё один тест генерации фронтенда, и исходная статья сообщает, что DeepSeek V4 Pro снова одержал победу.
Сгенерированная страница была описана как превосходящая по общей целостности и визуальному качеству
Результаты Grok 4.6.
Это усилило закономерность, наблюдаемую ранее в задачах: обе модели очень близки, но их сильные стороны различаются в зависимости от конкретного применения и формулировки запроса.
У V4 Pro всё ещё есть слабые места
DeepSeek V4 Pro не побеждает в каждом тесте генерации изображений.
В одном сравнении с участием пеликанов версия V4 Pro, как сообщается, превзошла версию Flash по общей визуальной завершённости и создала более привлекательную иллюстрацию слона, но направление движения пеликана было указано неверно.
Это небольшой пример, но он подчёркивает общее ограничение генеративного кодирования и визуальных систем: результат может выглядеть изысканно, но при этом содержать базовые семантические ошибки или ошибки движения.
Вишнёвое дерево на Three.js: разрыв стал более заметным
Затем исходная статья усложнила задачу, попросив DeepSeek V4 Pro, GPT-5.6 Sol и Claude Opus 5 сгенерировать одно и то же вишнёвое дерево с помощью Three.js.
На этот раз различия стали более явными.
Согласно статье, DeepSeek V4 Pro отставал от двух других моделей по детализации ствола и ветвей, листве, освещению, глубине резкости и общей атмосфере.
Этот результат важен, поскольку он не позволяет превратить сравнение в простую историю о победе. DeepSeek V4 Pro может быть очень мощным в сквозных задачах кодирования, но всё ещё существуют специализированные сценарии генерации изображений, в которых другие передовые модели достигают более точных результатов.
В целом: DeepSeek V4 Pro и Grok 4.6 находятся на сопоставимом уровне
По итогам нескольких раундов тестирования общий вывод исходной статьи заключается в том, что DeepSeek V4 Pro и Grok 4.6 достигли схожего конкурентного уровня.
Ни одна из моделей не может выиграть каждую задачу.
DeepSeek V4 Pro выглядит особенно сильным в некоторых сквозных задачах кодирования и создания приложений, тогда как Grok 4.6, возможно, более экономичен по использованию токенов и демонстрирует преимущества в некоторых сравнениях визуального дизайна и интеллектуальной работы.
Это делает такое сравнение более полезным, чем单一 оценка в рейтинге. Для разработчиков лучшая модель может зависеть от того, что для них приоритетнее: качество кода, надёжность агента, визуальная точность, эффективность использования токенов или стоимость API.
Две модели ИИ сокращают разрыв с передовыми разработками
Исходная статья описывает одновременный выпуск DeepSeek V4 Pro и Grok 4.6 как необычный момент на рынке ИИ.
Реакция Рика Де Оливейры, цитируемая в статье, подчёркивает, что обе модели одновременно мощные и доступные по цене.
Именно это сочетание делает их релизы столь заметными.
Официальная документация DeepSeek подтверждает, что V4 Pro разработан для вызова инструментов, рабочих нагрузок с длинным контекстом, а также режимов мышления и без мышления.
Официальные материалы xAI о Grok аналогичным образом позиционируют последнее поколение Grok в области кодирования, задач агентов и интеллектуальной работы. Например, в официальном анонсе Grok 4.5 модель описана как созданная для кодирования, задач агентов и интеллектуальной работы, с приведением реальных инженерных результатов тестирования.
Даже если отдельные показатели бенчмарков меняются, более широкая тенденция остаётся ясной: ИИ передового уровня становится всё более доступным для разработчиков, а соотношение цены и производительности становится всё более важной частью конкуренции моделей.
Что будет дальше?
В конце исходной статьи указано направление следующего раунда конкуренции.
В ней упоминается, что xAI уже анонсировала Grok 4.7, а OpenAI и Anthropic, как ожидается, продолжат отвечать обновлениями своих моделей.
Это означает, что сегодняшние лидеры бенчмарков могут не удержать первенство надолго.
Для разработчиков более долговечный урок заключается в следующем: оценивайте модели по задачам, которые действительно влияют на ваш рабочий процесс. Модель с высокими баллами в бенчмарках, но плохой работой в вашей кодовой базе, процессе развёртывания, требованиях к интерфейсу или инструментальной цепочке всё равно может оказаться неправильным выбором.
Часто задаваемые вопросы
Что такое DeepSeek V4 Pro?
DeepSeek V4 Pro — это флагманская модель V4 от DeepSeek, ориентированная на рассуждение, кодирование, использование инструментов и рабочие нагрузки с длинным контекстом. Официальная документация DeepSeek указывает контекстное окно в 1 миллион токенов и поддержку вызова инструментов, а также доступ к API в форматах OpenAI и Anthropic.
Как DeepSeek V4 Pro соотносится с Grok 4.6?
Согласно исходной статье, обе модели показали близкие результаты в нескольких тестах агентов и кодирования,各有 победы и поражения. DeepSeek V4 Pro особенно отличился в нескольких сквозных тестах создания приложений, тогда как Grok 4.6 продемонстрировал сильные результаты в кодировании, интеллектуальной работе и некоторых задачах визуального дизайна.
Дешевле ли DeepSeek V4 Pro, чем Grok?
Согласно сравнению в исходной статье от 14 августа 2026 года, заявленная цена вывода DeepSeek V4 Pro составляет 0,87 доллара за миллион токенов, а Grok 4.6 — 6 долларов. Текущая официальная страница цен DeepSeek подтверждает цену V4 Pro в 0,87 доллара за миллион выходных токенов, хотя цены на API могут меняться.
Может ли DeepSeek V4 Pro создавать веб-сайты и игры?
В исходной статье сообщается об успешных тестах, в которых DeepSeek V4 Pro создал 3D-опыт с Землёй, веб-сайты, коллекцию дизайнов в стиле Bento, 3D-игру «Арканоид» и игру в стиле Flappy Bird. Это задокументированные реальные результаты тестов, а не гарантия того, что каждый запрос приведёт к аналогичному качеству.
Подходит ли DeepSeek V4 Pro для ИИ-агентов кодирования?
Он разработан для вызова инструментов и агентных рабочих нагрузок, и в исходной статье сообщается о его высокой производительности в нескольких агентных и программно-инженерных тестах. Официальная документация DeepSeek также подтверждает поддержку вызова инструментов в V4 Pro.
Всегда ли DeepSeek V4 Pro превосходит другие передовые модели?
Нет. В исходной статье есть тесты, в которых GPT-5.6 Sol и Claude Opus 5 показали лучшие результаты, особенно в сравнении генерации вишнёвого дерева на Three.js. Результаты сильно различаются в зависимости от задачи.
Что ещё разработчикам следует сравнивать помимо баллов бенчмарков?
Разработчикам также следует сравнивать стоимость API, задержку, длину контекста, вызов инструментов, надёжность кодирования, качество вывода и то, насколько модель вписывается в их существующие агентные рабочие процессы. Для производственных систем последовательность и общая стоимость могут быть важнее, чем незначительные различия в бенчмарках.
Связанные инструменты
- DeepSeek API: Официальная конечная точка API для доступа к моделям DeepSeek.
- Документация DeepSeek API: Официальная документация по моделям, ценам, вызову инструментов и интеграции API.
- xAI API: Официальный ресурс для разработчиков по созданию решений с моделями Grok.
- Grok: Пользовательский сервис xAI для взаимодействия с моделями Grok.
- Three.js: Библиотека JavaScript для 3D, связанная с тестами генерации Three.js, описанными в статье.
Связанные ссылки
- Модели и цены DeepSeek: Официальные спецификации моделей DeepSeek API и текущие цены на токены.
- Документация DeepSeek V4: Официальная документация API DeepSeek и руководства по интеграции.
- Анонс xAI Grok 4.5: Официальный анонс xAI, охватывающий возможности кодирования и агентов текущего поколения Grok.
- Документация xAI API: Официальная документация по использованию Grok через платформу разработчиков xAI.
- Three.js: Официальный сайт проекта Three.js и документация.
- DeepSeek API
GitHub: официальная организация DeepSeek на GitHub.
Краткое содержание
DeepSeek V4 Pro и Grok 4.6 одновременно продвигают передовой ИИ в двух направлениях: более мощные агенты для реального мира и кодинг, а также более агрессивное соотношение цены и производительности.
Ранние тесты не выявили однозначного победителя. DeepSeek V4 Pro показывает сильные результаты в ряде задач по созданию сквозных приложений, тогда как Grok 4.6 демонстрирует конкурентоспособные возможности в кодинге, работе со знаниями и визуальном дизайне.
Более значительный сдвиг заключается в том, что у разработчиков теперь есть больше выбора среди более мощных моделей без необходимости автоматически платить по ценам передового уровня.