DeepSeek V4 Pro против Grok 4.6: первые испытания в реальном мире выводят обе модели в число лидеров

Два ИИ-модели были выпущены почти одновременно, что вывело DeepSeek V4 Pro и Grok 4.6 в центр внимания. DeepSeek V4 Pro в области агентных и

发布于 2026年8月14日generalGEO 评分: 09 次阅读
DeepSeek V4 Pro против Grok 4.6: первые испытания в реальном мире выводят обе модели в число лидеров

DeepSeek V4 Pro против Grok 4.6: первое реальное тестирование выводит обе модели в высшую лигу

Введение

Две мощные ИИ-модели вышли практически одновременно, что сразу вывело DeepSeek V4 Pro и Grok 4.6 в центр внимания.

DeepSeek V4 Pro совершил значительный скачок в производительности агентных систем и разработке ПО, тогда как Grok 4.6 уверенно проявил себя в программировании, интеллектуальной работе и комплексных задачах. В исходной статье оба релиза описываются как прямой вызов текущим передовым моделям OpenAI и Anthropic.

Особый интерес этому сравнению придаёт то, что обе модели оцениваются не только по бенчмаркам. Ранние реальные тесты также требовали от них создания веб-сайтов, игр, воспроизведения визуальных дизайнов и генерации 3D-опытов с использованием одинаковых промптов.

Результат — не столько простое соревнование с победителем, сколько равная борьба: у каждой модели есть области, где она выделяется.

DeepSeek V4 Pro выходит на сцену, Grok 4.6 вступает в игру

В исходной статье перечислены многочисленные результаты бенчмарков DeepSeek V4 Pro.

В агентной оценке кибербезопасности CyberGym DeepSeek V4 Pro, как сообщается, набрал 83,3, с небольшим отрывом опередив Fable 5 (83,1) и Opus 4.8 (78,3).

В AutomationBench он достиг 31,8, опередив Fable 5 (29,1) и Opus 4.8 (27,2).

Наиболее близким по результатам оказался Terminal-Bench 2.1. DeepSeek V4 Pro набрал 87,9, тогда как Opus 4.8 — 85,0, а Fable 5 — 88,0.

В исходной статье также сообщается о результате 60,0 в конфигурации Humanity's Last Exam с использованием инструментов, тогда как Opus 4.8 показал 57,9, а Fable 5 — 63,0.

DeepSWE также стал ещё одним значительным улучшением в отчёте. DeepSeek V4 Pro достиг 62,7, что является огромным скачком по сравнению с 12,8 у превью-версии, выше заявленных 58,0 у Opus 4.8, но всё ещё ниже 70,0 у Fable 5.

Grok 4.6 тестировался в нескольких областях в сравнении с GPT-5.6 и Fable 5.

В исходной статье сообщается о его комплексном индексе интеллекта 61, что на один балл уступает Fable 5 (62).

В CursorBench Grok 4.6, по сообщениям, набрал 69,9%, опередив GPT-5.6 (67,2%) и приблизившись к Fable 5 (70,5%).

Во FrontierCode он достиг 61,3%, также слегка опередив GPT-5.6 (60,6%) и уступив Fable 5 (63,6%).

Исходная статья показывает, что в интеллектуальной работе результаты оказались более убедительными. По сообщениям, Grok 4.6 занял первое место во всех трёх ключевых оценках: 1 753 Elo в GDPval-AA v2, 1 577 Elo в AA-Briefcase и 15,8% в профессиональном юридическом бенчмарке Harvey LAB.

Основной вывод исходной статьи из этих данных прямолинеен: обе модели вошли в разговор наравне с ведущими передовыми системами.

Разница в цене — тоже часть истории

Производительность — лишь половина этого сравнения.

В исходной статье также подчёркиваются затраты на инференс. Приводятся цены за миллион выходных токенов на момент релиза:

Модель Цена за млн выходных токенов (по данным статьи)
DeepSeek V4 Pro $0,87
Grok 4.6 $6
GPT-5.6 Sol $30
Claude Opus 5 $25
Fable 5 $50

В текущем представлении цен в долларах США: $0,435 за миллион входных токенов при отсутствии попадания в кэш и $0,003625 при попадании в кэш.

В документации DeepSeek также

указывается, что модель V4 поддерживает окно контекста в 1 миллион токенов, вызов инструментов, а также доступ к API в форматах OpenAI и Anthropic.

Конкретные цены других моделей меняются со временем, поэтому кросс-модельные ценовые сравнения из исходной статьи следует рассматривать как снимок на дату публикации, а не как долгосрочный прайс-лист.

Первый реальный тест: DeepSeek V4 Pro создаёт 3D-Землю

Первый практический тест, описанный в статье, предъявил к DeepSeek V4 Pro довольно высокие требования.

Всего по одному промпту модель создала полноценный интерактивный 3D-опыт Земли в браузере.

По сообщениям, результат поддерживал базовые взаимодействия: перетаскивание, вращение и масштабирование, а также включал глобальные потоки данных, динамические маршруты и геометки по всему миру.

Визуальные детали пошли ещё дальше. Атмосферное рассеяние, облака, смена дня и ночи, а также окружающий интерфейс были включены в сгенерированный опыт.

Суть этого теста не только в том, что модель создала веб-страницу, но и в том, что она продемонстрировала, насколько далеко может зайти ИИ-модель программирования, когда ей поручают в рамках одной задачи скоординировать визуальный дизайн, 3D-рендеринг, интерактивность и структуру приложения.

DeepSeek V4 Pro против Grok 4.6 в трёх прикладных задачах

Далее в исходной статье обе модели сравниваются с использованием одинаковых или очень близких промптов.

ИИ-автор Сянъян Цяому сначала прогнал три небольшие задачи через DeepSeek V4 Pro, а затем передал два из этих же промптов модели Grok 4.6.

Создание и развёртывание сайта с использованием трёх навыков

Первая задача требовала от модели использовать три навыка для разработки и развёртывания веб-сайта.

По сообщениям, DeepSeek V4 Pro успешно выполнил весь рабочий процесс. В исходной статье отмечается, что дизайн страницы и общая целостность показали стабильные результаты.

Такие тесты особенно важны для агентного программирования, поскольку модели необходимо координировать несколько инструментов или способностей, а не просто генерировать фрагмент кода.

Воспроизведение 60 стилей дизайна в Bento-карточках

Вторая задача требовала от модели воспроизвести 60 различных стилей дизайна и представить их в виде набора Bento-карточек.

По сообщениям, DeepSeek V4 Pro различал типографику, цветовые сочетания и компоновку в разных дизайнах.

Когда тот же промпт был передан Grok 4.6, последний получил преимущество. В исходной статье говорится, что некоторые страницы Grok оказались более зрелыми по компоновке, цвету и визуальной иерархии, что в итоге дало более изысканный результат.

Создание 3D-игры в жанре Breakout

Третья задача заключалась в создании 3D-игры Breakout с нуля.

DeepSeek V4 Pro создал играбельную игру с 3D-окружением, фоновой музыкой, динамическими звуковыми эффектами и интерактивной обратной связью.

Grok 4.6 выступил сопоставимо в этом раунде. Исходная статья описывает результаты как практически равные по визуальному качеству, полноте сцены и играбельности.

Тест с Flappy Bird выявляет ещё один компромисс

Более детальный тест провёл разработчик Джун Сон, который дал DeepSeek V4 Pro и Grok 4.6 абсолютно одинаковые промпты с требованием создать игру в стиле Flappy Bird с нуля.

Обе модели выбрали кардинально разные подходы.

DeepSeek V4 Pro использовал более 20 000 токенов, но по сообщениям стоимость API составила $0 — благодаря ценообразованию API этой модели (в рамках ограниченной по времени акции DeepSeek) входные и выходные токены были полностью бесплатными.

019**.

Grok 4.6 использовал около 5 000 токенов, а заявленные затраты составили $0,03.

Таким образом, в этом конкретном запуске Grok был более эффективен по токенам, но, согласно исходной статье, DeepSeek выдал более сильный конечный результат.

По сообщениям, версия DeepSeek включала многослойный горный фон, облака, градиенты и объёмные трубы, а также анимацию «+1», всплывающую при прохождении персонажем труб.

Вывод исходной статьи ценен: меньшее потребление токенов не обязательно означает лучший результат приложения, а большее потребление токенов не обязательно означает более высокие затраты.

Ещё один фронтенд-тест также отдаёт предпочтение DeepSeek

Разработчик Хамза провёл ещё один тест генерации фронтенда, и исходная статья сообщает, что DeepSeek V4 Pro снова одержал победу.

Сгенерированная страница была описана как превосходящая по общей целостности и визуальному качеству

Результаты Grok 4.6.

Это усилило закономерность, наблюдаемую ранее в задачах: обе модели очень близки, но их сильные стороны различаются в зависимости от конкретного применения и формулировки запроса.

У V4 Pro всё ещё есть слабые места

DeepSeek V4 Pro не побеждает в каждом тесте генерации изображений.

В одном сравнении с участием пеликанов версия V4 Pro, как сообщается, превзошла версию Flash по общей визуальной завершённости и создала более привлекательную иллюстрацию слона, но направление движения пеликана было указано неверно.

Это небольшой пример, но он подчёркивает общее ограничение генеративного кодирования и визуальных систем: результат может выглядеть изысканно, но при этом содержать базовые семантические ошибки или ошибки движения.

Вишнёвое дерево на Three.js: разрыв стал более заметным

Затем исходная статья усложнила задачу, попросив DeepSeek V4 Pro, GPT-5.6 Sol и Claude Opus 5 сгенерировать одно и то же вишнёвое дерево с помощью Three.js.

На этот раз различия стали более явными.

Согласно статье, DeepSeek V4 Pro отставал от двух других моделей по детализации ствола и ветвей, листве, освещению, глубине резкости и общей атмосфере.

Этот результат важен, поскольку он не позволяет превратить сравнение в простую историю о победе. DeepSeek V4 Pro может быть очень мощным в сквозных задачах кодирования, но всё ещё существуют специализированные сценарии генерации изображений, в которых другие передовые модели достигают более точных результатов.

В целом: DeepSeek V4 Pro и Grok 4.6 находятся на сопоставимом уровне

По итогам нескольких раундов тестирования общий вывод исходной статьи заключается в том, что DeepSeek V4 Pro и Grok 4.6 достигли схожего конкурентного уровня.

Ни одна из моделей не может выиграть каждую задачу.

DeepSeek V4 Pro выглядит особенно сильным в некоторых сквозных задачах кодирования и создания приложений, тогда как Grok 4.6, возможно, более экономичен по использованию токенов и демонстрирует преимущества в некоторых сравнениях визуального дизайна и интеллектуальной работы.

Это делает такое сравнение более полезным, чем单一 оценка в рейтинге. Для разработчиков лучшая модель может зависеть от того, что для них приоритетнее: качество кода, надёжность агента, визуальная точность, эффективность использования токенов или стоимость API.

Две модели ИИ сокращают разрыв с передовыми разработками

Исходная статья описывает одновременный выпуск DeepSeek V4 Pro и Grok 4.6 как необычный момент на рынке ИИ.

Реакция Рика Де Оливейры, цитируемая в статье, подчёркивает, что обе модели одновременно мощные и доступные по цене.

Именно это сочетание делает их релизы столь заметными.

Официальная документация DeepSeek подтверждает, что V4 Pro разработан для вызова инструментов, рабочих нагрузок с длинным контекстом, а также режимов мышления и без мышления.

Официальные материалы xAI о Grok аналогичным образом позиционируют последнее поколение Grok в области кодирования, задач агентов и интеллектуальной работы. Например, в официальном анонсе Grok 4.5 модель описана как созданная для кодирования, задач агентов и интеллектуальной работы, с приведением реальных инженерных результатов тестирования.

Даже если отдельные показатели бенчмарков меняются, более широкая тенденция остаётся ясной: ИИ передового уровня становится всё более доступным для разработчиков, а соотношение цены и производительности становится всё более важной частью конкуренции моделей.

Что будет дальше?

В конце исходной статьи указано направление следующего раунда конкуренции.

В ней упоминается, что xAI уже анонсировала Grok 4.7, а OpenAI и Anthropic, как ожидается, продолжат отвечать обновлениями своих моделей.

Это означает, что сегодняшние лидеры бенчмарков могут не удержать первенство надолго.

Для разработчиков более долговечный урок заключается в следующем: оценивайте модели по задачам, которые действительно влияют на ваш рабочий процесс. Модель с высокими баллами в бенчмарках, но плохой работой в вашей кодовой базе, процессе развёртывания, требованиях к интерфейсу или инструментальной цепочке всё равно может оказаться неправильным выбором.

Часто задаваемые вопросы

Что такое DeepSeek V4 Pro?

DeepSeek V4 Pro — это флагманская модель V4 от DeepSeek, ориентированная на рассуждение, кодирование, использование инструментов и рабочие нагрузки с длинным контекстом. Официальная документация DeepSeek указывает контекстное окно в 1 миллион токенов и поддержку вызова инструментов, а также доступ к API в форматах OpenAI и Anthropic.

Как DeepSeek V4 Pro соотносится с Grok 4.6?

Согласно исходной статье, обе модели показали близкие результаты в нескольких тестах агентов и кодирования,各有 победы и поражения. DeepSeek V4 Pro особенно отличился в нескольких сквозных тестах создания приложений, тогда как Grok 4.6 продемонстрировал сильные результаты в кодировании, интеллектуальной работе и некоторых задачах визуального дизайна.

Дешевле ли DeepSeek V4 Pro, чем Grok?

Согласно сравнению в исходной статье от 14 августа 2026 года, заявленная цена вывода DeepSeek V4 Pro составляет 0,87 доллара за миллион токенов, а Grok 4.6 — 6 долларов. Текущая официальная страница цен DeepSeek подтверждает цену V4 Pro в 0,87 доллара за миллион выходных токенов, хотя цены на API могут меняться.

Может ли DeepSeek V4 Pro создавать веб-сайты и игры?

В исходной статье сообщается об успешных тестах, в которых DeepSeek V4 Pro создал 3D-опыт с Землёй, веб-сайты, коллекцию дизайнов в стиле Bento, 3D-игру «Арканоид» и игру в стиле Flappy Bird. Это задокументированные реальные результаты тестов, а не гарантия того, что каждый запрос приведёт к аналогичному качеству.

Подходит ли DeepSeek V4 Pro для ИИ-агентов кодирования?

Он разработан для вызова инструментов и агентных рабочих нагрузок, и в исходной статье сообщается о его высокой производительности в нескольких агентных и программно-инженерных тестах. Официальная документация DeepSeek также подтверждает поддержку вызова инструментов в V4 Pro.

Всегда ли DeepSeek V4 Pro превосходит другие передовые модели?

Нет. В исходной статье есть тесты, в которых GPT-5.6 Sol и Claude Opus 5 показали лучшие результаты, особенно в сравнении генерации вишнёвого дерева на Three.js. Результаты сильно различаются в зависимости от задачи.

Что ещё разработчикам следует сравнивать помимо баллов бенчмарков?

Разработчикам также следует сравнивать стоимость API, задержку, длину контекста, вызов инструментов, надёжность кодирования, качество вывода и то, насколько модель вписывается в их существующие агентные рабочие процессы. Для производственных систем последовательность и общая стоимость могут быть важнее, чем незначительные различия в бенчмарках.

Связанные инструменты

  • DeepSeek API: Официальная конечная точка API для доступа к моделям DeepSeek.
  • Документация DeepSeek API: Официальная документация по моделям, ценам, вызову инструментов и интеграции API.
  • xAI API: Официальный ресурс для разработчиков по созданию решений с моделями Grok.
  • Grok: Пользовательский сервис xAI для взаимодействия с моделями Grok.
  • Three.js: Библиотека JavaScript для 3D, связанная с тестами генерации Three.js, описанными в статье.

Связанные ссылки

  • Модели и цены DeepSeek: Официальные спецификации моделей DeepSeek API и текущие цены на токены.
  • Документация DeepSeek V4: Официальная документация API DeepSeek и руководства по интеграции.
  • Анонс xAI Grok 4.5: Официальный анонс xAI, охватывающий возможности кодирования и агентов текущего поколения Grok.
  • Документация xAI API: Официальная документация по использованию Grok через платформу разработчиков xAI.
  • Three.js: Официальный сайт проекта Three.js и документация.
  • DeepSeek API

GitHub: официальная организация DeepSeek на GitHub.

Краткое содержание

DeepSeek V4 Pro и Grok 4.6 одновременно продвигают передовой ИИ в двух направлениях: более мощные агенты для реального мира и кодинг, а также более агрессивное соотношение цены и производительности.

Ранние тесты не выявили однозначного победителя. DeepSeek V4 Pro показывает сильные результаты в ряде задач по созданию сквозных приложений, тогда как Grok 4.6 демонстрирует конкурентоспособные возможности в кодинге, работе со знаниями и визуальном дизайне.

Более значительный сдвиг заключается в том, что у разработчиков теперь есть больше выбора среди более мощных моделей без необходимости автоматически платить по ценам передового уровня.