Цикл вызовов Claude Opus 5: как мультиагентная итерация создаёт играбельные браузерные игры

Новая схема промптов для Claude Opus 5 стремительно распространяется в сообществе AI-программистов: разработчики используют её для создания удивительно качественных браузерных игровых прототипов на основе кратких описаний.

发布于 2026年7月31日generalGEO 评分: 08 次阅读
Изображение представляет собой рекламный баннер руководства по циклу вызовов Claude Opus 5. Тёмный фон с надписью «CLAUDE». Оранжевым выделено «Руководство по циклу вызовов», ниже текст «Мультиагентная разработка игр в коде Клода». В центре — кольцевая структура из четырёх ролей: «Планировщик», «Кодировщик», «Тестировщик», «Ревьюер», рядом с каждой ролью соответствующая иконка. Вокруг кольца — элементы интерфейса кода, что в целом передаёт концепцию разработки игр с помощью Claude Opus 5 в мультиагентной системе.

«Петля испытаний» Claude Opus 5: как мультиагентная итерация позволяет создавать играбельные браузерные игры

Введение

Новый паттерн промптов для Claude Opus 5 стремительно распространяется в сообществе ИИ-разработчиков, поскольку разработчики используют его для создания удивительно качественных прототипов браузерных игр из коротких начальных инструкций.

Этот метод теперь называют «Петля испытаний» (Gauntlet Loop).

Его основная идея проста: не позволяйте одному и тому же агенту создать что-то один раз, оценить свою работу и остановиться на этом. Дайте ведущему агенту высокоуровневую цель, поручите ему разбить проект на более мелкие части, назначьте профессиональных исполнителей и используйте независимых агентов-рецензентов для сравнения фактического результата с конкретными стандартами качества.

Если сгенерированный результат не проходит сравнение — вернитесь на новый цикл итерации.

Мэтт Шумер популяризировал этот метод после того, как создал браузерный шутер от первого лица, вдохновлённый современными играми серии Call of Duty, с помощью Claude Code и Opus 5. Впоследствии он опубликовал промпты, исходный код и описание рабочего процесса.

Изображение демонстрирует публикацию Мэтта Шумера в Twitter, где он пишет, что Claude Opus 5 справляется с первого раза, весь контент, показанный в демонстрации, является пользовательским кодом, без использования внешних ресурсов, игры с искусственным интеллектом будут великолепны. Ниже приведён двуязычный текст на английском и китайском языках. Под изображением находится игровой кадр, показывающий вид от первого лица, с оружием в руках, прицеливанием в дальнюю цель, на фоне городской застройки. Это изображение связано с описанием метода Gauntlet Loop для Claude Opus 5 в документе и демонстрирует его применение в области разработки игр.

Другой разработчик, Аншу Чимала, применил аналогичный рабочий процесс для создания «Долгой тишины» (The Long Silence), процедурной космической игры-исследования, работающей в браузере.

Эти проекты следует описывать точно. Они не означают, что один промпт может мгновенно создать коммерческую игру уровня AAA. Они показывают, что мощный кодирующий агент, наделённый инструментами, субагентами, длительным временем выполнения, измеримыми порогами качества и повторной проверкой, может продвинуть прототип значительно дальше, чем традиционный одноразовый промпт.

Паттерн промптов, стоящий за вирусной демонстрацией

Первоначальная задача Шумера ставила намеренно экстремальную цель: создать шутер от первого лица с визуальными амбициями, сопоставимыми с современными AAA-проектами.

Ключевая часть заключается не в жанре игры, а в структуре оценки.

Изображение демонстрирует твит Мэтта Шумера, где задача ставится как создание шутера от первого лица, сопоставимого по уровню с недавними играми Call of Duty, с безупречной визуальной составляющей — от текстур до физики, всё должно соответствовать стандартам качества AAA. Также требуется распределить субагентов, чтобы каждый обрабатывал отдельную часть, и каждая часть имела независимого субагента для визуальной проверки, чтобы убедиться, что она выглядит на уровне AAA, а если не соответствует — продолжать итерации. Твит подчёркивает, что не следует останавливаться, пока каждый субагент не будет полностью убеждён в качестве по сравнению с реальной игрой Call of Duty, и следует проводить слепое сравнение, чтобы определить, какой вариант лучше.

Рабочий процесс предписывал агенту:

  1. Разбить общую цель на более мелкие части.
  2. Делегировать эти части специализированным субагентам.
  3. Использовать независимых агентов-рецензентов для проверки результатов.
  4. Сравнивать полученные артефакты с реальными эталонами.
  5. Отклонять работы, не соответствующие стандартам.
  6. Продолжать итерации, а не останавливаться после фиксированного числа раундов.

Впоследствии Шумер формализовал этот подход как «Петлю испытаний» (Gauntlet Loop).

Упрощённая версия выглядит следующим образом:

Цель
  ↓
Ведущий агент
  ↓
Декомпозиция задач
  ↓
Агенты-исполнители
  ↓
Фактический результат
  ↓
Независимая оценка
  ↓
Сравнение с эталоном
  ↓
Пройдено? ── да → Интеграция
  │
  нет
  ↓
Объяснение наибольшего разрыва
  ↓
Улучшение исполнителем
  ↓
Повторение

Конкретные пороги качества имеют решающее значение

Обратная связь вроде «сделай лучше» — слабая, потому что модель должна сама определить, что значит «лучше».

В «Петле испытаний» оценщику предоставляется внешний эталон.

Для игр это могут быть скриншоты из коммерческих проектов.

Для веб-сайтов — несколько ведущих сайтов в той же категории.

Для бэкенд-разработки это могут быть:

  • Набор тестов
  • Целевая задержка
  • Эталонная реализация
  • Аудит безопасности
  • Порог надёжности

Цель не обязательно должна быть полностью достижимой. Её роль — помешать агенту преждевременно объявить об успехе.

Никогда не позволяйте исполнителю быть единственным судьёй

Второе ключевое правило — независимость.

Исполнитель знает причины каждого своего решения и легко может оправдать свои результаты. А новый оценщик, получающий готовый артефакт, не знает контекста реализации.

Для визуальных работ оценщик может проверять отрендеренные пиксели.

Для программного обеспечения оценщик может проверять тесты и поведение во время выполнения.

Для задач производительности оценщик может проверять реальные измерения.

Более широкий принцип: генерация и оценка должны быть разделены.

Claude of Duty: проект, который сделал петлю популярной

Первоначальная демонстрация Шумера была публично выпущена под названием Claude of Duty.

В его репозитории на GitHub описан шутер от первого лица на основе Three.js и WebGL2, содержащий около 55 000 строк кода в ~11 подсистемах.

В описании репозитория указано, что игра не использует внешних художественных ресурсов. Текстуры, меши, анимации и звуки процедурно генерируются кодом.

Его системы включают:

  • Рендеринг
  • Материалы
  • Атмосферу и небо
  • Геометрию мира
  • Физику
  • Движение игрока
  • Оружие
  • Спецэффекты
  • ИИ противников
  • Интерфейс
  • Процедурный звук

Утверждение, что проект создан «с первого раза», не означает, что всё появилось в одном ответе. По словам Шумера, высокоуровневый промпт запустил длительную сессию Claude Code, которая затем порождала субагентов, записывала файлы, запускала инструменты, рендерила игру, проверяла результаты и постоянно вносила изменения.

Инструменты проверки — тоже часть результата

Репозиторий включает следующие инструменты:

  • Воспроизводимые скриншоты
  • Наборы изображений для рецензирования
  • Попиксельное сравнение изображений
  • Анализ времени кадра
  • Скриптованные игровые сессии

Файл README также более осторожен, чем некоторые вирусные публикации: в нём прямо указано, что итоговый проект не соответствует уровню современных игр Call of Duty.

Это делает эксперимент даже более ценным. Настоящий результат — не «ИИ уже заменил AAA-студии», а то, что намеренно высокая планка позволяет агенту продолжать работать значительно дольше, чем там, где остановился бы обычный промпт.

Космическая игра за 24 часа: The Long Silence

Затем Аншу Чимала применил аналогичный рабочий процесс для создания The Long Silence — процедурной браузерной космической игры-исследования, построенной с использованием Claude Opus 5.

![Изображение демонстрирует начальный экран игры The Long Silence. В центре кадра — заголовок «THE LONG SILENCE», ниже указано «DEEP SURVEY VESSEL - PALE SEEKER», а также отображаются надписи «SYSTEMS NOMINAL» и «WAKE». Фоном служит тёмный интерьер космического корабля с металлическими конструкциями и трубами, создающий научно-фантастическую атмосферу. Это изображение связано с описанием игры The Long Silence как процедурной браузерной космической игры-исследования, построенной с использованием Claude Opus 5, и наглядно демонстрирует визуальный стиль игры.](https://we0-cms.oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/07/ad

com/cms-assets/image/2026/07/4c0cc196-a519-4a65-9455-9973c77719a4-8c0d5688-9322-4030-96b7-7f67d4d1707a.png)

В описании публичного репозитория указано, что игра использует WebGL2, браузерный рендеринг в стиле Three.js и пользовательский GLSL.

Также применяется процедурная генерация контента на основе сида вместо загрузки традиционных библиотек ассетов.

В исходной статье описан процесс разработки продолжительностью около 24 часов, разделённый на три основных этапа.

Шаг первый: передать задачу Opus 5 и позволить ему выбрать архитектуру

Первым запросом было создание космической игры-исследования с использованием Three.js.

Требования были намеренно сформулированы на высоком уровне:

  • Игрок должен иметь возможность перемещаться.
  • Игрок должен иметь возможность управлять кораблём.
  • Избегать чрезмерно пластикового визуального стиля.
  • Стабильная работа в браузере.
  • Стремление к плавной производительности там, где это возможно.

Большая часть построения мира и технической архитектуры была оставлена на усмотрение агента.

Это следует ключевому принципу данного подхода:

Определяй конечную точку, а не маршрут.

В исходной статье также упоминается, что Claude Code в процессе работы подключался к инструментам, связанным с Blender. В публичном репозитории содержится каталог навыков Claude для моделирования твёрдотельных поверхностей в Blender, что подтверждает — переиспользуемые инструкции для Blender стали частью проекта.

Изображение демонстрирует сцену из игры «The Long Silence». На нём показано тёмное внутреннее помещение: слева лестница, справа шлюзовая дверь, впереди коридор. В нижней части экрана есть текст «Scanner online. Seven Resonators are out there. Bring back what they say.», а также подсказки управления: «WASD move», «MOUSE look», «E use», «SHIFT run», «K outside view». Изображение относится к описанию игры «The Long Silence» в документе и наглядно показывает игровое окружение.

Шаг второй: запуск длительного цикла визуальной оптимизации

После завершения первой играбельной версии проект перешёл в длительную фазу визуальной доработки.

Несколько субагентов занимались разными областями, в то время как один агент-рецензент сравнивал скриншоты с эталонными изображениями качественных космических игр.

Суть заключалась не в том, чтобы просто сказать Opus 5 «сделай игру красивее». Агент-рецензент должен был выявлять видимые различия и отправлять слабые места на повторную итерацию.

В исходной статье упоминается, что такие работы, как Starfield, использовались в качестве ориентира качества.

Длинный цикл также требует условий остановки. Полезные точки остановки включают:

  • Достижение измеримой цели.
  • Агент-рецензент больше не обнаруживает существенных различий.
  • Улучшения слишком незначительны, чтобы оправдать вычислительные затраты.
  • Выделенное время или бюджет исчерпаны.
  • Ответственный человек считает результат достаточным.

Цикл является механизмом давления, а не гарантией того, что результат в конечном итоге станет «идеальным».

Шаг третий: ручная перенастройка приоритетов, очистка и извлечение навыков

Процесс не был полностью автоматическим.

Согласно исходной статье, Чимала удалённо контролировал прогресс и вмешивался, когда агент уделял слишком много внимания одной области.

После завершения длительного цикла были использованы дополнительные сеансы Claude для:

  • исправления проблем рендеринга;
  • очистки кода;
  • подготовки проекта к развёртыванию.

Затем модель попросили обобщить переиспользуемый опыт в виде навыка.

В публичном репозитории содержится:

.claude/skills/blender-hardsurface

Это полезный шаблон для длительных агентских задач. Проект может производить не только артефакты, но и накапливать переиспользуемые практические знания: какие инструменты работают, какие тесты важны, что не сработало и как следует структурировать будущие задачи.

The Long Silence создала собственный набор инструментов валидации

Одной из самых заметных частей публичного репозитория является

набор инструментов валидации.

В README задокументированы следующие команды:

node tools/play.mjs
node tools/survey.mjs
node tools/probe.mjs "<js>" --shot out.png
node tools/sheet.mjs a.png b.png --out s.png
node tools/levels.mjs shots/*.png
node tools/judgeset.mjs

Документированные назначения этих команд:

  • play.mjs: 17 интерактивных проверок, охватывающих полёт, сканирование, складывание и прыжки;
  • survey.mjs: скриншоты основных сцен и отчёт о производительности;
  • probe.mjs: однократное выполнение выражения в браузере и один скриншот;
  • sheet.mjs: контактный лист миниатюр для визуального сравнения;
  • levels.mjs: статистика по тону и экспозиции;
  • judgeset.mjs: пересоздание набора для визуальной рецензии.

Изображение показывает интерфейс GitHub-репозитория космической игры «THE LONG SILENCE», созданной Claude Opus 5. Слева — структура каталога репозитория: claude/skills, blender-hardsurface, public, src, tools, .gitignore, LICENSE, README.md, index.html, package-lock.json, package.json, vite.config.js и другие файлы и папки. Справа — описание репозитория, указывающее, что это космическая игра от Claude Opus 5 на WebGL, с 202 звёздами, 1 подписчиком и 29 форками. Изображение связано с контекстом описания создания игры с помощью Claude Opus 5 и наглядно показывает состояние GitHub-репозитория.

Ключевой момент: агент создал не только саму игру, но и механизмы для её оценки.

Именно поэтому долго работающий агент способен улучшать результат надёжнее, чем простой конвейер «сгенерировал — остановился».

Репозиторий демонстрирует реальные инженерные компромиссы

В README задокументирован ряд практических графических решений:

  • Плавающее начало координат для обработки очень больших пространственных расстояний.
  • Планеты запекаются в кубические текстуры, чтобы избежать дорогостоящих процедурных вычислений на каждом кадре.
  • Атмосфера использует вычисления рассеяния.
  • Постобработка включает bloom, цветокоррекцию, линзовые эффекты, зернистость и сглаживание.
  • Динамическое масштабирование рендера защищает частоту кадров.

В репозитории также указано, что проверка в браузере выполнялась на реальном экземпляре Chromium с включённой GPU-растеризацией.

Эти детали важны, поскольку они показывают, как модель справляется с привычными инженерными ограничениями: производительность, точность, воспроизводимость, поведение браузера и визуальное качество.

Результат играбелен, но остаётся прототипом

«The Long Silence» доступна для игры в браузере.

В репозитории представлены стандартные команды разработки:

npm install
npm run dev
npm run build

Игра включает космический полёт, сканирование, процедурные среды, навигацию, исследовательские цели и несколько интерфейсных систем.

Это делает её чем-то большим, чем статичная модель.

Но это всё ещё не коммерческая AAA-игра, над которой крупная студия работает годами.

Производство AAA-уровня обычно требует больших команд, отвечающих за:

  • художественное оформление;
  • дизайн уровней;
  • анимацию;
  • аудио;
  • нарратив;
  • многопользовательский режим;
  • контроль качества;
  • поддержку доступности;
  • сертификацию;
  • оптимизацию производительности;
  • эксплуатацию и сопровождение.

Более обоснованный вывод: один разработчик сегодня может оркестрировать передовые кодирующие агенты и создавать визуально амбициозные, технически нетривиальные играбельные прототипы со скоростью, которая раньше не была практически возможна.

Сообщество разработчиков начало переиспользовать этот паттерн

После того как Shumer опубликовал промпт и код, этот рабочий процесс быстро распространился.

Картинг-гонки

Райан Кэмпбелл применил схожий подход

Циклически продвигая браузерный картинг-проект, постоянно итерируя рендеринг, управление, поведение камеры и производительность на мобильных устройствах.

Опубликованный Shumer каталог Gauntlet Loop позже продемонстрировал гоночный эксперимент, созданный этим методом и доступный для игры в браузере.

Claudepunk 2077

Дизайнер Йоги Сурия поделился проектом на Three.js в стиле киберпанк, вдохновлённым тем же промпт-паттерном.

Это изображение связано с проектом Claudepunk 2077, которым поделился дизайнер Йоги Сурия. Проект разработан на основе Three.js и является веб-проектом в стиле киберпанк, созданным по промпт-паттерну Gauntlet Loop, опубликованному Shumer. Текст в верхней части изображения упоминает, что проект вдохновлён постом @matthshumer, а также рассматривает возможность создания игры с трансчеловеческими персонажами с помощью Claude и Unreal Engine 4, с приложенной ссылкой на соответствующий GitHub-репозиторий. В нижней части изображения показан интерфейс запуска проекта в браузере: виден тёмный кибергородской игровой сценарий, а также элементы интерфейса, такие как миникарта и указатель мыши.

Этот пример показывает, что метод не ограничивается одним игровым жанром. Референтная цель, художественное направление и набор инструментов могут меняться, а структура «создавай — критикуй — повторяй» остаётся неизменной.

Тот же паттерн можно применять и к другим кодинг-агентам

Источник также показал процесс, в котором разработчик использовал GPT-5.6 Sol в Codex для аналогичного промпта.

Разработчик сообщил, что время сборки составило около двух часов, и охарактеризовал результат как неплохой, но не такой отточенный, как демонстрация Shumer.

Изображение демонстрирует публикацию Дэниела Замбирини в Twitter. Он использовал GPT-5.6 Sol в Codex для промпта Мэтта, время сборки составило 2 часа 6 минут. В тексте упоминается, что промпт неплохой, но не такой отточенный, как работа Мэтта; папка названа «Call of Sol», что означает «Зов Солнца», с пояснением, что «Sol» на португальском означает «солнце». В нижней части изображения показан игровой кадр: на нём изображено оружие, а на фоне — туннель с архитектурными конструкциями.

Это показывает, что Gauntlet Loop по своей сути не является эксклюзивным для Claude.

Паттерн опирается на агентную среду, способную:

  • получать доступ к файлам
  • запускать код
  • отображать вывод
  • проверять скриншоты
  • использовать инструменты
  • работать непрерывно в течение многих раундов
  • делегировать задачи
  • вносить изменения на основе обратной связи

Разные модели могут показывать разные результаты внутри цикла, но архитектура переносима.

Почему агент-критик меняет результат

Традиционный генеративный процесс обычно выглядит так:

Пользователь → Модель → Результат → Пользователь

Gauntlet Loop добавляет уровень оценки:

Пользователь
  ↓
Главный агент
  ↓
Строитель
  ↓
Артефакт
  ↓
Независимый критик
  ↓
Измерение разрыва
  ↓
Пересмотр строителем
  ↓
Новый артефакт

Это создаёт больше возможностей выявить некачественные результаты до их сдачи.

Критик должен проверять реальность

Слова «страница теперь должна быть адаптивной» менее убедительны, чем открыть страницу на мобильной ширине и действительно проверить.

«Игра должна быть быстрее» менее убедительно, чем измерить время кадра.

«Рендер стал лучше» менее убедительно, чем сравнить скриншоты.

Лучшие сигналы обратной связи укоренены в реальных артефактах.

Новый контекст снижает самооправдание

Строитель помнит каждый компромисс, на который он пошёл.

Это может исказить оценку.

Независимый критик может задать более простой вопрос: действительно ли результат соответствует стандарту?

Это отражает человеческие рабочие процессы. Разработчики используют тесты и ревью кода. Дизайнеры используют визуальные ревью и пользовательское тестирование. Писатели используют редактуру.

ИИ-агенты могут воспроизводить это разделение с гораздо большей частотой.

Почему Opus 5 подходит для этого рабочего процесса

Anthropic выпустила Claude Opus 5 24 июля 2026 года.

В официальных материалах

о выпуске подчёркивается более высокая производительность в кодинге, длительных многошаговых задачах, проверке и итерациях.

Anthropic особо отметила, что Opus 5 лучше справляется со следующими задачами:

  • проверка собственной работы
  • повторные итерации до успешного выполнения задачи
  • поиск первопричины
  • создание тестовых фреймворков при необходимости
  • поддержание прогресса в длительных задачах
  • проверка визуального вывода перед сдачей работы

Эти поведения идеально согласуются с Gauntlet Loop.

Этот промпт не наделяет модель новыми способностями. Он создаёт структуру, которая снова и снова заставляет модель использовать уже имеющиеся у неё возможности.

Anthropic также сообщила, что Opus 5 эффективнее Opus 4.8 при той же базовой цене: 5 долларов за миллион входных токенов и 25 долларов за миллион выходных токенов.

Opus 5 всё ещё требует наблюдения

Длительно работающие агенты по-прежнему могут сталкиваться с такими проблемами, как:

  • дрейф контекста
  • нарушение приоритетов
  • нерациональное использование вычислительных ресурсов
  • слабые локальные решения
  • конфликты интеграции
  • сбои инструментов
  • визуальная несогласованность

Поэтому контрольные точки с участием человека остаются полезными.

Самый сильный рабочий процесс — это не «больше никогда не смотреть на агента», а «позволить агенту работать дольше между двумя ценными вмешательствами человека».

Практический шаблон Gauntlet Loop

Этот метод можно распространить и на другие сферы, помимо игр.

Шаг 1: Определите цель

Опишите желаемый результат, а не предписывайте каждую деталь реализации.

Создайте отточенную браузерную космическую игру-исследование с плавным управлением,
яркой визуальной атмосферой и стабильной производительностью.

Шаг 2: Определите реальные стандарты качества

Используйте то, что рецензент может проверить.

Для визуальных работ:

Сравните освещение, глубину, композицию и уровень проработки интерфейса с набором избранных качественных скриншотов коммерческих игр.

Для программного обеспечения используйте тесты, бенчмарки или эталонные реализации.

Шаг 3: Позвольте главному агенту декомпозировать работу

Агент может разделить задачу на компоненты, например:

  • движение
  • освещение
  • окружение
  • интерфейс
  • аудио
  • спецэффекты
  • производительность

Шаг 4: Разделите роли строителя и критика

Для важных компонентов используйте:

  • одного строителя
  • одного критика с полностью новым контекстом

Шаг 5: Возвращайте самый значимый разрыв

Критик должен указывать на самый большой устранимый разрыв, а не выдавать длинный список расплывчатых претензий.

Шаг 6: Повторяйте

Продолжайте итерации до тех пор, пока качество, бюджет или время не достигнут точки остановки.

Шаг 7: Проведите интеграционную проверку

Параллельные агенты могут создавать локально хорошие, но глобально несогласованные результаты.

Финальный интеграционный агент может проверять:

  • общие интерфейсы
  • визуальную согласованность
  • именование
  • дублирующуюся логику
  • производительность
  • конфликты между системами

Шаг 8: Сохраняйте переиспользуемые знания

Сохраняйте полезные части процесса в виде:

  • навыков
  • тестовых скриптов
  • бенчмарков
  • шаблонов промптов
  • инструментов проверки

Последующие запуски должны начинаться с учёта предыдущего опыта.

Когда этот паттерн наиболее эффективен

Gauntlet Loop наиболее эффективен, когда качество можно многократно измерять.

Хорошие кандидаты включают:

  • фронтенд-разработку
  • игры
  • разработку через тестирование
  • рефакторинг
  • оптимизацию производительности
  • исследовательские отчёты
  • маркетинговые страницы
  • презентации
  • визуальный дизайн

Но паттерн работает хуже, когда у критика нет надёжных сигналов.

Критик без скриншотов, тестов,

бенчмарков, референсных материалов или реальной пользовательской обратной связи может просто создать ещё одно «мнение» модели.

Стоимость и контроль по-прежнему важны

Многоагентные рабочие процессы, работающие в течение длительного времени, могут потреблять значительные вычислительные ресурсы.

Каждый раунд проверки может включать:

  • Новые вызовы моделей
  • Рендеринг в браузере
  • Анализ изображений
  • Выполнение инструментов
  • Генерацию кода
  • Тестирование

Практические средства контроля бюджета включают:

  • Максимальное время выполнения
  • Максимальные затраты на модели
  • Максимальное количество раундов критики
  • Минимальный порог улучшения
  • Ручное утверждение после ключевых этапов

Строгий критик может повысить качество, но он также может заставить систему работать дольше, когда дальнейшие улучшения уже нецелесообразны.

Часто задаваемые вопросы

Что такое Gauntlet Loop?

Gauntlet Loop — это метод подсказок для мультиагентов, популяризированный Мэттом Шумером. Ведущий агент разбивает цель на более мелкие задачи, агент-конструктор отвечает за создание результатов, а независимый агент-критик сравнивает фактический вывод с конкретным эталоном; результаты, не соответствующие требованиям, отправляются на доработку.

Действительно ли Claude of Duty был создан с помощью всего одной подсказки?

По словам Шумера, проект начинался с подсказки высокого уровня, но он не был сгенерирован за один ответ модели. Затем Claude Code работал в течение нескольких часов, порождая субагентов, написав около 55 000 строк кода, используя инструменты, проверяя результаты и выполняя итерации.

Создал ли Claude Opus 5 настоящую 3A-игру за 24 часа?

Нет. Эти демонстрации — технически впечатляющие браузерные игры и прототипы, но они не эквивалентны коммерческим 3A-проектам. Сам репозиторий Claude of Duty указывает на то, что конечный результат несопоставим с современными играми Call of Duty, которые служили эталоном качества.

Что такое The Long Silence?

The Long Silence — это браузерная процедурно генерируемая космическая игра от Аншу Чималы. В её публичном репозитории указано, что она создана с использованием Claude Opus 5 и включает пользовательский рендеринг, процедурно генерируемый контент и инструменты проверки на основе браузера.

Зачем нужен независимый агент-критик?

Новый критик вряд ли будет защищать решения по реализации, принятые конструктором. Он может изучить фактический результат и сравнить его с тестами, скриншотами, бенчмарками или эталонными примерами, прежде чем запросить повторную доработку.

Применим ли Gauntlet Loop только к Claude Opus 5?

Нет. Такая архитектура может применяться к другим кодирующим агентам, поддерживающим инструменты, редактирование файлов, выполнение кода, визуальную проверку и повторяющуюся работу. В исходном тексте приведён пример с GPT-5.6 Sol и Codex.

Нужен ли мне Claude Code?

Полный рабочий процесс требует среды выполнения агента, а не обычного чат-интерфейса. Claude Code — один из вариантов, поскольку он может работать с файлами, запускать команды, подключать инструменты и координировать длительные задачи по написанию кода.

Каково самое большое ограничение?

Когда стандарты качества размыты или неизмеримы, длительные циклы могут тратить время и вычислительные ресурсы. Человек-владелец по-прежнему должен устанавливать бюджет, проверять прогресс, при необходимости перенастраивать приоритеты и решать, когда дальнейшие итерации теряют смысл.

Связанные инструменты

  • Claude Code: агентная среда программирования от Anthropic для работы с кодовыми базами, инструментами и долгосрочными задачами разработки.
  • Claude Opus 5: официальное объявление Anthropic.

Описывает возможности Opus 5 в кодировании, проверке, итерациях и задачах с длинным циклом.

  • Three.js: библиотека JavaScript 3D, используемая в браузерных игровых проектах, обсуждаемых в этой статье.
  • Blender: открытый 3D-пакет, который можно подключить к агентному рабочему процессу через внешние инструменты.
  • Model Context Protocol: открытый протокол для подключения ИИ-приложений к внешним инструментам и источникам данных.

Связанные ссылки

Итог

Громкие игровые эксперименты на Opus 5 следует понимать скорее как демонстрацию рабочего процесса, а не как волшебную «одну генерацию». Gauntlet Loop сочетает декомпозицию задач, экспертных конструкторов, независимых критиков, конкретные стандарты качества и повторяющиеся итерации.

The Long Silence показывает, чего эта модель может достичь в агентном проекте длительностью около одного дня. Его публичный репозиторий включает не только играбельную игру, но и скрипты проверки, инструменты создания скриншотов, интерактивные утверждения и переиспользуемые агентные инструкции.

Этот метод по-прежнему зависит от человеческого суждения, вычислительных бюджетов, качественных эталонов и агентной рабочей станции. Он не означает, что браузерные прототипы могут сравниться со студийными 3A-играми.

Настоящий сдвиг в том, что цель высокого уровня теперь может запустить долгосрочный цикл «создание — измерение — критика — улучшение», выполняя гораздо больше работы до того, как потребуется вмешательство человека.